Задача
Издательский дом производит контент из аудио: интервью, подкасты, записи круглых столов, диктофонные заметки авторов. Расшифровку делали вручную — на час записи уходили часы работы транскрибатора. Это дорого, медленно и превратилось в узкое место всего редакционного потока.
Отдельное требование: неопубликованные интервью и авторские материалы нельзя было прогонять через публичные онлайн-сервисы расшифровки — контент чувствительный и не должен покидать инфраструктуру издательства.
Решение
Собрали двухэтапный конвейер «аудио → готовый черновик статьи».
Этап 1 — распознавание речи в контуре заказчика. Аудио прогоняется через российскую ASR-модель на собственных мощностях издательства. Контент не уходит наружу — вопрос конфиденциальности снят на уровне архитектуры. На выходе — сырая расшифровка с таймкодами и разметкой пауз.
Этап 2 — обработка текста нейросетью. Сырую расшифровку автоматически обрабатывает языковая модель: убирает слова-паразиты и оговорки, расставляет пунктуацию и абзацы, разделяет реплики по спикерам, приводит к редакционному стилю. Отдельным шагом формируется черновик статьи с заголовком и подзаголовками.
Пакетный режим. Папка с записями обрабатывается очередью без участия человека — результат складывается рядом в готовых .docx.
Стек
Python-конвейер · российская ASR-модель для распознавания речи (локально, в контуре заказчика) · облачная языковая модель для редактуры и структурирования · очередь задач для пакетной обработки · выгрузка в .docx.
Результат
- Час записи превращается в структурированный черновик за считанные минуты вместо часов ручной работы.
- Конфиденциальный контент не покидает инфраструктуру издательства.
- Редактор получает не «стену текста», а готовый черновик с заголовками — остаётся вычитка.
- Себестоимость расшифровки часа контента снизилась в разы.