DIGITAL студия

Задача

Издательский дом производит контент из аудио: интервью, подкасты, записи круглых столов, диктофонные заметки авторов. Расшифровку делали вручную — на час записи уходили часы работы транскрибатора. Это дорого, медленно и превратилось в узкое место всего редакционного потока.

Отдельное требование: неопубликованные интервью и авторские материалы нельзя было прогонять через публичные онлайн-сервисы расшифровки — контент чувствительный и не должен покидать инфраструктуру издательства.

Решение

Собрали двухэтапный конвейер «аудио → готовый черновик статьи».

Этап 1 — распознавание речи в контуре заказчика. Аудио прогоняется через российскую ASR-модель на собственных мощностях издательства. Контент не уходит наружу — вопрос конфиденциальности снят на уровне архитектуры. На выходе — сырая расшифровка с таймкодами и разметкой пауз.

Этап 2 — обработка текста нейросетью. Сырую расшифровку автоматически обрабатывает языковая модель: убирает слова-паразиты и оговорки, расставляет пунктуацию и абзацы, разделяет реплики по спикерам, приводит к редакционному стилю. Отдельным шагом формируется черновик статьи с заголовком и подзаголовками.

Пакетный режим. Папка с записями обрабатывается очередью без участия человека — результат складывается рядом в готовых .docx.

Стек

Python-конвейер · российская ASR-модель для распознавания речи (локально, в контуре заказчика) · облачная языковая модель для редактуры и структурирования · очередь задач для пакетной обработки · выгрузка в .docx.

Результат

  • Час записи превращается в структурированный черновик за считанные минуты вместо часов ручной работы.
  • Конфиденциальный контент не покидает инфраструктуру издательства.
  • Редактор получает не «стену текста», а готовый черновик с заголовками — остаётся вычитка.
  • Себестоимость расшифровки часа контента снизилась в разы.