Все статьи
Гайд2026-07-15· 10 мин

Автосубтитры на русском: какая точность реально бывает

Распознавание чистой русской речи доходит до 98%, запись со смартфона до 92%, телефонный звонок хуже. Разбираем, откуда берутся ошибки и как довести субтитры до готовых.

Макс GPTМакс GPTРазвитие бизнеса Monty

Автосубтитры перестали быть чем-то экспериментальным: на чистой записи качество распознавания русской речи вплотную подошло к человеческому. Но цифра «98% точности» в маркетинге и то, что ты видишь в своём ролике, расходятся, и расходятся предсказуемо. Разберём, от чего это зависит и что с этим делать.

Какая точность бывает на самом деле

Точность распознавания зависит не от сервиса, а в первую очередь от качества записи. Разброс по типам материала выглядит так.

Чистая речь, микрофон97% точности
Подкаст, созвон92% точности
Запись со смартфона88% точности
Телефон, шум84% точности
Типичные диапазоны точности распознавания русской речи по данным сравнений 2026 года. Верхняя граница у чистой записи доходит до 98%.

Разница между 97% и 88% выглядит небольшой, но считать надо иначе: при 88% каждое восьмое слово требует внимания. На минутном ролике это примерно двадцать правок, то есть больше, чем занял бы набор субтитров вручную по частям.

Вывод для практики: время на субтитры экономит не выбор сервиса, а петличка или запись на нормальный микрофон. Улучшение исходника даёт больший прирост, чем смена движка распознавания.

Зачем субтитры вообще нужны

Короткие видео смотрят без звука: в транспорте, на работе, в очереди. Ролик без субтитров в этой ситуации листают, не разбираясь, о чём он.

80%
зрителей досматривают ролик до конца при наличии субтитров против 20% без них, по исследованию Verizon Media и Publicis Media

Отсюда и требование к точности. Субтитр с ошибкой в ключевом слове хуже, чем его отсутствие: зритель спотыкается, перечитывает и теряет нить. Особенно это заметно на русском, где неверно распознанное окончание меняет падеж и разваливает фразу.

Чем отличаются движки на русском

Международные и российские модели действительно расходятся, но не так драматично, как обещают обе стороны.

ДвижокСильная сторонаГде заметно
Yandex SpeechKitОбучен преимущественно на русскомСтабильнее на разговорной речи и именах
Whisper и обёрткиХорошо держит смешанную речьРусский с англицизмами вперемешку
SaluteSpeech (GigaAM)Заточен под сложное русское аудиоЗаписи с шумом и несколькими голосами

Разница между лучшими вариантами на чистой речи измеряется единицами процентов. Она становится заметной там, где запись плохая, а не там, где всё хорошо.

Где русский ломает распознавание

Ошибки распределены неравномерно. Знать места, где они собираются, полезнее, чем гнаться за средней точностью.

  • Англицизмы в русской фразе: «сторис», «инсайт», «оффер» распознаются то кириллицей, то латиницей, и в одном ролике по-разному
  • Числа и даты: «две тысячи двадцать шестого» превращается в цифры или остаётся словами, а выглядит это в кадре по-разному
  • Имена, названия каналов и брендов, особенно написанные латиницей
  • Профессиональный жаргон: слово, которого нет в обиходе, заменяется ближайшим похожим по звучанию
  • Быстрая речь со слипшимися словами: границы слов ставятся не там, и строка разбивается криво
Все пять пунктов лечатся одним приёмом: словарь своих терминов, имён и названий. Задаётся один раз, дальше работает на всём потоке роликов, и именно он даёт основную экономию, а не проценты точности движка.

Диаризация: кто из них говорит

Если в кадре двое, к распознаванию добавляется задача разделения голосов. Здесь точность заметно ниже, порядка 85-95% на нормальных записях, и падает при перебиваниях, которых в живом разговоре много.

Практический вывод для интервью и подкастов: не рассчитывай, что подписи «кто говорит» встанут сами. Проще снимать так, чтобы говорящий был очевиден из кадра, чем править разметку голосов постфактум.

Что делать с оставшимися ошибками

  1. Читай субтитры глазами, не слушая ролик. Ошибка распознавания почти всегда выглядит как слово не из этого предложения
  2. Правь только смысловые ошибки. Пропущенная запятая в субтитре не стоит внимания, а неверное слово стоит
  3. Проверяй числа отдельно: они ошибаются чаще всего и заметнее всего для зрителя
  4. Смотри на разбивку строк, а не только на текст: правильные слова в неправильной разбивке читаются хуже, чем опечатка

Сколько это времени

Субтитры руками

  • Набрать текст: 10 минут
  • Расставить тайминги: 10 минут
  • Проверить и поправить: 5 минут
  • Итого около 25 минут на ролик

Автосубтитры с вычиткой

  • Распознавание: около минуты
  • Вычитка глазами: 3 минуты
  • Правка терминов: 1 минута
  • Итого около 5 минут на ролик

Двадцать минут разницы на ролик. На пятнадцати роликах в месяц это пять часов, и это при том, что вычитку всё равно приходится делать.

Что сделать с записью до распознавания

Час работы над звуком экономит несколько часов правок на дистанции. Порядок действий простой и не требует оборудования дороже петлички.

  1. Пиши на петличку или на гарнитуру, а не на встроенный микрофон телефона с вытянутой руки
  2. Убери фон: холодильник, кондиционер и улица за окном съедают точность сильнее, чем кажется
  3. Говори чуть медленнее, чем в разговоре. Слипшиеся слова это главная причина кривой разбивки строк
  4. Названия и термины проговаривай отчётливо и одинаково: распознавание учится не на одном ролике, но словарь работает лучше, когда слово звучит стабильно
Самый недооценённый пункт это фон. Разница между записью в тихой комнате и на кухне с работающим холодильником в цифрах точности составляет несколько процентов, а в количестве правок почти вдвое.

Перевод и субтитры на другом языке

Отдельная задача, которая возникает, когда ролик хочется показать не только русскоязычной аудитории. Здесь порядок обратный привычному: сначала точная расшифровка на русском, потом перевод. Перевод плохой расшифровки удваивает ошибки, потому что переводчик добросовестно переведёт неверно распознанное слово.

Практический ориентир: если русские субтитры требуют больше пяти правок на минуту, версию на другом языке делать рано. Сначала имеет смысл поправить звук.

Проверка на настоящем исходнике

Средняя точность распознавания мало говорит о готовом ролике. Проверять нужно всю цепочку на живом материале: исходный звук, имена и числа, синхронизацию слов, фирменное оформление, положение в безопасной зоне и финальную вычитку. На странице «до и после» Monty можно включить реальные исходники и готовые версии рядом. Первая пара начинается с авторского дубля длиной 1:53 и показывает готовый ролик 0:45 с монтажом, вжигом субтитров, музыкой и b-roll. Это позволяет оценивать не обещание функции, а видимый результат обработки.

ЭтапЧто проверитьКакая ошибка критична
Исходная речьИмена, цифры, англицизмы и слова на фоне музыкиДвижок угадывает именно те слова, на которых держится смысл
СинхронизацияПодсветка появляется в момент произнесения словаЦелая фраза висит неподвижным блоком несколько секунд
Фирменный стильОдинаковые шрифт, цвет, логотип и ритм оформленияКаждый выпуск выглядит как новый случайный шаблон
Безопасная зонаТекст не перекрыт кнопками и системными подписями площадкиПравильная расшифровка физически не читается в ленте
ПодтверждениеЧеловек проверяет фамилии, факты и числа перед публикациейОшибка в собственном имени уходит в автоматический постинг
Публичное сравнение показывает работу продукта, но не обещает конкретных просмотров. На охват одновременно влияют тема, хук, монтаж, исходная аудитория и распространение ролика.

Полный продуктовый маршрут описан на странице ИИ-видеоредактора в стиле вашего бренда. Для длинных записей продолжите с разбором нарезки Shorts из длинного видео, а варианты инструментов для субтитров собраны в сравнении альтернатив Submagic.

Как это работает в Monty

Распознавание идёт автоматически, субтитры вжигаются в видео сразу в фирменном оформлении: шрифт с кириллицей, положение с учётом безопасной зоны каждой площадки, разбивка по смыслу. Словарь терминов задаётся в настройках бренда и применяется ко всем роликам, поэтому названия и англицизмы пишутся одинаково от выпуска к выпуску.

Где субтитры показывать, а где нет

Ещё один вопрос, который возникает после того, как субтитры научились получаться. Площадки относятся к вжигаемому тексту по-разному, и это влияет на решение.

  • Reels, Shorts и TikTok: субтитры обязательны, смотрят без звука и решают за секунду
  • Telegram: тоже нужны, но там есть текст поста, поэтому часть смысла можно вынести из кадра
  • Длинные ролики на YouTube и Rutube: там зритель чаще со звуком, и сплошные вжигаемые субтитры мешают, лучше отдельной дорожкой

Практическое следствие: вжигать субтитры имеет смысл в вертикальные версии, а для длинного горизонтального ролика оставлять их отключаемыми. Один и тот же материал в этом смысле требует двух разных сборок.

Итог

Автосубтитры на русском работают, и работают хорошо, если запись чистая. Основной рычаг лежит не в выборе сервиса, а в двух вещах: нормальный звук на входе и словарь своих слов. Вычитку глазами при этом никто не отменял, но она занимает минуты, а не полчаса.

FAQ

Какая точность у автосубтитров на русском?

На чистой записи с микрофоном 95-98%, на подкасте или созвоне 90-95%, на записи со смартфона 85-92%, на телефонном звонке с шумом 80-88%.

Какой движок лучше распознаёт русский?

Модели, обученные преимущественно на русском, дают небольшое преимущество на разговорной речи и именах. На чистой записи разница между лидерами измеряется единицами процентов и на глаз незаметна.

Почему один и тот же термин пишется по-разному в разных роликах?

Распознавание решает каждый раз заново, особенно для англицизмов и названий. Лечится словарём своих терминов, который задаётся один раз и применяется ко всему потоку.

Нужно ли вычитывать автосубтитры?

Да, но это занимает около трёх минут на ролик против двадцати пяти при наборе вручную. Смотреть надо прежде всего на числа, имена и разбивку строк.

Работает ли разделение голосов в интервью?

Работает с точностью около 85-95% на нормальных записях, но заметно хуже при перебиваниях. Для интервью надёжнее, когда говорящий понятен из кадра.

Что сильнее влияет на качество субтитров: сервис или запись?

Запись. Разница между лучшими движками на чистом звуке измеряется единицами процентов, а разница между петличкой и встроенным микрофоном телефона доходит до десяти процентов точности.

Источники

  1. 1.Обзор лучших API для распознавания речи 2026
  2. 2.Распознавание речи: SpeechKit, SaluteSpeech и Whisper
  3. 3.Рейтинг нейросетей для распознавания речи и транскрибации видео
  4. 4.Расшифровка аудио в текст: ИИ-сервисы 2026
Поделиться с другомTelegramПочта

Эй, Monty. Сделай рилс.

Попробовать Monty бесплатно

Читать ещё