← Все статьи
Гайд2026-09-30· 8 мин

Субтитры на казахском и узбекском: что умеет распознавание и где врёт

Whisper поддерживает 99 языков, включая казахский и узбекский, но словарная ошибка там в разы выше английской. Разбираем реальные цифры и порядок работы.

Макс GPTМакс GPTРазвитие бизнеса Monty

Ролик на казахском или узбекском без субтитров теряет ленту так же, как русский: смотрят без звука. Автоматика формально эти языки поддерживает, а качество отличается от английского в разы. Ниже честные цифры и порядок, при котором субтитры выходят пригодными для публикации.

Что показывают исследования

УсловиеОшибкаКомментарий
Whisper large-v3, чистый английскийоколо 2,7% WERэталон, к которому все привыкли
Языки с малым объёмом данных25% и выше WERкаждое четвёртое слово требует правки
Whisper large на казахскомCER около 4посимвольная ошибка, слова страдают сильнее
Whisper после дообучения на казахскомCER 3,39 и WER 14,5дообучение снижает ошибку заметно
Яндекс SpeechKit16 языков, включая казахский и узбекскийузбекский добавлен в 2023 году
Разница между 2,7 и 14,5 процента это не косметика. На тридцатисекундном ролике примерно 70-90 слов, значит десяток исправлений в каждом клипе. Умножьте на тридцать роликов в месяц и получите отдельную работу.

Где ошибки предсказуемы

  • Имена и топонимы: их модель не знает и подставляет похожее по звучанию.
  • Смешанная речь: русские и английские вставки внутри казахской или узбекской фразы ломают распознавание сильнее всего.
  • Числа и единицы: тысячи, проценты и даты почти всегда требуют проверки.
  • Термины и профессиональный жаргон: их в обучающих данных мало.
  • Диалектные различия: узбекская речь из разных регионов распознаётся неодинаково.

Рабочий порядок

  1. Записать звук чисто: петличка или близкий микрофон снижают ошибку сильнее, чем выбор модели.
  2. Прогнать распознавание, выбрав язык вручную, а не автоопределением: смешанная речь путает автодетект.
  3. Прочитать расшифровку глазами и поправить имена, числа и термины. Это пять минут, а не полчаса.
  4. Проверить разбивку на строки: длинные строки в вертикали не помещаются в безопасную зону.
  5. Сохранить свой словарь имён и терминов, чтобы правки не повторялись из ролика в ролик.
Английский, чистый звук3% ошибок в словах
Казахский, дообученная модель15% ошибок в словах
Языки с малыми данными25% ошибок в словах
Порядок величин словарной ошибки. Вывод простой: чем меньше данных у языка, тем важнее ручная вычитка и чистая запись

Двуязычные субтитры

Для рынков Казахстана и Узбекистана часто нужны две дорожки: язык ролика и русский или английский. Практика такая: основной язык на экране, второй в описании либо в виде отдельной версии ролика. Две одновременные строки в вертикальном кадре не помещаются, если держать безопасную зону, а держать её обязательно.

Отдельно про рынок: у Яндекс SpeechKit оплата в рублях и распознавание русского, казахского и узбекского в одном сервисе, у Whisper открытые веса и дообучение под свой словарь. Для команды в России первый вариант проще по оплате, второй дешевле на объёме.

Что делает Monty

Monty ставит субтитры в такт речи и держит их внутри безопасной зоны, чистит и выравнивает звук, собирает версию под каждую площадку и публикует в YouTube Shorts, Instagram Reels, TikTok и Telegram. Ответственность за проверку имён и терминов на языках с малым объёмом данных остаётся на человеке, и мы это говорим прямо: обещать безошибочные казахские субтитры было бы нечестно.

FAQ

Поддерживает ли Whisper казахский и узбекский?

Да, оба языка входят в 99 поддерживаемых. Точность при этом заметно ниже английской: на чистом английском около 2,7% ошибок в словах, у языков с малым объёмом данных 25% и выше.

Насколько точны казахские субтитры?

У большой модели посимвольная ошибка около 4, у дообученной на казахском 3,39 при словарной ошибке 14,5. То есть примерно каждое седьмое слово требует внимания.

Что лучше для казахского и узбекского: Whisper или SpeechKit?

SpeechKit поддерживает 16 языков, включая оба, и делает субтитры. Whisper выигрывает открытостью и дообучением под свой словарь. Разумно проверить оба на своих записях.

Как снизить количество ошибок?

Чистая запись, ручной выбор языка вместо автоопределения, собственный словарь имён и терминов, вычитка перед публикацией.

Можно ли показывать две языковые дорожки сразу?

В вертикальном кадре нет: две строки не помещаются в безопасную зону. Второй язык уходит в описание или в отдельную версию ролика.

Источники

  1. 1.How Accurate Is Whisper in 2026? WER data by language
  2. 2.Fine-tuning OpenAI Whisper for Kazakh speech recognition
  3. 3.Improving Whisper for under-represented language Kazakh (arXiv)
  4. 4.Яндекс SpeechKit: supported languages and recognition models
  5. 5.Яндекс SpeechKit learned to recognise Uzbek
Поделиться с другомTelegramПочта

Эй, Monty. Сделай рилс.

Попробовать Monty бесплатно

Читать ещё