Казахская речь в текст: что работает, а что нет

Казахская речь в текст переводится автоматически, но универсальные сервисы делают это заметно хуже, чем на английском. Причина двойная: агглютинативная морфология языка и малый объём обучающих данных. Ниже разобрано, почему глобальные движки ломаются на казахском и где сегодня качество уже приемлемое.

Почему казахская речь даётся машинам тяжелее английской?

Казахский агглютинативен. Там, где в английском пять отдельных слов, в казахском одно слово с цепочкой суффиксов, и форм у каждого корня десятки. Модель, обученная на английском, видит такое слово как неизвестный блок и либо пропускает его, либо угадывает наугад.

Второй фактор: дефицит данных. Записей казахской речи для обучения систем распознавания собрано несопоставимо меньше, чем английской. Эта разница прямо сказывается на точности.

Третий фактор: произношение. Оно заметно различается по регионам, и непривычный акцент добавляет движку ошибок поверх проблем с морфологией и данными.

Вот почему у глобальных движков на языках Центральной Азии ошибок бывает больше 30%, то есть каждое третье слово неверно.

Как понять, что распознавание сломалось именно на языке?

Три признака, которые говорят о системной проблеме с языком, а не о плохом качестве записи.

Слипшиеся окончания. Казахские суффиксы обозначают падеж, принадлежность, время и лицо одновременно. Когда движок не знает язык, он разрезает слово в произвольном месте или склеивает несколько слов в одно. В транскрипте это выглядит как бессмысленные сочетания букв там, где должно стоять нормальное слово.

Имена собственные превращаются в мусор. Казахские имена, топонимы и названия организаций система транскрибирует фонетически, ориентируясь на созвучные слова в своём словаре. В транскрипте вместо имени появляется случайное слово или бессмысленный набор букв.

Смешанная казахско-русская речь режется на переключении. На реальных рабочих совещаниях в Алматы или Астане казахский и русский перемежаются внутри одной фразы. Системы, настроенные на один язык, при переключении выдают один из трёх сценариев: глухое молчание в транскрипте, транслитерацию с одного языка в кодировку другого или полный обрыв фразы на середине.

Это значит: если транскрипт вашего аудио выглядит именно так, проблема не в качестве записи и не в настройках программы. Проблема в том, что движок не обучен под казахский.

Что даёт модель, обученная под регион

Здесь начинается разговор о конкретном инструменте. Sezish работает на собственной модели, обученной для языков Центральной Азии: узбекского, казахского, кыргызского, русского и английского.

Опубликованная точность: около 9% ошибок распознавания. Это одно слово из одиннадцати.

Важная оговорка: цифра 9% word error rate измерена на узбекском. По казахскому отдельного опубликованного показателя нет. Переносить её на казахский как измеренный факт нельзя. Модель обучена под регион, включая казахский, но отдельного бенчмарка по казахскому мы не публиковали.

Для сравнения: у глобальных движков на узбекском ошибок бывает больше 30%. По казахскому и соседним языкам картина аналогичная, потому что причины те же: агглютинативная морфология и малый объём обучающих данных.

В демо на sezi.sh/ru/ казахский можно проверить прямо сейчас, не скачивая ничего.

Где казахское распознавание можно попробовать прямо сейчас?

СпособКак работаетОграничение
Демо на главной sezi.sh/ru/Нажали кнопку, сказали, увидели результат. Обработка на сервере.До 30 секунд за раз. При нагрузке появляется «Демо занято».
Telegram-бот @sezishbotПересылаете голосовое или аудиофайл, в ответ текст с пунктуацией. Работает в группах.10 минут в день бесплатно. Файлы до 20 МБ.
MacЛокально, модель 225 МБ, обработка без интернета. Диктовка и запись встреч.Только macOS. Полный офлайн только здесь.
iPhoneПриложение «Sezish Talk» в App Store, бесплатно.Обработка через сервер.
AndroidВыходит в Google Play.Пока недоступно.
WindowsРанняя бета, только диктовка.Запись встреч недоступна, функционал ограничен.

Голосовые сообщения на казахском, которые приходят в Telegram от родственников или коллег: отдельный сценарий. Он подробнее разобран в статье про голосовые в текст, а перевод голосовых на другие языки описан отдельно. Про запись совещаний с таймкодами есть отдельная статья, в таблице она указана в строке Mac.

Куда уходит казахское аудио и что с ним происходит

На Mac обработка локальная. Модель весит 225 МБ и работает на вашем компьютере: ни байта аудио не передаётся никуда. Это важно для тех, кто расшифровывает совещания госорганов, юридические переговоры или любые записи, которые нельзя отдавать на сторонние серверы.

При серверной обработке (бот, мобильные приложения, веб-демо) аудио передаётся по защищённому соединению TLS. Сервер обрабатывает файл в оперативной памяти, возвращает текст и не сохраняет аудио после ответа. Формулировка, которая стоит в документации: «сервер отдаёт текст и забывает аудио».

Записи и транскрипты не используются для обучения моделей. В приложении нет регистрации, рекламы и трекеров. Идентификаторы устройства и геолокация не собираются.

Полные условия: в политике конфиденциальности.

FAQ

Насколько точно распознаётся казахская речь?

Опубликованная цифра: около 9% ошибок распознавания, одно слово из одиннадцати. Замерена она на узбекском, отдельного показателя по казахскому нет. Для сравнения: у глобальных движков на языках Центральной Азии ошибок бывает больше 30%. Проверить на своём голосе можно в демо на главной за 30 секунд.

Почему вы не публикуете цифру ошибок отдельно по казахскому?

Потому что отдельного замера нет. Опубликованная цифра в 9% word error rate получена на узбекском. Публиковать её как цифру по казахскому было бы недостоверно. Модель обучена под регион, включая казахский, но честный ответ: измеренного и опубликованного WER по казахскому у нас пока нет.

Что будет, если в разговоре мешают казахский и русский?

Модель обучена сразу на пяти языках региона, включая казахский и русский. Глобальные движки в такой ситуации либо выбирают один язык и теряют фразы на другом, либо обрывают транскрипт на переключении. Отдельного опубликованного замера по смешанной речи у нас нет, поэтому проверить поведение на своём аудио лучше всего в демо: теория здесь хуже живого теста.

Понимает ли система региональное произношение?

Обещать нельзя. Известно только, что модель обучена специально под языки Центральной Азии. Конкретных данных о точности по каждому акценту нет. Если вы работаете с аудио определённого региона, самый честный ответ: попробуйте на своём материале в демо и посмотрите результат.

Мои записи используются для обучения модели?

Нет. Ни аудио, ни тексты транскриптов для обучения не используются. Это зафиксировано в политике конфиденциальности. При локальной обработке на Mac данные вообще не покидают устройство.

Можно ли расшифровать казахское аудио без интернета?

Да, но только на Mac. Модель весит 225 МБ, скачивается один раз и работает локально: ни во время записи, ни во время обработки интернет не нужен. Бот, веб-демо и мобильные приложения обрабатывают аудио на сервере и требуют подключения.

Сколько казахской речи можно расшифровать бесплатно?

Через Telegram-бот: 10 минут в день бесплатно, короткий файл тратит ровно свою длину. Веб-демо на главной: до 30 секунд за запрос. iPhone-приложение в App Store бесплатно. На Mac обработка идёт локально на компьютере, поэтому серверные лимиты минут её не касаются.

Читайте ещё