Перевод голосовых сообщений: как понять чужой язык

Перевод голосовых сообщений работает в два шага: сначала речь превращается в текст, потом текст переводится. Первый шаг ломается на языках Центральной Азии: у глобальных сервисов на узбекском бывает каждое третье слово с ошибкой. В статье разобраны варианты для узбекского, казахского, кыргызского и русского.

Почему голосовое сначала становится текстом, а потом переводится

Прямого перевода «аудио → другой язык» не существует. Любой сервис, который говорит «переводим голос», делает то же самое: сначала распознаёт речь, потом передаёт полученный текст в переводчик.

Это значит, что качество перевода определяется качеством распознавания. Если первый шаг вернул кашу, второй шаг кашу и переведёт. Ошибка в имени, числе или глаголе на этапе расшифровки меняет смысл целого предложения.

Вот почему ломается всё сразу. Модель с 30% ошибок строит перевод на тексте, где почти треть слов неверная, и результат теряет связность.

Подробнее о том, как работает само распознавание и какие форматы оно принимает, читайте в статье «Голосовые в текст: три способа расшифровки».

Что не так со встроенными расшифровками мессенджеров?

Telegram Premium расшифровывает голосовые внутри приложения. На русском и английском это работает сносно. На узбекском, казахском и кыргызском расшифровка не работает.

У глобальных сервисов причина та же. Универсальные движки учились преимущественно на английском; узбекский и казахский агглютинативны, обучающих данных по ним публично мало, а произношение сильно расходится по регионам. Результат: больше 30% ошибок распознавания, то есть каждое третье слово неверно.

На практике это выглядит так: человек переслал войс через универсальный сервис, получил текст, запустил переводчик, и смысл не считывается. Переводчик тут ни при чём: текст пришёл к нему уже неверным.

Отдельная история с казахским: даже среди специализированных решений качество сильно разнится. Про это подробнее в статье «Казахская речь в текст».

Как перевести голосовое через Telegram-бота

3.1. В личке, по шагам

Самый быстрый путь: переслать голосовое боту @sezishbot. Ни регистрации, ни установки приложений не нужно.

Бот принимает голосовые сообщения, кружочки, аудиофайлы и видео до 20 МБ. В ответ приходит грамотный текст с пунктуацией, не поток слов. Под текстом появляются кнопки перевода на шесть языков, включая каракалпакский: язык, которого нет ни в Google Translate, ни в большинстве других переводчиков, при том что носителей около двух миллионов. Про перевод на каракалпакский подробнее в статье «Перевод на каракалпакский онлайн».

Бесплатно доступно 10 минут расшифровки в день. Короткое сообщение тратит ровно свою длину: войс на 40 секунд списывает 40 секунд.

Ограничение здесь честное: файл больше 20 МБ бот не примет, а бесплатный лимит в 10 минут суммируется по всем сообщениям за день.

3.2. Для всего чата сразу

Бот работает не только в личке. Добавьте @sezishbot в рабочую или семейную группу: он начнёт расшифровывать каждое голосовое сам, без команд. Остальным участникам настраивать ничего не нужно.

Минуты в группе списываются с баланса того, кто добавил бота. Это снимает организационный барьер: в чате на 40 человек, где голосовые падают на трёх языках, достаточно одного действия одного человека.

Вот почему групповой сценарий закрывает задачу иначе, чем личная переписка. Голосовые перестают быть «непрослушанными»: текст появляется прямо в ленте, его можно искать, копировать и переводить.

Что делать, если голосовых много и они длинные?

Подходящий инструмент зависит от объёма задачи. Бот оптимален для отдельных сообщений в мессенджере, но не для длинных файлов.

ЗадачаИнструментОграничение
Отдельный войс в Telegram (до 20 МБ)Бот @sezishbot10 минут в день бесплатно; файл больше 20 МБ не принимается
Длинная запись, конфиденциальные переговорыMac-приложение sezi.sh/ru/Только macOS; перевод идёт через сервер, офлайн только распознавание
Живой разговор с другим человекомМобильное приложение для iOSAndroid в ожидании выхода в Google Play

Для длинных записей, которые не влезают в лимит бота, путь другой: Mac-приложение обрабатывает длинные записи локально. Про этот сценарий подробнее в статье «Транскрибация встреч и звонков».

Здесь есть нюанс про офлайн. На Mac модель весит 225 МБ и работает прямо на компьютере: распознавание идёт без интернета. Но перевод требует сервера: текст реплики уходит к языковой модели по защищённому соединению, и без сети кнопка перевода не сработает.

Куда попадает голосовое, которое вы переслали?

Аудио передаётся по защищённому соединению TLS. Сервер обрабатывает его в оперативной памяти и не сохраняет после ответа: получил файл, вернул текст, забыл аудио.

Тексты и записи не используются для обучения моделей. Приложение работает без регистрации; идентификаторы устройства и геолокация не собираются.

Отдельный вопрос про перевод. Когда вы нажимаете кнопку перевода, текст реплики уходит к языковой модели. Провайдер модели получает только текст, без данных о пользователе и устройстве, и обязан защищать его не слабее политики sezish.

Это значит: у разработчика нет архива пересланных голосовых. Аналитика стоит только на сайте sezi.sh и получает стандартные технические данные браузера; в боте и приложениях аналитики нет. Полные условия в политике конфиденциальности.

FAQ

Сохраняется ли моё голосовое на сервере?

Нет. Сервер обрабатывает аудио в оперативной памяти и не сохраняет его после того, как вернул текст. Записи не используются для обучения моделей.

Видят ли другие участники чата, что бот расшифровывает мои голосовые?

Бот публикует расшифровку в общую ленту чата: текст виден всем участникам, как обычное сообщение. Скрытой фоновой обработки нет.

Сколько голосовых можно перевести бесплатно?

Бесплатно доступно 10 минут расшифровки в день. Каждое голосовое тратит ровно свою длину: войс на минуту списывает одну минуту. Перевод расшифрованного текста доступен кнопкой под каждым сообщением.

Точно ли бот поймёт узбекский, казахский и кыргызский?

Собственная модель, обученная для языков Центральной Азии, ошибается примерно в 9% слов на узбекском: одно слово из одиннадцати. У глобальных сервисов на узбекском ошибок бывает больше 30%. По казахскому и кыргызскому модель специализирована под регион; отдельные измеренные цифры для этих языков публично не публиковались.

Что делать с голосовым длиннее лимита или тяжелее 20 МБ?

Бот принимает файлы до 20 МБ; бесплатный лимит составляет 10 минут в день. Для длинных записей путь другой: Mac-приложение обрабатывает длинные записи локально. Подробнее в статье «Транскрибация встреч и звонков».

Можно ли перевести голосовое без интернета?

Перевод офлайн не работает: текст реплики уходит к языковой модели через сервер. Локально на Mac работает только распознавание: модель весит 225 МБ и обрабатывает аудио прямо на компьютере. Кнопка перевода в этом случае требует подключения.

На какие языки бот умеет переводить?

Бот переводит на шесть языков, включая каракалпакский. Полный список доступен в интерфейсе бота: кнопки перевода появляются под каждой расшифровкой.

Читайте ещё