Транскрибация встреч и звонков: три рабочих способа

Транскрибация встреч превращает запись созвона в текст с таймкодами. Делается тремя способами: локально на компьютере, через бота в мессенджере или встроенными средствами платформы. На языках Центральной Азии выбор способа критичен: два из трёх вариантов на узбекском или казахском дадут кашу вместо текста.

Что даёт транскрипт встречи

Часовой созвон с клиентом закончился. Переслушивать его полностью нет ни времени, ни желания.

Текст с таймкодами решает три задачи сразу. Первая: поиск по слову. Через месяц вы наберёте «дедлайн» или «бюджет» и попадёте ровно в нужный момент, а не мотаете ползунок на глаз. Вторая: цитата с отметкой времени. Вместо «послушай с 3:40» вы вставляете в письмо точную фразу клиента, и она остаётся навсегда. Третья: протокол. Транскрипт плюс AI-саммари закрывают задачу, на которую раньше уходило полчаса после каждой встречи.

Почему автоматические транскрипты не работают на узбекском и казахском?

Глобальные движки учились преимущественно на английском. Узбекский и казахский агглютинативны: одно слово может нести значение целого русского предложения, и форм у него десятки. Обучающих данных по этим языкам публично мало, произношение сильно расходится по регионам. Результат: у глобальных движков на узбекском бывает больше 30% ошибок, то есть каждое третье слово неверно.

Здесь есть нюанс со смешанной речью. На реальных рабочих встречах в Ташкенте или Алматы узбекский перемешан с русским, а иногда и с английским. Системы, которые при нескольких языках в файле выдают текст только на «преобладающем», теряют половину смысла.

Собственная модель, обученная для языков Центральной Азии, ошибается примерно в 9% слов на узбекском, то есть в одном слове из одиннадцати.

Три способа получить транскрипт

3.1. Локально на компьютере

Sezish для Mac пишет встречу с двух дорожек одновременно: системный звук (то, что идёт из Zoom, Meet или Telegram) и микрофон. Это называется двухдорожечная диаризация. Два голоса не сливаются в один поток, и транскрипт получается читаемым даже при активном обсуждении.

Час записи обрабатывается примерно за три минуты. Модель весит 225 МБ и работает прямо на компьютере: ни байта аудио не покидает ноутбук. Вот почему этот способ закрывает задачу юриста или финансиста, которому нельзя отдавать записи переговоров в облако третьей стороне.

Приложение живёт в строке меню macOS и кроме записи встреч умеет диктовку в любое поле ввода. Скачать можно на sezi.sh/ru/.

Важное ограничение: полный офлайн есть только на Mac. Мобильные приложения и бот обрабатывают аудио через сервер.

3.2. Через Telegram-бота

Если созвон прошёл в Telegram или коллега прислал запись голосовым сообщением, файл можно переслать сразу боту @sezishbot. Никаких приложений устанавливать не нужно.

Бот принимает голосовые сообщения, аудиофайлы и видео до 20 МБ. В ответ приходит грамотный текст с пунктуацией, не поток слов. Бесплатно доступно 10 минут расшифровки в день: короткий файл тратит ровно свою длину.

Бот также работает в группах. Добавили в рабочий чат, и он расшифровывает голосовые сам, без команд. Минуты в этом случае списываются с баланса того, кто добавил бота.

Это способ для мессенджера, не для длинных созвонов из Zoom. Про голосовые в мессенджерах есть отдельная статья.

3.3. Встроенные транскрипты платформ

Zoom и Google Meet предлагают автоматическую расшифровку. На русском и английском работает сносно. На узбекском, казахском и кыргызском: ни Zoom AI Companion, ни Meet Transcripts эти языки не поддерживают. Telegram Premium расшифровывает голосовые внутри мессенджера на русском и английском; языков Центральной Азии в его списке нет.

Этот способ подходит, если встреча идёт полностью на русском или английском и нет требований к приватности данных.

Что выбрать: сравнение способов

СпособГде обрабатывается аудиоЯзыкиОграничение
Mac-приложение (локально)На вашем компьютереУзбекский, казахский, кыргызский, русский, английскийТолько macOS; Windows: ранняя бета, только диктовка
Telegram-бот @sezishbotСервер sezishУзбекский, казахский, кыргызский, русский, английскийЛимит файла 20 МБ; 10 мин/день бесплатно
Встроенные средства Zoom/Meet/TelegramСерверы платформРусский, английский (и ряд европейских)Узбекский, казахский, кыргызский не поддерживаются

Выбор зависит от двух вопросов: на каком языке идёт встреча и куда можно отдавать аудио.

Куда уходит запись встречи

На Mac обработка полностью локальная. Запись совещания не покидает ноутбук: ни во время работы приложения, ни после.

При серверной обработке (бот, мобильные приложения) аудио передаётся по защищённому соединению TLS. Сервер обрабатывает файл в оперативной памяти и не сохраняет его после ответа: получил аудио, вернул текст, забыл аудио. Записи и транскрипты не используются для обучения моделей.

Это значит: даже если вы пользуетесь ботом, у разработчика нет архива ваших переговоров. Подробности в политике конфиденциальности.

FAQ

Можно ли расшифровать встречу без интернета?

Да, но только на Mac. Модель весит 225 МБ и работает локально: ни во время записи, ни во время обработки интернет не нужен. Бот и мобильные приложения работают через сервер и требуют подключения.

Записи моих переговоров попадут на чужой сервер?

С Mac-приложением никуда: аудио не покидает компьютер. При использовании бота или мобильного приложения файл передаётся на сервер sezish по TLS, обрабатывается в оперативной памяти и не сохраняется.

Используются ли мои записи для обучения моделей?

Нет. Ни аудио, ни тексты транскриптов не используются для обучения. Это зафиксировано в политике конфиденциальности.

Что будет, если на встрече говорят на двух языках сразу?

Sezish распознаёт пять языков: узбекский, казахский, кыргызский, русский и английский. Смешанная речь для рабочих встреч в Центральной Азии типична, и модель обучена именно под этот регион. Большинство глобальных сервисов при нескольких языках в файле выдают текст только на преобладающем, теряя остальное.

Насколько точной будет расшифровка на узбекском или казахском?

На узбекском собственная модель, обученная для языков Центральной Азии, ошибается примерно в 9% слов. Это одно слово из одиннадцати. У глобальных движков на узбекском ошибок бывает больше 30%. По казахскому и кыргызскому модель также специализирована под регион, отдельные измеренные цифры WER для этих языков публично не публиковались.

Сколько времени занимает расшифровка часовой записи?

На Mac: примерно три минуты. Обработка идёт локально, скорость зависит от железа, но не от интернет-соединения. Через бота скорость определяется загрузкой сервера и размером файла.

Есть ли транскрибация встреч на Windows и Android?

На Windows пока ранняя бета, и это только диктовка: записи встреч и диаризации там нет. Android появится в Google Play в ближайшее время. Полный набор функций, включая локальную запись встреч, сейчас работает только на Mac.

Читайте ещё