В каких форматах принимается аудио?
mp3, m4a, ogg, oga, opus, wav, flac, aac и webm — в том числе отправленные документом. Из видеофайлов и кружков берётся звуковая дорожка.
Отправьте аудиофайл в Telegram-бот VoiceKit и получите текст обратно — обычно за 15–30 секунд. Не нужно ставить программы, регистрироваться и загружать файл на сторонний сайт: бот работает прямо в том мессенджере, где файл уже лежит.
Перевести аудио в текст30 минут бесплатно на старт. Без регистрации.
Расшифровка остаётся текстовым сообщением в чате с ботом, поэтому вернуться к ней можно поиском по словам — обычным поиском Telegram, который по аудио не работает.
VoiceKit принимает аудио тремя разными способами, и каждый из них обрабатывается одинаково:
Кроме аудио бот принимает видеокружки и видеозаписи — из них берётся звуковая дорожка, а результат получается точно такой же.
Ограничение одно, и оно идёт от самого Telegram: бот скачивает файлы размером до 20 МБ. Если запись длинная, отправьте её как аудио, а не как видео, — при том же содержании звуковая дорожка занимает в разы меньше места.
Указывать язык записи не нужно. Модель распознавания определяет его по самому аудио и отдаёт текст на языке оригинала: русское интервью останется русским, английский подкаст — английским. Это же касается смешанной речи, где в русскую фразу вставлены английские термины.
Дословная расшифровка мало кому нужна: читать пятиминутный поток без знаков препинания почти так же тяжело, как слушать его. Поэтому после распознавания текст проходит вторую обработку, и в заметке появляется:
Если нужен короткий пересказ длинной записи — саммари собирается по уже расшифрованному тексту одной кнопкой.
30 минут расшифровки на старт — за наш счёт. Дальше подписка PRO: 120 минут в месяц за 99 Telegram Stars или 199 ₽, годовая — 1990 ₽, то есть 165 ₽ в месяц. Списываются только минуты обработанного аудио, абонентской платы за простой нет. Где именно проходит граница бесплатного и платного — разобрано на странице «Аудио в текст бесплатно», а про работу без установки и регистрации — на странице «Аудио в текст онлайн».
30 минут расшифровки бесплатны на старт и не требуют регистрации. Перешлите боту любую запись — лекцию, интервью, диктофонную заметку — и посмотрите на результат.
Перевести аудио в текстmp3, m4a, ogg, oga, opus, wav, flac, aac и webm — в том числе отправленные документом. Из видеофайлов и кружков берётся звуковая дорожка.
До 20 МБ — это ограничение Telegram на скачивание файлов ботами. Для голосовых и большинства диктофонных записей этого хватает с запасом; крупное видео лучше отправлять отдельной звуковой дорожкой.
Точность на чистой записи с одним говорящим — выше 95%. На качество влияют шум, музыка на фоне и одновременный разговор нескольких человек: чем чище звук, тем меньше правок после расшифровки.
Да, язык указывать не нужно — он определяется автоматически, и текст возвращается на языке записи.
Нет. Аудио нужно только для распознавания и после обработки не хранится — остаётся текстовая заметка.
Текст приходит обычным сообщением, его можно скопировать и поправить. Чаще всего правки нужны в именах, названиях компаний и узких терминах — их полезно перепроверять всегда.