Аудио в текст
Аудио в текст: загрузите запись — получите текст с таймкодами
Аудио в текст превращается одной загрузкой: перетащите в окно ниже запись MP3, M4A, WAV, FLAC или OGG, и нейросеть Whisper распознает речь и запишет каждую фразу отдельной строкой с таймкодом, готовой к выгрузке в TXT, SRT или VTT, без ручной перепечатки. Первая запись до 10 мин — бесплатно и без регистрации, дальше — минута баланса за минуту звука.
Обновлено
На этой странице
Как перевести аудио в текст: четыре шага
Перевести аудио в текст здесь можно за четыре шага: запись проходит путь от вашего устройства до готового транскрипта, а слушать и перепечатывать её вручную не нужно.
- Выберите файл. Перетащите MP3, M4A, WAV или другой аудиофайл в окно загрузки либо нажмите на окно и выберите запись. Браузер проверит тип и размер ещё до отправки.
- Проверьте цену и запустите. Первая запись гостя расшифровывается сразу и бесплатно: целиком, если она не длиннее 10 мин, а у записи подлиннее — первые 10 мин. После входа страница показывает, сколько минут спишется, и ничего не начнётся, пока вы не нажмёте «Расшифровать».
- Сверьте текст со звуком. Запись играет с вашего устройства рядом с транскриптом: нажмите на любой таймкод, и плеер перейдёт к этой фразе.
- Скачайте транскрипт. Сохраните его в TXT или Markdown для чтения либо в SRT или VTT для субтитров.
Программа для расшифровки на компьютер не ставится: аудио в текст онлайн переводится на нашем сервере, а страница только отправляет запись, поэтому всё одинаково работает в Windows, macOS и на телефоне. Длинный файл показывает прогресс в минутах — например, «Расшифровано 12 из 60 мин», и у часового интервью видно, сколько осталось. Если удобнее большой экран, откройте запись в рабочем пространстве: там транскрипт, плеер и AI-разборы стоят рядом.
Какие аудиофайлы подходят и сколько они могут весить
Сервис принимает форматы, в которых сохраняют звук телефоны, диктофоны и редакторы вроде Audacity, а жёстких ограничений всего два — размер файла и длительность.
| Формат | Откуда обычно берётся |
|---|---|
| MP3 | выпуски подкастов, диктофоны, скачанные лекции |
| M4A (внутри AAC или ALAC) | Диктофон iPhone, звуковая дорожка записи Zoom, экспорт из QuickTime; подробнее — отдельный разбор M4A в текст |
| WAV, AIFF | полевые рекордеры, студийные программы, несжатый экспорт |
| FLAC | архивы без потерь |
| OGG, Opus, AAC | голосовые сообщения, сохранённые из Telegram, записи в браузере |
| MP4, MOV, MKV, WEBM, AVI, MPEG, TS, WMV | видеофайлы: звук извлекается, картинка не используется |
Размер и длительность зависят от того, вошли ли вы в аккаунт:
- Без входа: файлы до 100 МБ; первая запись — бесплатно, целиком до 10 мин, дальше — короткие бесплатные фрагменты.
- После входа: файлы до 500 МБ и длиной до 4 ч.
- Запись от 100 до 500 МБ сжимать не нужно: войдите, и та же загрузка пройдёт.
- Запись длиннее 4 ч придётся сначала разрезать на части.
Все форматы идут одним путём, поэтому MP3 в текст и WAV в текст выглядят и стоят одинаково: конвертировать аудио в текст через какой-то «правильный» формат заранее не нужно. Если речь записана на видео, загружайте сам видеофайл: про звуковые дорожки MP4 и MOV и про лимиты размера рассказывает раздел о транскрибации видеофайлов.
Расширение — только первая проверка: сервер читает настоящий контейнер утилитой ffprobe, и файл, который лишь назван .mp3, получит понятный отказ ещё до показа цены.
Как выглядит расшифровка: таймкоды и пример
Расшифровка приходит строками — одна фраза, одна строка, и в начале каждой стоит момент, когда фраза началась, в минутах и секундах.
Пример в точном формате TXT; текст придуман для иллюстрации, это не настоящая запись:
[0:00] Спасибо, что подключились. Сегодня разбираем итоги первого квартала.
[0:05] Продажи выросли во всех регионах, кроме северного, где закрылись два магазина.
[0:12] Начнём с интернет-магазина, потому что основная разница пришла оттуда.
[0:19] Заказов стало примерно на пятую часть больше, чем за те же месяцы прошлого года.Знаки препинания и заглавные буквы расставляет сам Whisper, а язык речи определяется автоматически: выбирать его перед запуском не нужно. После первого часа к метке добавляются часы, например [1:02:15].
В каждом формате выгрузки таймкоды записаны по-своему:
- TXT:
[1:15] текст фразы; переключатель на транскрипте убирает метки, если нужен сплошной текст. - Markdown:
- **[1:15]** текст фразы— строка списка для Obsidian и других заметочников. - SRT: начало и конец реплики через запятую перед миллисекундами,
00:01:15,000. - VTT: то же через точку,
00:01:15.000.
Метка ставится на начало фразы, а не на каждое слово и не через равные промежутки вроде 30 секунд. Чтобы найти цитату, этого хватает: таймкод ведёт к нужной фразе с точностью до секунды.
Лекции, интервью, созвоны и голосовые: что расшифровывают чаще всего
Чаще всего в текст переводят пять видов записей, и у каждого своя задача после расшифровки.
- Лекция в текст. Полуторачасовая лекция займёт 90 минут баланса; из транскрипта AI-разбор соберёт конспект лекции по темам и тезисам, а таймкоды покажут, где преподаватель объяснял конкретную тему.
- Интервью в текст. Журналисту и исследователю нужны точные цитаты: строку с таймкодом легко переслушать перед публикацией.
- Запись звонка или встречи. Созвон из Zoom или Google Meet превращается в транскрипт, из которого получаются саммари и ключевые моменты.
- Голосовые сообщения. Голосовое из Telegram, сохранённое на компьютер файлом .ogg, загружается как любая запись; сообщение на пару минут укладывается в бесплатную первую запись.
- Подкаст. Выпуск в MP3 становится текстом для описания или статьи.
Путь у всех один — файл загружается без установки программы, а цена зависит только от длительности: 20 минут звука стоят 20 минут баланса, будь то лекция или голосовое.
Что влияет на качество распознавания речи
Точнее всего распознаётся один чёткий голос рядом с микрофоном, а слова теряются там, где с речью спорят другие звуки.
- Помогает: телефон или микрофон рядом с говорящим, тихая комната, речь без музыкальной подложки.
- Мешает: двое говорят одновременно, фоновая музыка, шум улицы, ветер, эхо большого зала.
- Песни: слова распознаются, но пение поверх инструментов выходит грубее речи.
- Расстояние: телефон на кафедре лекционного зала слышит больше, чем телефон на последнем ряду.
Так устроена любая транскрибация аудио: чем ближе голос к микрофону, тем меньше правок. Если фраза вышла неразборчивой, таймкод рядом с ней ведёт прямо к этому месту — переслушайте и поправьте строку вручную.
Процент точности мы не публикуем: он зависит от записи гораздо сильнее, чем от программы. Честная проверка — ваша бесплатная первая запись: она покажет, как распознаётся именно ваш звук, ещё до любой оплаты.
Экспорт, субтитры и AI-разборы после расшифровки
Готовый транскрипт выгружается в четырёх форматах без доплаты, и AI-разборы поверх него тоже не требуют второго списания.
- TXT — чистый текст, с таймкодами или без них.
- Markdown — те же строки для заметок в Obsidian.
- SRT — файл субтитров с началом и концом каждой реплики; его импортируют Premiere Pro и DaVinci Resolve.
- VTT — субтитры WebVTT для HTML5-плееров.
Нужен другой формат субтитров или только слова без времени? Бесплатные конвертеры субтитров в браузере переделают SRT в VTT или в обычный текст прямо на вашем компьютере.
AI-разборы работают с готовым транскриптом: саммари, подробный конспект, статья, пост для соцсетей, Pro Transcript с вычищенным текстом, перевод текста, чат с записью или свой промпт. Они входят в стоимость расшифровки — вы платите за минуты распознавания речи, а не за каждую кнопку. Разбор запускается только по вашему нажатию, а результат можно сохранить в PDF или DOCX.
Аудио в текст бесплатно: что входит, а что за минуты
Без регистрации первая запись расшифровывается бесплатно — целиком до 10 мин и первые 10 мин у записи подлиннее; дальше полная расшифровка аудиофайла стоит минуту баланса за минуту звука, от 2,1 ₽ за минуту.
| Что | Стоимость | Условия |
|---|---|---|
| Первая запись | бесплатно | без регистрации; целиком до 10 мин, у записи подлиннее — первые 10 мин; в общих сетях — дневной лимит на сеть |
| Следующие записи без входа | бесплатный фрагмент | короткий фрагмент с начала; вся запись — после входа |
| AI-разборы | входят в расшифровку | любые разборы расшифрованной записи без второго списания |
| Подарок при регистрации | 10 мин | один раз на аккаунт, тратятся первыми, сгорают через 7 дней |
| Весь файл | 1 мин баланса за минуту записи | с округлением вверх; цена видна до запуска; списание после успешной расшифровки |
| Пакеты минут | 1 час — 299 ₽ · 3 часа — 700 ₽ · 10 часов — 1800 ₽ · 20 часов — 2500 ₽ | разовая оплата, без подписки; купленные минуты не сгорают |
Пакеты оплачиваются через ЮKassa картой или по СБП, кассовый чек приходит на email, а неизрасходованный остаток минут можно вернуть. Все условия собраны в тарифах MediaScribe и публичной оферте.
На практике подарок покрывает запись до 10 мин — короткое интервью или кусок лекции. Для совещания на 45 минут понадобится пакет сверху, и страница скажет об этом до любого списания.
Текст ролика YouTube с субтитрами — другой случай: он бесплатен навсегда, без регистрации и лимитов, потому что берётся из готовых субтитров, а не из распознавания речи.
Куда уходит аудиофайл
После транскрибации аудио остаётся только текст: исходный файл удаляется с нашего сервера, как только из него извлечён звук.
- Извлечённый звук (MP3, 16 кГц, моно) уходит на распознавание в Whisper от OpenAI; его куски удаляются, как только транскрипт готов.
- Без входа транскрипт на сервере не хранится: он ждёт около часа, пока страница его заберёт, а дальше живёт только в вашем браузере.
- Загрузка, которую так и не запустили, например пока вы пополняли баланс, удаляется с сервера примерно через час.
- После входа транскрипт сохраняется в личном кабинете.
- Плеер играет запись с вашего устройства. После перезагрузки страницы выберите файл снова, чтобы слушать; текст уже сохранён.
- Когда вы выбираете файл на этой странице, браузер держит временную копию, чтобы передать её в рабочее пространство, и удаляет её после передачи или не позже чем через час.
Все правила — в политике обработки персональных данных.
Чего расшифровка не делает
Главное, чего нет в этой расшифровке аудио в текст, — разметки спикеров: текст идёт одним потоком строк с таймкодами, кто бы ни говорил.
- Нет таймкода на каждое слово и меток через равные промежутки: одна метка на фразу.
- Субтитры не вшиваются в видео: вы получаете файлы SRT или VTT для монтажной программы.
- Нет записи с микрофона и живой диктовки: загружается готовая запись.
- Нет приёма по ссылкам на Google Диск, Яндекс Диск или Dropbox — сначала скачайте файл, потом загрузите его сюда.
- Файлы больше 500 МБ или длиннее 4 ч не принимаются — разрежьте их заранее.
- Используется только первая звуковая дорожка. Запись, где у каждого участника своя дорожка, нужно свести в одну или загрузить дорожки по отдельности.
Что гарантировано взамен: цена видна до запуска, минуты списываются только после успешной расшифровки, а выгрузка готового транскрипта входит в стоимость.
Разборы по форматам: M4A в текст
Частые вопросы
Можно ли расшифровать аудио бесплатно?
Да, первую запись: без регистрации она расшифровывается бесплатно — целиком до 10 мин, а у записи подлиннее первые 10 мин. Дальше гость получает короткий бесплатный фрагмент, вся запись расходует минуты баланса, а при регистрации мы дарим 10 мин.
Нужна ли регистрация?
Нет — для первой записи и коротких бесплатных фрагментов. Да — для целых файлов после этого: вход по ссылке из письма на email, пароль придумывать не нужно.
Какие форматы и размеры аудио можно загрузить?
MP3, M4A, WAV, FLAC, OGG, Opus, AAC и AIFF, а также видеофайлы MP4, MOV и MKV. Без входа — до 100 МБ, после входа — до 500 МБ и 4 ч.
Сохраняется ли мой аудиофайл?
Нет. Исходник удаляется с сервера сразу после извлечения звука или примерно через час, если расшифровка так и не началась, а куски звука — после распознавания. Текст остаётся в браузере или, после входа, в личном кабинете.
Сколько стоит расшифровка часа аудио?
Час записи — 60 минут баланса. В пакете «1 час» это 299 ₽, в крупных пакетах минута дешевле — от 2,1 ₽.
Различает ли сервис, кто говорит?
Нет. Разметки спикеров нет: транскрипт — один поток строк с таймкодами, кто бы ни говорил.
Что делать, если бесплатная расшифровка недоступна?
В общих сетях — в офисе или у мобильного оператора — у бесплатной расшифровки есть дневной лимит на сеть, и страница скажет, когда он исчерпан. Тогда остаётся короткий фрагмент, а вся запись — после входа, с подаренными 10 мин.