MediaScribe
🇷🇺Русский

Аудио в текст

Аудио в текст: загрузите запись — получите текст с таймкодами

Аудио в текст превращается одной загрузкой: перетащите в окно ниже запись MP3, M4A, WAV, FLAC или OGG, и нейросеть Whisper распознает речь и запишет каждую фразу отдельной строкой с таймкодом, готовой к выгрузке в TXT, SRT или VTT, без ручной перепечатки. Первая запись до 10 мин — бесплатно и без регистрации, дальше — минута баланса за минуту звука.

Обновлено

Без входа: файлы до 100 МБ; первая расшифровка — бесплатно целиком до 10 мин, дальше — короткий бесплатный фрагмент. После входа: до 500 МБ и 4 ч. · 1 мин баланса за минуту записи
MP3 · M4A · WAV · FLAC · OGG · MP4 · MOV · MKV · WEBM · AVI · SRT · VTT
На этой странице

Как перевести аудио в текст: четыре шага

Перевести аудио в текст здесь можно за четыре шага: запись проходит путь от вашего устройства до готового транскрипта, а слушать и перепечатывать её вручную не нужно.

  1. Выберите файл. Перетащите MP3, M4A, WAV или другой аудиофайл в окно загрузки либо нажмите на окно и выберите запись. Браузер проверит тип и размер ещё до отправки.
  2. Проверьте цену и запустите. Первая запись гостя расшифровывается сразу и бесплатно: целиком, если она не длиннее 10 мин, а у записи подлиннее — первые 10 мин. После входа страница показывает, сколько минут спишется, и ничего не начнётся, пока вы не нажмёте «Расшифровать».
  3. Сверьте текст со звуком. Запись играет с вашего устройства рядом с транскриптом: нажмите на любой таймкод, и плеер перейдёт к этой фразе.
  4. Скачайте транскрипт. Сохраните его в TXT или Markdown для чтения либо в SRT или VTT для субтитров.

Программа для расшифровки на компьютер не ставится: аудио в текст онлайн переводится на нашем сервере, а страница только отправляет запись, поэтому всё одинаково работает в Windows, macOS и на телефоне. Длинный файл показывает прогресс в минутах — например, «Расшифровано 12 из 60 мин», и у часового интервью видно, сколько осталось. Если удобнее большой экран, откройте запись в рабочем пространстве: там транскрипт, плеер и AI-разборы стоят рядом.

Какие аудиофайлы подходят и сколько они могут весить

Сервис принимает форматы, в которых сохраняют звук телефоны, диктофоны и редакторы вроде Audacity, а жёстких ограничений всего два — размер файла и длительность.

ФорматОткуда обычно берётся
MP3выпуски подкастов, диктофоны, скачанные лекции
M4A (внутри AAC или ALAC)Диктофон iPhone, звуковая дорожка записи Zoom, экспорт из QuickTime; подробнее — отдельный разбор M4A в текст
WAV, AIFFполевые рекордеры, студийные программы, несжатый экспорт
FLACархивы без потерь
OGG, Opus, AACголосовые сообщения, сохранённые из Telegram, записи в браузере
MP4, MOV, MKV, WEBM, AVI, MPEG, TS, WMVвидеофайлы: звук извлекается, картинка не используется

Размер и длительность зависят от того, вошли ли вы в аккаунт:

  • Без входа: файлы до 100 МБ; первая запись — бесплатно, целиком до 10 мин, дальше — короткие бесплатные фрагменты.
  • После входа: файлы до 500 МБ и длиной до 4 ч.
  • Запись от 100 до 500 МБ сжимать не нужно: войдите, и та же загрузка пройдёт.
  • Запись длиннее 4 ч придётся сначала разрезать на части.

Все форматы идут одним путём, поэтому MP3 в текст и WAV в текст выглядят и стоят одинаково: конвертировать аудио в текст через какой-то «правильный» формат заранее не нужно. Если речь записана на видео, загружайте сам видеофайл: про звуковые дорожки MP4 и MOV и про лимиты размера рассказывает раздел о транскрибации видеофайлов.

Расширение — только первая проверка: сервер читает настоящий контейнер утилитой ffprobe, и файл, который лишь назван .mp3, получит понятный отказ ещё до показа цены.

Как выглядит расшифровка: таймкоды и пример

Расшифровка приходит строками — одна фраза, одна строка, и в начале каждой стоит момент, когда фраза началась, в минутах и секундах.

Пример в точном формате TXT; текст придуман для иллюстрации, это не настоящая запись:

[0:00] Спасибо, что подключились. Сегодня разбираем итоги первого квартала.
[0:05] Продажи выросли во всех регионах, кроме северного, где закрылись два магазина.
[0:12] Начнём с интернет-магазина, потому что основная разница пришла оттуда.
[0:19] Заказов стало примерно на пятую часть больше, чем за те же месяцы прошлого года.

Знаки препинания и заглавные буквы расставляет сам Whisper, а язык речи определяется автоматически: выбирать его перед запуском не нужно. После первого часа к метке добавляются часы, например [1:02:15].

В каждом формате выгрузки таймкоды записаны по-своему:

  • TXT: [1:15] текст фразы; переключатель на транскрипте убирает метки, если нужен сплошной текст.
  • Markdown: - **[1:15]** текст фразы — строка списка для Obsidian и других заметочников.
  • SRT: начало и конец реплики через запятую перед миллисекундами, 00:01:15,000.
  • VTT: то же через точку, 00:01:15.000.

Метка ставится на начало фразы, а не на каждое слово и не через равные промежутки вроде 30 секунд. Чтобы найти цитату, этого хватает: таймкод ведёт к нужной фразе с точностью до секунды.

Лекции, интервью, созвоны и голосовые: что расшифровывают чаще всего

Чаще всего в текст переводят пять видов записей, и у каждого своя задача после расшифровки.

  • Лекция в текст. Полуторачасовая лекция займёт 90 минут баланса; из транскрипта AI-разбор соберёт конспект лекции по темам и тезисам, а таймкоды покажут, где преподаватель объяснял конкретную тему.
  • Интервью в текст. Журналисту и исследователю нужны точные цитаты: строку с таймкодом легко переслушать перед публикацией.
  • Запись звонка или встречи. Созвон из Zoom или Google Meet превращается в транскрипт, из которого получаются саммари и ключевые моменты.
  • Голосовые сообщения. Голосовое из Telegram, сохранённое на компьютер файлом .ogg, загружается как любая запись; сообщение на пару минут укладывается в бесплатную первую запись.
  • Подкаст. Выпуск в MP3 становится текстом для описания или статьи.

Путь у всех один — файл загружается без установки программы, а цена зависит только от длительности: 20 минут звука стоят 20 минут баланса, будь то лекция или голосовое.

Что влияет на качество распознавания речи

Точнее всего распознаётся один чёткий голос рядом с микрофоном, а слова теряются там, где с речью спорят другие звуки.

  • Помогает: телефон или микрофон рядом с говорящим, тихая комната, речь без музыкальной подложки.
  • Мешает: двое говорят одновременно, фоновая музыка, шум улицы, ветер, эхо большого зала.
  • Песни: слова распознаются, но пение поверх инструментов выходит грубее речи.
  • Расстояние: телефон на кафедре лекционного зала слышит больше, чем телефон на последнем ряду.

Так устроена любая транскрибация аудио: чем ближе голос к микрофону, тем меньше правок. Если фраза вышла неразборчивой, таймкод рядом с ней ведёт прямо к этому месту — переслушайте и поправьте строку вручную.

Процент точности мы не публикуем: он зависит от записи гораздо сильнее, чем от программы. Честная проверка — ваша бесплатная первая запись: она покажет, как распознаётся именно ваш звук, ещё до любой оплаты.

Экспорт, субтитры и AI-разборы после расшифровки

Готовый транскрипт выгружается в четырёх форматах без доплаты, и AI-разборы поверх него тоже не требуют второго списания.

  • TXT — чистый текст, с таймкодами или без них.
  • Markdown — те же строки для заметок в Obsidian.
  • SRT — файл субтитров с началом и концом каждой реплики; его импортируют Premiere Pro и DaVinci Resolve.
  • VTT — субтитры WebVTT для HTML5-плееров.

Нужен другой формат субтитров или только слова без времени? Бесплатные конвертеры субтитров в браузере переделают SRT в VTT или в обычный текст прямо на вашем компьютере.

AI-разборы работают с готовым транскриптом: саммари, подробный конспект, статья, пост для соцсетей, Pro Transcript с вычищенным текстом, перевод текста, чат с записью или свой промпт. Они входят в стоимость расшифровки — вы платите за минуты распознавания речи, а не за каждую кнопку. Разбор запускается только по вашему нажатию, а результат можно сохранить в PDF или DOCX.

Аудио в текст бесплатно: что входит, а что за минуты

Без регистрации первая запись расшифровывается бесплатно — целиком до 10 мин и первые 10 мин у записи подлиннее; дальше полная расшифровка аудиофайла стоит минуту баланса за минуту звука, от 2,1 ₽ за минуту.

ЧтоСтоимостьУсловия
Первая записьбесплатнобез регистрации; целиком до 10 мин, у записи подлиннее — первые 10 мин; в общих сетях — дневной лимит на сеть
Следующие записи без входабесплатный фрагменткороткий фрагмент с начала; вся запись — после входа
AI-разборывходят в расшифровкулюбые разборы расшифрованной записи без второго списания
Подарок при регистрации10 минодин раз на аккаунт, тратятся первыми, сгорают через 7 дней
Весь файл1 мин баланса за минуту записис округлением вверх; цена видна до запуска; списание после успешной расшифровки
Пакеты минут1 час — 299 ₽ · 3 часа — 700 ₽ · 10 часов — 1800 ₽ · 20 часов — 2500 ₽разовая оплата, без подписки; купленные минуты не сгорают

Пакеты оплачиваются через ЮKassa картой или по СБП, кассовый чек приходит на email, а неизрасходованный остаток минут можно вернуть. Все условия собраны в тарифах MediaScribe и публичной оферте.

На практике подарок покрывает запись до 10 мин — короткое интервью или кусок лекции. Для совещания на 45 минут понадобится пакет сверху, и страница скажет об этом до любого списания.

Текст ролика YouTube с субтитрами — другой случай: он бесплатен навсегда, без регистрации и лимитов, потому что берётся из готовых субтитров, а не из распознавания речи.

Куда уходит аудиофайл

После транскрибации аудио остаётся только текст: исходный файл удаляется с нашего сервера, как только из него извлечён звук.

  • Извлечённый звук (MP3, 16 кГц, моно) уходит на распознавание в Whisper от OpenAI; его куски удаляются, как только транскрипт готов.
  • Без входа транскрипт на сервере не хранится: он ждёт около часа, пока страница его заберёт, а дальше живёт только в вашем браузере.
  • Загрузка, которую так и не запустили, например пока вы пополняли баланс, удаляется с сервера примерно через час.
  • После входа транскрипт сохраняется в личном кабинете.
  • Плеер играет запись с вашего устройства. После перезагрузки страницы выберите файл снова, чтобы слушать; текст уже сохранён.
  • Когда вы выбираете файл на этой странице, браузер держит временную копию, чтобы передать её в рабочее пространство, и удаляет её после передачи или не позже чем через час.

Все правила — в политике обработки персональных данных.

Чего расшифровка не делает

Главное, чего нет в этой расшифровке аудио в текст, — разметки спикеров: текст идёт одним потоком строк с таймкодами, кто бы ни говорил.

  • Нет таймкода на каждое слово и меток через равные промежутки: одна метка на фразу.
  • Субтитры не вшиваются в видео: вы получаете файлы SRT или VTT для монтажной программы.
  • Нет записи с микрофона и живой диктовки: загружается готовая запись.
  • Нет приёма по ссылкам на Google Диск, Яндекс Диск или Dropbox — сначала скачайте файл, потом загрузите его сюда.
  • Файлы больше 500 МБ или длиннее 4 ч не принимаются — разрежьте их заранее.
  • Используется только первая звуковая дорожка. Запись, где у каждого участника своя дорожка, нужно свести в одну или загрузить дорожки по отдельности.

Что гарантировано взамен: цена видна до запуска, минуты списываются только после успешной расшифровки, а выгрузка готового транскрипта входит в стоимость.

Разборы по форматам: M4A в текст

Частые вопросы

Можно ли расшифровать аудио бесплатно?

Да, первую запись: без регистрации она расшифровывается бесплатно — целиком до 10 мин, а у записи подлиннее первые 10 мин. Дальше гость получает короткий бесплатный фрагмент, вся запись расходует минуты баланса, а при регистрации мы дарим 10 мин.

Нужна ли регистрация?

Нет — для первой записи и коротких бесплатных фрагментов. Да — для целых файлов после этого: вход по ссылке из письма на email, пароль придумывать не нужно.

Какие форматы и размеры аудио можно загрузить?

MP3, M4A, WAV, FLAC, OGG, Opus, AAC и AIFF, а также видеофайлы MP4, MOV и MKV. Без входа — до 100 МБ, после входа — до 500 МБ и 4 ч.

Сохраняется ли мой аудиофайл?

Нет. Исходник удаляется с сервера сразу после извлечения звука или примерно через час, если расшифровка так и не началась, а куски звука — после распознавания. Текст остаётся в браузере или, после входа, в личном кабинете.

Сколько стоит расшифровка часа аудио?

Час записи — 60 минут баланса. В пакете «1 час» это 299 ₽, в крупных пакетах минута дешевле — от 2,1 ₽.

Различает ли сервис, кто говорит?

Нет. Разметки спикеров нет: транскрипт — один поток строк с таймкодами, кто бы ни говорил.

Что делать, если бесплатная расшифровка недоступна?

В общих сетях — в офисе или у мобильного оператора — у бесплатной расшифровки есть дневной лимит на сеть, и страница скажет, когда он исчерпан. Тогда остаётся короткий фрагмент, а вся запись — после входа, с подаренными 10 мин.

Получите текст сейчас

Перетащите запись в окно загрузки вверху страницы: первая расшифровка аудио в текст бесплатна, целиком до 10 мин, а дальше весь файл стоит минуту баланса за минуту звука.