Audio a texto
Transcribir audio a texto: sube la grabación y recibe el texto con tiempos
Transcribir audio a texto no exige programa ni teclado: sube un MP3, M4A, WAV, FLAC u OGG y el reconocimiento de voz Whisper devuelve la grabación escrita, con una marca de tiempo en cada línea y lista para exportar en TXT, SRT o VTT — tu primera grabación es gratis hasta 10 minutos, sin registro. Después, un minuto de saldo por minuto de sonido; el original se borra.
Actualizado el
En esta página
Transcribir audio a texto en cuatro pasos
Cuatro pasos separan la grabación que tienes en el móvil o en el ordenador de una transcripción descargable, sin instalar nada y sin pausar y rebobinar para copiarlo todo a mano.
- Elige el archivo. Arrastra un MP3, un M4A, un WAV u otro archivo de sonido a la zona de carga, o haz clic en ella para buscarlo. Tu navegador comprueba el tipo y el tamaño antes de enviar nada.
- Revisa el precio y empieza. La primera grabación de un invitado se transcribe al momento y gratis: entera si dura hasta 10 minutos, y sus primeros 10 minutos si es más larga. Con la sesión iniciada ves cuántos minutos va a consumir, y nada arranca hasta que pulsas «Transcribir».
- Coteja lo escrito con lo que suena. La grabación se reproduce desde tu propio dispositivo, junto a la transcripción; un clic en una marca de tiempo lleva el reproductor a esa línea.
- Descarga la transcripción. Guárdala en TXT o Markdown para leerla, o en SRT o VTT si la quieres como subtítulos.
En tu equipo no se instala ningún transcriptor de audio a texto: el reconocimiento de voz trabaja en nuestro servidor, y la página solo envía la grabación. Un archivo largo muestra su avance en minutos procesados sobre la duración total, así que con una entrevista de una hora sabes por dónde va el trabajo en vez de mirar un icono de carga. En una pantalla más ancha puedes subir la grabación al espacio de trabajo, donde la transcripción, el reproductor y las herramientas de IA quedan uno al lado del otro.
Qué archivos de audio se aceptan, y con qué límites
El sitio acepta los formatos que generan los móviles y las grabadoras, y los que exportan programas como Audacity; los únicos límites estrictos son el tamaño y la duración.
| Formato | De dónde suele salir |
|---|---|
| MP3 | episodios de pódcast, grabadoras de bolsillo, clases descargadas |
| M4A (con AAC o ALAC dentro) | Notas de voz del iPhone, grabaciones de Zoom solo con sonido, exportaciones de QuickTime |
| WAV, AIFF | grabadoras de campo, programas de estudio, exportaciones sin comprimir |
| FLAC | archivos sin pérdida |
| OGG, Opus, AAC | notas de voz guardadas desde WhatsApp o Telegram, grabaciones hechas en el navegador |
| MP4, MOV, MKV, WEBM, AVI, MPEG, TS, WMV | archivos de vídeo: se extrae la pista de sonido y se ignora la imagen; para Zoom o Teams, mira cómo transcribir una reunión grabada en MP4 |
El tamaño y la duración dependen de si has iniciado sesión:
- Sin cuenta: archivos de hasta 100 MB; la primera grabación se transcribe gratis, entera hasta 10 minutos, y después llegan fragmentos cortos gratuitos.
- Con la sesión iniciada: archivos de hasta 500 MB y de hasta 4 horas.
- Una grabación de entre 100 y 500 MB no necesita comprimirse: inicia sesión y el mismo envío pasa.
- Lo que dure más de 4 horas se corta antes en varias partes.
Todos los formatos siguen el mismo camino, y pasar audio a texto no depende de la extensión: pasar un MP3 a texto cuesta lo mismo que transcribir un WAV de igual duración. Para el sonido de un vídeo, sube el propio vídeo; la página dedicada a los archivos de vídeo y su pista de sonido explica MP4, MOV y los límites de tamaño.
La extensión del nombre es solo un primer filtro: antes de transcribir nada, el servidor lee con ffprobe el contenedor real, y un archivo con un nombre engañoso se rechaza con un mensaje claro, incluso antes de que aparezca un precio.
Ejemplo: así queda una transcripción de audio
Una transcripción sacada de un archivo de sonido llega como una línea por frase dicha, y cada línea empieza con el instante en que arranca esa frase, en minutos y segundos.
Texto de ejemplo en el formato TXT exacto, no una grabación real:
[0:00] Gracias por venir. Hoy repasamos cómo ha ido el primer trimestre.
[0:05] Las ventas subieron en todas las zonas salvo en el norte, donde cerraron dos tiendas.
[0:12] Empecemos por la tienda online, porque casi todo el cambio viene de ahí.
[0:19] Los pedidos crecieron alrededor de una quinta parte frente a los mismos meses del año pasado.Al convertir audio a texto aquí, Whisper pone por su cuenta la puntuación y las mayúsculas, y el idioma hablado se detecta solo: no hay que elegir ningún ajuste antes de empezar. A partir de la primera hora, la marca gana un campo para las horas, como [1:02:15]. Cada marca señala el comienzo de una frase, no el de cada palabra.
Qué grabaciones se transcriben bien
El reconocimiento de voz acierta más con una voz clara y cerca del micrófono, y pierde palabras allí donde otros sonidos tapan el habla.
- Ayuda: un móvil o un micrófono cerca de quien habla, una sala tranquila, una voz sin música de fondo.
- Estorba: dos personas hablando a la vez, música por debajo, tráfico, viento, el eco de un salón grande.
- Canciones: la letra se transcribe como palabras, pero el canto sobre instrumentos sale menos limpio que la voz hablada.
- Distancia: un móvil sobre la mesa del ponente capta mucho más que uno en la última fila del aula.
Vale para cualquier transcripción de audio a texto, sea una entrevista, un pódcast o una clase: si un pasaje sale deformado, la marca de tiempo de al lado te lleva directo a él para volver a escucharlo y corregir la línea a mano. Quien necesita transcribir entrevistas suele hacer justo eso con los nombres propios y las cifras.
No publicamos tasas de acierto en porcentaje, porque dependen mucho más de la grabación que del programa. Tu primera grabación gratuita es la prueba honesta: muestra cómo se reconoce tu propio sonido antes de que gastes un solo minuto.
Después de la transcripción: exportar, subtítulos e IA
Una transcripción terminada se descarga sin coste extra en cuatro formatos, y las herramientas de IA que trabajan sobre ella tampoco cuestan nada más.
- TXT: texto plano, con o sin las marcas
[m:ss]; un interruptor en la transcripción las muestra o las oculta. - Markdown: las mismas líneas, listas para aplicaciones de notas como Obsidian.
- SRT: un archivo de subtítulos con hora de inicio y de fin, que Premiere Pro importa como pista de subtítulos; la estructura del formato se explica en qué es un archivo SRT.
- VTT: subtítulos WebVTT para reproductores de vídeo HTML5.
Así, un pódcast o una locución dan subtítulos sin pasar por ningún vídeo: la página que explica cómo crear un archivo SRT a partir de un MP3 describe cómo se cortan las réplicas. Para cambiar luego de formato o quedarte con las palabras sin los tiempos, los conversores de subtítulos gratis en el navegador pasan un SRT a VTT o a texto plano dentro de tu propio ordenador.
Las acciones de IA parten de la transcripción terminada: resumen, apuntes detallados, artículo, publicación para redes, un Pro Transcript limpio, traducción del texto, chat sobre la grabación o un prompt propio. Van incluidas con la grabación transcrita, sin un segundo cobro: pagas minutos de reconocimiento de voz, no cada botón. Cada acción se lanza solo cuando la eliges, y su resultado se guarda en PDF o DOCX.
Transcribir audio a texto gratis: qué no cuesta nada y qué consume minutos
Tu primera grabación es gratis sin cuenta, entera hasta 10 minutos y sus primeros 10 minutos si es más larga; a partir de ahí, un archivo completo cuesta un minuto de saldo por minuto de sonido, desde $0.033 el minuto.
| Qué | Coste | Condiciones |
|---|---|---|
| Primera grabación | gratis | sin cuenta; entera hasta 10 minutos, los primeros 10 minutos si es más larga; en una red compartida, límite diario por red |
| Grabaciones siguientes sin cuenta | fragmento gratis | un fragmento corto desde el principio; la grabación completa al iniciar sesión |
| Análisis de IA | incluidos | todos los análisis de IA de una grabación transcrita, sin un segundo cobro |
| Regalo al registrarte | 10 minutos | una vez por cuenta, se gastan primero, caducan a los 7 días |
| Archivo completo | 1 minuto de saldo por minuto de sonido | redondeado al minuto superior; el precio se ve antes de empezar; se descuenta tras una transcripción correcta |
| Paquetes | 1 hora por $2.99 · 3 horas por $7.99 · 10 horas por $19.99 · 30 horas por $58.99 | pago único, sin suscripción; los minutos comprados no caducan; reembolso en 14 días |
Más allá de la primera grabación, lo gratuito se queda en un fragmento corto. El regalo cubre una grabación de 10 minutos como máximo, por ejemplo una entrevista breve o una parte de una clase. Una reunión de 45 minutos pide además un paquete, y la página te lo dice antes de cobrar nada.
El texto de un vídeo de YouTube que ya tiene subtítulos es otro caso: sigue siendo gratis para siempre, sin registro y sin límite, porque sale de los subtítulos que ya trae el vídeo y no del reconocimiento de voz. La transcripción de una clase publicada en YouTube se consigue igual, en un solo documento.
Adónde va tu archivo
De la transcripción aquí solo queda el texto: tu archivo original se borra de nuestro servidor en cuanto se ha extraído el sonido.
- El sonido extraído (MP3, 16 kHz, mono) va a Whisper de OpenAI para el reconocimiento; sus trozos se borran en cuanto la transcripción está lista.
- Sin cuenta, la transcripción no se guarda en el servidor: la retiene una hora más o menos, lo justo para que la página la recoja, y después solo vive en tu navegador.
- Un envío que nunca llega a empezar, por ejemplo mientras recargas minutos, se borra del servidor pasada una hora aproximadamente.
- Con la sesión iniciada, la transcripción se guarda en tu cuenta.
- El reproductor suena desde tu dispositivo. Si recargas la página, vuelve a elegir el archivo para escucharlo; lo escrito ya está guardado.
- Cuando eliges un archivo en esta página, tu navegador conserva una copia temporal para pasarla al espacio de trabajo y la borra en cuanto este la recoge, como mucho al cabo de una hora.
Todas las reglas están en la política de privacidad.
Lo que esta transcripción no hace
Identificar a cada hablante queda fuera de esta transcripción de audio: el resultado es un único flujo de líneas con marca de tiempo, hable quien hable.
- Ni marcas por palabra ni a intervalos fijos: una por frase.
- No incrusta subtítulos en un vídeo; recibes archivos SRT o VTT para cargarlos en un editor.
- No graba desde el micrófono ni hace dictado en directo; sube una grabación ya terminada.
- No abre enlaces de Google Drive, Dropbox o Spotify; descarga primero el archivo y luego súbelo aquí.
- Rechaza archivos de más de 500 MB o de más de 4 horas; córtalos antes.
- Usa solo la primera pista de sonido. Una grabación con una pista por persona necesita una mezcla, o enviar cada pista por separado.
Lo que sí queda garantizado cuando transcribes audio a texto aquí: el precio aparece antes de empezar, los minutos se descuentan solo tras una transcripción correcta y la exportación del resultado está incluida.
Preguntas frecuentes
¿Se puede pasar un audio a texto gratis?
Sí, la primera grabación: sin cuenta se transcribe gratis, entera hasta 10 minutos y los primeros 10 minutos si es más larga. Después, un invitado recibe un fragmento corto gratuito; la grabación completa consume minutos de tu saldo, y al registrarte te regalamos 10.
¿Hace falta crear una cuenta?
No para la primera grabación ni para los fragmentos cortos gratuitos. Sí para los archivos completos que vengan después: se entra con un enlace que te llega por correo, sin inventar ninguna contraseña.
¿Qué formatos de audio y qué tamaños puedo subir?
MP3, M4A, WAV, FLAC, OGG, Opus, AAC y AIFF, además de archivos de vídeo como MP4, MOV y MKV. Hasta 100 MB sin cuenta; hasta 500 MB y 4 horas con la sesión iniciada.
¿Se guarda mi archivo?
No. El original se borra del servidor en cuanto se extrae el sonido, o al cabo de una hora más o menos si la transcripción no llega a empezar; los trozos de audio se eliminan tras el reconocimiento. Lo escrito queda en tu navegador o, si has iniciado sesión, en tu cuenta.
¿La transcripción distingue a quién habla?
No. No hay etiquetas de hablante: la transcripción es un único flujo de líneas con marca de tiempo, hable quien hable.
¿Qué pasa si la transcripción gratuita no está disponible?
En una red compartida, como la de una oficina o la de un operador móvil, la transcripción gratuita tiene un límite diario por red, y la página lo avisa en cuanto se alcanza. Entonces recibes un fragmento corto, y la grabación completa al iniciar sesión, con los 10 minutos de regalo.