MediaScribe
🇫🇷Français

Audio en texte

Transcription audio en texte : importez l’enregistrement, obtenez un texte horodaté

Transformer un audio en texte ne demande ici ni logiciel ni frappe : importez un MP3, M4A, WAV, FLAC ou OGG, et la reconnaissance vocale Whisper livre la transcription audio en texte, avec un horodatage par ligne, prête à exporter en TXT, SRT ou VTT — votre premier enregistrement est gratuit jusqu’à 10 minutes, sans inscription. Ensuite, une minute de solde par minute d’audio ; l’original est supprimé.

Mis à jour le

Sans compte : fichiers jusqu’à 100 Mo ; première transcription gratuite et complète jusqu’à 10 min, puis un court extrait gratuit. Après connexion : jusqu’à 500 Mo et 4 heures. · 1 min de solde par minute d’enregistrement
MP3 · M4A · WAV · FLAC · OGG · MP4 · MOV · MKV · WEBM · AVI · SRT · VTT
Sur cette page

Transformer un audio en texte en quatre étapes

Quatre étapes mènent de l’enregistrement sur votre appareil à une transcription téléchargeable, sans installation, sans pause ni retour en arrière pour tout taper à la main.

  1. Choisissez le fichier. Déposez un MP3, un M4A, un WAV ou un autre fichier audio dans la zone d’import, ou cliquez dessus pour le sélectionner. Votre navigateur vérifie le type et la taille avant tout envoi.
  2. Vérifiez le prix et lancez. Le premier enregistrement d’un invité est transcrit tout de suite et gratuitement : en entier jusqu’à 10 minutes, les 10 premières minutes s’il est plus long. Une fois connecté, vous voyez combien de minutes l’enregistrement va consommer, et rien ne démarre avant votre clic sur « Transcrire ».
  3. Comparez le texte au son. L’enregistrement est lu depuis votre propre appareil, à côté de la transcription ; un clic sur un horodatage amène le lecteur à cette ligne.
  4. Téléchargez la transcription. Enregistrez-la en TXT ou en Markdown pour la lecture, en SRT ou en VTT pour des sous-titres.

Aucun logiciel de transcription ne s’installe sur votre ordinateur : la reconnaissance vocale tourne sur notre serveur, et la page ne fait qu’envoyer l’enregistrement. Un long fichier affiche sa progression en minutes traitées sur la durée totale : pour un entretien d’une heure, vous voyez où en est le travail au lieu de fixer une icône de chargement. Sur un écran plus large, vous pouvez importer l’enregistrement dans l’espace de travail, où la transcription, le lecteur et les outils IA sont côte à côte.

Quels fichiers audio sont acceptés, et les limites

Le site accepte les formats que produisent les téléphones et les dictaphones et qu’exportent des logiciels comme Audacity ; les seules limites strictes portent sur la taille et la durée.

FormatD’où il vient le plus souvent
MP3épisodes de podcast, dictaphones, cours téléchargés
M4A (AAC ou ALAC à l’intérieur)Dictaphone de l’iPhone, enregistrements Zoom en audio seul, exports de QuickTime
WAV, AIFFenregistreurs de terrain, logiciels de studio, exports non compressés
FLACarchives sans perte
OGG, Opus, AACmessages vocaux enregistrés depuis Telegram, enregistrements faits dans le navigateur
MP4, MOV, MKV, WEBM, AVI, MPEG, TS, WMVfichiers vidéo : la piste son est extraite, l’image est ignorée ; pour Zoom ou Teams, voir comment transcrire une réunion enregistrée en MP4

La taille et la durée dépendent de la connexion :

  • Sans compte : fichiers jusqu’à 100 Mo ; le premier enregistrement est transcrit gratuitement, en entier jusqu’à 10 minutes, puis viennent de courts extraits gratuits.
  • Après connexion : fichiers jusqu’à 500 Mo et jusqu’à 4 heures.
  • Un enregistrement entre 100 et 500 Mo n’a pas besoin d’être compressé : connectez-vous, et le même envoi passe.
  • Un enregistrement de plus de 4 heures se découpe d’abord en plusieurs parties.

Tous les formats suivent le même chemin : passer un MP3 en texte coûte autant que transcrire un WAV de même durée. Pour le son d’une vidéo, importez la vidéo elle-même ; la page consacrée aux fichiers vidéo et à leur piste son détaille MP4, MOV et les limites de taille.

L’extension du fichier n’est qu’un premier contrôle : avant de transcrire un fichier audio, le serveur lit le conteneur réel avec ffprobe, et un fichier mal nommé est refusé avec un message clair, avant même l’affichage d’un prix.

Exemple : à quoi ressemble une transcription audio

Une transcription tirée d’un fichier audio revient sous forme d’une ligne par phrase prononcée, et chaque ligne s’ouvre sur l’instant où cette phrase commence, en minutes et en secondes.

Texte d’exemple au format TXT exact, pas un vrai enregistrement :

[0:00] Merci d’être là. Aujourd’hui, on passe en revue le premier trimestre.
[0:05] Les ventes ont progressé dans toutes les régions, sauf dans le Nord, où deux magasins ont fermé.
[0:12] Commençons par la boutique en ligne, puisque l’essentiel du changement vient de là.
[0:19] Les commandes ont augmenté d’environ un cinquième par rapport aux mêmes mois de l’an dernier.

Quand vous transcrivez un audio en texte ici, Whisper pose lui-même la ponctuation et les majuscules, et la langue parlée est détectée automatiquement : aucun réglage de langue n’est à choisir avant le démarrage. Après la première heure, l’horodatage gagne un champ pour les heures, comme [1:02:15]. Chaque horodatage marque le début d’une phrase, pas celui de chaque mot.

Quels enregistrements se transcrivent bien

La reconnaissance vocale est la plus précise sur une voix claire, proche du micro, et elle perd des mots partout où d’autres sons couvrent la parole.

  • Aide : un téléphone ou un micro près de la personne qui parle, une pièce calme, une voix sans musique de fond.
  • Gêne : deux personnes qui parlent en même temps, une musique de fond, la circulation, le vent, l’écho d’une grande salle.
  • Chansons : les paroles sont transcrites comme des mots, mais le chant sur des instruments ressort moins net que la parole.
  • Distance : un téléphone posé sur le bureau du conférencier capte davantage qu’un téléphone au dernier rang de l’amphithéâtre.

Cela vaut pour toute retranscription audio en texte, qu’il s’agisse d’un entretien, d’un podcast ou d’un cours : si un passage ressort déformé, l’horodatage voisin vous y amène directement, pour réécouter et corriger la ligne à la main.

Nous ne publions pas de taux de précision en pourcentage, car il dépend bien plus de l’enregistrement que du logiciel. Votre premier enregistrement gratuit est le test honnête : il montre comment votre propre son est reconnu avant que vous ne dépensiez la moindre minute.

Après la transcription : export, sous-titres, IA

Une transcription terminée se télécharge sans supplément dans quatre formats, et les outils IA qui s’appuient dessus ne coûtent rien de plus non plus.

  • TXT : du texte brut, avec ou sans les repères [m:ss] ; un interrupteur sur la transcription les affiche ou les masque.
  • Markdown : les mêmes lignes, prêtes pour des applications de notes comme Obsidian.
  • SRT : un fichier de sous-titres avec heures de début et de fin, que Premiere Pro importe comme piste de sous-titres ; la structure du format est décrite dans ce qu’est un fichier SRT.
  • VTT : des sous-titres WebVTT pour les lecteurs vidéo HTML5.

Un podcast ou une voix off donne ainsi des sous-titres sans passer par une vidéo : la page qui explique comment créer un fichier SRT à partir d’un MP3 décrit le découpage des répliques. Pour changer de format ensuite ou garder les mots sans les minutages, les convertisseurs de sous-titres gratuits dans le navigateur transforment un SRT en VTT ou en texte brut, directement sur votre ordinateur.

Les actions IA travaillent sur la transcription terminée : résumé, notes détaillées, article, post pour réseaux, un Pro Transcript nettoyé, traduction du texte, chat sur l’enregistrement ou prompt personnalisé. Elles sont incluses avec l’enregistrement transcrit, sans seconde facturation : vous payez des minutes de reconnaissance vocale, pas chaque bouton. Chaque action ne se lance que lorsque vous la choisissez, et son résultat s’enregistre en PDF ou en DOCX.

Transcription audio en texte gratuite : ce qui est offert, ce qui coûte des minutes

Votre premier enregistrement est gratuit sans compte, en entier jusqu’à 10 minutes et les 10 premières minutes s’il est plus long ; ensuite, convertir un fichier audio complet en texte coûte une minute de solde par minute de son, à partir de $0.033 la minute.

QuoiCoûtConditions
Premier enregistrementgratuitsans compte ; en entier jusqu’à 10 minutes, les 10 premières minutes s’il est plus long ; sur un réseau partagé, limite quotidienne par réseau
Enregistrements suivants sans compteextrait gratuitun court extrait depuis le début ; l’enregistrement complet après connexion
Analyses IAinclusestoutes les analyses IA d’un enregistrement transcrit, sans seconde facturation
Cadeau à l’inscription10 minutesune fois par compte, utilisées en premier, expirent au bout de 7 jours
Fichier complet1 minute de solde par minute d’audioarrondi à la minute supérieure ; le prix s’affiche avant le démarrage ; débité après une transcription réussie
Packs1 heure pour $2.99 · 3 heures pour $7.99 · 10 heures pour $19.99 · 30 heures pour $58.99paiement unique, sans abonnement ; les minutes achetées n’expirent pas ; remboursement sous 14 jours

Au-delà du premier enregistrement, l’audio en texte gratuit se limite à un court extrait. Le cadeau couvre un enregistrement de 10 minutes au plus, une courte interview ou une partie de cours par exemple. Une réunion de 45 minutes demande un pack en plus, et la page vous le dit avant tout débit.

Le texte d’une vidéo YouTube qui a déjà des sous-titres est un autre cas : il reste gratuit pour toujours, sans inscription et sans limite, parce qu’il vient des sous-titres que porte déjà la vidéo et non de la reconnaissance vocale. La transcription d’un cours publié sur YouTube s’obtient de la même façon, en un seul document.

Où va votre fichier

De la transcription, seul le texte reste ici : votre fichier d’origine est supprimé de notre serveur dès que le son en a été extrait.

  • Le son extrait (MP3, 16 kHz, mono) part chez Whisper d’OpenAI pour la reconnaissance ; ses morceaux sont supprimés dès que la transcription est prête.
  • Sans compte, la transcription n’est pas enregistrée sur le serveur : il la garde environ une heure, le temps que la page la récupère, puis elle ne vit plus que dans votre navigateur.
  • Un envoi qui ne démarre jamais, pendant une recharge de minutes par exemple, est supprimé du serveur au bout d’une heure environ.
  • Après connexion, la transcription est enregistrée dans votre compte.
  • Le lecteur joue le fichier depuis votre appareil. Après un rechargement de la page, choisissez-le de nouveau pour l’écouter ; le texte est déjà enregistré.
  • Quand vous choisissez un fichier sur cette page, votre navigateur en garde une copie temporaire pour la transmettre à l’espace de travail, puis la supprime dès qu’elle est reprise, au plus tard au bout d’une heure.

L’ensemble des règles figure dans la politique de confidentialité.

Ce que la transcription ne fait pas

L’identification des intervenants est absente de cette transcription audio : le texte est un seul flux de lignes horodatées, quelle que soit la personne qui parle.

  • Pas d’horodatage par mot ni à intervalles fixes : un par phrase.
  • Pas de sous-titres incrustés dans une vidéo ; vous recevez des fichiers SRT ou VTT à charger dans un logiciel de montage.
  • Pas d’enregistrement depuis le micro ni de dictée en direct ; importez un enregistrement terminé.
  • Pas de liens Google Drive, Dropbox ou Spotify ; téléchargez d’abord le fichier, puis importez-le ici.
  • Les fichiers de plus de 500 Mo ou de plus de 4 heures sont refusés ; découpez-les avant.
  • Seule la première piste audio est utilisée. Un enregistrement avec une piste par personne demande une piste mixée, ou l’envoi de chaque piste séparément.

Ce qui est garanti en échange quand vous transcrivez un audio ici : le prix s’affiche avant le démarrage, les minutes ne sont débitées qu’après une transcription réussie, et l’export de la transcription terminée est inclus.

Questions fréquentes

Peut-on transformer un audio en texte gratuitement ?

Oui, pour votre premier enregistrement : sans compte, il est transcrit gratuitement, en entier jusqu’à 10 minutes, les 10 premières minutes s’il est plus long. Ensuite, un invité reçoit un court extrait gratuit ; l’enregistrement complet consomme des minutes de votre solde, et l’inscription vous en offre 10.

Faut-il créer un compte ?

Non pour le premier enregistrement et pour les courts extraits gratuits. Oui pour les fichiers complets ensuite : la connexion passe par un lien envoyé par e-mail, sans mot de passe à créer.

Quels formats audio et quelles tailles de fichier puis-je importer ?

MP3, M4A, WAV, FLAC, OGG, Opus, AAC et AIFF, ainsi que des fichiers vidéo comme MP4, MOV et MKV. Jusqu’à 100 Mo sans compte ; jusqu’à 500 Mo et 4 heures après connexion.

Mon fichier audio est-il conservé ?

Non. L’original est supprimé du serveur dès que le son en est extrait, ou au bout d’une heure environ si la transcription ne démarre jamais ; les morceaux audio sont supprimés après la reconnaissance. Le texte reste dans votre navigateur ou, si vous êtes connecté, dans votre compte.

La transcription distingue-t-elle les intervenants ?

Non. Il n’y a pas d’étiquette de locuteur : la transcription est un seul flux de lignes horodatées, quelle que soit la personne qui parle.

Que se passe-t-il si la transcription gratuite n’est pas disponible ?

Sur un réseau partagé, celui d’un bureau ou d’un opérateur mobile par exemple, la transcription gratuite a une limite quotidienne par réseau, et la page l’indique dès qu’elle est atteinte. Vous recevez alors un court extrait, et l’enregistrement complet après connexion, avec les 10 minutes offertes.

Obtenez la transcription maintenant

Déposez un enregistrement dans la zone d’import en haut de la page pour transformer l’audio en texte : votre premier enregistrement revient gratuitement, en entier jusqu’à 10 minutes, puis un fichier complet coûte une minute de solde par minute d’audio.