MediaScribe
🇩🇪Deutsch

Audio in Text

Audio transkribieren: Aufnahme hochladen, Text mit Zeitstempeln erhalten

Audio transkribieren lässt sich hier ohne Programm und ohne Abtippen: Lade eine MP3-, M4A-, WAV-, FLAC- oder OGG-Datei hoch, und die Spracherkennung Whisper schreibt jedes gesprochene Wort mit einem Zeitstempel pro Zeile auf, fertig für den Export als TXT, SRT oder VTT – deine erste Aufnahme ist bis 10 Minuten kostenlos, ohne Anmeldung. Danach kostet eine Datei eine Minute Guthaben pro Audiominute; das Original wird gelöscht.

Aktualisiert am

Ohne Konto: Dateien bis 100 MB; die erste Transkription ist bis 10 Min vollständig kostenlos, danach ein kurzer kostenloser Ausschnitt. Nach der Anmeldung: bis 500 MB und 4 Stunden. · 1 Min Guthaben pro Minute Aufnahme
MP3 · M4A · WAV · FLAC · OGG · MP4 · MOV · MKV · WEBM · AVI · SRT · VTT
Auf dieser Seite

Audio transkribieren in vier Schritten

Vier Schritte führen von der Aufnahme auf deinem Gerät zum fertigen Transkript, ohne Installation und ohne das ständige Anhalten und Zurückspulen beim Abtippen.

  1. Wähle die Datei. Ziehe eine MP3-, M4A-, WAV- oder andere Audiodatei auf das Upload-Feld oder klicke darauf, um sie auszuwählen. Dein Browser prüft Typ und Größe, bevor etwas gesendet wird.
  2. Prüfe den Preis und starte. Die erste Aufnahme eines Gastes wird sofort und kostenlos transkribiert: vollständig bis 10 Minuten, bei einer längeren die ersten 10 Minuten. Nach der Anmeldung zeigt die Seite, wie viele Minuten die Aufnahme verbraucht, und nichts startet, bevor du auf „Transkribieren“ klickst.
  3. Gleiche den Text mit dem Ton ab. Die Aufnahme läuft von deinem eigenen Gerät neben dem Transkript; ein Klick auf einen Zeitstempel springt im Player zu dieser Zeile.
  4. Lade das Transkript herunter. Speichere es als TXT oder Markdown zum Lesen oder als SRT oder VTT für Untertitel.

Auf deinem Computer landet keine Transkriptionssoftware: Audio zu Text macht die Spracherkennung auf unserem Server, die Seite lädt nur die Aufnahme hoch. Eine lange Datei meldet ihren Fortschritt als erledigte Minuten von der Gesamtlänge, sodass du bei einem einstündigen Interview siehst, wo es steht, statt auf ein Ladesymbol zu warten. Am größeren Bildschirm kannst du die Aufnahme im Arbeitsbereich hochladen, wo Transkript, Player und KI-Werkzeuge nebeneinander liegen.

Welche Audiodateien angenommen werden, und die Grenzen

Angenommen werden die Formate, die Smartphones und Diktiergeräte speichern und Programme wie Audacity exportieren; feste Grenzen gibt es nur bei Dateigröße und Länge.

FormatWoher es meist kommt
MP3Podcast-Folgen, Diktiergeräte, heruntergeladene Vorlesungen
M4A (darin AAC oder ALAC)Sprachmemos auf dem iPhone, Zoom-Aufnahmen nur mit Ton, Exporte aus QuickTime; mehr dazu, wie du eine M4A-Datei transkribieren kannst
WAV, AIFFFeldrekorder, Studiosoftware, unkomprimierte Exporte
FLACverlustfreie Archive
OGG, Opus, AACaus Telegram gespeicherte Sprachnachrichten, Aufnahmen im Browser
MP4, MOV, MKV, WEBM, AVI, MPEG, TS, WMVVideodateien: Die Tonspur wird extrahiert, das Bild ignoriert

Größe und Länge hängen davon ab, ob du angemeldet bist:

  • Ohne Konto: Dateien bis 100 MB; die erste Aufnahme wird kostenlos transkribiert, vollständig bis 10 Minuten, danach gibt es kurze kostenlose Ausschnitte.
  • Nach der Anmeldung: Dateien bis 500 MB und bis 4 Stunden Länge.
  • Eine Aufnahme zwischen 100 und 500 MB musst du nicht komprimieren: Melde dich an, und derselbe Upload geht durch.
  • Eine Aufnahme über 4 Stunden schneidest du vorher in Teile.

Audio transkribieren läuft bei jedem Format über denselben Weg: Eine MP3 zu transkribieren kostet genauso viel wie eine WAV-Datei gleicher Länge. Für den Ton aus einem Video lädst du das Video selbst hoch; die Seite über Videodateien und ihre Tonspur erklärt MP4, MOV und die Größengrenzen.

Die Dateiendung ist nur eine erste Prüfung: Bevor du eine Audiodatei transkribieren lässt, liest der Server mit ffprobe den tatsächlichen Container, und eine falsch benannte Datei wird mit einer klaren Meldung abgelehnt, noch bevor ein Preis erscheint.

Beispiel: So sieht ein Audio-Transkript aus

Ein Transkript aus einer Audiodatei kommt als eine Zeile pro gesprochener Phrase zurück, und jede Zeile beginnt mit dem Moment, in dem diese Phrase anfängt, in Minuten und Sekunden.

Beispieltext im exakten TXT-Format, keine echte Aufnahme:

[0:00] Danke, dass ihr dabei seid. Heute gehen wir das erste Quartal durch.
[0:05] Der Umsatz ist in allen Regionen gewachsen, außer im Norden, wo zwei Filialen geschlossen haben.
[0:12] Fangen wir mit dem Onlineshop an, denn von dort kam der größte Teil der Veränderung.
[0:19] Die Bestellungen lagen etwa ein Fünftel über denselben Monaten im Vorjahr.

Wenn du hier Audio transkribieren lässt, setzt Whisper Satzzeichen und Großschreibung selbst, und die gesprochene Sprache wird automatisch erkannt, eine Spracheinstellung vor dem Start gibt es nicht. Nach der ersten Stunde bekommt der Zeitstempel ein Stundenfeld, etwa [1:02:15]. Jeder Stempel markiert den Anfang einer Phrase, nicht jedes einzelne Wort.

Welche Aufnahmen sich gut transkribieren lassen

Die Spracherkennung arbeitet am genauesten bei einer klaren Stimme nah am Mikrofon und verliert Wörter überall dort, wo andere Geräusche mit der Sprache konkurrieren.

  • Hilft: ein Smartphone oder Mikrofon nah an der sprechenden Person, ein ruhiger Raum, Sprache ohne Musik darunter.
  • Schadet: zwei Personen, die gleichzeitig reden, Hintergrundmusik, Verkehr, Wind, der Hall eines großen Saals.
  • Lieder: Songtexte werden als Wörter erkannt, Gesang über Instrumenten kommt aber ungenauer heraus als Sprache.
  • Abstand: Ein Handy auf dem Pult im Hörsaal nimmt mehr auf als eines in der letzten Reihe.

Das gilt für jede Sprachaufnahme, die du in Text umwandeln willst: Kommt eine Stelle verstümmelt heraus, führt dich der Zeitstempel daneben genau dorthin, sodass du nachhören und die Zeile von Hand korrigieren kannst.

Eine Genauigkeit in Prozent veröffentlichen wir nicht, weil sie viel stärker von der Aufnahme abhängt als von der Software. Deine kostenlose erste Aufnahme ist der ehrliche Test: Sie zeigt, wie gut dein eigener Ton erkannt wird, bevor du für weitere Dateien Minuten ausgibst.

Nach dem Transkript: Export, Untertitel, KI

Ein fertiges Transkript lädst du ohne Aufpreis in vier Formaten herunter, und auch die KI-Werkzeuge darauf kosten nichts extra.

  • TXT: reiner Text, mit oder ohne die Stempel [m:ss]; ein Schalter am Transkript blendet sie ein und aus.
  • Markdown: dieselben Zeilen, bereit für Notiz-Apps wie Obsidian.
  • SRT: eine Untertiteldatei mit Start- und Endzeiten, die Premiere Pro als Untertitelspur importiert.
  • VTT: WebVTT-Untertitel für HTML5-Videoplayer.

Brauchst du die Untertitel in einem anderen Format oder die Wörter ohne Zeitangaben? Die kostenlosen Untertitel-Konverter im Browser machen aus SRT eine VTT-Datei oder reinen Text, direkt auf deinem Rechner.

KI-Aktionen arbeiten mit dem fertigen Transkript: Zusammenfassung, ausführliche Notizen, Artikel, Social-Post, ein bereinigtes Pro Transcript, Text übersetzen, Chat zur Aufnahme oder ein eigener Prompt. Sie sind in der transkribierten Aufnahme enthalten, ohne zweite Abrechnung: Du zahlst für Minuten Spracherkennung, nicht pro Knopf. Jede Aktion läuft erst, wenn du sie auswählst, und ihr Ergebnis lässt sich als PDF oder DOCX speichern.

Audio transkribieren kostenlos: was gratis ist und was Minuten kostet

Deine erste Aufnahme ist ohne Konto kostenlos, vollständig bis 10 Minuten und bei einer längeren die ersten 10 Minuten; danach kostet es eine Minute Guthaben pro Minute Ton, eine ganze Audiodatei in Text umzuwandeln, ab $0.033 pro Minute.

WasKostenBedingungen
Erste Aufnahmekostenlosohne Konto; vollständig bis 10 Minuten, bei einer längeren die ersten 10 Minuten; in geteilten Netzen gilt ein Tageslimit pro Netz
Weitere Aufnahmen ohne Kontokostenloser Ausschnittein kurzer Ausschnitt vom Anfang; die ganze Aufnahme nach der Anmeldung
KI-Analyseninklusivejede KI-Analyse einer transkribierten Aufnahme, ohne zweite Abrechnung
Geschenk bei der Anmeldung10 Minuteneinmal pro Konto, werden zuerst verbraucht, verfallen nach 7 Tagen
Ganze Datei1 Minute Guthaben pro Audiominuteauf die nächste volle Minute aufgerundet; der Preis steht vor dem Start fest; abgebucht wird nach erfolgreicher Transkription
Pakete1 Stunde für $2.99 · 3 Stunden für $7.99 · 10 Stunden für $19.99 · 30 Stunden für $58.99Einmalzahlung, kein Abo; gekaufte Minuten verfallen nicht; Rückerstattung innerhalb von 14 Tagen

Über die erste Aufnahme hinaus ist Audio in Text nur als kurzer Ausschnitt kostenlos. Das Geschenk deckt eine Aufnahme bis 10 Minuten ab, etwa ein kurzes Interview oder einen Abschnitt einer Vorlesung. Eine 45-minütige Besprechung braucht zusätzlich ein Paket, und die Seite sagt dir das, bevor etwas abgebucht wird.

Der Text eines YouTube-Videos mit Untertiteln ist ein anderer Fall: Er bleibt dauerhaft kostenlos, ohne Anmeldung und ohne Limit, weil er aus den Untertiteln entsteht, die das Video schon mitbringt, und nicht aus Spracherkennung.

Wohin deine Datei geht

Von der Audio-Transkription bleibt hier nur der Text: Deine Originaldatei löschen wir von unserem Server, sobald der Ton daraus extrahiert ist.

  • Der extrahierte Ton (MP3, 16 kHz, mono) geht zur Erkennung an Whisper von OpenAI; seine Teilstücke werden gelöscht, sobald das Transkript fertig ist.
  • Ohne Konto wird das Transkript nicht auf dem Server gespeichert: Der Server hält es etwa eine Stunde bereit, bis die Seite es abholt, danach liegt es nur in deinem Browser.
  • Ein Upload, der nie startet, etwa während du Minuten auflädst, wird nach etwa einer Stunde vom Server gelöscht.
  • Nach der Anmeldung wird das Transkript in deinem Konto gespeichert.
  • Der Player spielt die Datei von deinem Gerät ab. Nach dem Neuladen der Seite wählst du sie zum Anhören erneut aus; der Text ist schon gespeichert.
  • Wählst du auf dieser Seite eine Datei aus, behält dein Browser eine temporäre Kopie, um sie an den Arbeitsbereich zu übergeben, und löscht sie, sobald sie übernommen wurde, spätestens nach einer Stunde.

Die vollständigen Regeln stehen in der Datenschutzerklärung.

Was die Transkription nicht kann

Sprecherkennzeichnung liefert diese Audio-Transkription nicht: Der Text ist ein durchgehender Strom von Zeilen mit Zeitstempeln, egal wer gerade spricht.

  • Keine Zeitstempel pro Wort und keine in festen Abständen: einer pro Phrase.
  • Keine Untertitel, die ins Video eingebrannt werden; du bekommst SRT- oder VTT-Dateien für deinen Editor.
  • Keine Aufnahme über das Mikrofon und kein Live-Diktat; lade eine fertige Aufnahme hoch.
  • Keine Links zu Google Drive, Dropbox oder Spotify; lade die Datei erst herunter und dann hier hoch.
  • Dateien über 500 MB oder länger als 4 Stunden werden abgelehnt; teile sie vorher.
  • Genutzt wird nur die erste Tonspur. Eine Aufnahme mit getrennten Spuren pro Person braucht eine gemischte Spur, oder du lädst jede Spur einzeln hoch.

Worauf du dich stattdessen verlassen kannst, wenn du hier Audio transkribieren lässt: Der Preis steht vor dem Start fest, Minuten werden erst nach erfolgreicher Transkription abgebucht, und der Export des fertigen Transkripts ist inklusive.

Anleitungen nach Format: M4A to Text

Häufige Fragen

Kann ich Audio kostenlos in Text umwandeln?

Ja, deine erste Aufnahme: Ohne Konto wird sie kostenlos transkribiert, vollständig bis 10 Minuten, bei einer längeren die ersten 10 Minuten. Danach bekommt ein Gast einen kurzen kostenlosen Ausschnitt; die ganze Aufnahme verbraucht Minuten von deinem Guthaben, und bei der Anmeldung schenken wir dir 10 davon.

Brauche ich ein Konto?

Nein für die erste Aufnahme und für kurze kostenlose Ausschnitte. Ja für ganze Dateien danach: Die Anmeldung läuft über einen Link per E-Mail, ein Passwort musst du nicht anlegen.

Welche Audioformate und Dateigrößen kann ich hochladen?

MP3, M4A, WAV, FLAC, OGG, Opus, AAC und AIFF, dazu Videodateien wie MP4, MOV und MKV. Ohne Konto bis 100 MB; nach der Anmeldung bis 500 MB und 4 Stunden.

Wird meine Audiodatei gespeichert?

Nein. Das Original wird vom Server gelöscht, sobald der Ton extrahiert ist, oder nach etwa einer Stunde, falls die Transkription nie startet; die Tonstücke werden nach der Erkennung gelöscht. Der Text bleibt in deinem Browser oder, wenn du angemeldet bist, in deinem Konto.

Erkennt die Transkription verschiedene Sprecher?

Nein. Es gibt keine Sprecherkennzeichnung: Das Transkript ist ein durchgehender Strom von Zeilen mit Zeitstempeln, egal wer gerade spricht.

Was passiert, wenn die kostenlose Transkription nicht verfügbar ist?

In einem geteilten Netz, etwa im Büro oder im Mobilfunk, hat die kostenlose Transkription ein Tageslimit pro Netz, und die Seite sagt es, sobald es erreicht ist. Dann bekommst du einen kurzen Ausschnitt und die ganze Aufnahme nach der Anmeldung, mit den 10 geschenkten Minuten.

Jetzt das Transkript holen

Zieh eine Aufnahme in das Upload-Feld oben auf der Seite, um Audio zu transkribieren: Deine erste Aufnahme kommt kostenlos zurück, vollständig bis 10 Minuten, danach kostet eine ganze Datei eine Minute Guthaben pro Audiominute.