音声 → テキスト
音声文字起こし:録音ファイルをアップロードしてテキストに
MP3・M4A・WAVなどの録音ファイルを下の枠へドロップしてください:音声文字起こしの結果は、Whisperの音声認識が話された言葉を1行ずつ書き起こし、各行の頭に開始時刻のタイムスタンプを付けた、TXT・SRT・VTTで保存できるテキストとして返ってきます。最初の録音は登録不要・無料で、10分までなら全編を文字起こしします。それ以降は録音1分につき残高1分を使い、元のファイルはサーバーから削除されます。
更新日
音声文字起こしの4つの手順
音声文字起こし、つまり音声をテキスト化する作業は、デバイスにある録音ファイルを4つの手順でダウンロードできるテキストに変えるもので、ソフトのインストールも、止めては巻き戻して手で打ち込む作業もいりません。
- ファイルを選ぶ:MP3・M4A・WAVなどの音声ファイルを枠にドラッグ&ドロップするか、枠をクリックして選びます。送信の前に、ブラウザが形式とサイズを確認します。
- 料金を確かめて開始する:ゲストの最初の録音は、その場で無料の文字起こしが始まります。10分までなら全編、それより長ければ最初の10分です。ログイン後は使う分数が先に表示され、「文字起こしする」を押すまで何も始まりません。
- 音声と照らし合わせる:録音はお使いのデバイスから再生され、テキストの横に並びます。タイムスタンプをクリックすると、プレーヤーがその行の位置へ移ります。
- テキストを保存する:読むならTXTかMarkdown、字幕に使うならSRTかVTTで書き出します。
音声認識はサーバー側で動くため、パソコンに文字起こしソフトを入れる必要はなく、このページは録音をアップロードするだけです。長い録音では「60分中12分を文字起こし済み」のように進み具合が分単位で表示されるので、1時間のインタビューでも待ち状況がわかります。画面を広く使いたい場合は、作業画面で録音を開くと、テキスト・プレーヤー・AIツールが横に並びます。
対応する音声ファイルの形式と上限
対応しているのは、スマホやICレコーダーが保存する音声データと、Audacityなどの編集ソフトが書き出す一般的な音声ファイルで、はっきりした上限はファイルサイズと長さの2つだけです。
| 形式 | 主な入手元 |
|---|---|
| MP3 | ICレコーダー、ポッドキャストの配信回、講義の録音 |
| M4A(中身はAACまたはALAC) | iPhoneのボイスメモ、Zoomの音声のみの録音、QuickTimeの書き出し。M4Aファイルを文字起こしする手順も参照 |
| WAV、AIFF | ICレコーダーのリニアPCM録音、フィールドレコーダー、音楽制作ソフト |
| FLAC | ロスレスで保存した音源 |
| OGG、Opus、AAC | ブラウザの録音機能、メッセージアプリから保存したボイスメッセージ |
| MP4、MOV、MKV、WEBM、AVI、MPEG、TS、WMV | 動画ファイル:音声トラックだけを取り出し、映像は使いません |
サイズと長さの上限は、ログインしているかどうかで変わります。
- アカウントなし:100 MBまでのファイル。最初の録音は10分までなら全編を無料で文字起こしし、その後は短い抜粋が無料です。
- ログイン後:500 MBまで、長さ4時間までのファイル。
- 100〜500 MBの録音は圧縮しなくてかまいません。ログインすれば、同じファイルをそのままアップロードできます。
- 4時間を超える録音は、先に分割してください。
どの形式も同じ処理を通るので、MP3の文字起こしもWAVの文字起こしも、手順と料金は変わりません。動画の音声を文字にしたいときは動画ファイルをそのまま入れれば足ります。MP4やMOVの扱いとサイズの上限は、動画ファイルから音声を取り出して文字起こしするページで説明しています。
拡張子は最初の目安にすぎません。音声ファイルの文字起こしを始める前に、サーバーがffprobeで実際のコンテナを読み取り、中身の違うファイルは料金を表示する前に、わかりやすいメッセージで断ります。
音声文字起こしの例
音声から書き起こしたテキストは、話したひとまとまりごとに1行で返り、各行の頭にそのフレーズが始まる時刻が分と秒で付きます。
実際の録音ではなく、TXT形式どおりに作った例文です:
[0:00] 本日はお集まりいただきありがとうございます。第1四半期の振り返りから始めます。
[0:06] 売上は北部を除くすべての地域で伸びました。北部では2店舗が閉店しています。
[0:13] まずオンラインショップから見ていきます。変化の大部分はここで起きました。
[0:20] 注文数は前年の同じ時期と比べて、およそ2割増えています。句読点はWhisperが付け、話されている言語は自動で判定されるため、始める前に言語を選ぶ設定はありません。録音が1時間を超えると、[1:02:15]のように時間の桁が加わります。タイムスタンプが示すのは単語ごとの位置ではなく、フレーズの始まりです。
精度を左右する録音の条件
音声認識の精度がいちばん高くなるのは、マイクの近くで1人がはっきり話している録音で、話し声に別の音が重なる箇所では言葉が抜けやすくなります。
- 精度が上がる:話す人の近くに置いたスマホやマイク、静かな部屋、BGMのない会話。
- 精度が下がる:2人が同時に話す場面、BGM、車の音、風、広いホールの反響。
- 歌:歌詞も言葉として書き起こしますが、楽器に乗った歌声は話し声より粗くなります。
- 距離:講義室なら、最後列より最前列の机に置いたスマホのほうが多くの言葉を拾います。
会議でもインタビューでも、録音した音声の文字起こしに聞き取れない一節が出たら、隣のタイムスタンプからその位置へ飛び、聞き直してその行だけ手で直せます。
精度を何パーセントと公表していないのは、結果がソフトよりも録音そのものに大きく左右されるからです。無料の最初の録音で、ご自身の音声がどこまで書き起こせるかを支払いの前に確かめるのが、いちばん正直な試し方です。
文字起こしのあとに:書き出し・字幕・AI
仕上がったテキストは4つの形式で書き出せ、書き出しにも、その上で動くAIの機能にも追加料金はかかりません。
- TXT:プレーンテキスト。テキスト上のスイッチで、
[m:ss]のタイムスタンプを付けるか外すかを選べます。 - Markdown:同じ行を、Obsidianなどのノートアプリ向けの形で。
- SRT:開始と終了の時刻を持つ字幕ファイル。Premiere Proがキャプショントラックとして読み込みます。
- VTT:HTML5の動画プレーヤー向けのWebVTT字幕。
別の字幕形式が必要なときや、時刻を外して言葉だけを残したいときは、ブラウザで動く無料の字幕変換ツールが、SRTをVTTやプレーンテキストに手元のパソコンで変換します。番号とタイムコードの並び方は、SRTファイルのしくみで確認できます。
AIの機能は、完成したテキストの上で動きます:要約、詳細なノート、記事、SNS投稿、整えたPro Transcript、テキストの翻訳、録音とのチャット、カスタムプロンプト。どれも文字起こしした録音に含まれ、払うのは音声認識の分数で、ボタンごとの料金ではありません。押したときだけ実行され、結果はPDFやDOCXで保存できます。
音声文字起こしを無料で使える範囲と、分数を使う場合
最初の録音はアカウントなしで無料になり、10分までなら全編、それより長い録音なら最初の10分が対象です。それ以降、音声ファイル1本を丸ごと文字起こしするには録音1分につき残高1分を使い、料金は1分あたり$0.033からです。
| 内容 | 料金 | 条件 |
|---|---|---|
| 最初の録音 | 無料 | アカウント不要。10分までなら全編、長い録音は最初の10分。共有ネットワークでは1ネットワークあたり1日の上限あり |
| アカウントなしの2本目以降 | 無料の抜粋 | 冒頭の短い抜粋。録音全体はログイン後 |
| AI分析 | 料金に含まれる | 文字起こしした録音のAI分析すべて。二重の請求なし |
| 登録プレゼント | 10分 | 1アカウントにつき1回。最初に使われ、7日で失効 |
| ファイル全体 | 録音1分につき残高1分 | 1分未満は切り上げ。開始前に料金を表示し、文字起こしが成功してから差し引き |
| パック | 1時間 $2.99 · 3時間 $7.99 · 10時間 $19.99 · 30時間 $58.99 | 買い切りでサブスクリプションなし。購入した分数は失効しません。14日以内なら返金 |
最初の録音のあと、無料で使えるのは短い抜粋だけです。プレゼントの10分で、短いインタビューや講義の一部など10分までの録音をまかなえます。45分の会議にはパックの追加が必要で、そのことは請求の前に画面でお知らせします。
字幕が付いたYouTube動画のテキストは事情が違い、登録も上限もなくずっと無料です。音声認識で音声をテキストにするのではなく、動画がすでに持っている字幕を読むからです。
アップロードしたファイルの扱い
ここでの音声文字起こしで残るのはテキストだけで、元のファイルは音声を取り出した直後にサーバーから削除されます。
- 取り出した音声(MP3・16 kHz・モノラル)は認識のためにOpenAIのWhisperへ送られ、テキストができた時点でその断片も削除されます。
- アカウントなしの場合、テキストはサーバーに保存されません。ページが受け取るまでの約1時間だけ保持し、その後はお使いのブラウザの中にだけ残ります。
- 開始しなかったアップロード(分数を追加している間など)は、約1時間後にサーバーから削除されます。
- ログイン後は、テキストがアカウントに保存されます。
- プレーヤーはデバイス上のファイルを再生します。ページを再読み込みしたら、聞くためにもう一度ファイルを選んでください。テキストは保存されています。
- このページでファイルを選ぶと、作業画面へ渡すための一時的なコピーをブラウザが持ち、受け渡しが済んだ時点か、遅くとも1時間後に削除します。
詳しい取り扱いは、ページ下部のプライバシーポリシーに記載しています。
この音声文字起こしでできないこと
話者の区別は、この音声文字起こしが提供していない代表的な機能で、誰が話していても、テキストはタイムスタンプ付きの行がひと続きに並ぶ形になります。
- 単語ごとのタイムスタンプや、一定の間隔ごとのタイムスタンプはありません。付くのはフレーズごとに1つです。
- 動画に字幕を焼き付ける機能はありません。お渡しするのは、編集ソフトに読み込むSRTやVTTのファイルです。
- マイクからの録音やリアルタイムの音声入力はできません。録音済みのファイルをアップロードしてください。
- Googleドライブ、Dropbox、Spotifyのリンクは受け付けません。先にダウンロードしてからアップロードしてください。
- 500 MBを超えるファイルや4時間を超える録音は受け付けません。先に分割してください。
- 使うのは最初の音声トラックだけです。話者ごとにトラックが分かれた録音は、1本にミックスするか、トラックを1本ずつアップロードしてください。
その代わりに約束できること:料金は開始前に表示され、分数は文字起こしが成功してから差し引かれ、仕上がったテキストの書き出しは料金に含まれます。
形式別のガイド:M4A文字起こし
よくある質問
音声文字起こしは無料でできますか?
はい、最初の録音なら無料です。アカウントなしで、10分までなら全編、それより長ければ最初の10分を文字起こしします。その後、ゲストが無料で使えるのは短い抜粋で、録音全体には残高の分数を使います。登録すると10分がプレゼントされます。
アカウント登録は必要ですか?
いいえ、最初の録音と短い無料の抜粋には不要です。その後ファイル全体を文字起こしするにはログインが必要です。メールに届くリンクで入るので、パスワードを作る必要はありません。
どの形式・サイズの音声ファイルに対応していますか?
MP3、M4A、WAV、FLAC、OGG、Opus、AAC、AIFFのほか、MP4・MOV・MKVなどの動画ファイルにも対応します。アカウントなしでは100 MBまで、ログイン後は500 MB・4時間までです。
音声ファイルはサーバーに保存されますか?
いいえ。元のファイルは音声を取り出した直後に削除され、文字起こしが始まらなかった場合も約1時間後に削除されます。音声の断片も認識が終わると削除されます。テキストはブラウザに、ログインしていればアカウントに残ります。
話者を区別できますか?
いいえ。話者ラベルはなく、誰が話していても、タイムスタンプ付きの行がひと続きに並びます。
無料の文字起こしが使えないと表示されたら?
会社や携帯キャリアなどの共有ネットワークでは、無料の文字起こしに1ネットワークあたり1日の上限があり、上限に達するとページに表示されます。その場合は短い抜粋だけになり、録音全体はログイン後にプレゼントの10分で文字起こしできます。