動画 → テキスト
動画文字起こし:動画ファイルの音声トラックをテキストに
動画文字起こしで読み取るのは音声トラックだけです:MP4・MOV・MKV・WEBMのファイルを下の枠に入れると、動画から取り出した音声をWhisperが認識し、話した言葉を1行ずつタイムスタンプ付きで書き出して、TXT・SRT・VTTで保存できるテキストにします。最初の録音は登録不要・無料で、10分までなら全編を文字起こしします。その後は録音1分につき残高1分です。
更新日
動画文字起こしが読むのは、映像ではなく音声トラック
動画文字起こしとは動画の音声トラックに音声認識をかける処理で、オープンソースのメディアツールffmpegが映像をデコードせずに最初の音声トラックだけを取り出し、16 kHz・モノラルのMP3にしてOpenAIのWhisperモデルへ渡すため、映像のコーデックがH.264でもHEVCでも結果は変わりません。
- 映像は使いません。スライド、画面に焼き込まれた字幕、そのほか画面上の文字は読み取らず、テキストになるのは話された言葉だけです。
- 音がなければ、テキストもできません。マイクもシステム音声もオフで撮った画面録画は、「このファイルには音声がありません。」というメッセージで断ります。
- 使うトラックは1本。吹き替えが2種類入った映画のように音声トラックが複数ある場合は、最初の1本を使います。
- 大きすぎるときは?音声だけをアップロードしてください。QuickTime Playerで動画をオーディオのみで書き出せば、M4Aのボイスメモと同じ手順で文字起こしできます。テキストは同じで、ファイルは数分の一になります。
処理の道筋が同じなので、動画と音声ファイルの1分あたりの料金も同じです。映像のない録音なら、音声だけの録音ファイルの文字起こしがまったく同じ道筋をたどります。
動画を文字起こしする4つの手順
動画を文字起こしする方法はこの4つの手順だけで、パソコンやスマホのファイルがダウンロードできるテキストになります。インストールも、巻き戻しながら書き取る作業もいりません。
- 動画を選ぶ:MP4・MOV・MKV・WEBMなどのファイルを枠にドラッグするか、枠をクリックして選びます。送信の前に、ブラウザが形式とサイズを確認します。
- 文字起こしを始める:ゲストの最初の録音は、すぐに無料で文字起こしが始まります。10分までなら全編、それより長ければ最初の10分です。ログイン後は使う分数が表示され、「文字起こしする」を押すまで何も動きません。
- 映像とテキストを並べて確かめる:動画はお使いのデバイスから再生され、テキストの横に並びます。タイムスタンプをクリックすると、その場面へプレーヤーが移ります。
- テキストか字幕を保存する:読んで直すならTXTかMarkdown、字幕に使うならSRTかVTTをダウンロードします。
パソコンの動画でもスマホの動画でも、動画の音声を文字起こしする流れは同じです。音声認識はサーバーで動くため、プラグインもデスクトップアプリもいりません。長い録画では進み具合が分単位で表示されるので、90分のウェビナーでも待ち状況がわかります。大きな画面で作業するなら、作業画面でファイルを開くと、プレーヤー・テキスト・AIツールが横に並びます。
対応する動画ファイルの形式とサイズの上限
この動画のテキスト化は、スマホ、カメラ、会議アプリ、画面録画ソフトが保存するコンテナに対応し、はっきりした上限はファイルサイズと長さだけです。
| 形式 | 主な入手元 |
|---|---|
| MP4 | Androidのカメラ、Zoomのローカル録画、ダウンロードしたTeamsやGoogle Meetの録画、Loom。MP4ファイルの形式と注意点も参照 |
| MOV | iPhoneのカメラ、Macの画面収録、QuickTime Player |
| MKV、WEBM | OBS Studio、ブラウザで動く画面録画ツール |
| AVI、WMV、MPEG、TS | 古いカメラやWindowsのソフト、放送素材のキャプチャ |
サイズと長さの上限は、ログインしているかどうかで変わります。
- アカウントなし:100 MBまでのファイル。最初の録音は10分までなら全編を無料で文字起こしし、その後は短い抜粋が無料です。
- ログイン後:500 MBまで、長さ4時間までのファイル。
- 4時間を超えるファイルは、先に分割してください。
映像は話し声よりはるかに重く、1080pの画面録画は1時間で500 MBの上限を超えることがありますが、同じ1時間の音声は数十MBです。拡張子は最初の目安にすぎず、サーバーがffprobeで実際のコンテナを読み、メディアファイルでないものは料金を表示する前に断ります。
文字起こしに向いている動画
いちばんきれいに文字起こしできるのは、話す人が映るトーク動画、講義、インタビュー、ウェビナー、解説付きの画面録画で、どれもマイクの近くで1人がはっきり話しているからです。
- 向いている:ピンマイクやヘッドセット、静かな部屋、一度に1人が話す場面。
- 向いていない:話し声の下に流れるBGM、雑踏、声が重なる場面、屋外でスマホに当たる風。
- ミュージックビデオ:歌詞は話し声より粗く書き起こされます。
OpenAIは2022年の論文「Robust Speech Recognition via Large-Scale Weak Supervision」で、Whisperをウェブから集めた68万時間の音声で学習させたと説明しており、なまりやくだけた話し方も想定の範囲内です。誤りの主な原因は、声の重なりと、話し声の下に流れる音楽です。精度を何パーセントと公表していないのは、結果がソフトよりも録画そのものに左右されるからです。ご自身の動画でどこまで書き起こせるかは無料の最初の録音で確かめられ、崩れた行があれば横のタイムスタンプからその場面へ飛んで聞き直せます。
動画文字起こしの例
動画から起こしたテキストは、話したひとまとまりごとに1行で返り、各行の頭にそのフレーズが始まる分と秒が付きます。
実際の録画ではなく、TXT形式どおりに作った例文です:
[0:00] みなさん、こんにちは。新しいダッシュボードの製品デモを始めます。
[0:06] 左側にあるのが、先週追加したフィルターです。
[0:12] 質問がいちばん多かった売上レポートを開いてみます。
[0:19] ご覧のとおり、ページを再読み込みしなくても合計が更新されます。句読点はWhisperが付け、話されている言語は自動で判定されるので、始める前に設定することはありません。1時間を超えると[1:04:10]のように時間の桁が加わり、タイムスタンプは単語ごとではなくフレーズの始まりを示します。
文字起こしのあとに:字幕・書き出し・AI
仕上がったテキストは4つの形式で追加料金なしに書き出せ、そのうち2つは字幕ファイルです。
- TXTとMarkdown:読む、メモを取る、編集する用途に。
[m:ss]のタイムスタンプは付けても外しても使えます。 - SRTはPremiere Pro、DaVinci Resolve、YouTube Studio向け、VTTはHTML5のプレーヤー向けです。
SRTの字幕ブロックには認識で得た開始と終了の時刻が入るので、字幕のために2回目の処理はいりません。手順と区切り方は話し声から字幕を自動生成する手順にまとめています。タイミングを直したり、形式を変えたり、時刻を外したりするなら、SRT・VTT・TXTを相互に変換するツールがブラウザの中で処理します。HTML5の動画に載せる字幕の書き方は、WebVTTファイルの構造で確認できます。
AIの機能は、完成したテキストの上で動きます:要約、詳細なノート、重要ポイント、チャプターとタイムコード、記事、SNS投稿、整えたPro Transcript、録画とのチャット、カスタムプロンプト。どれも文字起こしした録画に含まれ、払うのは音声認識の分数で、ボタンごとの料金ではありません。
動画文字起こしを無料で使える範囲と、分数を使う場合
動画文字起こしが無料になるのはアカウントなしの最初の録音で、10分までなら全編、それより長ければ最初の10分が対象です。その後、ファイル全体の文字起こしには録音1分につき残高1分を使い、料金は1分あたり$0.033からです。
| 内容 | 料金 | 条件 |
|---|---|---|
| 最初の録音 | 無料 | アカウント不要。10分までなら全編、長い録音は最初の10分。共有ネットワークでは1ネットワークあたり1日の上限あり |
| アカウントなしの2本目以降 | 無料の抜粋 | 冒頭の短い抜粋。ファイル全体はログイン後 |
| 書き出しとAI分析 | 料金に含まれる | TXT・MD・SRT・VTTと、文字起こししたファイルのAI分析すべて。二重の請求なし |
| 登録プレゼント | 10分 | 1アカウントにつき1回。最初に使われ、7日で失効 |
| ファイル全体 | 録音1分につき残高1分 | 1分未満は切り上げ。開始前に料金を表示し、文字起こしが成功してから差し引き |
| パック | 1時間 $2.99 · 3時間 $7.99 · 10時間 $19.99 · 30時間 $58.99 | 買い切りでサブスクリプションなし。購入した分数は失効しません。14日以内なら返金 |
目安として、プレゼントで10分の画面録画や短いインタビューをまかなえます。75分の講義にはパックの追加が必要で、そのことは請求の前に画面でお知らせします。「最初の録音」はゲスト1人につき1回で、字幕のないYouTube動画を先に文字起こししていれば、それが最初の録音として数えられます。
YouTubeにある動画も、アップロードが必要?
いいえ、多くのYouTube動画には字幕があり、そのテキストはアップロードも音声認識もなしで直接読み取れます。
字幕トラックからYouTube動画の字幕をテキストに変換する場合は、登録も上限もなく、そのテキストのAI分析も無料です。音声認識とそれに使う分数が必要になるのは、もとになるテキストがないときだけ、つまりご自身のファイルか、字幕のないYouTube動画です。
アップロードした動画の扱い
ここで動画を文字起こししても残るのはテキストだけで、動画ファイルそのものは音声を取り出した直後にサーバーから削除されます。
- 取り出した音声は認識のためにOpenAIのWhisperへ送られ、テキストができた時点でその断片も削除されます。
- アカウントなしの場合、テキストはサーバーに保存されません。ページが受け取るまでの約1時間だけ保持し、その後はお使いのブラウザの中にだけ残ります。
- 開始しなかったアップロード(分数を追加している間など)は、約1時間後に削除されます。
- ログイン後は、テキストがアカウントに保存されます。
- プレーヤーはデバイス上のファイルを再生します。ページを再読み込みしたら、見るためにもう一度ファイルを選んでください。テキストは保存されています。
- このページでファイルを選ぶと、作業画面へ渡すための一時的なコピーをブラウザが持ち、受け渡しが済んだ時点か、遅くとも1時間後に削除します。
詳しい取り扱いは、ページ下部のプライバシーポリシーに記載しています。
動画文字起こしでできないこと
画面上の文字は、この動画文字起こしが扱わない代表的なものです。テキストになるのは話し声だけで、映像は読み取りません。
- 話者ラベルはありません。タイムスタンプ付きの行がひと続きに並びます。
- 映像に字幕を焼き付ける機能はありません。お渡しするのは、編集ソフトやプレーヤーに読み込むSRTやVTTのファイルです。
- MKVやMP4の中にすでに入っている字幕トラックは取り出しません。テキストは話し声から作ります。
- Googleドライブ、Dropbox、Vimeo、TikTokのリンクは受け付けません。先にファイルをダウンロードしてからアップロードしてください。
- 500 MBを超えるファイルや4時間を超えるファイルは受け付けません。音声だけをアップロードするか、分割してください。
- 使うのは最初の音声トラックだけです。
その代わりに約束できること:料金は開始前に表示され、分数は文字起こしが成功してから差し引かれ、仕上がったテキストの書き出しは料金に含まれます。
よくある質問
動画を無料で文字起こしできますか?
はい、最初の録音なら無料です。アカウントなしで、10分までなら全編、それより長ければ最初の10分を文字起こしします。その後、ゲストが無料で使えるのは短い抜粋で、ファイル全体には残高の分数を使います。登録すると10分がプレゼントされます。
アカウント登録は必要ですか?
いいえ、最初の録音と短い無料の抜粋には不要です。その後ファイル全体を文字起こしするにはログインが必要です。メールに届くリンクで入るので、パスワードを作る必要はありません。
どの形式・サイズの動画に対応していますか?
MP4、MOV、MKV、WEBM、AVI、MPEG、TS、WMVのほか、MP3・M4A・WAVなどの音声ファイルにも対応します。アカウントなしでは100 MBまで、ログイン後は500 MB・4時間までです。
動画が上限より大きいときは?
音声だけをアップロードしてください。QuickTime Playerなどで音声トラックをM4Aとして書き出せば、認識するのはもともと音声だけなのでテキストは同じになり、ファイルは数分の一の大きさになります。
動画はサーバーに保存されますか?
いいえ。ファイルは音声を取り出した直後にサーバーから削除され、文字起こしが始まらなかった場合も約1時間後に削除されます。音声の断片も認識が終わると削除されます。テキストはブラウザに、ログインしていればアカウントに残ります。
画面上の文字や焼き込み字幕も読み取れますか?
いいえ。テキストになるのは話し声だけです。スライド、映像に描き込まれた字幕、そのほか画面に出ている文字は読み取りません。
話者を区別できますか?
いいえ。話者ラベルはなく、誰が話していても、タイムスタンプ付きの行がひと続きに並びます。