File video ke teks
Transkrip video ke teks: unggah file, dapatkan teks berstempel waktu
Transkrip video ke teks dari rekaman Zoom, kamera HP atau perekam layar dimulai dengan mengunggah filenya: suara diambil dari file MP4, MOV, MKV atau WEBM, dikenali oleh model Whisper, lalu ditulis baris demi baris dengan stempel waktu, siap diunduh sebagai TXT, SRT atau VTT, dan rekaman pertama Anda gratis tanpa akun sampai 10 menit. Setelah itu, satu menit saldo cukup untuk satu menit rekaman.
Diperbarui
Di halaman ini
Dari mana file video biasanya datang
Hampir semua file yang orang ubah jadi teks berasal dari lima sumber, dan semuanya diterima tanpa konversi lebih dulu.
| Sumber | Format yang biasanya dihasilkan |
|---|---|
| Kamera HP Android, video WhatsApp, ekspor CapCut | MP4 |
| Kamera iPhone, rekaman layar Mac | MOV |
| Rekaman lokal Zoom, unduhan rekaman Google Meet dan Microsoft Teams | MP4 |
| OBS Studio, perekam layar di browser | MKV, WEBM |
| Kamera lama, program Windows, rekaman siaran TV | AVI, WMV, MPEG, TS |
Ekstensi file hanya pemeriksaan pertama. Server membaca wadah file yang sebenarnya dengan ffprobe dan menolak apa pun yang bukan file media sebelum harga ditampilkan.
Yang dibaca hanya suara, bukan gambar
Mengubah video jadi teks di sini berarti mengenali ucapan pada trek audionya: ffmpeg menyalin trek suara pertama tanpa mendekode gambar, mengubahnya menjadi MP3 mono 16 kHz, lalu meneruskannya ke model Whisper dari OpenAI. Karena itu codec gambar, H.264 atau HEVC, tidak berpengaruh.
- Gambar diabaikan. Slide, tulisan di layar dan subtitle yang tertanam di gambar tidak dibaca.
- Tanpa suara, tanpa teks. Rekaman layar tanpa mikrofon dan tanpa suara sistem ditolak dengan pesan bahwa file tidak berisi audio.
- Satu trek. Jika file punya beberapa trek suara, misalnya film dengan dua sulih suara, yang dipakai adalah trek pertama.
- Terlalu besar? Unggah suaranya saja. Teksnya sama, ukurannya tinggal sebagian kecil.
Jalurnya sama dengan file audio, sehingga satu menit klip dihitung sama dengan satu menit rekaman suara. MP3, M4A dan WAV diterima di area unggah yang sama.
Cara transkrip video ke teks dalam empat langkah
Empat langkah membawa file dari komputer atau HP menjadi transkrip yang bisa diunduh, tanpa memasang program dan tanpa mengetik ulang ucapan.
- Pilih file video. Seret file MP4, MOV, MKV, WEBM atau format lain ke area unggah, atau klik untuk memilihnya. Browser memeriksa jenis dan ukuran file sebelum apa pun dikirim.
- Mulai transkripsi. Rekaman pertama tamu langsung diproses dan gratis: utuh sampai 10 menit, atau 10 menit pertama jika lebih panjang. Setelah masuk, halaman menunjukkan berapa menit saldo yang akan dipakai, dan proses baru berjalan setelah Anda menekan tombol.
- Tonton dan baca berdampingan. Video diputar dari perangkat Anda sendiri di samping transkrip; klik stempel waktu untuk melompat ke detik itu.
- Unduh teks atau subtitle. Simpan TXT atau Markdown untuk dibaca dan disunting, SRT atau VTT untuk subtitle.
Pengenalan suara berjalan di server kami, jadi video to text di halaman ini tidak memerlukan plugin atau aplikasi desktop. Rekaman panjang menampilkan kemajuan dalam menit yang sudah selesai: untuk webinar 90 menit Anda melihat posisinya, bukan sekadar ikon memuat. Untuk layar yang lebih lega, Anda bisa membuka ruang kerja dengan file Anda, tempat pemutar, transkrip dan alat AI berdampingan.
Ukuran file dan durasi
Batas keras hanya ada dua, ukuran file dan durasi rekaman, dan keduanya bergantung pada apakah Anda sudah masuk.
- Tanpa akun: file sampai 100 MB; rekaman pertama ditranskrip gratis, utuh sampai 10 menit, setelah itu tersedia potongan pendek gratis.
- Setelah masuk: file sampai 500 MB dan durasi sampai 4 jam.
- File yang lebih dari 4 jam perlu dipotong dulu menjadi beberapa bagian.
Gambar jauh lebih berat daripada suara: satu jam rekaman layar 1080p bisa melewati 500 MB, sedangkan satu jam suaranya hanya beberapa puluh megabita.
Rekaman yang hasil transkripnya bagus
Video ke teks paling akurat untuk satu orang yang berbicara dekat mikrofon: kuliah, wawancara, webinar, presentasi dan tutorial dengan narasi.
- Bagus: mikrofon klip atau headset, ruangan tenang, satu orang bicara pada satu waktu.
- Lebih lemah: musik di bawah ucapan, suara penonton, orang bicara bersahutan, angin pada rekaman HP di luar ruangan.
- Lagu: lirik yang dinyanyikan keluar kurang akurat dibanding ucapan biasa.
OpenAI melatih Whisper dengan 680.000 jam audio dari web, seperti dijelaskan dalam makalah «Robust Speech Recognition via Large-Scale Weak Supervision» tahun 2022, dan bahasa Indonesia termasuk dalam daftar bahasanya. Kami tidak menerbitkan angka akurasi dalam persen, karena angka itu lebih bergantung pada rekaman daripada pada perangkat lunak. Rekaman pertama yang gratis adalah uji paling jujur dengan materi Anda sendiri, dan stempel waktu di samping baris yang keliru membawa Anda langsung ke detik itu untuk didengar ulang.
Contoh hasil transkrip video
Transkrip kembali sebagai satu baris per frasa yang diucapkan, dan setiap baris diawali menit serta detik saat frasa itu dimulai.
Contoh teks dalam format TXT yang sebenarnya, bukan rekaman nyata:
[0:00] Selamat pagi, hari ini kita membahas laporan keuangan kuartal ketiga.
[0:07] Di sebelah kiri ada filter baru yang kita tambahkan minggu lalu.
[0:14] Saya buka laporan penjualan dulu, karena paling banyak pertanyaan di situ.
[0:22] Totalnya sekarang langsung berubah tanpa perlu memuat ulang halaman.Tanda baca dan huruf kapital berasal dari Whisper. Setelah jam pertama, stempel waktu mendapat kolom jam, misalnya [1:04:10]. Setiap stempel menandai awal frasa, bukan awal setiap kata.
Setelah transkrip: subtitle, ekspor, AI
Transkrip yang sudah jadi bisa diunduh dalam empat format tanpa biaya tambahan, dan dua di antaranya adalah file subtitle.
- TXT dan Markdown untuk dibaca, dicatat dan disunting, dengan atau tanpa stempel
[m:ss]. - SRT untuk CapCut, Premiere Pro, DaVinci Resolve dan YouTube Studio; VTT untuk pemutar HTML5.
File SRT dari unggahan ini punya waktu mulai dan selesai hasil pengenalan, sama seperti file yang Anda dapat saat menyimpan subtitle YouTube yang sudah ada, jadi tidak perlu proses kedua.
Analisis AI bekerja di atas transkrip yang sudah selesai: ringkasan, catatan lengkap, momen penting, bab dengan stempel waktu, artikel, unggahan media sosial, Transkrip Pro yang rapi, obrolan tentang rekaman, atau prompt Anda sendiri. Cara meringkas rekaman menjadi poin utama sama persis dengan video YouTube. Semua analisis itu termasuk dalam rekaman yang sudah ditranskrip, tanpa tagihan kedua: yang dibayar adalah menit pengenalan suara, bukan tombol.
Transkrip video gratis, dan kapan menit terpakai
Yang gratis adalah rekaman pertama Anda tanpa akun, utuh sampai 10 menit atau 10 menit pertama dari rekaman yang lebih panjang; setelah itu file utuh memakai satu menit saldo per menit rekaman, mulai $0.033 per menit.
| Apa | Biaya | Ketentuan |
|---|---|---|
| Rekaman pertama | gratis | tanpa akun; utuh sampai 10 menit, atau 10 menit pertama jika lebih panjang; di jaringan bersama berlaku batas harian per jaringan |
| Video berikutnya tanpa akun | potongan gratis | potongan pendek dari awal; file utuh setelah masuk |
| Ekspor dan analisis AI | termasuk | TXT, MD, SRT, VTT dan setiap analisis AI dari file yang sudah ditranskrip, tanpa tagihan kedua |
| Hadiah saat mendaftar | 10 menit | sekali per akun, dipakai lebih dulu, hangus setelah 7 hari |
| File utuh | 1 menit saldo per menit rekaman | dibulatkan ke atas; harga tampil sebelum mulai; saldo dipotong setelah transkripsi berhasil |
| Paket | 1 jam seharga $2.99 · 3 jam seharga $7.99 · 10 jam seharga $19.99 · 30 jam seharga $58.99 | sekali bayar dalam dolar AS, tanpa langganan; menit yang dibeli tidak hangus; pengembalian dana dalam 14 hari |
Dalam praktik, hadiah itu cukup untuk rekaman layar 10 menit atau satu wawancara pendek. Kuliah 75 menit perlu paket tambahan, dan halaman memberi tahu hal itu sebelum saldo dipotong. «Rekaman pertama» hanya ada satu per tamu: video YouTube tanpa subtitle yang pernah ditranskrip juga dihitung sebagai rekaman itu.
Video yang sudah ada di YouTube perlu diunggah?
Tidak: sebagian besar video YouTube punya subtitle, dan teksnya dibaca langsung tanpa unggahan dan tanpa pengenalan suara.
Mengambil teks dari video YouTube yang punya subtitle tidak dipungut biaya: teks berasal dari trek subtitle, tanpa daftar dan tanpa batas, dan analisis AI di atasnya juga gratis. Pengenalan suara, dan karena itu menit saldo, hanya diperlukan jika tidak ada teks sebagai titik awal: file Anda sendiri, atau video YouTube tanpa subtitle. Untuk sekadar membaca isi tayangan, halaman utama membuka transkrip YouTube yang bisa dicari per kata.
Ke mana file video Anda pergi
Yang tersisa hanya teks: file videonya sendiri kami hapus dari server segera setelah suaranya diambil.
- Suara yang diambil dikirim ke Whisper dari OpenAI untuk dikenali; potongan-potongannya dihapus begitu transkrip selesai.
- Tanpa akun, transkrip tidak disimpan di server: server menahannya sekitar satu jam sampai halaman mengambilnya, setelah itu teks hanya ada di browser Anda.
- Unggahan yang tidak pernah dimulai, misalnya saat Anda sedang mengisi saldo, dihapus setelah sekitar satu jam.
- Setelah masuk, transkrip disimpan di akun Anda.
- Pemutar memutar file dari perangkat Anda sendiri. Setelah halaman dimuat ulang, pilih file itu lagi untuk ditonton; teksnya sudah tersimpan.
Semua aturannya ada di kebijakan privasi.
Yang tidak bisa dilakukan transkripsi video
Tulisan di layar tidak masuk ke transkrip: alat ini mengubah ucapan menjadi teks dan tidak membaca gambar.
- Tidak ada penanda pembicara; hasilnya satu aliran baris berstempel waktu.
- Tidak menanamkan subtitle ke gambar; Anda mendapat file SRT atau VTT untuk editor atau pemutar.
- Tidak membaca trek subtitle yang sudah ada di dalam file MKV atau MP4; teks dibuat dari ucapan.
- Tidak menerima tautan Google Drive, Dropbox, Vimeo atau TikTok; unduh filenya dulu, lalu unggah di sini.
- File di atas 500 MB atau lebih dari 4 jam ditolak; unggah suaranya saja atau potong filenya.
- Hanya trek suara pertama yang dipakai.
Yang bisa Anda pegang saat mengubah video sendiri menjadi teks: harga tampil sebelum mulai, menit dipotong hanya setelah transkripsi berhasil, dan ekspor transkrip sudah termasuk.
Pertanyaan yang sering diajukan
Bisakah transkrip video ke teks secara gratis?
Ya, untuk rekaman pertama Anda: tanpa akun, file ditranskrip gratis, utuh sampai 10 menit, atau 10 menit pertama jika lebih panjang. Setelah itu tamu mendapat potongan pendek gratis, sedangkan file utuh memakai menit saldo; saat mendaftar Anda mendapat hadiah 10 menit.
Apakah harus membuat akun?
Tidak untuk rekaman pertama dan potongan pendek gratis. Untuk file utuh berikutnya, ya: masuk lewat tautan yang dikirim ke email, tanpa kata sandi.
Format dan ukuran file apa yang diterima?
MP4, MOV, MKV, WEBM, AVI, MPEG, TS dan WMV, ditambah file audio seperti MP3, M4A dan WAV. Tanpa akun sampai 100 MB; setelah masuk sampai 500 MB dan 4 jam.
File saya lebih besar dari batas. Apa yang bisa dilakukan?
Unggah suaranya saja. Ekspor trek audio, misalnya sebagai M4A atau MP3, lalu unggah file itu: transkripnya sama, karena yang dikenali memang hanya suara, dan ukurannya jauh lebih kecil.
Apakah video saya disimpan di server?
Tidak. File dihapus dari server segera setelah suaranya diambil, atau setelah sekitar satu jam jika transkripsi tidak pernah dimulai; potongan audio dihapus setelah dikenali. Teks tetap ada di browser Anda, atau di akun jika Anda masuk.
Apakah bahasa Indonesia dikenali otomatis?
Ya. Bahasa ucapan dideteksi sendiri, tanpa pengaturan sebelum mulai. Rekaman yang mencampur bahasa Indonesia dan Inggris tetap ditranskrip, tetapi istilah asing lebih sering salah eja.
Apakah pembicara dibedakan?
Tidak. Transkrip berupa satu aliran baris berstempel waktu, siapa pun yang sedang berbicara.