OpenAI Rilis GPT Transcribe, Tekan Biaya Transkripsi Audio pada 2026
OpenAI telah merilis GPT Transcribe pada 2026, model speech-to-text baru yang ditujukan bagi pengembang yang membangun transkripsi audio ke dalam aplikasi, alur kerja media, alat dukungan pelanggan, dan sistem suara real-time. Model ini kini tercantum dalam dokumentasi pengembang OpenAI sebagai opsi transkripsi berakurasi tinggi untuk file audio yang telah selesai diproses, transkrip file streaming, dan giliran yang dikomit dalam sesi Realtime. OpenAI mematok harga GPT Transcribe sebesar US$0,0045 per menit, atau setara US$4,50 untuk setiap 1.000 menit audio, menurut halaman model perusahaan.
Harga tersebut membuat pembaruan ini menarik di luar sekadar rilis model biasa. Transkripsi adalah salah satu kasus penggunaan AI yang paling praktis bagi bisnis, kreator, dan tim perangkat lunak. Podcast, rapat, wawancara, rekaman panggilan, catatan suara, teks video, dan panggilan dukungan semuanya menghasilkan volume audio dalam jumlah besar. Biaya per menit yang lebih rendah dapat berdampak cepat ketika alur kerja tersebut berpindah dari penggunaan sesekali ke skala produksi.
Perubahan yang lebih besar bukan hanya soal harga. GPT Transcribe juga memberi pengembang kontrol konteks yang lebih banyak dibandingkan alur kerja transkripsi lama. OpenAI menyatakan model ini mendukung prompt tak terstruktur, petunjuk kata kunci, dan petunjuk bahasa ganda untuk meningkatkan pengenalan istilah domain, audio multibahasa, dan peralihan kode. Hal itu menjadikan peluncuran tersebut tidak sekadar pengenalan suara generik, melainkan transkripsi yang dapat digunakan dalam lingkungan bisnis nyata.
Model speech-to-text kerap gagal pada hal-hal yang paling dipedulikan pengguna. Model mungkin menangkap kalimat normal dengan benar, tetapi meleset pada nama produk, istilah teknis, kata medis, ticker saham, pengenal akun, atau akronim. OpenAI berupaya mengatasi celah itu dengan memungkinkan pengembang memberi model lebih banyak informasi sebelum transkripsi dimulai. Dalam panduan transkripsi filenya, OpenAI menyebut pengembang dapat menggunakan prompt untuk mendeskripsikan rekaman, kata kunci untuk istilah harfiah yang diperkirakan muncul dalam audio, serta bahasa untuk bahasa masukan yang diharapkan. Perusahaan juga memperingatkan bahwa kata kunci hanyalah petunjuk dan harus digunakan secara hati-hati, karena istilah yang tidak relevan dapat menyebabkan kesalahan jika mendorong model menuju kata-kata yang sebenarnya tidak diucapkan.
Hal ini penting untuk kasus penggunaan praktis. Platform dukungan pelanggan mungkin membutuhkan model untuk mengenali nama paket, ID tiket, dan istilah penagihan. Perangkat dokumentasi medis mungkin membutuhkan nama obat yang tepat. Perusahaan media mungkin membutuhkan ejaan yang akurat untuk nama eksekutif, perusahaan rintisan, dan nama produk. Tim multibahasa mungkin membutuhkan transkripsi yang mampu menangani pembicara yang berpindah antara bahasa Inggris, Prancis, Spanyol, atau bahasa lain dalam percakapan yang sama. Dalam kasus-kasus tersebut, akurasi tolok ukur mentah hanya sebagian dari cerita. Pertanyaannya adalah apakah model dapat diarahkan menuju kosakata yang muncul dalam alur kerja sebenarnya.
OpenAI juga mengarahkan pengembang pada GPT Transcribe sebagai jalur migrasi dari Whisper untuk audio yang direkam. Panduan migrasinya menyebut GPT Transcribe dirancang untuk transkripsi akurat atas audio yang telah selesai, sementara GPT-Live-Transcribe dirancang untuk transkripsi streaming berlatensi rendah yang berkelanjutan. Pemisahan itu penting. Rapat yang direkam dan file yang diunggah tidak sama dengan teks langsung selama panggilan berlangsung. OpenAI memisahkan kedua alur kerja itu alih-alih memperlakukan semua kasus penggunaan speech-to-text dalam satu kategori.
Dokumentasi transkripsi Realtime OpenAI menyatakan pengembang harus memulai dengan GPT-Live-Transcribe ketika aplikasi membutuhkan teks dari mikrofon, panggilan, atau streaming audio langsung tanpa respons asisten lisan. Model tersebut mengembalikan delta transkrip saat ucapan tiba dan transkrip akhir ketika aplikasi mengomit giliran audio, menurut panduan transkripsi Realtime OpenAI. Hal itu menempatkan GPT-Live-Transcribe lebih dekat dengan produk seperti teks langsung, pemantauan pusat panggilan, pencatatan agen suara, asisten rapat, dan transkripsi streaming di dalam aplikasi peramban atau seluler.
Bagi pengembang, perbedaan itu penting karena transkripsi file dan transkripsi langsung memiliki ekspektasi latensi yang berbeda. Transkrip podcast dapat menunggu. Panggilan dukungan pelanggan tidak bisa. Agen suara membutuhkan teks parsial yang cukup cepat untuk menjaga interaksi tetap berjalan. OpenAI juga membuat GPT Transcribe bekerja dengan keluaran streaming untuk file yang telah selesai. Artinya, aplikasi dapat mengunggah rekaman yang sudah jadi dan menerima peristiwa transkrip parsial selama file diproses. Ini tidak sama dengan streaming masukan mikrofon, tetapi dapat membuat rekaman panjang terasa lebih responsif di antarmuka pengguna.
Peluncuran ini tidak perlu diposisikan sebagai OpenAI yang tiba-tiba menguasai pasar speech-to-text. Artificial Analysis, yang melacak penyedia speech-to-text, menyatakan indeks AA-WER miliknya mengukur akurasi transkripsi pada tiga kumpulan data yang mencakup ucapan dunia nyata, beragam aksen, bahasa khusus domain, dan kondisi akustik yang menantang. Papan peringkatnya membandingkan model non-streaming berdasarkan tingkat kesalahan kata dan harga pada sekitar delapan jam audio, menurut papan peringkat speech-to-text Artificial Analysis. Tangkapan layar yang dibagikan Artificial Analysis menunjukkan GPT Transcribe mencetak skor 3,31 persen pada AA-WER dan menempati peringkat kesembilan dalam tolok ukur tersebut, sekaligus lebih baik daripada GPT-4o Transcribe dan menurunkan harga menjadi US$4,50 per 1.000 menit audio.
Hal ini membuat ceritanya lebih bernuansa. OpenAI mungkin tidak mengklaim kemenangan tolok ukur yang menyeluruh di seluruh pasar. Sebaliknya, perusahaan tampaknya bersaing pada kombinasi akurasi, harga, perangkat pengembang, kontrol konteks, dan integrasi dengan API audio serta Realtime yang lebih luas. Bagi banyak pelanggan, paket itu mungkin lebih penting daripada posisi papan peringkat tunggal. Perusahaan yang sudah menggunakan OpenAI untuk teks, agen suara, atau otomasi mungkin lebih memilih model transkripsi yang sesuai dengan tumpukan API yang sama, meskipun penyedia lain mencetak skor lebih baik dalam tolok ukur yang sempit.
Bagi kreator, GPT Transcribe dapat mengurangi biaya untuk mengubah video panjang, wawancara, dan podcast menjadi teks yang dapat dicari, teks video, dan konten tertulis yang digunakan ulang. Dengan harga US$4,50 per 1.000 menit, transkripsi untuk konten bervolume besar menjadi jauh lebih terjangkau.