OpenAI telah secara rasmi memperluas keupayaan pertukaran ucapan-ke-teks (speech-to-text) dengan pelancaran GPT Transcribe dan GPT Live Transcribe. Model berasaskan API baharu ini bertujuan untuk menyediakan transkripsi berkelajuan tinggi dan kos efektif bagi kedua-dua pemprosesan berkelompok (batch processing) dan aplikasi penstriman masa nyata (real-time streaming).
Kelajuan, Ketepatan, dan Penambahbaikan Harga
Pelancaran baharu ini memperkenalkan dua aliran kerja yang berbeza: GPT Transcribe, yang direka untuk memproses fail audio yang telah dirakam, dan GPT Live Transcribe, yang dioptimumkan untuk penstriman masa nyata dengan kependaman (latency) rendah. Pencapaian teknikal yang menonjol ialah kelajuan GPT Transcribe, yang boleh memproses fail audio kira-kira 34 kali lebih pantas daripada masa nyata.
Dari segi ketepatan, OpenAI telah mencapai kemajuan yang ketara. Menurut penanda aras AA-WER oleh Artificial Analysis, GPT Transcribe mencapai Kadar Ralat Perkataan (Word Error Rate - WER) sebanyak 3.31 peratus. Ini mewakili peningkatan 0.7 mata peratusan berbanding pendahulunya, GPT-4o Transcribe. Seiring dengan lonjakan ketepatan ini adalah pengurangan harga sebanyak 25 peratus, dengan kadar baharu ditetapkan pada $0.0045 seminit audio. Untuk meningkatkan ketepatan kontekstual, kedua-dua model menyokong penyertaan konteks teks, kata kunci khusus, dan pelbagai bahasa input.
Landskap Persaingan: OpenAI lwn. Gergasi Industri
Walaupun terdapat penambahbaikan, OpenAI mendapati dirinya dalam persaingan sengit untuk penguasaan ucapan, ketinggalan di belakang peneraju khusus dalam aspek ketepatan tulen. Kedudukan AA-WER mendedahkan bahawa kadar ralat 3.31% OpenAI kini diatasi oleh beberapa pesaing utama:
- ElevenLabs: Mendahului industri dengan model Scribe v2 miliknya, dengan kadar ralat unggul sebanyak 2.3%.
- Google: Model Gemini 3 Pro miliknya menyusul rapat dengan kadar ralat 2.9%.
- Mistral: Model Voxtral Small memegang kedudukan yang kukuh dengan kadar ralat 3%.
Selain ketepatan, medan pertempuran juga beralih ke arah persaingan harga. Mistral baru-baru ini telah bertindak merendahkan harga pasaran dengan Voxtral Transcribe V2 miliknya, yang bermula pada harga yang sangat agresif iaitu $0.003 seminit.
Integrasi dengan Ekosistem OpenAI
Model transkripsi ini bukan alat yang berdiri sendiri; ia adalah komponen penting dalam strategi multimodal OpenAI yang lebih luas. Ia direka untuk melengkapi generasi model Realtime yang diumumkan baru-baru ini, yang merangkumi model GPT-Realtime-Whisper. Dengan menawarkan transkripsi berkelompok berkelajuan tinggi dan penstriman langsung kependaman rendah, OpenAI meletakkan dirinya untuk berkhidmat kepada pelbagai pembangun—daripada mereka yang membina pembantu mesyuarat automatik kepada mereka yang mencipta perkhidmatan terjemahan masa nyata.
Bagi landskap AI yang lebih luas, perkembangan ini menandakan peralihan daripada "ketepatan pada sebarang kos" kepada pengoptimuman yang lebih seimbang antara kelajuan, kos, dan ketepatan. Walaupun OpenAI mungkin tidak memegang gelaran untuk kadar ralat terendah, keupayaannya untuk menawarkan peningkatan kecekapan yang ketara menjadikannya pemain yang hebat dalam pasaran AI gred pengeluaran (production-grade).
Ringkasan Utama
- Peningkatan Prestasi: GPT Transcribe mengurangkan Kadar Ralat Perkataan kepada 3.31% dan memproses audio 34x lebih pantas daripada masa nyata.
- Kecekapan Kos: OpenAI telah memotong harga transkripsi sebanyak 25%, mengurangkan kos kepada $0.0045 seminit.
- Tekanan Persaingan: OpenAI masih ketinggalan di belakang ElevenLabs (2.3% WER) dan Google (2.9% WER) dari segi ketepatan, manakala Mistral menerajui dari segi harga.
OpenAI telah melancarkan dua API speech-to-text baharu—GPT Transcribe untuk fail berkelompok dan GPT Live Transcribe untuk penstriman—menjanjikan pemprosesan 34 kali lebih pantas dan pemotongan harga sebanyak 25 peratus yang membawa kos kepada $0.0045 seminit.
Pelancaran ini berlaku ketika pembangun sedang bersaing mendapatkan perkhidmatan transkripsi yang dapat mengimbangi set data audio yang semakin besar sambil mengekalkan margin keuntungan yang kecil.
Mengapa naik taraf ini penting
GPT Live Transcribe menambah penstriman kependaman rendah, bermakna pembangun boleh memasukkan suapan mikrofon langsung ke dalam API dan menerima teks hampir serta-merta. Kedua-dua model menerima konteks teks tambahan, petunjuk kata kunci dan input pelbagai bahasa, yang membantu sistem memantau terminologi khusus domain.
Ketepatan juga bertambah baik. Penanda aras AA-WER daripada Artificial Analysis merekodkan Kadar Ralat Perkataan (WER) sebanyak 3.31 peratus untuk GPT Transcribe, penurunan 0.7 mata daripada model GPT-4o Transcribe sebelum ini. Walaupun bukan angka terendah dalam carta pendahulu, jurangnya cukup kecil untuk ditoleransi oleh banyak saluran paip pengeluaran (production pipelines), terutamanya apabila lonjakan kelajuan diterjemahkan kepada bil pengkomputeran yang lebih rendah.
Gambaran persaingan
Kedudukan AA-WER yang sama menunjukkan tiga pesaing mengatasi OpenAI dari segi kadar ralat tulen:
- Scribe v2 milik ElevenLabs pada 2.3 peratus
- Gemini 3 Pro milik Google pada 2.9 peratus
- Voxtral Small milik Mistral pada 3 peratus
Voxtral Transcribe V2 milik Mistral yang terbaharu malah lebih murah daripada OpenAI, menawarkan transkripsi pada harga $0.003 seminit. Angka-angka ini mewujudkan satu imbangan (trade-off) yang jelas: pembangun mesti memutuskan sama ada mereka mengutamakan kadar seminit yang paling murah, margin ralat yang paling kecil, atau kemudahan integrasi yang disediakan oleh ekosistem OpenAI yang lebih luas.
Apa yang pembangun peroleh – dan apa yang mereka korbankan
Kelajuan dan kos adalah manfaat utama. Tugasan berkelompok (batch job) yang sebelum ini memerlukan pengkomputeran selama satu jam penuh kini selesai jauh lebih cepat, sekali gus membebaskan masa GPU untuk beban kerja lain. Kadar $0.0045 seminit juga mengurangkan kos transkripsi selama sepuluh jam berbanding harga sebelum ini, satu penjimatan yang kecil tetapi nyata apabila diskalakan kepada beribu-ribu jam.
Sinergi ekosistem adalah satu lagi nilai jualan. Model-model baharu ini hadir bersama tawaran multimodal OpenAI, termasuk penjanaan model Realtime dan GPT-Realtime-Whisper yang diumumkan baru-baru ini. Oleh itu, satu kunci API sahaja boleh memacu penjanaan imej, sembang, dan kini transkripsi pantas tanpa perlu menggabungkan penyedia yang berbeza-beza. Bagi pasukan yang sudah menggunakan stack OpenAI, keseragaman tersebut mengurangkan beban pengesahan (authentication overhead) dan memudahkan pengebilan.
Imbangan ketepatan kekal menjadi kebimbangan utama. WER sebanyak 3.31 peratus masih bermaksud kira-kira satu kesilapan bagi setiap tiga puluh patah perkataan dalam audio yang bising atau khusus untuk domain tertentu. Aplikasi seperti diktasi perubatan atau transkripsi undang-undang, di mana ralat membawa risiko yang lebih tinggi, mungkin masih lebih cenderung kepada ElevenLabs atau Google walaupun kosnya lebih tinggi. Keupayaan untuk memasukkan kata kunci dan konteks tersuai dapat mengurangkan jurang tersebut, tetapi ia memerlukan usaha kejuruteraan tambahan.
Peralihan pasaran yang lebih luas
Langkah penetapan harga OpenAI menandakan peralihan daripada "ketepatan pada sebarang kos" kepada formula yang lebih seimbang antara kelajuan, kos, dan ketepatan. Pasaran teks-ke-ucapan (speech-to-text) secara tradisinya terbahagi kepada: firma butik yang mengejar kadar ralat terendah, gergasi awan yang bersaing dari segi skala, dan pendatang baharu yang bersaing dari segi harga. Dengan mengecilkan jurang harga sambil memberikan kadar ralat yang munasabah dan daya pemprosesan (throughput) yang ekstrem, OpenAI memaksa pesaing untuk mempertimbangkan semula struktur harga mereka sendiri.
Tawaran agresif Mistral pada harga $0.003 seminit sudah pun memberi tekanan kepada OpenAI untuk mengekalkan kadar yang kompetitif. ElevenLabs dan Google, dengan bajet penyelidikan yang lebih besar, mungkin bertindak balas dengan memperkemas penyambung integrasi (integration hooks) atau membundelkan transkripsi dengan perkhidmatan premium yang lain. Beberapa suku tahun akan datang mungkin akan menyaksikan gelombang pelan "bayar mengikut penggunaan" (pay-as-you-go), diskaun volum, atau SDK mesra pembangun yang bertujuan untuk mengunci penggunaan jangka panjang.
Hujah balas: apabila yang termurah tidak mencukupi
Angka-angka utama tersebut menyembunyikan nuansa yang penting bagi penggunaan dunia nyata. Penambahbaikan WER sebanyak 0.7 mata berbanding GPT-4o adalah bermakna, tetapi kadar ralat mutlak masih ketinggalan di belakang tiga pesaing teratas. Bagi pembangun yang membina produk di mana ralat transkripsi memberi kesan langsung kepada kepercayaan pengguna—seperti sari kata langsung untuk penyiaran atau log kritikal pematuhan—memilih model dengan ralat terendah mungkin lebih penting daripada sebarang penjimatan kos.
Selain itu, kelebihan kelajuan bergantung kepada keupayaan untuk menghantar audio ke API pada kadar yang tinggi. Projek yang dihadkan oleh lebar jalur rangkaian atau tersekat oleh pemprosesan peranti pinggir (edge-device) mungkin tidak akan menikmati peningkatan kelajuan 34× sepenuhnya, sekali gus mengurangkan manfaat kos tersebut. Dalam senario tersebut, model yang dihoskan secara tempatan dengan ketepatan yang setanding mungkin lebih praktikal, walaupun harga seminit kelihatan lebih tinggi di atas kertas.
Apa yang perlu diperhatikan seterusnya
- Keanjalan harga: Adakah kadar bawah $0.003 milik Mistral akan mencetuskan perang harga, atau adakah OpenAI akan kekal pada $0.0045?
- Metrik penggunaan pembangun: Data penggunaan awal daripada pasaran API akan mendedahkan sama ada kelajuan atau harga yang memacu sebahagian besar trafik.
- Pemerhatian kawal selia: Memandangkan transkripsi menjadi semakin meluas, peraturan privasi data boleh mempengaruhi penyedia mana yang sesuai untuk industri sensitif.
Kesimpulan
GPT Transcribe dan GPT Live Transcribe milik OpenAI memberikan gabungan unik antara pemprosesan ultra-pantas dan pemotongan harga yang ketara, meletakkan syarikat tersebut sebagai alternatif kos efektif bagi pembangun yang mengutamakan kelajuan dan kesepaduan ekosistem berbanding kadar ralat mutlak yang terendah.
