Whisper versus API: Kapan model “gratis” menjadi item biaya termahal

Tim Anda melihat tagihan AssemblyAI. Seseorang bertanya: "Mengapa kita tidak menghosting Whisper sendiri saja untuk menghemat uang?"

Kedengarannya sederhana. Unduh sebuah checkpoint. Jalankan sebuah perintah. Selesai dalam satu sore.

Namun pertanyaan sebenarnya adalah: berapa biaya untuk menjalankan endpoint tersebut selama dua tahun ke depan?

Mengapa tagihan API terlihat murah

Layanan transkripsi terkelola mengenakan biaya berdasarkan detik audio yang diproses. AssemblyAI, misalnya, menagih sekitar $0,15 – $0,21 untuk setiap jam konten yang melewati pipeline asinkronnya. Angka-angka tersebut menyembunyikan banyak pekerjaan: penyedia layanan memelihara perangkat keras inferensi, membersihkan audio yang bising, memisahkan pembicara, memformat entitas (nomor kartu kredit, email, kode verifikasi), melakukan streaming hasil secara real-time, dan memantau layanan 24 × 7. Faktur yang Anda terima adalah jumlah dari semua itu, yang dibundel ke dalam tarif per detik yang sederhana.

Apa arti sebenarnya dari harga GPU

Whisper Large-v3 dapat berjalan pada satu GPU A100 atau H100. Penyedia layanan cloud mencantumkan kartu-kartu tersebut seharga $2 – $4 per jam sesuai permintaan (on demand). Masalahnya adalah Anda membayar harga per jam secara penuh bahkan ketika chip tersebut sedang menganggur (idle). Jika beban kerja Anda hanya menggunakan 15% dari kapasitas GPU, Anda tetap menanggung biaya penuh $2 – $4 tersebut.

Utang teknis (engineering debt) yang Anda warisi

Menghosting sendiri tidak berhenti pada peluncuran checkpoint model. Pekerjaan tersembunyi akan dengan cepat melampaui biaya perangkat keras yang terlihat di permukaan.

  • Speaker diarization – Whisper sumber terbuka (open-source) tidak memisahkan suara. Membangun pipeline diarization yang andal memerlukan model, data, dan penyetelan (tuning) yang berkelanjutan.
  • Dukungan streaming – Whisper memproses seluruh file secara asinkron. Caption waktu nyata (real-time) atau respons agen suara memerlukan lapisan streaming khusus, lengkap dengan penanganan back-pressure dan pemantauan latensi.
  • Pemformatan entitas – Transkrip mentah tidak memiliki logika untuk menyamarkan atau memformat ulang string sensitif. Menambahkan aturan untuk nomor kartu kredit, alamat email, atau kode OTP adalah upaya teknik yang tidak sepele, dan satu kesalahan ketik saja dapat membuat transkrip tidak dapat digunakan.
  • Rekayasa keandalan (reliability engineering) – Demo yang berjalan pada satu GPU itu mudah; layanan produksi harus menangani konkurensi, percobaan ulang (retries), pemutakhiran tanpa waktu henti (zero-downtime upgrades), dan peringatan (alerting).

Kapan menghosting sendiri benar-benar menguntungkan

Perhitungannya baru akan berbalik hanya dalam beberapa skenario sempit:

  • Pemrosesan batch yang berat dan berkelanjutan – Jika Anda memiliki cukup banyak audio untuk menjaga utilisasi GPU mendekati 100% selama berbulan-bulan, biaya perangkat keras per jam dapat diamortisasi ke dalam volume transkripsi yang masif, sehingga biaya per audio menjadi lebih rendah daripada tarif API.
  • Mandat privasi data yang ketat – Peraturan yang melarang audio keluar dari lokasi Anda memaksa Anda untuk tetap melakukan pemrosesan secara internal, terlepas dari biayanya.
  • Kontrol model penuh untuk pembuatan prototipe – Eksperimen tahap awal yang perlu mengubah arsitektur Whisper, prompt, atau melakukan fine-tune pada data milik sendiri akan mendapat manfaat dari kepemilikan checkpoint secara langsung.

Di luar skenario tersebut, model “gratis” menjadi item biaya termahal karena utang teknis yang tersembunyi dan waktu GPU yang tidak terpakai secara maksimal akan dengan cepat melampaui biaya per detik API yang relatif murah.

Kesimpulan: Biaya lisensi Whisper yang nol memang menggiurkan, tetapi total biaya kepemilikan (total cost of ownership) mencakup harga GPU, waktu menganggur, dan serangkaian tugas teknik yang biasanya sudah diserahkan oleh sebagian besar tim ke API transkripsi. Hanya ketika Anda dapat memanfaatkan perangkat keras secara penuh, harus menyimpan data di lokasi (on-prem), atau membutuhkan kontrol model yang mendalam, menghosting sendiri menjadi rute yang lebih murah. Jika tidak, model “gratis” tersebut kemungkinan besar akan menjadi bagian termahal dari anggaran transkripsi Anda.