Whisper lawan API: Apabila model “percuma” menjadi item kos yang paling mahal

Pasukan anda melihat bil AssemblyAI. Seseorang bertanya: "Mengapa tidak hos Whisper sendiri sahaja untuk menjimatkan wang?"

Ia kedengaran mudah. Muat turun satu checkpoint. Jalankan satu arahan. Selesai dalam satu petang.

Tetapi soalan sebenarnya ialah: berapakah kos untuk menjalankan endpoint tersebut bagi dua tahun akan datang?

Mengapa bil API kelihatan murah

Perkhidmatan transkripsi terurus mengenakan caj mengikut saat audio yang diproses. AssemblyAI, sebagai contoh, mengenakan caj kira-kira $0.15 – $0.21 bagi setiap jam kandungan yang melalui saluran asynchronous miliknya. Angka-angka tersebut menyembunyikan banyak kerja: penyedia mengekalkan perkakasan inferens, membersihkan audio yang bising, memisahkan penutur, memformat entiti (nombor kad kredit, e-mel, kod pengesahan), menyalurkan (stream) keputusan dalam masa nyata, dan memantau perkhidmatan 24 × 7. Invois yang anda terima adalah jumlah keseluruhan semua itu, yang digabungkan ke dalam kadar setiap saat yang ringkas.

Apa maksud sebenar harga GPU

Whisper Large-v3 boleh dijalankan pada satu GPU A100 atau H100. Penyedia awan menyenaraikan kad tersebut pada harga $2 – $4 sejam mengikut permintaan. Masalahnya ialah anda membayar harga sejam yang penuh walaupun cip tersebut tidak digunakan (idle). Jika beban kerja anda hanya menggunakan 15% kapasiti GPU, anda tetap akan dikenakan caj penuh $2 – $4 tersebut.

Hutang kejuruteraan yang anda warisi

Hos sendiri tidak terhenti setakat melancarkan checkpoint model sahaja. Kerja-kerja tersembunyi akan dengan cepat mengatasi kos perkakasan utama.

  • Speaker diarization – Whisper sumber terbuka tidak memisahkan suara. Membina saluran diarization yang boleh dipercayai memerlukan model, data, dan penalaan berterusan yang berasingan.
  • Sokongan penstriman – Whisper memproses keseluruhan fail secara asynchronous. Kapsyen masa nyata atau respons ejen suara memerlukan lapisan penstriman tersuai, lengkap dengan pengendalian back-pressure dan pemantauan kependaman (latency).
  • Pemformatan entiti – Transkrip mentah tidak mempunyai logik untuk menutup (mask) atau memformat semula rentetan sensitif. Menambah peraturan untuk nombor kad kredit, alamat e-mel, atau kod OTP adalah usaha kejuruteraan yang bukan remeh, dan satu kesilapan taip boleh menyebabkan transkrip tidak boleh digunakan.
  • Kejuruteraan kebolehpercayaan – Demo yang berjalan pada satu GPU adalah mudah; perkhidmatan pengeluaran (production) mesti menguruskan konkurensi, cubaan semula (retries), naik taraf tanpa masa henti (zero-downtime), dan amaran (alerting).

Bila hos sendiri sebenarnya berbaloi

Pengiraan akan berubah hanya dalam beberapa senario terhad:

  • Pemprosesan kelompok (batch) yang berat dan berterusan – Jika anda mempunyai audio yang mencukupi untuk mengekalkan penggunaan GPU pada tahap hampir 100% selama berbulan-bulan, caj perkakasan sejam boleh diamortisasikan merentasi volum transkripsi yang besar, menjadikan kos setiap audio lebih rendah daripada kadar API.
  • Mandat privasi data yang ketat – Peraturan yang melarang audio keluar dari premis anda memaksa anda untuk mengekalkan pemprosesan secara dalaman, tanpa mengira kos.
  • Kawalan model penuh untuk prototaip – Eksperimen peringkat awal yang perlu mengubah suai seni bina Whisper, prompt, atau melakukan penalaan halus (fine-tune) pada data proprietari akan mendapat manfaat daripada pemilikan checkpoint secara langsung.

Di luar kotak tersebut, model “percuma” menjadi item kos yang paling mahal kerana hutang kejuruteraan yang tersembunyi dan masa GPU yang tidak digunakan sepenuhnya akan dengan cepat mengatasi yuran setiap saat API yang rendah.

Rumusan: Yuran lesen sifar Whisper memang menggiurkan, tetapi jumlah kos pemilikan merangkumi harga GPU, masa terbiar (idle), dan rangkaian tugas kejuruteraan yang kebanyakan pasukan sudah serahkan kepada API transkripsi. Hanya apabila anda boleh menggunakan perkakasan sepenuhnya, perlu menyimpan data di premis (on-prem), atau memerlukan kawalan model yang mendalam, barulah hos sendiri menjadi laluan yang lebih murah. Jika tidak, model “percuma” berkemungkinan besar menjadi bahagian paling mahal dalam bajet transkripsi anda.