Analisis kos terbaharu menunjukkan bahawa hos kendiri (self-hosting) model bahasa besar hanya lebih menjimatkan berbanding API komersial apabila sesebuah perniagaan memproses kira-kira 5 juta hingga 10 juta token input setiap bulan. Bagi sesiapa yang merancang bajet perkhidmatan AI, titik pulang modal (break-even point) akan menentukan sama ada daya tarikan pemberat terbuka (open weights) yang "percuma" akan bertukar menjadi penjimatan sebenar.

Model API

Penyedia API mengenakan caj mengikut token dan menguruskan semua perkakasan, kuasa, dan penyejukan. Kadar awam semasa adalah:

  • Claude Sonnet 5 – $2 bagi setiap sejuta token input
  • GPT-5.6 – kira-kira $1 bagi setiap sejuta token input
  • Meta Muse Spark – $1.25 bagi setiap sejuta token masuk (inbound), $4.25 bagi setiap sejuta token keluar (outbound)

Model ini adalah jenis bayar mengikut penggunaan (pay-as-you-go). Apabila trafik jatuh ke sifar, bil juga jatuh ke sifar. Pengguna juga dapat mengelakkan kerumitan kegagalan GPU, kemas kini perisian tegar (firmware), dan perancangan kapasiti.

Model Hos Kendiri

Menjalankan model pemberat terbuka pada perkakasan anda sendiri bermakna anda menanggung kos pengkomputeran tanpa mengira tahap penggunaan. Sebuah NVIDIA H100 tunggal—pilihan biasa untuk inferens LLM—berharga:

  • $2 – $3 sejam pada perkhidmatan awan GPU generik
  • $7 – $12 sejam pada platform awan utama (AWS, Azure)

Ini bermakna kira-kira $1,800 – $2,000 sebulan untuk operasi berterusan satu unit H100. Harga perkakasan hanyalah bahagian bil yang nyata sahaja.

Titik Pertemuan Angka

Analisis mendapati bahawa hos kendiri menjadi lebih murah daripada API premium sebaik sahaja volum token input bulanan mencapai julat 5 juta hingga 10 juta. Di bawah ambang tersebut, kadar API mengikut token adalah lebih menguntungkan. Pada volum 100 juta token sebulan atau lebih, garis kos perkakasan sahaja jatuh di bawah garis API, menjadikan hos kendiri kelihatan menarik di atas kertas.

Perbelanjaan Operasi Tersembunyi

Sewaan GPU hanyalah sekitar 30% daripada kos sebenar menjalankan model dalam pengeluaran (production). Selebihnya datang daripada:

  • Rangkaian dan storan – pautan berkapasiti tinggi dan cakera pantas memastikan kependaman (latency) kekal rendah.
  • Redundansi dan pemantauan – pelbagai instans, pemeriksaan kesihatan, dan saluran amaran menambah perbelanjaan perisian dan perkakasan.
  • Bakat kejuruteraan – memastikan model sentiasa dalam talian secara stabil biasanya memerlukan 1.5 – 2 jurutera sepenuh masa. Pada kadar pasaran, ini menambah $270,000 – $550,000 kepada perbelanjaan tahunan.

Apabila lapisan-lapisan ini ditambah, penjimatan nyata daripada perkakasan sahaja akan lenyap dengan cepat.

Siapa yang Patut Mempertimbangkan Hos Kendiri

Hos kendiri hanya masuk akal di bawah syarat-syarat tertentu:

  • Volum yang besar secara konsisten – organisasi mesti kerap melebihi ambang 5 juta token, jika tidak, harga API mengikut token kekal lebih rendah.
  • Kekangan kawal selia atau privasi data – sesetengah sektor melarang penghantaran data proprietari atau peribadi ke titik akhir (endpoint) pihak ketiga.
  • Penyesuaian khusus atau jaminan kependaman – apabila model perlu ditala halus (fine-tuned) pada data dalaman atau memberikan respons bawah satu saat, pemilikan keseluruhan sistem (stack) boleh dijustifikasikan.

Jika tiada tekanan ini wujud, kos kakitangan dan infrastruktur tersembunyi sering kali melebihi penjimatan perkakasan.

Strategi Hibrid

Kebanyakan pasukan yang mencapai skala di mana hos kendiri berdaya maju masih mengekalkan pendekatan campuran:

  1. Mulakan dengan API – ia murah, cepat untuk disepadukan, dan sempurna untuk eksperimen atau beban kerja volum rendah.
  2. Migrasikan aliran volum tinggi – sebaik sahaja jumlah token secara konsisten melepasi titik pulang modal, pindahkan saluran tersebut ke kluster dalaman.
  3. Kekalkan jaring keselamatan – kekalkan permintaan berkala atau mendadak (bursty) pada API untuk mengelakkan penyediaan berlebihan (over-provisioning) sumber on-prem.

Lakukan pengiraan token secara berkala, kemudian tambahkan kos overhed operasi yang tidak termasuk dalam harga perkakasan mentah. Keputusan berdasarkan gambaran penuh tersebut adalah jauh lebih sukar untuk dipengaruhi oleh mitos.

Kesimpulan

Jika produk AI anda memproses kurang daripada beberapa juta token setiap bulan, laluan yang paling mudah dan murah adalah dengan menggunakan API. Hanya apabila permintaan volum tinggi yang berterusan, pematuhan ketat, atau keperluan kependaman khusus timbul, barulah hos kendiri menjadi berdaya maju dari segi kewangan—dan walaupun begitu, kos tersembunyi kakitangan dan infrastruktur mesti diambil kira sebelum anda mengisytiharkan kemenangan ke atas perkhidmatan awan.