Mengapa model baharu terasa lebih “berat”

Google membina Gemini 3.8 Flash untuk ejen autonomi yang perlu berfikir melalui beberapa peringkat. Tidak seperti Gemini 3.7 Flash, yang biasanya menjawab dalam satu fasa, 3.8 memecahkan masalah kepada sub-soalan, memanggil API luaran, dan melakukan iterasi sehingga ia berpuas hati. Google memberi amaran bahawa kerja mental tambahan ini menggunakan lebih banyak token, terutamanya pada tetapan “usaha” yang lebih tinggi.

Analisis bebas menunjukkan token output bagi setiap tugasan meningkat kira-kira 30 % berbanding 3.7 Flash, dan pusingan interaksi juga meningkat. Oleh kerana yuran bagi setiap token kekal sama, kos efektif meningkat kira-kira 40 % untuk banyak beban kerja dunia nyata.

Penanda aras yang penting bagi pembangun

Pertukaran ini bukan sekadar teori akademik. Dalam ujian perbandingan terus pada penanda aras kejuruteraan perisian DeepSWE v1.1, Gemini 3.8 Flash menewaskan Fable 5 milik Anthropic secara meyakinkan. Model ini juga menduduki tempat teratas dalam penanda aras Vals Finance Agent V2 dan Harvey’s Legal Agent, membuktikan ia mampu mengendalikan pengiraan kewangan yang kompleks dan penaakulan undang-undang yang bernuansa.

John Ennis, CEO Aigora.ai, merumuskan kelebihannya: model ini memberikan “kualiti pengekodan Opus 5” sambil beroperasi pada sebahagian kecil kos dan kelajuan yang jauh lebih tinggi. Beliau memetik kes penggunaan seperti menjana video Remotion, di mana inferens pantas dan penjanaan kod yang canggih dapat menjimatkan masa berjam-jam dalam saluran paip pengeluaran.

Ekonomi AI yang berubah

Pembangun dahulunya menilai kemampuan milik berdasarkan harga-setiap-token. Ejen pelbagai pusingan yang dipertingkatkan dengan alatan mengubah metrik tersebut kepada harga-setiap-tugasan-berjaya. Dengan Gemini 3.8 Flash, harga token yang lebih murah tidak lagi menjamin bil yang lebih murah jika model tersebut menggunakan lebih banyak token untuk mencapai hasil yang sama.

Google meletakkan model ini di antara model perintis yang sangat mahal dan penjana pusingan tunggal yang ringan. Dengan menjenamakannya sebagai “intelligence-on-demand,” syarikat tersebut memberi isyarat bahawa pembangun boleh memanfaatkan kuasa penaakulan yang lebih tinggi tanpa kependaman yang biasanya datang dengan model yang lebih besar dan lebih perlahan. Pertukarannya jelas: output yang lebih canggih bermakna jumlah token keseluruhan yang lebih tinggi.

Bilakah perlu kekal dengan versi lama

Pasukan yang memerlukan jangkaan kos yang ketat—terutamanya mereka yang menjalankan kerja kelompok berskala besar atau beroperasi dengan margin yang kecil—sepatutnya kekal dengan Gemini 3.7 Flash. Model lama tersebut masih menawarkan kependaman rendah dan penggunaan token yang stabil, menjadikan perbelanjaan bulanan lebih mudah diramal.

Apa yang perlu diperhatikan seterusnya

  • Harga panggilan alatan:

Kesimpulan

Gemini 3.8 Flash menunjukkan bahawa penaakulan yang lebih tinggi boleh dicapai dengan kependaman tahap flash, tetapi ia menggunakan lebih banyak token bagi setiap interaksi. Pembangun yang membina ejen AI pelbagai langkah yang canggih akan mendapati peningkatan prestasi ini sangat menarik, namun mereka mesti melaraskan belanjawan untuk menampung kos token tersembunyi. Bagi orang lain, 3.7 Flash yang lama kekal sebagai pilihan yang lebih selamat dan lebih mudah diramal.