Menjalankan model AI berskala besar kini bukan lagi sekadar pencapaian saintifik, sebaliknya telah menjadi masalah matematik yang mencabar berkaitan bil elektrik dan sewa pusat data. Setiap token yang dijana oleh Gemini melibatkan kos sebenar bagi Google—kitaran silikon, lebar jalur memori, dan watt yang diambil daripada punca kuasa. Apabila volum pertanyaan meningkat, pecahan sen akan terkumpul menjadi jumlah yang boleh menelan keseluruhan margin keuntungan. Desakan senyap itulah yang mendorong Frozen v2, sebuah projek cip pelayan dalaman yang kini sedang dibentuk di dalam Google. Daripada menambah baik Tensor Processing Units (TPU) kegunaan amnya untuk generasi seterusnya, syarikat tersebut sedang mencuba sesuatu yang jauh lebih radikal: mencetak rangka model Gemini secara terus ke dalam silikon itu sendiri.

Daripada Pemecut Fleksibel kepada Silikon Khusus Model

TPU Google telah menjadi tulang belakang infrastrukturnya selama hampir sedekad. Ia melatih model, menggerakkan algoritma kedudukan carian, dan juga disewakan mengikut jam kepada pelanggan awan termasuk Meta dan pihak lain yang mencari alternatif kepada GPU Nvidia. Kepelbagaian fungsi itulah yang menjadikan TPU sebagai sebuah TPU. Ia menggunakan kosa kata umum pendaraban matriks dan pergerakan memori, yang boleh digunakan oleh hampir mana-mana rangkaian neural yang boleh anda huraikan dalam perisian.

Frozen v2 sengaja mengorbankan fleksibiliti tersebut. Cip ini direka sebagai pemecut khusus domain yang litar fizikalnya mencerminkan bahagian seni bina Gemini itu sendiri. Jika TPU mengambil arahan dan mentafsirnya sebagai operasi perisian, Frozen v2 akan membakar pelan struktur model tersebut—susunan lapisan dan laluan datanya—secara terus ke dalam susun atur cip. Google menjangkakan gabungan erat antara model dan logam ini akan menjadikan cip tersebut enam hingga sepuluh kali lebih cekap daripada TPU semasa dalam memberikan respons AI. Langkah pengiraan yang lebih sedikit bagi setiap pertanyaan bermakna masa menunggu token muncul adalah lebih singkat, dan tenaga yang digunakan untuk menjananya juga jauh lebih rendah.

Ini bukan sekadar versi yang lebih pantas bagi idea yang sama. Ia adalah kategori cip yang berbeza, yang mengorbankan sifat umum demi pengkhususan kepada satu keluarga model sahaja.

Mengapa "Frozen" yang Pertama "Cair"

Pendekatan ini berakar umbi daripada konsep terdahulu yang dikaitkan dengan Jeff Dean, Ketua Saintis di Google DeepMind. Cadangan asal "Frozen" mencadangkan pengkhususan yang lebih mendalam dengan melakukan pengekodan keras (hardcoding) bukan sahaja pada seni bina, tetapi juga pada pemberat model (model weights) yang sebenar—berbilion parameter yang dilaraskan yang membentuk tingkah laku Gemini yang dipelajari—secara terus ke dalam cip itu sendiri.

Logiknya adalah kukuh. Jika anda tahu dengan tepat nombor yang akan digunakan oleh model tersebut, mengapa perlu bersusah payah mengambilnya daripada memori luaran? Anda boleh mengukirnya ke dalam transistor dan menghapuskan keseluruhan kategori kelewatan.

Masalahnya ialah kekekalan. Model AI tidak statik. Google mengemas kini Gemini secara berterusan, melatih semula dengan data baharu, melaraskan parameter, dan mengeluarkan versi yang lebih baik. Cip dengan pemberat yang dibekukan dalam silikon akan menjadi sekadar pemberat kertas sebaik sahaja semakan model baharu dikeluarkan. Kekurangan fleksibiliti itulah yang mematikan konsep asal tersebut.

Seni Bina Tanpa Sauh

Frozen v2 menyelesaikan perangkap usang dengan melakukan pengekodan keras pada seni bina sambil membiarkan pemberatnya bebas untuk berubah. Bayangkan ia seperti membina litar lumba tersuai dan bukannya mengimpal kereta pada jalan raya. Bentuk litar kekal tetap, dioptimumkan untuk corak pengiraan khusus Gemini, tetapi kandungan yang mengalir melalui litar tersebut boleh diperbaharui dengan memuatkan pemberat baharu daripada memori.

Perbezaan ini penting dalam praktiknya. Apabila jurutera melatih titik semakan (checkpoint) Gemini yang baharu, mereka boleh melaksanakannya pada perkakasan Frozen v2 tanpa perlu menghasilkan cip baharu. Tahap pengekodan keras yang tepat masih menjadi persoalan terbuka di dalam Google; pasukan mesti memutuskan dengan tepat elemen struktur mana yang layak mendapat "keabadian silikon" dan mana yang harus kekal boleh dikonfigurasi. Namun, prinsipnya telah ditetapkan. Dengan membekukan bentuk dan menukar parameter secara lancar, Google mengekalkan kelebihan kecekapan tanpa mengorbankan keupayaan untuk melakukan iterasi.

Ekonomi Mengekalkannya Secara Dalaman

Terdapat satu lagi sebab mengapa anda tidak akan melihat Frozen v2 disenaraikan dalam helaian harga Google Cloud. Oleh kerana cip ini dibentuk dengan begitu rapat mengikut komponen dalaman Gemini, ia tidak akan memberi manfaat kepada pembangun luar yang menjalankan PyTorch atau varian Transformer tersuai. Google tidak mempunyai rancangan untuk menjualnya sebagai produk kegunaan am. Ia akan kekal sebagai alat dalaman, yang ditujukan khusus untuk memenuhi permintaan yang amat tinggi bagi kapasiti inferens di dalam pusat data Google sendiri.

Pilihan itu mencerminkan realiti ekonomi yang nyata. Dalam pasaran AI generatif semasa, keupayaan model sedang menyatu dengan pantas. Jurang antara pesaing sering kali bergantung kepada siapa yang mampu menjalankan model terbesar pada kos terendah bagi setiap token. Inferens bukan lagi sekadar perkara sampingan selepas latihan; bagi produk yang digunakan secara meluas seperti Gemini, ia merupakan perbelanjaan utama. Jika Frozen v2 mengurangkan perbelanjaan tersebut sebanyak enam kali ganda atau lebih, Google akan memperoleh ruang kelebihan yang sukar ditandingi oleh pesaing. Ia boleh menyimpan penjimatan tersebut sebagai margin keuntungan atau menyalurkannya dalam bentuk harga yang lebih rendah untuk pengguna API dan integrasi produk, sekali gus memberi tekanan kepada OpenAI, Anthropic, dan lain-lain.

Apa Yang Ini Isyaratkan kepada Industri

Langkah Google juga memberi petunjuk tentang hala tuju strategi perkakasan yang lebih luas. Selama bertahun-tahun, strategi standard adalah untuk membina pemecut (accelerator) yang paling fleksibel yang mungkin dan membiarkan perisian mengendalikan pengkhususan. GPU Nvidia mendominasi kerana ia mampu menjalankan segalanya, daripada dinamik molekul hingga ke permainan video dan model bahasa besar. TPU milik Google sendiri dicipta dengan semangat kegunaan yang luas yang sama.

Frozen v2 memecah tradisi tersebut. Ia merupakan satu pengakuan bahawa apabila satu keluarga model memacu volum pertanyaan yang mencukupi, silikon tersuai yang disesuaikan dengan model tersebut boleh memberikan pulangan berkali-kali ganda. Pengendali skala besar (hyperscalers) lain telah mengikuti logik yang sama—seperti cip Trainium dan Inferentia milik Amazon, sebagai contoh—tetapi pendekatan Google adalah lebih mendalam dengan mereka bentuk perkakasan bersama (co-designing) berdasarkan seni bina model tertentu dan bukannya kelas rangkaian umum.

Risikonya, sudah tentu, adalah kekakuan. Jika seni bina Gemini berkembang ke arah yang tidak dapat ditampung oleh litar yang telah ditetapkan (hardcoded), Google mungkin akan mendapati dirinya memiliki silikon mahal yang tidak dapat menjalankan idea terbaharunya. Itulah sebabnya mengapa kompromi "seni bina sahaja" (architecture-only) itu penting. Ia menawarkan jalan tengah: pengkhususan yang mencukupi untuk mencapai peningkatan kecekapan yang drastik, serta fleksibiliti yang mencukupi untuk mengelakkan syarikat daripada terperangkap dalam situasi yang sukar.

Intipati Sebenar

Frozen v2 paling tepat difahami bukan sebagai pengumuman cip, tetapi sebagai pertaruhan strategik terhadap bentuk persaingan AI pada masa hadapan. Google bertaruh bahawa pemenang bukan sekadar membina model terbaik, tetapi akan memiliki keseluruhan lapisan (stack)—daripada pelan biru model sehinggalah kepada elektron yang mengalir melalui transistor. Jika projek ini berjaya, hasilnya tidak akan kelihatan dalam skor penanda aras (benchmark). Ia akan kelihatan dalam kolum kos laporan pendapatan suku tahunan, di mana penjimatan beberapa sen bagi setiap satu juta token boleh melakar semula sempadan tentang apa yang mungkin secara komersial dalam AI generatif.