Menjalankan model AI skala besar kini bukan lagi sekadar pencapaian ilmiah, melainkan masalah matematika yang brutal tentang tagihan listrik dan biaya sewa pusat data. Setiap token yang dihasilkan Gemini memakan biaya nyata bagi Google—siklus silikon, bandwidth memori, dan daya watt yang diambil dari sumber listrik. Seiring bertambahnya volume kueri, pecahan sen pun akan terakumulasi menjadi jumlah yang dapat melahap seluruh margin keuntungan. Urgensi yang sunyi inilah yang melatarbelakangi Frozen v2, sebuah proyek chip server internal yang kini mulai terbentuk di dalam Google. Alih-alih sekadar menyempurnakan Tensor Processing Units (TPU) serbaguna untuk generasi berikutnya, perusahaan ini mencoba sesuatu yang jauh lebih radikal: mencetak kerangka model Gemini langsung ke dalam silikon itu sendiri.

Dari Akselerator Fleksibel ke Silikon Khusus Model

TPU Google telah menjadi tulang punggung infrastrukturnya selama hampir satu dekade. TPU ini melatih model, menggerakkan algoritma peringkat pencarian, dan bahkan disewakan per jam kepada pelanggan cloud termasuk Meta dan pihak lain yang mencari alternatif bagi GPU Nvidia. Fleksibilitas itulah yang membuat sebuah TPU disebut TPU. Ia menggunakan kosakata umum perkalian matriks dan pergerakan memori, yang dapat digunakan oleh hampir semua jaringan saraf (neural network) yang dapat Anda deskripsikan dalam perangkat lunak.

Frozen v2 sengaja mengorbankan fleksibilitas tersebut. Chip ini dirancang sebagai akselerator khusus domain (domain-specific accelerator) yang sirkuitnya secara fisik mencerminkan bagian-bagian dari arsitektur Gemini itu sendiri. Jika TPU mengambil instruksi dan menafsirkannya sebagai operasi perangkat lunak, Frozen v2 akan membakar cetak biru struktural model tersebut—pengaturan lapisan dan jalur datanya—langsung ke dalam tata letak chip. Google memperkirakan perpaduan erat antara model dan logam ini akan membuat chip tersebut enam hingga sepuluh kali lebih efisien daripada TPU saat ini dalam melayani respons AI. Lebih sedikit langkah komputasi per kueri berarti lebih sedikit waktu menunggu token muncul, dan jauh lebih sedikit energi yang dihabiskan untuk menghasilkannya.

Ini bukan sekadar versi yang lebih cepat dari ide yang sama. Ini adalah kategori chip yang berbeda, yang menukar sifat umum dengan dedikasi penuh pada satu keluarga model saja.

Mengapa "Frozen" Pertama Meleleh

Pendekatan ini berakar pada konsep awal yang dikaitkan dengan Jeff Dean, Chief Scientist di Google DeepMind. Proposal "Frozen" yang asli menyarankan spesialisasi yang lebih jauh dengan melakukan hardcoding tidak hanya pada arsitekturnya, tetapi juga pada bobot model yang sebenarnya—miliaran parameter yang telah disetel yang membentuk perilaku Gemini yang dipelajari—langsung ke dalam chip itu sendiri.

Logikanya masuk akal. Jika Anda tahu persis angka mana yang akan digunakan model, mengapa repot-repot mengambilnya dari memori eksternal? Anda dapat mengukirnya ke dalam transistor dan menghilangkan seluruh kategori penundaan (delay).

Masalahnya adalah permanensi. Model AI tidak pernah diam. Google memperbarui Gemini secara terus-menerus, melatih ulang dengan data baru, menyesuaikan parameter, dan merilis versi yang lebih baik. Chip dengan bobot yang membeku dalam silikon akan menjadi sekadar pemberat kertas (paperweight) saat revisi model baru dirilis. Kurangnya fleksibilitas itulah yang mematikan konsep aslinya.

Arsitektur Tanpa Jangkar

Frozen v2 mengatasi jebakan usang dengan melakukan hardcoding pada arsitekturnya sambil membiarkan bobotnya bebas berubah. Bayangkan seperti membangun lintasan balap khusus alih-alih mengelas mobil ke jalanan. Bentuk sirkuit tetap tetap, dioptimalkan untuk pola komputasi spesifik Gemini, tetapi konten yang mengalir melalui sirkuit tersebut dapat diperbarui dengan memuat bobot baru dari memori.

Perbedaan ini sangat penting dalam praktiknya. Ketika para insinyur melatih checkpoint Gemini yang baru, mereka dapat menerapkannya ke perangkat keras Frozen v2 tanpa harus memproduksi chip baru. Tingkat hardcoding yang tepat masih menjadi pertanyaan terbuka di dalam Google; tim harus memutuskan secara tepat elemen struktural mana yang layak mendapatkan keabadian silikon dan mana yang harus tetap dapat dikonfigurasi. Namun, prinsipnya sudah ditetapkan. Dengan membekukan bentuknya dan menukar parameter secara cair, Google mempertahankan keunggulan efisiensi tanpa mengorbankan kemampuan untuk melakukan iterasi.

Ekonomi Menjaganya Tetap di Dalam Perusahaan

Ada alasan lain mengapa Anda tidak akan melihat Frozen v2 tercantum dalam daftar harga Google Cloud. Karena chip ini dibentuk sedemikian rupa mengikuti bagian internal Gemini, chip ini tidak akan masuk akal bagi pengembang luar yang menjalankan PyTorch atau varian Transformer khusus. Google tidak memiliki rencana untuk menjualnya sebagai produk serbaguna. Chip ini akan tetap menjadi alat internal, yang ditujukan khusus untuk memenuhi permintaan kapasitas inferensi yang sangat besar di dalam pusat data Google sendiri.

Pilihan tersebut mencerminkan realitas ekonomi yang gamblang. Di pasar AI generatif saat ini, kemampuan model sedang menyatu dengan cepat. Kesenjangan antar kompetitor sering kali ditentukan oleh siapa yang mampu menjalankan model terbesar dengan biaya per token terendah. Inferensi bukan lagi sekadar pemikiran tambahan setelah pelatihan; untuk produk yang digunakan secara luas seperti Gemini, ini adalah pengeluaran yang dominan. Jika Frozen v2 memangkas pengeluaran tersebut sebanyak enam kali lipat atau lebih, Google akan mendapatkan ruang gerak yang tidak mudah ditandingi oleh kompetitor. Google dapat menyimpan penghematan tersebut sebagai margin atau meneruskannya dalam bentuk harga yang lebih rendah bagi konsumen API dan integrasi produk, sehingga memberikan tekanan lebih besar pada OpenAI, Anthropic, dan lainnya.

Apa Sinyal yang Diberikan bagi Industri Ini

Langkah Google juga mengisyaratkan ke mana arah strategi perangkat keras yang lebih luas. Selama bertahun-tahun, strategi standar adalah membangun akselerator sefleksibel mungkin dan membiarkan perangkat lunak menangani spesialisasi. GPU Nvidia mendominasi karena mereka dapat menjalankan segalanya, mulai dari dinamika molekuler hingga video game hingga model bahasa besar. TPU milik Google sendiri dirancang dengan semangat kegunaan yang luas yang sama.

Frozen v2 mendobrak tradisi tersebut. Ini adalah pengakuan bahwa ketika satu keluarga model mendorong volume kueri yang cukup besar, silikon khusus yang disesuaikan dengan model tersebut dapat memberikan keuntungan berkali-kali lipat. Hyperscaler lain telah mengejar logika serupa—chip Trainium dan Inferentia milik Amazon, misalnya—tetapi pendekatan Google melangkah lebih jauh dengan merancang perangkat keras secara bersamaan (co-designing) di sekitar arsitektur model tertentu, bukan sekadar kelas jaringan umum.

Risikonya, tentu saja, adalah kekakuan. Jika arsitektur Gemini berevolusi ke arah yang tidak dapat diakomodasi oleh sirkuit yang telah diprogram secara keras, Google bisa mendapati dirinya memiliki silikon mahal yang tidak dapat menjalankan ide-ide terbarunya. Itulah alasan mengapa kompromi "hanya arsitektur" menjadi penting. Ini menawarkan jalan tengah: spesialisasi yang cukup untuk menangkap peningkatan efisiensi yang dramatis, namun fleksibilitas yang cukup untuk menghindari situasi yang menyudutkan perusahaan.

Kesimpulan Utamanya

Frozen v2 paling tepat dipahami bukan sebagai pengumuman chip, melainkan sebagai taruhan strategis pada bentuk persaingan AI di masa depan. Google bertaruh bahwa pemenangnya bukan sekadar membangun model terbaik, tetapi akan memiliki seluruh tumpukan (stack)—mulai dari cetak biru model hingga elektron yang mengalir melalui transistor. Jika proyek ini berhasil, hasilnya tidak akan terlihat dalam skor benchmark. Hasilnya akan terlihat di kolom biaya dalam laporan laba rugi kuartalan, di mana penghematan beberapa sen per satu juta token dapat menggambar ulang batasan tentang apa yang mungkin secara komersial dalam AI generatif.