DeepMind meluncurkan DiffusionGemma minggu ini, sebuah model bahasa open-weight yang dapat menghasilkan sekitar 1.500 token per detik pada satu GPU H100, sementara model standar Gemma 4 mencapai puncaknya di dekat 303 token per detik. Peningkatan kecepatan ini sangat penting karena dapat memperkecil hambatan latensi yang memperlambat agen berbasis AI dalam aplikasi waktu nyata (real-time).

Bagaimana DiffusionGemma mematahkan kebiasaan token-per-token

Sebagian besar model bahasa modern menghasilkan teks secara autoregresif: mereka memprediksi satu token, memasukkannya kembali ke dalam model, lalu memprediksi token berikutnya. Loop "kiri-ke-kanan" tersebut memaksa keterkaitan erat antara komputasi dan memori, karena bobot (weights) model harus diakses untuk setiap token. DiffusionGemma menggantikan loop tersebut dengan proses difusi diskrit yang memperlakukan potongan (chunk) 256 token sebagai satu blok data berisik (noisy data). Model tersebut kemudian melakukan denoising pada seluruh blok secara paralel, mengalihkan beban kerja dari pencarian bobot yang berulang ke jumlah komputasi yang lebih besar per langkah. Pada perangkat keras yang unggul dalam matematika paralel, seperti Nvidia H100, pertukaran (trade-off) ini membuahkan hasil.

Mengapa kecepatan penting bagi agen AI

Agen otonom biasanya menjalankan siklus pencarian, peringkasan, dan pengujian. Setiap langkah mungkin melibatkan beberapa pemanggilan model, sehingga latensi per token akan menumpuk dengan cepat. Ketika sebuah model terhenti, seluruh pipeline agen akan mengalami penumpukan, yang meningkatkan biaya dan menurunkan pengalaman pengguna.

Kompromi performa

Kecepatan DiffusionGemma datang dengan biaya yang terukur dalam hal kemampuan murni. Dalam benchmark AIME—sebuah rangkaian pengujian yang mengukur penalaran, faktualitas, dan pemahaman bahasa—DiffusionGemma mencetak skor 69,1, sementara Gemma 4 mencapai 88,3. Pendekatan difusi juga menunjukkan kelemahan pada output yang sangat pendek dan sesekali terjadi "stuttering" token, di mana teks yang dihasilkan berulang atau ragu-ragu. Ketika lebih dari sekitar 32 pengguna melakukan kueri ke model secara bersamaan, keuntungan paralel tersebut terkikis dan metode autoregresif standar akan mengejar dalam hal throughput keseluruhan.

Di mana setiap pendekatan cocok digunakan

Data menunjukkan strategi penerapan hibrida:

  • Model difusi untuk tugas dengan konkurensi rendah dan sensitif terhadap latensi yang tidak menuntut penalaran mendalam—misalnya, menghasilkan prompt pendek, mengisi templat, atau menghasilkan draf teks.
  • Model autoregresif untuk beban kerja dengan konkurensi tinggi, penalaran kompleks, atau pembuatan teks panjang di mana akurasi lebih penting daripada kecepatan murni.

Apa implikasi pergeseran ini bagi infrastruktur AI

Jika peningkatan kecepatan dapat diperoleh dengan memikirkan kembali algoritma generasi alih-alih sekadar memperbesar ukuran model, maka kemenangan efisiensi terbesar mungkin datang dari perbaikan "plumbing" (infrastruktur dasar). Kompromi ini juga berarti pengembang harus menerima sedikit penurunan kualitas untuk kasus penggunaan tertentu.

Sanggahan: apakah difusi siap untuk penggunaan luas?

Implementasi difusi kesulitan dengan prompt pendek dan dapat menghasilkan output yang tidak stabil (jittery).

Apa yang perlu diperhatikan selanjutnya

  • Studi penskalaan: Akankah model difusi yang lebih besar dapat menutup celah kemampuan sambil tetap mempertahankan kecepatan?
  • Optimasi perangkat keras: Seiring berkembangnya GPU, keseimbangan antara langkah difusi yang berat komputasi dan autoregresi yang berat bobot dapat bergeser kembali.
  • Algoritma perutean (routing): Prototipe awal dari model router yang sadar tugas (task-aware) akan mengungkap seberapa banyak latensi sistem secara keseluruhan dapat dipangkas melalui pemilihan dinamis.

Poin Utama

DiffusionGemma membuktikan bahwa memikirkan kembali loop generasi fundamental dapat memangkas latensi tanpa menambah lebih banyak chip. Teknologi ini bukanlah pengganti menyeluruh untuk model autoregresif, melainkan menawarkan alat yang menarik untuk stack AI hibrida di mana kecepatan dan akurasi diseimbangkan berdasarkan tugas. Gelombang infrastruktur AI berikutnya kemungkinan besar tidak hanya akan dinilai dari ukuran model, tetapi dari seberapa cerdik ia merutekan pekerjaan melalui jenis mesin yang tepat.