DeepMind telah memperkenalkan DiffusionGemma minggu ini, sebuah model bahasa pemberat terbuka (open-weight) yang boleh menjana kira-kira 1,500 token sesaat pada satu GPU H100 tunggal, manakala model standard Gemma 4 mencapai tahap maksimum hampir 303 token sesaat. Peningkatan kelajuan ini penting kerana ia dapat mengurangkan kekangan kependaman (latency bottleneck) yang melambatkan ejen dipacu AI dalam aplikasi masa nyata.

Bagaimana DiffusionGemma memecahkan tabiat token-demi-token

Kebanyakan model bahasa moden menjana teks secara autoregresif: mereka meramalkan satu token, memasukkannya semula ke dalam model, kemudian meramalkan token seterusnya. Gelung "kiri-ke-kanan" tersebut memaksa kaitan erat antara pengkomputeran dan memori, kerana pemberat (weights) model mesti diakses untuk setiap satu token. DiffusionGemma menggantikan gelung tersebut dengan proses difusi diskret yang menganggap satu kelompok 256-token sebagai satu blok data bising tunggal. Model tersebut kemudiannya melakukan proses nyah-hingar (denoises) pada keseluruhan blok secara selari, mengalihkan beban kerja daripada pencarian pemberat yang berulang kepada jumlah pengkomputeran yang lebih besar bagi setiap langkah. Pada perkakasan yang cemerlang dalam matematik selari, seperti Nvidia H100, pertukaran (trade-off) ini membuahkan hasil.

Mengapa kelajuan penting untuk ejen AI

Ejen autonomi biasanya menjalankan kitaran carian, ringkasan, dan ujian. Setiap langkah mungkin melibatkan beberapa panggilan model, jadi sebarang kependaman bagi setiap token akan meningkat dengan cepat. Apabila model terhenti, keseluruhan saluran paip (pipeline) ejen akan tersumbat, sekali gus meningkatkan kos dan menjejaskan pengalaman pengguna.

Pertukaran prestasi

Kelajuan DiffusionGemma datang dengan kos yang boleh diukur dalam keupayaan mentah. Dalam penanda aras AIME—satu set ujian yang mengukur penaakulan, faktualiti, dan pemahaman bahasa—DiffusionGemma mencatatkan skor 69.1, manakala Gemma 4 mencapai 88.3. Pendekatan difusi juga menunjukkan kelemahan pada output yang sangat pendek dan "gagap" token sekali-sekala, di mana teks yang dijana berulang atau teragak-agak. Apabila lebih daripada kira-kira 32 pengguna membuat pertanyaan kepada model secara serentak, kelebihan selari tersebut akan terhakis dan kaedah autoregresif standard akan mengejar dari segi keseluruhan daya pemprosesan (throughput).

Di mana setiap pendekatan sesuai digunakan

Data menunjukkan strategi penggunaan hibrid:

  • Model difusi untuk tugas dengan konkurensi rendah dan sensitif terhadap kependaman yang tidak memerlukan penaakulan mendalam—contohnya, menjana prom yang pendek, mengisi templat, atau menghasilkan draf teks.
  • Model autoregresif untuk beban kerja dengan konkurensi tinggi, penaakulan kompleks, atau penjanaan bentuk panjang di mana ketepatan lebih penting daripada kelajuan mentah.

Apa yang tersirat daripada peralihan ini untuk infrastruktur AI

Jika peningkatan kelajuan boleh diperoleh dengan memikirkan semula algoritma penjanaan dan bukannya sekadar menskalakan saiz model, kemenangan kecekapan terbesar mungkin datang daripada penambahbaikan "perpaipan" (plumbing). Pertukaran ini juga bermakna pembangun mesti menerima sedikit penurunan kualiti untuk kes penggunaan tertentu.

Hujah balas: adakah difusi sudah bersedia untuk kegunaan utama?

Implementasi difusi bergelut dengan prom yang pendek dan boleh menghasilkan output yang tidak stabil.

Apa yang perlu diperhatikan seterusnya

  • Kajian penskalaan: Adakah model difusi yang lebih besar akan merapatkan jurang keupayaan sambil mengekalkan kelajuan?
  • Pengoptimuman perkakasan: Apabila GPU berkembang, keseimbangan antara langkah difusi yang berat pengkomputeran dan autoregresi yang berat pemberat boleh berubah lagi.
  • Algoritma penghalaan (routing): Prototaip awal penghala model yang peka terhadap tugas akan mendedahkan sejauh mana kependaman sistem keseluruhan dapat dikurangkan melalui pemilihan dinamik.

Kesimpulan

DiffusionGemma membuktikan bahawa memikirkan semula gelung penjanaan asas dapat memangkas kependaman tanpa menambah lebih banyak cip. Teknologi ini bukanlah pengganti menyeluruh bagi model autoregresif, tetapi ia menawarkan alat yang menarik untuk timbunan (stack) AI hibrid di mana kelajuan dan ketepatan diseimbangkan berdasarkan setiap tugas. Gelombang infrastruktur AI seterusnya berkemungkinan besar tidak hanya dinilai berdasarkan saiz model, tetapi sejauh mana ia menghalakan kerja dengan bijak melalui jenis enjin yang betul.