DeepMind imezindua DiffusionGemma wiki hii, modeli ya lugha ya open-weight inayoweza kuzalisha takriban tokeni 1,500 kwa sekunde kwenye GPU moja ya H100, wakati modeli ya kawaida ya Gemma 4 hufikia juu ya tokeni 303 kwa sekunde. Ongezeko hili la kasi ni muhimu kwa sababu linaweza kupunguza kizuizi cha ucheleweshaji (latency bottleneck) kinachochelewesha wakala wanaoendeshwa na AI katika programu za wakati halisi (real-time applications).
Jinsi DiffusionGemma inavyovunja tabia ya kutengeneza tokeni moja baada ya nyingine
Modeli nyingi za kisasa za lugha huzalisha maandishi kwa njia ya autoregressive: hutabiri tokeni moja, huirudisha kwenye modeli, kisha hutabiri inayofuata. Mzunguko huo wa "kutoka kushoto kwenda kulia" unalazimisha uhusiano wa karibu kati ya hesabu (compute) na kumbukumbu (memory), kwa sababu uzito wa modeli (weights) lazima upatikane kwa kila tokeni moja. DiffusionGemma inachukua nafasi ya mzunguko huo kwa mchakato wa diffusion wa kidisiti (discrete diffusion process) unaochukulia kipande cha tokeni 256 kama kizuizi kimoja cha data yenye kelele (noisy data). Kisha modeli hiyo huondoa kelele (denoises) kwenye kizuizi kizima kwa njia ya sambamba (in parallel), ikihamisha mzigo wa kazi kutoka kwenye utafutaji wa uzito unaojirudia kwenda kwenye kiasi kikubwa zaidi cha hesabu (compute) kwa kila hatua. Kwenye vifaa vinavyofanya vizuri katika hesabu za sambamba, kama Nvidia H100, mabadiliko haya unufaika.
Kwa nini kasi ni muhimu kwa wakala wa AI
Wakala huru (autonomous agents) kwa kawaida hufanya mzunguko wa kutafuta, kufupisha, na kufanya majaribio. Kila hatua inaweza kuhusisha mialiko kadhaa ya modeli, hivyo ucheleweshaji wowote wa kila tokeni huongezeka haraka. Modeli inapokwama, mchakato mzima wa wakala unakwama, jambo linaloongeza gharama na kudhoofisha uzoefu wa mtumiaji.
Mabadiliko ya utendaji (The performance trade-off)
Kasi ya DiffusionGemma inakuja na gharama inayoweza kupimika katika uwezo wa asili. Katika kipimo cha AIME—mkusanyiko unaopima mantiki, ukweli, na uelewa wa lugha—DiffusionGemma inapata alama 69.1, wakati Gemma 4 inafikia 88.3. Mbinu ya diffusion pia inaonyesha udhaifu katika matokeo mafupi sana na "kugugumia" (stuttering) kwa tokeni mara kwa mara, ambapo maandishi yanayozalishwa hujirudia au kusita. Wakati watumiaji zaidi ya takriban 32 wanapouliza modeli kwa wakati mmoja, faida ya sambamba hupotea na njia ya kawaida ya autoregressive inafikia kiwango sawa cha ufanisi (throughput).
Wapi kila mbinu inafaa
Data inaonyesha mkakati wa utumiaji mchanganyiko:
- Modeli za diffusion kwa kazi zenye ushindani mdogo (low-concurrency) na zinazohitaji kasi (latency-sensitive) ambazo hazihitaji mantiki ya kina—kwa mfano, kutengeneza maelekezo (prompts) mafupi, kujaza vigezo (templates), au kuandaa rasimu ya maandishi.
- Modeli za autoregressive kwa kazi zenye ushindani mkubwa (high-concurrency), mantiki tata, au uzalishaji wa maandishi marefu ambapo usahihi ni muhimu kuliko kasi ya asili.
Nini mabadiliko haya yanamaanisha kwa miundombinu ya AI
Ikiwa faida za kasi zinaweza kupatikana kwa kufikiria upya algoriti ya uzalishaji badala ya kuongeza tu ukubwa wa modeli, ushindi mkubwa wa ufanisi unaweza kutoka kwenye maboresho ya "plumbing" (miundombinu ya ndani). Mabadiliko haya pia yanamaanisha kuwa watengenezaji lazima wakubali kushuka kidogo kwa ubora kwa matumizi fulani.
Hoja kinyume: je, diffusion iko tayari kwa matumizi makubwa?
Utekelezaji wa diffusion unakabiliwa na changamoto na maelekezo (prompts) mafupi na unaweza kutoa matokeo yenye kutetemeka (jittery output).
Nini cha kufuatilia baadaye
- Utafiti wa upanuzi (Scaling studies): Je, modeli kubwa zaidi za diffusion zitaziba pengo la uwezo huku zikihifadhi kasi?
- Uboreshaji wa vifaa (Hardware optimizations): Kadiri GPU zinavyobadilika, uwiano kati ya hatua za diffusion zinazohitaji hesabu nyingi na autoregression inayohitaji uzito mkubwa unaweza kubadilika tena.
- Algoriti za uelekezaji (Routing algorithms): Mifano ya awali ya viongozi wa modeli (model routers) wanaozingatia kazi itaonyesha ni kiasi gani ucheleweshaji wa mfumo mzima unaweza kupunguzwa kwa uteuzi wa kidinamiki.
Hitimisho
DiffusionGemma inathibitisha kuwa kufikiria upya mzunguko wa msingi wa uzalishaji kunaweza kupunguza ucheleweshaji (latency) bila kuongeza chips zaidi. Teknolojia hii si mbadala kamili wa modeli za autoregressive, lakini inatoa chombo chenye nguvu kwa mfumo mchanganyiko wa AI (hybrid AI stack) ambapo kasi na usahihi vinadhibitiwa kulingana na kazi. Wimbi linalofuata la miundombinu ya AI huenda lisihukumiwe tu kwa ukubwa wa modeli, bali kwa jinsi inavyoelekeza kazi kwa akili kupitia aina sahihi ya injini.
