DeepMind એ આ અઠવાડિયે DiffusionGemma રજૂ કર્યું છે, જે એક ઓપન-વેઇટ લેંગ્વેજ મોડલ છે જે સિંગલ H100 GPU પર સેકન્ડ દીઠ અંદાજે 1,500 ટોકન્સ જનરેટ કરી શકે છે, જ્યારે સ્ટાન્ડર્ડ Gemma 4 મોડલ સેકન્ડ દીઠ આશરે 303 ટોકન્સ સુધી પહોંચે છે. આ સ્પીડમાં વધારો મહત્વનો છે કારણ કે તે રિયલ-ટાઇમ એપ્લિકેશન્સમાં AI-સંચાલિત એજન્ટોને ધીમા પાડતા લેટન્સી બોટલનેક (latency bottleneck) ને ઘટાડી શકે છે.

DiffusionGemma કેવી રીતે ટોકન-બાય-ટોકન પદ્ધતિને તોડે છે

મોટાભાગના આધુનિક લેંગ્વેજ મોડલ્સ ઓટોરીગ્રેસિવલી (autoregressively) ટેક્સ્ટ જનરેટ કરે છે: તેઓ એક ટોકનનું અનુમાન લગાવે છે, તેને મોડલમાં પાછું ફીડ કરે છે, અને પછી પછીના ટોકનનું અનુમાન લગાવે છે. આ "ડાબેથી-જમણે" (left-to-right) લૂપ કમ્પ્યુટ અને મેમરી વચ્ચે ગાઢ જોડાણ બનાવે છે, કારણ કે દરેક સિંગલ ટોકન માટે મોડલના વેઇટ્સ (weights) એક્સેસ કરવા પડે છે. DiffusionGemma આ લૂપને એક ડિસ્ક્રીટ ડિફ્યુઝન પ્રક્રિયા (discrete diffusion process) થી બદલે છે જે 256-ટોકનનો ચંક (chunk) એક સિંગલ નોઈઝી ડેટા બ્લોક તરીકે ગણે છે. ત્યારબાદ મોડલ આખા બ્લોકને સમાંતર (parallel) રીતે ડિનોઈઝ (denoise) કરે છે, જેનાથી વર્કલોડ વારંવાર વેઇટ લુકઅપ કરવાને બદલે દરેક સ્ટેપ દીઠ વધુ કમ્પ્યુટિંગ તરફ વળે છે. Nvidia ના H100 જેવા હાર્ડવેર પર, જે પેરેલલ મેથ્સ (parallel math) માં શ્રેષ્ઠ છે, ત્યાં આ બદલાવ ફાયદાકારક સાબિત થાય છે.

AI એજન્ટ્સ માટે સ્પીડ શા માટે મહત્વની છે

ઓટોનોમસ એજન્ટ્સ સામાન્ય રીતે સર્ચિંગ, સમરાઇઝિંગ અને ટેસ્ટિંગનું ચક્ર ચલાવે છે. દરેક સ્ટેપમાં મોડલના અનેક કોલ્સ સામેલ હોઈ શકે છે, તેથી પ્રતિ-ટોકન લેટન્સી (per-token latency) ઝડપથી વધતી જાય છે. જ્યારે મોડલ અટકી જાય છે, ત્યારે આખી એજન્ટ પાઇપલાઇન ધીમી પડી જાય છે, જેનાથી ખર્ચ વધે છે અને યુઝર એક્સપિરિયન્સ બગડે છે.

પરફોર્મન્સ ટ્રેડ-ઓફ

DiffusionGemma ની સ્પીડ કાચી ક્ષમતામાં (raw capability) માપી શકાય તેવા ખર્ચ સાથે આવે છે. AIME બેન્ચમાર્ક—જે રીઝનિંગ, ફેક્ટ્યુઆલિટી અને લેંગ્વેજ અન્ડરસ્ટેન્ડિંગને માપે છે—તેમાં DiffusionGemma 69.1 સ્કોર કરે છે, જ્યારે Gemma 4 88.3 સુધી પહોંચે છે. ડિફ્યુઝન અભિગમ ખૂબ ટૂંકા આઉટપુટમાં નબળાઈ પણ દર્શાવે છે અને ક્યારેક ટોકન "સ્ટટરિંગ" (stuttering) જોવા મળે છે, જ્યાં જનરેટ થયેલ ટેક્સ્ટ પુનરાવર્તિત થાય છે અથવા અટકે છે. જ્યારે એકસાથે આશરે 32 થી વધુ યુઝર્સ મોડલને ક્વેરી કરે છે, ત્યારે પેરેલલ ફાયદો ઘટી જાય છે અને સ્ટાન્ડર્ડ ઓટોરીગ્રેસિવ પદ્ધતિ કુલ થ્રુપુટમાં તેની બરાબરી કરી લે છે.

દરેક અભિગમ ક્યાં સુસંગત છે

ડેટા એક હાઇબ્રિડ ડિપ્લોયમેન્ટ વ્યૂહરચના સૂચવે છે:

  • ડિફ્યુઝન મોડલ્સ: લો-કન્કરન્સી (low-concurrency), લેટન્સી-સેન્સિટિવ કાર્યો માટે જે ઊંડું રીઝનિંગ માંગતા નથી—દા.ત., ટૂંકા પ્રોમ્પ્ટ્સ જનરેટ કરવા, ટેમ્પલેટ્સ ભરવા અથવા ડ્રાફ્ટ ટેક્સ્ટ તૈયાર કરવા માટે.
  • ઓટોરીગ્રેસિવ મોડલ્સ: હાઈ-કન્કરન્સી વર્કલોડ્સ, જટિલ રીઝનિંગ અથવા લાંબા આઉટપુટ જનરેશન માટે જ્યાં ચોકસાઈ (accuracy) સ્પીડ કરતા વધુ મહત્વની હોય.

આ ફેરફાર AI ઇન્ફ્રાસ્ટ્રક્ચર માટે શું સૂચવે છે

જો માત્ર મોડલનું કદ વધારવાને બદલે જનરેશન અલ્ગોરિધમ વિશે ફરીથી વિચારીને સ્પીડ મેળવી શકાય, તો સૌથી મોટો કાર્યક્ષમતાનો ફાયદો "પ્લમ્બિંગ" (plumbing) સુધારાઓમાંથી મળી શકે છે. આ ટ્રેડ-ઓફનો અર્થ એ પણ છે કે ડેવલપર્સે અમુક ઉપયોગના કિસ્સાઓમાં ગુણવત્તામાં થોડો ઘટાડો સ્વીકારવો પડશે.

વિરોધ પક્ષ: શું ડિફ્યુઝન મુખ્ય પ્રવાહ માટે તૈયાર છે?

ડિફ્યુઝન અમલીકરણ ટૂંકા પ્રોમ્પ્ટ્સ સાથે સંઘર્ષ કરે છે અને અનિયમિત (jittery) આઉટપુટ આપી શકે છે.

આગળ શું જોવું

  • સ્કેલિંગ સ્ટડીઝ: શું મોટા ડિફ્યુઝન મોડલ્સ સ્પીડ જાળવી રાખીને ક્ષમતાનો તફાવત ઘટાડી શકશે?
  • હાર્ડવેર ઓપ્ટિમાઇઝેશન: જેમ જેમ GPUs વિકસિત થશે, તેમ કમ્પ્યુટ-હેવી ડિફ્યુઝન સ્ટેપ્સ અને વેઇટ-હેવી ઓટોરીગ્રેસન વચ્ચેનું સંતુલન ફરીથી બદલાઈ શકે છે.
  • રૂટિંગ અલ્ગોરિધમ્સ: ટાસ્ક-અવેર મોડલ રૂટર્સના પ્રારંભિક પ્રોટોટાઇપ્સ એ દર્શાવશે કે ડાયનેમિક સિલેક્શન દ્વારા સિસ્ટમની લેટન્સીમાં કેટલો ઘટાડો કરી શકાય છે.

મુખ્ય વાત

DiffusionGemma સાબિત કરે છે કે વધુ ચિપ્સ ઉમેર્યા વગર જનરેશન લૂપ વિશે ફરીથી વિચારવાથી લેટન્સીમાં મોટો ઘટાડો કરી શકાય છે. આ ટેકનોલોજી ઓટોરીગ્રેસિવ મોડલ્સનો સંપૂર્ણ વિકલ્પ નથી, પરંતુ તે હાઇબ્રિડ AI સ્ટેક માટે એક આકર્ષક સાધન છે જ્યાં સ્પીડ અને ચોકસાઈને કાર્યના આધારે સંતુલિત કરવામાં આવે છે. AI ઇન્ફ્રાસ્ટ્રક્ચરની આગામી લહેર કદાચ માત્ર મોડલના કદથી નહીં, પરંતુ તે કામને યોગ્ય એન્જિન દ્વારા કેટલી ચતુરાઈથી રૂટ કરે છે તેના પરથી નક્કી કરવામાં આવશે.