DeepMind ఈ వారం DiffusionGemmaను పరిచయం చేసింది, ఇది ఒక ఓపెన్-వెయిట్ లాంగ్వేజ్ మోడల్. ఇది ఒకే ఒక H100 GPU పై సెకనుకు సుమారు 1,500 టోకెన్లను ఉత్పత్తి చేయగలదు, అయితే ప్రామాణిక Gemma 4 మోడల్ సెకనుకు 303 టోకెన్ల వద్ద గరిష్టంగా ఉంటుంది. ఈ వేగవంతమైన పెరుగుదల చాలా ముఖ్యం, ఎందుకంటే ఇది రియల్-టైమ్ అప్లికేషన్లలో AI-ఆధారిత ఏజెంట్లను నెమ్మదింపజేసే లేటెన్సీ (latency) సమస్యను తగ్గించగలదు.

DiffusionGemma టోకెన్-బై-టోకెన్ పద్ధతిని ఎలా మారుస్తుంది

చాలా ఆధునిక లాంగ్వేజ్ మోడల్స్ టెక్స్ట్‌ను ఆటోరెగ్రెసివ్‌గా (autoregressively) ఉత్పత్తి చేస్తాయి: అవి ఒక టోకెన్‌ను అంచనా వేస్తాయి, దానిని తిరిగి మోడల్‌కు అందిస్తాయి, ఆపై తదుపరి టోకెన్‌ను అంచనా వేస్తాయి. ఈ "ఎడమ నుండి కుడికి" లూప్ వల్ల కంప్యూట్ మరియు మెమరీ మధ్య బలమైన అనుసంధానం అవసరమవుతుంది, ఎందుకంటే ప్రతి ఒక్క టోకెన్ కోసం మోడల్ వెయిట్స్‌ను యాక్సెస్ చేయాల్సి ఉంటుంది. DiffusionGemma ఈ లూప్‌కు బదులుగా ఒక డిస్క్రీట్ డిఫ్యూజన్ ప్రాసెస్‌ను (discrete diffusion process) ఉపయోగిస్తుంది, ఇది 256-టోకెన్ల చంక్‌ను ఒకే ఒక నాయిసీ డేటా బ్లాక్‌గా పరిగణిస్తుంది. ఆ తర్వాత మోడల్ మొత్తం బ్లాక్‌ను సమాంతరంగా (in parallel) డీనోయిస్ చేస్తుంది, దీనివల్ల పదేపదే వెయిట్ లుకప్‌ల నుండి పనిభారం పెద్ద మొత్తంలో కంప్యూట్ వైపు మళ్లుతుంది. Nvidia యొక్క H100 వంటి సమాంతర గణిత ప్రక్రియలలో (parallel math) మెరుగ్గా పనిచేసే హార్డ్‌వేర్‌పై, ఈ మార్పు లాభదాయకంగా ఉంటుంది.

AI ఏజెంట్లకు వేగం ఎందుకు ముఖ్యం

స్వయంప్రతిపత్తి కలిగిన ఏజెంట్లు (Autonomous agents) సాధారణంగా సెర్చింగ్, సమ్మరైజింగ్ మరియు టెస్టింగ్ అనే చక్రంలో పనిచేస్తాయి. ప్రతి దశలో మోడల్ కాల్స్ అవసరం కావచ్చు, కాబట్టి ప్రతి టోకెన్ లేటెన్సీ వేగంగా పెరుగుతుంది. మోడల్ నెమ్మదించినప్పుడు, మొత్తం ఏజెంట్ పైప్‌లైన్ ఆగిపోతుంది, దీనివల్ల ఖర్చులు పెరగడమే కాకుండా యూజర్ అనుభవం కూడా దెబ్బతింటుంది.

పనితీరు పరమైన సర్దుబాటు (The performance trade-off)

DiffusionGemma యొక్క వేగం దాని ప్రాథమిక సామర్థ్యంలో కొంత తగ్గుదల వల్ల వస్తుంది. AIME బెంచ్‌మార్క్—అంటే రీజనింగ్, ఫ్యాక్చువాలిటీ మరియు లాంగ్వేజ్ అండర్‌స్టాండింగ్‌ను కొలిచే ఒక సూట్—లో DiffusionGemma 69.1 స్కోరు సాధించగా, Gemma 4 88.3 స్కోరు సాధించింది. డిఫ్యూజన్ విధానం చాలా చిన్న అవుట్‌పుట్‌లతో మరియు అప్పుడప్పుడు టోకెన్ "స్టట్టరింగ్" (stuttering) సమస్యలతో కూడా ఇబ్బంది పడుతుంది, అంటే ఉత్పత్తి చేయబడిన టెక్స్ట్ పునరావృతమవ్వడం లేదా తడబడటం జరుగుతుంది. ఒకేసారి సుమారు 32 కంటే ఎక్కువ మంది వినియోగదారులు మోడల్‌ను క్వెరీ చేసినప్పుడు, సమాంతర ప్రయోజనం తగ్గిపోతుంది మరియు ప్రామాణిక ఆటోరెగ్రెసివ్ పద్ధతి మొత్తం త్రూపుట్‌లో (throughput) దానిని అందుకుంటుంది.

ఏ విధానం ఎక్కడ సరిపోతుంది

డేటా ప్రకారం ఒక హైబ్రిడ్ డిప్లాయ్‌మెంట్ వ్యూహం అవసరం:

  • Diffusion models: తక్కువ కన్కరెన్సీ (low-concurrency), లోతైన రీజనింగ్ అవసరం లేని లేటెన్సీ-సెన్సిటివ్ పనుల కోసం—ఉదాహరణకు, చిన్న ప్రాంప్ట్‌లను రూపొందించడం, టెంప్లేట్‌లను నింపడం లేదా డ్రాఫ్ట్ టెక్స్ట్‌ను తయారు చేయడం.
  • Autoregressive models: అధిక కన్కరెన్సీ వర్క్‌లోడ్లు, సంక్లిష్టమైన రీజనింగ్ లేదా ఖచ్చితత్వం వేగం కంటే ముఖ్యమైన సుదీర్ఘమైన జనరేషన్ కోసం.

ఈ మార్పు AI ఇన్‌ఫ్రాస్ట్రక్చర్‌కు సూచించేది ఏమిటి

మోడల్ పరిమాణాన్ని పెంచడం కంటే, జనరేషన్ అల్గారిథమ్‌ను తిరిగి ఆలోచించడం ద్వారా వేగాన్ని పెంచగలిగితే, అతిపెద్ద సామర్థ్య లాభాలు "ప్లంబింగ్" (plumbing) మెరుగుదలల నుండి రావచ్చు. ఈ సర్దుబాటు వల్ల డెవలపర్లు కొన్ని సందర్భాల్లో నాణ్యతలో స్వల్ప తగ్గుదలను కూడా అంగీకరించాల్సి ఉంటుంది.

ప్రతిపాదనకు విరుద్ధంగా: డిఫ్యూజన్ ప్రధాన సమయానికి సిద్ధంగా ఉందా?

డిఫ్యూజన్ అమలు చిన్న ప్రాంప్ట్‌లతో ఇబ్బంది పడుతుంది మరియు అస్థిరమైన (jittery) అవుట్‌పుట్‌ను ఇవ్వవచ్చు.

తదుపరి ఏమి గమనించాలి

  • Scaling studies: పెద్ద డిఫ్యూజన్ మోడల్స్ వేగాన్ని కాపాడుతూనే సామర్థ్య అంతరాన్ని (capability gap) తగ్గిస్తాయా?
  • Hardware optimizations: GPUలు అభివృద్ధి చెందుతున్న కొద్దీ, కంప్యూట్-హెవీ డిఫ్యూజన్ దశలు మరియు వెయిట్-హెవీ ఆటోరెగ్రెషన్ మధ్య సమతుల్యత మళ్ళీ మారవచ్చు.
  • Routing algorithms: టాస్క్-అవేర్ మోడల్ రూటర్ల ప్రారంభ ప్రోటోటైప్‌లు, డైనమిక్ ఎంపిక ద్వారా మొత్తం సిస్టమ్ లేటెన్సీని ఎంత తగ్గించవచ్చో తెలియజేస్తాయి.

ముగింపు (Takeaway)

మౌలిక జనరేషన్ లూప్‌ను తిరిగి ఆలోచించడం ద్వారా అదనపు చిప్‌లను జోడించకుండానే లేటెన్సీని తగ్గించవచ్చని DiffusionGemma నిరూపిస్తుంది. ఈ సాంకేతికత ఆటోరెగ్రెసివ్ మోడళ్లకు పూర్తిస్థాయి ప్రత్యామ్నాయం కాదు, కానీ వేగం మరియు ఖచ్చితత్వం పనుల ఆధారంగా సమతుల్యంగా ఉండే హైబ్రిడ్ AI స్టాక్ కోసం ఇది ఒక శక్తివంతమైన సాధనం. AI ఇన్‌ఫ్రాస్ట్రక్చర్ యొక్క తదుపరి దశ కేవలం మోడల్ పరిమాణం ద్వారా మాత్రమే కాకుండా, సరైన ఇంజిన్ ద్వారా పనులను ఎంత తెలివిగా పంపిణీ (route) చేస్తుంది అనే దానిపై ఆధారపడి ఉంటుంది.