DeepMind இந்த வாரம் DiffusionGemma-வை அறிமுகப்படுத்தியது, இது ஒரு open-weight மொழி மாதிரி (language model). இது ஒரு தனி H100 GPU-வில் வினாடிக்கு சுமார் 1,500 டோக்கன்களை (tokens) உருவாக்க முடியும், அதே சமயம் நிலையான Gemma 4 மாதிரி வினாடிக்கு 303 டோக்கன்கள் என்ற அளவில் மட்டுமே செயல்படுகிறது. இந்த வேக அதிகரிப்பு முக்கியமானது, ஏனெனில் இது நிகழ்நேர பயன்பாடுகளில் (real-time applications) AI-ஆல் இயக்கப்படும் ஏஜெண்டுகளை (agents) மெதுவாக்கும் தாமதத் தடைகளை (latency bottleneck) குறைக்க உதவும்.

DiffusionGemma எவ்வாறு டோக்கன்-பை-டோக்கன் முறையை உடைக்கிறது

பெரும்பாலான நவீன மொழி மாதிரிகள் உரையை autoregressively உருவாக்குகின்றன: அவை ஒரு டோக்கனை முன்னறிவித்து, அதை மீண்டும் மாதிரியில் செலுத்தி, பின்னர் அடுத்த டோக்கனை முன்னறிவிக்கின்றன. இந்த "இடமிருந்து வலமாக" செல்லும் சுழற்சி, கணக்கீடு (compute) மற்றும் நினைவகத்திற்கு (memory) இடையே ஒரு நெருக்கமான பிணைப்பை ஏற்படுத்துகிறது, ஏனெனில் ஒவ்வொரு டோக்கனுக்கும் மாதிரியின் எடைகளை (weights) அணுக வேண்டியிருக்கும். DiffusionGemma இந்தச் சுழற்சிக்கு பதிலாக, 256-டோக்கன் தொகுதியை (chunk) ஒரு ஒற்றை இரைச்சல் தரவுத் தொகுதியாக (block of noisy data) கருதும் ஒரு தனித்துவமான டிஃப்யூஷன் செயல்முறையை (discrete diffusion process) பயன்படுத்துகிறது. மாதிரி பின்னர் முழுத் தொகுதியையும் இணையாக (in parallel) சத்தமில்லாமல் (denoises) மாற்றுகிறது, இதன் மூலம் பணிச்சுமையைத் தொடர்ச்சியான எடைத் தேடல்களில் இருந்து ஒரு படிநிலைக்குத் தேவையான அதிகப்படியான கணக்கீட்டிற்கு மாற்றுகிறது. Nvidia-வின் H100 போன்ற இணையாகக் கணிதச் செயல்பாடுகளைச் செய்வதில் சிறந்து விளங்கும் வன்பொருள்களில் (hardware), இந்த மாற்றத்தின் பலன் கிடைக்கிறது.

AI ஏஜெண்டுகளுக்கு வேகம் ஏன் முக்கியம்

தன்னாட்சி ஏஜெண்டுகள் (Autonomous agents) பொதுவாகத் தேடுதல், சுருக்கிக் கூறுதல் மற்றும் சோதனை செய்தல் ஆகிய சுழற்சிகளைச் செய்கின்றன. ஒவ்வொரு படிநிலையிலும் பல முறை மாதிரியை அழைக்க வேண்டியிருக்கலாம், எனவே ஒவ்வொரு டோக்கனுக்கான தாமதமும் (latency) விரைவாகக் கூடிக்கொண்டே போகும். ஒரு மாதிரி முடங்கும்போது, முழு ஏஜென்ட் குழாயும் (pipeline) பின்னோக்கித் தடையை ஏற்படுத்துகிறது, இது செலவுகளை அதிகரிப்பதோடு பயனர் அனுபவத்தையும் குறைக்கிறது.

செயல்திறன் சமநிலை (The performance trade-off)

DiffusionGemma-வின் வேகம் அதன் அடிப்படைத் திறனில் ஒரு அளவிடக்கூடிய இழப்பை ஏற்படுத்துகிறது. AIME பெஞ்ச்மார்க் (benchmark)—தர்க்கம் (reasoning), உண்மைத்தன்மை மற்றும் மொழிப் புரிதலை அளவிடும் ஒரு தொகுப்பு—இல் DiffusionGemma 69.1 மதிப்பெண்களைப் பெறுகிறது, அதே சமயம் Gemma 4 88.3 மதிப்பெண்களை எட்டுகிறது. டிஃப்யூஷன் அணுகுமுறை மிகக் குறுகிய வெளியீடுகளுடன் (outputs) சிக்கலையும், அவ்வப்போது டோக்கன் "தடுமாற்றத்தையும்" (stuttering) காட்டுகிறது, அதாவது உருவாக்கப்பட்ட உரை மீண்டும் மீண்டும் வருவதோ அல்லது தயங்குவதோ நிகழும். சுமார் 32 பயனர்களுக்கும் மேலாக ஒரே நேரத்தில் மாதிரியைத் தேடும்போது, இணையாகச் செயல்படும் நன்மை குறைகிறது மற்றும் நிலையான autoregressive முறை ஒட்டுமொத்தத் திறனில் (throughput) சமநிலையை அடைகிறது.

ஒவ்வொரு அணுகுமுறையும் எங்கு பொருந்தும்

தரவுகள் ஒரு கலப்பு வரிசைப்படுத்தல் உத்தியை (hybrid deployment strategy) பரிந்துரைக்கின்றன:

  • Diffusion models: குறைந்த பயனர் எண்ணிக்கை மற்றும் ஆழமான தர்க்கம் தேவையில்லாத, தாமதத்திற்கு முக்கியமான பணிகளுக்கு—உதாரணமாக, குறுகிய தூண்டுதல்களை (prompts) உருவாக்குதல், டெம்ப்ளேட்களை நிரப்புதல் அல்லது வரைவு உரையைத் தயாரித்தல்.
  • Autoregressive models: அதிக பயனர் எண்ணிக்கை கொண்ட பணிச்சுமைகள், சிக்கலான தர்க்கம் அல்லது துல்லியம் வேகத்தை விட முக்கியத்துவம் வாய்ந்த நீண்ட வடிவ உருவாக்கங்களுக்கு.

இந்த மாற்றம் AI உள்கட்டமைப்பிற்கு (infrastructure) எதைக் குறிக்கிறது

மாதிரியின் அளவை அதிகரிப்பதற்குப் பதிலாக, உருவாக்கும் அல்காரிதத்தை (algorithm) மறுசிந்தனை செய்வதன் மூலம் வேகத்தை அதிகரிக்க முடிந்தால், மிகப்பெரிய செயல்திறன் வெற்றிகள் "பிளம்பிங்" (plumbing) மேம்பாடுகளிலிருந்து வரக்கூடும். இந்தச் சமநிலை, குறிப்பிட்ட பயன்பாட்டுத் தேவைகளுக்குத் தரத்தில் ஏற்படும் சிறிய சரிவை டெவலப்பர்கள் ஏற்றுக்கொள்ள வேண்டும் என்பதையும் குறிக்கிறது.

எதிர்வாதம்: டிஃப்யூஷன் பயன்பாட்டிற்குத் தயாராக உள்ளதா?

டிஃப்யூஷன் செயலாக்கம் குறுகிய தூண்டுதல்களுடன் போராடுகிறது மற்றும் நிலையற்ற (jittery) வெளியீட்டை உருவாக்கலாம்.

அடுத்து கவனிக்க வேண்டியவை

  • Scaling studies: பெரிய டிஃப்யூஷன் மாதிரிகள் வேகத்தைப் பராமரிக்கும் அதே வேளையில் திறன் இடைவெளியைக் குறைக்க முடியுமா?
  • Hardware optimizations: GPU-க்கள் வளர்ச்சியடையும் போது, கணக்கீடு சார்ந்த டிஃப்யூஷன் படிநிலைகளுக்கும் எடை சார்ந்த autoregression-க்கும் இடையிலான சமநிலை மீண்டும் மாறக்கூடும்.
  • Routing algorithms: பணி சார்ந்த மாதிரி ரூட்டர்களின் (model routers) ஆரம்பகால முன்மாதிரிகள், பணித் தேர்வின் மூலம் ஒட்டுமொத்த கணினித் தாமதத்தை எவ்வளவு குறைக்க முடியும் என்பதைக் காட்டும்.

சுருக்கம் (Takeaway)

அடிப்படை உருவாக்கும் சுழற்சியை மறுசிந்தனை செய்வதன் மூலம் கூடுதல் சிப்களைச் சேர்க்காமலேயே தாமதத்தைக் குறைக்க முடியும் என்பதை DiffusionGemma நிரூபிக்கிறது. இந்தத் தொழில்நுட்பம் autoregressive மாதிரிகளுக்கு ஒரு முழுமையான மாற்றீடு அல்ல, ஆனால் வேகம் மற்றும் துல்லியம் ஆகியவை பணி அடிப்படையில் சமநிலைப்படுத்தப்படும் ஒரு கலப்பு AI கட்டமைப்பிற்கு (hybrid AI stack) ஒரு சிறந்த கருவியாகும். அடுத்த தலைமுறை AI உள்கட்டமைப்பு என்பது மாதிரியின் அளவால் மட்டுமல்லாமல், சரியான வகை இயந்திரத்தின் மூலம் பணிகளை எவ்வளவு புத்திசாலித்தனமாக வழிநடத்துகிறது என்பதைக் கொண்டே மதிப்பிடப்படும்.