DeepMind نے اس ہفتے DiffusionGemma متعارف کرایا، جو کہ ایک اوپن ویٹ (open-weight) لینگویج ماڈل ہے جو ایک سنگل H100 GPU پر تقریباً 1,500 ٹوکن فی سیکنڈ جنریٹ کر سکتا ہے، جبکہ معیاری Gemma 4 ماڈل کی رفتار 303 ٹوکن فی سیکنڈ کے قریب ہے۔ رفتار میں یہ اضافہ اس لیے اہم ہے کیونکہ یہ اس لیٹنسی (latency) کی رکاوٹ کو کم کر سکتا ہے جو ریئل ٹائم ایپلی کیشنز میں AI سے چلنے والے ایجنٹس کی رفتار کو سست کر دیتی ہے۔
DiffusionGemma کس طرح ٹوکن-بائی-ٹوکن کی عادت کو توڑتا ہے
زیادہ تر جدید لینگویج ماڈلز خودکار طریقے سے (autoregressively) ٹیکسٹ جنریٹ کرتے ہیں: وہ ایک ٹوکن کی پیش گوئی کرتے ہیں، اسے دوبارہ ماڈل میں ڈالتے ہیں، اور پھر اگلے ٹوکن کی پیش گوئی کرتے ہیں۔ یہ "بائیں سے دائیں" والا لوپ کمپیوٹ اور میموری کے درمیان ایک گہرا تعلق پیدا کرتا ہے، کیونکہ ہر ایک ٹوکن کے لیے ماڈل کے ویٹس (weights) تک رسائی ضروری ہوتی ہے۔ DiffusionGemma اس لوپ کو ایک ڈسکریٹ ڈیفیوژن عمل (discrete diffusion process) سے بدل دیتا ہے جو 256 ٹوکنز کے ایک ٹکڑے کو شور زدہ ڈیٹا (noisy data) کے ایک سنگل بلاک کے طور پر لیتا ہے۔ اس کے بعد ماڈل پورے بلاک کو متوازی طور پر (in parallel) ڈی نوائز (denoise) کرتا ہے، جس سے کام کا بوجھ بار بار ویٹس تلاش کرنے کے بجائے فی مرحلہ زیادہ کمپیوٹیشن کی طرف منتقل ہو جاتا ہے۔ ان ہارڈ ویئرز پر جو متوازی ریاضی (parallel math) میں مہارت رکھتے ہیں، جیسے کہ Nvidia کا H100، یہ تبدیلی فائدہ مند ثابت ہوتی ہے۔
AI ایجنٹس کے لیے رفتار کیوں اہم ہے
خود مختار ایجنٹس عام طور پر تلاش کرنے، خلاصہ کرنے اور ٹیسٹ کرنے کا ایک چکر چلاتے ہیں۔ ہر مرحلے میں ماڈل کے کئی کالز شامل ہو سکتے ہیں، اس لیے فی ٹوکن لیٹنسی تیزی سے بڑھتی جاتی ہے۔ جب ماڈل رک جاتا ہے، تو پورا ایجنٹ پائپ لائن پیچھے رہ جاتا ہے، جس سے اخراجات بڑھتے ہیں اور صارف کا تجربہ خراب ہوتا ہے۔
کارکردگی کا توازن
DiffusionGemma کی رفتار کی قیمت اس کی بنیادی صلاحیتوں میں واضح طور پر ادا کرنی پڑتی ہے۔ AIME بینچ مارک میں—جو استدلال (reasoning)، حقائقیت اور زبان کی سمجھ بوجھ کو ماپنے والا ایک مجموعہ ہے—DiffusionGemma کا اسکور 69.1 ہے، جبکہ Gemma 4 کا اسکور 88.3 تک پہنچ جاتا ہے۔ ڈیفیوژن کا طریقہ کار بہت مختصر آؤٹ پٹ کے ساتھ بھی کمزوریاں ظاہر کرتا ہے اور کبھی کبھار ٹوکن "اٹکنے" (stuttering) کا باعث بنتا ہے، جہاں تیار کردہ ٹیکسٹ دہرایا جاتا ہے یا ہچکچاہٹ محسوس ہوتی ہے۔ جب ایک وقت میں تقریباً 32 سے زیادہ صارفین ماڈل سے سوال کرتے ہیں، تو متوازی ہونے کا فائدہ ختم ہو جاتا ہے اور معیاری خودکار طریقہ کار (autoregressive method) مجموعی تھرو پٹ (throughput) میں برابر آ جاتا ہے۔
ہر طریقہ کار کہاں موزوں ہے
ڈیٹا ایک ہائبرڈ ڈیپلائمنٹ حکمت عملی کی تجویز دیتا ہے:
- Diffusion models: کم کنکرنسی (low-concurrency) اور لیٹنسی کے حساس کاموں کے لیے جن میں گہری استدلال کی ضرورت نہیں ہوتی—مثلاً مختصر پرامپٹس تیار کرنا، ٹیمپلیٹس بھرنا، یا ڈرافٹ ٹیکسٹ تیار کرنا۔
- Autoregressive models: زیادہ کنکرنسی والے کاموں، پیچیدہ استدلال، یا طویل تحریر کی تیاری کے لیے جہاں درستگی رفتار سے زیادہ اہم ہو۔
اس تبدیلی کے AI انفراسٹرکچر کے لیے کیا معنی ہیں
اگر صرف ماڈل کا سائز بڑھانے کے بجائے جنریشن الگورتھم پر نظر ثانی کر کے رفتار میں اضافہ کیا جا سکتا ہے، تو سب سے بڑی کارکردگی کے فوائد "پلَمبنگ" (plumbing) یعنی بنیادی ڈھانچے کی بہتری سے حاصل ہو سکتے ہیں۔ اس توازن کا مطلب یہ بھی ہے کہ ڈویلپرز کو مخصوص استعمال کے کیسز کے لیے معیار میں معمولی کمی کو قبول کرنا ہوگا۔
جوابی دلیل: کیا ڈیفیوژن مکمل طور پر استعمال کے لیے تیار ہے؟
ڈیفیوژن کا نفاذ مختصر پرامپٹس کے ساتھ جدوجہد کرتا ہے اور غیر مستحکم (jittery) آؤٹ پٹ پیدا کر سکتا ہے۔
آگے کیا دیکھنا ہے
- Scaling studies: کیا بڑے ڈیفیوژن ماڈلز رفتار برقرار رکھتے ہوئے صلاحیتوں کے فرق کو ختم کر دیں گے؟
- Hardware optimizations: جیسے جیسے GPUs ترقی کریں گے، کمپیوٹ پر مبنی ڈیفیوژن مراحل اور ویٹ پر مبنی خودکار طریقہ کار (autoregression) کے درمیان توازن دوبارہ بدل سکتا ہے۔
- Routing algorithms: ٹاسک کے لحاظ سے ماڈل راؤٹرز کے ابتدائی پروٹو ٹائپس یہ ظاہر کریں گے کہ ڈائنامک انتخاب کے ذریعے مجموعی سسٹم لیٹنسی کو کتنا کم کیا جا سکتا ہے۔
خلاصہ
DiffusionGemma ثابت کرتا ہے کہ بنیادی جنریشن لوپ پر نظر ثانی کرنے سے مزید چپس لگائے بغیر لیٹنسی کو کم کیا جا سکتا ہے۔ یہ ٹیکنالوجی خودکار ماڈلز کا مکمل متبادل نہیں ہے، بلکہ یہ ایک ہائبرڈ AI اسٹیک کے لیے ایک بہترین ٹول فراہم کرتی ہے جہاں ہر کام کی بنیاد پر رفتار اور درستگی کے درمیان توازن برقرار رکھا جا سکتا ہے۔ AI انفراسٹرکچر کی اگلی لہر کا فیصلہ شاید صرف ماڈل کے سائز سے نہیں، بلکہ اس بات سے کیا جائے گا کہ وہ کام کو صحیح انجن کے ذریعے کتنی مہارت سے تقسیم (route) کرتا ہے۔
