بڑے پیمانے پر ایک بڑے AI ماڈل کو چلانا اب ایک سائنسی کارنامے سے زیادہ بجلی کے بلوں اور ڈیٹا سینٹر کے کرایوں کا ایک کٹھن ریاضیاتی مسئلہ بن گیا ہے۔ Gemini جو بھی ٹوکن تیار کرتا ہے اس کی گوگل کو ایک حقیقی قیمت ادا کرنی پڑتی ہے—سلیکون سائیکلز، میموری بینڈوتھ، اور بجلی کے استعمال (watts) کی صورت میں۔ جیسے جیسے سوالات کی تعداد بڑھتی ہے، ایک سینٹ کا چھوٹا سا حصہ بھی اتنی رقم میں بدل جاتا ہے جو منافع کو مکمل طور پر نگل سکتی ہے۔ یہی خاموش ضرورت Frozen v2 کے پیچھے ہے، جو کہ گوگل کے اندر ایک اندرونی سرور چپ پروجیکٹ ہے جو اب شکل اختیار کر رہا ہے۔ اپنی جنرل پرپز (general-purpose) Tensor Processing Units کو ایک اور نسل کے لیے بہتر بنانے کے بجائے، کمپنی کچھ زیادہ ہی انقلابی کرنے کی کوشش کر رہی ہے: Gemini ماڈل کے ڈھانچے کو براہ راست سلیکون میں ہی ڈھالنا۔

لچکدار ایکسلریٹر سے ماڈل کے مخصوص سلیکون تک

گوگل کے TPUs تقریباً ایک دہائی سے اس کے انفراسٹرکچر کے ورک ہارس رہے ہیں۔ یہ ماڈلز کو ٹرین کرتے ہیں، سرچ رینکنگ الگورتھم کو طاقت فراہم کرتے ہیں، اور یہاں تک کہ Meta اور دیگر کسٹمرز کو گھنٹوں کے حساب سے کرایے پر بھی دیے جاتے ہیں جو Nvidia کے GPUs کا متبادل تلاش کر رہے ہیں۔ یہی ہمہ جہت صلاحیت ایک TPU کو TPU بناتی ہے۔ یہ میٹرکس ملٹی پلیکیشن اور میموری موومنٹ کی ایک عمومی زبان بولتا ہے، جسے سافٹ ویئر میں بیان کردہ تقریباً کسی بھی نیورل نیٹ ورک کے ذریعے استعمال کیا جا سکتا ہے۔

Frozen v2 جان بوجھ کر اس لچک کو قربان کر دیتا ہے۔ اس چپ کو ایک ڈومین-اسپیسیفک (domain-specific) ایکسلریٹر کے طور پر ڈیزائن کیا جا رہا ہے جس کے سرکٹس Gemini کے اپنے آرکیٹیکچر کے حصوں کی جسمانی طور پر عکاسی کرتے ہیں۔ جہاں ایک TPU ہدایات حاصل کرتا ہے اور انہیں سافٹ ویئر آپریشنز کے طور پر تشریح کرتا ہے، وہیں Frozen v2 ماڈل کے ساختی نقشے—اس کے لیئرز اور ڈیٹا پاتھ کے انتظام—کو براہ راست چپ کے لے آؤٹ میں نقش کر دے گا۔ گوگل کو توقع ہے کہ ماڈل اور دھات کا یہ گہرا ملاپ AI جوابات فراہم کرنے کے لیے چپ کو موجودہ TPUs کے مقابلے میں چھ سے دس گنا زیادہ کارآمد بنا دے گا۔ فی سوال کم کمپیوٹ اقدامات کا مطلب ہے ٹوکن کے ظاہر ہونے کے لیے کم انتظار کرنا، اور اسے تیار کرنے میں بہت کم توانائی خرچ کرنا۔

یہ محض اسی آئیڈیا کا ایک تیز رفتار ورژن نہیں ہے۔ یہ چپ کی ایک مختلف قسم ہے، جو عمومی ہونے کے بجائے ایک ہی ماڈل فیملی کے لیے وقف ہے۔

پہلا “Frozen” کیوں پگھل گیا

اس طریقہ کار کی جڑیں گوگل DeepMind کے چیف سائنٹسٹ، جیف ڈین (Jeff Dean) سے منسوب ایک پرانے تصور میں ہیں۔ اصل “Frozen” تجویز میں نہ صرف آرکیٹیکچر بلکہ اصل ماڈل ویٹس (weights)—وہ اربوں ٹیون شدہ پیرامیٹرز جو Gemini کے سیکھے ہوئے طرزِ عمل پر مشتمل ہیں—کو براہ راست چپ میں ہارڈ کوڈ کرنے کے ذریعے تخصصی عمل کو مزید آگے بڑھانے کی تجویز دی گئی تھی۔

منطق درست تھی۔ اگر آپ کو بالکل معلوم ہے کہ ماڈل کون سے نمبر استعمال کرے گا، تو انہیں بیرونی میموری سے حاصل کرنے کی زحمت کیوں کی جائے؟ آپ انہیں ٹرانزسٹرز میں نقش کر سکتے ہیں اور تاخیر کے پورے زمروں کو ختم کر سکتے ہیں۔

مسئلہ مستقل مزاجی کا تھا۔ AI ماڈلز ساکن نہیں رہتے۔ گوگل Gemini کو مسلسل اپ ڈیٹ کرتا ہے، نئے ڈیٹا پر دوبارہ ٹرین کرتا ہے، پیرامیٹرز کو ایڈجسٹ کرتا ہے، اور بہتر ورژن جاری کرتا ہے۔ سلیکون میں ویٹس منجمد (frozen) کرنے والی چپ اس لمحے ایک کاغذ کے وزن (paperweight) کے برابر ہو جائے گی جب نیا ماڈل ورژن جاری ہوگا۔ لچک کی اس کمی نے اصل تصور کو ختم کر دیا۔

بغیر لنگر کے آرکیٹیکچر

Frozen v2 ویٹس کو تبدیل ہونے کے لیے آزاد چھوڑتے ہوئے آرکیٹیکچر کو ہارڈ کوڈ کر کے اس فرسودگی کے جال سے نکل جاتا ہے۔ اسے گاڑی کو سڑک کے ساتھ ویلڈ کرنے کے بجائے ایک کسٹم ریس ٹریک بنانے کے طور پر سوچیں۔ سرکٹ کی شکل ساکن رہتی ہے، جو Gemini کے مخصوص کمپیوٹیشن پیٹرنز کے لیے موزوں ہے، لیکن ان سرکٹس کے ذریعے بہنے والا مواد میموری سے نئے ویٹس لوڈ کر کے تازہ کیا جا سکتا ہے۔

عملی طور پر یہ فرق اہمیت رکھتا ہے۔ جب انجینئرز ایک نیا Gemini چیک پوائنٹ ٹرین کرتے ہیں، تو وہ نیا چپ بنائے بغیر اسے Frozen v2 ہارڈ ویئر پر تعینات کر سکتے ہیں۔ ہارڈ کوڈنگ کی صحیح حد اب بھی گوگل کے اندر ایک کھلا سوال ہے؛ ٹیموں کو یہ فیصلہ کرنا ہوگا کہ کون سے ساختی عناصر سلیکون کی ابدیت کے مستحق ہیں اور کنہیں کنفیگر ایبل (configurable) رہنا چاہیے۔ لیکن اصول طے ہو چکا ہے۔ شکل کو منجمد کر کے اور پیرامیٹرز کو روانی سے تبدیل کر کے، گوگل تبدیلی کی صلاحیت کو قربان کیے بغیر کارکردگی کا فائدہ حاصل رکھتا ہے۔

اسے اندرونی رکھنے کی معیشت

ایک اور وجہ ہے کہ آپ Frozen v2 کو گوگل کلاؤڈ کے پرائسنگ شیٹ پر نہیں دیکھیں گے۔ چونکہ یہ چپ Gemini کے اندرونی ڈھانچے کے گرد اتنی گہرائی سے بنی ہے، اس لیے PyTorch یا کسٹم Transformer ورائینٹس چلانے والے بیرونی ڈویلپرز کے لیے اس کا کوئی خاص فائدہ نہیں ہوگا۔ گوگل کا اسے ایک جنرل پرپز پروڈکٹ کے طور پر فروخت کرنے کا کوئی ارادہ نہیں ہے۔ یہ ایک اندرونی ٹول رہے گا، جس کا رخ براہ راست گوگل کے اپنے ڈیٹا سینٹرز کے اندر انفرنس کی گہراں طلب کو پورا کرنے کی طرف ہوگا۔

یہ انتخاب ایک تلخ معاشی حقیقت کی عکاسی کرتا ہے۔ موجودہ جنریٹیو AI مارکیٹ میں، ماڈلز کی صلاحیتیں تیزی سے ایک دوسرے کے قریب آ رہی ہیں۔ حریفوں کے درمیان فرق اکثر اس بات پر منحصر ہوتا ہے کہ کون فی ٹوکن (token) کم ترین لاگت پر سب سے بڑا ماڈل چلانے کی استطاعت رکھتا ہے۔ انفرنس (Inference) اب ٹریننگ کے بعد کا کوئی معمولی مرحلہ نہیں رہا؛ Gemini جیسے وسیع پیمانے پر استعمال ہونے والے پروڈکٹ کے لیے، یہ سب سے بڑا خرچہ ہے۔ اگر Frozen v2 اس خرچ میں چھ گنا یا اس سے زیادہ کمی کرتا ہے، تو گوگل کو ایسی گنجائش مل جائے گی جس کا مقابلہ حریف آسانی سے نہیں کر سکیں گے۔ یہ یا تو ان بچتوں کو منافع (margin) کے طور پر اپنے پاس رکھ سکتا ہے یا پھر API صارفین اور پروڈکٹ انٹیگریشنز کے لیے قیمتیں کم کر کے انہیں فراہم کر سکتا ہے، جس سے OpenAI، Anthropic اور دیگر کمپنیوں پر دباؤ بڑھے گا۔

یہ صنعت کے لیے کیا اشارہ ہے

گوگل کا یہ قدم اس بات کی طرف بھی اشارہ کرتا ہے کہ وسیع تر ہارڈ ویئر حکمت عملی کس سمت میں جا رہی ہے۔ برسوں سے، معیاری طریقہ کار یہ تھا کہ زیادہ سے زیادہ لچکدار ایکسلریٹر (accelerator) بنایا جائے اور سافٹ ویئر کو تخصصی کاموں (specialization) کے لیے چھوڑ دیا جائے۔ Nvidia کے GPUs کا غلبہ اس لیے ہے کیونکہ وہ مالیکیولر ڈائنامکس سے لے کر ویڈیو گیمز اور لارج لینگویج ماڈلز تک سب کچھ چلا سکتے ہیں۔ گوگل کے اپنے TPUs بھی اسی وسیع افادیت کے جذبے کے ساتھ تیار کیے گئے تھے۔

Frozen v2 اس روایت سے ہٹ کر ہے۔ یہ اس بات کا اعتراف ہے کہ جب ماڈلز کا ایک خاندان کافی زیادہ کوئری والیوم (query volume) پیدا کرتا ہے، تو اس ماڈل کے لیے خاص طور پر تیار کردہ کسٹم سلیکون (custom silicon) اپنی لاگت کئی گنا زیادہ منافع کے ذریعے پورا کر سکتا ہے۔ دیگر ہائپر اسکیلرز نے بھی اسی منطق پر عمل کیا ہے—مثال کے طور پر Amazon کے Trainium اور Inferentia چپس—لیکن گوگل کا طریقہ کار نیٹ ورکس کی ایک عام قسم کے بجائے ایک مخصوص ماڈل آرکیٹیکچر کے گرد ہارڈ ویئر کو ڈیزائن کرنے کی وجہ سے زیادہ گہرا ہے۔

یقیناً، خطرہ سختی (rigidity) کا ہے۔ اگر Gemini کی آرکیٹیکچر ایسی سمت میں ترقی کرتی ہے جسے ہارڈ کوڈڈ سرکٹس (hardcoded circuits) کے مطابق نہیں ڈھالا جا سکتا، تو گوگل خود کو ایسے مہنگے سلیکون کے ساتھ پا سکتا ہے جو اس کے نئے ترین آئیڈیاز کو نہیں چلا سکتا۔ یہی وجہ ہے کہ صرف آرکیٹیکچر پر مبنی سمجھوتہ اہمیت رکھتا ہے۔ یہ ایک درمیانی راستہ فراہم کرتا ہے: کارکردگی میں نمایاں بہتری حاصل کرنے کے لیے کافی تخصصی مہارت، اور کمپنی کو مشکل صورتحال میں پھنسنے سے بچانے کے لیے کافی لچک۔

اصل نتیجہ

Frozen v2 کو محض ایک چپ کے اعلان کے طور پر نہیں، بلکہ AI کے مقابلے کی مستقبل کی شکل پر ایک اسٹریٹجک شرط کے طور پر سمجھنا بہتر ہے۔ گوگل یہ شرط لگا رہا ہے کہ فاتح صرف بہترین ماڈلز نہیں بنائیں گے، بلکہ وہ پورے اسٹیک (stack) کے مالک ہوں گے—ماڈل کے بلیو پرنٹ سے لے کر ٹرانزسٹر سے گزرنے والے الیکٹران تک۔ اگر یہ منصوبہ کامیاب ہو گیا، تو اس کا فائدہ بینچ مارک اسکورز میں نظر نہیں آئے گا۔ یہ سہ ماہی آمدنی کی رپورٹ کے لاگت والے کالم میں نظر آئے گا، جہاں فی ملین ٹوکنز پر بچنے والے چند سینٹ جنریٹیو AI میں تجارتی طور پر ممکنہ حدود کو دوبارہ سے ترتیب دے سکتے ہیں۔