OpenAI نے اپنا انفرنس چپ (inference chip)، Jalapeño، متعارف کروا دیا ہے اور کہا ہے کہ یہ Nvidia کے GB200 اور GB300 ایکسلیریٹرز (accelerators) کے مقابلے میں فی کلو واٹ 1.9 × تک زیادہ تھرو پٹ (throughput) فراہم کرتا ہے۔ ٹیم نے محض نو ماہ میں ایک تصور کو کام کرنے والے سلیکون ڈائی (silicon die) میں تبدیل کر دیا—جو کہ کسٹم AI پروسیسرز کے لیے عام دو سے تین سالہ سائیکل کے مقابلے میں کہیں زیادہ تیز ہے۔

یہ تیز رفتار عمل کیوں اہم ہے

OpenAI اب صرف Nvidia GPUs پر انحصار کرنے کے بجائے Cerebras، AWS Trainium، AMD اور دیگر کے ہارڈ ویئر پر ماڈلز چلا رہا ہے۔ جیسے جیسے AI کا رخ ٹریننگ (training) سے زیادہ انفرنس (inference) پر مبنی ورک لوڈز کی طرف بڑھ رہا ہے، بجلی کا استعمال اور فی سوال لاگت فیصلہ کن عوامل بن جاتے ہیں۔ ایک ایسا چپ جو ایک ٹریلین پیرامیٹر (trillion-parameter) ماڈل کے لیے درکار توانائی کو نصف کر دے، وہ روزانہ اربوں درخواستوں کو سنبھالنے والی سروسز کے آپریٹنگ اخراجات میں کمی لا سکتا ہے۔

AI نے چپ کیسے لکھی

Jalapeño ایک ASIC ہے—ایک ایسا چپ جو صرف ایک مقصد کے لیے بنایا گیا ہے: بڑے لینگویج ماڈلز (large language models) کو چلانا۔ ایک عام مقصد کے لیے استعمال ہونے والے GPU کے برعکس، ایک ASIC غیر ضروری لاجک کو ختم کر دیتا ہے اور ڈیٹا پاتھ کو LLM انفرنس پیٹرنز کے مطابق ڈھال دیتا ہے۔ OpenAI کے انجینئرز نے اس کا ڈیزائن XLS میں لکھا، جو کہ ایک ہارڈ ویئر ڈسکرپشن لینگویج ہے جو مشین لرننگ ماڈلز کو کوڈ تیار کرنے کی اجازت دیتی ہے۔ کمپنی کا کہنا ہے کہ AI سے تیار کردہ لاجک چپ کے کور کا نصف سے زیادہ حصہ ہے، جس سے ڈیزائن پائپ لائن برسوں سے سمٹ کر مہینوں میں رہ گئی ہے۔

کارکردگی کے دعوے بمقابلہ حقیقت

OpenAI نے Jalapeño کے لیے تین اہم اعداد و شمار درج کیے ہیں:

  • فی کلو واٹ تھرو پٹ (Throughput per kilowatt): Nvidia کے GB200/GB300 سے 1.5 – 1.9 × زیادہ۔
  • لیٹنسی (Latency): انہی Nvidia ماڈلز سے 1.7 – 3.6 × کم۔
  • ایک ٹریلین پیرامیٹر ماڈل پر بجلی کا استعمال: GB300 کے 1,400 W کے مقابلے میں 700 W۔

اگر یہ اعداد و شمار درست ثابت ہوئے، تو ایک ڈیٹا سینٹر بجلی کے نصف خرچ پر وہی ماڈل چلا سکے گا اور ساتھ ہی تیز تر جوابات بھی فراہم کرے گا۔ یہ دعوے انفرنس پر مرکوز ہیں؛ OpenAI ٹریننگ کی کارکردگی کے بارے میں کچھ نہیں کہتا، جو کہ چیٹ طرز کی ایپلی کیشنز فراہم کرنے پر اس کے موجودہ زور کے عین مطابق ہے۔

اس کا Nvidia کے لیے کیا مطلب ہے

Nvidia کے آنے والے Blackwell اور Vera Rubin چپس ہائی اینڈ ایکسلیریٹر مارکیٹ کو نشانہ بناتی ہیں۔ Nvidia کا فائدہ اس کے پختہ سافٹ ویئر اسٹیک، ڈویلپرز کی وسیع پیمانے پر پذیرائی اور AI کے مختلف کاموں میں لچک میں پنہاں ہے۔ اس کے برعکس، Jalapeño ایک محدود مقصد کا آلہ ہے جو صرف اسی وقت کامیاب ہوتا ہے جب ورک لوڈ اس کی مہارت کے مطابق ہو۔

Nvidia پر دباؤ کے دو پہلو ہیں۔ پہلا یہ کہ جو صارفین کسٹم ASIC کی استطاعت رکھتے ہیں، وہ وعدہ کردہ بچت کے لیے اسے اپنا سکتے ہیں، جس سے Nvidia کے انفرنس مارکیٹ شیئر میں کمی آئے گی۔ دوسرا یہ کہ یہ ثبوت کہ AI ہارڈ ویئر ڈیزائن کرنے میں مدد کر سکتا ہے، حریفوں کے ڈویلپمنٹ سائیکلز کو مختصر کر سکتا ہے، جس سے Nvidia کو اپنے روڈ میپ میں تیزی لانے پر مجبور ہونا پڑے گا۔

جوابی نکات اور کھلے سوالات

  • سافٹ ویئر ایکو سسٹم (Software ecosystem): Nvidia کی CUDA لائبریریاں، پروفائلنگ ٹولز اور کمیونٹی سپورٹ اب بھی زیادہ تر ڈویلپرز کے لیے اسے ایک فیصلہ کن برتری فراہم کرتی ہیں۔ Jalapeño کو شامل کرنے کے لیے نئے ٹول چینز اور ممکنہ طور پر کوڈ کی دوبارہ لکھائی کی ضرورت ہوگی۔
  • حقیقی دنیا میں تصدیق (Real-world validation): یہ اعداد و شمار OpenAI کے اندرونی ٹیسٹوں سے لیے گئے ہیں۔ آزاد بینچ مارکس، طویل مدتی بھروسہ مندی کا ڈیٹا، اور مختلف صارفین کے بوجھ (mixed-tenant loads) کے تحت اس کی کارکردگی ابھی تک غیر تصدیق شدہ ہے۔
  • اسکیل کی معیشت (Economics of scale): ایک ASIC کا لاگت کا فائدہ حجم کے ساتھ بڑھتا ہے۔ OpenAI کا اندرونی استعمال اس سرمایہ کاری کو جائز قرار دے سکتا ہے، لیکن بیرونی صارفین کو فی چپ زیادہ قیمتوں کا سامنا کرنا پڑ سکتا ہے جب تک کہ پیداوار میں اضافہ نہ ہو۔

مستقبل کا منظرنامہ

فی الحال، Jalapeño یہ ثابت کرتا ہے کہ نو ماہ کی تیز رفتار کوشش سے ایک ایسا چپ تیار کیا جا سکتا ہے جو کاغذ پر، AI اسٹیک کے سب سے زیادہ حساس لاگت والے حصے میں موجود GPU سے بہتر کارکردگی دکھاتا ہے۔ اصل امتحان یہ ہوگا کہ آیا یہ برتری حقیقی دنیا کے ورک لوڈز کے دباؤ میں برقرار رہ پاتی ہے یا نہیں۔