بینچ مارک کی اہم باتیں
Hot Chips کانفرنس نے وہ اعداد و شمار سامنے لائے ہیں جن کی ایک آزاد فرم نے InferenceX سوٹ کے ذریعے تصدیق کی ہے۔ OpenAI، Jalapeño کو ایک جنرل پرپز انفرنس ایکسلیریٹر (general-purpose inference accelerator) قرار دیتا ہے—یہ ماڈلز کو چلاتا ہے لیکن انہیں ٹرین نہیں کرتا۔ ٹیسٹوں میں یہ چپ:
- آج کے لیڈرز کے مقابلے میںพีک تھرو پٹ (peak throughput) پر فی واٹ 1.5x سے 1.9x زیادہ کام فراہم کیا۔
- لیٹنسی (latency) کو 1.7x سے 3.6x تک کم کیا، جبکہ انٹرایکٹو فوائد میں 2.1x سے 4.1x تک اضافہ ہوا۔
ماڈل کے لحاظ سے نتائج:
- GPT-OSS 120B: ~1,400 ٹوکنز / سیکنڈ / صارف۔
- Deepseek R1 670B: ایک ہی وقت میں ایک درخواست (single concurrent request) پر ~700 ٹوکنز / سیکنڈ۔
- Kimi K2.5 1T: ہائی پرفارمنس سوٹ میں ٹیسٹ کیا گیا (درست اعداد و شمار ظاہر نہیں کیے گئے)۔
OpenAI نے اس بات پر زور دیا کہ یہ اعداد و شمار سپیکیلیٹو ڈیکوڈنگ (speculative decoding) یا ملٹی ٹوکن پریڈکشن کے بغیر حاصل کیے گئے ہیں—جو کہ وہ حربے ہیں جو بہت سے حریف اپنے ہیڈ لائن نمبروں کو بڑھانے کے لیے استعمال کرتے ہیں۔
Jalapeño کیسے بنایا گیا
OpenAI نے Broadcom کے ساتھ مل کر نو ماہ میں چپ کا ڈیزائن مکمل کیا۔ فرم نے اپنے ماڈلز کو ڈیزائن لوپ میں شامل کیا، جس سے بلیو پرنٹنگ، پروگرامنگ اور آپٹیمائزیشن کی رفتار میں اضافہ ہوا—اس طریقے کو "AI-assisted silicon design" کا نام دیا گیا ہے۔ یہ تیز رفتار عمل ان کثیر سالہ سائیکلز سے تبدیلی کو ظاہر کرتا ہے جو کبھی ہائی پرفارمنس سلیکون کی پہچان ہوا کرتے تھے۔
Nvidia کی برتری کے لیے اثرات
Nvidia خام کارکردگی (raw performance) اور CUDA ایکو سسٹم پر انحصار کرتا ہے۔ نیا ڈیٹا کارکردگی کے اس برتری کو چیلنج کے قابل بناتا ہے۔ تجزیہ کاروں نے خبردار کیا ہے کہ اگر مزید AI فرمیں اسی طرح کی کارکردگی کے ساتھ کسٹم انفرنس سلیکون متعارف کرواتی ہیں، تو ڈویلپرز CUDA سے دور ہو سکتے ہیں، جس سے متبادل اسٹیکس اور ایک تقسیم شدہ مارکیٹ کے لیے جگہ پیدا ہو جائے گی۔
OpenAI کی مکسڈ سگنل حکمت عملی
چیف فنانشل آفیسر Kelly Huang نے Jalapeño کو ایک وسیع کمپیوٹ پلان کے ایک حصے کے طور پر پیش کیا، نہ کہ موجودہ شراکت داروں کے مکمل متبادل کے طور پر۔ OpenAI اب بھی مختلف ورک لوڈز کے لیے Nvidia، AMD، AWS اور Cerebras کے ساتھ کام کرتا ہے۔ Jalapeño ابھی ایک انجینئرنگ سیمپل ہے؛ اسے ابھی تک Deepseek V4 Pro جیسے بڑے آنے والے ماڈلز کا سامنا نہیں کرنا پڑا۔ Huang کے تبصروں سے ظاہر ہوتا ہے کہ OpenAI اپنے سلیکون کو تھرڈ پارٹی ایکسلیریٹرز کے ساتھ ملا کر استعمال کرے گا، تاکہ ہر کام کے لیے بہترین لاگت اور کارکردگی کا امتزاج حاصل کیا جا سکے۔
جوابی نکات
ابتدائی مرحلے کے سیمپلز بڑے پیمانے پر پیداوار، پیداواری شرح (yields) یا طویل مدتی بھروسہ مندی کی ضمانت نہیں دیتے، اس لیے جوش و خروش کو اعتدال میں رکھنا چاہیے۔
آگے کیا دیکھنا ہے
- پروڈکشن رول آؤٹ: کیا OpenAI، Jalapeño کو بڑے پیمانے پر تیار ہونے والا حصہ بنا سکتا ہے، اور وہ کس قیمت پر؟
- سافٹ ویئر اسٹیک: ڈویلپرز کے لیے پروگرامنگ ماڈل اور ٹول چین کتنی پختہ ہوگی؟
- مقابلہ کرنے والوں کا ردعمل: Nvidia اور دیگر وینڈرز مارکیٹ شیئر کے تحفظ کے لیے اپنے روڈ میپس یا قیمتوں میں کیسے تبدیلی لائیں گے؟
- ماڈل اسکیلنگ: کیا Jalapeño ٹریلین پیرامیٹر والے ماڈلز کی اگلی لہر پر اپنی برتری برقرار رکھ سکے گا؟
خلاصہ: کسٹم انفرنس سلیکون ایک محدود تجربے سے نکل کر Nvidia کے ہارڈ ویئر غلبے کے لیے ایک معتبر چیلنج بنتا جا رہا ہے۔
