نکات برجسته بنچمارک

کنفرانس Hot Chips اعدادی را فاش کرد که توسط یک شرکت مستقل با استفاده از مجموعه InferenceX تأیید شده‌اند. OpenAI از Jalapeño به عنوان یک شتاب‌دهنده استنتاج همه‌منظوره یاد می‌کند؛ این تراشه مدل‌ها را اجرا می‌کند اما آن‌ها را آموزش نمی‌دهد. در آزمایش‌ها، این تراشه:

  • ۱.۵ تا ۱.۹ برابر کار بیشتر به ازای هر وات در حداکثر توان عملیاتی نسبت به پیشروهای فعلی ارائه داد.
  • تأخیر را ۱.۷ تا ۳.۶ برابر کاهش داد، که در بخش‌های تعاملی به میزان ۲.۱ تا ۴.۱ برابر بهبود یافت.

نتایج اختصاصی برای هر مدل:

  • GPT-OSS 120B: حدود ۱۴۰۰ توکن در ثانیه برای هر کاربر.
  • Deepseek R1 670B: حدود ۷۰۰ توکن در ثانیه در یک درخواست همزمان واحد.
  • Kimi K2.5 1T: در مجموعه با عملکرد بالا آزمایش شده است (اعداد دقیق منتشر نشده است).

OpenAI تأکید کرد که این ارقام بدون استفاده از رمزگشایی حدسی (speculative decoding) یا پیش‌بینی چندتوکنی (multi-token prediction) به‌دست آمده‌اند؛ ترفندهایی که بسیاری از رقبا برای بالا بردن اعداد و ارقام تبلیغاتی خود از آن‌ها استفاده می‌کنند.

نحوه ساخت Jalapeño

OpenAI طراحی این تراشه را در نُه ماه با همکاری Broadcom به پایان رساند. این شرکت مدل‌های خود را در چرخه طراحی وارد کرد تا فرآیند نقشه‌کشی، برنامه‌نویسی و بهینه‌سازی را تسریع کند؛ روشی که «طراحی سیلیکون به کمک هوش مصنوعی» نامیده می‌شود. این سرعت عمل، نشان‌دهنده تغییری نسبت به چرخه‌های چندساله است که زمانی مشخصه تولید سیلیکون‌های با عملکرد بالا بود.

پیامدها برای پیشتازی Nvidia

Nvidia بر عملکرد خام و اکوسیستم CUDA تکیه دارد. داده‌های جدید، برتری عملکردی این شرکت را به چالشی جدی تبدیل می‌کند. تحلیلگران هشدار می‌دهند که اگر شرکت‌های هوش مصنوعی بیشتری سیلیکون‌های استنتاج سفارشی با کارایی مشابه عرضه کنند، ممکن است توسعه‌دهندگان از CUDA فاصله بگیرند و این امر فضا را برای پشته‌های (stacks) جایگزین و یک بازار پراکنده باز کند.

استراتژی سیگنال ترکیبی OpenAI

کلی هوانگ (Kelly Huang)، مدیر مالی شرکت، Jalapeño را به عنوان بخشی از یک برنامه محاسباتی گسترده‌تر معرفی کرد، نه جایگزینی کامل برای شرکای فعلی. OpenAI همچنان در حجم‌های کاری مختلف با Nvidia، AMD، AWS و Cerebras همکاری می‌کند. Jalapeño فعلاً یک نمونه مهندسی است و هنوز با بزرگ‌ترین مدل‌های آینده مانند Deepseek V4 Pro روبرو نشده است. اظهارات هوانگ نشان می‌دهد که OpenAI سیلیکون‌های خود را با شتاب‌دهنده‌های شخص ثالث ترکیب خواهد کرد تا بهترین ترکیب هزینه-عملکرد را برای هر وظیفه دنبال کند.

نکات متقابل

نمونه‌های مراحل اولیه، تولید انبوه، بازدهی (yields) یا قابلیت اطمینان طولانی‌مدت را تضمین نمی‌کنند، بنابراین باید در برخورد با این هیجانات احتیاط کرد.

آنچه باید در آینده زیر نظر داشت

  • عرضه تولیدی: آیا OpenAI می‌تواند Jalapeño را به یک قطعه تولید انبوه تبدیل کند، و با چه قیمتی؟
  • پشته نرم‌افزاری: مدل برنامه‌نویسی و زنجیره ابزار (toolchain) برای توسعه‌دهندگان تا چه حد بالغ خواهد بود؟
  • پاسخ رقبا: Nvidia و سایر فروشندگان چگونه نقشه‌راه‌ها یا قیمت‌گذاری خود را برای محافظت از سهم بازار تغییر خواهند داد؟
  • مقیاس‌پذیری مدل: آیا Jalapeño برتری خود را در برابر موج بعدی مدل‌های تریلیون پارامتری حفظ خواهد کرد؟

نتیجه‌گیری: سیلیکون استنتاج سفارشی از یک آزمایش محدود در حال تبدیل شدن به یک چالش جدی برای سلطه سخت‌افزاری Nvidia است.