OpenAI از تراشه استنتاج اختصاصی خود با نام Jalapeño رونمایی کرد و اعلام کرد که این تراشه تا 1.9 برابر نرخ پردازش (throughput) به ازای هر کیلووات را نسبت به شتاب‌دهنده‌های GB200 و GB300 شرکت Nvidia ارائه می‌دهد. این تیم تنها در نُه ماه یک مفهوم را به یک قالب سیلیکونی (silicon die) عملیاتی تبدیل کرد؛ فرآیندی که بسیار سریع‌تر از چرخه معمول دو تا سه ساله برای پردازنده‌های هوش مصنوعی سفارشی است.

چرا این سرعت عمل اهمیت دارد

OpenAI اکنون به جای تکیه صرف بر GPUهای Nvidia، مدل‌های خود را روی سخت‌افزارهای Cerebras، AWS Trainium، AMD و موارد دیگر اجرا می‌کند. با تغییر تمرکز حجم‌های کاری هوش مصنوعی از آموزش (training) به سمت استنتاج (inference)، مصرف انرژی و هزینه به ازای هر پرس‌وجو (query) به عوامل تعیین‌کننده تبدیل می‌شوند. تراشه‌ای که انرژی مورد نیاز برای یک مدل با یک تریلیون پارامتر را نصف کند، می‌تواند هزینه‌های عملیاتی سرویس‌هایی را که روزانه میلیاردها درخواست را مدیریت می‌کنند، به شدت کاهش دهد.

چگونه هوش مصنوعی این تراشه را نوشت

Jalapeño یک ASIC است؛ تراشه‌ای که برای یک هدف ساخته شده است: اجرای مدل‌های زبانی بزرگ (LLM). برخلاف یک GPU با کاربرد عمومی، یک ASIC منطق‌های غیرضروری را حذف کرده و مسیرهای داده را دقیقاً برای الگوهای استنتاج LLM متناسب‌سازی می‌کند. مهندسان OpenAI طراحی این تراشه را با XLS نوشتند؛ یک زبان توصیف سخت‌افزار که به مدل‌های یادگیری ماشین اجازه می‌دهد کد تولید کنند. این شرکت می‌گوید منطق تولیدشده توسط هوش مصنوعی، بیش از نیمی از هسته تراشه را تشکیل می‌دهد و چرخه طراحی را از چندین سال به چند ماه کاهش داده است.

ادعاهای عملکرد در برابر واقعیت

OpenAI سه عدد کلیدی را برای Jalapeño فهرست کرده است:

  • نرخ پردازش به ازای هر کیلووات: 1.5 تا 1.9 برابر بالاتر از GB200/GB300 شرکت Nvidia.
  • تأخیر (Latency): 1.7 تا 3.6 برابر کمتر از همان مدل‌های Nvidia.
  • میزان مصرف توان در یک مدل با یک تریلیون پارامتر: 700 وات در مقابل 1,400 وات در مدل GB300.

اگر این ارقام صحت داشته باشند، یک مرکز داده می‌تواند همان مدل را با نصف هزینه برق اجرا کند و در عین حال پاسخ‌های سریع‌تری ارائه دهد. این ادعاها بر استنتاج تمرکز دارند؛ OpenAI به عملکرد آموزشی (training) اشاره‌ای نکرده است که با تمرکز فعلی این شرکت بر ارائه سرویس‌های اپلیکیشن‌های چت‌محور همخوانی دارد.

این موضوع چه معنایی برای Nvidia دارد

تراشه‌های آتی Blackwell و Vera Rubin شرکت Nvidia بازار شتاب‌دهنده‌های رده‌بالا را هدف قرار داده‌اند. مزیت Nvidia در پشته نرم‌افزاری (software stack) بالغ، پذیرش گسترده توسط توسعه‌دهندگان و انعطاف‌پذیری در وظایف مختلف هوش مصنوعی نهفته است. در مقابل، Jalapeño دستگاهی با کاربرد محدود است که تنها زمانی برنده می‌شود که حجم کاری با تخصص آن مطابقت داشته باشد.

فشار بر Nvidia از دو جهت است. اول، مشتریانی که توانایی خرید یک ASIC سفارشی را دارند، ممکن است برای صرفه‌جویی وعده داده شده، به سراغ آن بروند و سهم Nvidia در بخش استنتاج را کاهش دهند. دوم، این اثبات که هوش مصنوعی می‌تواند به طراحی سخت‌افزار کمک کند، می‌تواند چرخه‌های توسعه رقبا را فشرده کرده و Nvidia را مجبور به تسریع در نقشه راه خود کند.

نکات متقابل و پرسش‌های بی‌پاسخ

  • اکوسیستم نرم‌افزاری: کتابخانه‌های CUDA، ابزارهای پروفایلینگ و پشتیبانی جامعه کاربری، همچنان به Nvidia برتری تعیین‌کننده‌ای برای اکثر توسعه‌دهندگان می‌دهد. ادغام Jalapeño مستلزم زنجیره‌های ابزار (toolchains) جدید و احتمالاً بازنویسی کدها خواهد بود.
  • اعتبارسنجی در دنیای واقعی: این اعداد از آزمایش‌های داخلی OpenAI به دست آمده‌اند. بنچمارک‌های مستقل، داده‌های قابلیت اطمینان بلندمدت و رفتار مقیاس‌پذیری تحت بارهای کاری چند مستأجری (mixed-tenant) هنوز تأیید نشده‌اند.
  • صرفه اقتصادی مقیاس: مزیت هزینه یک ASIC با افزایش حجم تولید بیشتر می‌شود. استفاده داخلی OpenAI ممکن است این سرمایه‌گذاری را توجیه کند، اما مشتریان خارجی ممکن است با قیمت‌های بالاتر به ازای هر تراشه مواجه شوند، مگر اینکه تولید در مقیاس بالا انجام شود.

نگاهی به آینده

در حال حاضر، Jalapeño ثابت می‌کند که یک شتاب نُه ماهه می‌تواند تراشه‌ای تولید کند که روی کاغذ، در حساس‌ترین بخش پشته هوش مصنوعی از نظر هزینه، از GPUهای فعلی بازار بهتر عمل می‌کند. آزمون واقعی این خواهد بود که آیا این مزیت در برابر فشار حجم‌های کاری دنیای واقعی دوام می‌آورد یا خیر.