OpenAI از تراشه استنتاج اختصاصی خود با نام Jalapeño رونمایی کرد و اعلام کرد که این تراشه تا 1.9 برابر نرخ پردازش (throughput) به ازای هر کیلووات را نسبت به شتابدهندههای GB200 و GB300 شرکت Nvidia ارائه میدهد. این تیم تنها در نُه ماه یک مفهوم را به یک قالب سیلیکونی (silicon die) عملیاتی تبدیل کرد؛ فرآیندی که بسیار سریعتر از چرخه معمول دو تا سه ساله برای پردازندههای هوش مصنوعی سفارشی است.
چرا این سرعت عمل اهمیت دارد
OpenAI اکنون به جای تکیه صرف بر GPUهای Nvidia، مدلهای خود را روی سختافزارهای Cerebras، AWS Trainium، AMD و موارد دیگر اجرا میکند. با تغییر تمرکز حجمهای کاری هوش مصنوعی از آموزش (training) به سمت استنتاج (inference)، مصرف انرژی و هزینه به ازای هر پرسوجو (query) به عوامل تعیینکننده تبدیل میشوند. تراشهای که انرژی مورد نیاز برای یک مدل با یک تریلیون پارامتر را نصف کند، میتواند هزینههای عملیاتی سرویسهایی را که روزانه میلیاردها درخواست را مدیریت میکنند، به شدت کاهش دهد.
چگونه هوش مصنوعی این تراشه را نوشت
Jalapeño یک ASIC است؛ تراشهای که برای یک هدف ساخته شده است: اجرای مدلهای زبانی بزرگ (LLM). برخلاف یک GPU با کاربرد عمومی، یک ASIC منطقهای غیرضروری را حذف کرده و مسیرهای داده را دقیقاً برای الگوهای استنتاج LLM متناسبسازی میکند. مهندسان OpenAI طراحی این تراشه را با XLS نوشتند؛ یک زبان توصیف سختافزار که به مدلهای یادگیری ماشین اجازه میدهد کد تولید کنند. این شرکت میگوید منطق تولیدشده توسط هوش مصنوعی، بیش از نیمی از هسته تراشه را تشکیل میدهد و چرخه طراحی را از چندین سال به چند ماه کاهش داده است.
ادعاهای عملکرد در برابر واقعیت
OpenAI سه عدد کلیدی را برای Jalapeño فهرست کرده است:
- نرخ پردازش به ازای هر کیلووات: 1.5 تا 1.9 برابر بالاتر از GB200/GB300 شرکت Nvidia.
- تأخیر (Latency): 1.7 تا 3.6 برابر کمتر از همان مدلهای Nvidia.
- میزان مصرف توان در یک مدل با یک تریلیون پارامتر: 700 وات در مقابل 1,400 وات در مدل GB300.
اگر این ارقام صحت داشته باشند، یک مرکز داده میتواند همان مدل را با نصف هزینه برق اجرا کند و در عین حال پاسخهای سریعتری ارائه دهد. این ادعاها بر استنتاج تمرکز دارند؛ OpenAI به عملکرد آموزشی (training) اشارهای نکرده است که با تمرکز فعلی این شرکت بر ارائه سرویسهای اپلیکیشنهای چتمحور همخوانی دارد.
این موضوع چه معنایی برای Nvidia دارد
تراشههای آتی Blackwell و Vera Rubin شرکت Nvidia بازار شتابدهندههای ردهبالا را هدف قرار دادهاند. مزیت Nvidia در پشته نرمافزاری (software stack) بالغ، پذیرش گسترده توسط توسعهدهندگان و انعطافپذیری در وظایف مختلف هوش مصنوعی نهفته است. در مقابل، Jalapeño دستگاهی با کاربرد محدود است که تنها زمانی برنده میشود که حجم کاری با تخصص آن مطابقت داشته باشد.
فشار بر Nvidia از دو جهت است. اول، مشتریانی که توانایی خرید یک ASIC سفارشی را دارند، ممکن است برای صرفهجویی وعده داده شده، به سراغ آن بروند و سهم Nvidia در بخش استنتاج را کاهش دهند. دوم، این اثبات که هوش مصنوعی میتواند به طراحی سختافزار کمک کند، میتواند چرخههای توسعه رقبا را فشرده کرده و Nvidia را مجبور به تسریع در نقشه راه خود کند.
نکات متقابل و پرسشهای بیپاسخ
- اکوسیستم نرمافزاری: کتابخانههای CUDA، ابزارهای پروفایلینگ و پشتیبانی جامعه کاربری، همچنان به Nvidia برتری تعیینکنندهای برای اکثر توسعهدهندگان میدهد. ادغام Jalapeño مستلزم زنجیرههای ابزار (toolchains) جدید و احتمالاً بازنویسی کدها خواهد بود.
- اعتبارسنجی در دنیای واقعی: این اعداد از آزمایشهای داخلی OpenAI به دست آمدهاند. بنچمارکهای مستقل، دادههای قابلیت اطمینان بلندمدت و رفتار مقیاسپذیری تحت بارهای کاری چند مستأجری (mixed-tenant) هنوز تأیید نشدهاند.
- صرفه اقتصادی مقیاس: مزیت هزینه یک ASIC با افزایش حجم تولید بیشتر میشود. استفاده داخلی OpenAI ممکن است این سرمایهگذاری را توجیه کند، اما مشتریان خارجی ممکن است با قیمتهای بالاتر به ازای هر تراشه مواجه شوند، مگر اینکه تولید در مقیاس بالا انجام شود.
نگاهی به آینده
در حال حاضر، Jalapeño ثابت میکند که یک شتاب نُه ماهه میتواند تراشهای تولید کند که روی کاغذ، در حساسترین بخش پشته هوش مصنوعی از نظر هزینه، از GPUهای فعلی بازار بهتر عمل میکند. آزمون واقعی این خواهد بود که آیا این مزیت در برابر فشار حجمهای کاری دنیای واقعی دوام میآورد یا خیر.
