در حالی که Cerebras در حال ساخت تراشههای اختصاصی هوش مصنوعی است، استارتاپ فرانسوی Kog عملکرد را از GPUهایی که شرکتها از قبل در اختیار دارند، استخراج میکند. Kog با بازنویسی نرمافزارهای سطح پایین برای سختافزارهای موجود در مراکز داده، گلوگاههای تأخیر (latency) را که باعث کندی جریانهای کاری هوش مصنوعی میشوند، از بین میبرد.
به چالش کشیدن ضرورت سیلیکونهای اختصاصی هوش مصنوعی
صنعت هوش مصنوعی به سمت تراشههای ساختهشده برای استنتاج (inference) تغییر جهت داده است. Gaël Delalleau، مدیرعامل Kog، میگوید این باور که GPUهای استاندارد نمیتوانند رمزگشایی (decoding) را انجام دهند، اشتباه است. GPUهای مدرن — مانند Nvidia H200 و AMD MI300X — پهنای باند حافظهای را ارائه میدهند که نرمافزارهای فعلی آن را بلااستفاده رها میکنند.
Kog Inference Engine (KIE) شرکت Kog، «رمزگشایی بسیار سریع برای تکدرخواست» را هدف قرار داده است؛ ویژگیای که برای اپلیکیشنهای بلادرنگ (real-time) ضروری است. در یک دمو اخیر، این شرکت با استفاده از Laneformer 2B (یک مدل متنباز با ۲ میلیارد پارامتر که برای پشته نرمافزاری آنها بهینه شده است)، به سرعت ۳۰۰۰ توکن در ثانیه (TPS) دست یافت. اگرچه این دمو از یک مدل کوچک استفاده میکند، اما Kog قصد دارد این دستاوردها را به مدلهای زبانی بزرگتر (LLMs) نیز تعمیم دهد.
رویکردی «هکری» به مهندسی GPU
برخلاف ارائهدهندگان مستقل از سختافزار (hardware-agnostic) مانند ZML، Kog عمیقتر عمل میکند. این تیم GPUها را در سطوح اسمبلی (assembly) و باینری (binary) مهندسی معکوس میکند و با سیلیکون مانند مجموعهای از قوانین فیزیکی برخورد میکند که باید بر آنها مسلط شد.
این تمرکز بر سطح پایین، تمام قطرههای کارایی را استخراج میکند، اما هزینه زمان را به همراه دارد. Kog با تیم کوچکی متشکل از ۱۱ مهندس، هفتهها یا ماهها وقت صرف کالبدشکافی هر معماری جدید GPU میکند تا بتواند پشتیبانی از آن را اضافه کند. این روش عملکردی در سطح بالا ارائه میدهد، اما سرعت پوشش دادن سختافزارهای جدید توسط Kog را محدود میکند.
هدف قرار دادن موارد استفاده با ارزش بالای هوش مصنوعی
Kog بر بخشهایی تمرکز دارد که در آنها تأخیر به معنای از دست رفتن درآمد است:
- مهندسی نرمافزار: ابزارهایی مانند Claude Code برای دقایق متوقف میشوند. هدف Kog تبدیل «ساعتها انتظار» به نتایج تقریباً آنی است.
- طراحی اپلیکیشن/بازیهای مولد: خط لولههای تبدیل دستور (prompt) به اپلیکیشن، برای حفظ تعامل کاربران و جریان درآمد، به تکرار و اصلاح سریع نیاز دارند.
نقطه عطف بعدی شرکت، دستیابی به ۱۰ برابر سرعت بیشتر در اولین مدل بزرگمقیاس اصلی خود است. Kog با حمایت Scaleway، Bpifrance و برنامه French Tech 2030، خود را به عنوان یک بازیگر کلیدی در تلاش اروپا برای حاکمیت در حوزه هوش مصنوعی معرفی میکند.
نکات کلیدی
- بهینهسازی به جای سختافزار: Kog با مهندسی نرمافزار بسیار سطح پایین، پهنای باند حافظه GPUهای Nvidia H200 و AMD MI300X را به حد نهایی میرساند.
- شکستن سد تأخیر: این استارتاپ هدف خود را افزایش ۳۰ برابری سرعت استنتاج LLM برای جریانهای کاری حرفهای و بلادرنگ، مانند کدنویسی خودکار و طراحی مولد، قرار داده است.
- مهندسی در سطوح عمیق: Kog با اتخاذ طرز فکر «هکری»، کد اسمبلی و باینری GPU را مهندسی معکوس میکند تا به عملکردی دست یابد که پشتههای نرمافزاری استاندارد قادر به رسیدن به آن نیستند.
Kog، یک استارتاپ فرانسوی، میگوید Kog Inference Engine آن را هدف گرفته است که رمزگشایی مدلهای زبانی بزرگ (LLM) را تا ۳۰ برابر سریعتر روی همان GPUهای Nvidia H200 یا AMD MI300X که اپراتورهای مرکز داده در حال حاضر در اختیار دارند، اجرا کند.
چرا فشار برای سرعت در حال حاضر اهمیت دارد
استنتاج LLM در حال حاضر باعث محدود شدن عملکرد محصولاتی مانند دستیارهای تکمیل کد، تولیدکنندگان محتوای آنی و ابزارهای تعاملی طراحی بازی میشود. در این محیطها، فاصله بین دستور (prompt) کاربر و پاسخ مدل مستقیماً بر بهرهوری و درآمد تأثیر میگذارد. APIهای سطح بالا مانند CUDA بخش بزرگی از پهنای باند حافظه GPU را بلااستفاده رها میکنند، بهویژه در طول رمزگشایی توکنبهتوکن که در موارد استفاده بلادرنگ غالب است.
پاسخ سطح پایین Kog
Kog لایههای نرمافزاری متداول را نادیده میگیرد و مستقیماً با سیلیکون صحبت میکند. مهندسان آن GPU را در سطح اسمبلی مهندسی معکوس میکنند و با سختافزار به جای یک جعبه سیاه برای انتزاع (abstraction)، به عنوان مجموعهای از محدودیتها برای رعایت کردن برخورد میکنند. نتیجه، یک مسیر اجرای سفارشی است که باعث میشود دادهها با ظرفیت نزدیک به کامل در لولههای حافظه GPU جریان یابند.
در یک دمو اخیر، این شرکت Laneformer 2B را — یک مدل متنباز با ۲ میلیارد پارامتر که برای پشته نرمافزاری آن بهینه شده است — اجرا کرد و نرخ عبور (throughput) بالای توکن را گزارش داد. این مدل در مقایسه با سیستمهای تجاری بزرگتر، کوچک است، اما افزایش سرعت نشان میدهد که یک پشته نرمافزاری اختصاصی چه میزان میتواند از همان سختافزار بهرهبرداری کند.
موازنه مهندسی
مزیت این رویکرد با یک منحنی هزینه سنگین همراه است. تیم ۱۱ نفره مهندسان Kog هفتهها یا ماهها وقت صرف کالبدشکافی هر معماری جدید GPU میکند تا بتواند از آن پشتیبانی کند. این عمق کار، عملکرد بالایی را در کارتهای هدفشده به ارمغان میآورد، اما به این معناست که Kog نمیتواند بلافاصله پشتیبانی از هر GPU جدیدی را که وارد بازار میشود، اضافه کند. مشتریان تنها در صورتی سود میبرند که ناوگان آنها شامل GPUهای Nvidia H200 یا AMD MI300X باشد که Kog قبلاً آنها را بهینه کرده است.
چه کسانی سود خواهند برد
- ابزارهای مهندسی نرمافزار – محصولاتی که کد تولید میکنند، مانند Claude Code، اغلب در حالی که مدل در حال پردازش یک درخواست است، برای چندین دقیقه متوقف میشوند. کاهش این زمان انتظار به چند ثانیه، توسعه تعاملی را بسیار روانتر میکند.
- خط لوله طراحی مولد (Generative design pipelines) – استودیوهایی که دستورات متنی را به پروتوتایپهای اپلیکیشن یا داراییهای بازی تبدیل میکنند، برای درگیر نگه داشتن سازندگان به تکرار سریع نیاز دارند. رمزگشایی (decoding) سریعتر، حلقههای طراحی را کوتاهتر کرده و نرخ تبدیل را افزایش میدهد.
هر دو بخش، تأخیر (latency) را مستقیماً به ساعتهای قابل پرداخت از دست رفته یا ریزش مشتری تبدیل میکنند؛ بنابراین، افزایش سرعت ۳۰ برابری میتواند یک مزیت رقابتی تعیینکننده باشد.
تصویر گستردهتر
استراتژی Kog برخلاف روند فعلی صنعت در ساخت سیلیکونهای اختصاصی هوش مصنوعی است. شرکتهایی مانند Cerebras میلیاردها دلار را صرف تراشههایی میکنند که وعده توان عملیاتی (throughput) بالاتر در هر وات را میدهند. Kog استدلال میکند که GPUهای امروزی از قبل پهنای باند حافظه کافی برای رمزگشایی دارند؛ قطعه گمشده، نرمافزاری است که واقعاً بتواند از آن استفاده کند. اگر این ادعا در مقیاس بزرگ نیز صادق باشد، توسعهدهندگان میتوانند ارتقای هزینهبر سختافزار را به تعویق بیندازند و برای دستیابی به استنتاج (inference) نزدیک به زمان واقعی، به ارتقای نرمافزاری تکیه کنند.
چالشهای احتمالی
- بار نگهداری – هر نسل جدید از GPU نیازمند مهندسی معکوس مجدد خواهد بود. با متنوع شدن بازار، این تیم کوچک ممکن است با کمبود نیرو مواجه شود.
- مقیاسپذیری برای مدلهای بزرگتر – در نسخه نمایشی از یک مدل با ۲ میلیارد پارامتر استفاده شده است. مقیاسبندی همین تکنیکها برای سیستمهای بسیار بزرگتر ممکن است با محدودیتهای ظرفیت حافظه مواجه شود یا نیازمند ترفندهای مهندسی اضافی باشد که هنوز فاش نشدهاند.
- مسیرهای جایگزین – ارائهدهندگان ابری در حال حاضر نمونههای (instances) بهینهسازیشده برای استنتاج را ارائه میدهند که تراشهها و نرمافزارهای تخصصی را با هم ترکیب میکنند. برای برخی از حجمهای کاری، سود حاشیهای حاصل از پشته (stack) نرمافزاری Kog ممکن است از راحتی یک سرویس مدیریتشده کمتر باشد.
آنچه باید زیر نظر داشت
- اولین عرضه مدل بزرگ – Kog میگوید نقطه عطف بعدی آن، افزایش سرعت ۱۰ برابری در یک «مدل بزرگمقیاس اصلی» است. فاصله بین نسخه نمایشی ۲ میلیاردی و یک مدل در سطح سازمانی، شفافترین آزمون برای این رویکرد خواهد بود.
- گسترش پشتیبانی از سختافزار – اضافه کردن پشتیبانی از GPUهای جدیدتر یا سایر شتابدهندهها نشان خواهد داد که آیا این مدل سطح پایین (low-level) میتواند با سرعت بالای تغییرات سختافزاری همگام شود یا خیر.
جمعبندی
Kog نشان میدهد که وقتی پشته نرمافزاری را از پایه بازنویسی میکنید، استخراج کار بیشتر از GPUهای موجود امکانپذیر است. وعده رمزگشایی ۳۰ برابر سریعتر LLM میتواند نحوه قیمتگذاری و معماری سرویسهای هوش مصنوعی توسط توسعهدهندگان را تغییر دهد؛ البته به شرطی که شرکت بتواند تلاشهای مهندسی شدیدی را که برای هر قطعه سیلیکون جدید لازم است، حفظ کند.
