Cerebras कस्टम AI चिप्स बनवत असताना, फ्रेंच स्टार्टअप Kog उद्योगांकडे आधीपासून असलेल्या GPUs मधून जास्तीत जास्त कार्यक्षमता (performance) मिळवून देते. विद्यमान डेटासेंटर हार्डवेअरसाठी लो-लेव्हल सॉफ्टवेअर पुन्हा लिहून, Kog AI वर्कफ्लो मंदावणारे लॅटन्सी बॉटलनेक्स (latency bottlenecks) दूर करते.
कस्टम AI सिलिकॉनच्या आवश्यकतेला आव्हान
AI उद्योग आता इन्फरन्ससाठी (inference) खास बनवलेल्या चिप्सकडे वळला आहे. Kog चे CEO, Gaël Delalleau, म्हणतात की, स्टँडर्ड GPUs डिकोडिंग हाताळू शकत नाहीत हा समज चुकीचा आहे. आधुनिक GPUs—Nvidia H200, AMD MI300X—असा मेमरी बँडविड्थ (memory bandwidth) देतात जो सध्याचे सॉफ्टवेअर वापरू शकत नाही (idle ठेवतो).
Kog चे Kog Inference Engine (KIE) "अत्यंत वेगवान सिंगल-रिक्वेस्ट डिकोडिंग" (extremely fast single-request decoding) वर लक्ष केंद्रित करते, जे रिअल-टाइम ॲप्ससाठी अत्यंत आवश्यक आहे. एका अलीकडील डेमोमध्ये, कंपनीने त्यांच्या स्टॅकसाठी ट्यून केलेल्या Laneformer 2B या ओपन-सोर्स 2-बिलियन-पॅरामीटर मॉडेलसह प्रति सेकंद 3,000 टोकन्स (TPS) इतका वेग गाठला. हा डेमो एका लहान मॉडेलचा वापर करतो, परंतु Kog या फायद्यांचा विस्तार मोठ्या LLMs पर्यंत करण्याचा विचार करत आहे.
GPU इंजिनीअरिंगसाठी "हॅकर" दृष्टिकोन
ZML सारख्या हार्डवेअर-अज्ञेयवादी (hardware-agnostic) पुरवठादारांच्या उलट, Kog खोलवर जाऊन काम करते. ही टीम GPUs ला असेंब्ली (assembly) आणि बायनरी (binary) स्तरावर रिव्हर्स-इंजिनीअर करते, आणि सिलिकॉनला आत्मसात करायच्या भौतिक नियमांच्या संचाप्रमाणे मानते.
या लो-लेव्हल फोकसमुळे कार्यक्षमतेचा प्रत्येक अंश मिळवता येतो, परंतु त्यासाठी वेळ लागतो. 11 इंजिनीअर्सच्या लहान टीमसह, Kog प्रत्येक नवीन GPU आर्किटेक्चरला सपोर्ट देण्यापूर्वी त्याचे सखोल विश्लेषण करण्यासाठी आठवडे किंवा महिने खर्च करते. ही पद्धत उच्च दर्जाची कामगिरी देते, परंतु Kog किती वेगाने नवीन हार्डवेअर कव्हर करू शकते यावर मर्यादा आणते.
उच्च-मूल्य असलेल्या AI वापराच्या प्रकरणांना लक्ष्य करणे
Kog अशा क्षेत्रांवर लक्ष केंद्रित करते जिथे लॅटन्सी म्हणजे महसुलाचे नुकसान आहे:
- सॉफ्टवेअर इंजिनीअरिंग: Claude Code सारखी साधने मिनिटांसाठी थांबतात. Kog "तासनतास वाट पाहणे" हे जवळजवळ त्वरित निकालांमध्ये बदलण्याचे उद्दिष्ट ठेवते.
- जनरेटिव्ह ॲप/गेम डिझाइन: वापरकर्त्यांना गुंतवून ठेवण्यासाठी आणि महसूल टिकवून ठेवण्यासाठी प्रॉम्प्ट-टू-ॲप (Prompt-to-app) पाइपलाइनमध्ये जलद पुनरावृत्तीची (iteration) आवश्यकता असते.
कंपनीचे पुढील महत्त्वाचे उद्दिष्ट त्यांच्या पहिल्या मोठ्या स्केलवरील मॉडेलमध्ये 10× वेग वाढवणे हे आहे. Scaleway, Bpifrance आणि French Tech 2030 प्रोग्रामच्या पाठिंब्याने, Kog स्वतःला युरोपच्या AI सार्वभौमत्व मोहिमेतील (AI sovereignty drive) एक प्रमुख खेळाडू म्हणून प्रस्थापित करत आहे.
मुख्य निष्कर्ष
- हार्डवेअरपेक्षा ऑप्टिमायझेशनवर भर: Kog अत्यंत लो-लेव्हल सॉफ्टवेअर इंजिनीअरिंगद्वारे Nvidia H200 आणि AMD MI300X GPUs चा मेमरी बँडविड्थ मर्यादेपर्यंत पोहोचवते.
- लॅटन्सीचा अडथळा दूर करणे: हे स्टार्टअप ऑटोमेटेड कोडिंग आणि जनरेटिव्ह डिझाइन सारख्या रिअल-टाइम प्रोफेशनल वर्कफ्लोसाठी LLM इन्फरन्स वेगात 30× वाढ करण्याचे लक्ष्य ठेवते.
- डीप-लेव्हल इंजिनीअरिंग: "हॅकर" मानसिकता स्वीकारून, Kog GPU असेंब्ली आणि बायनरी कोड रिव्हर्स-इंजिनीअर करते, जेणेकरून स्टँडर्ड स्टॅक्स पोहोचू शकत नाहीत अशी कामगिरी साध्य करता येईल.
फ्रेंच स्टार्टअप Kog म्हणते की, त्यांचे Kog Inference Engine हे डेटा-सेंटर ऑपरेटर्सकडे आधीपासून असलेल्या Nvidia H200 किंवा AMD MI300X GPUs वर लार्ज-लँग्वेज-मॉडेल (LLM) डिकोडिंग 30 पटीने वेगाने चालवण्याचे उद्दिष्ट ठेवते.
वेगासाठीचा हा प्रयत्न आता का महत्त्वाचा आहे
LLM इन्फरन्समुळे आता कोड-कम्प्लिशन असिस्टंट, ऑन-द-फ्लाई कंटेंट जनरेटर्स आणि इंटरअॅक्टिव्ह गेम-डिझाइन टूल्स यांसारख्या उत्पादनांचा वेग मंदावतो. अशा परिस्थितीत, वापरकर्त्याचा प्रॉम्प्ट आणि मॉडेलचा प्रतिसाद यातील अंतर थेट उत्पादकता आणि महसुलावर परिणाम करते. CUDA सारखे हाय-लेव्हल APIs, विशेषतः टोकन-बाय-टोकन डिकोडिंग दरम्यान, GPU मेमरी बँडविड्थचा मोठा भाग वापरू न देता रिकामी (idle) ठेवतात, जे रिअल-टाइम वापराच्या प्रकरणांमध्ये प्रामुख्याने घडते.
Kog चे लो-लेव्हल उत्तर
Kog पारंपारिक सॉफ्टवेअर लेयर्स वगळून थेट सिलिकॉनशी संवाद साधते. त्यांचे इंजिनीअर्स GPU ला असेंब्ली स्तरावर रिव्हर्स-इंजिनीअर करतात, आणि हार्डवेअरला 'अॅब्स्ट्रॅक्ट' करायच्या ब्लॅक बॉक्सऐवजी पाळायचे असलेले नियमांचे संच (constraints) म्हणून पाहतात. याचा परिणाम म्हणजे एक कस्टम एक्झिक्यूशन पाथ (execution path) मिळतो, जो GPU च्या मेमरी पाईप्समधून डेटा जवळजवळ पूर्ण क्षमतेने प्रवाहित ठेवतो.
एका अलीकडील डेमोमध्ये कंपनीने Laneformer 2B—त्यांच्या स्टॅकसाठी ट्यून केलेले 2-बिलियन-पॅरामीटर ओपन-सोर्स मॉडेल—चालवले आणि उच्च टोकन थ्रूपुट (token throughput) नोंदवला. मोठ्या व्यावसायिक प्रणालींच्या तुलनेत हे मॉडेल लहान आहे, परंतु वेगातील ही वाढ दाखवते की एक खास बनवलेला सॉफ्टवेअर स्टॅक त्याच हार्डवेअरमधून किती कार्यक्षमता मिळवू शकतो.
इंजिनीअरिंगमधील तडजोड
या फायद्यासोबतच एक मोठी किंमतही चुकवावी लागते. Kog ची 11 इंजिनीअर्सची टीम प्रत्येक नवीन GPU आर्किटेक्चरला सपोर्ट देण्यापूर्वी त्याचे सखोल विश्लेषण करण्यासाठी आठवडे किंवा महिने खर्च करते. या सखोलतेमुळे लक्ष्यित कार्ड्सवर उच्च कामगिरी मिळते, परंतु याचा अर्थ असाही आहे की बाजारात येणाऱ्या प्रत्येक नवीन GPU साठी Kog त्वरित सपोर्ट देऊ शकत नाही. ग्राहकांना फायदा तेव्हाच होतो जेव्हा त्यांच्याकडे Nvidia H200 किंवा AMD MI300X GPUs असतील जे Kog ने आधीच ऑप्टिमाइझ केले आहेत.
कोणाला फायदा होईल
- Software-engineering tools – Products that generate code, such as Claude Code, often stall for minutes while the model processes a request. Cutting that wait to a few seconds would make interactive development far more fluid.
- Generative design pipelines – Studios turning textual prompts into app prototypes or game assets need rapid iteration to keep creators engaged. Faster decoding shortens design loops and boosts conversion rates.
Both sectors translate latency directly into lost billable hours or churn, so a 30× speed boost could be a decisive competitive edge.
The broader picture
Kog’s strategy runs counter to the industry trend of building custom AI silicon. Companies like Cerebras pour billions into chips that promise higher throughput per watt. Kog argues that today’s GPUs already have enough memory bandwidth for decoding; the missing piece is software that can actually use it. If the claim holds at scale, developers could defer costly hardware upgrades and rely on a software upgrade to achieve near-real-time inference.
Potential headwinds
- Maintenance burden – Every new GPU generation will require fresh reverse-engineering. As the market diversifies, the small team could be stretched thin.
- Scalability to larger models – The demo used a 2 B-parameter model. Scaling the same techniques to much larger systems may hit memory-capacity limits or demand additional engineering tricks not yet disclosed.
- Alternative paths – Cloud providers already offer inference-optimized instances that bundle specialized chips and software. For some workloads, the marginal gain from Kog’s stack may not outweigh the convenience of a managed service.
What to watch
- First large-model rollout – Kog says its next milestone is a 10× speedup on a “major large-scale model.” The gap between the 2 B demo and an enterprise-grade model will be the clearest test of the approach.
- Hardware support expansion – Adding support for newer GPUs or other accelerators will signal whether the low-level model can keep pace with rapid hardware cadence.
Takeaway
Kog shows that squeezing more work from existing GPUs is possible when you rewrite the software stack from the ground up. The promise of 30× faster LLM decoding could reshape how developers price and architect AI services—provided the company can sustain the intense engineering effort needed for each new piece of silicon.
