Während Cerebras maßgeschneiderte KI-Chips entwickelt, holt das französische Startup Kog das Maximum an Leistung aus den GPUs heraus, die Unternehmen bereits besitzen. Durch das Umschreiben von Low-Level-Software für bestehende Rechenzentrumshardware eliminiert Kog die Latenzengpässe, die KI-Workflows verlangsamen.
Die Notwendigkeit von spezialisierter KI-Hardware infrage stellen
Die KI-Branche hat sich auf spezialisierte Chips für das Inference konzentriert. Der CEO von Kog, Gaël Delalleau, sagt, dass der Glaube, Standard-GPUs könnten das Decoding nicht bewältigen, falsch sei. Moderne GPUs – Nvidia H200, AMD MI300X – bieten eine Speicherbandbreite, die von aktueller Software ungenutzt bleibt.
Die Kog Inference Engine (KIE) von Kog zielt auf ein „extrem schnelles Single-Request-Decoding“ ab, was für Echtzeit-Anwendungen unerlässlich ist. In einer kürzlich durchgeführten Demo erreichte das Unternehmen 3.000 Tokens pro Sekunde (TPS) mit Laneformer 2B, einem Open-Source-Modell mit 2 Milliarden Parametern, das auf ihren Stack optimiert wurde. Die Demo nutzt ein kleines Modell, aber Kog plant, diese Gewinne auf wesentlich größere LLMs auszuweiten.
Ein „Hacker“-Ansatz für das GPU-Engineering
Im Gegensatz zu hardwareagnostischen Anbietern wie ZML geht Kog tief ins Detail. Das Team betreibt Reverse Engineering an GPUs auf Assembly- und Binärebene und betrachtet das Silizium als eine Reihe physikalischer Gesetze, die es zu meistern gilt.
Dieser Low-Level-Fokus schöpft jedes Quäntchen Effizienz ab, kostet jedoch Zeit. Mit einer schlanken Mannschaft von 11 Ingenieuren verbringt Kog Wochen oder Monate damit, jede neue GPU-Architektur zu analysieren, bevor sie Unterstützung bietet. Die Methode liefert Spitzenleistungen, schränkt jedoch die Geschwindigkeit ein, mit der Kog neue Hardware abdecken kann.
Fokus auf hochkarätige KI-Anwendungsfälle
Kog konzentriert sich auf Sektoren, in denen Latenz gleich Umsatzverlust bedeutet:
- Software Engineering: Tools wie Claude Code stocken minutenlang. Kog zielt darauf ab, „Wartezeiten von Stunden“ in nahezu sofortige Ergebnisse zu verwandeln.
- Generative App-/Spieleentwicklung: Prompt-to-App-Pipelines benötigen schnelle Iterationen, um Nutzer bei der Stange zu halten und den Umsatz zu sichern.
Der nächste Meilenstein des Unternehmens ist eine 10-fache Beschleunigung seines ersten großen Large-Scale-Modells. Unterstützt von Scaleway, Bpifrance und dem Programm French Tech 2030, positioniert sich Kog als wichtiger Akteur im Bestreben Europas nach KI-Souveränität.
Wichtigste Erkenntnisse
- Optimierung statt Hardware: Kog treibt die Speicherbandbreite von Nvidia H200 und AMD MI300X GPUs durch extremen Low-Level-Software-Engineering an ihre Grenzen.
- Durchbrechen der Latenzbarriere: Das Startup strebt eine 30-fache Steigerung der LLM-Inference-Geschwindigkeit für professionelle Echtzeit-Workflows wie automatisiertes Coding und generatives Design an.
- Deep-Level-Engineering: Durch einen „Hacker“-Mindset betreibt Kog Reverse Engineering von GPU-Assembly und Binärcode, um eine Performance zu erreichen, die Standard-Stacks nicht leisten können.
Kog, ein französisches Startup, gibt an, dass seine Kog Inference Engine darauf abzielt, das Decoding von Large Language Models (LLM) bis zu 30-mal schneller auf denselben Nvidia H200 oder AMD MI300X GPUs auszuführen, die Rechenzentrumbetreiber bereits besitzen.
Warum der Drang nach Geschwindigkeit jetzt wichtig ist
LLM-Inference bremst derzeit Produkte wie Code-Completion-Assistenten, On-the-fly-Content-Generatoren und interaktive Spieleentwicklungstools aus. In diesen Szenarien wirkt sich die Lücke zwischen dem Prompt des Nutzers und der Antwort des Modells direkt auf die Produktivität und den Umsatz aus. High-Level-APIs wie CUDA lassen einen großen Teil der GPU-Speicherbandbreite ungenutzt, insbesondere während des Token-für-Token-Decodings, das Echtzeit-Anwendungsfälle dominiert.
Kog’s Low-Level-Lösung
Kog überspringt herkömmliche Software-Ebenen und kommuniziert direkt mit dem Silizium. Seine Ingenieure betreiben Reverse Engineering an der GPU auf Assembly-Ebene und behandeln die Hardware als eine Reihe von Bedingungen, denen zu folgen ist, anstatt sie als eine zu abstrahierende Black Box zu betrachten. Das Ergebnis ist ein maßgeschneiderter Ausführungspfad, der den Datenfluss durch die Speicherleitungen der GPU bei nahezu voller Kapazität aufrechterhält.
In einer kürzlich durchgeführten Demo ließ das Unternehmen Laneformer 2B laufen – ein Open-Source-Modell mit 2 Milliarden Parametern, das auf seinen Stack optimiert wurde – und meldete einen hohen Token-Durchsatz. Das Modell ist bescheiden im Vergleich zu größeren kommerziellen Systemen, aber der Geschwindigkeitsgewinn zeigt, was ein spezialisierter Software-Stack aus derselben Hardware herausholen kann.
Der Engineering-Kompromiss
Der Vorteil geht mit einer steilen Kostenkurve einher. Das 11-köpfige Ingenieurteam von Kog verbringt Wochen oder Monate damit, jede neue GPU-Architektur zu analysieren, bevor sie unterstützt werden kann. Diese Tiefe ermöglicht eine hohe Performance auf den Zielkarten, bedeutet aber auch, dass Kog nicht sofort Unterstützung für jede neue GPU hinzufügen kann, die auf den Markt kommt. Kunden profitieren nur dann, wenn ihre Flotten die Nvidia H200 oder AMD MI300X GPUs enthalten, die Kog bereits optimiert hat.
Wer davon profitiert
- Software-Engineering-Tools – Produkte, die Code generieren, wie etwa Claude Code, stocken oft minutenlang, während das Modell eine Anfrage verarbeitet. Die Reduzierung dieser Wartezeit auf wenige Sekunden würde die interaktive Entwicklung weitaus flüssiger machen.
- Generative Design-Pipelines – Studios, die Text-Prompts in App-Prototypen oder Game-Assets verwandeln, benötigen schnelle Iterationen, um die Kreativen bei der Stange zu halten. Schnelleres Decoding verkürzt Design-Zyklen und steigert die Konversionsraten.
In beiden Sektoren schlägt sich Latenz direkt in verlorenen abrechenbaren Stunden oder Abwanderung (Churn) nieder, sodass ein 30-facher Geschwindigkeitsschub ein entscheidender Wettbewerbsvorteil sein könnte.
Das Gesamtbild
Kogs Strategie widerspricht dem Branchentrend, maßgeschneiderte KI-Chips zu entwickeln. Unternehmen wie Cerebras investieren Milliarden in Chips, die einen höheren Durchsatz pro Watt versprechen. Kog argumentiert, dass heutige GPUs bereits über genügend Speicherbandbreite für das Decoding verfügen; das fehlende Puzzleteil ist die Software, die diese tatsächlich nutzen kann. Sollte sich diese Behauptung im großen Maßstab bewahrheiten, könnten Entwickler kostspielige Hardware-Upgrades aufschieben und sich auf ein Software-Upgrade verlassen, um Inferenz in nahezu Echtzeit zu erreichen.
Potenzielle Herausforderungen
- Wartungsaufwand – Jede neue GPU-Generation wird neues Reverse-Engineering erfordern. Da der Markt diversifiziert, könnte das kleine Team überfordert werden.
- Skalierbarkeit auf größere Modelle – Die Demo verwendete ein Modell mit 2 Milliarden Parametern. Die Skalierung derselben Techniken auf wesentlich größere Systeme könnte an Speicherplatzgrenzen stoßen oder zusätzliche Engineering-Tricks erfordern, die noch nicht bekannt gegeben wurden.
- Alternative Wege – Cloud-Anbieter bieten bereits auf Inferenz optimierte Instanzen an, die spezialisierte Chips und Software bündeln. Bei einigen Workloads könnte der geringfügige Gewinn durch Kogs Stack den Komfort eines Managed Service nicht rechtfertigen.
Worauf man achten sollte
- Erster Rollout eines großen Modells – Kog gibt an, dass der nächste Meilenstein eine 10-fache Beschleunigung bei einem „bedeutenden Large-Scale-Modell“ ist. Die Lücke zwischen der 2-Milliarden-Parameter-Demo und einem Modell auf Enterprise-Niveau wird der deutlichste Test für diesen Ansatz sein.
- Erweiterung der Hardware-Unterstützung – Die Aufnahme von Unterstützung für neuere GPUs oder andere Beschleuniger wird zeigen, ob das Low-Level-Modell mit dem schnellen Hardware-Takt mithalten kann.
Fazit
Kog zeigt, dass es möglich ist, mehr Leistung aus bestehenden GPUs herauszuholen, wenn man den Software-Stack von Grund auf neu schreibt. Das Versprechen eines 30-mal schnelleren LLM-Decodings könnte die Art und Weise, wie Entwickler KI-Dienste bepreisen und entwerfen, grundlegend verändern – vorausgesetzt, das Unternehmen kann den intensiven Engineering-Aufwand aufbringen, der für jedes neue Stück Silizium erforderlich ist.
