Terwijl Cerebras op maat gemaakte AI-chips bouwt, haalt de Franse startup Kog het maximale uit de GPU's die bedrijven al in bezit hebben. Door low-level software voor bestaande datacenterhardware te herschrijven, elimineert Kog de latency-bottlenecks die AI-workflows vertragen.

De noodzaak van op maat gemaakte AI-siliconen ter discussie stellen

De AI-industrie is overgestapt op speciaal ontwikkelde chips voor inference. De CEO van Kog, Gaël Delalleau, stelt dat de overtuiging dat standaard GPU's decoding niet aankunnen, onjuist is. Moderne GPU's — Nvidia H200, AMD MI300X — bieden een geheugenbandbreedte die door de huidige software onbenut blijft.

De Kog Inference Engine (KIE) van Kog richt zich op "extreem snelle single-request decoding", een must-have voor real-time applicaties. In een recente demo behaalde het bedrijf 3.000 tokens per seconde (TPS) met Laneformer 2B, een open-source model met 2 miljard parameters dat is afgestemd op hun stack. De demo maakt gebruik van een klein model, maar Kog is van plan deze winst uit te breiden naar veel grotere LLM's.

Een "hacker"-aanpak voor GPU-engineering

In tegenstelling tot hardware-agnostische aanbieders zoals ZML, gaat Kog de diepte in. Het team voert reverse engineering uit op GPU's op assembly- en binnenniveau, waarbij ze het silicium behandelen als een reeks natuurwetten die beheerst moeten worden.

Die low-level focus haalt elke druppel efficiëntie eruit, maar het kost tijd. Met een klein team van 11 engineers besteedt Kog weken of maanden aan het ontleden van elke nieuwe GPU-architectuur voordat er ondersteuning wordt toegevoegd. De methode levert topkwaliteit prestaties, maar beperkt de snelheid waarmee Kog nieuwe hardware kan ondersteunen.

Gericht op AI-use-cases met een hoge waarde

Kog richt zich op sectoren waar latency gelijkstaat aan omzetverlies:

  • Software engineering: Tools zoals Claude Code lopen minutenlang vast. Kog streeft ernaar om "uren wachten" om te zetten in bijna onmiddellijke resultaten.
  • Generatieve app-/game-design: Prompt-to-app-pipelines hebben snelle iteratie nodig om gebruikers betrokken te houden en de omzet te laten stromen.

De volgende mijlpaal van het bedrijf is een versnelling van 10x op zijn eerste grote grootschalige model. Met steun van Scaleway, Bpifrance en het Franse Tech 2030-programma, positioneert Kog zich als een belangrijke speler in de Europese drang naar AI-soevereiniteit.

Belangrijkste punten

  • Optimalisatie boven hardware: Kog drijft de geheugenbandbreedte van Nvidia H200- en AMD MI300X-GPU's tot het uiterste met extreme low-level software engineering.
  • De latency-barrière doorbreken: De startup streeft naar een 30x boost in LLM-inference-snelheid voor real-time professionele workflows, zoals geautomatiseerde codering en generatief design.
  • Deep-level engineering: Door een "hacker"-mentaliteit aan te nemen, voert Kog reverse engineering uit op GPU-assembly en binaire code om prestaties te bereiken die standaard stacks niet kunnen halen.

Kog, een Franse startup, stelt dat zijn Kog Inference Engine tot doel heeft om large-language-model (LLM) decoding tot 30 keer sneller uit te voeren op dezelfde Nvidia H200- of AMD MI300X-GPU's die datacenterbeheerders al in bezit hebben.

Waarom de drang naar snelheid nu belangrijk is

LLM-inference remt momenteel producten zoals code-completion assistenten, on-the-fly contentgenerators en interactieve game-designtools. In die omgevingen heeft de kloof tussen de prompt van een gebruiker en het antwoord van het model een directe impact op de productiviteit en omzet. High-level API's zoals CUDA laten een groot deel van de geheugenbandbreedte van de GPU onbenut, vooral tijdens token-voor-token decoding, wat de real-time use-cases domineert.

Kog's low-level antwoord

Kog slaat conventionele softwarelagen over en communiceert rechtstreeks met het silicium. De engineers voeren reverse engineering uit op de GPU op assembly-niveau, waarbij ze de hardware behandelen als een reeks beperkingen die nageleefd moeten worden, in plaats van een black box die geabstraheerd moet worden. Het resultaat is een aangepast executiepad dat ervoor zorgt dat gegevens met bijna volledige capaciteit door de geheugenkanalen van de GPU blijven stromen.

In een recente demo draaide het bedrijf Laneformer 2B — een open-source model met 2 miljard parameters dat is afgestemd op zijn stack — en rapporteerde een hoge token-doorvoer. Het model is bescheiden in vergelijking met grotere commerciële systemen, maar de snelheidswinst laat zien wat een speciaal ontwikkelde softwarestack kan extraheren uit dezelfde hardware.

De engineering-trade-off

Het voordeel gaat gepaard met een steile kostencurve. Het team van 11 engineers van Kog besteedt weken of maanden aan het ontleden van elke nieuwe GPU-architectuur voordat deze ondersteund kan worden. Die diepgang levert hoge prestaties op de doelgerichte kaarten, maar het betekent ook dat Kog niet direct ondersteuning kan toevoegen voor elke nieuwe GPU die op de markt komt. Klanten profiteren alleen als hun vloot de Nvidia H200- of AMD MI300X-GPU's bevat die Kog al heeft geoptimaliseerd.

Wie profiteert ervan

  • Software-engineering tools – Producten die code genereren, zoals Claude Code, blijven vaak minutenlang hangen terwijl het model een verzoek verwerkt. Het verkorten van die wachttijd tot enkele seconden zou interactieve ontwikkeling veel vloeiender maken.
  • Generatieve designpipelines – Studio's die tekstuele prompts omzetten in app-prototypes of game-assets hebben behoefte aan snelle iteratie om makers betrokken te houden. Snellere decoding verkort de designloops en verhoogt de conversieratio's.

In beide sectoren vertaalt latentie zich direct in verloren facturabele uren of klantverloop, dus een versnelling van 30× zou een beslissend concurrentievoordeel kunnen zijn.

Het grotere plaatje

De strategie van Kog gaat in tegen de industrietrend om op maat gemaakte AI-silicium te bouwen. Bedrijven zoals Cerebras pompen miljarden in chips die een hogere doorvoer per watt beloven. Kog stelt dat de huidige GPU's al voldoende geheugenbandbreedte hebben voor decoding; het ontbrekende puzzelstukje is software die dit daadwerkelijk kan benutten. Als deze bewering op grote schaal standhoudt, kunnen ontwikkelaars kostbare hardware-upgrades uitstellen en vertrouwen op een software-upgrade om bijna real-time inferentie te bereiken.

Potentiële tegenwind

  • Onderhoudslast – Elke nieuwe GPU-generatie zal nieuwe reverse-engineering vereisen. Naarmate de markt diversifieert, zou het kleine team overbelast kunnen raken.
  • Schaalbaarheid naar grotere modellen – De demo maakte gebruik van een model met 2 miljard parameters. Het opschalen van dezelfde technieken naar veel grotere systemen kan tegen limieten van de geheugencapaciteit aanlopen of extra engineering-trucs vereisen die nog niet zijn onthuld.
  • Alternatieve paden – Cloudproviders bieden al inferentie-geoptimaliseerde instances aan die gespecialiseerde chips en software combineren. Voor sommige workloads weegt de marginale winst van de stack van Kog mogelijk niet op tegen het gemak van een managed service.

Waar op te letten

  • Eerste uitrol voor grote modellen – Kog zegt dat de volgende mijlpaal een 10× versnelling is op een "belangrijk grootschalig model". De kloof tussen de 2B-demo en een model van enterprise-klasse zal de duidelijkste test zijn voor deze aanpak.
  • Uitbreiding van hardwareondersteuning – Het toevoegen van ondersteuning voor nieuwere GPU's of andere versnellers zal aangeven of het low-level model het tempo van de snelle hardware-ontwikkelingen kan bijhouden.

Conclusie

Kog laat zien dat het mogelijk is om meer prestaties uit bestaande GPU's te persen wanneer je de softwarestack vanaf de basis herschrijft. De belofte van 30× snellere LLM-decoding zou de manier waarop ontwikkelaars AI-services beprijzen en ontwerpen volledig kunnen veranderen — mits het bedrijf de intense engineering-inspanning kan volhouden die nodig is voor elk nieuw stuk silicium.