Mentre Cerebras costruisce chip AI personalizzati, la startup francese Kog estrae il massimo delle prestazioni dalle GPU che le aziende già possiedono. Riscrivendo il software di basso livello per l'hardware esistente nei datacenter, Kog elimina i colli di bottiglia della latenza che rallentano i flussi di lavoro dell'IA.

Mettere in discussione la necessità di silicio AI personalizzato

L'industria dell'IA si è spostata verso chip progettati specificamente per l'inferenza. Il CEO di Kog, Gaël Delalleau, afferma che la convinzione che le GPU standard non possano gestire la decodifica è errata. Le GPU moderne — Nvidia H200, AMD MI300X — offrono una larghezza di banda della memoria che l'attuale software lascia inutilizzata.

Il Kog Inference Engine (KIE) di Kog punta alla "decodifica a singola richiesta estremamente veloce", un requisito essenziale per le applicazioni in tempo reale. In una recente demo, l'azienda ha raggiunto i 3.000 token al secondo (TPS) con Laneformer 2B, un modello open-source da 2 miliardi di parametri ottimizzato per il loro stack. La demo utilizza un modello piccolo, ma Kog prevede di estendere questi vantaggi a LLM molto più grandi.

Un approccio "hacker" all'ingegneria delle GPU

A differenza dei fornitori hardware-agnostic come ZML, Kog scava in profondità. Il team esegue l'ingegneria inversa delle GPU a livello di assembly e binario, trattando il silicio come un insieme di leggi fisiche da padroneggiare.

Questa attenzione al basso livello estrae ogni briciolo di efficienza, ma richiede tempo. Con un team snello di 11 ingegneri, Kog impiega settimane o mesi per analizzare ogni nuova architettura GPU prima di aggiungerne il supporto. Il metodo garantisce prestazioni di alto livello, ma limita la velocità con cui Kog può coprire nuovi hardware.

Puntare a casi d'uso dell'IA ad alto valore

Kog si concentra su settori in cui la latenza si traduce in perdita di entrate:

  • Ingegneria del software: Strumenti come Claude Code si bloccano per minuti. Kog punta a trasformare le "ore di attesa" in risultati quasi istantanei.
  • Design generativo di app/giochi: Le pipeline prompt-to-app necessitano di un'iterazione rapida per mantenere gli utenti coinvolti e garantire il flusso di entrate.

Il prossimo traguardo dell'azienda è un incremento di velocità di 10 volte sul suo primo grande modello su larga scala. Sostenuta da Scaleway, Bpifrance e dal programma French Tech 2030, Kog si posiziona come un attore chiave nella spinta verso la sovranità dell'IA in Europa.

Punti chiave

  • Ottimizzazione rispetto all'hardware: Kog spinge al limite la larghezza di banda della memoria delle GPU Nvidia H200 e AMD MI300X attraverso un'ingegneria software di estremo basso livello.
  • Rompere la barriera della latenza: La startup punta a un incremento di 30 volte della velocità di inferenza degli LLM per flussi di lavoro professionali in tempo reale, come la codifica automatizzata e il design generativo.
  • Ingegneria di basso livello: Adottando una mentalità da "hacker", Kog esegue l'ingegneria inversa del codice assembly e binario delle GPU per raggiungere prestazioni che gli stack standard non possono ottenere.

Kog, una startup francese, afferma che il suo Kog Inference Engine punta a eseguire la decodifica dei modelli linguistici di grandi dimensioni (LLM) fino a 30 volte più velocemente sulle stesse GPU Nvidia H200 o AMD MI300X che gli operatori di data center già possiedono.

Perché la spinta verso la velocità è importante ora

L'inferenza degli LLM oggi rallenta prodotti come gli assistenti per il completamento del codice, i generatori di contenuti istantanei e gli strumenti interattivi di game design. In questi contesti, il divario tra il prompt dell'utente e la risposta del modello impatta direttamente sulla produttività e sui ricavi. API di alto livello come CUDA lasciano una vasta porzione della larghezza di banda della memoria della GPU inutilizzata, specialmente durante la decodifica token per token, che domina i casi d'uso in tempo reale.

La risposta di basso livello di Kog

Kog salta i livelli software convenzionali e comunica direttamente con il silicio. I suoi ingegneri eseguono l'ingegneria inversa della GPU a livello di assembly, trattando l'hardware come un insieme di vincoli da rispettare piuttosto che come una black box da astrarre. Il risultato è un percorso di esecuzione personalizzato che mantiene il flusso di dati attraverso le pipeline di memoria della GPU a una capacità quasi massima.

In una recente demo, l'azienda ha eseguito Laneformer 2B — un modello open-source da 2 miliardi di parametri ottimizzato per il suo stack — e ha riportato un elevato throughput di token. Il modello è modesto rispetto ai sistemi commerciali più grandi, ma il guadagno di velocità dimostra ciò che uno stack software dedicato può estrarre dallo stesso hardware.

Il compromesso ingegneristico

Il vantaggio comporta una curva dei costi ripida. Il team di 11 ingegneri di Kog impiega settimane o mesi per analizzare ogni nuova architettura GPU prima che possa essere supportata. Questa profondità garantisce prestazioni elevate sulle schede mirate, ma significa anche che Kog non può aggiungere istantaneamente il supporto per ogni nuova GPU che arriva sul mercato. I clienti ne beneficiano solo se i loro parchi macchine includono le GPU Nvidia H200 o AMD MI300X che Kog ha già ottimizzato.

Chi ne trarrà beneficio

  • Strumenti di ingegneria del software – I prodotti che generano codice, come Claude Code, spesso si bloccano per minuti mentre il modello elabora una richiesta. Ridurre tale attesa a pochi secondi renderebbe lo sviluppo interattivo molto più fluido.
  • Pipeline di design generativo – Gli studi che trasformano prompt testuali in prototipi di app o asset per videogiochi necessitano di un'iterazione rapida per mantenere alto l'impegno dei creatori. Una decodifica più veloce accorcia i cicli di progettazione e aumenta i tassi di conversione.

Entrambi i settori traducono direttamente la latenza in ore fatturabili perse o abbandono (churn), quindi un incremento di velocità di 30× potrebbe rappresentare un vantaggio competitivo decisivo.

Il quadro generale

La strategia di Kog va contro la tendenza del settore di costruire silicio AI personalizzato. Aziende come Cerebras investono miliardi in chip che promettono un throughput più elevato per watt. Kog sostiene che le GPU odierne abbiano già una larghezza di banda della memoria sufficiente per la decodifica; l'elemento mancante è un software in grado di utilizzarla effettivamente. Se questa affermazione si rivelasse valida su larga scala, gli sviluppatori potrebbero rimandare costosi aggiornamenti hardware e fare affidamento su un aggiornamento software per ottenere un'inferenza quasi in tempo reale.

Possibili ostacoli

  • Onere di manutenzione – Ogni nuova generazione di GPU richiederà nuovi processi di reverse engineering. Con la diversificazione del mercato, il piccolo team potrebbe trovarsi in difficoltà.
  • Scalabilità verso modelli più grandi – La demo ha utilizzato un modello da 2 miliardi di parametri. Scalare le stesse tecniche su sistemi molto più grandi potrebbe scontrarsi con i limiti della capacità di memoria o richiedere ulteriori trucchi ingegneristici non ancora rivelati.
  • Percorsi alternativi – I provider cloud offrono già istanze ottimizzate per l'inferenza che combinano chip specializzati e software. Per alcuni carichi di lavoro, il guadagno marginale derivante dallo stack di Kog potrebbe non superare la comodità di un servizio gestito.

Cosa osservare

  • Primo rilascio su modelli di grandi dimensioni – Kog afferma che il suo prossimo traguardo è un incremento di velocità di 10× su un "importante modello su larga scala". Il divario tra la demo da 2 miliardi di parametri e un modello di livello enterprise sarà il test più chiaro per questo approccio.
  • Espansione del supporto hardware – L'aggiunta del supporto per nuove GPU o altri acceleratori segnalerà se il modello di basso livello può tenere il passo con la rapida cadenza dell'hardware.

In sintesi

Kog dimostra che è possibile estrarre maggiori prestazioni dalle GPU esistenti riscrivendo lo stack software da zero. La promessa di una decodifica LLM 30 volte più veloce potrebbe cambiare il modo in cui gli sviluppatori definiscono i prezzi e l'architettura dei servizi AI, a patto che l'azienda riesca a sostenere l'intenso sforzo ingegneristico richiesto per ogni nuovo componente di silicio.