Le RadixAttention de SGLang a réduit le temps de latence initial (time-to-first-token) à 68 ms sur une configuration équipée de deux RTX 3090, tandis que le PagedAttention de vLLM stagnait à 184 ms — un écart de latence de 82,9 % qui rend les interactions avec des agents multi-tours nettement plus fluides.
Les deux projets tentent d'accélérer l'inférence des grands modèles de langage (LLM), mais le benchmark cible des charges de travail qui alimentent les assistants autonomes : de longs prompts système, des schémas d'appel d'outils (tool-calling) et un historique évolutif des échanges utilisateur-assistant. Ces jetons (tokens) répétés résident dans la mémoire du GPU ; si le cache n'est pas géré efficacement, ils deviennent un goulot d'étranglement de calcul qui ralentit la conversation.
La charge de travail qui a fait pencher la balance
Les serveurs LLM traditionnels sont optimisés pour un échange unique — prompt de l'utilisateur, réponse du modèle, terminé. Les agents modernes, en revanche, conservent un « état de conversation » qui peut s'étendre sur des dizaines de tours, chacun ajoutant des centaines de jetons au cache. La suite de tests a rejoué une telle boucle multi-tours sur deux cartes RTX 3090, mesurant :
- Temps de latence initial (TTFT) – délai avant l'apparition du premier jeton après le début d'un nouveau tour.
- Latence globale – temps moyen par jeton sur l'ensemble de la boucle.
- Débit soutenu – jetons traités par seconde lorsque la boucle s'exécute en continu.
- Taux de réussite du cache (cache-hit ratio) – proportion de jetons réutilisés à partir du cache clé-valeur (KV) au lieu d'être recalculés.
SGLang a battu vLLM sur chaque métrique : 68 ms contre 184 ms pour le TTFT, une réduction de latence de 82,9 %, un débit supérieur de 39,8 % et un taux de réussite du cache de 96,8 % contre 84,2 % pour vLLM.
PagedAttention vs RadixAttention
Les deux moteurs stockent les paires KV intermédiaires dans la mémoire du GPU, mais ils organisent cette mémoire différemment.
- PagedAttention (vLLM) découpe le cache en blocs de taille fixe. Si un prompt se termine au milieu d'un bloc, les jetons restants doivent être recalculés à chaque tour car le bloc ne peut pas être réutilisé partiellement. L'approche est simple et fonctionne lorsque les prompts s'alignent sur les limites des blocs, mais elle gaspille des cycles sur les jetons de « bordure » qui changent le plus souvent dans les boucles d'agents.
- RadixAttention (SGLang) traite le cache comme un arbre. Il trouve le plus long préfixe commun entre le prompt actuel et ce qui est déjà en cache, indépendamment des limites de blocs, et élague les feuilles inutilisées. Cela permet à un prompt système massif de rester ancré dans la mémoire du GPU pendant que seul le tour le plus récent est traité, augmentant ainsi le taux de réussite du cache et réduisant le travail redondant.
Quand chaque moteur excelle
| Scénario | Moteur privilégié |
|---|---|
| Agents autonomes multi-tours, appels d'outils intensifs, raisonnement tree-of-thought | SGLang (RadixAttention) |
| Large support matériel (incluant les accélérateurs AMD et Gaudi), décodage spéculatif, modèles vision-langage | vLLM (PagedAttention) |
La distinction ne repose pas uniquement sur la performance ; elle concerne aussi l'écosystème. La compatibilité matérielle plus large de vLLM en fait un choix par défaut plus sûr pour les organisations disposant de clusters de calcul hétérogènes. Sa fonctionnalité de décodage spéculatif — qui génère plusieurs candidats de jetons en parallèle — peut accélérer la génération en un seul tour, un créneau où le cache basé sur un arbre de RadixAttention offre moins d'avantages.
L'essentiel
Pour les développeurs qui construisent des agents multi-tours jonglant avec de longs prompts et des mises à jour incrémentielles, le RadixAttention de SGLang offre une expérience nettement plus rapide et plus efficace en termes de cache sur les GPU grand public. Les équipes qui ont besoin d'une large couverture matérielle ou qui se spécialisent dans la génération en un seul tour peuvent encore privilégier vLLM. Le choix dépend désormais de si la charge de travail est « orientée agents » ou « axée sur la diversité matérielle ».
