AWS a ajouté une option de « routage sensible au préfixe » (prefix-aware routing) à Amazon SageMaker Inference, promettant des taux de hits de cache plus élevés et une latence nettement inférieure pour les clients qui exécutent des grands modèles de langage (LLM) sur leur propre infrastructure. Ce changement est important car il permet de réduire considérablement la latence et les coûts de calcul GPU.
Pourquoi la latence des LLM est importante
Lorsqu'un LLM reçoit une requête, il recalcule normalement l'attention sur l'ensemble du prompt — une étape coûteuse qui augmente avec chaque nouveau token ajouté. Si le modèle peut réutiliser le cache d'attention d'une requête précédente, il n'a besoin de traiter que la nouvelle partie du texte. Les charges de travail qui envoient de manière répétée le même prompt système ou qui maintiennent un historique de conversation sont des candidates idéales pour la réutilisation du cache.
Dans la configuration par défaut de SageMaker, les requêtes entrantes sont distribuées de manière aléatoire parmi l'ensemble des instances d'inférence. Une distribution aléatoire signifie qu'une requête qui aurait pu bénéficier d'un cache chaud atterrit souvent sur une instance froide, forçant un recalcul complet. Le résultat est une latence plus élevée et des cycles GPU supplémentaires qui se traduisent directement par une augmentation des dépenses.
Comment fonctionne le routage sensible au préfixe
Le nouveau mode de routage conserve une carte légère des préfixes de requêtes récents — essentiellement la première partie d'un prompt qui a tendance à rester constante d'un appel à l'autre. Lorsqu'une nouvelle requête arrive, SageMaker consulte la carte et redirige la requête vers une instance qui a déjà traité le même préfixe. Si l'instance détient toujours le cache d'attention pertinent, le modèle peut sauter la majeure partie du travail et générer la réponse plus rapidement.
Points clés :
- Aucune modification de code requise – la fonctionnalité réside entièrement dans la couche du service d'inférence.
- S'applique uniquement aux modèles auto-hébergés – les offres gérées telles que l'API d'OpenAI ou le service d'Anthropic ne sont pas affectées.
- Transparent pour les applications – l'URL du point de terminaison SageMaker et le contrat d'API restent inchangés.
Qui peut en bénéficier
Les entreprises qui hébergent des LLM sur SageMaker le font pour diverses raisons, allant de la confidentialité des données au contrôle des coûts. Pour celles qui exploitent des chatbots de support, des assistants de vente ou tout agent interactif utilisant de manière répétée un prompt système fixe, cet ajustement du routage peut réduire les temps de réponse moyens. Côté coûts, chaque hit de cache évite au GPU de réévaluer la partie partagée du prompt.
Limites et contre-arguments
L'avantage repose sur la présence de préfixes répétés. Les prompts hautement variables — tels que des requêtes ponctuelles ou des messages système générés dynamiquement — ne bénéficieront pas du même avantage de taux de hits de cache.
Comme la fonctionnalité est limitée aux déploiements auto-hébergés, les clients liés à des services de LLM gérés ne peuvent pas en profiter.
L'essentiel : Le routage sensible au préfixe offre aux utilisateurs de SageMaker un moyen simple et sans code de réduire la latence des charges de travail LLM répétitives tout en diminuant les coûts GPU. Pour les organisations qui hébergent déjà des modèles sur la plateforme, cette mise à jour est un ajustement à faible risque qui pourrait se traduire par des interactions utilisateur plus rapides et des factures moins élevées.
