Au-delà des Transformers : les startups qui redéfinissent la prochaine ère des LLM

L'ère du transformer est confrontée à un goulot d'étranglement fondamental, alors que les exigences de calcul des grands modèles de langage (LLM) atteignent un point de rupture. Si l'article « Attention Is All You Need » de 2017 a posé les bases de l'actuel boom de l'IA, une nouvelle génération de startups s'efforce désormais de remplacer ou de réinventer l'architecture de base pour atteindre une véritable efficacité.

Le goulot d'étranglement des Transformers : pourquoi l'attention dense échoue

Depuis près d'une décennie, le transformer est le moteur de l'industrie de l'IA, propulsé par un mécanisme connu sous le nom d'« attention dense ». Ce processus compare chaque token d'un bloc de texte avec tous les autres via des multiplications à grande échelle. Bien qu'extrêmement précis pour capturer le sens sémantique, sa complexité mathématique évolue mal.

Par exemple, un document de 10 000 mots peut nécessiter d'effectuer environ 50 millions de multiplications pour un transformer. Cette croissance quadratique du calcul entraîne deux défis majeurs : une consommation d'énergie en plein essor et des fenêtres de contexte limitées. Alors qu'OpenAI dépenserait 50 milliards de dollars en calcul cette année et que la demande d'électricité des centres de données devrait doubler d'ici 2030, l'industrie se heurte à un mur, tant sur le plan des coûts que de la physique.

Repenser l'attention : l'essor des mécanismes parcimonieux (sparse)

Pour résoudre la crise de l'efficacité, plusieurs startups tentent de s'éloigner de l'attention dense au profit de l'« attention parcimonieuse » (sparse attention). Au lieu de calculer chaque paire de mots possible, l'attention parcimonieuse se concentre uniquement sur les connexions les plus pertinentes, réduisant ainsi considérablement la charge de calcul.

La startup Subquadratic, basée à Miami, est un leader dans ce domaine avec son modèle SubQ. Contrairement aux mécanismes parcimonieux précédents qui peinaient à maintenir leur précision, Subquadratic affirme que sa technologie rivalise avec les LLM grand public dans des tâches spécialisées telles que le codage et la recherche. Leur approche repose sur un système dynamique qui identifie à la volée quels mots sont réellement importants pour un texte donné, plutôt que de gaspiller des cycles de calcul sur des tokens non pertinents.

Power Retention : vers des résumés glissants

Une autre approche consiste à s'éloigner totalement du mécanisme d'attention. Manifest AI, basée à San Francisco, fait œuvre de pionnier avec une technique appelée « power retention ». Alors que les modèles d'attention parcimonieuse comme SubQ tentent toujours de conserver une image globale de l'ensemble de la fenêtre de contexte, la « power retention » fonctionne en fournissant au modèle un résumé glissant de sa mémoire.

À mesure que de nouvelles informations entrent dans la fenêtre de contexte, le modèle identifie et supprime les données les moins pertinentes, garantissant que la charge de calcul reste gérable, quelle que soit la taille de l'entrée. Manifest AI a déjà démontré la viabilité de cette approche en :

  • Convertissant le modèle open-source StarCoder en PowerCoder grâce à la power retention.
  • Publiant Brumby, un modèle qui, selon eux, rivalise avec les populaires modèles open-source Qwen d'Alibaba.

La capacité d'adapter les modèles transformer existants en modèles de « power retention » avec un réentraînement minimal suggère que la transition vers les « LLM+ » — la prochaine génération de modèles — pourrait se produire bien plus rapidement que prévu.

Points clés à retenir

  • La limite des Transformers : La mise à l'échelle quadratique de l'attention dense rend les LLM actuels incroyablement coûteux à exploiter et difficiles à adapter pour des ensembles de données massifs ou du raisonnement de longue durée.
  • Parcimonie vs Rétention : Les startups attaquent le problème sous deux angles : Subquadratic optimise l'attention via des calculs parcimonieux (SubQ), tandis que Manifest AI la remplace par des résumés glissants (Power Retention).
  • Impératif économique : Alors que les coûts de calcul de l'IA atteignent des dizaines de milliards de dollars, le vainqueur de la prochaine ère de l'IA sera probablement celui qui résoudra la question de l'efficacité plutôt que celle de la simple puissance brute.