Chaque nouvelle sortie de modèle déclenche le même débat lassant. Les commentateurs se précipitent pour couronner un vainqueur et déclarer le niveau précédent obsolète. Avec GPT-5.6 Luna qui côtoie Terra et Sol, le récit s'écrit de lui-même : Luna est suffisamment abordable et performant pour rendre Terra non pertinent. C'est une erreur. Il est également coûteux. Choisir un modèle pour vos agents de codage n'est pas un concours de beauté, une question d'identité d'équipe ou une course aux benchmarks. C'est une politique opérationnelle. Les équipes qui intériorisent cette distinction dépenseront moins, avanceront plus vite et casseront moins de choses que les équipes qui choisissent par défaut le modèle le plus puissant pour chaque requête.
Votre choix par défaut devrait être l'outil le moins cher qui convienne
Luna est le segment économique, et ce n'est pas un compliment en moins. Il excelle dans les tâches délimitées, explicites et simples. Pensez à la classification, au résumé, aux courtes modifications de code et à la recherche de premier niveau. Lorsqu'un agent analyse un ticket de support pour lui attribuer une étiquette de priorité, Luna suffit. Lorsqu'il renomme une variable dans quelques fichiers ou rédige un résumé d'un paragraphe d'un git diff, Luna suffit. Ce sont des tâches à portée étroite, avec des entrées claires et des sorties objectivement vérifiables.
L'effet économique est ce qui change la donne. Luna est peu coûteux. À haut volume, cela fait passer l'automatisation d'une cérémonie onéreuse à une véritable infrastructure. Vous ne comptez plus les tokens, vous commencez à mesurer le débit. Un modèle bon marché qui traite quatre-vingts pour cent des tâches de routine est plus précieux qu'un modèle coûteux qui en traite quatre-vingt-cinq pour cent si ces cinq pour cent supplémentaires ne changent pas le résultat. Si Luna génère un test unitaire en deux secondes et que Terra en génère un légèrement plus propre en huit secondes pour cinq fois le coût, le calcul ne fonctionne que si quelqu'un audite soigneusement chaque ligne. La plupart du temps, personne ne le fait. Luna devrait être votre choix par défaut pour les travaux délimités précisément parce que la plupart des travaux sont délimités.
Passez au niveau supérieur lorsque les limites s'estompent
Terra n'est pas inutile. C'est votre niveau d'escalade, et il justifie sa place sur les tâches sans limites claires. Utilisez-le lorsque l'objectif est mal spécifié ou lorsque le travail implique des systèmes complexes tels que des chemins de déploiement, des changements inter-modules ou le triage d'incidents. Un chemin de déploiement qui serpente à travers les environnements de staging, de canary et de production avec des feature flags n'a pas de fiche technique bien nette. Un refactoring qui touche à la logique de facturation et qui se répercute discrètement sur le pipeline de reporting n'est pas une tâche délimitée. Un incident de production où les logs hurlent à propos de timeouts d'API, mais dont la cause racine réside dans un script de migration du trimestre dernier, nécessite du jugement.
Terra apporte ce jugement. Il sépare les symptômes des causes. Luna pourrait patcher une boucle de retry pour stopper l'hémorragie. Terra demande si la boucle de retry doit exister du tout, ou si l'architecture de timeout sous-jacente est le véritable problème. Cette différence est cruciale lorsqu'une mauvaise correction transforme un ralentissement temporaire en une défaillance en cascade. Un modèle plus puissant qui empêche une mauvaise migration en production vaut le prix s'il épargne une journée entière de nettoyage à un ingénieur. Un incident évité finance des mois de marge d'escalade.
Sol est votre police d'assurance, pas votre outil quotidien
Sol existe pour les cas où une capacité supplémentaire justifie le coût élevé. Utilisez-le pour les revues à haut risque ou les changements architecturaux. Reconstruire le flux d'authentification, repenser le sharding de la base de données ou approuver une pull request qui touche à la passerelle de paiement ne sont pas des événements quotidiens. Ce sont des événements majeurs. Sol ne devrait pas être votre choix par défaut. Il devrait être votre gestionnaire d'exceptions, invoqué lorsque le coût d'un échec est trop élevé pour que des modèles moins chers puissent le supporter seuls.
Pour la catégorie la plus risquée, associez Sol à un vérificateur déterministe. Laissez Sol suggérer le changement de schéma ou raisonner sur les compromis architecturaux. Laissez votre pipeline CI, l'analyse statique et vos tests d'intégration confirmer les détails mécaniques. Le modèle apporte l'intuition. Le vérificateur apporte les garanties. C'est cette combinaison qui vous protège lorsque le rayon d'impact est le plus large.
Construisez un routeur, pas une religion
La véritable métrique n'est pas de savoir quel modèle est le meilleur. La question est de savoir quel modèle doit gérer cette tâche en fonction du coût, de la latence et du rayon d'impact. Arrêtez de traiter le choix du modèle comme une identité. Ne dites pas : « Nous sommes une équipe Terra ». Au lieu de cela, routez par classe de tâche.
Build a simple classifier. Incoming tasks get tagged by blast radius. Low-blast-radius work goes to Luna. Medium-blast-radius work goes to Terra. High-blast-radius work goes to a strong model plus a deterministic verifier. You do not need a perfect machine learning classifier to start. A few heuristics will do. Code reviews that only touch internal utilities and stay under a narrow line count? Luna. Tickets mentioning deployment pipelines, cross-service calls, or ambiguous requirements? Terra. Anything touching customer data, critical paths, or legal compliance? Escalate to Sol and require human or deterministic review.
Measure outcomes, not model names. Track cost per task, retry rate, and escape defects. If Luna is failing on tasks you assigned to it, move the boundary up. If Terra is overkill for a pattern that repeats every day, demote it to Luna and watch your burn drop. The goal is to increase automation without breaking your budget. Luna handles the high-volume background work. Terra handles the moments where judgment matters. Sol stands watch for the exceptions that can break your week.
The teams that get this right treat their agent fleet like a well-run engineering org. They do not staff every project with architects, and they do not ask interns to redesign the core data model. They match capability to risk. Do the same with your models.
Read the original discussion: GPT-5.6 Luna Is The Value Tier. Terra Is Not Useless
Join the GyaanSetu learning community: t.me/GyaanSetuAi
