Każda nowa premiera modelu wywołuje tę samą, nużącą debatę. Komentatorzy śpieszą się, by ogłosić zwycięzcę i uznać poprzedni poziom za martwy. W obliczu obecności GPT-5.6 Luna obok Terra i Sol, narracja pisze się sama: Luna jest wystarczająco tania i zdolna, by uczynić Terra nieistotną. To błąd. To również kosztowne podejście. Wybór modelu dla agentów programistycznych to nie konkurs piękności, nie budowanie tożsamości zespołu ani wyścig benchmarków. To polityka operacyjna. Zespoły, które zrozumieją to rozróżnienie, będą wydawać mniej, działać szybciej i popełniać mniej błędów niż te, które domyślnie wybierają najsilniejszy model do każdego zapytania.
Twoim domyślnym wyborem powinno być najtańsze narzędzie, które spełnia wymagania
Luna to segment ekonomiczny i nie jest to mało znaczący komplement. Świetnie radzi sobie z zadaniami ograniczonymi, jawnymi i prostymi. Myśl o klasyfikacji, streszczaniu, krótkich edycjach kodu czy wstępnym researchu. Gdy agent analizuje zgłoszenie wsparcia, aby przypisać mu etykietę priorytetu, Luna wystarczy. Gdy zmienia nazwę zmiennej w kilku plikach lub przygotowuje jednostronicowe podsumowanie git diff, Luna wystarczy. Są to zadania o wąskim zakresie, jasnych danych wejściowych i obiektywnie sprawdzalnych wynikach.
To efekt ekonomiczny zmienia zasady gry. Luna jest tania. Przy dużej skali zmienia to automatyzację z kosztownego rytuału w infrastrukturę. Przestajesz liczyć tokeny, a zaczynasz mierzyć przepustowość. Tani model, który rozwiązuje osiemdziesiąt procent rutynowych zadań, jest cenniejszy niż drogi model rozwiązujący osiemdziesiąt pięć procent, jeśli te dodatkowe pięć procent nie zmienia wyniku. Jeśli Luna generuje test jednostkowy w dwie sekundy, a Terra generuje nieco czystszy w osiem sekund za pięciokrotnie wyższą cenę, matematyka ma sens tylko wtedy, gdy ktoś skrupulatnie audytuje każdą linię. W większości przypadków nikt tego nie robi. Luna powinna być Twoim domyślnym wyborem do zadań o ograniczonym zakresie właśnie dlatego, że większość pracy ma taki właśnie charakter.
Przekazuj zadania wyżej, gdy granice się zacierają
Terra nie jest bezużyteczna. To Twój poziom eskalacji, który zarabia na siebie przy zadaniach bez wyraźnych granic. Używaj jej, gdy cel jest niedookreślony lub gdy praca obejmuje złożone systemy, takie jak ścieżki wdrożeń, zmiany między modułami czy triage incydentów. Ścieżka wdrożenia, która wije się przez środowiska stagingowe, canary i produkcyjne przy użyciu feature flag, nie posiada przejrzystej specyfikacji. Refaktoryzacja, która dotyka logiki rozliczeń i po cichu wpływa na potok raportowania, nie jest zadaniem o ograniczonym zakresie. Incydent na produkcji, w którym logi krzyczą o przekroczeniach czasu oczekiwania API, ale przyczyna leży w skrypcie migracyjnym z zeszłego kwartału, wymaga osądu.
Terra dostarcza ten osąd. Oddziela objawy od przyczyn. Luna może załatać pętlę ponowień (retry loop), aby zatamować krwotok. Terra zapyta, czy ta pętla w ogóle powinna istnieć lub czy prawdziwym problemem jest architektura timeoutów. Ta różnica ma znaczenie, gdy niewłaściwa poprawka zamienia tymczasowe spowolnienie w kaskadową awarię. Silniejszy model, który zapobiegnie jednej złej migracji na produkcji, jest wart swojej ceny, jeśli zaoszczędzi inżynierowi cały dzień sprzątania. Jedna zapobieżona awaria pokrywa koszty miesięcy korzystania z poziomu eskalacji.
Sol to polisa ubezpieczeniowa, a nie narzędzie codziennego użytku
Sol istnieje w przypadkach, gdy dodatkowe możliwości uzasadniają wysoki koszt. Używaj jej do wysokiego ryzyka, takich jak przeglądy krytyczne lub zmiany architektoniczne. Odbudowa przepływu uwierzytelniania, przeprojektowanie shardingu bazy danych czy zatwierdzanie pull requesta dotykającego bramki płatności to nie są zdarzenia codzienne. To wydarzenia. Sol nie powinna być Twoim domyślnym wyborem. Powinna być Twoim mechanizmem obsługi wyjątków, przywoływanym, gdy koszt błędu jest zbyt wysoki, by tańsze modele mogły go udźwignąć samodzielnie.
W przypadku kategorii najwyższego ryzyka połącz Sol z deterministycznym weryfikatorem. Pozwól Sol zasugerować zmianę schematu lub przeanalizować kompromisy architektoniczne. Niech Twój pipeline CI, analiza statyczna i testy integracyjne potwierdzą szczegóły mechaniczne. Model wnosi intuicję. Weryfikator wnosi gwarancje. To połączenie chroni Cię, gdy promień rażenia błędu jest największy.
Zbuduj router, a nie religię
Prawdziwą miarą nie jest to, który model jest najlepszy. Pytanie brzmi: który model powinien obsłużyć to zadanie, biorąc pod uwagę koszt, opóźnienie i promień rażenia. Przestań traktować wybór modelu jako element tożsamości. Nie mów: „Jesteśmy zespołem korzystającym z Terra”. Zamiast tego, kieruj zadania według ich klasy.
Build a simple classifier. Incoming tasks get tagged by blast radius. Low-blast-radius work goes to Luna. Medium-blast-radius work goes to Terra. High-blast-radius work goes to a strong model plus a deterministic verifier. You do not need a perfect machine learning classifier to start. A few heuristics will do. Code reviews that only touch internal utilities and stay under a narrow line count? Luna. Tickets mentioning deployment pipelines, cross-service calls, or ambiguous requirements? Terra. Anything touching customer data, critical paths, or legal compliance? Escalate to Sol and require human or deterministic review.
Measure outcomes, not model names. Track cost per task, retry rate, and escape defects. If Luna is failing on tasks you assigned to it, move the boundary up. If Terra is overkill for a pattern that repeats every day, demote it to Luna and watch your burn drop. The goal is to increase automation without breaking your budget. Luna handles the high-volume background work. Terra handles the moments where judgment matters. Sol stands watch for the exceptions that can break your week.
The teams that get this right treat their agent fleet like a well-run engineering org. They do not staff every project with architects, and they do not ask interns to redesign the core data model. They match capability to risk. Do the same with your models.
Read the original discussion: GPT-5.6 Luna Is The Value Tier. Terra Is Not Useless
Join the GyaanSetu learning community: t.me/GyaanSetuAi
