Benchmark pięciu lokalnie uruchomionych agentów LLM na pojedynczej karcie RTX 5090 pokazuje, że model typu mixture-of-experts (MoE) o 35 miliardach parametrów przewyższył konkurencję w rzeczywistym zadaniu programistycznym. Test, polegający na dodaniu komponentu Tag Manager do istniejącego panelu administracyjnego bez użycia zewnętrznych API w chmurze, wyłonił Qwen 3.6 35B-A3B jako wyraźnego zwycięzcę.
Dlaczego ten test jest ważny
Uruchamianie dużych modeli językowych na własnym sprzęcie pozwala programistom uniknąć opłat za API i obaw o prywatność danych. Jednak „lokalni agenci” pozostają modnym hasłem: czy potrafią faktycznie edytować pliki, wywoływać narzędzia wiersza poleceń i dostarczać kod gotowy do produkcji bez nadzoru człowieka? Ta praktyczna analiza porównawcza, pozbawiona usług chmurowych, daje programistom konkretne wyobrażenie o obecnym stanie tej technologii.
Sprzęt i zadanie
Wszystkie pięć modeli działało na tej samej stacji roboczej: GPU RTX 5090, typowej wysokiej klasy karcie konsumenckiej, bez żadnych zewnętrznych usług. Zadanie było celowo proste, ale reprezentatywne – dodanie komponentu Tag Manager do gotowej sekcji administracyjnej. Sukces wymagał od modelu zlokalizowania odpowiednich plików źródłowych, edycji ich oraz zweryfikowania, czy nowa funkcja została zintegrowana bez zakłócania istniejącej funkcjonalności.
Wydajność modeli
- Qwen 3.6 35B-A3B (MoE) – Wykonał zadanie autonomicznie, wprowadził sensowne ulepszenia, o które nie proszono, i nie wymagał poprawek po zakończeniu pracy.
- Qwen 3.6 27B (dense) – Ukończył zadanie, ale potrzebował około dwa razy więcej kroków interakcji i sporadycznie błędnie interpretował instrukcje.
- GLM-4.7-Flash (dense) – Stworzył działającą implementację, ale użył błędnych wzorców dopasowywania plików i pominął kontrole bezpieczeństwa, pozostawiając kod podatnym na ataki.
- Qwythos-9B – Nie uruchomił żadnych rzeczywistych narzędzi; przyczyna porażki mogła leżeć w samym modelu lub w lokalnej konfiguracji, ale test nie pozwolił na izolację tej przyczyny.
- Nemotron-3-Nano (hybrid) – Zapętlił się, poświęcając 40 tur na szukanie folderu, który już wcześniej zlokalizował, i nie posunął się dalej.
Co mówią wyniki
Architektura nie jest wiarygodnym predyktorem
Model MoE, który rozdziela swoje parametry pomiędzy wiele podsieci eksperckich, wygrał bezapelacyjnie, podczas gdy warianty dense i hybrid rozłożyły się między sukcesem a całkowitą porażką. Sugeruje to, że sam wybór architektury nie gwarantuje biegłości w obsłudze narzędzi.
Obsługa narzędzi pozostaje główną przeszkodą
Żaden z pięciu agentów nie użył dedykowanego narzędzia do robienia zrzutów ekranu dostarczonego do testu. Wszyscy próbowali improwizować, albo zgadując nazwy plików, albo próbując stosować pośrednie obejścia. Luka między „potrafi generować kod” a „potrafi zarządzać zewnętrznymi narzędziami” jest wciąż duża.
Lokalna praca oznacza debugowanie całego stosu technologicznego, a nie tylko modelu
Dwa modele wymagały bieżących poprawek szablonów promptów, zanim test mógł w ogóle się rozpocząć. Wysiłek włożony w naprawianie błędów specyficznych dla modeli przewyższył czas poświęcony na pisanie właściwego kodu Tag Managera, co podkreśla, jak kruche są obecne lokalne wdrożenia.
Uwaga ostrzegawcza
Benchmark odzwierciedla pojedynczą konfigurację sprzętową, pojedynczy scenariusz programistyczny i mały zestaw modeli. Model Qwen 3.6 35B-A3B zaliczył wcześniej porażkę w poprzedniej rundzie; jego wcześniejszy błąd był dziełem przypadku. Wyniki są zatem wskazujące, a nie definitywne.
Na co warto zwrócić uwagę w przyszłości
Przyszłe rundy będą wymagały rozszerzenia zestawu zadań, uwzględnienia bardziej zróżnicowanych łańcuchów narzędzi (toolchains) i testowania na szerszej gamie sprzętu. Obserwatorzy powinni śledzić, czy modele MoE będą konsekwentnie przewyższać projekty typu dense i hybrid oraz czy programiści będą w stanie budować niezawodne wrappery, które wyeliminują potrzebę ręcznego łatania błędów.
Podsumowanie: Model MoE o parametrach 35B może już działać jako kompetentny lokalny asystent programistyczny, ale szerszy ekosystem – integracja narzędzi, inżynieria promptów i stabilne środowiska uruchomieniowe – wciąż odstaje. Dopóki te elementy nie zostaną dopracowane, programiści powinni powściągać oczekiwania wobec agentów typu „plug-and-play”.
