Бенчмарк п'яти локально запущених LLM-агентів на одній RTX 5090 показує, що модель Mixture-of-Experts (MoE) із 35 мільярдами параметрів перевершила своїх конкурентів у реальному завданні з програмування. Тест, який полягав у додаванні Tag Manager до існуючої панелі адміністратора без використання будь-яких хмарних API, визнав Qwen 3.6 35B-A3B беззаперечним переможцем.
Чому цей тест важливий
Запуск великих мовних моделей на персональному обладнанні дозволяє розробникам уникати витрат на API та проблем із конфіденційністю даних. Проте «локальні агенти» залишаються лише модним словом: чи можуть вони насправді редагувати файли, викликати інструменти командного рядка та створювати готовий до використання (production-ready) код без допомоги людини? Це практичне порівняння, проведене без хмарних сервісів, дає розробникам чітке розуміння поточного стану технології.
Обладнання та завдання
Усі п'ять моделей працювали на одній робочій станції: відеокарта RTX 5090 (типова споживча карта високого класу) і жодних зовнішніх сервісів. Завдання було навмисно простим, але репрезентативним — додати компонент Tag Manager до вже створеного розділу адміністрування. Для успіху моделі потрібно було знайти правильні вихідні файли, відредагувати їх і переконатися, що нова функція інтегрувалася, не порушивши існуючу функціональність.
Продуктивність моделей
- Qwen 3.6 35B-A3B (MoE) – Виконав роботу автономно, додав розумні покращення, про які не просили, і не потребував виправлень після завершення.
- Qwen 3.6 27B (dense) – Виконав завдання, але витратив приблизно вдвічі більше кроків взаємодії та іноді неправильно інтерпретував інструкції.
- GLM-4.7-Flash (dense) – Створив робочу реалізацію, але використовував неправильні шаблони зіставлення файлів і пропустив перевірки безпеки, що зробило код вразливим.
- Qwythos-9B – Не виконав жодного реального інструменту; невдача могла бути викликана як самою моделлю, так і локальним налаштуванням, але тест не дозволив ізолювати причину.
- Nemotron-3-Nano (hybrid) – Зациклився, витративши 40 ходів на пошук папки, яку вже знайшов, і так і не просунувся далі.
Що показують результати
Архітектура не є надійним показником
Модель MoE, яка розподіляє свої параметри між кількома експертними підмережами, здобула беззаперечну перемогу, тоді як варіанти dense та hybrid розділили результати між успіхом і повною невдачею. Це свідчить про те, що вибір архітектури сам по собі не гарантує вміння користуватися інструментами.
Використання інструментів залишається головною перешкодою
Жоден із п'яти агентів не скористався спеціальним інструментом створення скриншотів, наданим для тесту. Усі намагалися імпровізувати, або вгадуючи назви файлів, або намагаючись використати непрямі обхідні шляхи. Розрив між «може генерувати код» і «може керувати зовнішніми утилітами» все ще великий.
Локальний запуск означає налагодження всього стека, а не лише моделі
Двом моделям знадобилися оперативні виправлення їхніх шаблонів промптів (prompt templates) ще до того, як тест міг розпочатися. Зусилля, витрачені на виправлення специфічних помилок моделей, перевищили час, витрачений на написання самого коду Tag Manager, що підкреслює, наскільки крихкими є сучасні локальні розгортання.
Зауваження
Бенчмарк відображає одну конфігурацію обладнання, один сценарій програмування та невеликий набір моделей. Qwen 3.6 35B-A3B раніше зазнав невдачі в попередньому раунді; його попередня помилка була випадковістю. Тому результати є показовими, а не остаточними.
За чим стежити далі
Майбутні раунди потребуватимуть розширення набору завдань, включення більш різноманітних інструментаріїв та тестування на ширшому спектрі обладнання. Спостерігачам варто стежити за тим, чи будуть моделі MoE стабільно перевершувати архітектури dense та hybrid, і чи зможуть розробники створювати надійні оболонки (wrappers), які усунуть потребу в ручному виправленні помилок.
Підсумок: Модель MoE на 35B параметрів уже може діяти як компетентний локальний помічник із програмування, але ширша екосистема — інтеграція інструментів, промпт-інжиніринг і стабільні середовища виконання — все ще відстає. Поки ці елементи не будуть узгоджені, розробникам варто стримувати очікування щодо локальних агентів за принципом «підключив і працюй» (plug-and-play).
