Бенчмарк пяти локально запущенных LLM-агентов на одной RTX 5090 показывает, что модель Mixture-of-Experts (MoE) с 35 миллиардами параметров превзошла своих конкурентов в реальной задаче по программированию. Тест, заключавшийся в добавлении Tag Manager в существующую админ-панель без использования каких-либо облачных API, выявил явного победителя — Qwen 3.6 35B-A3B.
Почему этот тест важен
Запуск больших языковых моделей на личном оборудовании позволяет разработчикам избегать платы за API и проблем с конфиденциальностью данных. Тем не менее, «локальные агенты» остаются модным словом: могут ли они на самом деле редактировать файлы, вызывать инструменты командной строки и выпускать готовый к использованию код без помощи человека? Это практическое сравнение, проведенное без облачных сервисов, дает разработчикам четкое представление о текущем состоянии технологий.
Оборудование и задача
Все пять моделей запускались на одной рабочей станции: GPU RTX 5090 (типичная высокопроизводительная потребительская карта) и никаких внешних сервисов. Задача была намеренно простой, но репрезентативной — добавить компонент Tag Manager в уже созданный раздел администрирования. Для успеха модели требовалось найти нужные исходные файлы, отредактировать их и убедиться, что новая функция интегрирована, не нарушая существующую функциональность.
Производительность моделей
- Qwen 3.6 35B-A3B (MoE) — выполнила работу автономно, добавила разумные улучшения, о которых не просили, и не потребовала исправлений после завершения работы.
- Qwen 3.6 27B (dense) — выполнила задачу, но потребовалось примерно в два раза больше шагов взаимодействия, и она периодически неверно интерпретировала инструкции.
- GLM-4.7-Flash (dense) — создала рабочую реализацию, но использовала неверные шаблоны сопоставления файлов и пропустила проверки безопасности, оставив код уязвимым.
- Qwythos-9B — не выполнила ни одного реального действия с инструментами; причина сбоя могла заключаться как в самой модели, так и в локальной настройке, но тест не позволил изолировать причину.
- Nemotron-3-Nano (hybrid) — зациклилась, потратив 40 ходов на поиск папки, которую уже нашла, и так и не продвинулась дальше.
Что раскрывают результаты
Архитектура не является надежным предиктором
Модель MoE, которая распределяет свои параметры между несколькими экспертными подсетями, одержала безоговорочную победу, в то время как варианты dense и hybrid показали разброс результатов от успеха до полного провала. Это говорит о том, что выбор архитектуры сам по себе не гарантирует умение работать с инструментами.
Использование инструментов остается серьезным препятствием
Ни один из пяти агентов не использовал специальный инструмент для создания скриншотов, предоставленный для теста. Все пытались импровизировать, либо угадывая имена файлов, либо пытаясь использовать косвенные обходные пути. Разрыв между способностью «генерировать код» и способностью «управлять внешними утилитами» все еще огромен.
Локальный запуск означает отладку всего стека, а не только модели
Двум моделям потребовались оперативные исправления шаблонов промптов еще до того, как тест смог начаться. Усилия, затраченные на исправление специфических багов моделей, затмили время, потраченное на написание самого кода Tag Manager, что подчеркивает хрупкость текущих локальных развертываний.
Предостережение
Бенчмарк отражает одну конфигурацию оборудования, один сценарий программирования и небольшой набор моделей. Qwen 3.6 35B-A3B ранее потерпела неудачу в предыдущем раунде; ее прошлый провал был случайностью. Таким образом, результаты носят ознакомительный, а не окончательный характер.
За чем следить дальше
В будущих раундах потребуется расширить набор задач, включить более разнообразные наборы инструментов и протестировать на более широком спектре оборудования. Наблюдателям следует следить за тем, будут ли модели MoE последовательно превосходить dense- и hybrid-архитектуры, и смогут ли разработчики создавать надежные оболочки (wrappers), устраняющие необходимость ручного исправления багов.
Главный вывод: Модель MoE с 35B параметров уже может выступать в роли компетентного локального помощника по программированию, но более широкая экосистема — интеграция инструментов, промпт-инжиниринг и стабильные среды выполнения — все еще отстает. Пока эти элементы не будут работать слаженно, разработчикам следует сдерживать ожидания относительно локальных агентов формата «plug-and-play».
