Een benchmark van vijf lokaal gedraaide LLM-agents op een enkele RTX 5090 laat zien dat een mixture-of-experts (MoE) model met 35 miljard parameters zijn concurrenten overtrof bij een real-world programmeertaak. De test, waarbij een Tag Manager werd toegevoegd aan een bestaand beheerderspaneel zonder gebruik te maken van cloud-API's, kroonde Qwen 3.6 35B-A3B tot de duidelijke winnaar.
Waarom de test ertoe doet
Het draaien van grote taalmodellen op persoonlijke hardware stelt ontwikkelaars in staat om API-kosten en zorgen over gegevensprivacy te vermijden. Toch blijft "lokale agents" een modewoord: kunnen ze daadwerkelijk bestanden bewerken, command-line tools aanroepen en productieklare code leveren zonder menselijke begeleiding? Deze praktische vergelijking, ontdaan van cloudservices, geeft ontwikkelaars een concreet beeld van de huidige stand van de technologie.
De hardware en de taak
Alle vijf de modellen draaiden op dezelfde workstation: een RTX 5090 GPU, een typische high-end consumentenkaart, zonder externe services. De taak was doelbewust eenvoudig maar representatief – het toevoegen van een Tag Manager-component aan een reeds gebouwd beheerdersgedeelte. Succes vereiste dat het model de juiste bronbestanden lokaliseerde, deze bewerkte en controleerde of de nieuwe functie werd geïntegreerd zonder de bestaande functionaliteit te verstoren.
Modelprestaties
- Qwen 3.6 35B-A3B (MoE) – Voltooide de taak autonoom, voegde zinvolle verbeteringen toe die niet waren aangevraagd, en had geen patches na afloop nodig.
- Qwen 3.6 27B (dense) – Voltooide de taak, maar had ongeveer twee keer zoveel interactiestappen nodig en interpreteerde instructies af en toe verkeerd.
- GLM-4.7-Flash (dense) – Produceerde een werkende implementatie, maar gebruikte onjuiste patronen voor het matchen van bestanden en liet beveiligingscontroles weg, waardoor de code kwetsbaar bleef.
- Qwythos-9B – Voerde geen echte tools uit; de fout kon voortkomen uit het model zelf of uit de lokale configuratie, maar de test kon de oorzaak niet isoleren.
- Nemotron-3-Nano (hybrid) – Raakte vast in een loop, waarbij het 40 beurten besteedde aan het zoeken naar een map die het al had gevonden, en kwam nooit verder dan dat punt.
Wat de resultaten onthullen
Architectuur is geen betrouwbare voorspeller
Het MoE-model, dat zijn parameters verdeelt over meerdere expert-subnetwerken, won overtuigend, terwijl de dense en hybride varianten verdeeld waren tussen succes en totaal falen. Dit suggereert dat pure architecturale keuzes geen garantie bieden voor competentie in het gebruik van tools.
Toolgebruik blijft een grote hindernis
Geen van de vijf agents gebruikte de speciaal voor de test aangeboden screenshot-tool. Ze probeerden allemaal te improviseren, hetzij door bestandsnamen te raden, hetzij door indirecte omwegen te proberen. De kloof tussen "code kunnen genereren" en "externe hulpprogramma's kunnen aansturen" is nog steeds groot.
Lokaal draaien betekent de stack debuggen, niet alleen het model
Twee modellen vereisten on-the-fly patches voor hun prompt-templates voordat de test überhaupt kon beginnen. De inspanning die werd besteed aan het oplossen van modelspecifieke bugs overtrof de tijd die werd besteed aan het schrijven van de eigenlijke Tag Manager-code, wat benadrukt hoe kwetsbaar huidige lokale implementaties zijn.
Een waarschuwing
De benchmark weerspiegelt een enkele hardwareconfiguratie, een enkel programmeerscenario en een kleine reeks modellen. De Qwen 3.6 35B-A3B was in een eerdere ronde al geflopt; dat eerdere falen was een incident. De resultaten zijn daarom indicatief, niet definitief.
Waar we op moeten letten
Toekomstige rondes zullen de takenlijst moeten uitbreiden, meer diverse toolchains moeten bevatten en moeten testen op een breder scala aan hardware. Waarnemers moeten in de gaten houden of MoE-modellen consequent beter presteren dan dense en hybride ontwerpen, en of ontwikkelaars betrouwbare wrappers kunnen bouwen die de noodzaak voor handmatige bug-patches elimineren.
Kernpunt: Een 35B MoE-model kan al fungeren als een competente lokale programmeerassistent, maar het bredere ecosysteem — tool-integratie, prompt engineering en stabiele runtimes — loopt nog achter. Totdat die onderdelen op elkaar aansluiten, moeten ontwikkelaars hun verwachtingen over "plug-and-play" lokale agents matigen.
