Ein Benchmark von fünf lokal ausgeführten LLM-Agenten auf einer einzelnen RTX 5090 zeigt, dass ein Mixture-of-Experts (MoE)-Modell mit 35 Milliarden Parametern seine Konkurrenten bei einer realen Programmieraufgabe übertraf. Der Test, bei dem ohne Cloud-APIs ein Tag-Manager zu einem bestehenden Admin-Panel hinzugefügt wurde, krönte Qwen 3.6 35B-A3B zum klaren Sieger.

Warum der Test wichtig ist

Das Ausführen großer Sprachmodelle auf privater Hardware ermöglicht es Entwicklern, API-Gebühren und Datenschutzbedenken zu umgehen. Dennoch bleibt „lokale Agenten“ ein Schlagwort: Können sie tatsächlich Dateien bearbeiten, Kommandozeilen-Tools aufrufen und produktionsreifen Code ausliefern, ohne dass ein Mensch sie an die Hand nimmt? Dieser praxisnahe Vergleich, der auf Cloud-Dienste verzichtet, vermittelt Entwicklern ein konkretes Gefühl dafür, wo die Technologie aktuell steht.

Die Hardware und die Aufgabe

Alle fünf Modelle liefen auf derselben Workstation: einer RTX 5090 GPU, einer typischen High-End-Consumer-Karte, und ohne externe Dienste. Die Aufgabe war bewusst einfach, aber repräsentativ – eine Tag-Manager-Komponente zu einem bereits erstellten Admin-Bereich hinzuzufügen. Der Erfolg erforderte, dass das Modell die richtigen Quelldateien findet, diese bearbeitet und verifiziert, dass die neue Funktion integriert wurde, ohne die bestehende Funktionalität zu beeinträchtigen.

Modellleistung

  • Qwen 3.6 35B-A3B (MoE) – Erledigte die Aufgabe autonom, fügte sinnvolle, nicht angeforderte Verbesserungen hinzu und benötigte keine Patches nach dem Durchlauf.
  • Qwen 3.6 27B (dense) – Schloss die Aufgabe ab, benötigte jedoch etwa doppelt so viele Interaktionsschritte und interpretierte Anweisungen gelegentlich falsch.
  • GLM-4.7-Flash (dense) – Erzeugte eine funktionierende Implementierung, verwendete jedoch falsche Dateimatch-Muster und ließ Sicherheitsprüfungen weg, was den Code anfällig machte.
  • Qwythos-9B – Führte keine echten Tools aus; das Scheitern könnte am Modell selbst oder am lokalen Setup liegen, aber der Test konnte die Ursache nicht isolieren.
  • Nemotron-3-Nano (hybrid) – Steckte in einer Schleife fest, verbrachte 40 Durchgänge mit der Suche nach einem Ordner, den es bereits gefunden hatte, und kam nie darüber hinaus.

Was die Ergebnisse zeigen

Architektur ist kein zuverlässiger Prädiktor

Das MoE-Modell, das seine Parameter auf mehrere Experten-Subnetzwerke aufteilt, gewann eindeutig, während die Dense- und Hybrid-Varianten zwischen Erfolg und völligem Scheitern schwankten. Dies deutet darauf hin, dass rein architektonische Entscheidungen keine Kompetenz bei der Tool-Nutzung garantieren.

Die Tool-Nutzung bleibt eine große Hürde

Keiner der fünf Agenten nutzte das für den Test bereitgestellte dedizierte Screenshot-Tool. Alle versuchten zu improvisieren, entweder durch das Raten von Dateinamen oder durch den Versuch indirekter Umwege. Die Lücke zwischen „Code generieren können“ und „externe Hilfsmittel orchestrieren können“ ist immer noch groß.

Lokales Ausführen bedeutet, den Stack zu debuggen, nicht nur das Modell

Zwei Modelle erforderten On-the-fly-Patches für ihre Prompt-Templates, bevor der Test überhaupt beginnen konnte. Der Aufwand für das Beheben modellspezifischer Bugs überstieg die Zeit, die für das Schreiben des eigentlichen Tag-Manager-Codes aufgewendet wurde, was verdeutlicht, wie fragil aktuelle lokale Deployments sind.

Ein Hinweis zur Vorsicht

Der Benchmark spiegelt eine einzige Hardwarekonfiguration, ein einziges Programmierszenario und eine kleine Auswahl an Modellen wider. Qwen 3.6 35B-A3B war zuvor in einer früheren Runde gescheitert; dieses frühere Versagen war ein Zufall. Die Ergebnisse sind daher indikativ, nicht definitiv.

Worauf man als Nächstes achten sollte

Zukünftige Runden müssen den Aufgabensatz erweitern, vielfältigere Toolchains einbeziehen und auf einer breiteren Palette von Hardware testen. Beobachter sollten verfolgen, ob MoE-Modelle Dense- und Hybrid-Designs konsistent übertreffen und ob Entwickler zuverlässige Wrapper bauen können, die manuelle Bug-Patches überflüssig machen.

Fazit: Ein 35B MoE-Modell kann bereits als kompetenter lokaler Coding-Assistent agieren, aber das breitere Ökosystem – Tool-Integration, Prompt Engineering und stabile Laufzeiten – hinkt noch hinterher. Bis diese Teile ineinandergreifen, sollten Entwickler ihre Erwartungen an „Plug-and-Play“-lokale Agenten dämpfen.