HarnessDev: LLMs bauen ihre eigene Infrastruktur
ByteDance und eine Gruppe von Universitäten haben HarnessDev vorgestellt, ein Framework, das es Large Language Models (LLMs) ermöglicht, ihre eigenen „Agent-Betriebssysteme“ namens Agent Harnesses zu schreiben. Das Team stellt einem LLM ein minimales Starter-Kit zur Verfügung und lässt es den Rest ausarbeiten. Dies zeigt, wie KI die Steuerungsebene konstruieren kann, die ihre eigenen Tool-Nutzungsschleifen, Verifizierungsschritte und Fehlerbehandlungen ausführt – ohne dass ein Mensch jede Zeile tippen muss.
Warum ein selbstgebautes Harness wichtig ist
KI-Agenten haben sich von Assistenten für Einzelprompts zu mehrstufigen Arbeitern entwickelt, die APIs aufrufen, Datenbanken abfragen und Ergebnisse zusammenführen. Bisher haben Entwickler den Orchestrierungscode manuell erstellt, der dem Modell vorgibt, wann ein Suchwerkzeug aufgerufen werden soll, wie Zwischenzustände gespeichert werden und wie eine finale Antwort verifiziert wird. HarnessDev kehrt dieses Modell um: Ein Seed Harness liefert gerade genug Gerüst – grundlegende Funktionen für Schleifen, die Auswahl von Tools und das Tracking des Zustands – und das LLM erweitert dies zu einer funktionsfähigen Runtime.
Im Benchmark der Forschungsarbeit erzeugte das Modell 18 verschiedene Harnesses und fügte dem ursprünglichen Seed mehr als 17.000 Zeilen Code hinzu. Jedes Harness verwaltete den vollständigen Lebenszyklus einer Aufgabe: Ausführen von Schleifen, Auswahl des richtigen Tools, Aufrechterhaltung des Kontexts, Tracking des Zustands, Verifizierung der Ergebnisse und Fehlerbehebung.
Die versteckten Kosten, die die Studie aufdeckte
Die Zahlen sehen beeindruckend aus, aber die Autoren warnen davor, dass eine reine Implementierung nicht gleichbedeutend mit der praktischen Anwendung ist.
- Nicht genutzte Komponenten – Ein beträchtlicher Teil des generierten Codes wurde während der eigentlichen Aufgabenausführung nie ausgeführt. Das LLM schrieb Funktionen, die der Agent nie aufrief, was die Codebasis aufblähte, ohne einen Mehrwert zu bieten.
- Model Lock-in – Die Harnesses neigten dazu, auf das spezifische LLM abgestimmt zu sein, das sie erstellt hatte. Wenn dasselbe Harness einem anderen Modell übergeben wurde, sank die Leistung merklich. Dies deutet darauf hin, dass die automatisch generierte Steuerungslogik modellspezifische Eigenheiten enthält.
- Verifizierungslücken – Ein Test-Harness meldete eine Erfolgsquote von 99 % (99 von 100 Durchläufen), war aber nur in 48 % der Fälle korrekt. Ohne starke Verifizierung kann ein Agent mit großer Zuversicht falsche Antworten präsentieren.
- Token-Overhead – Der Token-Verbrauch – ein Indikator für die Rechenkosten – variierte drastisch. Ein Harness benötigte siebenmal mehr Token als ein anderer, um das gleiche Ergebnis zu erzielen, was Bedenken hinsichtlich der Skalierbarkeit in Produktionsumgebungen aufwirft.
Diese Erkenntnisse unterstreichen die Notwendigkeit eines disziplinierten Designs, selbst wenn der Code aus einem LLM hervorgeht.
Was Entwickler beachten sollten
- Betrachten Sie das Harness-Design als Architektur – Verlassen Sie sich nicht darauf, dass das Modell „einfach so funktioniert“. Definieren Sie klare Module für die Schleifensteuerung, Tool-Auswahl, Zustandsverwaltung und Verifizierung, bevor Sie das LLM die Details ausfüllen lassen.
- Bauen Sie eine starke Verifizierung auf – Fügen Sie explizite Prüfungen ein, die die Behauptung eines Agenten mit der Ground Truth oder einem sekundären Modell vergleichen. Die im Studium festgestellte Genauigkeit von 48 % trotz einer selbstberichteten Erfolgsquote von 99 % zeigt, dass die Verifizierung kein nachträglicher Gedanke sein darf.
- Achten Sie auf Token-Budgets – Aufwendigere Harnesses können die Token-Anzahl in die Höhe treiben. Analysieren Sie verschiedene Harness-Varianten frühzeitig, um versteckte Kostenexplosionen zu vermeiden.
- Testen Sie über verschiedene Modelle hinweg – Führen Sie dasselbe Harness mit mehreren LLM-Backends aus. Wenn die Leistung stark abfällt, benötigen Sie möglicherweise ein modellunabhängigeres Design oder separate Harnesses pro Modell.
Fazit: HarnessDev beweist, dass LLMs ihren eigenen, betriebssystemähnlichen Steuerungscode entwerfen können.
