Anthropic hat 80 % des System-Prompts, der Claude Code steuert, entfernt und meldete keinen Rückgang seiner Fähigkeit, Code zu schreiben. Das Experiment zeigt, dass Entwickler mit zunehmender Leistungsfähigkeit von Large Language Models (LLMs) das sperrige Gerüst, mit dem sie die Modelle auf Kurs halten, kürzen können, ohne die Performance zu beeinträchtigen.

Warum der Prompt ursprünglich wichtig war

Als Claude Code auf den Markt kam, enthielt sein System-Prompt Dutzende von Regeln. Ingenieure fügten neue Zeilen hinzu, wann immer ein Bug auftrat, entfernten aber selten etwas, das scheinbar funktionierte. Im Laufe der Zeit wuchs der Prompt zu einem verworrenen, statischen Dokument heran.

Die Modell-Lücke schließt sich

Diese zusätzlichen Regeln verbargen eine „Modell-Lücke“ – den Unterschied zwischen dem, was das Modell leisten konnte, und dem, was die Anwendung verlangte. Im Jahr 2024 mussten Entwickler strikte Einschränkungen formulieren, um zu verhindern, dass das Modell beispielsweise Code übermäßig kommentiert. Heute kann dasselbe Modell den gewünschten Stil aus einer einzigen Anweisung wie „passe dich dem bestehenden Codestil an“ ableiten. Die Regeln haben sich von einer Hilfe zu einem Rauschen entwickelt.

Was sich im Context Engineering ändert

Anthropics Kürzung spiegelt einen breiteren Wandel in der Art und Weise wider, wie Entwickler Prompts strukturieren:

  • Einmalige kritische Anweisungen – eine Regel einmal festlegen und das Modell sie behalten lassen.
  • Tool-gesteuerte Parameter statt Few-Shot-Beispielen – beschreiben Sie Eingabe- und Ausgabestrukturen im Tool-Schema und lassen Sie das Modell diese ausfüllen.
  • Progressive Disclosure (schrittweise Offenlegung) – geben Sie nur den Kontext an, der für den aktuellen Schritt benötigt wird, und fügen Sie später bei Bedarf mehr hinzu.
  • Statische Anweisungen in Tool-Beschreibungen verschieben – Dinge wie „verwende camelCase für Variablen“ gehören in die Spezifikation des Tools, nicht in den System-Prompt.
  • Hardcodierte Regeln durch Heuristiken ersetzen – lassen Sie das Modell entscheiden, wann eine Regel anwendbar ist, anstatt sie bedingungslos zu erzwingen.

Diese Taktiken funktionieren, weil das Modell bereits viele Konventionen kennt, die früher eine explizite Verstärkung erforderten.

Das Risiko des Über-Kürzens

Dasselbe Pruning, das Frontier-Modellen zugutekommt, kann kleineren Modellen schaden. Anthropic stellt fest, dass Modelle wie Haiku immer noch auf reichhaltigere Prompts angewiesen sind, um auf Kurs zu bleiben. Zu viel Anleitung von einem weniger leistungsfähigen Modell zu entfernen, kann die Fehler wieder einführen, die der ursprüngliche Prompt zu verhindern versuchte: inkonsistente Benennung, übermäßige Kommentare oder übersehene Edge Cases.

So auditieren Sie Ihre eigenen Prompts

Wenn Sie eine Pipeline zur Codegenerierung betreiben, kann ein Prompt-Audit unnötigen Ballast aufdecken. Eine praktische Checkliste sieht so aus:

  • Anweisungsdichte neu anpassen – passen Sie die Menge der Anleitung an das Modell an, das Sie tatsächlich verwenden.
  • Doppelte Anweisungen löschen – wenn eine Regel sowohl im System-Prompt als auch in der Tool-Beschreibung erscheint, behalten Sie sie nur einmal.
  • Gelungene Beispiele in reichhaltigere Schemata umwandeln – ersetzen Sie konkrete Beispiele durch enumerierte Parametertypen oder Enums.
  • Situative Details externalisieren – verschieben Sie große Referenzblöcke in separate Dateien, die das Modell bei Bedarf abrufen kann.
  • Regeln für verschwundene Verhaltensweisen entfernen – wenn das Modell keine unerwünschten Kommentare mehr hinzufügt, lassen Sie die „Keine-Kommentare“-Regel weg.

Verlassen Sie sich nicht auf Ihr Bauchgefühl. Verwenden Sie eine einfache „3-Test-Regel“: Führen Sie fünf realistische Codierungsaufgaben aus, vergleichen Sie die Ergebnisse vor und nach jeder Löschung und notieren Sie etwaige Regressionen.

  1. Baseline – messen Sie die Performance mit dem vollständigen Prompt.
  2. Löschen – entfernen Sie eine Kandidatenzeile oder einen Block.
  3. Erneut ausführen – führen Sie dieselben fünf Aufgaben aus.

Wenn sich die Ausgabe ändert, haben Sie eine Zeile identifiziert, die immer noch Gewicht hat. Wenn nicht, kann die Zeile sicher weggelassen werden.

Worauf Entwickler als Nächstes achten sollten

Vorerst ist die Erkenntnis klar: Ein System-Prompt ist ein lebendiges Dokument. Betrachten Sie jede Zeile als zeitlich begrenzt, führen Sie regelmäßig Audits durch und lassen Sie die wachsende Kompetenz des Modells die schwere Arbeit erledigen.

Quelle: dev.to/ialijr/your-system-prompt-has-a-shelf-life-maintaining-prompts-as-models-improve-cd9