OpenAI Codex hat ein vollständiges 16-Bit-x86-Assembly-DOS-Spiel im Asteroids-Stil erstellt, das 18 Quelldateien und etwa 2.500 Zeilen Code lieferte – ohne eine einzige Zeile von Menschen geschriebenen Assembly-Code. Das Experiment zeigt, dass eine KI einen vollständigen Software-Lebenszyklus – von der Planung bis zum Debugging – ohne direkte Eingriffe eines Programmierers steuern kann, was einen Schritt über die üblichen „Code-Completion“-Demos hinausgeht.

Warum der Test wichtig war

Die meisten öffentlichen KI-Coding-Vorführungen beschränken sich auf winzige Snippets oder einfache Hilfsprogramme. Um die Obergrenze auszuloten, zwang das Experiment Codex in die am stärksten eingeschränkte Umgebung, die man sich vorstellen kann: 16-Bit-x86-Assembly auf DOS, ohne Game-Engines, Grafikbibliotheken oder den Komfort von Hochsprachen. Das Ziel war es zu sehen, ob eine KI nicht nur Code generieren, sondern auch die umliegenden Engineering-Aufgaben bewältigen kann.

Wie die Rollen aufgeteilt wurden

Die Verantwortlichkeiten des Menschen beschränkten sich auf drei Aktionen:

  • Festlegung des allgemeinen Projektziels (ein Shooter im Asteroids-Stil).
  • Beantwortung aller spielbezogenen Fragen, die auftauchten.
  • Playtesting jedes Builds und Melden beobachteter Bugs.

Die Verantwortlichkeiten von Codex umfassten alles andere:

  • Erstellung eines Projektplans und einer Architektur.
  • Schreiben der Assembly-Quelldateien.
  • Debugging, Refactoring und Umstrukturierung des Codes.
  • Verwaltung des Git-Repositorys, einschließlich Commits und Branch-Management.
  • Erstellen des Binärcodes und Ausführen in einem DOS-Emulator.

Der Mensch tippte nie eine einzige Assembly-Anweisung, rief nie einen Compiler auf und startete das Spiel während der Entwicklung nie selbst. Die Interaktion beschränkte sich auf das Beschreiben von Bug-Symptomen; die KI lokalisierte und behob die Ursache eigenständig.

Der iterative Workflow

Jeder Zyklus begann damit, dass Codex einen Meilenstein vorschlug (z. B. „Implementierung der Bewegung des Spielerschiffs“). Anschließend wurden die entsprechenden Quelldateien erstellt, committet, die ausführbare Datei gebaut und der Tester erhielt den lauffähigen Build. Codex analysierte das Symptom, verfolgte es durch die Codebasis und erstellte einen Patch ohne weitere menschliche Anleitung.

Was das Endprodukt enthält

  • 18 Assembly-Quelldateien, organisiert in einer konventionellen Repository-Struktur.
  • ≈2.500 Zeilen Assembly, die Input-Handling, Sprite-Zeichnen, Kollisionserkennung und ein Highscore-System abdecken.
  • Eine spielbare DOS-Executable, die in einer Standard-DOS-Umgebung läuft und das klassische Asteroids-Gameplay imitiert.
  • Null von Menschen geschriebener Assembly, was bestätigt, dass die KI alle Low-Level-Programmieraufgaben übernommen hat.

Bedeutung und Auswirkungen

Wenn eine KI ein Projekt autonom von der Konzeption bis hin zu einer funktionierenden Binärdatei leiten kann, verschiebt sich die traditionelle Rolle des Programmierers als primärer Orchestrator einer Codebasis. Unternehmen könnten die Zeit für Boilerplate-Setup, Dokumentation und routinemäßiges Debugging reduzieren und so Ingenieure dafür freimachen, sich auf Design und Produktstrategie zu konzentrieren.

Das Experiment zeigt jedoch auch Grenzen auf. Die Testumgebung war bewusst eng gefasst: ein Singleplayer-DOS-Spiel mit gut verstandenen Mechaniken. Die Skalierung dieses Ansatzes auf große, multimodulare Systeme mit externen Abhängigkeiten, Sicherheitsbeschränkungen oder performancekritischen Code-Pfaden ist noch unbewiesen. Zudem fungierte der menschliche Tester weiterhin als letzte Qualitätskontrolle; ein unentdeckter Logikfehler hätte ohne diese Aufsicht durchrutschen können.

Gegenargumente und offene Fragen

  • Zuverlässigkeit: Assembly-Programmierung ist unnachgiebig; ein einziger Off-by-one-Fehler kann das gesamte Programm zum Absturz bringen. Codex behob die Bugs, die es sah, aber es könnte subtile Timing-Probleme übersehen, die erst unter Belastungstests auftreten.
  • Wartbarkeit: Code, der ohne menschliche Styleguides generiert wurde, könnte für zukünftige Entwickler schwerer zu lesen oder zu erweitern sein, insbesondere wenn die Namenskonventionen der KI von den Teamstandards abweichen.
  • Geistiges Eigentum: Wem gehört der Code, wenn eine KI ihn schreibt? Aktuelle Lizenzmodelle setzen menschliche Urheberschaft voraus, was einen Graubereich für KI-erzeugte Artefakte hinterlässt.

Worauf man als Nächstes achten sollte

  • Breitere Benchmarks: Die Anwendung desselben autonomen Workflows auf vernetzte Anwendungen, mobile Apps oder moderne C/C++-Projekte wird testen, ob der Ansatz über Retro-Spiele hinaus skalierbar ist.
  • Tool-Integration: Die Einbettung von Codex in CI/CD-Pipelines könnte nicht nur die Codegenerierung, sondern auch das Testen, Security-Scanning und Deployment automatisieren.
  • Weiterentwicklung der Richtlinien: Da KI-generierter Code zunimmt, müssen rechtliche und unternehmensinterne Richtlinien Fragen zu Eigentum, Haftung und Compliance klären.

Das Fazit ist eindeutig: KI kann mittlerweile als einzelner Softwareentwickler für klar definierte, abgegrenzte Projekte agieren und funktionalen Low-Level-Code liefern, ohne dass dieser manuell von Menschen programmiert werden muss. Ob diese Fähigkeit die Mainstream-Entwicklung grundlegend verändert, hängt davon ab, wie schnell das Ökosystem Fragen der Zuverlässigkeit, Wartbarkeit und rechtliche Bedenken adressiert.