Autonome Fahrzeuge folgen seit Jahren starren Anweisungssätzen. Ingenieure schrieben tausende von If-Then-Anweisungen. Wenn ein Fußgänger die Straße überquert, bremsen. Wenn die Ampel auf Rot springt, anhalten. Wenn die Fahrspur kurvt, lenken. Dieser Ansatz funktioniert, wenn sich die Welt genau wie erwartet verhält, aber das reale Fahren ist chaotischer. Ein Regelwerk kann nicht jede schlammige Nebenstraße, jede unmarkierte Kreuzung oder jeden Radfahrer abdecken, der sich durch den Verkehr schlängelt. Wenn sich die Umgebung ändert, versagen strikte Befehle. Wir brauchen Systeme, die lernen, was gutes Fahren bedeutet, anstatt einfach nur eine Checkliste abzuarbeiten.
Jenseits von fest programmierten Regeln
Traditionelle autonome Systeme verlassen sich auf explizite Programmierung. Sie funktionieren gut in geschlossenen Umgebungen wie Lagerhallen, dedizierten Fahrspuren und bei vorhersehbarem Wetter. Auf öffentlichen Straßen bricht dieselbe Logik oft zusammen.
Stellen Sie sich eine Baustelle mit handgeschriebenen Schildern, in seltsamen Winkeln verstreuten Pylonen und einem Einweiser vor, der den Verkehr durchwinkt. Ein regelbasiertes System benötigt ein klares Verkehrssignal. Es sieht nur Chaos. Ohne eine spezifische Regel für eine „Person in orangefarbener Weste, die nach links gestikuliert“, friert das Auto ein oder rät falsch. Menschliche Fahrer bewältigen dies sofort, weil wir Absicht und Kontext interpretieren und nicht nur Pixel. Wir lesen die Szene. Einer Maschine beizubringen, dasselbe zu tun, erfordert einen grundlegend anderen Ansatz.
Lernen durch Beobachtung: Inverse Reinforcement Learning
Hier verändert Inverse Reinforcement Learning die Spielregeln. Beim Standard-Reinforcement-Learning gibt man der KI ein Ziel und eine Belohnungsfunktion vor. Erreiche das Ziel schnell, erhalte Punkte. Fahre gegen einen Bordstein, verliere Punkte. Der Agent tastet sich so lange voran, bis er eine Policy entdeckt, die seinen Score maximiert. Aber beim Fahren geht es nicht nur um Effizienz. Es geht um Komfort, Sicherheit, Rechtmäßigkeit und soziale Konventionen. Eine mathematische Belohnung für „fahre wie ein vorsichtiger, aber kompetenter Mensch“ zu formulieren, ist nahezu unmöglich.
Inverse Reinforcement Learning kehrt das Problem um. Anstatt der KI ein Ziel vorzugeben, zeigt man ihr Beispiele. Der Algorithmus analysiert stundenlanges Videomaterial menschlicher Fahrten. Er beobachtet, wann der Mensch langsamer wird, frühzeitig die Spur wechselt oder einem einfahrenden LKW Vorrang gewährt. Er merkt sich nicht einfach nur den exakten Lenkwinkel. Er arbeitet rückwärts, um den Grund zu erschließen. Vielleicht hat der Fahrer gebremst, weil ein Kind am Bürgersteig stand, obwohl die Straße rechtlich frei war. Die KI extrahiert die verborgene Belohnung: Die Nähe zu Fußgängern ist wichtig, selbst ohne Zebrastreifen.
Indem der Mensch als Experte behandelt wird, der das Optimierungsproblem bereits gelöst hat, stellt der Algorithmus die Kostenfunktion wieder her, die dieser Experte minimiert. Sobald das System die zugrunde liegenden Präferenzen versteht – wie etwa sanftes Bremsen gegenüber abrupten Stopps oder das Halten in der Spur gegenüber dem Abkürzen von Kurven –, kann es generalisieren. Es stößt in einer anderen Stadt auf eine neue Straße und weiß in etwa, worauf ein guter Fahrer in dieser unbekannten Umgebung Wert legen würde.
Entscheidungen treffen: Deep Q-Networks
Belohnungen zu verstehen, ist nur die halbe Miete. Ein Auto muss immer noch handeln. Deep Q-Networks übernehmen die Entscheidungsfindung, indem sie Sensordaten verarbeiten, um die beste Aktion auszuwählen.
Klassisches Q-Learning existiert bereits seit Jahrzehnten. Ein Agent lernt den Wert einer bestimmten Aktion in einem bestimmten Zustand. Das Problem ist, dass die Zustände beim realen Fahren praktisch unendlich sind. Ein Kamera-Feed ist keine einfache Grid-World. Es sind Millionen von Pixeln, die sich sechzigmal pro Sekunde ändern, kombiniert mit Lidar-Punktwolken, Geschwindigkeitsmessungen und GPS-Vektoren.
Deep Q-Networks lösen dies, indem sie ein neuronales Netz als Funktionsapproximator verwenden. Das Netzwerk nimmt rohe Sensordaten auf und gibt einen vorhergesagten Wert für jede mögliche Aktion aus: nach links lenken, sanft bremsen, beschleunigen, Kurs halten. Anstatt für jedes Szenario eine Nachschlagetabelle zu speichern, generalisiert das Netzwerk. Es erkennt, dass ein dunkler Fleck in einer regnerischen Nacht wahrscheinlich ein geparktes Auto ist – genau wie es während des sonnigen Trainings gelernt hat – und weist der Aktion „beschleunigen“ einen niedrigen Wert zu.
Das Training beinhaltet Experience Replay. Das System speichert Momente aus vergangenen Fahrten – erfolgreiche Spurwechsel, Beinahe-Kollisionen und sanfte Verzögerungen – und zieht dann zufällige Stichproben, um sein Netzwerk zu aktualisieren. Dies bricht schädliche Korrelationen auf und stabilisiert das Lernen. Über tausende simulierte Stunden hinweg lernt das Netzwerk, welche Aktionen zu einem sicheren Vorankommen führen und welche Probleme verursachen.
Alles zusammenführen
Keine der beiden Methoden allein erschafft einen kompetenten Fahrer. Inverse Reinforcement Learning ohne eine Entscheidungsinstanz ist lediglich ein Beobachter. Es weiß, dass Menschen Wert auf eine sanfte Fahrweise legen, kann aber nicht selbst am Steuer eingreifen. Ein Deep Q-Network ohne eine gut ausgearbeitete Belohnungsfunktion optimiert auf das Falsche. Es könnte feststellen, dass das Fahren im Kreis Kollisionen perfekt vermeidet und so eine hohe Punktzahl erreicht, während es nirgendwohin kommt.
In Kombination bilden sie einen leistungsstarken Kreislauf. Inverse Reinforcement Learning beobachtet menschliche Experten und destilliert eine Belohnungsfunktion, die die Prioritäten der realen Welt erfasst. Das Deep Q-Network nutzt diese Belohnungsfunktion dann, um sich durch Versuch und Irrtum selbst zu trainieren, wobei es Live-Sensordaten verarbeitet, um Aktionen auszuwählen. Die KI lernt komplexe Verhaltensweisen sowohl durch Beobachtung als auch durch Übung.
Betrachten wir das Einfädeln auf einer Autobahn. Die Inverse Reinforcement Learning-Komponente hat geschlussfolgert, dass menschliche Fahrer ein Gleichgewicht zwischen Geschwindigkeitsanpassung und Lückenakzeptanz finden. Das Deep Q-Network erhält dieses nuancierte Kostensignal und übt das Einfädeln zehntausendmal in einer Simulation. Es lernt, wann es beschleunigen muss, wann es zurückhalten sollte und wann eine Lücke zu eng ist. Das Ergebnis ist kein Papagei, der aufgezeichnete menschliche Bewegungen wiederholt. Es ist ein System, das die Logik verinnerlicht hat und sich anpassen kann, wenn die Autobahn nass ist oder die Lücke kleiner als üblich ausfällt.
