Le auto a guida autonoma hanno trascorso anni seguendo rigidi set di istruzioni. Gli ingegneri hanno scritto migliaia di istruzioni if-then. Se un pedone attraversa, frena. Se il semaforo diventa rosso, fermati. Se la corsia curva, sterza. Questo approccio funziona quando il mondo si comporta esattamente come previsto, ma la guida reale è più caotica. Un manuale di regole non può coprire ogni strada sterrata, incrocio non segnalato o ciclista che si inserisce nel traffico. Quando l'ambiente cambia, i comandi rigidi falliscono. Abbiamo bisogno di sistemi che imparino cosa significhi guidare bene, piuttosto che limitarsi a seguire una lista di controllo.
Oltre le regole codificate rigidamente
I sistemi autonomi tradizionali si affidano a una programmazione esplicita. Funzionano bene in ambienti chiusi come aree di magazzino, corsie dedicate e condizioni meteorologiche prevedibili. Sulle strade pubbliche, la stessa logica spesso fallisce.
Immaginate una zona di cantiere con cartelli scritti a mano, coni sparsi con angolazioni insolite e un addetto al traffico che segnala il passaggio. Un sistema basato su regole cerca un segnale stradale chiaro. Invece vede il caos. Senza una regola specifica per "persona con giubbotto arancione che indica a sinistra", l'auto si blocca o sbaglia valutazione. Gli esseri umani gestiscono questa situazione istantaneamente perché interpretiamo l'intento e il contesto, non solo i pixel. Leggiamo la scena. Insegnare a una macchina a fare lo stesso richiede un approccio fondamentalmente diverso.
Imparare osservando: Inverse Reinforcement Learning
È qui che l'Inverse Reinforcement Learning cambia le regole del gioco. Nel reinforcement learning standard, si fornisce all'IA un obiettivo e una funzione di ricompensa. Raggiungi la destinazione velocemente, ottieni punti. Colpisci un cordolo, perdi punti. L'agente procede a tentativi finché non scopre una policy che massimizza il suo punteggio. Ma guidare non riguarda solo l'efficienza. Riguarda il comfort, la sicurezza, la legalità e le convenzioni sociali. Scrivere una ricompensa matematica per "guida come un essere umano prudente ma competente" è quasi impossibile.
L'Inverse Reinforcement Learning ribalta il problema. Invece di fornire all'IA un obiettivo, le mostri degli esempi. L'algoritmo osserva ore di filmati di guida umana. Osserva quando l'essere umano rallenta, cambia corsia in anticipo o cede il passo a un camion che si immette. Non si limita a memorizzare l'esatto angolo di sterzata. Lavora a ritroso per inferire il perché. Forse il conducente ha rallentato perché un bambino si trovava vicino al marciapiede, anche se la strada era legalmente libera. L'IA estrae la ricompensa nascosta: la vicinanza ai pedoni è importante, anche in assenza di strisce pedonali.
Trattando l'essere umano come un esperto che ha già risolto il problema di ottimizzazione, l'algoritmo recupera la funzione di costo che quell'esperto sta minimizzando. Una volta che il sistema comprende le preferenze sottostanti, come favorire una frenata fluida rispetto a stop bruschi o il mantenimento della corsia rispetto al tagliare le curve, può generalizzare. Incontra una nuova strada in una città diversa e sa, approssimativamente, cosa un buon conducente darebbe valore in quel contesto sconosciuto.
Prendere decisioni: Deep Q-Networks
Capire le ricompense è solo metà dell'opera. Un'auto deve comunque agire. Le Deep Q-Networks gestiscono il processo decisionale elaborando i dati sensoriali per scegliere l'azione migliore.
Il classico Q-learning esiste da decenni. Un agente impara il valore di compiere una specifica azione in uno stato specifico. Il problema è che gli stati della guida reale sono praticamente infiniti. Un feed video non è un semplice mondo a griglia. È composto da milioni di pixel che cambiano a sessanta fotogrammi al secondo, combinati con nuvole di punti lidar, letture di velocità e vettori GPS.
Le Deep Q-Networks risolvono questo problema utilizzando una rete neurale come approssimatore di funzioni. La rete riceve dati sensoriali grezzi e restituisce un valore previsto per ogni possibile azione: sterza a sinistra, frena dolcemente, accelera, mantieni la rotta. Invece di memorizzare una tabella di consultazione per ogni scenario, la rete generalizza. Riconosce che una macchia scura in una notte piovosa è probabilmente un'auto parcheggiata, proprio come ha imparato durante l'addestramento in condizioni di sole, e assegna un valore basso all'azione "accelera".
L'addestramento prevede l'experience replay. Il sistema memorizza momenti di guide passate, cambi di corsia riusciti, quasi incidenti e decelerazioni fluide, per poi campionarli casualmente per aggiornare la propria rete. Questo rompe le correlazioni dannose e stabilizza l'apprendimento. Nel corso di migliaia di ore simulate, la rete impara quali azioni portano a un progresso sicuro e quali portano a problemi.
Mettiamo tutto insieme
Nessuno dei due metodi, preso singolarmente, è in grado di creare un conducente competente. L'Inverse Reinforcement Learning senza un motore decisionale è solo un osservatore. Sa che gli esseri umani apprezzano la fluidità, ma non può toccare il volante. Una Deep Q-Network senza una funzione di ricompensa ben strutturata ottimizza l'obiettivo sbagliato. Potrebbe scoprire che guidare in cerchio evita perfettamente le collisioni, ottenendo un punteggio elevato senza però andare da nessuna parte.
Combinati, creano un ciclo potente. L'Inverse Reinforcement Learning osserva gli esperti umani e distilla una funzione di ricompensa che cattura le priorità del mondo reale. La Deep Q-Network utilizza quindi tale funzione di ricompensa per addestrarsi attraverso tentativi ed errori, elaborando i dati dei sensori in tempo reale per scegliere le azioni. L'IA apprende comportamenti complessi attraverso l'osservazione, ma anche attraverso la pratica.
Consideriamo un inserimento in autostrada. La componente di Inverse Reinforcement Learning ha dedotto che i conducenti umani bilanciano l'adeguamento della velocità con l'accettazione dello spazio disponibile. La Deep Q-Network riceve questo segnale di costo sfumato e si esercita nell'inserimento diecimila volte in simulazione. Impara quando accelerare, quando restare indietro e quando lo spazio è troppo stretto. Il risultato non è un pappagallo che ripete le manovre umane registrate. È un sistema che ha interiorizzato la logica e può adattarsi quando l'autostrada è bagnata o lo spazio è più ridotto del solito.
