தானியங்கி கார்கள் பல ஆண்டுகளாகக் கடுமையான அறிவுறுத்தல் தொகுப்புகளைப் பின்பற்றி வருகின்றன. பொறியாளர்கள் ஆயிரக்கணக்கான 'இருந்தால்-அப்படியென்றால்' (if-then) கூற்றுகளை எழுதினார்கள். ஒரு பாதசாரி குறுக்கே வந்தால், பிரேக் போடு. சிக்னல் சிவப்பாக மாறினால், நிறுத்து. வழி வளைந்தால், திருப்பு. உலகம் எதிர்பார்த்தபடியே செயல்படும் போது இந்த அணுகுமுறை வேலை செய்யும், ஆனால் நிஜமான ஓட்டுதல் மிகவும் சிக்கலானது. ஒவ்வொரு சேறு நிறைந்த பின்னூரிடத்தையும், அடையாளமிடப்படாத சந்திப்பையோ அல்லது போக்குவரத்து நெரிசலில் ஊடுருவிச் செல்லும் சைக்கிள் ஓட்டுநரையோ ஒரு விதிமுறைப் புத்தகத்தால் ஈடு செய்ய முடியாது. சூழல் மாறும்போது, கடுமையான கட்டளைகள் தோல்வியடைகின்றன. வெறும் சரிபார்ப்புப் பட்டியலைப் பின்பற்றுவதற்குப் பதிலாக, சிறந்த ஓட்டுதல் என்றால் என்ன என்பதைக் கற்றுக்கொள்ளும் அமைப்புகள் நமக்குத் தேவை.

கடினமான குறியீட்டு விதிகளுக்கு அப்பால்

பாரம்பரியத் தானியங்கி அமைப்புகள் வெளிப்படையான நிரலாக்கத்தைச் (explicit programming) சார்ந்திருக்கின்றன. அவை கிடங்குத் தளங்கள், பிரத்யேகப் பாதைகள் மற்றும் கணிக்கக்கூடிய வானிலை போன்ற மூடிய சூழல்களில் சிறப்பாகச் செயல்படுகின்றன. பொதுச் சாலைகளில், அதே தர்க்கம் பெரும்பாலும் தோல்வியடைகிறது.

கையால் எழுதப்பட்ட பலகைகள், விசித்திரமான கோணங்களில் சிதறிக் கிடக்கும் கோன்கள் மற்றும் போக்குவரத்தை வழிநடத்தும் ஒரு கொடி ஏந்திய நபர் (flagman) கொண்ட ஒரு கட்டுமானப் பகுதியை கற்பனை செய்து பாருங்கள். ஒரு விதிமுறை சார்ந்த அமைப்பு தெளிவான போக்குவரத்து சிக்னலை எதிர்பார்க்கும். அது குழப்பத்தையே காணும். "ஆரஞ்சு நிற உடை அணிந்த நபர் இடதுபுறம் சைகை செய்கிறார்" என்பதற்கான குறிப்பிட்ட விதி இல்லையென்றால், கார் அப்படியே நின்றுவிடும் அல்லது தவறாகக் கணிக்கும். மனித ஓட்டுநர்கள் இதை உடனடியாகக் கையாளுவார்கள், ஏனெனில் நாங்கள் வெறும் பிக்சல்களை (pixels) மட்டும் பார்க்காமல், நோக்கத்தையும் சூழலையும் புரிந்துகொள்கிறோம். நாங்கள் அந்தச் சூழலைப் படிக்கிறோம். ஒரு இயந்திரத்திற்கு இதைப் போலவே செய்யக் கற்பிப்பது முற்றிலும் மாறுபட்ட அணுகுமுறையைக் கோருகிறது.

கவனிப்பதன் மூலம் கற்றல்: Inverse Reinforcement Learning

இங்குதான் Inverse Reinforcement Learning விளையாட்டை மாற்றுகிறது. நிலையான Reinforcement Learning-இல், நீங்கள் AI-க்கு ஒரு இலக்கையும் வெகுமதிச் செயல்பாட்டையும் (reward function) வழங்குகிறீர்கள். இலக்கை விரைவாக அடையுங்கள், புள்ளிகளைப் பெறுங்கள். நடைபாதையில் மோதினால், புள்ளிகளை இழக்கவும். அதன் மதிப்பெண்ணை அதிகப்படுத்தும் ஒரு கொள்கையைக் (policy) கண்டறியும் வரை அந்த ஏஜென்ட் (agent) தடுமாறிச் செல்லும். ஆனால் ஓட்டுதல் என்பது வெறும் செயல்திறனைப் பற்றியது மட்டுமல்ல. அது வசதி, பாதுகாப்பு, சட்டபூர்வமான நடைமுறை மற்றும் சமூக மரபுகளைப் பற்றியதுமாகும். "ஒரு எச்சரிக்கையான ஆனால் திறமையான மனிதனைப் போல ஓட்டுங்கள்" என்பதற்கான கணித ரீதியான வெகுமதியை எழுதுவது கிட்டத்தட்ட சாத்தியமற்றது.

Inverse Reinforcement Learning இந்தப் பிரச்சனையைத் தலைகீழாக மாற்றுகிறது. AI-க்கு ஒரு இலக்கைக் கொடுப்பதற்குப் பதிலாக, நீங்கள் அதற்கு உதாரணங்களைக் காட்டுகிறீர்கள். இந்த அல்காரிதம் (algorithm) பல மணிநேர மனித ஓட்டுதல் காட்சிகளைக் கவனிக்கும். மனிதன் எப்போது வேகம் குறைக்கிறார், எப்போது முன்கூட்டியே பாதையை மாற்றுகிறார் அல்லது ஒரு லாரி இணையும் போது வழிவிடுகிறார் என்பதைக் கவனிக்கும். அது துல்லியமான ஸ்டீயரிங் கோணத்தை (steering angle) மட்டும் மனப்பாடம் செய்வதில்லை. அது ஏன் என்பதை அறிய பின்னோக்கிச் செயல்படுகிறது. சாலை சட்டப்படி காலியாக இருந்தபோதிலும், நடைபாதைக்கு அருகில் ஒரு குழந்தை நின்றதால் ஓட்டுநர் வேகத்தைக் குறைத்திருக்கலாம். AI அந்த மறைமுகமான வெகுமதியைச் பிரித்தெடுக்கிறது: பாதசாரி குறுக்குப்பாதை இல்லாவிட்டாலும், அவர்களின் அருகாமை முக்கியமானது.

மனிதனை ஏற்கனவே உகப்பாக்கல் சிக்கலைத் (optimization problem) தீர்த்த ஒரு நிபுணராகக் கருதுவதன் மூலம், அந்த நிபுணர் எதனைக் குறைக்க முயல்கிறார் என்பதைக் கண்டறியும் செலவுச் செயல்பாட்டை (cost function) அல்காரிதம் மீட்டெடுக்கிறது. ஒருமுறை அமைப்பு அடிப்படையான விருப்பங்களைப் புரிந்துகொண்டால் (உதாரணமாக, திடீர் நிறுத்தங்களை விட மென்மையான பிரேக்கிங்கையும், குறுக்காகச் செல்வதை விட பாதையின் மையப்பகுதியில் செல்வதையும் விரும்புவது), அது பொதுப்படையாகச் செயல்பட முடியும். அது ஒரு புதிய நகரத்தில் உள்ள புதிய பாதையைச் சந்திக்கும் போது, அந்தப் புதிய சூழலில் ஒரு சிறந்த ஓட்டுநர் எதற்கு முக்கியத்துவம் கொடுப்பார் என்பதை ஏறத்தாழத் தெரிந்து கொள்ளும்.

முடிவுகளை எடுத்தல்: Deep Q-Networks

வெகுமதிகளைப் புரிந்துகொள்வது பாதிப் போர் மட்டுமே. ஒரு கார் இன்னும் செயல்பட வேண்டும். சிறந்த செயலைத் தேர்ந்தெடுக்க உணர்வுத் தரவுகளை (sensory data) செயலாக்குவதன் மூலம் Deep Q-Networks முடிவெடுக்கும் பணியைக் கையாள்கின்றன.

கிளாசிக் Q-learning பல தசாப்தங்களாக இருந்து வருகிறது. ஒரு குறிப்பிட்ட நிலையில் ஒரு குறிப்பிட்ட செயலைச் செய்வதன் மதிப்பை ஒரு ஏஜென்ட் கற்றுக்கொள்கிறது. ஆனால் நிஜமான ஓட்டுதல் நிலைகள் நடைமுறையில் முடிவிலி போன்றவை. ஒரு கேமரா காட்சி என்பது ஒரு எளிய கட்ட உலகமல்ல (grid world). அது நொடிக்கு அறுபது பிரேம்களில் (frames per second) மாறும் மில்லியன் கணக்கான பிக்சல்கள், அதனுடன் lidar point clouds, வேக அளவீடுகள் மற்றும் GPS வெக்டர்கள் ஆகியவை இணைந்ததாகும்.

Deep Q-Networks ஒரு நரம்பியல் வலைப்பின்னலை (neural network) ஒரு சார்பு மதிப்பீட்டாளராகப் (function approximator) பயன்படுத்துவதன் மூலம் இதைத் தீர்க்கிறது. இந்த வலைப்பின்னல் மூலத் தரவுகளைப் பெற்று, ஒவ்வொரு சாத்தியமான செயலுக்கும் ஒரு கணிக்கப்பட்ட மதிப்பை வெளியிடுகிறது: இடதுபுறம் திருப்பு, மென்மையாக பிரேக் போடு, வேகத்தை அதிகரி, பாதையைத் தொடர். ஒவ்வொரு சூழ்நிலைக்கும் ஒரு தேடல் அட்டவணையைச் (lookup table) சேமிப்பதற்குப் பதிலாக, வலைப்பின்னல் பொதுப்படையாகச் செயல்படுகிறது. வெயில் காலப் பயிற்சியின் போது கற்றது போலவே, மழைக்கால இரவில் ஒரு இருண்ட நிழல் ஒரு நிறுத்தப்பட்ட காராக இருக்கலாம் என்பதை அது அடையாளம் கண்டு, "வேகத்தை அதிகரி" என்ற செயலுக்குக் குறைந்த மதிப்பை வழங்குகிறது.

பயிற்சி என்பது அனுபவ மறுசுழற்சியை (experience replay) உள்ளடக்கியது. கடந்த கால பயணங்கள், வெற்றிகரமான பாத மாற்றங்கள், விபத்துத் தவிர்க்கப்பட்ட தருணங்கள் மற்றும் மென்மையான வேகக் குறைப்பு போன்ற தருணங்களை அமைப்பு சேமித்து வைத்து, பின்னர் தனது வலைப்பின்னலைப் புதுப்பிக்க அவற்றைச் சீரற்ற முறையில் எடுக்கிறது. இது தீங்கு விளைவிக்கும் தொடர்புகளை உடைத்து கற்றலை நிலைப்படுத்துகிறது. ஆயிரக்கணக்கான உருவகப்படுத்தப்பட்ட (simulated) மணிநேரங்களுக்குப் பிறகு, எந்தச் செயல்கள் பாதுகாப்பான முன்னேற்றத்திற்கு வழிவகுக்கும் மற்றும் எந்தச் செயல்கள் சிக்கலுக்கு வழிவகுக்கும் என்பதை வலைப்பின்னல் கற்றுக்கொள்கிறது.

அனைத்தையும் இணைத்தல்

Neither method alone builds a competent driver. Inverse Reinforcement Learning without a decision engine is just an observer. It knows that humans value smoothness but cannot touch the wheel. A Deep Q-Network without a well-crafted reward function optimizes for the wrong thing. It might discover that driving in circles avoids collisions perfectly, achieving a high score while going nowhere.

Combined, they create a powerful loop. Inverse Reinforcement Learning watches human experts and distills a reward function that captures real-world priorities. The Deep Q-Network then uses that reward function to train itself through trial and error, processing live sensor data to choose actions. The AI learns complex behaviors through observation, but also through practice.

Consider a highway merge. The Inverse Reinforcement Learning component has inferred that human drivers balance speed matching with gap acceptance. The Deep Q-Network receives this nuanced cost signal and practices merging ten thousand times in simulation. It learns when to speed up, when to hang back, and when a gap is too tight. The result is not a parrot repeating recorded human moves. It is a system that internalized the logic and can adapt when the highway is wet or the gap is smaller than usual.

Why This Matters for Real Roads