सेल्फ-ड्राइविंग कारें सालों से कठोर निर्देश सेटों का पालन करती आ रही हैं। इंजीनियरों ने हजारों 'इफ-देन' (if-then) कथन लिखे। यदि कोई पैदल यात्री सड़क पार करता है, तो ब्रेक लगाएँ। यदि लाइट लाल हो जाती है, तो रुकें। यदि लेन मुड़ती है, तो स्टीयर करें। यह दृष्टिकोण तब काम करता है जब दुनिया बिल्कुल वैसी ही व्यवहार करती है जैसी उम्मीद की जाती है, लेकिन वास्तविक ड्राइविंग अधिक जटिल है। एक नियम पुस्तिका हर कीचड़ भरी कच्ची सड़क, बिना निशान वाले चौराहे, या ट्रैफिक के बीच से निकल रहे साइकिल चालक को कवर नहीं कर सकती। जब वातावरण बदलता है, तो सख्त कमांड विफल हो जाते हैं। हमें ऐसे सिस्टम की आवश्यकता है जो केवल एक चेकलिस्ट का पालन करने के बजाय यह सीखें कि अच्छी ड्राइविंग का अर्थ क्या है।

हार्ड-कोडेड नियमों से परे

पारंपरिक स्वायत्त प्रणालियाँ स्पष्ट प्रोग्रामिंग पर निर्भर करती हैं। वे गोदामों के फर्श, समर्पित लेन और पूर्वानुमानित मौसम जैसे बंद वातावरणों में अच्छी तरह से काम करती हैं। सार्वजनिक सड़कों पर, यही तर्क अक्सर विफल हो जाता है।

हाथ से लिखे संकेतों वाले निर्माण क्षेत्र (construction zone) की कल्पना करें, जहाँ शंकु (cones) अजीब कोणों पर बिखरे हुए हैं और एक फ्लैगमैन ट्रैफिक को निर्देशित कर रहा है। एक नियम-आधारित सिस्टम स्पष्ट ट्रैफिक सिग्नल चाहता है। उसे केवल अराजकता दिखाई देती है। "नारंगी बनियान पहने व्यक्ति के बाएं इशारा करने" के लिए किसी विशिष्ट नियम के बिना, कार जम जाती है या गलत अनुमान लगाती है। मानव चालक इसे तुरंत संभाल लेते हैं क्योंकि हम केवल पिक्सेल नहीं, बल्कि इरादे और संदर्भ (intent and context) की व्याख्या करते हैं। हम दृश्य को समझते हैं। मशीन को ऐसा करने के लिए सिखाने के लिए एक मौलिक रूप से अलग दृष्टिकोण की आवश्यकता होती है।

देखकर सीखना: Inverse Reinforcement Learning

यहीं पर Inverse Reinforcement Learning खेल बदल देता है। मानक Reinforcement Learning में, आप AI को एक लक्ष्य और एक रिवॉर्ड फंक्शन (reward function) देते हैं। गंतव्य तक जल्दी पहुँचें, अंक प्राप्त करें। कर्ब (curb) से टकराएँ, अंक खो दें। एजेंट तब तक भटकता रहता है जब तक कि वह ऐसी पॉलिसी न खोज ले जो उसके स्कोर को अधिकतम कर दे। लेकिन ड्राइविंग केवल दक्षता के बारे में नहीं है। यह आराम, सुरक्षा, वैधता और सामाजिक परंपराओं के बारे में है। "एक सतर्क लेकिन सक्षम मानव की तरह ड्राइव करें" के लिए गणितीय रिवॉर्ड लिखना लगभग असंभव है।

Inverse Reinforcement Learning इस समस्या को उलट देता है। AI को लक्ष्य देने के बजाय, आप उसे उदाहरण दिखाते हैं। एल्गोरिदम मानव ड्राइविंग फुटेज के घंटों का अवलोकन करता है। वह देखता है कि मानव कब धीमा होता है, लेन कब जल्दी बदलता है, या मर्ज होने वाले ट्रक को कब रास्ता देता है। यह केवल सटीक स्टीयरिंग एंगल को याद नहीं करता है। यह इसके पीछे के कारण का अनुमान लगाने के लिए पीछे की ओर काम करता है। शायद ड्राइवर इसलिए धीमा हुआ क्योंकि फुटपाथ के पास एक बच्चा खड़ा था, भले ही सड़क कानूनी रूप से खाली थी। AI छिपे हुए रिवॉर्ड को निकाल लेता है: पैदल यात्री की निकटता मायने रखती है, भले ही वहां कोई क्रॉसवाक न हो।

मानव को एक विशेषज्ञ के रूप में मानकर, जिसने पहले ही ऑप्टिमाइज़ेशन समस्या को हल कर लिया है, एल्गोरिदम उस कॉस्ट फंक्शन (cost function) को पुनः प्राप्त कर लेता है जिसे वह विशेषज्ञ कम कर रहा है। एक बार जब सिस्टम अंतर्निहित प्राथमिकताओं को समझ लेता है, जैसे कि अचानक रुकने के बजाय सुचारू ब्रेकिंग को प्राथमिकता देना या कोनों को काटने के बजाय लेन के बीच में रहना, तो यह सामान्यीकरण (generalize) कर सकता है। जब यह किसी दूसरे शहर में एक नई सड़क पर आता है, तो यह लगभग जान जाता है कि उस अपरिचित सेटिंग में एक अच्छा ड्राइवर किसे महत्व देगा।

निर्णय लेना: Deep Q-Networks

रिवॉर्ड को समझना केवल आधी लड़ाई है। कार को अभी भी कार्य करने की आवश्यकता है। Deep Q-Networks सबसे अच्छा कार्य चुनने के लिए संवेदी डेटा (sensory data) को प्रोसेस करके निर्णय लेने का कार्य संभालते हैं।

क्लासिक Q-learning दशकों से अस्तित्व में है। एक एजेंट एक विशिष्ट स्थिति (state) में एक विशिष्ट कार्य करने के मूल्य को सीखता है। समस्या यह है कि वास्तविक ड्राइविंग स्थितियाँ व्यावहारिक रूप से अनंत हैं। कैमरा फीड कोई सरल ग्रिड वर्ल्ड नहीं है। यह साठ फ्रेम प्रति सेकंड पर बदलने वाले लाखों पिक्सेल हैं, जो lidar पॉइंट क्लाउड्स, गति रीडिंग और GPS वेक्टर्स के साथ मिलकर काम करते हैं।

Deep Q-Networks एक न्यूरल नेटवर्क को फंक्शन एप्रोक्सिमेटर (function approximator) के रूप में उपयोग करके इसे हल करते हैं। नेटवर्क कच्चे संवेदी डेटा को लेता है और प्रत्येक संभावित कार्य के लिए एक अनुमानित मान आउटपुट करता है: बाएं मुड़ें, धीरे से ब्रेक लगाएं, गति बढ़ाएं, मार्ग बनाए रखें। हर परिदृश्य के लिए लुकअप टेबल स्टोर करने के बजाय, नेटवर्क सामान्यीकरण करता है। यह पहचान लेता है कि बारिश वाली रात में एक काला धब्बा संभवतः एक खड़ी कार है, ठीक वैसे ही जैसे उसने धूप वाले प्रशिक्षण के दौरान सीखा था, और "गति बढ़ाएं" कार्य को कम मान देता है।

प्रशिक्षण में एक्सपीरियंस रिप्ले (experience replay) शामिल है। सिस्टम पिछले ड्राइविंग के क्षणों, सफल लेन परिवर्तन, बाल-बाल बचने वाली स्थितियों और सुचारू मंदी (decelerations) को स्टोर करता है, फिर अपने नेटवर्क को अपडेट करने के लिए उन्हें यादृच्छिक रूप से चुनता है। यह हानिकारक सहसंबंधों (correlations) को तोड़ता है और सीखने को स्थिर करता है। हजारों सिम्युलेटेड घंटों के दौरान, नेटवर्क सीखता है कि कौन से कार्य सुरक्षित प्रगति की ओर ले जाते हैं और कौन से परेशानी की ओर।

सब कुछ एक साथ जोड़ना

कोई भी एक तरीका अकेले एक सक्षम ड्राइवर नहीं बना सकता। बिना डिसीजन इंजन के Inverse Reinforcement Learning केवल एक ऑब्जर्वर है। यह जानता है कि इंसान सुगमता को महत्व देते हैं, लेकिन यह स्टीयरिंग व्हील को छू नहीं सकता। एक अच्छी तरह से तैयार किए गए रिवॉर्ड फंक्शन के बिना Deep Q-Network गलत चीज़ के लिए ऑप्टिमाइज़ करता है। यह यह खोज सकता है कि गोल-गोल घूमकर ड्राइविंग करने से टकराव पूरी तरह से टल जाता है, जिससे कहीं भी न पहुँचते हुए भी एक उच्च स्कोर प्राप्त हो जाता है।

साथ मिलकर, वे एक शक्तिशाली लूप बनाते हैं। Inverse Reinforcement Learning मानव विशेषज्ञों को देखता है और एक ऐसा रिवॉर्ड फंक्शन निकालता है जो वास्तविक दुनिया की प्राथमिकताओं को दर्शाता है। इसके बाद Deep Q-Network उस रिवॉर्ड फंक्शन का उपयोग करके ट्रायल और एरर के माध्यम से खुद को प्रशिक्षित करता है, और क्रियाएं चुनने के लिए लाइव सेंसर डेटा को प्रोसेस करता है। AI अवलोकन के माध्यम से जटिल व्यवहार सीखता है, लेकिन अभ्यास के माध्यम से भी।

हाईवे मर्ज पर विचार करें। Inverse Reinforcement Learning घटक ने यह निष्कर्ष निकाला है कि मानव ड्राइवर गति मिलान और गैप स्वीकार करने के बीच संतुलन बनाए रखते हैं। Deep Q-Network इस सूक्ष्म कॉस्ट सिग्नल को प्राप्त करता है और सिमुलेशन में दस हजार बार मर्ज करने का अभ्यास करता है। यह सीखता है कि कब गति बढ़ानी है, कब पीछे रहना है, और कब गैप बहुत कम है। इसका परिणाम रिकॉर्ड किए गए मानवीय मूव्स को दोहराने वाला कोई तोता नहीं है। यह एक ऐसा सिस्टम है जिसने तर्क को आत्मसात कर लिया है और जब हाईवे गीला हो या गैप सामान्य से कम हो, तो यह खुद को ढाल सकता है।

यह वास्तविक सड़कों के लिए क्यों महत्वपूर्ण है