స్వయంచాలిత కార్లు సంవత్సరాలుగా కఠినమైన సూచనల సమితిని అనుసరిస్తూ వస్తున్నాయి. ఇంజనీర్లు వేలాది 'if-then' స్టేట్మెంట్లను రాశారు. పాదచారి రోడ్డు దాటితే, బ్రేక్ వేయండి. సిగ్నల్ ఎరుపు రంగులోకి మారితే, ఆగండి. లేన్ వంకరగా ఉంటే, స్టీరింగ్ తిప్పండి. ప్రపంచం మనం ఊహించిన విధంగానే ఉన్నప్పుడు ఈ విధానం పనిచేస్తుంది, కానీ నిజమైన డ్రైవింగ్ అంత సులభం కాదు. ప్రతి బురద రోడ్డును, గుర్తు లేని కూడలిని లేదా ట్రాఫిక్లో వెళ్తున్న సైక్లిస్ట్ను ఒక రూల్ బుక్ ద్వారా కవర్ చేయడం సాధ్యం కాదు. వాతావరణం మారినప్పుడు, కఠినమైన ఆదేశాలు విఫలమవుతాయి. మనం కేవలం ఒక చెక్లిస్ట్ను అనుసరించడం కంటే, మంచి డ్రైవింగ్ అంటే ఏమిటో నేర్చుకునే వ్యవస్థలు మనకు అవసరం.
హార్డ్-కోడెడ్ నియమాలకు మించి
సాంప్రదాయ స్వయంచాలిత వ్యవస్థలు స్పష్టమైన ప్రోగ్రామింగ్పై ఆధారపడతాయి. ఇవి వేర్హౌస్ ఫ్లోర్లు, ప్రత్యేకమైన లేన్లు మరియు ఊహించదగిన వాతావరణం వంటి మూసివేసిన వాతావరణాలలో బాగా పనిచేస్తాయి. కానీ బహిరంగ రోడ్లపై, అదే లాజిక్ తరచుగా విఫలమవుతుంది.
చేతితో రాసిన సైన్ బోర్డులు, వింత కోణాల్లో పడి ఉన్న కోన్లు మరియు ట్రాఫిక్ను నియంత్రిస్తున్న ఫ్లాగ్మ్యాన్ ఉన్న నిర్మాణ ప్రాంతాన్ని (construction zone) ఊహించుకోండి. ఒక నియమ ఆధారిత వ్యవస్థ (rule-based system) స్పష్టమైన ట్రాఫిక్ సిగ్నల్ కోసం ఎదురుచూస్తుంది. అది అక్కడ గందరగోళాన్ని చూస్తుంది. "నారింజ రంగు వెస్ట్ ధరించి సంజ్ఞలు చేస్తున్న వ్యక్తి" కోసం ప్రత్యేక నియమం లేకపోతే, కారు ఆగిపోతుంది లేదా తప్పుగా ఊహిస్తుంది. మానవ డ్రైవర్లు దీనిని వెంటనే అర్థం చేసుకుంటారు, ఎందుకంటే మనం కేవలం పిక్సెల్లను మాత్రమే కాకుండా, ఉద్దేశాన్ని మరియు సందర్భాన్ని కూడా అర్థం చేసుకుంటాము. మనం దృశ్యాన్ని చదువుతాము. యంత్రాన్ని కూడా అదే చేయమని నేర్పడానికి ప్రాథమికంగా భిన్నమైన విధానం అవసరం.
గమనించడం ద్వారా నేర్చుకోవడం: Inverse Reinforcement Learning
ఇక్కడే Inverse Reinforcement Learning ఆటను మారుస్తుంది. ప్రామాణిక reinforcement learningలో, మీరు AIకి ఒక లక్ష్యాన్ని మరియు రివార్డ్ ఫంక్షన్ను ఇస్తారు. గమ్యాన్ని త్వరగా చేరుకోండి, పాయింట్లు పొందండి. కర్బ్ను ఢీకొంటే, పాయింట్లు కోల్పోండి. ఏజెంట్ తన స్కోరును గరిష్టీకరించే విధానాన్ని కనుగొనే వరకు ప్రయత్నిస్తూనే ఉంటుంది. కానీ డ్రైవింగ్ అనేది కేవలం సామర్థ్యం గురించి మాత్రమే కాదు. ఇది సౌకర్యం, భద్రత, చట్టబద్ధత మరియు సామాజిక నియమావళి గురించి కూడా. "జాగ్రత్తగా మరియు సమర్థవంతంగా ఉండే మనిషిలా డ్రైవ్ చేయండి" అనే అంశానికి గణితపరమైన రివార్డ్ను రాయడం దాదాపు అసాధ్యం.
Inverse Reinforcement Learning ఈ సమస్యను తిరగేస్తుంది. AIకి లక్ష్యాన్ని ఇవ్వడానికి బదులుగా, మీరు దానికి ఉదాహరణలను చూపిస్తారు. అల్గారిథమ్ గంటల కొద్దీ మానవ డ్రైవింగ్ ఫుటేజీని గమనిస్తుంది. మనిషి ఎప్పుడు నెమ్మదిస్తారో, ఎప్పుడు లేన్ను ముందుగానే మారుస్తారో లేదా మెర్జింగ్ ట్రక్కుకు దారి ఇస్తారో అది గమనిస్తుంది. ఇది కేవలం స్టీరింగ్ యాంగిల్ను మాత్రమే గుర్తుంచుకోదు. అది ఎందుకు అలా చేసిందో తెలుసుకోవడానికి వెనక్కి వెళ్తుంది. బహుశా రోడ్డు చట్టబద్ధంగా ఖాళీగా ఉన్నప్పటికీ, ఫుట్పాత్ దగ్గర ఒక بچہ ఉన్నందున డ్రైవర్ వేగం తగ్గించి ఉండవచ్చు. AI ఆ దాగి ఉన్న రివార్డ్ను గ్రహిస్తుంది: క్రాస్వాక్ లేకపోయినా, పాదచారుల సామీప్యం ముఖ్యం.
మానవుడిని ఇప్పటికే ఆప్టిమైజేషన్ సమస్యను పరిష్కరించిన ఒక నిపుణుడిగా పరిగణించడం ద్వారా, ఆ నిపుణుడు తగ్గించడానికి ప్రయత్నించే కాస్ట్ ఫంక్షన్ను అల్గారిథమ్ తిరిగి పొందుతుంది. హఠాత్తుగా బ్రేక్ వేయడం కంటే మృదువైన బ్రేకింగ్ను లేదా మూలాలను కట్ చేయడం కంటే లేన్ మధ్యలో ఉండటాన్ని ఇష్టపడటం వంటి అంతర్లీన ప్రాధాన్యతలను వ్యవస్థ అర్థం చేసుకున్న తర్వాత, అది కొత్త పరిస్థితులకు అనుగుణంగా మారుతుంది. అది వేరే నగరంలోని కొత్త రోడ్డును చూసినప్పుడు, ఆ అపరిచిత వాతావరణంలో మంచి డ్రైవర్ దేనికి ప్రాధాన్యత ఇస్తారో దాదాపుగా తెలుసుకోగలదు.
నిర్ణయాలు తీసుకోవడం: Deep Q-Networks
రివార్డ్లను అర్థం చేసుకోవడం అనేది సగం పోరాటం మాత్రమే. కారు ఇంకా నిర్ణయాలు తీసుకోవాలి. ఉత్తమ చర్యను ఎంచుకోవడానికి సెన్సరీ డేటాను ప్రాసెస్ చేయడం ద్వారా Deep Q-Networks నిర్ణయ ప్రక్రియను నిర్వహిస్తాయి.
క్లాసిక్ Q-learning దశాబ్దాలుగా ఉంది. ఒక ఏజెంట్ ఒక నిర్దిష్ట స్థితిలో (state) ఒక నిర్దిష్ట చర్య తీసుకోవడం వల్ల కలిగే విలువను నేర్చుకుంటుంది. సమస్య ఏమిటంటే, నిజమైన డ్రైవింగ్ స్టేట్లు దాదాపు అనంతం. కెమెరా ఫీడ్ అనేది ఒక సాధారణ గ్రిడ్ వరల్డ్ కాదు. ఇది సెకనుకు అరవై ఫ్రేమ్ల వేగంతో మారుతున్న మిలియన్ల పిక్సెల్లు, వాటితో పాటు lidar పాయింట్ క్లౌడ్లు, స్పీడ్ రీడింగ్లు మరియు GPS వెక్టర్లు.
Deep Q-Networks ఒక న్యూరల్ నెట్వర్క్ను ఫంక్షన్ అప్రోక్సిమేటర్గా ఉపయోగించడం ద్వారా దీనిని పరిష్కరిస్తాయి. నెట్వర్క్ ముడి సెన్సరీ డేటాను తీసుకుని ప్రతి సాధ్యమయ్యే చర్య కోసం అంచనా వేయబడిన విలువను అందిస్తుంది: ఎడమ వైపుకు స్టీరింగ్ తిప్పడం, నెమ్మదిగా బ్రేక్ వేయడం, వేగం పెంచడం, లేదా మార్గాన్ని కొనసాగించడం. ప్రతి సినారియో కోసం లుకప్ టేబుల్ను నిల్వ చేయడానికి బదులుగా, నెట్వర్క్ సాధారణీకరణను (generalization) చేస్తుంది. వర్షం పడే రాత్రి చీకటిగా ఉన్నప్పుడు కనిపించే ఒక నల్లటి ఆకారం బహుశా పార్క్ చేసిన కారు అయి ఉండవచ్చని, ఎండగా ఉన్నప్పుడు నేర్చుకున్న దానిని బట్టి అది గుర్తిస్తుంది మరియు "వేగం పెంచడం" అనే చర్యకు తక్కువ విలువను కేటాయిస్తుంది.
శిక్షణలో experience replay ఉంటుంది. వ్యవస్థ గత డ్రైవ్ల నుండి, విజయవంతమైన లేన్ మార్పుల నుండి, ప్రమాదకరంగా తప్పించుకున్న సందర్భాల నుండి మరియు మృదువైన డీసెలరేషన్ల నుండి క్షణాలను నిల్వ చేస్తుంది, ఆపై తన నెట్వర్క్ను అప్డేట్ చేయడానికి వాటిని యాదృచ్ఛికంగా తీసుకుంటుంది. ఇది హానికరమైన సంబంధాలను విచ్ఛిన్నం చేస్తుంది మరియు నేర్చుకునే ప్రక్రియను స్థిరీకరిస్తుంది. వేలాది సిమ్యులేటెడ్ గంటల ద్వారా, ఏ చర్యలు సురక్షితమైన ప్రయాణానికి దారితీస్తాయో మరియు ఏ చర్యలు ఇబ్బందులకు దారితీస్తాయో నెట్వర్క్ నేర్చుకుంటుంది.
అంతా కలిపి
ఏ పద్ధతి కూడా ఒంటరిగా సమర్థవంతమైన డ్రైవర్ను తయారు చేయలేదు. నిర్ణయ యంత్రాంగం (decision engine) లేని Inverse Reinforcement Learning కేవలం ఒక పరిశీలకుడిలా మాత్రమే ఉంటుంది. మనుషులు సాఫీగా డ్రైవింగ్ చేయడాన్ని ఇష్టపడతారని దానికి తెలుసు, కానీ అది స్టీరింగ్ను పట్టుకోలేదు. సరిగ్గా రూపొందించబడిన రివార్డ్ ఫంక్షన్ (reward function) లేని Deep Q-Network తప్పు అంశాల కోసం ఆప్టిమైజ్ చేస్తుంది. ఎక్కడికీ వెళ్లకుండా కేవలం వృత్తాకారంలో తిరగడం వల్ల ప్రమాదాలు జరగవు అని, తద్వారా ఎక్కువ స్కోరు వస్తుందని అది గుర్తించవచ్చు.
ఇవి రెండూ కలిస్తే ఒక శక్తివంతమైన లూప్ను సృష్టిస్తాయి. Inverse Reinforcement Learning మానవ నిపుణులను గమనించి, వాస్తవ ప్రపంచ ప్రాధాన్యతలను ప్రతిబింబించేలా ఒక రివార్డ్ ఫంక్షన్ను సంగ్రహిస్తుంది. ఆ తర్వాత Deep Q-Network ఆ రివార్డ్ ఫంక్షన్ను ఉపయోగించి, లైవ్ సెన్సార్ డేటాను విశ్లేషించి, తప్పులు చేస్తూ నేర్చుకుంటూ (trial and error) చర్యలను ఎంచుకోవడానికి తనను తాను శిక్షణ ఇచ్చుకుంటుంది. AI సంక్లిష్టమైన ప్రవర్తనలను పరిశీలన ద్వారా మాత్రమే కాకుండా, సాధన ద్వారా కూడా నేర్చుకుంటుంది.
హైవే మెర్జ్ (highway merge) సందర్భాన్ని పరిశీలిద్దాం. మానవ డ్రైవర్లు వేగాన్ని సరిపోల్చుకుంటూనే, ఖాళీ ప్రదేశాన్ని (gap acceptance) ఎలా సమతుల్యం చేస్తారో Inverse Reinforcement Learning అంశం గ్రహించింది. Deep Q-Network ఈ సూక్ష్మమైన సిగ్నల్ను అందుకుని, సిమ్యులేషన్లో పది వేల సార్లు మెర్జ్ అయ్యే ప్రక్రియను ప్రాక్టీస్ చేస్తుంది. ఎప్పుడు వేగం పెంచాలి, ఎప్పుడు వెనక్కి తగ్గాలి మరియు ఎప్పుడు ఖాళీ తక్కువగా ఉందో అది నేర్చుకుంటుంది. దీని ఫలితం కేవలం రికార్డ్ చేయబడిన మానవ కదలికలను అనుకరించే చిలుకలా ఉండదు. ఇది తర్కాన్ని అంతర్గతంగా గ్రహించిన వ్యవస్థ, కాబట్టి హైవే తడిగా ఉన్నా లేదా ఖాళీ ప్రదేశం మామూలు కంటే తక్కువగా ఉన్నా ఇది తగినట్లుగా మారుతుంది.
