ಸ್ವಯಂ ಚಾಲಿತ ಕಾರುಗಳು ವರ್ಷಗಳಿಂದ ಕಟ್ಟುನಿಟ್ಟಾದ ಸೂಚನಾ ಸೆಟ್ಗಳನ್ನು ಅನುಸರಿಸುತ್ತಿವೆ. ಎಂಜಿನಿಯರ್ಗಳು ಸಾವಿರಾರು 'if-then' ಹೇಳಿಕೆಗಳನ್ನು ಬರೆದಿದ್ದಾರೆ. ಪಾದಚಾರಿ ರಸ್ತೆ ದಾಟಿದರೆ, ಬ್ರೇಕ್ ಹಾಕು. ಲೈಟ್ ಕೆಂಪು ಬಣ್ಣಕ್ಕೆ ಬದಲಾದರೆ, ನಿಲ್ಲು. ಲೇನ್ ವಕ್ರವಾಗಿದ್ದರೆ, ಸ್ಟೀರಿಂಗ್ ಮಾಡು. ಪ್ರಪಂಚವು ನಿರೀಕ್ಷಿಸಿದಂತೆಯೇ ವರ್ತಿಸಿದಾಗ ಈ ವಿಧಾನವು ಕೆಲಸ ಮಾಡುತ್ತದೆ, ಆದರೆ ನೈಜ ಚಾಲನೆಯು ಹೆಚ್ಚು ಸಂಕೀರ್ಣವಾಗಿದೆ. ಪ್ರತಿಯೊಂದು ಕೆಸರು ತುಂಬಿದ ಹಿಂಬದಿಯ ರಸ್ತೆ, ಗುರುತಿಸದ ರಸ್ತೆ ಸಂಧಿಗಳು ಅಥವಾ ಟ್ರಾಫಿಕ್ ನಡುವೆ ಸಾಗುವ ಸೈಕಲ್ ಸವಾರನನ್ನು ನಿಯಮದ ಪುಸ್ತಕದಿಂದ ಕವರ್ ಮಾಡಲು ಸಾಧ್ಯವಿಲ್ಲ. ಪರಿಸರವು ಬದಲಾದಾಗ, ಕಟ್ಟುನಿಟ್ಟಾದ ಆದೇಶಗಳು ವಿಫಲವಾಗುತ್ತವೆ. ನಾವು ಕೇವಲ ಚೆಕ್ಲಿಸ್ಟ್ ಅನ್ನು ಅನುಸರಿಸುವ ಬದಲು, ಉತ್ತಮ ಚಾಲನೆ ಎಂದರೆ ಏನು ಎಂಬುದನ್ನು ಕಲಿಯುವ ವ್ಯವಸ್ಥೆಗಳ ಅಗತ್ಯವಿದೆ.
ಹಾರ್ಡ್-ಕೋಡ್ ಮಾಡಲಾದ ನಿಯಮಗಳ ಆಚೆಗಡೆ
ಸಾಂಪ್ರದಾಯಿಕ ಸ್ವಾಯತ್ತ ವ್ಯವಸ್ಥೆಗಳು ಸ್ಪಷ್ಟವಾದ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿವೆ. ಅವು ಗೋದಾಮುಗಳ ನೆಲ, ಮೀಸಲಾದ ಲೇನ್ಗಳು ಮತ್ತು ಮುನ್ಸೂಚನೆ ನೀಡಬಹುದಾದ ಹವಾಮಾನದಂತಹ ಮುಚ್ಚಿದ ಪರಿಸರಗಳಲ್ಲಿ ಚೆನ್ನಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ. ಸಾರ್ವಜನಿಕ ರಸ್ತೆಗಳಲ್ಲಿ, ಅದೇ ತರ್ಕವು ಅನೇಕ ಬಾರಿ ವಿಫಲವಾಗುತ್ತದೆ.
ಕೈಬರಹದ ಫಲಕಗಳು, ವಿಚಿತ್ರ ಕೋನಗಳಲ್ಲಿ ಚದುರಿಹೋಗಿರುವ ಕೋನ್ಗಳು ಮತ್ತು ಟ್ರಾಫಿಕ್ ಅನ್ನು ನಿಯಂತ್ರಿಸುವ ಫ್ಲ್ಯಾಗ್ಮ್ಯಾನ್ ಇರುವ ನಿರ್ಮಾಣ ಪ್ರದೇಶವನ್ನು ಕಲ್ಪಿಸಿಕೊಳ್ಳಿ. ನಿಯಮ ಆಧಾರಿತ ವ್ಯವಸ್ಥೆಯು ಸ್ಪಷ್ಟವಾದ ಟ್ರಾಫಿಕ್ ಸಿಗ್ನಲ್ ಅನ್ನು ಬಯಸುತ್ತದೆ. ಅದು ಅಲ್ಲಿನ ಗೊಂದಲವನ್ನು ನೋಡುತ್ತದೆ. "ಕಿತ್ತಳೆ ಬಣ್ಣದ ವೆಸ್ಟ್ ಧರಿಸಿದ ವ್ಯಕ್ತಿ ಎಡಕ್ಕೆ ಸಂಕೇತಿಸುತ್ತಿದ್ದಾನೆ" ಎಂಬ ನಿರ್ದಿಷ್ಟ ನಿಯಮವಿಲ್ಲದೆ, ಕಾರು ಸ್ಥಗಿತಗೊಳ್ಳುತ್ತದೆ ಅಥವಾ ತಪ್ಪು ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ. ಮಾನವ ಚಾಲಕರು ಇದನ್ನು ತಕ್ಷಣವೇ ನಿಭಾಯಿಸುತ್ತಾರೆ ಏಕೆಂದರೆ ನಾವು ಕೇವಲ ಪಿಕ್ಸೆಲ್ಗಳನ್ನು ಮಾತ್ರವಲ್ಲದೆ, ಉದ್ದೇಶ ಮತ್ತು ಸಂದರ್ಭವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುತ್ತೇವೆ. ನಾವು ದೃಶ್ಯವನ್ನು ಓದುತ್ತೇವೆ. ಯಂತ್ರಕ್ಕೆ ಇದನ್ನೇ ಮಾಡಲು ಕಲಿಸುವುದು ಮೂಲಭೂತವಾಗಿ ವಿಭಿನ್ನವಾದ ವಿಧಾನವನ್ನು ಬಯಸುತ್ತದೆ.
ವೀಕ್ಷಿಸುವ ಮೂಲಕ ಕಲಿಯುವುದು: Inverse Reinforcement Learning
ಇಲ್ಲೇ Inverse Reinforcement Learning ಆಟವನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ. ಪ್ರಮಾಣಿತ reinforcement learning ನಲ್ಲಿ, ನೀವು AI ಗೆ ಒಂದು ಗುರಿ ಮತ್ತು ರಿವಾರ್ಡ್ ಫಂಕ್ಷನ್ (reward function) ನೀಡುತ್ತೀರಿ. ಗುರಿಯನ್ನು ಬೇಗ ತಲುಪಿದರೆ, ಪಾಯಿಂಟ್ಗಳನ್ನು ಗಳಿಸಿ. ಕರ್ಬಿಗೆ ಡಿಕ್ಕಿ ಹೊಡೆದರೆ, ಪಾಯಿಂಟ್ಗಳನ್ನು ಕಳೆದುಕೊಳ್ಳಿ. ಏಜೆಂಟ್ ತನ್ನ ಸ್ಕೋರ್ ಅನ್ನು ಗರಿಷ್ಠಗೊಳಿಸುವ ನೀತಿಯನ್ನು ಕಂಡುಹಿಡಿಯುವವರೆಗೆ ಅಲೆದಾಡುತ್ತಿರುತ್ತದೆ. ಆದರೆ ಚಾಲನೆಯು ಕೇವಲ ದಕ್ಷತೆಯ ಬಗ್ಗೆ ಮಾತ್ರವಲ್ಲ. ಇದು ಸೌಕರ್ಯ, ಸುರಕ್ಷತೆ, ಕಾನೂನುಬದ್ಧತೆ ಮತ್ತು ಸಾಮಾಜಿಕ ಸಂಪ್ರದಾಯಗಳ ಬಗ್ಗೆಯೂ ಆಗಿದೆ. "ಜಾಗರೂಕ ಆದರೆ ಸಮರ್ಥ ಮಾನವನಂತೆ ಚಾಲನೆ ಮಾಡಿ" ಎಂಬುದಕ್ಕೆ ಗಣಿತೀಯ ರಿವಾರ್ಡ್ ಅನ್ನು ಬರೆಯುವುದು ಅಸಾಧ್ಯದ ಮಾತು.
Inverse Reinforcement Learning ಸಮಸ್ಯೆಯನ್ನು ಉಲ್ಟಾ ಮಾಡುತ್ತದೆ. AI ಗೆ ಗುರಿಯನ್ನು ನೀಡುವ ಬದಲಿಗೆ, ನೀವು ಅದಕ್ಕೆ ಉದಾಹರಣೆಗಳನ್ನು ತೋರಿಸುತ್ತೀರಿ. ಅಲ್ಗಾರಿದಮ್ ಮಾನವ ಚಾಲನೆಯ ಗಂಟೆಗಟ್ಟಲೆ ದೃಶ್ಯಗಳನ್ನು ವೀಕ್ಷಿಸುತ್ತದೆ. ಮಾನವನು ಯಾವಾಗ ವೇಗವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತಾನೆ, ಲೇನ್ಗಳನ್ನು ಮುಂಚಿತವಾಗಿ ಬದಲಾಯಿಸುತ್ತಾನೆ ಅಥವಾ ಮರ್ಜಿಂಗ್ ಆಗುತ್ತಿರುವ ಟ್ರಕ್ಗೆ ದಾರಿ ಬಿಡುತ್ತಾನೆ ಎಂಬುದನ್ನು ಅದು ಗಮನಿಸುತ್ತದೆ. ಅದು ಕೇವಲ ನಿಖರವಾದ ಸ್ಟೀರಿಂಗ್ ಕೋನವನ್ನು ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವುದಿಲ್ಲ. ಅದು ಏಕೆ ಹೀಗೆ ಮಾಡಿತು ಎಂಬುದನ್ನು ತಿಳಿಯಲು ಹಿಂದಕ್ಕೆ ಕೆಲಸ ಮಾಡುತ್ತದೆ. ಬಹುಶಃ ರಸ್ತೆ ಕಾನೂನುಬದ್ಧವಾಗಿ ಖಾಲಿ ಇದ್ದರೂ, ಪಾದಚಾರಿ ಸಿಗ್ನಲ್ ಬಳಿ ಮಗು ನಿಂತಿದ್ದರಿಂದ ಚಾಲಕ ವೇಗವನ್ನು ಕಡಿಮೆ ಮಾಡಿರಬಹುದು. AI ಅಡಗಿರುವ ರಿವಾರ್ಡ್ ಅನ್ನು ಹೊರತೆಗೆಯುತ್ತದೆ: ಕ್ರಾಸ್ವಾಕ್ ಇಲ್ಲದಿದ್ದರೂ ಪಾದಚಾರಿಗಳ ಸಮೀಪತೆ ಮುಖ್ಯವಾಗುತ್ತದೆ.
ಮಾನವನನ್ನು ಈಗಾಗಲೇ ಆಪ್ಟಿಮೈಸೇಶನ್ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸಿದ ತಜ್ಞ ಎಂದು ಪರಿಗಣಿಸುವ ಮೂಲಕ, ಆ ತಜ್ಞನು ಕನಿಷ್ಠಗೊಳಿಸುತ್ತಿರುವ ಕಾಸ್ಟ್ ಫಂಕ್ಷನ್ ಅನ್ನು ಅಲ್ಗಾರಿದಮ್ ಮರುಪಡೆಯುತ್ತದೆ. ಒಮ್ಮೆ ವ್ಯವಸ್ಥೆಯು ಕಠಿಣ ಬ್ರೇಕಿಂಗ್ಗಿಂತ ಮೃದುವಾದ ಬ್ರೇಕಿಂಗ್ ಅಥವಾ ಮೂಲೆಗಳನ್ನು ಕತ್ತರಿಸುವ ಬದಲು ಲೇನ್ ಸೆಂಟರಿಂಗ್ ಅನ್ನು ಆದ್ಯತೆ ನೀಡುವುದು ಅಂತಹ ಮೂಲಭೂತ ಆದ್ಯತೆಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಂಡರೆ, ಅದು ಸಾಮಾನ್ಯೀಕರಣವನ್ನು (generalize) ಮಾಡಬಲ್ಲದು. ಅದು ಬೇರೆ ನಗರದ ಹೊಸ ರಸ್ತೆಯನ್ನು ಎದುರಿಸಿದಾಗ, ಆ ಪರಿಚಿತವಲ್ಲದ ಪರಿಸರದಲ್ಲಿ ಒಬ್ಬ ಉತ್ತಮ ಚಾಲಕ ಯಾವುದನ್ನು ಮೌಲ್ಯೀಕರಿಸುತ್ತಾನೆ ಎಂಬುದನ್ನು ಅಂದಾಜ的に ತಿಳಿಯುತ್ತದೆ.
ಆಯ್ಕೆಗಳನ್ನು ಮಾಡುವುದು: Deep Q-Networks
ರಿವಾರ್ಡ್ಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ಅರ್ಧದಷ್ಟು ಹೋರಾಟ ಮಾತ್ರ. ಕಾರು ಇನ್ನೂ ಕಾರ್ಯನಿರ್ವಹಿಸಬೇಕಾಗುತ್ತದೆ. ಅತ್ಯುತ್ತಮ ಕ್ರಮವನ್ನು ಆಯ್ಕೆ ಮಾಡಲು ಸಂವೇದನಾ ಡೇಟಾವನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವ ಮೂಲಕ Deep Q-Networks ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವಿಕೆಯನ್ನು ನಿರ್ವಹಿಸುತ್ತವೆ.
ಕ್ಲಾಸಿಕ್ Q-learning ದಶಕಗಳಿಂದ ಅಸ್ತಿತ್ವದಲ್ಲಿದೆ. ಏಜೆಂಟ್ ಒಂದು ನಿರ್ದಿಷ್ಟ ಸ್ಥಿತಿಯಲ್ಲಿ ನಿರ್ದಿಷ್ಟ ಕ್ರಮವನ್ನು ತೆಗೆದುಕೊಳ್ಳುವ ಮೌಲ್ಯವನ್ನು ಕಲಿಯುತ್ತದೆ. ಆದರೆ ನೈಜ ಚಾಲನೆಯ ಸ್ಥಿತಿಗಳು ಪ್ರಾಯೋಗಿಕವಾಗಿ ಅನಂತವಾಗಿವೆ. ಕ್ಯಾಮೆರಾ ಫೀಡ್ ಎಂಬುದು ಸರಳವಾದ ಗ್ರಿಡ್ ವರ್ಲ್ಡ್ ಅಲ್ಲ. ಇದು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ ಅರವತ್ತು ಫ್ರೇಮ್ಗಳಲ್ಲಿ ಬದಲಾಗುವ ಲಕ್ಷಾಂತರ ಪಿಕ್ಸೆಲ್ಗಳು, ಜೊತೆಗೆ lidar point clouds, ವೇಗದ ರೀಡಿಂಗ್ಗಳು ಮತ್ತು GPS ವೆಕ್ಟರ್ಗಳ ಸಂಯೋಜನೆಯಾಗಿದೆ.
Deep Q-Networks ನ್ಯೂರಲ್ ನೆಟ್ವರ್ಕ್ ಅನ್ನು ಫಂಕ್ಷನ್ ಅಪ್ರೋಕ್ಸಿಮೇಟರ್ (function approximator) ಆಗಿ ಬಳಸುವ ಮೂಲಕ ಇದನ್ನು ಪರಿಹರಿಸುತ್ತದೆ. ನೆಟ್ವರ್ಕ್ ಕಚ್ಚಾ ಸಂವೇದನಾ ಡೇಟಾವನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ ಮತ್ತು ಪ್ರತಿಯೊಂದು ಸಂಭವನೀಯ ಕ್ರಮಕ್ಕಾಗಿ ಅಂದಾಜು ಮಾಡಿದ ಮೌಲ್ಯವನ್ನು ನೀಡುತ್ತದೆ: ಎಡಕ್ಕೆ ಸ್ಟೀರಿಂಗ್ ಮಾಡು, ಮೃದುವಾಗಿ ಬ್ರೇಕ್ ಮಾಡು, ವೇಗವನ್ನು ಹೆಚ್ಚಿಸು, ಹಾದಿಯನ್ನು ಕಾಯ್ದುಕೊಳ್ಳು. ಪ್ರತಿಯೊಂದು ಸನ್ನಿವೇಶಕ್ಕಾಗಿ ಲುಕ್ಅಪ್ ಟೇಬಲ್ ಅನ್ನು ಸಂಗ್ರಹಿಸುವ ಬದಲು, ನೆಟ್ವರ್ಕ್ ಸಾಮಾನ್ಯೀಕರಣ ಮಾಡುತ್ತದೆ. ಮಳೆಯ ರಾತ್ರಿಯಲ್ಲಿ ಕಪ್ಪು ಚುಕ್ಕೆ ಕಾಣಿಸಿಕೊಂಡರೆ ಅದು ಬಹುಶಃ ನಿಂತಿರುವ ಕಾರು ಎಂದು ಅದು ಗುರುತಿಸುತ್ತದೆ (ಹಗಲಿನ ತರಬೇತಿಯಲ್ಲಿ ಕಲಿತಂತೆ), ಮತ್ತು "ವೇಗವನ್ನು ಹೆಚ್ಚಿಸು" ಎಂಬ ಕ್ರಮಕ್ಕೆ ಕಡಿಮೆ ಮೌಲ್ಯವನ್ನು ನೀಡುತ್ತದೆ.
ತರಬೇತಿಯಲ್ಲಿ ಎಕ್ಸ್ಪೀರಿಯನ್ಸ್ ರಿಪ್ಲೇ (experience replay) ಒಳಗೊಂಡಿದೆ. ವ್ಯವಸ್ಥೆಯು ಹಿಂದಿನ ಚಾಲನೆಗಳು, ಯಶಸ್ವಿ ಲೇನ್ ಬದಲಾವಣೆಗಳು, ಅಪಾಯಕಾರಿ ಸಂದರ್ಭಗಳು ಮತ್ತು ಮೃದುವಾದ ವೇಗ ಇಳಿಕೆಗಳ ಕ್ಷಣಗಳನ್ನು ಸಂಗ್ರಹಿಸುತ್ತದೆ, ನಂತರ ತನ್ನ ನೆಟ್ವರ್ಕ್ ಅನ್ನು ಅಪ್ಡೇಟ್ ಮಾಡಲು ಅವುಗಳನ್ನು ಯಾದೃಚ್ಛಿಕವಾಗಿ (randomly) ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ. ಇದು ಹಾನಿಕಾರಕ ಸಂಬಂಧಗಳನ್ನು ಮುರಿಯುತ್ತದೆ ಮತ್ತು ಕಲಿಕೆಯನ್ನು ಸ್ಥಿರಗೊಳಿಸುತ್ತದೆ. ಸಾವಿರಾರು ಸಿಮ್ಯುಲೇಟೆಡ್ ಗಂಟೆಗಳ ಮೇಲೆ, ಯಾವ ಕ್ರಮಗಳು ಸುರಕ್ಷಿತ ಪ್ರಗತಿಗೆ ಕಾರಣವಾಗುತ್ತವೆ ಮತ್ತು ಯಾವುವು ತೊಂದರೆಗೆ ಕಾರಣವಾಗುತ್ತವೆ ಎಂಬುದನ್ನು ನೆಟ್ವರ್ಕ್ ಕಲಿಯುತ್ತದೆ.
ಎಲ್ಲವನ್ನೂ ಒಟ್ಟಿಗೆ ಸೇರಿಸುವುದು
ಯಾವುದೇ ಒಂದು ವಿಧಾನವು ಒಬ್ಬ ಸಮರ್ಥ ಚಾಲಕನನ್ನು ರೂಪಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ. ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವ ಇಂಜಿನ್ ಇಲ್ಲದ Inverse Reinforcement Learning ಕೇವಲ ಒಬ್ಬ ವೀಕ್ಷಕನಷ್ಟೇ. ಮನುಷ್ಯರು ಮೃದುವಾದ ಚಾಲನೆಯನ್ನು (smoothness) ಗೌರವಿಸುತ್ತಾರೆ ಎಂಬುದು ಅದಕ್ಕೆ ತಿಳಿದಿದೆ, ಆದರೆ ಅದು ಸ್ಟೀರಿಂಗ್ ವೀಲ್ ಅನ್ನು ಮುಟ್ಟಲು ಸಾಧ್ಯವಿಲ್ಲ. ಸರಿಯಾಗಿ ರೂಪಿಸಲಾದ ರಿವಾರ್ಡ್ ಫಂಕ್ಷನ್ ಇಲ್ಲದ Deep Q-Network ತಪ್ಪು ವಿಷಯಗಳಿಗಾಗಿ ಉತ್ತಮಗೊಳ್ಳಲು (optimize) ಪ್ರಯತ್ನಿಸುತ್ತದೆ. ಇದು ವೃತ್ತಾಕಾರದಲ್ಲಿ ಚಾಲನೆ ಮಾಡುವುದರಿಂದ ಡಿಕ್ಕಿಗಳನ್ನು ಪರಿಪೂರ್ಣವಾಗಿ ತಪ್ಪಿಸಬಹುದು ಎಂದು ಕಂಡುಕೊಳ್ಳಬಹುದು, ಇದರಿಂದ ಎಲ್ಲಿಗೂ ತಲುಪದೆ ಹೆಚ್ಚಿನ ಸ್ಕೋರ್ ಪಡೆಯಬಹುದು.
ಇವೆರಡನ್ನೂ ಸಂಯೋಜಿಸಿದಾಗ, ಅವು ಒಂದು ಶಕ್ತಿಯುತವಾದ ಲೂಪ್ ಅನ್ನು ಸೃಷ್ಟಿಸುತ್ತವೆ. Inverse Reinforcement Learning ಮಾನವ ತಜ್ಞರನ್ನು ಗಮನಿಸುತ್ತದೆ ಮತ್ತು ನೈಜ ಪ್ರಪಂಚದ ಆದ್ಯತೆಗಳನ್ನು ಸೆರೆಹಿಡಿಯುವ ರಿವಾರ್ಡ್ ಫಂಕ್ಷನ್ ಅನ್ನು ಹೊರತೆಗೆಯುತ್ತದೆ. ನಂತರ Deep Q-Network ಆ ರಿವಾರ್ಡ್ ಫಂಕ್ಷನ್ ಅನ್ನು ಬಳಸಿಕೊಂಡು, ಲೈವ್ ಸೆನ್ಸರ್ ಡೇಟಾವನ್ನು ಸಂಸ್ಕರಿಸಿ, ಪ್ರಯೋಗ ಮತ್ತು ತಪ್ಪುಗಳ (trial and error) ಮೂಲಕ ತನಗೆ ತಾನೇ ತರಬೇತಿ ಪಡೆಯುತ್ತದೆ ಮತ್ತು ಕ್ರಮಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡುತ್ತದೆ. AI ಸಂಕೀರ್ಣ ನಡವಳಿಕೆಗಳನ್ನು ವೀಕ್ಷಣೆಯ ಮೂಲಕ ಮಾತ್ರವಲ್ಲದೆ, ಅಭ್ಯಾಸದ ಮೂಲಕವೂ ಕಲಿಯುತ್ತದೆ.
ಹೆದ್ದಾರಿಗೆ ವಾಹನವನ್ನು ಸೇರಿಸುವ (highway merge) ಸಂದರ್ಭವನ್ನು ಪರಿಗಣಿಸಿ. Inverse Reinforcement Learning ಘಟಕವು, ಮಾನವ ಚಾಲಕರು ವೇಗವನ್ನು ಹೊಂದಿಸುವುದು ಮತ್ತು ಅಂತರವನ್ನು (gap) ಸ್ವೀಕರಿಸುವ ನಡುವೆ ಸಮತೋಲನವನ್ನು ಕಾಯ್ದುಕೊಳ್ಳುತ್ತಾರೆ ಎಂದು ಅರಿತುಕೊಳ್ಳುತ್ತದೆ. Deep Q-Network ಈ ಸೂಕ್ಷ್ಮವಾದ ಕಾಸ್ಟ್ ಸಿಗ್ನಲ್ ಅನ್ನು ಪಡೆದು, ಸಿಮ್ಯುಲೇಶನ್ನಲ್ಲಿ ಹತ್ತು ಸಾವಿರ ಬಾರಿ ಮರ್ಜಿಂಗ್ ಮಾಡುವುದನ್ನು ಅಭ್ಯಾಸ ಮಾಡುತ್ತದೆ. ಯಾವಾಗ ವೇಗವನ್ನು ಹೆಚ್ಚಿಸಬೇಕು, ಯಾವಾಗ ಹಿಂದೆ ಇರಬೇಕು ಮತ್ತು ಯಾವಾಗ ಅಂತರವು ತುಂಬಾ ಕಡಿಮೆ ಇರುತ್ತದೆ ಎಂಬುದನ್ನು ಇದು ಕಲಿಯುತ್ತದೆ. ಇದರ ಫಲಿತಾಂಶವು ಕೇವಲ ರೆಕಾರ್ಡ್ ಮಾಡಲಾದ ಮಾನವ ಚಲನೆಗಳನ್ನು ಪುನರಾವರ್ತಿಸುವ ಗಿಳಿಗಿಂತ ಭಿನ್ನವಾಗಿದೆ. ಇದು ತರ್ಕವನ್ನು ಅಳವಡಿಸಿಕೊಂಡಿರುವ ಒಂದು ವ್ಯವಸ್ಥೆಯಾಗಿದ್ದು, ಹೆದ್ದಾರಿ ಒದ್ದೆಯಾಗಿದ್ದಾಗ ಅಥವಾ ಅಂತರವು ಎಂದಿಗಿಂತಲೂ ಕಡಿಮೆಯಿದ್ದಾಗ ಹೊಂದಿಕೊಳ್ಳಬಲ್ಲದು.
