SEED ಪೇಪರ್ನ ಲೇಖಕರು reinforcement-learning (RL) ಏಜೆಂಟ್ಗಳು ತಮ್ಮದೇ ಆದ ವೈಫಲ್ಯದ ಲಾಗ್ಗಳನ್ನು (failure logs) ಹೊಸ ತರಬೇತಿ ಡೇಟಾವಾಗಿ ಪರಿವರ್ತಿಸಲು ಅನುವು ಮಾಡಿಕೊಡುವ ಒಂದು ವಿಧಾನವನ್ನು ಅನಾವರಣಗೊಳಿಸಿದ್ದಾರೆ. ಇದು ALFWorld ಬೆಂಚ್ಮಾರ್ಕ್ನಲ್ಲಿ ಸರಾಸರಿ ಸ್ಕೋರ್ ಅನ್ನು 91.8ಕ್ಕೆ ಏರಿಸುತ್ತದೆ ಮತ್ತು ತರಬೇತಿ ಡೇಟಾದ ಪ್ರಮಾಣವನ್ನು ಸುಮಾರು 40% ಕಡಿಮೆ ಮಾಡುತ್ತದೆ. ಇದೇ ತಂತ್ರವು ಏಜೆಂಟ್ಗಳು ಎಂದೂ ನೋಡಿರದ ಕಾರ್ಯಗಳಲ್ಲಿ 15.3 ಪಾಯಿಂಟ್ಗಳ ಜಿಗಿತವನ್ನು ನೀಡುತ್ತದೆ, ಇದು ಹೆಚ್ಚುವರಿ ಮಾನವ ಮೇಲ್ವಿಚಾರಣೆ ಇಲ್ಲದೆ ಮಾಡೆಲ್ ತನ್ನ ತಪ್ಪುಗಳಿಂದ ಕಲಿಯಬಲ್ಲದು ಎಂಬುದನ್ನು ಸಾಬೀತುಪಡಿಸುತ್ತದೆ.
RL ಏಜೆಂಟ್ಗಳಿಗೆ ಕೇವಲ pass/fail ಫ್ಲಾಗ್ ಮಾತ್ರ ಏಕೆ ಸಾಕಾಗುವುದಿಲ್ಲ?
ಸಾಂಪ್ರದಾಯಿಕ RL ಸೆಟಪ್ಗಳು ಏಜೆಂಟ್ಗೆ ದೀರ್ಘವಾದ ಎಪಿಸೋಡ್ನ ಕೊನೆಯಲ್ಲಿ ಮಾತ್ರ ಬಹುಮಾನವನ್ನು ನೀಡುತ್ತವೆ. ಈ ಸಿಗ್ನಲ್ ವ್ಯವಸ್ಥೆಗೆ ಫಲಿತಾಂಶ ತಪ್ಪಾಗಿದೆ ಎಂದು ತಿಳಿಸುತ್ತದೆ, ಆದರೆ ದೋಷ ಎಲ್ಲಿ ಸಂಭವಿಸಿತು ಎಂಬುದರ ಬಗ್ಗೆ ಏನನ್ನೂ ಹೇಳುವುದಿಲ್ಲ. ಒಂದು ವೇಳೆ ಹತ್ತು ಹಂತಗಳ ಹಿಂದೆಯೇ ತಪ್ಪು ಸಂಭವಿಸಿದ್ದರೆ—ಬಹುಶಃ ತಪ್ಪಾದ ಸರ್ಚ್ ಟರ್ಮ್ ನೀಡಿದ್ದರೆ ಅಥವಾ ತಪ್ಪು ಫೈಲ್ ತೆರೆದಿದ್ದರೆ—ಅಂತಿಮ ಬೈನರಿ ಸಿಗ್ನಲ್ ಎಲ್ಲಾ ಮಧ್ಯಂತರ ಮಾಹಿತಿಯನ್ನು ಕೈಬಿಡುತ್ತದೆ. ಈ ನಷ್ಟವು ಸಂಶೋಧಕರು ವೈಫಲ್ಯಕ್ಕೆ ಕಾರಣವಾಗುವ ಅಪರೂಪದ ಮಾದರಿಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಕೇವಲ ಅತಿ ಹೆಚ್ಚಿನ ಸಂಖ್ಯೆಯ ಎಪಿಸೋಡ್ಗಳನ್ನು ಸಂಗ್ರಹಿಸುವಂತೆ ಮಾಡುತ್ತದೆ.
SEED ಫೀಡ್ಬ್ಯಾಕ್ ಲೂಪ್ ಅನ್ನು ಹೇಗೆ ಬದಲಾಯಿಸುತ್ತದೆ
SEED (Self-Evolving On-Policy Distillation) ಪ್ರತಿ ಎಪಿಸೋಡ್ ನಂತರ ಎರಡನೇ ಕಲಿಕೆಯ ಹಂತವನ್ನು ಸೇರಿಸುತ್ತದೆ:
- ಕಾರ್ಯವನ್ನು ಪೂರ್ಣಗೊಳಿಸಿ – ಏಜೆಂಟ್ ಕಾರ್ಯವನ್ನು ಪೂರ್ಣಗೊಳಿಸುತ್ತದೆ ಮತ್ತು ಸಾಮಾನ್ಯ ಯಶಸ್ಸು/ವೈಫಲ್ಯದ ಲೇಬಲ್ ಅನ್ನು ಪಡೆಯುತ್ತದೆ.
- ತನ್ನದೇ ಆದ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ ಅನ್ನು ಓದಿ – ಕ್ರಮಗಳು (actions), ವೀಕ್ಷಣೆಗಳು (observations) ಮತ್ತು ಮಧ್ಯಂತರ ನಿರ್ಧಾರಗಳ ಸರಣಿಯನ್ನು ಮಾಡೆಲ್ಗೆ ಮರಳಿ ನೀಡಲಾಗುತ್ತದೆ.
- ನೈಸರ್ಗಿಕ ಭಾಷೆಯ ಪಾಠಗಳನ್ನು ಬರೆಯಿರಿ – ಮಾಡೆಲ್ ಏನಾಗಬಾರದು ಎಂಬುದನ್ನು ವಿವರಿಸುವ ಸಣ್ಣ ವಾಕ್ಯಗಳನ್ನು ರಚಿಸುತ್ತದೆ, ಉದಾಹರಣೆಗೆ, “search term ‘X’ returned irrelevant results” ಅಥವಾ “opened file ‘Y’ instead of ‘Z’”.
- ಪಾಠಗಳನ್ನು ಪಾಲಿಸಿ ಅಪ್ಡೇಟ್ಗಳಾಗಿ ಡಿಸ್ಟಿಲ್ ಮಾಡಿ – ಆ ವಾಕ್ಯಗಳು ಹೊಸ on-policy distillation ಹಂತಕ್ಕೆ ಗುರಿಯಾಗುತ್ತವೆ, ಇದು ತಿದ್ದುಪಡಿ ಹಿಂದಿನ ತರ್ಕವನ್ನು ಮಾಡೆಲ್ಗೆ ಕಲಿಸುತ್ತದೆ.
ರಚಿಸಲಾದ ಪಾಠಗಳು ಇನ್ಫರೆನ್ಸ್ ಸಮಯದಲ್ಲಿ ಬಳಸುವ ಪ್ರಾಂಪ್ಟ್ಗಳಲ್ಲ; ಅವು ಪಾಲಿಸಿಯನ್ನು ಮರುರೂಪಿಸುವ ಆಂತರಿಕ ತರಬೇತಿ ಸಿಗ್ನಲ್ಗಳಾಗಿವೆ. ಪ್ರಭಾವಶಾಲಿ ಪರಿಣಾಮವಾಗಿ, ಏಜೆಂಟ್ ತನ್ನದೇ ಆದ ಶಿಕ್ಷಕನಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ, ಕಚ್ಚಾ ವೈಫಲ್ಯದ ಲಾಗ್ಗಳನ್ನು ರಚನಾತ್ಮಕ ಜ್ಞಾನವಾಗಿ ಪರಿವರ್ತಿಸುತ್ತದೆ.
ಮೆಮೊರಿ ಟ್ರಿಕ್ಸ್ ಗಿಂತ ಈ ವಿಧಾನವು ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿಯಾಗಿರುವುದು ಏಕೆ?
ಸಾಮಾನ್ಯ ಪರಿಹಾರವೆಂದರೆ ನಂತರದ ನೆನಪಿನಿಗಾಗಿ ಗಮನಾರ್ಹ ಸ್ಥಿತಿಗಳು ಅಥವಾ ಟಿಪ್ಪಣಿಗಳನ್ನು ಸಂಗ್ರಹಿಸುವ ಬಾಹ್ಯ ಮೆಮೊರಿ ಬಫರ್ ಅನ್ನು ಅಳವಡಿಸುವುದು. ಆ ತಂತ್ರವು ಒಂದು ವಿಸ್ತಾರವಾದ “ಫೈಲಿಂಗ್ ಕ್ಯಾಬಿನೆಟ್” ಅನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ, ಅಲ್ಲಿ ಏಜೆಂಟ್ ಸರಿಯಾದ ಸಮಯದಲ್ಲಿ ಸರಿಯಾದ ಮಾಹಿತಿಯನ್ನು ಹಿಂಪಡೆಯುವುದನ್ನು ಕಲಿಯಬೇಕಾಗುತ್ತದೆ—ಇದು ಹೆಚ್ಚಿನ ಹೊರೆಯನ್ನು ಉಂಟುಮಾಡುವ ಮತ್ತು ಕ್ರಿಯೆ ಹಾಗೂ ಫಲಿತಾಂಶದ ನಡುವಿನ ಕಾರಣಾತ್ಮಕ ಸಂಬಂಧವನ್ನು ತಪ್ಪಿಸುವಂತಹ ಒಂದು ಸಂಕೀರ್ಣ ಸಮಸ್ಯೆಯಾಗಿದೆ.
SEED ಈ ರಿಟ್ರಿೀವಲ್ ಸಮಸ್ಯೆಯನ್ನು ತಪ್ಪಿಸುತ್ತದೆ. ಡಿಸ್ಟಿಲೇಶನ್ ಮೂಲಕ ಪಾಲಿಸಿಯಲ್ಲಿ ನೇರವಾಗಿ ಪಾಠವನ್ನು ಅಳವಡಿಸುವ ಮೂಲಕ, ಏಜೆಂಟ್ ತಿದ್ದುಪಡಿಯನ್ನು ನಂತರ ಹುಡುಕಬೇಕಾದ ಟಿಪ್ಪಣಿಯ ಬದಲಿಗೆ ಒಂದು ಕೌಶಲ್ಯವಾಗಿ ಆಂತರಿಕೀಕರಿಸುತ್ತದೆ. ಇದರ ಪರಿಣಾಮವಾಗಿ ದೋಷ ಪತ್ತೆ ಮತ್ತು ನಡವಳಿಕೆಯ ಬದಲಾವಣೆಯ ನಡುವೆ ಗಟ್ಟಿಯಾದ ಸಂಬಂಧ ಏರ್ಪಡುತ್ತದೆ.
ಮುಖ್ಯವಾದ ಅಂಕಿಅಂಶಗಳು
- ALFWorld ಬೆಂಚ್ಮಾರ್ಕ್ – ಸರಾಸರಿ ಸ್ಕೋರ್ 91.8, ಇದು ಅದೇ ಪರಿಸರವನ್ನು ಬಳಸುವ ಸಾಂಪ್ರದಾಯಿಕ RL ಬೇಸ್ಲೈನ್ಗಳನ್ನು ಮೀರಿಸುತ್ತದೆ.
- ಡೇಟಾ ದಕ್ಷತೆ – ಸುಮಾರು 40% ಕಡಿಮೆ ತರಬೇತಿ ಎಪಿಸೋಡ್ಗಳೊಂದಿಗೆ ಅಷ್ಟೇ ಅಥವಾ ಅದಕ್ಕಿಂತ ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸಾಧಿಸುತ್ತದೆ.
- ಜನರಲೈಸೇಶನ್ (Generalization) – ನೋಡಿರದ ಕಾರ್ಯಗಳಲ್ಲಿ, ಈ ವಿಧಾನವು ಪ್ರಮಾಣಿತ RL ಗಿಂತ 15.3 ಪಾಯಿಂಟ್ಗಳನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ, ಇದು ಸ್ವಯಂ-ಸೃಷ್ಟಿತ ಪಾಠಗಳು ವರ್ಗಾಯಿಸಬಹುದಾದ ತರ್ಕದ ಮಾದರಿಗಳನ್ನು ಹಿಡಿಯುತ್ತವೆ ಎಂಬುದನ್ನು ಸೂಚಿಸುತ್ತದೆ.
ಈ ಅಂಕಿಅಂಶಗಳು ಸಂಕೀರ್ಣ ಏಜೆಂಟ್ಗಳ ತರಬೇತಿಗಾಗಿ ಕಂಪ್ಯೂಟೇಶನಲ್ ಮತ್ತು ಡೇಟಾ ಬಜೆಟ್ ಅನ್ನು SEED ಕಡಿಮೆ ಮಾಡಬಲ್ಲದು ಎಂದು ಸೂಚಿಸುತ್ತವೆ, ಇದು ಬೃಹತ್ ಸಿಮ್ಯುಲೇಶನ್ ಸಂಪನ್ಮೂಲಗಳಿಲ್ಲದ ತಂಡಗಳಿಗೆ ವರದಾನವಾಗಿದೆ.
ಅಪಾಯಗಳು ಮತ್ತು ಮಿತಿಗಳು
ಈ ತಂತ್ರವು ತನ್ನದೇ ಆದ ಅನುಭವವನ್ನು ಸರಿಯಾಗಿ ಅರ್ಥೈಸಿಕೊಳ್ಳುವ ಮಾಡೆಲ್ನ ಸಾಮರ್ಥ್ಯದ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ. ಏಜೆಂಟ್ ಪರಿಸರವನ್ನು ತಪ್ಪಾಗಿ ಅರ್ಥೈಸಿಕೊಂಡರೆ—ಉದಾಹರಣೆಗೆ, ವೈಫಲ್ಯವನ್ನು ತಪ್ಪು ಕಾರಣಕ್ಕೆ ಆರೋಪಿಸಿದರೆ—ಅದು ಆತ್ಮವಿಶ್ವಾಸದಿಂದ ಕೂಡಿದ ತಪ್ಪು ಪಾಠವನ್ನು ನೀಡಬಹುದು. ಅಂತಹ ಭ್ರಮೆಯ ಸಲಹೆಗಳ (hallucinated advice) ಮೇಲೆ ತರಬೇತಿ ಮಾಡುವುದು ಕೆಟ್ಟ ಅಭ್ಯಾಸಗಳನ್ನು ಬಲಪಡಿಸಬಹುದು. ವಿಶ್ಲೇಷಕರು ಕೆಲವೊಮ್ಮೆ ಆಳವಾದ ಸಮಸ್ಯೆಗಳನ್ನು ಮರೆಮಾಚುವ ಅತಿಯಾದ ಸುಂದರವಾದ ವಿವರಣೆಗಳನ್ನು ಸಿದ್ಧಪಡಿಸುವ ಮಾನವನ ಪೋಸ್ಟ್-ಮೋರ್ಟಮ್ಗಳಿಗೆ ಇದು ಸಮಾನವಾಗಿದೆ ಎಂದು ಲೇಖಕರು ಗಮನಿಸಿದ್ದಾರೆ.
ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು?
- ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ RL ಪೈಪ್ಲೈನ್ಗಳೊಂದಿಗೆ ಏಕೀಕರಣ – SEED ಕೇವಲ ಎಪಿಸೋಡ್ ನಂತರದ ಪ್ರೊಸೆಸಿಂಗ್ ಹಂತವನ್ನು ಸೇರಿಸುವುದರಿಂದ, ಇದನ್ನು ಸಣ್ಣ ಎಂಜಿನಿಯರಿಂಗ್ ಪ್ರಯತ್ನದೊಂದಿಗೆ ಅನೇಕ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ತರಬೇತಿ ಲೂಪ್ಗಳಿಗೆ ಬಳಸಬಹುದು.
RL ಏಜೆಂಟ್ಗಳನ್ನು ನಿರ್ಮಿಸುವ ಡೆವಲಪರ್ಗಳು ಎಪಿಸೋಡ್ ಲಾಗ್ಗಳನ್ನು ಕೇವಲ ಆರ್ಕೈವಲ್ ಡೇಟಾಕ್ಕಿಂತ ಹೆಚ್ಚಿನದಾಗಿ ಪರಿಗಣಿಸಲು ಪ್ರಾರಂಭಿಸಬೇಕು. ಪ್ರತಿ ರನ್ ನಂತರ, ಈ ಕೆಳಗಿನವುಗಳನ್ನು ಹೊರಹಾಕಲು ವ್ಯವಸ್ಥೆಯನ್ನು ಕೇಳಿ:
- ಕಾರ್ಯವನ್ನು ಹೆಚ್ಚು ಪ್ರಗತಿಪರಗೊಳಿಸಿದ ನಿರ್ಧಾರ.
- ಹಂತಗಳ ಅತಿ ಹೆಚ್ಚು ವ್ಯರ್ಥಕ್ಕೆ ಕಾರಣವಾದ ಊಹೆ.
- ದೋಷವನ್ನು ಮೊದಲೇ ಪತ್ತೆಹಚ್ಚಬಹುದಾಗಿದ್ದ ಒಂದು ಸರಳ ಪರಿಶೀಲನೆ.
ಆ ಟಿಪ್ಪಣಿಗಳನ್ನು ಅಡ್-ಹಾಕ್ ಪ್ರಾಂಪ್ಟ್ಗಳಾಗಿ ಮರಳಿ ನೀಡುವ ಬದಲು, SEED ಸೂಚಿಸುವಂತೆ ಡಿಸ್ಟಿಲೇಶನ್ ಹಂತಕ್ಕೆ ನೀಡಿ. ಇದರ ಪ್ರತಿಫಲ ಸ್ಪಷ್ಟವಾಗಿದೆ: ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆ, ಕಡಿಮೆ ಡೇಟಾ, ಮತ್ತು ತನ್ನದೇ ಆದ ತಪ್ಪುಗಳನ್ನು ವಿವರಿಸುವುದನ್ನು ಕಲಿಯುವ ಮಾಡೆಲ್.
ಮುಖ್ಯ ಅಂಶ: ವೈಫಲ್ಯದ ದಾಖಲೆಗಳನ್ನು ಸ್ವಯಂ-ಸೃಜಿತ ಪಾಠಗಳನ್ನಾಗಿ ಪರಿವರ್ತಿಸುವುದರಿಂದ, ವಿರಳವಾದ ಪ್ರತಿಫಲದ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಸಮೃದ್ಧವಾದ ಮತ್ತು ಮರುಬಳಕೆ ಮಾಡಬಹುದಾದ ತರಬೇತಿ ಸಂಕೇತವಾಗಿ ಪರಿವರ್ತಿಸಬಹುದು, ಇದು ವೇಗವಾದ ಮತ್ತು ಹೆಚ್ಚು ದತ್ತಾಂಶ-ದಕ್ಷ RL ಗೆ ಪ್ರಾಯೋಗಿಕ ಮಾರ್ಗವನ್ನು ಒದಗಿಸುತ್ತದೆ.
