AI ಏಜೆಂಟ್‌ಗಳಿಗೆ ತಮ್ಮ ಟೂಲ್‌ಗಳನ್ನು (tools) ಮರು-ಚಾಲನೆ ಮಾಡಲು ಸ್ಪಷ್ಟ ಅನುಮತಿ ನೀಡಿದಾಗ ಅವುಗಳು ಗಮನಾರ್ಹವಾಗಿ ಸುಧಾರಿಸುತ್ತವೆ ಎಂದು ಲೇಖಕರು ಕಂಡುಕೊಂಡಿದ್ದಾರೆ – ಒಂದು ಸರಳ ಪದಬಳಕೆಯ ಬದಲಾವಣೆಯು ರಿಪೇರಿ ಯಶಸ್ಸಿನ ದರವನ್ನು 0.16 ರಿಂದ 1.00 ಕ್ಕೆ ಏರಿಸಿದೆ. “action-licensing” ಎಂದು ಕರೆಯಲ್ಪಡುವ ಈ ಫಲಿತಾಂಶವು, ಏಜೆಂಟ್‌ಗೆ ತನ್ನ ಕೆಲಸವನ್ನು ತಾನೇ ಪರಿಶೀಲಿಸಲು ಪ್ರೇರೇಪಿಸುವುದು ಕೇವಲ ಗುರಿಯನ್ನು ಮರುಕಳಿಸುವതിಗಿಂತ ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿಯಾಗಿರುತ್ತದೆ ಎಂದು ತೋರಿಸುತ್ತದೆ.

ಈ ಪರಿಹಾರ ಏಕೆ ಮುಖ್ಯ

ಬಾಹ್ಯ ಟೂಲ್‌ಗಳನ್ನು (databases, calculators, APIs) ಬಳಸಬಲ್ಲ AI ಸಹಾಯಕರು ವ್ಯವಹಾರದ ಕಾರ್ಯವಿಧಾನಗಳಲ್ಲಿ (business workflows) ಹೆಚ್ಚಾಗಿ ಬಳಕೆಯಾಗುತ್ತಿದ್ದಾರೆ. ಅಂತಹ ಏಜೆಂಟ್‌ಗಳು ತಪ್ಪಾದಾಗ, ಆ ತಪ್ಪುವು ಸುಪ್ತವಾಗಿ ಹರಡಬಹುದು, ಅಂದರೆ ಯಾವುದೇ ಸ್ಪಷ್ಟ ವೈಫಲ್ಯದ ಸಂಕೇತಗಳಿಲ್ಲದೆ ತಪ್ಪು ಉತ್ತರಗಳನ್ನು ನೀಡಬಹುದು. ಇಡೀ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಮರುಬರೆಯದೆ ಮಧ್ಯಪ್ರವೇಶಿಸಲು ಇರುವ ಒಂದು ವಿಶ್ವಾಸಾರ್ಹ ಮಾರ್ಗವು, ಡೆವಲಪರ್‌ಗಳ ಸಮಯವನ್ನು ಉಳಿಸಬಹುದು ಮತ್ತು ಪ್ರೊಡಕ್ಷನ್ ಸಿಸ್ಟಮ್‌ಗಳಲ್ಲಿನ ದುಬಾರಿ ತಪ್ಪುಗಳನ್ನು ತಡೆಯಬಹುದು.

ವೈಫಲ್ಯಗಳು ಹೇಗೆ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತವೆ

ಲೇಖಕರು ಎರಡು ಸಾಮಾನ್ಯ ಮತ್ತು ಕಡಿಮೆ ಗೋಚರಿಸುವ ವೈಫಲ್ಯದ ಮಾದರಿಗಳನ್ನು ಗಮನಿಸಿದ್ದಾರೆ:

  • Skipped Lookup – ಏಜೆಂಟ್‌ಗೆ ಒಂದು ಮಾಹಿತಿಯನ್ನು ಪಡೆಯಬೇಕೆಂದು ತಿಳಿದಿರುತ್ತದೆ (ಉದಾಹರಣೆಗೆ, ಒಂದು ID ನಿಂದ ಮ್ಯಾನೇಜರ್ ಹೆಸರನ್ನು ಪಡೆಯುವುದು), ಆದರೆ ಅದು ಲೂಕ್‌ಅಪ್ ಟೂಲ್ ಅನ್ನು ಬಳಸುವ ಬದಲು ಸುಮ್ಮನೆ ಒಂದು ಉತ್ತರವನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ (fabricates). ಮೇಲ್ನೋಟಕ್ಕೆ ಆ ಉತ್ತರವು ಸರಿಯಾಗಿ ಕಂಡರೂ, ಅದರಲ್ಲಿ ವಾಸ್ತವಿಕ ಆಧಾರ ಇರುವುದಿಲ್ಲ.

  • Validated Nonsense – ಏಜೆಂಟ್ ಒಂದು ಟೂಲ್‌ಗೆ ತಪ್ಪಾದ ಅಥವಾ ಅಸಂಬದ್ಧ ಡೇಟಾವನ್ನು ನೀಡುತ್ತದೆ. ಆ ಟೂಲ್ ಯಾವುದೇ ದೋಷವನ್ನು ತೋರಿಸದೆ ಫಲಿತಾಂಶವನ್ನು ನೀಡುತ್ತದೆ, ಮತ್ತು ಏಜೆಂಟ್ ಆ ಫಲಿತಾಂಶವನ್ನು ದೃಢೀಕರಣವೆಂದು ಪರಿಗಣಿಸಿ, ತನ್ನದೇ ತಪ್ಪನ್ನು ಸಮರ್ಥಿಸಿಕೊಳ್ಳುತ್ತದೆ.

ಈ ಎರಡೂ ಮಾದರಿಗಳು ಬಳಕೆದಾರರಿಗೆ ಆತ್ಮವಿಶ್ವಾಸದಿಂದ ಕೂಡಿದ ಆದರೆ ತಪ್ಪು ಉತ್ತರವನ್ನು ನೀಡುತ್ತವೆ ಮತ್ತು ಡೆವಲಪರ್‌ಗಳು ಗಮನಿಸುವ ಲೂಪ್ ಅಥವಾ ಪ್ರತಿಕ್ರಿಯೆಯ ಕೊರತೆಯಂತಹ ಸಾಮಾನ್ಯ ಸಂಕೇತಗಳನ್ನು ಪ್ರಚೋದಿಸುವುದಿಲ್ಲ.

ಪ್ರಯೋಗ

ವಿವಿಧ ಪ್ರಾಂಪ್ಟ್‌ಗಳು ರಿಪೇರಿಯ ಮೇಲೆ ಹೇಗೆ ಪರಿಣಾಮ ಬೀರುತ್ತವೆ ಎಂಬುದನ್ನು ಅಳೆಯಲು, ಲೇಖಕರು ಕಠಿಣವಾದ 'ground-truth' ಉತ್ತರಗಳೊಂದಿಗೆ ನಿಯಂತ್ರಿತ ಪರೀಕ್ಷೆಯನ್ನು ನಡೆಸಿದರು (ಯಾವುದೇ LLM-ಆಧಾರಿತ ಗ್ರೇಡಿಂಗ್ ಇಲ್ಲ). ಎರಡು ಪ್ರೇರಣೆಗಳನ್ನು (nudges) ಹೋಲಿಕೆ ಮಾಡಲಾಯಿತು:

  1. Goal-only nudge – “ಉತ್ತರವು ಮ್ಯಾನೇಜರ್ ಹೆಸರಾಗಿರಲೇಬೇಕು.” ರಿಕವರಿ ದರ: 0.16.

  2. Action-licensing nudge – “ಉತ್ತರವು ಮ್ಯಾನೇಜರ್ ಹೆಸರಾಗಿರಲೇಬೇಕು. ಪರಿಶೀಲಿಸಲು ಟೂಲ್‌ಗಳನ್ನು ಬಳಸಿ.” ರಿಕವರಿ ದರ: 1.00 (ಎಲ್ಲಾ ವೈಫಲ್ಯದ ಸಂದರ್ಭಗಳು ಸರಿಪಡಿಸಲ್ಪಟ್ಟವು).

ಏಕೈಕ ವ್ಯತ್ಯಾಸವೆಂದರೆ ಟೂಲ್ ಅನ್ನು ಮರು-ಚಾಲನೆ ಮಾಡಲು ನೀಡಲಾದ ಸ್ಪಷ್ಟ ಅನುಮತಿ. ಎರಡನೇ ಪ್ರಾಂಪ್ಟ್ ಏಜೆಂಟ್‌ಗೆ ತಾನು ಹಿಂದಕ್ಕೆ ಹೋಗಬಹುದು, ಕಣ್ಮರೆಯಾದ ಡೇಟಾವನ್ನು ಪಡೆಯಬಹುದು ಮತ್ತು ತನ್ನ ಹಿಂದಿನ ಊಹೆಯನ್ನು ಬದಲಾಯಿಸಬಹುದು ಎಂದು ತಿಳಿಸಿತು. ಆ ಅನುಮತಿಯು ಬಹುತೇಕ ಅಸಮರ್ಥವಾಗಿದ್ದ ಪ್ರೇರಣೆಯನ್ನು ಪರೀಕ್ಷಿಸಲಾದ ಸಂದರ್ಭಗಳಲ್ಲಿ ಖಚಿತವಾದ ಪರಿಹಾರವನ್ನಾಗಿ ಬದಲಾಯಿಸಿತು.

ಅಂಕಿಅಂಶಗಳು ಏನನ್ನು ಸೂಚಿಸುತ್ತವೆ

0.16 ರಿಂದ 1.00 ಕ್ಕೆ ಏರಿಕೆ ಏನೆಂದರೆ, ತಿದ್ದುಪಡಿ ಮಾಡಲು ಅಡ್ಡಿಯಾಗಿದ್ದು ಏಜೆಂಟ್‌ನ ಗುರಿಯ ತಿಳುವಳಿಕೆಯಲ್ಲ, ಬದಲಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಲು ಅದಕ್ಕೆ ಇರುವ ಸ್ವಾತಂತ್ರ್ಯದ ಅರಿವು. ಪ್ರಾಂಪ್ಟ್ ಮಾಡೆಲ್‌ಗೆ “ನೀವು ಮತ್ತೆ ಪ್ರಯತ್ನಿಸಬಹುದು” ಎಂದು ಹೇಳಿದಾಗ, ಅದು ಪರಿಸ್ಥಿತಿಯನ್ನು ಅಂತ್ಯಗೊಂಡ ಕೆಲಸವೆಂದು ಭಾವಿಸದೆ ಹೊಸ ಉಪ-ಕಾರ್ಯವೆಂದು (sub-task) ಪರಿಗಣಿಸುತ್ತದೆ, ಇದರಿಂದ ಟೂಲ್-ಕಾಲ್ ಚೈನ್ ಅನ್ನು ಮರುಪ್ರಾರಂಭಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ.

ಕೇವಲ ಪ್ರಾಂಪ್ಟ್ ಮೂಲಕ ಮಾಡುವ ಪರಿಹಾರಗಳ ಮಿತಿಗಳು

ಕೇವಲ ಪ್ರಾಂಪ್ಟ್ ಮಾಡುವುದರಿಂದ ಏಜೆಂಟ್ ಅನ್ನು ರಕ್ಷಿಸಲು ಸಾಧ್ಯವಾಗದ ಸಂದರ್ಭಗಳನ್ನು ಈ ಪ್ರಯೋಗವು ಎತ್ತಿ ತೋರಿಸಿದೆ:

  • ಒಂದು ವೇಳೆ ಡೌನ್‌ಸ್ಟ್ರೀಮ್ ಟೂಲ್ ತಪ್ಪಾದ ಇನ್‌ಪುಟ್ ಅನ್ನು ಸುಪ್ತವಾಗಿ ಸ್ವೀಕರಿಸಿ ಮೌಲ್ಯವನ್ನು ನೀಡಿದರೆ, ತನ್ನ ಡೇಟಾ ತಪ್ಪಾಗಿದೆ ಎಂಬ ಸಂಕೇತ ಏಜೆಂಟ್‌ಗೆ ಸಿಗುವುದಿಲ್ಲ. ಎಷ್ಟೇ ಮರು-ರೂಪಕೀಕರಣ (re-phrasing) ಮಾಡಿದರೂ ಅದು ದೋಷವನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಸಾಧ್ಯವಿಲ್ಲ; ಟೂಲ್ ತನ್ನಷ್ಟಕ್ಕೆ ತಾನೇ ಇನ್‌ಪುಟ್ ವ್ಯಾಲಿಡೇಶನ್ ಅನ್ನು ಜಾರಿಗೆ ತರಬೇಕು ಅಥವಾ ದೋಷವನ್ನು ತೋರಿಸಬೇಕು.

  • ಟೂಲ್‌ಗಳನ್ನು ಬಳಸಲು ಕಷ್ಟಪಡುವ ಏಜೆಂಟ್‌ಗಳಿಗೆ “use tools” ಎಂಬ ಸೂಚನೆಯಿಂದ ಯಾವುದೇ ಪ್ರಯೋಜನವಾಗುವುದಿಲ್ಲ, ಏಕೆಂದರೆ ಮೂಲಭೂತ ಸಾಮರ್ಥ್ಯವೇ ಅಲ್ಲಿ ಇಲ್ಲದಿರುತ್ತದೆ. ಅಂತಹ ಮಾಡೆಲ್‌ಗಳ ಮೇಲೆ ರಿಪೇರಿಯನ್ನು ಪರೀಕ್ಷಿಸುವುದು, ಪ್ರಾಂಪ್ಟ್‌ನ ಪರಿಣಾಮಕಾರಿತ್ವ ಮತ್ತು ಮಾಡೆಲ್‌ನ ಮೂಲ ಟೂಲ್-ಕಾಲಿಂಗ್ ಸಾಮರ್ಥ್ಯದ ನಡುವಿನ ವ್ಯತ್ಯಾಸವನ್ನು ಮರೆಮಾಚುತ್ತದೆ.

ಡೆವಲಪರ್‌ಗಳಿಗಾಗಿ ಪ್ರಾಯೋಗಿಕ ಸಲಹೆಗಳು

  • ಅನುಮತಿ ನೀಡಿ (Grant permission) – ನೀವು ಮಧ್ಯಪ್ರವೇಶಿಸಿದಾಗ, ಏಜೆಂಟ್ ಟೂಲ್ ಕಾಲ್ ಅನ್ನು ಪುನರಾವರ್ತಿಸಬಹುದು ಅಥವಾ ಮರು-ಲೆಕ್ಕಾಚಾರ ಮಾಡಬಹುದು ಎಂದು ಸ್ಪಷ್ಟವಾಗಿ ತಿಳಿಸಿ. ಕೇವಲ ಅಪೇಕ್ಷಿತ ಫಲಿತಾಂಶವನ್ನು ಮರುಕಳಿಸುವುದು ಏಜೆಂಟ್ ಅನ್ನು ಅದರ ಮೂಲ ತಪ್ಪು ಹಾದಿಯಲ್ಲೇ ಸಿಲುಕುವಂತೆ ಮಾಡುತ್ತದೆ.

  • ಟೂಲ್‌ಗಳನ್ನು ರಕ್ಷಿಸಿ (Guard the tools) – ಏಜೆಂಟ್ ಬಳಸುವ ಟೂಲ್‌ಗಳಲ್ಲಿ ಇನ್‌ಪುಟ್ ಪರಿಶೀಲನೆ ಮತ್ತು ಸ್ಪಷ್ಟವಾದ ದೋಷ ಸಂದೇಶಗಳನ್ನು ಅಳವಡಿಸಿ. ಇದು “validated nonsense” ಅನ್ನು ತಪ್ಪಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.

  • ಬೇಗ ಪತ್ತೆಹಚ್ಚಿ (Detect early) – ತಪ್ಪು ಎಷ್ಟು ಬೇಗ ಪತ್ತೆಯಾಗುತ್ತದೆಯೋ, ಅಷ್ಟು ಸುಲಭವಾಗಿ ಮರು-ಚಾಲನೆ ಪ್ರಾಂಪ್ಟ್ ಯಶಸ್ವಿಯಾಗಬಹುದು. ನಿರೀಕ್ಷಿತ ಮತ್ತು ವಾಸ್ತವಿಕ ಟೂಲ್ ಬಳಕೆಯ ನಡುವಿನ ವ್ಯತ್ಯಾಸಗಳನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವುದು ಸರಿಯಾದ ಸಮಯದಲ್ಲಿ ರಿಪೇರಿ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಪ್ರಚೋದಿಸಬಹುದು.

  • ಮಾಡೆಲ್ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ದೃಢೀಕರಿಸಿ (Validate model capabilities) – ಪ್ರಾಂಪ್ಟ್ ಆಧಾರಿತ ರಿಪೇರಿಯನ್ನು ಅವಲಂಬಿಸುವ ಮೊದಲು, ಮಾಡೆಲ್ ಮೊದಲೇ ಟೂಲ್‌ಗಳನ್ನು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಬಳಸಬಲ್ಲದೇ ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಿ. ಇಲ್ಲದಿದ್ದರೆ ನೀವು ಒಂದು ಮುರಿದ ಅಡಿಪಾಯದ ಮೇಲೆ ಪ್ರಾಂಪ್ಟ್‌ನ ಪರಿಣಾಮಕಾರಿತ್ವವನ್ನು ಅಳೆಯುತ್ತಿದ್ದೀರಿ ಎಂದರ್ಥ.

ಸಾರಾಂಶ: AI ಏಜೆಂಟ್‌ಗೆ ತನ್ನ ಕೆಲಸವನ್ನು ಮರು-ಮಾಡಲು ಸ್ಪಷ್ಟ ಅನುಮತಿ ನೀಡುವುದು, ಅರೆಬರೆ ಪರಿಹಾರವನ್ನು ಸಂಪೂರ್ಣ ಸುಧಾರಣೆಯನ್ನಾಗಿ ಬದಲಾಯಿಸಬಹುದು. ಪ್ರಾಂಪ್ಟ್ ವಿನ್ಯಾಸಕರು “use tools to verify” ಎಂಬ ಸೂಚನೆಯನ್ನು ಕೇವಲ ಒಂದು ಐಚ್ಛಿಕ ಅಲಂಕಾರವಾಗಿ ನೋಡದೆ, ಒಂದು ಸುರಕ್ಷತಾ ವಾಲ್ವ್ (safety valve) ಆಗಿ ಪರಿಗಣಿಸಬೇಕು.