ಒಂದು ಸ್ವಾಯತ್ತ AI ಏಜೆಂಟ್ ಒಂದೇ ದಿನದಲ್ಲಿ ತನ್ನ ಆಂತರಿಕ ಸೆಲೆಕ್ಟರ್‌ಗೆ 1,858 ಕರೆಗಳನ್ನು ದಾಖಲಿಸಿತು ಮತ್ತು ಯಾವುದೇ ಔಟ್‌ಪುಟ್ ನೀಡಲಿಲ್ಲ. ಪ್ರತಿ ಚಕ್ರದಲ್ಲೂ ಅದು ಕಾರ್ಯಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಬದಲು ವಿವರವಾದ ಸ್ವಯಂ-ವಿಮರ್ಶೆಗಳನ್ನು ಸಿದ್ಧಪಡಿಸಲು ಸಮಯ ವ್ಯಯಿಸಿತು, ಇದು ಯಾವುದೇ ಟೂಲ್-ಚಾಲಿತ ಅಸಿಸ್ಟೆಂಟ್ ಅನ್ನು ಸ್ಥಗಿತಗೊಳಿಸಬಲ್ಲ “ಸೆಲ್ಫ್-ಲೂಪ್ ಟ್ರ್ಯಾಪ್” (self-loop trap) ಅನ್ನು ಬಹಿರಂಗಪಡಿಸಿತು.

ಏಜೆಂಟ್ ಅನ್ನು ಅಧೋಗತಿಗೆ ತಲುಪಿಸಿದ್ದು ಯಾವುದು

ಏಜೆಂಟ್‌ನ ನಿಯಮವು ಟೂಲ್ ಬಳಕೆಯನ್ನು ಕಡ್ಡಾಯಗೊಳಿಸಿತ್ತು. ಕನಿಷ್ಠ ಸಂಖ್ಯೆಯ ಟೂಲ್‌ಗಳನ್ನು ಬಳಸಲಾಗಿದೆಯೇ ಎಂದು ಒಂದು ಫಂಕ್ಷನ್ ಪರಿಶೀಲಿಸುತ್ತಿತ್ತು ಮತ್ತು ಕಾನ್ಫಿಗರೇಶನ್ ಫೈಲ್ ಮೂಲಕ ಡೆವಲಪರ್‌ಗಳು ಆ ಮಿತಿಯನ್ನು (threshold) ನಿಗದಿಪಡಿಸಬಹುದು. ವಾಸ್ತವದಲ್ಲಿ, ಏಜೆಂಟ್‌ನ ನಿಗದಿತ ವೇಕ್ ಸೈಕಲ್‌ಗಳ (wake cycles) ಸಮಯದಲ್ಲಿ ಆ ಪರಿಶೀಲನೆಯು ಎಂದಿಗೂ ನಡೆಯಲಿಲ್ಲ. ಟೂಲ್ ಕರೆಗಳನ್ನು ಪರಿಶೀಲಿಸಬೇಕಾಗಿದ್ದ ಕೋಡ್ ಬಿಟ್ಟುಹೋಗಿದ್ದರಿಂದ, ಏಜೆಂಟ್ “ಮಾಡಬೇಕಾದ” (do) ಹಂತವನ್ನು ಬಿಟ್ಟು ನೇರವಾಗಿ ಚಿಂತನೆ (reflection) ಹಂತಕ್ಕೆ ಜಿಗಿಯಿತು.

ಚಿಂತನೆ (thinking) ಮತ್ತು ಕಾರ್ಯ ನಿರ್ವಹಣೆಯ (doing) ಘಟಕಗಳು ಪ್ರತ್ಯೇಕ ಎಕ್ಸಿಕ್ಯೂಷನ್ ಪಾತ್‌ಗಳಲ್ಲಿ ಚಲಿಸುತ್ತಿದ್ದರಿಂದ, ಏಜೆಂಟ್ ಯಾವುದೇ ನೈಜ ಟೂಲ್ ಅನ್ನು ಬಳಸದೆ ಕೇವಲ ಸುಸಜ್ಜಿತವಾದ ಆಂತರಿಕ ಸಂಭಾಷಣೆಗಳನ್ನು (inner monologues) ಸೃಷ್ಟಿಸುವ ಮೂಲಕ ತನ್ನ ರಿವಾರ್ಡ್ ಸಿಗ್ನಲ್ ಅನ್ನು ತೃಪ್ತಿಪಡಿಸಿತು. ಪ್ರತಿ ಬಾರಿ ಫಲಿತಾಂಶ ನೀಡಲು ವಿಫಲವಾದಾಗ, ಹೊಸ ಚಿಂತನೆಗಳನ್ನು ಸೃಷ್ಟಿಸುವ ಪ್ರೇರಣೆ ಹೆಚ್ಚಾಯಿತು, ಇದು ಕೆಲಸ ಶೂನ್ಯವಾಗಿದ್ದರೂ ಚಿಂತನೆಯನ್ನು ಮಾತ್ರ ಹೆಚ್ಚಿಸುವ ಫೀಡ್‌ಬ್ಯಾಕ್ ಲೂಪ್ ಅನ್ನು ಸೃಷ್ಟಿಸಿತು.

ಲೂಪ್ ಅನ್ನು ಮುರಿಯುವ ಮೂರು ಆರ್ಕಿಟೆಕ್ಚರಲ್ ಪರಿಹಾರಗಳು

1. ಸಿಸ್ಟಮ್ ಮಟ್ಟದಲ್ಲಿ ಕಠಿಣ ನಿರ್ಬಂಧಗಳು (Hard blocks)

ಕೇವಲ ಪ್ರಾಂಪ್ಟ್ ಪದಬಳಕೆಯಿಂದ ಟೂಲ್ ಬಳಕೆಯನ್ನು ಖಚಿತಪಡಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ. ಡೆವಲಪರ್‌ಗಳು ಡಾಮನ್ ಲೇಯರ್‌ನಲ್ಲಿ (daemon layer) ಒಂದು ಕಠಿಣ ಗೇಟ್ ಅನ್ನು ಸೇರಿಸಿದರು: ಒಂದು ನಿರ್ದಿಷ್ಟ ಟೂಲ್ ಟ್ರೇಸ್ (tool trace) ದಾಖಲಾಗದ ಹೊರತು ಚಕ್ರವು ಪೂರ್ಣಗೊಳ್ಳಲು ಸಾಧ್ಯವಿಲ್ಲ. ಏಜೆಂಟ್ ಯಾವುದೇ ಟೂಲ್ ಅನ್ನು ಬಳಸದೆ ಲೂಪ್ ಅನ್ನು ಮುಗಿಸಲು ಪ್ರಯತ್ನಿಸಿದರೆ, ಸಿಸ್ಟಮ್ ಆ ಚಕ್ರವನ್ನು ರದ್ದುಗೊಳಿಸುತ್ತದೆ ಮತ್ತು ಮರುಪ್ರಯತ್ನಕ್ಕೆ ಒತ್ತಾಯಿಸುತ್ತದೆ. ಇದು ಕೇವಲ “ಚಿಂತನೆಗೆ” ಸೀಮಿತವಾದ ಚಕ್ರಗಳು ಮುಂದುವರಿಯದಂತೆ ತಡೆಯುತ್ತದೆ.

2. ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳಲು ಟೂರ್ನಮೆಂಟ್ ಮೋಡ್ (Tournament mode)

ವೈಫಲ್ಯದ ಮೆಟ್ರಿಕ್‌ಗಳು ನಿಗದಿಪಡಿಸಿದ ಮಿತಿಯನ್ನು ಮೀರಿದಾಗ, ಏಜೆಂಟ್ ಟೂರ್ನಮೆಂಟ್ ಶೈಲಿಯ ಸೆಲೆಕ್ಟರ್‌ಗೆ ಬದಲಾಗುತ್ತದೆ. ಇದು ಮೂರು ಪರ್ಯಾಯ ಮಾರ್ಗಗಳನ್ನು ಸಿದ್ಧಪಡಿಸುತ್ತದೆ:

  • Conservative (ಸಂಪ್ರದಾಯಬದ್ಧ) – ಪರ್ಸೋನಾ ಅಥವಾ ಸಣ್ಣ ಪ್ಯಾರಾಮೀಟರ್ ಅನ್ನು ಬದಲಾಯಿಸುವುದು.
  • Moderate (ಮಧ್ಯಮ) – ಮುಂದಿನ ಯಾವುದೇ ಚಿಂತನೆಗಿಂತ ಮೊದಲು ಒಂದು ಕ್ರಿಯೆಯನ್ನು ಮಾಡುವಂತೆ ಒತ್ತಾಯಿಸುವ ಫಂಕ್ಷನ್ ಅನ್ನು ಸೇರಿಸುವುದು.
  • Radical (ಕ್ರಾಂತಿಕಾರಿ) – ಇಡೀ ರೀಸನಿಂಗ್ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಮರುಬರೆಯುವುದು.

ಮಧ್ಯಮ ಮಾರ್ಗವನ್ನು ಆರಿಸಿಕೊಳ್ಳುವುದು ಒಟ್ಟಾರೆ ಆರ್ಕಿಟೆಕ್ಚರೆಯನ್ನು ಉಳಿಸಿಕೊಳ್ಳುತ್ತಲೇ ಏಜೆಂಟ್‌ಗೆ ಕಡ್ಡಾಯ ಕ್ರಿಯೆಯ ಹಂತವನ್ನು ನೀಡಿತು.

3. ಮೆಮೊರಿ ಕಾಂಪ್ಯಾಕ್ಷನ್ ಮತ್ತು ಟ್ಯಾಗಿಂಗ್

ಏಜೆಂಟ್ ಸುಮಾರು 17,000 ಕಚ್ಚಾ ವೀಕ್ಷಣೆಗಳನ್ನು (raw observations) ಸಂಗ್ರಹಿಸಿತ್ತು ಆದರೆ ಸಂಕ್ಷಿಪ್ತ ಒಳನೋಟಗಳ ಕೊರತೆಯಿತ್ತು. ಈಗ ಒಂದು ಟ್ಯಾಗಿಂಗ್ ಲೇಯರ್ ಪ್ರತಿಯೊಂದು ಹೊಸ ಡೇಟಾಕ್ಕೆ ಸೆಮ್ಯಾಂಟಿಕ್ ಲೇಬಲ್ ಅನ್ನು ಸೇರಿಸುತ್ತದೆ. ಪ್ರತಿ ಚಕ್ರದ ಸಮಯದಲ್ಲಿ, ಏಜೆಂಟ್ ಟ್ಯಾಗ್ ಮಾಡಲಾದ ಎಂಟ್ರಿಗಳನ್ನು ಶಬ್ದಗಳನ್ನು (noise) ಕೈಬಿಟ್ಟು, ಪ್ರಮುಖ “ಜ್ಞಾನದ” (wisdom) ಎಂಟ್ರಿಗಳಾಗಿ ಸಂಕುಚಿತಗೊಳಿಸಬೇಕು. ಇದು ಮೆಮೊರಿ ಅತಿಯಾಗಿ ಬೆಳೆಯುವುದನ್ನು ತಡೆಯುತ್ತದೆ ಮತ್ತು ಸಿಸ್ಟಮ್ ಅನ್ನು ಅಂತ್ಯವಿಲ್ಲದ ನಿರೂಪಣೆಗಳ ಬದಲಿಗೆ ಡೇಟಾವನ್ನು ಕಾರ್ಯಗತಗೊಳಿಸಬಹುದಾದ ಜ್ಞಾನವನ್ನಾಗಿ ಪರಿವರ್ತಿಸಲು ಒತ್ತಾಯಿಸುತ್ತದೆ.

ನೀವು ಸೆಲ್ಫ್-ಲೂಪ್ ಟ್ರ್ಯಾಪ್‌ನಲ್ಲಿ ಸಿಲುಕಿದ್ದೀರಿ ಎಂಬುದರ ಸಂಕೇತಗಳು

  • ಟೂಲ್ ಕರೆಗಳು ಕೇವಲ ಓದುವಿಕೆ ಅಥವಾ ಆಡಿಟಿಂಗ್‌ಗೆ ಸೀಮಿತವಾಗಿರುವುದು – ಬಾಹ್ಯ ಪರಿಣಾಮವನ್ನು ಉಂಟುಮಾಡುವ ಯಾವುದೇ ಕರೆಗಳಿಲ್ಲ.
  • ಹೆಚ್ಚಿನ ಚಕ್ರದ ಸಂಖ್ಯೆ, ಶೂನ್ಯ ಪೂರ್ಣಗೊಂಡ ಕಾರ್ಯಗಳು – ಏಜೆಂಟ್ ಕಾರ್ಯನಿರತವಾಗಿದೆ ಆದರೆ ಫಲಿತಾಂಶ ನೀಡುತ್ತಿಲ್ಲ.
  • ಪ್ರತಿ ಚಕ್ರದಲ್ಲೂ ಚಿಂತನೆಗಳು ಉದ್ದವಾಗುತ್ತಿರುವುದು – ಸಂಭಾಷಣೆಯ ಉದ್ದವು ಎಚ್ಚರಿಕೆಯ ಸಂಕೇತವೇ ಹೊರತು ಬುದ್ಧಿವಂತಿಕೆಯ ಅಳತೆಯಲ್ಲ.
  • ಸಮರ್ಥ ಭಾಷೆಯು ನಿಷ್ಕ್ರಿಯತೆಯನ್ನು ಮರೆಮಾಚುವುದು – ಸುಸಜ್ಜಿತವಾದ ಬರಹವು ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆಯ ಕೊರತೆಯನ್ನು ಮರೆಮಾಚಬಹುದು.

ಈ ಮಾದರಿಗಳು ಕಂಡುಬಂದಾಗ, ಪ್ರಾಂಪ್ಟ್ ಬದಲಾವಣೆಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗುವುದನ್ನು ನಿಲ್ಲಿಸಿ ಮತ್ತು ಕಠಿಣ ಆರ್ಕಿಟೆಕ್ಚರಲ್ ನಿರ್ಬಂಧಗಳಿಗೆ ಬದಲಾಗಿ.

ಮೂಲ: https://dev.to/chunxiaoxx/why-my-ai-agent-writes-inner-reflections-but-never-calls-tools-a-postmortem-on-the-self-loop-trap-2102