ಸಂಶೋಧಕರು Ring-Zero ಎಂಬ ಹೊಸ ರಿಇನ್‌ಫೋರ್ಸ್‌ಮೆಂಟ್-ಲರ್ನಿಂಗ್ ಫ್ರೇಮ್‌ವರ್ಕ್ ಅನ್ನು ಘೋಷಿಸಿದ್ದಾರೆ. ಇದು ಟ್ರಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ ಭಾಷಾ ಮಾದರಿಯು ಟೋಕನ್-ಬಜೆಟ್ ಮಿತಿಗಳ ಒಳಗೆ ಉಳಿದುಕೊಳ್ಳುತ್ತಲೇ ತರ್ಕಿಸಲು ಕಲಿಯಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ, ಮತ್ತು ಈ ಮಾದರಿಯು 2026ರ AIME ಗಣಿತ ಪರೀಕ್ಷೆಯಲ್ಲಿ 84.2% ಅಂಕಗಳನ್ನು ಗಳಿಸಿದೆ. ಈ ಫಲಿತಾಂಶವು, ಇಂತಹ ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ, ಎಂಜಿನಿಯರ್‌ಗಳು ಸಾಂಪ್ರದಿಕವಾಗಿ ಪ್ರಾಂಪ್ಟ್‌ಗಳಲ್ಲಿ ಹಾರ್ಡ್-ಕೋಡ್ ಮಾಡಿದ ಹಂತ-ಹಂತದ ಸಮಸ್ಯೆ ಪರಿಹರಿಸುವ ಅಭ್ಯಾಸಗಳನ್ನು ಮಾದರಿಯು ತಾನಾಗಿಯೇ ಪಡೆಯಬಲ್ಲದು ಎಂದು ತೋರಿಸುತ್ತದೆ.

ಇದು ಏಕೆ ಮುಖ್ಯ

AIME-ಮಟ್ಟದ ಕಾರ್ಯಕ್ಷಮತೆಯು ದೀರ್ಘಕಾಲದಿಂದ "ಮಾನವ-ಮಟ್ಟದ" ಪರಿಮಾಣಾತ್ಮಕ ತರ್ಕಕ್ಕೆ (quantitative reasoning) ಒಂದು ಮಾನದಂಡವಾಗಿದೆ. ಯಾವುದೇ ಮಾನವ-ಬರೆದ ಉದಾಹರಣೆಗಳಿಲ್ಲದೆ 84.2% ರೇಂಜ್ ಅನ್ನು ತಲುಪುವುದು ಎಂದರೆ, ಮಾದರಿಯ ತರ್ಕ ಸಾಮರ್ಥ್ಯವು ಕೈಯಿಂದ ಸಿದ್ಧಪಡಿಸಿದ ಸ್ಕ್ಯಾಫೋಲ್ಡ್‌ಗಳಿಂದ (scaffolds) ಬಂದಿದ್ದಲ್ಲ, ಬದಲಾಗಿ ತರಬೇತಿಯ ಡೈನಾಮಿಕ್ಸ್‌ನಿಂದಲೇ ಉದ್ಭವಿಸಿದೆ ಎಂದು ಸೂಚಿಸುತ್ತದೆ. AI ಏಜೆಂಟ್‌ಗಳನ್ನು ನಿರ್ಮಿಸುತ್ತಿರುವ ಕಂಪನಿಗಳಿಗೆ ಇದರ ಸೂಚನೆ ಸ್ಪಷ್ಟವಾಗಿದೆ: ಸಂಕೀರ್ಣವಾದ ಪ್ರಾಂಪ್ಟ್ ರೆಸಿಪಿಗಳನ್ನು ಬರೆಯುವ ಮತ್ತು ನಿರ್ವಹಿಸುವ ಅಗತ್ಯವನ್ನು, ಮಾದರಿಯು ಯಾವಾಗ ಹೆಚ್ಚು ಆಳವಾಗಿ ಯೋಚಿಸಬೇಕು ಮತ್ತು ಯಾವಾಗ ಸರಳವಾದ ಶಾರ್ಟ್‌ಕಟ್ ಸಾಕು ಎಂಬುದನ್ನು ಕಲಿಸುವ ಟ್ರೈನಿಂಗ್ ಲೂಪ್ ಮೂಲಕ ಬದಲಾಯಿಸಬಹುದು.

ಪ್ರಾಂಪ್ಟ್ ಎಂಜಿನಿಯರಿಂಗ್‌ನಿಂದ ತರಬೇತಿ ಡೈನಾಮಿಕ್ಸ್ ವರೆಗೆ

ವರ್ಷಗಳಿಂದ, ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳನ್ನು (LLMs) ಬಹು-ಹಂತದ ತರ್ಕಕ್ಕೆ ಪ್ರೇರೇಪಿಸಲು, "ಸಮಸ್ಯೆಯನ್ನು ಭಾಗಗಳಾಗಿ ವಿಂಗಡಿಸಿ" ಅಥವಾ "ನಿಮ್ಮ ಉತ್ತರವನ್ನು ಪರಿಶೀಲಿಸಿ" ಅಂತಹ ಪ್ರಾಂಪ್ಟ್ ಟೆಂಪ್ಲೇಟ್‌ಗಳ ಮೇಲೆ ಡೆವಲಪರ್‌ಗಳು ಅವಲಂಬಿತರಾಗಿದ್ದರು. ಆ ಟೆಂಪ್ಲೇಟ್‌ಗಳು ಬಾಹ್ಯ ಸ್ಕ್ಯಾಫೋಲ್ಡಿಂಗ್ ಆಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ; ಮಾದರಿಯು ಸೂಚನೆಗಳನ್ನು ಅನುಸರಿಸುತ್ತದೆ ಆದರೆ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳುವುದಿಲ್ಲ (internalize). Ring-Zero ಈ ಪ್ಯಾರಾಡೈಮ್ ಅನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ. ಮಾದರಿಯು ಕಾರ್ಯದ ವಿವರಣೆಯೊಂದಿಗೆ ಒಂದು ಪರಿಶೀಲಿಸಬಹುದಾದ ಉತ್ತರವನ್ನು (verifiable answer) ಪಡೆಯುತ್ತದೆ—ಇದು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಪರಿಶೀಲಿಸಬಹುದಾದ ಗ್ರೌಂಡ್-ಟ್ರೂತ್ ಆಗಿದೆ. ನಂತರ ಅದು ಸರಣಿ ಪ್ರಯತ್ನಗಳನ್ನು ಮಾಡುತ್ತದೆ, ಆ ಪ್ರಯತ್ನವು ಪರಿಶೀಲಿಸಬಹುದಾದ ಉತ್ತರವನ್ನೇ ಹೊಂದಿದ್ದಾಗ ಮಾತ್ರ ರಿವಾರ್ಡ್ ಪಡೆಯುತ್ತದೆ ಮತ್ತು ರಿಇನ್‌ಫೋರ್ಸ್‌ಮೆಂಟ್ ಲರ್ನಿಂಗ್ ಮೂಲಕ ತನ್ನ ಪಾಲಿಸಿಯನ್ನು ಅಪ್‌ಡೇಟ್ ಮಾಡಿಕೊಳ್ಳುತ್ತದೆ.

ಏಕೆಂದರೆ ರಿವಾರ್ಡ್ ಎಂಬುದು ವಂಚಿಸಲು ಕಷ್ಟವಾದ ಒಂದು ಉದ್ದೇಶಕ್ಕೆ (ಉತ್ತರವು ಕೇವಲ ಸಮಂಜಸವಾಗಿರದೆ, ಸರಿಯಾಗಿರಲೇಬೇಕು) ಸಂಬಂಧಿಸಿದೆ, ಮಾದರಿಯು ತರ್ಕದ ಮಾದರಿಗಳನ್ನು ತಾನಾಗಿಯೇ ಕಂಡುಕೊಳ್ಳುತ್ತದೆ. ಒಂದು ವಿಶ್ವಾಸಾರ್ಹ ರಿವಾರ್ಡ್ ಸಿಗ್ನಲ್ ಇದ್ದ一旦, ಮಾದರಿಯನ್ನು ಟ್ರಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳಿಗೆ ವಿಸ್ತರಿಸಿದಾಗ, ಎಂಜಿನಿಯರ್‌ಗಳು ಸಣ್ಣ ಮಾದರಿಗಳಿಗಾಗಿ ಮ್ಯಾನುಯಲ್ ಆಗಿ ಸೇರಿಸುತ್ತಿದ್ದ ಪ್ರಾಂಪ್ಟ್-ಎಂಜಿನಿಯರಿಂಗ್ ಟ್ರಿಕ್ಸ್ ಅಳವಡನೆಗೆ ತಾನಾಗಿಯೇ ದಾರಿ ಮಾಡಿಕೊಡುತ್ತದೆ ಎಂದು ಈ ಪತ್ರಿಕೆಯು ವಾದಿಸುತ್ತದೆ.

ನಾಲ್ಕು ಹಂತದ ತರಬೇತಿ ಪೈಪ್‌ಲೈನ್

Ring-Zero ನ ತರಬೇತಿಯು ನಾಲ್ಕು ವಿಭಿನ್ನ ಹಂತಗಳ ಮೂಲಕ ಸಾಗುತ್ತದೆ:

  1. ಮೊದಲ ಹಂತದ RL – ಮಾದರಿಯು ಸಂಭವನೀಯ ತರ್ಕದ ಹಾದಿಗಳನ್ನು (reasoning traces) ಅನ್ವೇಷಿಸುತ್ತದೆ, ಯಾವ ಟೋಕನ್ ಸರಣಿಗಳು ಸರಿಯಾದ ಉತ್ತರಗಳಿಗೆ ದಾರಿ ಮಾಡಿಕೊಡುತ್ತವೆ ಎಂಬುದನ್ನು ಕಲಿಯುತ್ತದೆ.
  2. ಸೆಲ್ಫ್-ಡಿಸ್ಟಿಲೇಶನ್ (Self-distillation) – ಉತ್ತಮ ಗುಣಮಟ್ಟದ ಟ್ರೇಸ್‌ಗಳು ಮಾದರಿಗೆ ಮರಳಿ ಬರುತ್ತವೆ, ಇದು ಉದ್ಭವಿಸುತ್ತಿರುವ ತರ್ಕದ ಮಾದರಿಗಳನ್ನು ಸ್ಥಿರಗೊಳಿಸುತ್ತದೆ.
  3. ಎರಡನೇ ಹಂತದ RL – ಮೊದಲಿನ ಸುಧಾರಣೆಗಳನ್ನು ಉಳಿಸಿಕೊಂಡೇ, ಹೆಚ್ಚು ಸೂಕ್ಷ್ಮವಾದ ಲೂಪ್ ಪಾಲಿಸಿಯನ್ನು ಪರಿಷ್ಕರಿಸುತ್ತದೆ.
  4. ಟಿಯರ್ಡ್ ಟ್ರೈನಿಂಗ್ (Tiered training) – ಸಮಸ್ಯೆಯ ಕಠಿಣತೆಗೆ ಅನುಗುಣವಾಗಿ ಸಣ್ಣ (≈2k ಟೋಕನ್‌ಗಳು) ಮತ್ತು ಉದ್ದವಾದ (≈20k ಟೋಕನ್‌ಗಳು) ತರ್ಕದ ಹಾದಿಗಳ ನಡುವೆ ಆಯ್ಕೆ ಮಾಡುವ ಮೂಲಕ, ಮಾದರಿಯು ಟೋಕನ್ ಬಜೆಟ್‌ಗಳನ್ನು ಬುದ್ಧಿವಂತಿಕೆಯಿಂದ ಹಂಚಿಕೆ ಮಾಡಲು ಕಲಿಯುತ್ತದೆ.

ಟಿಯರ್ಡ್ ಟ್ರೈನಿಂಗ್ ಎಂಬುದು ಉತ್ಪಾದನಾ ಪ್ರಕ್ರಿಯೆಗೆ ಅತ್ಯಂತ ಪ್ರಸ್ತುತವಾದ ಭಾಗವಾಗಿದೆ. ನೈಜ ಬಳಕೆಯಲ್ಲಿ, ಪ್ರತಿ ಹೆಚ್ಚುವರಿ ಟೋಕನ್ ಕಂಪ್ಯೂಟ್ ವೆಚ್ಚವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. ಒಂದು ಸಮಸ್ಯೆ ಯಾವಾಗ ಸಣ್ಣ ಉತ್ತರವಿಗೆ ಸಾಕಾಗುವಷ್ಟು ಸರಳವಾಗಿದೆ ಮತ್ತು ಯಾವಾಗ ಅದು ಆಳವಾದ, ಬಹು-ಹಂತದ ವಿಶ್ಲೇಷಣೆಯನ್ನು ಬಯಸುತ್ತದೆ ಎಂಬುದನ್ನು ಗುರುತಿಸಲು ಮಾದರಿಗೆ ಕಲಿಸುವ ಮೂಲಕ, Ring-Zero ತರ್ಕದ ಗುಣಮಟ್ಟವನ್ನು ಆರ್ಥಿಕ ದಕ್ಷತೆಗೆ ನೇರವಾಗಿ ಜೋಡಿಸುತ್ತದೆ.

ಕಲಿಕೆಯ ಎರಡು ಹಂತಗಳು: ಡಿಸ್ಕವರಿ ಮತ್ತು ಶಾರ್ಪನಿಂಗ್

ಲೇಖಕರು ಕಲಿಕೆಯ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಎರಡು ಹಂತಗಳಾಗಿ ವಿವರಿಸುತ್ತಾರೆ:

  • ಡಿಸ್ಕವರಿ (Discovery) – ಆರಂಭಿಕ ರಿಇನ್‌ಫೋರ್ಸ್‌ಮೆಂಟ್-ಲರ್ನಿಂಗ್ ಹಂತಗಳು ನಾಯ್ಸಿಯಾಗಿರುತ್ತವೆ (noisy); ಮಾದರಿಯು ವೈವಿಧ್ಯಮಯ ಕಾರ್ಯತಂತ್ರಗಳನ್ನು ಪ್ರಯತ್ನಿಸುತ್ತದೆ, ಅವುಗಳಲ್ಲಿ ಅನೇಕವು ವಿಫಲವಾಗುತ್ತವೆ. ಹೊಸ ತರ್ಕದ ಹಾದಿಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಈ ವ್ಯತ್ಯಾಸವು (variance) ಅತ್ಯಗತ್ಯ.
  • ಶಾರ್ಪನಿಂಗ್ (Sharpening) – ಒಂದು ಭರವಸೆಯ ಮಾದರಿ ಕಂಡುಬಂದ ನಂತರ, ನಂತರದ RL ಹಂತಗಳು ಪಾಲಿಸಿಯನ್ನು ಬಿಗಿಗೊಳಿಸುತ್ತವೆ, ವ್ಯತ್ಯಾಸವನ್ನು (variance) ಕಡಿಮೆ ಮಾಡುತ್ತವೆ ಮತ್ತು ವರ್ತನೆಯನ್ನು ಗಟ್ಟಿಗೊಳಿಸುತ್ತವೆ.

ಈ ಪ್ರಗತಿಯು ಮನುಷ್ಯರು ಹೇಗೆ ಸುಧಾರಿಸುತ್ತಾರೆ ಎಂಬುದನ್ನು ಪ್ರತಿಬಿಂಬಿಸುತ್ತದೆ: ಆರಂಭಿಕ ಮೆದುಳಿಗೆ ಬರುವ ಆಲೋಚನೆಗಳ ನಂತರ ಕೇಂದ್ರೀಕೃತ ಅಭ್ಯಾಸ. ಪ್ರಮುಖ ಅಂಶವೆಂದರೆ, ಆರಂಭಿಕ "ಅಸ್ತವ್ಯಸ್ತ" ಹಂತವನ್ನು ಹತ್ತಿಕ್ಕುವ ಬದಲು ಅಪ್ಪಿಕೊಳ್ಳಬೇಕು, ಏಕೆಂದರೆ ಅದು ನಂತರದ ಪರಿಷ್ಕರಣೆಗೆ ಬೇಕಾದ ಕಚ್ಚಾ ವಸ್ತುವನ್ನು ಒದಗಿಸುತ್ತದೆ.

ಏನಾದರೂ ತಪ್ಪಾಗಬಹುದೇ?

ಈ ಪತ್ರಿಕೆಯ ಆಶಾವಾದವು ಕೆಲವು ಊಹೆಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ, ಅವುಗಳನ್ನು ಪರಿಶೀಲಿಸಬೇಕಾಗಿದೆ:

  • ರಿವಾರ್ಡ್ ವಿನ್ಯಾಸ (Reward design) – ಈ ಫ್ರೇಮ್‌ವರ್ಕ್‌ಗೆ ಪರಿಶೀಲಿಸಬಹುದಾದ ಮತ್ತು ಶಾರ್ಟ್‌ಕಟ್‌ಗಳನ್ನು ತಪ್ಪಿಸುವಂತಹ ರಿವಾರ್ಡ್ ಅಗತ್ಯವಿದೆ. ಅನೇಕ ನೈಜ-ಜಗತ್ತಿನ ಕಾರ್ಯಗಳಿಗಾಗಿ, ಅಂತಹ ರಿವಾರ್ಡ್ ಅನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವುದು ಸುಲಭವಲ್ಲ ಮತ್ತು ಇದಕ್ಕೆ ದುಬಾರಿ ಅ𝗻ೋಟೇಶನ್ ಪೈಪ್‌ಲೈನ್‌ಗಳ ಅಗತ್ಯವಿರಬಹುದು.
  • ಪರಿಸರಕ್ಕೆ ಸಂಬಂಧಿಸಿದ ಅಡಚಣೆಗಳು (Environmental bottlenecks) – ಮಾದರಿಯ ಕಾರ್ಯಕ್ಷಮತೆಯು ಅದರ ಗಾತ್ರದಿಂದಲ್ಲ, ಬದಲಾಗಿ ಸುತ್ತಮುತ್ತಲಿನ ಮೌಲ್ಯಮಾಪನ ಮೂಲಸೌಕರ್ಯಗಳಿಂದ (ಟೆಸ್ಟ್ ಸೂಟ್‌ಗಳು, ಲಾಗ್‌ಗಳು, ಸ್ಪಷ್ಟ ಮೆಟ್ರಿಕ್‌ಗಳು) ಸೀಮಿತವಾಗಿದೆ ಎಂದು ಲೇಖಕರು ಸೂಚಿಸುತ್ತಾರೆ. ಆ ಮೂಲಸೌಕರ್ಯವನ್ನು ನಿರ್ಮಿಸುವುದು ಮತ್ತು ನಿರ್ವಹಿಸುವುದು ದೊಡ್ಡ ಎಂಜಿನಿಯರಿಂಗ್ ಪ್ರಯತ್ನವಾಗಬಹುದು.
  • ತರಬೇತಿಯ ಕಂಪ್ಯೂಟ್ ವೆಚ್ಚ – ಬಹು RL ಹಂತಗಳೊಂದಿಗೆ ಟ್ರಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ ಮಾದರಿಯನ್ನು ತರಬೇತುಗೊಳಿಸುವುದು ದುಬಾರಿ. ಟಿಯರ್ಡ್ ಟ್ರೈನಿಂಗ್ ಇನ್ಫರೆನ್ಸ್ ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡಿದರೂ, ಆರಂಭಿಕ ತರಬೇತಿ ಬಜೆಟ್ ಹೆಚ್ಚಾಗಿರುತ್ತದೆ, ಇದು ಈ ವಿಧಾನವನ್ನು ಕೇವಲ ಹೆಚ್ಚಿನ ಹಣಕಾಸಿನ ಸೌಲಭ್ಯವಿರುವ ಲ್ಯಾಬ್‌ಗಳಿಗೆ ಸೀಮಿತಗೊಳಿಸಬಹುದು.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

AI ವೃತ್ತಿಪರರಿಗಾಗಿ ಪ್ರಾಯೋಗಿಕ ಅಂಶಗಳು

  • ಪ್ರಾಂಪ್ಟ್‌ಗಳನ್ನು ಏಕೈಕ ಸಾಧನವೆಂದು ಪರಿಗಣಿಸಬೇಡಿ – ನೀವು ಪ್ರಾಂಪ್ಟ್‌ಗಳಲ್ಲಿ ಕೋಡ್ ಮಾಡುತ್ತಿರುವ ನಡವಳಿಕೆಯನ್ನು ಬದಲಾಗಿ ರಿವಾರ್ಡ್-ಚಾಲಿತ ತರಬೇತಿ ಲೂಪ್ (reward-driven training loop) ಮೂಲಕ ಕಲಿಯಲು ಸಾಧ್ಯವೇ ಎಂದು ಪ್ರಶ್ನಿಸಿ.
  • ಟೋಕನ್ ಬಳಕೆಯನ್ನು ಪ್ರಮುಖ ಉದ್ದೇಶವನ್ನಾಗಿ ಮಾಡಿಕೊಳ್ಳಿ – ಬಜೆಟ್-ಅರಿವಿರುವ ಸಂಕೇತಗಳನ್ನು ಮೊದಲೇ ಸೇರಿಸಿ; ಆಗ ಮಾಡೆಲ್ ನಿಖರತೆ ಮತ್ತು ಕಂಪ್ಯೂಟ್ ವೆಚ್ಚದ ನಡುವೆ ಸಮತೋಲನವನ್ನು ಕಾಯ್ದುಕೊಳ್ಳುವುದನ್ನು ಕಲಿಯುತ್ತದೆ.
  • ಫೀಡ್‌ಬ್ಯಾಕ್ ಲೂಪ್ ಅನ್ನು ಪೂರ್ಣಗೊಳಿಸಿ – ಕಾರ್ಯಗಳನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಒದಗಿಸುವ, ಪರಿಶೀಲಿಸಬಹುದಾದ ಉತ್ತರಗಳೊಂದಿಗೆ ಫಲಿತಾಂಶಗಳನ್ನು ಅಳೆಯುವ ಮತ್ತು ಆ ಫಲಿತಾಂಶಗಳನ್ನು ಮರಳಿ ತರಬೇತಿಗೆ ನೀಡುವ ವ್ಯವಸ್ಥೆಯನ್ನು ಅಳವಡಿಸಿ. ಈ ಲೂಪ್ ಮೂಲಕವೇ ಮಾಡೆಲ್ ತನ್ನದೇ ಆದ ಕಾರ್ಯವಿಧಾನವನ್ನು (workflow) ಕಂಡುಕೊಳ್ಳುತ್ತದೆ.

ರಿವಾರ್ಡ್ ಸ್ಪಷ್ಟವಾಗಿದ್ದಾಗ ಮತ್ತು ಪರಿಸರವು ಯಶಸ್ಸನ್ನು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಅಳೆಯಬಲ್ಲಾಗಿದ್ದಾಗ, ಮಾಡೆಲ್ ಅನ್ನು ಸ್ಕೇಲ್ ಮಾಡುವುದು ಕೇವಲ ಸಾಮರ್ಥ್ಯವನ್ನು ಹೆಚ್ಚಿಸುವುದಲ್ಲ—ಅದು ಮಾಡೆಲ್‌ಗೆ ಹೇಗೆ ಯೋಚಿಸಬೇಕು ಎಂಬುದನ್ನು ಆರಿಸಿಕೊಳ್ಳಲು ಕಲಿಸುತ್ತದೆ. ಕೈಬರಹದ ಸ್ಕ್ಯಾಫೋಲ್ಡಿಂಗ್‌ನಿಂದ (hand-written scaffolding) ಸ್ವಯಂ-ನಿರ್ದೇಶಿತ ತರ್ಕದತ್ತ (self-directed reasoning) ಆಗುವ ಈ ಬದಲಾವಣೆಯು ನಾವು AI ಏಜೆಂಟ್‌ಗಳನ್ನು ಹೇಗೆ ನಿರ್ಮಿಸುತ್ತೇವೆ ಮತ್ತು ಅವುಗಳ ಬೆಲೆಯನ್ನು ಹೇಗೆ ನಿಗದಿಪಡಿಸುತ್ತೇವೆ ಎಂಬುದನ್ನು ಮರುರೂಪಿಸಬಹುದು.