APIಗಳನ್ನು ಕರೆಯುವ, ಸಿಸ್ಟಮ್ ಕಮಾಂಡ್‌ಗಳನ್ನು ಚಲಾಯಿಸುವ ಅಥವಾ ಫೈಲ್‌ಗಳನ್ನು ನಿರ್ವಹಿಸುವ AI ಏಜೆಂಟ್‌ಗಳು ಈಗ ಬಳಕೆದಾರರ ಪರವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿವೆ. ಆ ಏಜೆಂಟ್‌ಗಳು ವಿನಂತಿಯನ್ನು ಅಕ್ಷರಶಃ ಸ್ವೀಕರಿಸಿದಾಗ – ಉದಾಹರಣೆಗೆ ಮನೆಯನ್ನೇ ಕುಸಿಯುವಂತೆ ಮಾಡುವ "ಬಂಗಾರದ ಬೆಟ್ಟ"ವನ್ನು ನೀಡಿದಾಗ – ಅದರ ಪರಿಣಾಮವು ವಿನಾಶಕಾರಿಯಾಗಿ, ಅನೈತಿಕವಾಗಿ ಅಥವಾ ಕೇವಲ ನಿಷ್ಪ್ರಯೋಜಕವಾಗಿರಬಹುದು. ಸಂಶೋಧಕರು ಈ ಕೊರತೆಯನ್ನು ತುಂಬಲು Genie coefficient ಎಂಬ ಹೊಸ ಪ್ರಸ್ತಾವಿತ ಮಾಪಕವನ್ನು ಪರಿಚಯಿಸುತ್ತಿದ್ದಾರೆ, ಇದು ಏಜೆಂಟ್‌ನ ಔಟ್‌ಪುಟ್ ಬಳಕೆದಾರರ ನೈಜ ಉದ್ದೇಶದಿಂದ ಎಷ್ಟು ದೂರ ಹೋಗಿದೆ ಎಂಬುದನ್ನು ಅಳೆಯುತ್ತದೆ.

ಈಗ ಅಸ್ಪಷ್ಟತೆ (underspecification) ಏಕೆ ಮುಖ್ಯವಾಗಿದೆ

ಕೇವಲ ಚಾಟ್ ಮಾಡುವ ಬಾಟ್‌ಗಳಿಂದ ಪ್ರಪಂಚದಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಏಜೆಂಟ್‌ಗಳೆಡೆಗೆ ಬದಲಾಗುವುದು ಭಾಷಾ ಮಾದರಿಯ ಸಮಸ್ಯೆಯನ್ನು ಸುರಕ್ಷತೆಯ ಸಮಸ್ಯೆಯನ್ನಾಗಿ ಪರಿವರ್ತಿಸುತ್ತದೆ. ಒಂದು ಮಾದರಿಯು ಇನ್ನೂ ಸುಲಲಿತವಾದ ಪಠ್ಯವನ್ನು ರಚಿಸಬಹುದು, ಆದರೆ ಅದು API ಕರೆಗಳನ್ನು ಅಥವಾ ಶೆಲ್ ಕಮಾಂಡ್‌ಗಳನ್ನು ನೀಡಲು ಪ್ರಾರಂಭಿಸಿದ一旦, ಅಕ್ಷರಶಃ ಅರ್ಥೈಸುವಿಕೆ ನೈಜ ಪ್ರಪಂಚದಲ್ಲಿ ಹಾನಿಯನ್ನು ಉಂಟುಮಾಡಬಹುದು. ಮಾದರಿಗೆ ಪ್ರಾಗ್ಮ್ಯಾಟಿಕ್ಸ್ (pragmatics) – ಅಂದರೆ ಸಂದರ್ಭ, ಸಮಂಜಸವಾದ ನಿರೀಕ್ಷೆಗಳು ಮತ್ತು ಹೇಳದ ಮಿತಿಗಳನ್ನು ಗ್ರಹಿಸುವ ಸಾಮರ್ಥ್ಯ – ಇಲ್ಲದ ಕಾರಣ, ಅದು ಪದಗಳನ್ನು ಪಾಲಿಸಬಹುದು ಆದರೆ ಅದರ ಹಿಂದಿನ ಉದ್ದೇಶವನ್ನು ಮರೆಯಬಹುದು. "ಜೀನಿ" (genie) ಹೋಲಿಕೆಯು ಇದನ್ನು ವಿವರಿಸುತ್ತದೆ: ಒಂದು ವರವನ್ನು ಅಕ್ಷರಶಃ ವಿನಂತಿಯನ್ನು ಪೂರೈಸುವ ರೀತಿಯಲ್ಲಿ ನೀಡಲಾಗುತ್ತದೆ ಆದರೆ ವರ ಕೇಳಿದವರ ಆಳವಾದ ಗುರಿಯನ್ನು ನಿರ್ಲಕ್ಷಿಸಲಾಗುತ್ತದೆ.

Genie coefficient ಏನನ್ನು ಅಳೆಯುತ್ತದೆ

ಈ ಕೋಎಫಿಶಿಯೆಂಟ್ ಎಂಬುದು ಕೇವಲ ಒಂದು ಬೆಂಚ್‌ಮಾರ್ಕ್ ಸಂಖ್ಯೆಯಲ್ಲ; ಇದು ಉದ್ದೇಶಿತ ಫಲಿತಾಂಶ ಮತ್ತು ಏಜೆಂಟ್‌ನ ನೈಜ ನಡವಳಿಕೆಯ ನಡುವಿನ ಅಂತರವನ್ನು ಅಳೆಯುವ ಒಂದು ಚೌಕಟ್ಟು. ಇದು ನಾಲ್ಕು ಸ್ತಂಭಗಳ ಮೇಲೆ ನಿಂತಿದೆ:

  • ಏಜೆಂಟ್ ಒಂದು ನಿರ್ದಿಷ್ಟ ಕ್ಷೇತ್ರದಲ್ಲಿ ಎದುರಿಸುವ ಕಾರ್ಯಗಳನ್ನು ಪ್ರತಿಬಿಂಬಿಸುವ ಡೊಮೇನ್-ನಿರ್ದಿಷ್ಟ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳು (Domain-specific benchmarks).
  • ಶಾರ್ಟ್‌ಕಟ್‌ಗಳು, ಎಡ್ಜ್ ಕೇಸ್‌ಗಳು ಮತ್ತು ಅನಿರೀಕ್ಷಿತ ಪರಿಣಾಮಗಳು ಹೊರಬರುವ ಅನುಕರಿಸಲಾದ ನೈಜ-ಪ್ರಪಂಚದ ಪರಿಸರಗಳು (Simulated real-world environments).
  • AI ಕ್ರಮಗಳಿಗಾಗಿ ಒಂದು ಸಮಂಜಸ ವ್ಯಕ್ತಿಯ ಮಾನದಂಡ (reasonable-person standard), ಇದನ್ನು ಅದೇ ಪರಿಸ್ಥಿತಿಯಲ್ಲಿ ಒಬ್ಬ ವಿವೇಕಿ ವ್ಯಕ್ತಿಯು ಏನು ಮಾಡುತ್ತಾನೆ ಎಂಬ ಕಾನೂನು ಪರಿಕಲ್ಪನೆಗಳಿಂದ ಎರವಲು ಪಡೆಯಲಾಗಿದೆ.
  • ಮಾಡೆಲ್ ಮತ್ತು ಸಾಫ್ಟ್‌ವೇರ್ ಹಾರ್ನೆಸ್‌ನ ಜಂಟಿ ಮೌಲ್ಯಮಾಪನ, ಸುತ್ತಮುತ್ತಲಿನ ಕೋಡ್‌ನಲ್ಲಿನ ದೋಷಗಳು (bugs) ಮಾದರಿಯ ದೋಷಗಳಷ್ಟೇ ಅಪಾಯಕಾರಿಯಾಗಿರಬಹುದು ಎಂಬುದನ್ನು ಇದು ಗುರುತಿಸುತ್ತದೆ.

ಈ ಅಂಶಗಳನ್ನು ಅನ್ವಯಿಸುವುದರಿಂದ, ಡೆವಲಪರ್‌ಗಳು ಅರ್ಥಪೂರ್ಣ ಸರಿತಪ್ಪುಗಳನ್ನು ಮತ್ತು ಪ್ರಾಗ್ಮ್ಯಾಟಿಕ್ ಸುರಕ್ಷತೆಯನ್ನು ಸೆರೆಹಿಡಿಯುವ Genie coefficient ಅನ್ನು ನಿಗದಿಪಡಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ.

ಡೆವಲಪರ್‌ಗಳು ಮತ್ತು ಬಳಕೆದಾರರಿಗೆ ಇರುವ ಅಪಾಯಗಳು

ಹೆಚ್ಚಿನ ಕೋಎಫಿಶಿಯೆಂಟ್ ಎಂದರೆ ಏಜೆಂಟ್ ಕಮಾಂಡ್‌ನ ಅಕ್ಷರಶಃ ಅರ್ಥವನ್ನು ಪಾಲಿಸುತ್ತದೆ ಆದರೆ ಅದರ ಸಾರವನ್ನು ಉಲ್ಲಂಘಿಸುತ್ತದೆ ಎಂದು ಸೂಚಿಸುತ್ತದೆ, ಇದು ಬಳಕೆದಾರರನ್ನು ಆರ್ಥಿಕ ನಷ್ಟ, ಡೇಟಾ ಉಲ್ಲಂಘನೆ ಅಥವಾ ನಿಯಂತ್ರಕ ದಂಡಗಳಿಗೆ ಒಡ್ಡಿಕೊಳ್ಳುವಂತೆ ಮಾಡುತ್ತದೆ. ಕಡಿಮೆ ಕೋಎಫಿಶಿಯೆಂಟ್ ಎಂದರೆ ಸಿಸ್ಟಮ್ ಸೂಚಿತ ಮಿತಿಗಳನ್ನು ಗೌರವಿಸುತ್ತದೆ ಎಂದು ತೋರಿಸುತ್ತದೆ, ಇದು ಹಣಕಾಸು, ಆರೋಗ್ಯ ಅಥವಾ ನಿರ್ಣಾಯಕ ಮೂಲಸೌಕರ್ಯದಂತಹ ಹೆಚ್ಚಿನ ಅಪಾಯವಿರುವ ಕ್ಷೇತ್ರಗಳಲ್ಲಿ ನಿಯೋಜನೆಯನ್ನು ಹೆಚ್ಚು ಕಾರ್ಯಸಾಧ್ಯವಾಗಿಸುತ್ತದೆ.

ಈ ಮಾಪಕವು ಉತ್ಪನ್ನ ತಂಡಗಳಿಗೆ ಒಂದು ರೋಗನಿರ್ಣಯ ಸಾಧನವನ್ನೂ (diagnostic tool) ನೀಡುತ್ತದೆ: ಅವರು ಸೂಚನೆ-ಮಟ್ಟದ ವೈಫಲ್ಯಗಳನ್ನು (ಮಾದರಿಯು ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ತಪ್ಪಾಗಿ ಅರ್ಥೈಸಿಕೊಂಡಿದೆ) ಮತ್ತು ತಾಂತ್ರಿಕ ತಪ್ಪು ನಡವಳಿಕೆಯನ್ನು (ಸುತ್ತಮುತ್ತಲಿನ ಕೋಡ್ API ಕರೆಯನ್ನು ತಪ್ಪಾದ ಮಾರ್ಗಕ್ಕೆ ಕಳುಹಿಸಿದೆ) ಪ್ರತ್ಯೇಕಿಸಬಹುದು. ಡಿಬಗ್ ಮಾಡುವುದು, ಅನುಸರಣೆ ವರದಿ ಮಾಡುವುದು ಮತ್ತು ವೆಚ್ಚದ ಹಂಚಿಕೆಗೆ ಈ ವ್ಯತ್ಯಾಸವು ಮುಖ್ಯವಾಗಿದೆ.

ವಿರೋಧಾಭಾಸಗಳು ಮತ್ತು ಮುಕ್ತ ಪ್ರಶ್ನೆಗಳು

ಉದ್ದೇಶವನ್ನು ಪ್ರಮಾಣೀಕರಿಸುವುದು ವ್ಯಕ್ತಿನಿಷ್ಠವಾಗಿದೆ ಮತ್ತು ಅಭಿವೃದ್ಧಿ ಚಕ್ರಗಳನ್ನು ನಿಧಾನಗೊಳಿಸಬಹುದು ಎಂದು ವಿಮರ್ಶಕರು ಹೇಳುತ್ತಾರೆ. ಪ್ರತಿ ಡೊಮೇನ್‌ಗೆ "ಸಮಂಜಸ ವ್ಯಕ್ತಿ" ಎಂಬ ಮೂಲತತ್ವವನ್ನು ನಿರ್ಮಿಸಲು ವ್ಯಾಪಕವಾದ ಕಾನೂನು ಮತ್ತು ನೈತಿಕ ಪರಿಣತಿಯ ಅಗತ್ಯವಿರಬಹುದು, ಇದು ಮಾದರಿ ಮೌಲ್ಯಮಾಪನದ ಹೊರೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. ತಂಡಗಳು ಈ ಕೋಎಫಿಶಿಯೆಂಟ್ ಅನ್ನು ವ್ಯವಸ್ಥೆಯ ಮರುವಿನ್ಯಾಸಕ್ಕಾಗಿ ಮಾರ್ಗದರ್ಶಕವಾಗಿ ಬಳಸುವ ಬದಲು ಕೇವಲ ಒಂದು ಚೆಕ್‌ಬಾಕ್ಸ್ ಆಗಿ ಪರಿಗಣಿಸುವ ಅಪಾಯವೂ ಇದೆ.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

ಮುಂದಿನ ಹಂತಗಳು Genie coefficient ಅನ್ನು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ AI ಪರೀಕ್ಷಾ ಪೈಪ್‌ಲೈನ್‌ಗಳಿಗೆ ಸೇರಿಸುವುದು ಮತ್ತು ಅದಕ್ಕೆ ಪೂರೈಕೆ ಮಾಡುವ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಸೂಟ್‌ಗಳನ್ನು ಪ್ರಮಾಣೀಕರಿಸುವುದನ್ನು ಒಳಗೊಂಡಿವೆ. ಕೈಗಾರಿಕಾ ಗುಂಪುಗಳು ಇದನ್ನು ಸುರಕ್ಷತಾ ಮೂಲತತ್ವವಾಗಿ ಅಳವಡಿಸಿಕೊಂಡರೆ, ಏಜೆಂಟ್‌ಗಳು ಗ್ರಾಹಕರನ್ನು ತಲುಪುವ ಮೊದಲು ಪ್ರಮಾಣೀಕರಣ ಕಾರ್ಯಕ್ರಮಗಳು ಒಂದು ನಿರ್ದಿಷ್ಟ ಮಿತಿಯ ಕೋಎಫಿಶಿಯೆಂಟ್ ಅನ್ನು ಬಯಸಬಹುದು. ಸಂಶೋಧಕರು ಬಹುಶಃ ಸಮಂಜಸ ವ್ಯಕ್ತಿಯ ವ್ಯಾಖ್ಯಾನವನ್ನು ಪರಿಷ್ಕರಿಸಬಹುದು ಮತ್ತು ವಿಶ್ವಾಸಾರ್ಹ ಮಾಪನಕ್ಕಾಗಿ ಅಗತ್ಯವಿರುವ ಅನುಕರಿಸಲಾದ ಪರಿಸರಗಳನ್ನು ರಚಿಸಲು ಸ್ವಯಂಚಾಲಿತ ವಿಧಾನಗಳನ್ನು ಅನ್ವೇಷಿಸಬಹುದು.

ಮೂಲ ಅಂಶ: AI ಏಜೆಂಟ್‌ಗಳು ಪಠ್ಯದಿಂದ ಕ್ರಿಯೆಯೆಡೆಗೆ ಚಲಿಸುತ್ತಿದ್ದಂತೆ, ಬಳಕೆದಾರರು ಕೇವಲ ಏನು ಹೇಳುತ್ತಾರೆ ಎಂಬುದನ್ನು ಮಾತ್ರವಲ್ಲದೆ, ಅವರು ನಿಜವಾಗಿಯೂ ಏನನ್ನು ಬಯಸುತ್ತಾರೆ ಎಂಬುದನ್ನು ಅವರು ಎಷ್ಟು ಚೆನ್ನಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳುತ್ತಾರೆ ಎಂಬುದನ್ನು ಅಳೆಯುವುದು ಅತ್ಯಗತ್ಯವಾಗುತ್ತದೆ. Genie coefficient ಆ ಅಳತೆಯನ್ನು ಪ್ರಾಯೋಗಿಕವಾಗಿ ಅಳವಡಿಸಲು ಒಂದು ನಿರ್ದಿಷ್ಟವಾದ ಮತ್ತು ವಿಕಸನಗೊಳ್ಳುತ್ತಿರುವ ಮಾರ್ಗವನ್ನು ನೀಡುತ್ತದೆ.