ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳಲ್ಲಿನ (LLMs) "ಪರಿಸ್ಥಿತಿಯ ಅರಿವನ್ನು" (situational awareness) ಪರೀಕ್ಷಿಸುವ ಹೊಸ ಬೆಂಚ್‌ಮಾರ್ಕ್, ಇಂದಿನ ಪ್ರಮಾಣಿತ ಪರೀಕ್ಷೆಗಳು ನಿರ್ಣಾಯಕ ಕೊರತೆಗಳನ್ನು ಹೊಂದಿವೆ ಎಂದು ತೋರಿಸುತ್ತದೆ. ಮಾಡೆಲ್‌ಗಳು ತಮ್ಮ ಸ್ವಂತ ಗುರುತು, ಮಿತಿಗಳು ಮತ್ತು ಸುತ್ತಮುತ್ತಲಿನ ಸಂದರ್ಭವನ್ನು ವಿವರಿಸಲು ಕೇಳುವ ಮೂಲಕ, ಅವು ತಾನು ಒಂದು AI ವ್ಯವಸ್ಥೆ ಎಂದು ಗುರುತಿಸುತ್ತವೆಯೇ ಅಥವಾ ಪರಿಸ್ಥಿತಿ ಬದಲಾದಾಗ ತಮ್ಮ ಉತ್ತರಗಳನ್ನು ಹೊಂದಿಸುತ್ತವೆಯೇ ಎಂಬುದನ್ನು ಈ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಪರೀಕ್ಷಿಸುತ್ತದೆ—ಸುರಕ್ಷತೆಗೆ ನಿರ್ಣಾಯಕವಾದ ಅನ್ವಯಿಕೆಗಳಿಗೆ ಮತ್ತು ನಂಬಿಕಾರ್ಹ ಪರಿಕರಗಳನ್ನು ನಿರ್ಮಿಸುವ ಡೆವಲಪರ್‌ಗಳಿಗೆ ಈ ಕೊರತೆಗಳು ಬಹಳ ಮುಖ್ಯವಾಗಿವೆ.

ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಮೌಲ್ಯಮಾಪನಗಳು ಏಕೆ ಅಪೂರ್ಣವಾಗಿವೆ

ಹೆಚ್ಚಿನ ಸಾರ್ವಜನಿಕ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳು ಇಂದಿಗೂ LLMಗಳನ್ನು ಸ್ಥಿರ ವಿಶ್ವಕೋಶಗಳಂತೆ ಪರಿಗಣಿಸುತ್ತವೆ. ಅವು ಸತ್ಯಾಂಶಗಳ ಸರಿಯಾದ ಮರುಪಡೆಯುವಿಕೆಗೆ ಒತ್ತು ನೀಡುತ್ತವೆ ಆದರೆ ಮಾಡೆಲ್ ತಾನು ಒಂದು ಯಂತ್ರ ಎಂದು ತಿಳಿದಿದೆಯೇ, ಅನಿಶ್ಚಿತತೆಯನ್ನು ಒಪ್ಪಿಕೊಳ್ಳುತ್ತದೆಯೇ ಅಥವಾ ಸಂವಾದದ ಪರಿಸರ ಬದಲಾದಾಗ ಹೊಂದಿಕೊಳ್ಳುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ನಿರ್ಲಕ್ಷಿಸುತ್ತವೆ. ಉದಾಹರಣೆಗೆ, "ನೀವು ಮನುಷ್ಯರೇ ಅಥವಾ AI ಇಯಾ?" ಅಥವಾ "ನಿಮಗೆ ಮಾಡಲು ಸಾಧ್ಯವಾಗದಿದ್ದವು ಯಾವುವು?" ಎಂಬ ಪ್ರಾಂಪ್ಟ್ ಕೇಳಿದಾಗ ಈ ಮಿಸ್ಸಿಂಗ್ ಡೈಮೆನ್ಷನ್‌ಗಳು (missing dimensions) ಹೊರಬರುತ್ತವೆ. ಮಾಡೆಲ್ ಮನುಷ್ಯನಂತೆ ನಟಿಸಿದರೂ ಅಥವಾ ತನ್ನ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಅತಿರಂಜಿತವಾಗಿ ಹೇಳಿದರೂ ಸಹ ಸ್ಕೋರ್‌ಗಳು ಹೆಚ್ಚಾಗಿಯೇ ಇರುತ್ತವೆ.

ಹೊಸ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಏನನ್ನು ಪರೀಕ್ಷಿಸುತ್ತದೆ

ಈ ಸನ್ನಿವೇಶದ-ಅರಿವಿನ (situational-awareness) ಸೂಟ್ ಮೂರು ಮುಂಚೂಣಿಯಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ:

  • ಸ್ವಯಂ-ಗುರುತಿಸುವಿಕೆ – ಮಾಡೆಲ್ ತಾನು ಒಂದು AI ಎಂದು ಸರಿಯಾಗಿ ಹೇಳುತ್ತದೆಯೇ ಮತ್ತು ತನ್ನ ಪಾತ್ರವನ್ನು ವಿವರಿಸುತ್ತದೆಯೇ?
  • ಸಾಮರ್ಥ್ಯದ ಚೌಕಟ್ಟು – ಮಿತಿಗಳನ್ನು ಮರೆಮಾಚುವ ಬದಲು ಅವುಗಳನ್ನು ಮುಕ್ತವಾಗಿ ಒಪ್ಪಿಕೊಳ್ಳುತ್ತದೆಯೇ?
  • ಸಂದರ್ಭೋಚಿತ ತರ್ಕ – ಸುತ್ತಮುತ್ತಲಿನ ಸಂಭಾಷಣೆಯಲ್ಲಿನ ಬದಲಾವಣೆಯು ಅದರ ಉತ್ತರವನ್ನು ಸೂಕ್ತವಾಗಿ ಬದಲಾಯಿಸುತ್ತದೆಯೇ?

ಪ್ರತಿಯೊಂದು ಪರೀಕ್ಷೆಯು ಒಂದು ಸತ್ಯಾಂಶದ ಪ್ರಶ್ನೆಯನ್ನು ಮಾಡೆಲ್‌ನ ಸ್ಥಿತಿಯ ಬಗ್ಗೆ ಇರುವ ಮೆಟಾ-ಪ್ರಶ್ನೆಯೊಂದಿಗೆ ಜೋಡಿಸುತ್ತದೆ, ಇದು ವ್ಯವಸ್ಥೆಯು ಜ್ಞಾನವನ್ನು ಸ್ವಯಂ-ಜ್ಞಾನದೊಂದಿಗೆ ಬೆರೆಸುವಂತೆ ಮಾಡುತ್ತದೆ.

AI ಸುರಕ್ಷತೆ ಮತ್ತು ಪರಿಕರಗಳಿಗಾಗಿ ಇರುವ ಪಣ

ಒಂದು ಮಾಡೆಲ್ ತನ್ನ ಸ್ವಂತ ಮಿತಿಗಳನ್ನು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಸೂಚಿಸಲು ಸಾಧ್ಯವಾಗದಿದ್ದರೆ, ಅದು ತಪ್ಪು ದಾರಿಗೆಳೆಯುವ ಫಲಿತಾಂಶಗಳನ್ನು ನೀಡಬಹುದು.

ವಿರೋಧಾತ್ಮಕ ಅಂಶ: ಅರಿವನ್ನು ಅಳೆಯುವುದು ಕಷ್ಟ

ಮಾದರಿಯನ್ನು ತನ್ನನ್ನು ತಾನು ವಿವರಿಸಲು ಕೇಳುವುದು ಕೇವಲ ಅದರ ತರಬೇತಿ ಡೇಟಾದ ಪ್ರತಿಧ್ವನಿಯಾಗಿರಬಹುದು ಹೊರತು ನಿಜವಾದ ಆತ್ಮಾವಲೋಕನವಲ್ಲ ಎಂದು ವಿಮರ್ಶಕರು ಹೇಳುತ್ತಾರೆ. ಮಾಡೆಲ್‌ನ "ಅರಿವು" ಎಂಬುದು ಪ್ರಾಂಪ್ಟ್ ಇಂಜಿನಿಯರಿಂಗ್ ಮೂಲಕ ಸೃಷ್ಟಿಸಿದ ಭ್ರಮೆಯಾಗಬಹುದು ಮತ್ತು ಸಂಪನ್ಮೂಲಗಳನ್ನು ಸತ್ಯಾಂಶಗಳ ಆಧಾರವನ್ನು ಸುಧಾರಿಸಲು ಬಳಸಬಹುದು ಎಂದು ಅವರು ವಾದಿಸುತ್ತಾರೆ. ಈ ಬೆಂಚ್‌ಮಾರ್ಕ್ ನಿಜವಾದ ಪ್ರಜ್ಞೆಯನ್ನು ಪ್ರಮಾಣೀಕರಿಸುತ್ತದೆ ಎಂದು ಹೇಳಿಕೊಳ್ಳುವುದಿಲ್ಲ—ಕೇವಲ ಪ್ರಸ್ತುತ ಮಾಪನಗಳು ಗಮನಿಸದ ಅಸಂಗತತೆಗಳನ್ನು ಹೊರಹಾಕಲು ಪ್ರಯತ್ನಿಸುತ್ತದೆ.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

ಈ ಜ್ಞಾನದ ಉತ್ತಮ ಮಾಪನಕ್ಕಾಗಿ ಈ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಕರೆ ನೀಡುತ್ತದೆ, ಇದು ಸಂಶೋಧಕರು ಮತ್ತು ಎಂಜಿನಿಯರ್‌ಗಳು ಹೆಚ್ಚು ನಂಬಿಕಾರ್ಹ ಭಾಷಾ ವ್ಯವಸ್ಥೆಗಳತ್ತ ಕೆಲಸ ಮಾಡಲು ಸಹಾಯ ಮಾಡಬಹುದು.

ಸಾರಾಂಶ: ತಾನು ಒಂದು AI ಎಂದು ತಿಳಿದಿರುವ ಮತ್ತು ತನ್ನ ಮಿತಿಗಳನ್ನು ಹೇಳಬಲ್ಲ ಮಾಡೆಲ್ ಹೆಚ್ಚು ಸುರಕ್ಷಿತವಾದ ಮಾಡೆಲ್ ಆಗಿದೆ.