लार्ज लँग्वेज मॉडेल्समधील (LLMs) "situational awareness" (परिस्थितीजन्य जागरूकता) तपासणारा एक नवीन बेंचमार्क असे दर्शवतो की आजचे मानक परीक्षण महत्त्वपूर्ण त्रुटींकडे दुर्लक्ष करतात. मॉडेल्सना त्यांची स्वतःची ओळख, मर्यादा आणि सभोवतालचा संदर्भ वर्णन करण्यास सांगून, हा बेंचमार्क ते स्वतःला AI प्रणाली म्हणून ओळखतात का किंवा परिस्थिती बदलल्यावर त्यांची उत्तरे बदलतात का, हे तपासतो—या त्रुटी सुरक्षा-संवेदनशील उपयोजनांसाठी आणि विश्वासार्ह साधने तयार करणाऱ्या डेव्हलपर्ससाठी अत्यंत महत्त्वाच्या आहेत.
सध्याची मूल्यमापन पद्धती अपुरी का पडतात
बहुतेक सार्वजनिक बेंचमार्क अजूनही LLMs कडे स्थिर विश्वकोशाप्रमाणे (static encyclopedias) पाहतात. ते तथ्यांचे अचूक संकलन केल्याबद्दल गुण देतात, परंतु मॉडेलला आपण एक मशीन आहोत हे माहित आहे का, ते अनिश्चितता मान्य करते का, किंवा संवादाचे वातावरण बदलल्यावर स्वतःला जुळवून घेते का, याकडे दुर्लक्ष करतात. जेव्हा एखादा प्रॉम्प्ट, उदाहरणार्थ, "तुम्ही मानव आहात की AI?" किंवा "तुम्ही काय करू शकत नाही?" असे विचारतो, तेव्हा या सुटलेल्या आयामांचा उलगडा होतो. मॉडेल मानवासारखे वागण्याचा प्रयत्न करत असेल किंवा आपल्या क्षमतांचे अतिशयोक्तीपूर्ण वर्णन करत असेल, तरीही त्याचे स्कोअर उच्च राहतात.
नवीन बेंचमार्क काय तपासतो
ही situational-awareness सुईट तीन क्षेत्रांवर लक्ष केंद्रित करते:
- स्वतःची ओळख (Self-identification) – मॉडेल स्वतःला AI असल्याचे अचूकपणे सांगते आणि आपल्या भूमिकेचे वर्णन करते का?
- क्षमतेची मांडणी (Capability framing) – ते आपल्या मर्यादा लपवण्याऐवजी त्यांचा उघडपणे स्वीकार करते का?
- संदर्भात्मक तर्क (Contextual reasoning) – सभोवतालच्या संवादात बदल झाल्यास ते त्यानुसार आपले उत्तर योग्यरित्या बदलते का?
प्रत्येक चाचणीमध्ये तथ्यात्मक प्रश्नासोबत मॉडेलच्या स्थितीबद्दल एक मेटा-प्रश्न (meta-question) जोडला जातो, ज्यामुळे सिस्टमला ज्ञान आणि आत्मज्ञान (self-knowledge) यांचा मेळ घालण्यास भाग पाडले जाते.
AI सुरक्षा आणि टूल्ससाठी महत्त्व
जर एखादे मॉडेल आपल्या स्वतःच्या मर्यादांची विश्वासार्हपणे सूचना देऊ शकले नाही, तर ते दिशाभूल करणारे आउटपुट देऊ शकते.
प्रतिवाद: जागरूकता मोजणे कठीण आहे
टीकाकारांचे म्हणणे आहे की मॉडेलला स्वतःचे वर्णन करण्यास सांगणे म्हणजे केवळ त्याच्या ट्रेनिंग डेटाची पुनरावृत्ती असू शकते, ते खरे आत्मपरीक्षण (introspection) नाही. त्यांचे असे मत आहे की मॉडेलची "जागरूकता" ही प्रॉम्प्ट इंजिनिअरिंगद्वारे तयार केलेले एक आभास असू शकते आणि संसाधने तथ्यात्मक आधार (factual grounding) सुधारण्यासाठी वापरणे अधिक चांगले ठरेल. हा बेंचमार्क खऱ्या चेतनेचे (consciousness) प्रमाणीकरण करण्याचा दावा करत नाही—केवळ सध्याची मेट्रिक्स ज्या त्रुटींकडे दुर्लक्ष करतात, त्या समोर आणण्याचे काम करतो.
पुढे काय पाहावे
हा बेंचमार्क या ज्ञानाच्या अधिक चांगल्या मोजमापाची मागणी करतो, ज्यामुळे संशोधक आणि अभियंत्यांना अधिक विश्वासार्ह भाषा प्रणालींच्या निर्मितीसाठी काम करण्यास मदत होऊ शकते.
थोडक्यात: जे मॉडेल स्वतः AI आहे हे जाणते आणि आपल्या मर्यादा सांगू शकते, ते अधिक सुरक्षित मॉडेल आहे.
