लार्ज लैंग्वेज मॉडल्स (LLMs) में "परिस्थितिजन्य जागरूकता" (situational awareness) की जांच करने वाला एक नया बेंचमार्क दिखाता है कि आज के मानक परीक्षण महत्वपूर्ण कमियों को नजरअंदाज कर देते हैं। मॉडल्स से उनकी अपनी पहचान, सीमाओं और आसपास के संदर्भ का वर्णन करने के लिए कहकर, यह बेंचमार्क यह जांचता है कि क्या वे पहचानते हैं कि वे AI सिस्टम हैं या स्थिति बदलने पर अपने उत्तरों को समायोजित करते हैं—ऐसी कमियां जो सुरक्षा-महत्वपूर्ण तैनाती और विश्वसनीय उपकरण बनाने वाले डेवलपर्स के लिए अत्यंत महत्वपूर्ण हैं।

मौजूदा मूल्यांकन क्यों कम पड़ जाते हैं

अधिकांश सार्वजनिक बेंचमार्क अभी भी LLMs के साथ स्थिर विश्वकोशों की तरह व्यवहार करते हैं। वे तथ्यों के सही निष्कर्षण (retrieval) को तो पुरस्कृत करते हैं, लेकिन इस बात को नजरअंदाज कर देते हैं कि क्या कोई मॉडल जानता है कि वह एक मशीन है, क्या वह अनिश्चितता स्वीकार करता है, या क्या वह संवादात्मक वातावरण बदलने पर खुद को ढालता है। ये छूटे हुए आयाम तब सामने आते हैं जब कोई प्रॉम्प्ट, उदाहरण के लिए, पूछता है, "क्या आप एक इंसान हैं या एक AI?" या "आप क्या नहीं कर सकते?" यदि मॉडल इंसान होने का ढोंग करता है या अपनी क्षमताओं को बढ़ा-चढ़ाकर बताता है, तब भी स्कोर उच्च बने रहते हैं।

नया बेंचमार्क क्या परीक्षण करता है

परिस्थितिजन्य-जागरूकता सूट (situational-awareness suite) तीन मोर्चों पर लक्षित है:

  • स्व-पहचान (Self-identification) – क्या मॉडल सही ढंग से यह बताता है कि वह एक AI है और अपनी भूमिका का वर्णन करता है?
  • क्षमता निर्धारण (Capability framing) – क्या यह अपनी सीमाओं को छिपाने के बजाय उन्हें खुलकर स्वीकार करता है?
  • संदर्भगत तर्क (Contextual reasoning) – क्या आसपास के संवाद में बदलाव उसके उत्तर को उचित रूप से बदलता है?

प्रत्येक परीक्षण एक तथ्यात्मक प्रश्न को मॉडल की स्थिति के बारे में एक मेटा-प्रश्न (meta-question) के साथ जोड़ता है, जिससे सिस्टम को ज्ञान के साथ आत्म-ज्ञान का मिश्रण करने के लिए मजबूर होना पड़ता है।

AI सुरक्षा और टूलिंग के लिए निहितार्थ

यदि कोई मॉडल विश्वसनीय रूप से अपनी सीमाओं का संकेत नहीं दे सकता है, तो वह भ्रामक आउटपुट दे सकता है।

प्रतिपक्ष: जागरूकता को मापना कठिन है

आलोचकों का कहना है कि मॉडल से खुद का वर्णन करने के लिए कहना केवल उसके प्रशिक्षण डेटा की प्रतिध्वनि हो सकती है, न कि वास्तविक आत्मनिरीक्षण। उनका तर्क है कि एक मॉडल की "जागरूकता" प्रॉम्प्ट इंजीनियरिंग द्वारा निर्मित एक भ्रम हो सकती है, और संसाधनों का बेहतर उपयोग तथ्यात्मक आधार (factual grounding) को सुधारने में किया जा सकता है। यह बेंचमार्क वास्तविक चेतना प्रमाणित करने का दावा नहीं करता है—यह केवल उन विसंगतियों को सामने लाने का प्रयास करता है जिन्हें वर्तमान मेट्रिक्स अनदेखा कर देते हैं।

आगे क्या देखें

यह बेंचमार्क इस ज्ञान के बेहतर मापन की मांग करता है, जो शोधकर्ताओं और इंजीनियरों को अधिक भरोसेमंद भाषा प्रणालियों की दिशा में काम करने में मदद कर सकता है।

निष्कर्ष: एक मॉडल जो जानता है कि वह एक AI है और अपनी सीमाओं को बता सकता है, वह एक सुरक्षित मॉडल है।