API कॉल करू शकणारे, सिस्टम कमांड्स चालवू शकणारे किंवा फाइल्स हाताळू शकणारे AI एजंट्स आता वापरकर्त्यांच्या वतीने काम करतात. जेव्हा हे एजंट्स एखाद्या विनंतीचा शब्दशः अर्थ लावतात – जसे की "सोन्याचा डोंगर" देणे ज्यामुळे एखादे घर कोसळते – तेव्हा त्याचे परिणाम विनाशकारी, अनैतिक किंवा केवळ निरुपयोगी असू शकतात. संशोधक या त्रुटी भरून काढण्यासाठी Genie coefficient नावाचा एक नवीन प्रस्तावित निकष (metric) आणत आहेत, जो एजंटचे आउटपुट वापरकर्त्याच्या वास्तविक हेतूपासून किती दूर जाते हे मोजतो.

आता अपूर्ण माहिती (underspecification) का महत्त्वाची आहे

केवळ चॅट करणाऱ्या बॉट्सकडून प्रत्यक्ष कृती करणाऱ्या एजंट्सकडे वळल्यामुळे, भाषेच्या मॉडेलची समस्या आता सुरक्षिततेची समस्या बनली आहे. मॉडेल अजूनही प्रवाही मजकूर तयार करू शकते, परंतु एकदा का त्याने API कॉल्स किंवा शेल कमांड्स देण्यास सुरुवात केली की, शब्दशः अर्थ लावल्यामुळे वास्तविक जगामध्ये नुकसान होऊ शकते. मॉडेलमध्ये 'प्रॅग्मॅटिक्स' (pragmatics) म्हणजेच संदर्भ, वाजवी अपेक्षा आणि न सांगितलेले निर्बंध ओळखण्याची क्षमता नसल्यामुळे, ते शब्दांचे पालन करू शकते परंतु त्यामागील उद्देशाचा भंग करू शकते. "जीनी" (genie) चे उदाहरण हे अचूकपणे स्पष्ट करते: एखादी इच्छा अशा प्रकारे पूर्ण करणे जी शब्दशः विनंती पूर्ण करते परंतु इच्छा करणाऱ्याच्या सखोल ध्येयाकडे दुर्लक्ष करते.

Genie coefficient काय मोजतो

हा निकष केवळ एक बेंचमार्क नंबर नाही; तर तो अपेक्षित परिणाम आणि एजंटचे वास्तविक वर्तन यातील अंतर मोजण्याचे एक फ्रेमवर्क आहे. तो चार स्तंभांवर आधारित आहे:

  • क्षेत्र-विशिष्ट बेंचमार्क (Domain-specific benchmarks) जे एजंटला एखाद्या विशिष्ट क्षेत्रात कोणत्या कार्यांचा सामना करावा लागेल त्याचे प्रतिबिंब दर्शवतात.
  • सिम्युलेटेड वास्तववादी वातावरण (Simulated real-world environments) जिथे शॉर्टकट, एज केसेस (edge cases) आणि अनपेक्षित दुष्परिणाम समोर येतात.
  • AI कृतींसाठी 'समजूतदार व्यक्तीचा निकष' (reasonable-person standard), जो एखाद्या परिस्थितीत एक विवेकी व्यक्ती काय करेल याच्या कायदेशीर संकल्पनेतून घेतलेला आहे.
  • मॉडेल आणि सॉफ्टवेअर हार्नेसचे संयुक्त मूल्यांकन (Joint evaluation of model and software harness), हे मान्य करून की सभोवतालच्या कोडमधील त्रुटी मॉडेलच्या त्रुटींइतक्याच धोकादायक असू शकतात.

या घटकांचा वापर केल्यामुळे डेव्हलपर्स अशा प्रकारे Genie coefficient नियुक्त करू शकतात जो अर्थपूर्ण अचूकता (semantic correctness) आणि व्यावहारिक सुरक्षा (pragmatic safety) या दोन्ही गोष्टींचे मोजमाप करतो.

डेव्हलपर्स आणि वापरकर्त्यांसाठी असलेले धोके

उच्च (high) coefficient सूचित करतो की एजंट आज्ञेच्या शब्दांचे पालन करेल परंतु त्याच्या भावनेचे उल्लंघन करेल, ज्यामुळे वापरकर्त्यांना आर्थिक नुकसान, डेटा चोरी किंवा नियामक दंड सहन करावा लागू शकतो. कमी (low) coefficient दर्शवतो की सिस्टम सूचित निर्बंधांचा आदर करते, ज्यामुळे वित्त (finance), आरोग्यसेवा (healthcare) किंवा महत्त्वपूर्ण पायाभूत सुविधा (critical infrastructure) यांसारख्या उच्च-जोखीम असलेल्या क्षेत्रांमध्ये उपयोजन अधिक व्यवहार्य होते.

हा निकष उत्पादन टीम्सना एक डायग्नोस्टिक टूल देखील प्रदान करतो: ते सूचना-स्तरीय त्रुटी (मॉडेलने प्रॉम्प्ट चुकीचा समजला) आणि तांत्रिक चुकीचे वर्तन (सभोवतालच्या कोडने API कॉल चुकीच्या मार्गाने पाठवला) यांमधील फरक करू शकतात. डीबगिंग, अनुपालन अहवाल (compliance reporting) आणि खर्च वाटपासाठी हा फरक महत्त्वाचा आहे.

प्रतिवाद आणि उघड्या प्रश्नांवर

टीकाकारांचे म्हणणे आहे की हेतूचे प्रमाणीकरण करणे हे व्यक्तिनिष्ठ (subjective) आहे आणि यामुळे विकास चक्राचा वेग मंदावू शकतो. प्रत्येक क्षेत्रासाठी "समजूतदार व्यक्ती" चा बेसलाइन तयार करण्यासाठी व्यापक कायदेशीर आणि नैतिक तज्ञांची आवश्यकता असू शकते, ज्यामुळे मॉडेल मूल्यांकनाचा खर्च वाढू शकतो. तसेच, टीम्स या coefficient ला सखोल सिस्टम रिडिझाइनसाठी मार्गदर्शक मानण्याऐवजी केवळ एक 'चेकबॉक्स' म्हणून घेण्याचा धोका देखील आहे.

पुढे काय पाहावे

पुढील टप्प्यांमध्ये Genie coefficient ला विद्यमान AI टेस्टिंग पाइपलाइनमध्ये समाविष्ट करणे आणि त्याला फीड करणाऱ्या बेंचमार्क सूट्सचे प्रमाणीकरण करणे समाविष्ट आहे. जर उद्योग गटांनी याला सुरक्षिततेचा बेसलाइन म्हणून स्वीकारले, तर एजंट ग्राहकांपर्यंत पोहोचण्यापूर्वी प्रमाणन कार्यक्रमांसाठी (certification programs) एका ठराविक threshold coefficient ची आवश्यकता असू शकते. संशोधक बहुधा 'reasonable-person' ची व्याख्या अधिक स्पष्ट करतील आणि विश्वसनीय मोजमापासाठी आवश्यक असलेली सिम्युलेटेड वातावरणे तयार करण्याच्या स्वयंचलित पद्धती शोधतील.

थोडक्यात सांगायचे तर: जसे AI एजंट्स मजकुराकडून कृतीकडे वळत आहेत, तसे वापरकर्ते केवळ काय म्हणतात यापेक्षा त्यांना खरोखर काय हवे आहे हे ते किती चांगल्या प्रकारे समजून घेतात, याचे मोजमाप करणे आवश्यक झाले आहे. Genie coefficient हे त्या मोजमापाला प्रत्यक्षात आणण्यासाठी एक ठोस आणि सतत विकसित होणारा मार्ग प्रदान करते.