कल्पना करा की तुम्ही एका वित्तीय सेवा कंपनीतील वरिष्ठ ॲप्लिकेशन सिक्युरिटी इंजिनिअर आहात. तुम्ही अंतर्गत विकसित केलेल्या ऑथेंटिकेशन कोडचा एक तुकडा (snippet) एका प्रगत AI मॉडेलमध्ये टाकता आणि त्यातील लॉजिकमधील त्रुटी (logic flaws) शोधायला सांगता. विश्लेषणाऐवजी, तुम्हाला उपदेश मिळतो. तुम्ही या माहितीचा वापर 'सिस्टमचा गैरफायदा घेण्यासाठी' (exploit a system) करू शकता या कारणास्तव मॉडेल नकार देते. तुम्ही गुन्हेगार नाही आहात. तुम्ही गुन्हेगारांना रोखण्यासाठी नियुक्त केलेली व्यक्ती आहात. तरीही, गार्डरेल (guardrail) या दोन्ही भूमिकांमध्ये फरक करू शकत नाही.
ही परिस्थिती आता नियमित होत चालली आहे. दुष्ट हेतूने होणारा गैरवापर रोखण्यासाठी जेव्हा मोठे AI लॅब्स सुरक्षा प्रोटोकॉल कडक करत आहेत, तेव्हा त्यांचा थेट संघर्ष कायदेशीर सायबर सुरक्षा व्यावसायिकांच्या कार्यप्रणालीशी (workflows) होत आहे. याचा परिणाम एका वाढत्या विरोधाभासात होत आहे: सॉफ्टवेअर इंजिनिअरिंगसाठी 'फोर्स मल्टिप्लायर' (force multipliers) म्हणून ज्या साधनांचा प्रचार केला जातो, तीच साधने महत्त्वपूर्ण पायाभूत सुविधांचे रक्षण करणाऱ्या तज्ञांपासून रोखली जात आहेत.
सुरक्षा (Safety) आणि संरक्षण (Security) मधील घर्षण
प्रमुख AI डेव्हलपर्सनी सायबर सुरक्षा समुदायाकडे पूर्णपणे दुर्लक्ष केलेले नाही. OpenAI Trusted Access for Cyber नावाचा एक कार्यक्रम राबवते. Anthropic Cyber Verification Program चालवते. या दोन्ही कार्यक्रमांची रचना तपासलेल्या (vetted) वापरकर्त्यांना काही नकार देण्याच्या यंत्रणांना (refusal mechanisms) बगल देण्यासाठी केली आहे, जेणेकरून ते कायदेशीर संशोधन करू शकतील. सिद्धांतानुसार, हे प्रवेशद्वार चांगल्या आणि वाईट घटकांना वेगळे करते.
प्रत्यक्षात, अनेक ऑफेन्सिव्ह सिक्युरिटी संशोधक आणि नेटवर्क डिफेंडर्सना हे केवळ नोकरशाहीतील अडथळ्यांसारखे (bureaucratic speed bumps) वाटतात. पडताळणी प्रक्रिया अपारदर्शक असू शकते. मंजुरीसाठी लागणारा वेळ स्पष्ट नसतो. स्वीकारले गेल्यानंतरही, संशोधक असे सांगतात की उच्च दर्जाचा प्रवेश (elevated access) नेहमीच विविध मॉडेल आवृत्त्यांमध्ये किंवा संभाषणांच्या थ्रेड्समध्ये विश्वसनीयपणे काम करत नाही. सक्रियपणे होणाऱ्या हल्ल्यांपासून वाचण्यासाठी त्रुटी (vulnerabilities) दूर करण्यासाठी धावपळ करणाऱ्या टीमसाठी, हा अडथळा महत्त्वाचा ठरतो.
वॉशिंग्टन आणि सिलिकॉन व्हॅलीमधील तणाव तेव्हा एका महत्त्वाच्या वळणावर पोहोचला, जेव्हा अमेरिकन सरकारने Anthropic च्या Mythos आणि Fable मॉडेल्सवर निर्यातीवर निर्बंध (export controls) लादले. सायबर हल्ले सुलभ करण्यासाठी व्यक्तींनी मॉडेल्सच्या सुरक्षा गार्डरेलला बगल दिली होती, अशा अहवालांनंतर हे निर्बंध लादण्यात आले. नियामक संस्थांनी या प्रणालींना अद्वितीय धोकादायक निर्यात वस्तू म्हणून मानण्यासाठी जलद पावले उचलली. हे निर्बंध त्यानंतर उठवण्यात आले किंवा बदलण्यात आले, परंतु या घटनेने एक स्पष्ट संकेत दिला: उच्च क्षमता असलेले AI मॉडेल्स हे सामान्य तांत्रिक साधनांऐवजी संभाव्य 'प्रलय घडवणारी उपकरणे' (doomsday devices) म्हणून पाहिले जात आहेत. ज्या संरक्षकांसाठी (defenders) ही साधने आवश्यक आहेत, त्यांच्यासाठी या दृष्टिकोनाचा अर्थ अधिक कडक तपासणी, संथ प्रवेश आणि 'सुरक्षा संशोधन म्हणजे केवळ दुसऱ्या नावाने केले जाणारे हॅकिंग आहे' अशी संशयित भावना असा आहे.
संरक्षण (Defense) आणि हल्ला (Offense) एकमेकांपासून वेगळे का असू शकत नाहीत
या संघर्षाचे मूळ प्रशासकीय नसून तांत्रिक आहे. एखाद्या नेटवर्कचे संरक्षण करण्यासाठी आवश्यक असलेली क्षमता आणि त्यावर हल्ला करण्यासाठी आवश्यक असलेली क्षमता जवळजवळ सारखीच असते.
NCC Group चे मुख्य शास्त्रज्ञ ख्रिस अॅनली (Chris Anley) एक साधे उदाहरण देतात: AI हे एका हातोड्यासारखे आहे. तुम्ही त्याचा वापर घर बांधण्यासाठी किंवा खिडकी फोडण्यासाठी करू शकता. त्या साधनाला स्वतःला यातील फरक माहित नसतो. सायबर सुरक्षेत, ही दुहेरी भूमिका टाळता येत नाही. जेव्हा एखादा व्यावसायिक मॉडेलला "हा कोड दुरुस्त करा" असे सांगतो, तेव्हा ती विनंती एक बचावात्मक कृती (defensive action) म्हणून ट्रिगर होते. परंतु त्रुटी सुधारण्याची प्रक्रिया—असुरक्षित फंक्शन्स ओळखणे, अविश्वसनीय इनपुटचा मागोवा घेणे, एक्झिक्यूशन फ्लो मॅप करणे—यामुळे ती त्रुटी (vulnerability) कशी सक्रिय केली जाऊ शकते, हे अपरिहार्यपणे समोर येते. ती स्पष्टीकरणे गैरफायदा घेण्यासाठी (exploitation) एक मार्गदर्शक नकाशा (roadmap) म्हणून काम करतात.
AI सुरक्षा टीम्स अनेकदा मॉडेल्सना अशा कोणत्याही प्रॉम्प्टला नकार देण्यासाठी प्रशिक्षित करतात ज्यामध्ये गैरफायदा घेण्याचे संकेत मिळतात, त्यामुळे ही यंत्रणा अनेकदा अति-सुधारणा (overcorrect) करते. युजर इनपुट कसे स्वच्छ (sanitize) करावे हे विचारणाऱ्या संशोधकाला उत्तर मिळते. एखादा संशोधक जर विचारत असेल की एखादा...
