Anthropic और OpenAI ने प्रत्येक ने एक नया रिसर्च ट्रैक खोला है जो जांचे-परखे (vetted) सुरक्षा टीमों को अधिकांश सुरक्षा फिल्टरों (safety filters) से मुक्त AI मॉडलों के साथ काम करने की अनुमति देता है। Anthropic का “Cyber Verification Program” और OpenAI का “Trusted Access for Cyber” स्वीकृत शोधकर्ताओं को शक्तिशाली लैंग्वेज मॉडलों तक सीधी पहुंच प्रदान करते हैं, जो बिना किसी प्रतिबंध के कोड, प्रॉम्प्ट और निर्देश उत्पन्न कर सकते हैं। यह कदम महत्वपूर्ण है क्योंकि यह AI सप्लाई चेन में एक स्पष्ट विभाजन पैदा करता है: कुछ चुनिंदा इनसाइडर्स कमजोर संस्करणों की जांच कर सकते हैं, जबकि बाकी दुनिया मजबूत सुरक्षा घेरों (guardrails) के पीछे रहती है।

ये प्रोग्राम क्यों शुरू किए गए

दोनों कंपनियों का कहना है कि इन पहलों का उद्देश्य उन कमजोरियों (vulnerabilities) की खोज में तेजी लाना है जिनका उपयोग उनकी सेवाओं के खिलाफ हथियार के रूप में किया जा सकता है। विशेषज्ञों के एक नियंत्रित समूह को कम प्रतिबंधों वाला एक 'सैंडबॉक्स' (sandbox) देकर, वे उम्मीद करते हैं कि हमलावर तत्वों (malicious actors) के उन्हें खोजने से पहले ही अटैक वेक्टर्स का पता लगाया जा सके। यह दृष्टिकोण पारंपरिक सॉफ्टवेयर सुरक्षा के समान है, जहाँ डेवलपर्स एक चुनिंदा दर्शकों के लिए “bug-bounty” बिल्ड जारी करते हैं।

रक्षकों के लिए नया जोखिम विश्लेषण

इसका दूसरा पहलू एक दो-स्तरीय एक्सेस मॉडल है जो हर संगठन को “शोधकर्ता” (researcher) और “हैकर” (hacker) के बीच एक रेखा खींचने के लिए मजबूर करता है। वह रेखा अब एक संभावित अटैक सरफेस (attack surface) बन जाती है। यदि कोई हमलावर क्रेडेंशियल्स चुरा लेता है, किसी इनसाइडर की पहुंच का फायदा उठाता है, या जांच प्रक्रिया (vetting process) को चकमा दे देता है, तो वे उन सुरक्षा घेरों (guardrails) को पार कर सकते हैं जो अधिकांश उपयोगकर्ताओं की रक्षा करते हैं। एक बार अंदर जाने के बाद, बिना प्रतिबंध वाले मॉडल से निम्नलिखित कार्य कराए जा सकते हैं:

  • ऐसी फिशिंग स्क्रिप्ट बनाना जो पहचान से बच सकें
  • विस्तृत कोड स्निपेट्स के साथ ज़ीरो-डे एक्सप्लॉइट्स (zero-day exploits) तैयार करना
  • विशिष्ट लक्ष्यों के लिए तैयार किए गए विश्वसनीय सोशल-इंजीनियरिंग प्रॉम्प्ट बनाना

सुरक्षा टीमों को, जिन्होंने इस धारणा पर बचाव तंत्र बनाया था कि AI आउटपुट हमेशा फ़िल्टर किए जाते हैं, अब उस आधार पर पुनर्विचार करना होगा।

रक्षक कैसे प्रतिक्रिया दे सकते हैं

  • इन प्रोग्रामों को एक खतरे के रूप में (threat vector) देखें। यह मानकर चलें कि विरोधी जांच प्रक्रिया (vetting pipeline) में घुसपैठ करने की कोशिश करेंगे और AI प्लेटफॉर्म पर असामान्य लॉगिन पैटर्न की निगरानी करें।
  • क्लाउड से परे डिटेक्शन का विस्तार करें। आउटबाउंड ट्रैफिक में AI-जनरेटेड कोड या टेक्स्ट की तलाश करें, विशेष रूप से विशेषाधिकार प्राप्त (privileged) खातों से।
  • पॉलिसी नियंत्रणों को कड़ाई से लागू करें। बाहरी AI सेवाओं के किसी भी आंतरिक उपयोग के लिए सख्त “least-privilege” नियम लागू करें, और उन वातावरणों को अलग (segment) करें जहाँ समझौता किए गए क्रेडेंशियल के माध्यम से पहुँचा जा सकता है।
  • वेंडर्स के साथ सहयोग करें। एक्सेस मानदंडों में बदलाव या खोजे गए दुरुपयोग के बारे में अलर्ट प्राप्त करने के लिए Anthropic और OpenAI के सुरक्षा संपर्क (security liaison) चैनलों के साथ जुड़े रहें।

दूसरा पक्ष

समर्थकों का तर्क है कि गहन जांच (deep probing) के लिए एक सुरक्षित चैनल के बिना, कमजोरियां तब तक छिपी रहेंगी जब तक कि उनका वास्तविक दुनिया में फायदा न उठाया जाए। इसलिए, ये प्रोग्राम खामियों को जल्दी सामने लाकर समग्र अटैक सरफेस को कम कर सकते हैं। इसके बदले में जोखिम यह है कि एक “कम-सुरक्षित” स्तर अवसरवादी दुरुपयोग को निमंत्रण देता है।

किन बातों पर नज़र रखें

  • दोनों कंपनियों की जांच प्रक्रिया (vetting process) में अपडेट
  • इन प्रोग्रामों से उत्पन्न होने वाले दुरुपयोग की रिपोर्ट
  • AI से संबंधित अटैक सरफेस को सूचीबद्ध करने के तरीकों में उद्योग-व्यापी बदलाव

निष्कर्ष: नए रिसर्च ट्रैक सुरक्षा शोधकर्ताओं को शक्तिशाली उपकरण देते हैं, लेकिन वे वही उपकरण किसी भी ऐसे व्यक्ति को भी सौंप देते हैं जो सुरक्षा घेरे को पार कर सके। रक्षात्मक टीमों को इन प्रोग्रामों को अंतर्दृष्टि (insight) के स्रोत और हमले के एक नए रास्ते, दोनों के रूप में देखना चाहिए।