Anthropic की दुरुपयोग रिपोर्ट से पता चलता है कि दुर्भावनापूर्ण तत्वों ने Claude को स्पैमर्स, कार्यकर्ताओं और मैलवेयर लेखकों के लिए बड़े पैमाने पर उत्पादन करने वाले टूल में बदल दिया है। दिसंबर और अगस्त के बीच, एक समूह ने 4,700 फर्जी डेटिंग-ऐप पहचानों (personas) से 2 मिलियन संदेश उत्पन्न करने, संपर्कों को धोखा देने के लिए एक कार्यकर्ता के लहजे की नकल करने और निगरानी एवं हथियारों के लिए कोड लिखने के लिए इस मॉडल का उपयोग किया।
यह रिपोर्ट क्यों महत्वपूर्ण है
AI-जनरेटेड टेक्स्ट पहले केवल शौकिया लोगों की जिज्ञासा का विषय हुआ करता था। नया डेटा साबित करता है कि यह तकनीक उस दोहराव वाले काम को स्वचालित करने के लिए पर्याप्त सस्ती है, जो कभी बड़े पैमाने पर दुरुपयोग को सीमित करता था। हजारों काल्पनिक पहचान बनाना और उन्हें बनाए रखना, या सुरक्षा उपकरणों द्वारा चिह्नित किए जाने के बाद दुर्भावनापूर्ण कोड को फिर से लिखना, पहले लोगों की टीमों की आवश्यकता होती थी। Claude उन बाधाओं को कुछ ही क्लिक तक सीमित कर देता है, जिससे एक कठिन मैन्युअल काम एक दोहराने योग्य पाइपलाइन में बदल जाता है।
समस्या का पैमाना
- स्पैम: 4,700 पहचानों ने 2 मिलियन अनुकूलित पिच भेजे जिन्हें फ़िल्टर करना कठिन है।
- छद्मवेश (Impersonation): एक कार्यकर्ता की लेखन शैली की नकल की गई, जिससे हमलावरों को कार्यकर्ता के नेटवर्क को विश्वसनीय अपील भेजने में मदद मिली।
- मैलवेयर और निगरानी: उपयोगकर्ताओं ने पहचान से बचने के लिए Claude-जनरेटेड स्क्रिप्ट निर्यात कीं और प्रत्येक ब्लॉक के बाद उन्हें फिर से तैनात किया।
बदलाव अब अलग-थलग बुरे संदेशों से हटकर निरंतर, बड़े पैमाने पर होने वाले ऑपरेशनों की ओर है।
Anthropic की प्रतिक्रिया
Anthropic ने दोषी खातों को ब्लॉक कर दिया और पहचानी गई गतिविधियों को बंद कर दिया। इससे उन उपयोगकर्ताओं का तत्काल प्रवाह तो रुक गया, लेकिन इसने पहले से ही जारी किए गए कोड या बॉट्स को मिटा नहीं दिया। एक बार जब कोई टूल पैक और वितरित कर दिया जाता है, तो प्रदाता का नियंत्रण समाप्त हो जाता है।
यह AI सुरक्षा के बारे में क्या कहता है
यह रिपोर्ट इस बात पर पुनर्विचार करने के लिए मजबूर करती है कि "खतरनाक" अनुरोधों को कैसे संभाला जाए। प्रतिबंधित प्रॉम्प्ट की एक स्थिर सूची अब काम नहीं करती है। Anthropic के आंतरिक नोट्स निम्नलिखित की मांग करते हैं:
- एक बार की जांच के बजाय उपयोग के पैटर्न की निरंतर निगरानी।
- सख्त एक्सेस कंट्रोल जो यह सीमित करें कि कौन बड़े पैमाने पर मॉडल चला सकता है।
- छोटे, स्पष्ट रूप से हानिरहित दिखने वाले अनुरोधों के समूहों को पहचानने के लिए मानव विश्लेषक, जो मिलकर एक बड़ा खतरा पैदा करते हैं।
नेतृत्व के लिए दुविधा
सख्त सुरक्षा उपाय वैध अनुसंधान, रैपिड प्रोटोटाइपिंग और ग्राहक-केंद्रित सुविधाओं को बाधित कर सकते हैं जो लचीले AI आउटपुट पर निर्भर करते हैं। ढीली नीतियां दुरुपयोग को अनियंत्रित रूप से बढ़ने देती हैं, जिससे ब्रांड को नुकसान, नियामक जांच और वास्तविक दुनिया में नुकसान का जोखिम होता है। निर्णय लेने वालों को उत्पादकता लाभ और संभावित दुरुपयोग की लागत के बीच संतुलन बनाना होगा।
भविष्य की ओर देखते हुए
यदि यह प्रवृत्ति जारी रहती है, तो AI सुरक्षा प्रयोगशाला की चिंता से हटकर एक परिचालन संबंधी चिंता बन जाएगी। कंपनियों को समर्पित टीमों की आवश्यकता होगी जो मॉडल के दुरुपयोग को किसी अन्य सुरक्षा घटना की तरह मानें—लॉग की निगरानी करना, नियंत्रणों को अपडेट करना और वास्तविक समय में उल्लंघनों का जवाब देना। Claude दुरुपयोग रिपोर्ट चेतावनी देती है कि मदद करने के लिए डिज़ाइन किए गए उपकरण, बड़े पैमाने पर, वही हथियार बन सकते हैं जिन्हें उन्हें बदलने के लिए बनाया गया था।
