Anthropic ने घोषणा की है कि 14 अगस्त से, Claude Code हर टूल कॉल के लिए उपयोगकर्ताओं से “approve” पर क्लिक करने के लिए कहना बंद कर देगा। इसके बजाय, एक AI-संचालित रिस्क क्लासिफायर (risk classifier) यह तय करेगा कि किन कार्यों के लिए मानवीय समीक्षा की आवश्यकता है। 1,053 परीक्षकों के एक अध्ययन से पता चला कि 97% क्लिक प्रॉम्प्ट पढ़े बिना ही किए गए थे, और क्लासिफायर ने 89% हानिकारक कार्यों को पकड़ा, जबकि मनुष्यों ने केवल 13.6% को पकड़ा।
पुराना “click to approve” मॉडल क्यों विफल रहा
पुराने वर्कफ़्लो में मनुष्य को एक बटन पर क्लिक करके प्रत्येक बाहरी कार्य—जैसे कोड पुश करना, फ़ाइलें हटाना—की पुष्टि करने के लिए मजबूर होना पड़ता था। व्यवहार में, उपयोगकर्ताओं ने इस डायलॉग को केवल एक औपचारिकता माना और बिना सोचे-समझे (reflexively) उसे अप्रूव कर दिया। अध्ययन के आंकड़े समस्या को उजागर करते हैं: लगभग हर क्लिक एक रिफ्लेक्स था, और जो कुछ वास्तविक चेतावनियाँ ध्यान आकर्षित कर पाईं, वे भी अधिकांश जोखिम भरे कार्यों को पहचानने में विफल रहीं। जब सुरक्षा कवच (safety gate) गायब हो जाता है, तो सिस्टम की सुरक्षा कमज़ोर हो जाती है।
नया क्लासिफायर क्या करता है
Anthropic का नया विकल्प एक प्रशिक्षित मॉडल है जो प्रत्येक लंबित कार्य का मूल्यांकन करता है और केवल तभी हस्तक्षेप करता है जब ऑपरेशन इन तीन श्रेणियों में से किसी एक में आता है:
- Irreversible (अपरिवर्तनीय) – वे कार्य जिन्हें बदला नहीं जा सकता, जैसे किसी रिपॉजिटरी में force-push करना या डेटाबेस टेबल को ड्रॉप करना।
- Destructive (विनाशकारी) – भारी मात्रा में डिलीट करना या फ़ाइलों को ओवरराइट करना जिससे काम मिट सकता है।
- Outward-facing (बाहरी प्रणालियों से जुड़े) – वे चरण जो कोड या संदेशों को बाहरी सिस्टम के सामने लाते हैं, जैसे कि pull request खोलना या Slack नोटिफिकेशन भेजना।
यदि कोई कार्य इनमें से किसी भी मानदंड को पूरा नहीं करता है, तो मॉडल उसे स्वचालित रूप से आगे बढ़ने देता है, जिससे उन प्रॉम्प्ट्स की बाढ़ समाप्त हो जाती है जिन्हें उपयोगकर्ता अनदेखा कर देते थे।
केवल AI-आधारित दृष्टिकोण की सीमाएं
क्लासिफायर कोई सार्वभौमिक सुरक्षा कवच नहीं है। इसने नुकसान की सामान्य धारणाओं को सीखा है, न कि किसी विशेष कोडबेस की बारीकियों को। “tmp” नाम का फोल्डर अधिकांश प्रोजेक्ट्स में हानिरहित हो सकता है, लेकिन आपके प्रोजेक्ट में इसमें महत्वपूर्ण बिल्ड आर्टिफैक्ट्स (build artifacts) हो सकते हैं; मॉडल संभवतः इसे सुरक्षित मान लेगा। अध्ययन का प्रदर्शन हर प्रोडक्शन एनवायरनमेंट में समान परिणाम देने की गारंटी नहीं देता है। एज केस (Edge cases)—विशेष रूप से वे जिनमें कस्टम टूलिंग या संवेदनशील इंफ्रास्ट्रक्चर शामिल है—के लिए अभी भी स्पष्ट अनुमति सेटिंग्स या अतिरिक्त निगरानी की आवश्यकता है।
उपयोगकर्ताओं को अब क्या करने की आवश्यकता है
- नए अनुमति मोड (permission mode) की समीक्षा करें: Pro, Max, और Team प्लान स्वचालित रूप से क्लासिफायर को अपना लेंगे। यदि आप किसी कस्टम अनुमति वर्कफ़्लो पर निर्भर हैं, तो सत्यापित करें कि यह अभी भी आपकी सुरक्षा नीतियों के अनुरूप है।
- उच्च-जोखिम वाले कार्यों की पहचान करें: अपने CI/CD पाइपलाइनों और डिप्लॉयमेंट स्क्रिप्ट को तीन ट्रिगर श्रेणियों के साथ मैप करें। यदि डिफॉल्ट क्लासिफायर अपर्याप्त है, तो उन स्क्रिप्ट्स को समायोजित करें जो अपरिवर्तनीय या विनाशकारी कदम उठाती हैं, ताकि उनमें स्पष्ट सुरक्षा उपाय शामिल किए जा सकें।
- क्लासिफायर अलर्ट की निगरानी करें: हस्तक्षेपों की आवृत्ति और सटीकता पर नज़र रखें। शुरुआती फीडबैक Anthropic को मॉडल को बेहतर बनाने (fine-tune) में मदद करेगा और आपको विशिष्ट वर्कफ़्लो के लिए मैन्युअल पुष्टिकरण को फिर से सक्षम करने के लिए प्रेरित कर सकता है।
आगे क्या देखने की आवश्यकता है
मानवीय रिफ्लेक्स क्लिक से एक प्रशिक्षित मॉडल पर स्विच करना, कई CI पाइपलाइनों में मौजूद सुरक्षा अंतराल (safety gap) को भरने का एक स्पष्ट प्रयास है।
Source: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
