Anthropic ने घोषणा केली आहे की, १४ ऑगस्टपासून, Claude Code प्रत्येक टूल कॉलसाठी वापरकर्त्यांना “approve” वर क्लिक करण्यास सांगणे थांबवेल. त्याऐवजी, एक AI-आधारित रिस्क क्लासिफायर (risk classifier) कोणत्या कृतींसाठी मानवी पुनरावलोकनाची (human review) आवश्यकता आहे हे ठरवेल. १,०५३ परीक्षकांच्या अभ्यासातून असे दिसून आले की, ९७% क्लिक्स प्रॉम्प्ट न वाचता केले गेले होते, आणि क्लासिफायरने ८९% हानिकारक कृती पकडल्या, तर मानवांनी केवळ १३.६% कृती पकडल्या.

जुने “click to approve” मॉडेल अपयशी का ठरले

जुन्या वर्कफ्लोमध्ये प्रत्येक बाह्य कृती—कोड पुश करणे, फाइल्स डिलीट करणे—पुष्टी करण्यासाठी मानवाला बटण क्लिक करणे बंधनकारक होते. प्रत्यक्षात, वापरकर्त्यांनी या संवादला (dialog) केवळ एक औपचारिकता मानले आणि प्रतिक्षिप्तपणे (reflexively) मंजुरी दिली. अभ्यासातील आकडेवारी ही समस्या उघड करते: जवळजवळ प्रत्येक क्लिक हे केवळ एक प्रतिक्षिप्त वर्तन होते, आणि ज्या काही खऱ्या चेतावणींकडे लक्ष दिले गेले, त्यामध्ये बहुतेक जोखमीच्या क्रिया सुटल्या. जेव्हा सुरक्षा कवच (safety gate) नाहीसे होते, तेव्हा सिस्टमची सुरक्षा धोक्यात येते.

नवीन क्लासिफायर काय करतो

Anthropic ने आणलेला पर्याय हा एक प्रशिक्षित मॉडेल आहे जो प्रत्येक प्रलंबित कृतीचे मूल्यमापन करतो आणि केवळ तेव्हाच अडथळा आणतो जेव्हा ती क्रिया खालील तीनपैकी एका श्रेणीत येते:

  • Irreversible (अपरिवर्तनीय) – ज्या कृती मागे घेता येत नाहीत, जसे की रिपॉझिटरीमध्ये force-push करणे किंवा डेटाबेस टेबल ड्रॉप करणे.
  • Destructive (विनाशकारी) – मोठ्या प्रमाणात फाइल्स डिलीट करणे किंवा फाइल्स ओव्हरराईट करणे ज्यामुळे काम पुसले जाऊ शकते.
  • Outward-facing (बाह्य-संबंधित) – अशा पायऱ्या ज्या कोड किंवा संदेश बाह्य सिस्टम्सना उघडे पाडतात, जसे की pull request उघडणे किंवा Slack नोटिफिकेशन पाठवणे.

जर एखादी कृती यापैकी कोणत्याही निकषात बसत नसेल, तर मॉडेल तिला आपोआप पुढे जाऊ देते, ज्यामुळे वापरकर्त्यांनी दुर्लक्षित केलेल्या प्रॉम्प्ट्सचा पाऊस थांबतो.

केवळ AI दृष्टिकोनाच्या मर्यादा

क्लासिफायर हे सार्वत्रिक सुरक्षा कवच नाही. त्याने हानिकारक गोष्टींच्या सामान्य संकल्पना शिकल्या आहेत, कोणत्याही कोडबेसचे तपशील नाही. “tmp” नावाचे फोल्डर बहुतेक प्रकल्पांमध्ये निरुपद्रवी असू शकते, परंतु तुमच्या प्रकल्पात त्यात महत्त्वाचे build artifacts असू शकतात; मॉडेल बहुदा त्याला सुरक्षित मानेल. अभ्यासातील कामगिरी प्रत्येक प्रोडक्शन एन्व्हायरनमेंटमध्ये (production environment) समान निकाल देण्याची हमी देत नाही. एज केसेस (Edge cases)—विशेषतः ज्यामध्ये कस्टम टूलिंग किंवा संवेदनशील इन्फ्रास्ट्रक्चरचा समावेश आहे—त्यासाठी अजूनही स्पष्ट परवानगी सेटिंग्ज किंवा अतिरिक्त देखरेखीची आवश्यकता आहे.

वापरकर्त्यांनी आता काय करणे आवश्यक आहे

  • नवीन परवानगी मोड तपासा: Pro, Max आणि Team प्लॅन्स आपोआप क्लासिफायरचा अवलंब करतील. जर तुम्ही कस्टम परवानगी वर्कफ्लोवर अवलंबून असाल, तर तो तुमच्या सुरक्षा धोरणांशी सुसंगत आहे की नाही याची खात्री करा.
  • उच्च-जोखीम असलेल्या कृती ओळखा: तुमच्या CI/CD पाइपलाइन्स आणि डिप्लॉयमेंट स्क्रिप्ट्सचे तीन ट्रिगर श्रेणींमध्ये वर्गीकरण करा. जर डिफॉल्ट क्लासिफायर अपुरा असेल, तर अपरिवर्तनीय किंवा विनाशकारी पावले उचलणाऱ्या स्क्रिप्ट्समध्ये स्पष्ट सुरक्षा उपाय समाविष्ट करण्यासाठी त्यामध्ये बदल करा.
  • क्लासिफायर अलर्ट्सवर लक्ष ठेवा: अडथळ्यांची वारंवारता आणि अचूकता ट्रॅक करा. सुरुवातीच्या फीडबॅकमुळे Anthropic ला मॉडेल अधिक अचूक (fine-tune) करण्यास मदत होईल आणि तुम्हाला विशिष्ट वर्कफ्लोसाठी मॅन्युअल कन्फर्मेशन पुन्हा सुरू करण्यास प्रवृत्त करू शकते.

पुढे काय पाहावे

मानवी प्रतिक्षिप्त क्लिक्सकडून प्रशिक्षित मॉडेलकडे वळणे हा अनेक CI पाइपलाइन्समध्ये असलेल्या सुरक्षिततेच्या त्रुटीला दूर करण्याचा एक स्पष्ट प्रयत्न आहे.

Source: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg