Anthropic نے اعلان کیا ہے کہ 14 اگست سے، Claude Code ہر ٹول کال کے لیے صارفین سے "approve" پر کلک کرنے کا مطالبہ کرنا بند کر دے گا۔ اس کے بجائے، ایک AI پر مبنی رسک کلاسیفائر (risk classifier) یہ فیصلہ کرے گا کہ کن اقدامات کے لیے انسانی نظر ثانی کی ضرورت ہے۔ 1,053 ٹیسٹرز پر کیے گئے ایک مطالعے سے پتہ چلا ہے کہ 97% کلکس پرامپٹ پڑھے بغیر کیے گئے، اور کلاسیفائر نے 89% نقصان دہ اقدامات کو پکڑ لیا جبکہ انسانوں نے صرف 13.6% کو پکڑا۔
پرانا "کلک ٹو اپروو" ماڈل کیوں ناکام رہا
پرانے ورک فلو میں انسان کو ہر بیرونی عمل—جیسے کوڈ پش کرنا یا فائلیں ڈیلیٹ کرنا—کو ایک بٹن پر کلک کر کے کنفرم کرنا پڑتا تھا۔ عملی طور پر، صارفین اس ڈائیلاگ کو محض ایک رسمی کارروائی سمجھتے تھے اور لاشعوری طور پر اسے منظور کر لیتے تھے۔ مطالعے کے اعداد و شمار اس مسئلے کو بے نقاب کرتے ہیں: تقریباً ہر کلک ایک ردعمل (reflex) تھا، اور چند حقیقی انتباہات جن پر توجہ دی گئی، وہ زیادہ خطرناک آپریشنز کو پکڑنے میں ناکام رہے۔ جب حفاظتی گیٹ ختم ہو جاتا ہے، تو سسٹم کی سیکیورٹی کمزور ہو جاتی ہے۔
نیا کلاسیفائر کیا کرتا ہے
Anthropic کا نیا متبادل ایک تربیت یافتہ ماڈل ہے جو ہر زیرِ التواء عمل کا جائزہ لیتا ہے اور صرف اس وقت مداخلت کرتا ہے جب آپریشن درج ذیل تین اقسام میں سے کسی ایک میں آتا ہو:
- Irreversible (ناقابلِ واپسی) – وہ اقدامات جنہیں واپس نہیں لیا جا سکتا، جیسے کسی ریپوزٹری میں force-push کرنا یا ڈیٹا بیس ٹیبل کو ڈراپ کرنا۔
- Destructive (تباہ کن) – بڑی تعداد میں ڈیلیٹ کرنا یا فائلوں کو اوور رائٹ کرنا جس سے کام مٹ سکتا ہے۔
- Outward-facing (بیرونی نظام سے منسلک) – وہ اقدامات جو کوڈ یا پیغامات کو بیرونی سسٹمز کے سامنے لاتے ہیں، جیسے کہ پرال ریکویسٹ (pull request) کھولنا یا Slack نوٹیفکیشن بھیجنا۔
اگر کوئی عمل ان میں سے کسی بھی معیار پر پورا نہیں اترتا، تو ماڈل اسے خود بخود آگے بڑھنے دیتا ہے، جس سے ان پرامپٹس کی بھرمار ختم ہو جاتی ہے جنہیں صارفین نظر انداز کر دیتے تھے۔
صرف AI پر مبنی طریقہ کار کی حدود
کلاسیفائر کوئی عالمگیر حفاظتی تدبیر نہیں ہے۔ اس نے نقصان کے عمومی تصورات سیکھے ہیں، کسی مخصوص کوڈ بیس (codebase) کی تفصیلات نہیں۔ "tmp" نامی فولڈر زیادہ تر پروجیکٹس میں بے ضرر ہو سکتا ہے لیکن آپ کے پروجیکٹ میں اس میں اہم بلڈ آرٹفیکٹس (build artifacts) ہو سکتے ہیں؛ ماڈل غالباً اسے محفوظ سمجھے گا۔ مطالعے کی کارکردگی ہر پروڈکشن ماحول میں یکساں نتائج کی ضمانت نہیں دیتی۔ ایڈج کیسز (Edge cases)—خاص طور پر وہ جن میں کسٹم ٹولنگ یا حساس انفراسٹرکچر شامل ہو—اب بھی واضح اجازت کی ترتیبات یا اضافی نگرانی کے متقاضی ہیں۔
صارفین کو اب کیا کرنے کی ضرورت ہے
- نئے پرمیشن موڈ کا جائزہ لیں: Pro، Max، اور Team پلانز خود بخود کلاسیفائر کو اپنا لیں گے۔ اگر آپ کسی کسٹم پرمیشن ورک فلو پر انحصار کرتے ہیں، تو تصدیق کریں کہ آیا یہ اب بھی آپ کی سیکیورٹی پالیسیوں کے مطابق ہے۔
- زیادہ خطرے والے اقدامات کی نشاندہی کریں: اپنے CI/CD پائپ لائنز اور ڈیپلائمنٹ اسکرپٹس کا ان تین ٹرگر کیٹیگریز کے ساتھ نقشہ بنائیں۔ اگر ڈیفالٹ کلاسیفائر ناکافی ہو، تو ان اسکرپٹس میں واضح حفاظتی اقدامات شامل کرنے کے لیے تبدیلی کریں جو ناقابلِ واپسی یا تباہ کن اقدامات کرتے ہیں۔
- کلاسیفائر الرٹس کی نگرانی کریں: مداخلتوں کی تعدد اور درستگی پر نظر رکھیں۔ ابتدائی فیڈ بیک Anthropic کو ماڈل کو بہتر بنانے میں مدد دے گا اور ہو سکتا ہے کہ یہ آپ کو مخصوص ورک فلو کے لیے دستی تصدیق (manual confirmations) کو دوبارہ فعال کرنے پر مائل کرے۔
آگے کیا نظر آئے گا
انسانی ردعمل والے کلکس سے ایک تربیت یافتہ ماڈل کی طرف منتقلی، ان حفاظتی خامیوں کو دور کرنے کی ایک واضح کوشش ہے جو بہت سے CI پائپ لائنز میں موجود تھیں۔
ماخذ: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
