Anthropic ঘোষণা করেছে যে, ১৪ আগস্ট থেকে Claude Code প্রতিটি টুল কলের জন্য ব্যবহারকারীদের “approve” বা অনুমোদন করার জন্য ক্লিক করতে বলবে না। পরিবর্তে, একটি AI-চালিত রিস্ক ক্লাসিফায়ার (risk classifier) সিদ্ধান্ত নেবে কোন পদক্ষেপগুলোর জন্য মানুষের পর্যালোচনার প্রয়োজন। ১,০৫৩ জন পরীক্ষকের ওপর করা একটি গবেষণায় দেখা গেছে যে, ৯৭% ক্লিকই প্রম্পট না পড়েই করা হয়েছিল, এবং ক্লাসিফায়ারটি ৮৯% ক্ষতিকারক পদক্ষেপ শনাক্ত করতে সক্ষম হয়েছে যেখানে মানুষ মাত্র ১৩.৬% শনাক্ত করতে পেরেছে।
কেন পুরনো “click to approve” মডেলটি ব্যর্থ হয়েছিল
পুরনো ওয়ার্কফ্লোতে প্রতিটি বাহ্যিক পদক্ষেপ—যেমন কোড পুশ করা বা ফাইল মুছে ফেলা—নিশ্চিত করার জন্য একজন মানুষকে একটি বাটনে ক্লিক করতে হতো। বাস্তবে, ব্যবহারকারীরা এই ডায়ালগটিকে একটি আনুষ্ঠানিকতা হিসেবে দেখতেন এবং অবচেতনভাবে (reflexively) অনুমোদন করে দিতেন। গবেষণার তথ্যগুলো সমস্যাটি প্রকাশ করে দেয়: প্রায় প্রতিটি ক্লিকই ছিল একটি রিফ্লেক্স বা অবচেতন প্রতিক্রিয়া, এবং যে কয়েকটি প্রকৃত সতর্কতা মানুষের নজরে এসেছিল, সেগুলো বেশিরভাগ ঝুঁকিপূর্ণ অপারেশন শনাক্ত করতে ব্যর্থ হয়েছে। যখন একটি নিরাপত্তা গেট বা সুরক্ষা ব্যবস্থা অদৃশ্য হয়ে যায়, তখন সিস্টেমের নিরাপত্তা ক্ষুণ্ণ হয়।
নতুন ক্লাসিফায়ারটি কী করে
Anthropic-এর এই বিকল্পটি হলো একটি প্রশিক্ষিত মডেল যা প্রতিটি পেন্ডিং অ্যাকশন বা অপেক্ষমান পদক্ষেপ মূল্যায়ন করে এবং কেবল তখনই বাধা দেয় যখন অপারেশনটি নিচের তিনটি ক্যাটাগরির যেকোনো একটির অন্তর্ভুক্ত হয়:
- Irreversible (অপরিবর্তনীয়) – এমন পদক্ষেপ যা আর আগের অবস্থায় ফিরিয়ে নেওয়া সম্ভব নয়, যেমন কোনো রিপোজিটরিতে force-push করা বা একটি ডাটাবেস টেবিল ড্রপ করা।
- Destructive (ধ্বংসাত্মক) – বড় আকারে ফাইল মুছে ফেলা বা ফাইল ওভাররাইট করা যা কাজ মুছে ফেলতে পারে।
- Outward-facing (বাহ্যিকমুখী) – এমন পদক্ষেপ যা কোড বা মেসেজকে বাহ্যিক সিস্টেমের কাছে প্রকাশ করে, যেমন একটি pull request খোলা বা Slack নোটিফিকেশন পাঠানো।
যদি কোনো পদক্ষেপ এই মানদণ্ডগুলোর কোনোটির সাথেই না মেলে, তবে মডেলটি এটিকে স্বয়ংক্রিয়ভাবে চলতে দেয়, যার ফলে ব্যবহারকারীরা যে অসংখ্য প্রম্পট উপেক্ষা করতেন তার অবসান ঘটে।
শুধুমাত্র AI-নির্ভর পদ্ধতির সীমাবদ্ধতা
এই ক্লাসিফায়ারটি কোনো সর্বজনীন সুরক্ষা কবচ নয়। এটি ক্ষতির সাধারণ ধারণাগুলো শিখেছে, কোনো নির্দিষ্ট কোডবেসের (codebase) খুঁটিনাটি বিষয় নয়। “tmp” নামের একটি ফোল্ডার বেশিরভাগ প্রজেক্টে ক্ষতিকারক নাও হতে পারে, কিন্তু আপনার প্রজেক্টে এতে গুরুত্বপূর্ণ বিল্ড আর্টিফ্যাক্ট (build artifacts) থাকতে পারে; মডেলটি সম্ভবত এটিকে নিরাপদ বলে গণ্য করবে। গবেষণার ফলাফল প্রতিটি প্রোডাকশন এনভায়রনমেন্টে একইভাবে কাজ করার গ্যারান্টি দেয় না। এজ কেসগুলো (Edge cases)—বিশেষ করে যেগুলোর সাথে কাস্টম টুলিং বা সংবেদনশীল ইনফ্রাস্ট্রাকচার জড়িত—সেগুলোর জন্য এখনও স্পষ্ট অনুমতির সেটিংস বা অতিরিক্ত পর্যবেক্ষণের প্রয়োজন।
ব্যবহারকারীদের এখন যা করা প্রয়োজন
- নতুন পারমিশন মোড পর্যালোচনা করুন: Pro, Max এবং Team প্ল্যানগুলো স্বয়ংক্রিয়ভাবে এই ক্লাসিফায়ার গ্রহণ করবে। আপনি যদি কোনো কাস্টম পারমিশন ওয়ার্কফ্লোর ওপর নির্ভর করেন, তবে সেটি আপনার নিরাপত্তা নীতির সাথে সামঞ্জস্যপূর্ণ কি না তা যাচাই করে নিন।
- উচ্চ-ঝুঁকিপূর্ণ পদক্ষেপগুলো শনাক্ত করুন: আপনার CI/CD পাইপলাইন এবং ডিপ্লয়মেন্ট স্ক্রিপ্টগুলোকে তিনটি ট্রিগার ক্যাটাগরির সাথে মিলিয়ে নিন। ডিফল্ট ক্লাসিফায়ার যথেষ্ট না হলে, যেসব স্ক্রিপ্ট অপরিবর্তনীয় বা ধ্বংসাত্মক পদক্ষেপ নেয়, সেগুলোতে স্পষ্ট সুরক্ষা ব্যবস্থা অন্তর্ভুক্ত করার জন্য স্ক্রিপ্টগুলো সমন্বয় করুন।
- ক্লাসিফায়ার অ্যালার্টগুলো পর্যবেক্ষণ করুন: ইন্টারাপশন বা বাধার ফ্রিকোয়েন্সি এবং নির্ভুলতা ট্র্যাক করুন। প্রাথমিক ফিডব্যাক Anthropic-কে মডেলটি আরও নিখুঁত করতে সাহায্য করবে এবং এটি আপনাকে নির্দিষ্ট ওয়ার্কফ্লোর জন্য ম্যানুয়াল কনফার্মেশন পুনরায় চালু করতে উদ্বুদ্ধ করতে পারে।
পরবর্তী যা লক্ষ্য রাখতে হবে
মানুষের অবচেতন রিফ্লেক্স ক্লিক থেকে একটি প্রশিক্ষিত মডেলে স্থানান্তরিত হওয়া হলো অনেক CI পাইপলাইনে বিদ্যমান নিরাপত্তার ঘাটতি পূরণ করার একটি স্পষ্ট প্রচেষ্টা।
উৎস: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
