آنتروپیک (Anthropic) اعلام کرد که از ۱۴ اوت، Claude Code دیگر از کاربران نمیخواهد برای هر فراخوانی ابزار (tool call)، روی گزینه «تایید» (approve) کلیک کنند. در عوض، یک طبقهبندیکننده ریسک مبتنی بر هوش مصنوعی تصمیم خواهد گرفت که کدام اقدامات نیاز به بررسی انسانی دارند. مطالعهای روی ۱۰۵۳ آزمایشکننده نشان داد که ۹۷٪ کلیکها بدون خواندن پیام (prompt) انجام شدهاند و طبقهبندیکننده ۸۹٪ از اقدامات مضر را شناسایی کرد، در حالی که انسانها تنها ۱۳.۶٪ را تشخیص دادند.
چرا مدل قدیمی «کلیک برای تایید» ناکارآمد بود
گردش کار قدیمی، انسان را مجبور میکرد تا هر اقدام خارجی — مانند push کردن کد یا حذف فایلها — را با کلیک بر روی یک دکمه تایید کند. در عمل، کاربران با این دیالوگ مانند یک تشریفات برخورد میکردند و بهصورت غریزی (reflexively) تایید میکردند. اعداد این مطالعه مشکل را آشکار میکند: تقریباً هر کلیک یک واکنش غریزی بود و معدود هشدارهای واقعی که مورد توجه قرار گرفتند، اکثر عملیاتهای پرخطر را از دست دادند. وقتی یک دروازه امنیتی از بین میرود، امنیت سیستم کاهش مییابد.
طبقهبندیکننده جدید چه کاری انجام میدهد
جایگزین Anthropic یک مدل آموزشدیده است که هر اقدام در انتظار را ارزیابی میکند و تنها زمانی فرآیند را متوقف میکند که عملیات در یکی از این سه دسته قرار بگیرد:
- غیرقابل بازگشت (Irreversible) – اقداماتی که قابل بازگشت نیستند، مانند force-push کردن به یک مخزن (repository) یا حذف یک جدول پایگاه داده (database table).
- تخریبی (Destructive) – حذفهای دستهجمعی یا بازنویسی فایلهایی که میتواند باعث پاک شدن کارها شود.
- رو به بیرون (Outward-facing) – مراحلی که کد یا پیامها را در معرض سیستمهای خارجی قرار میدهند، مانند باز کردن یک pull request یا ارسال یک اعلان در Slack.
اگر اقدامی هیچکدام از این معیارها را نداشته باشد، مدل اجازه میدهد بهطور خودکار پیش برود و به سیل پیامهایی که کاربران نادیده میگرفتند، پایان میدهد.
محدودیتهای رویکرد مبتنی بر هوش مصنوعیِ محض
این طبقهبندیکننده یک محافظ همهجانبه نیست. این مدل مفاهیم کلی آسیب را یاد گرفته است، نه جزئیات هر کدبیس (codebase) خاص را. پوشهای با نام "tmp" ممکن است در اکثر پروژهها بیخطر باشد، اما در پروژه شما میتواند حاوی فایلهای حیاتیِ ساخت (build artifacts) باشد؛ در این صورت مدل احتمالاً آن را ایمن تشخیص میدهد. عملکرد ذکر شده در مطالعه، تضمینکننده نتایج یکسان در هر محیط عملیاتی (production) نیست. موارد خاص (Edge cases) — بهویژه مواردی که شامل ابزارهای سفارشی یا زیرساختهای حساس هستند — همچنان به تنظیمات اجازه صریح یا نظارت اضافی نیاز دارند.
آنچه کاربران باید اکنون انجام دهند
- حالت مجوز جدید را بررسی کنید: طرحهای Pro، Max و Team بهطور خودکار از این طبقهبندیکننده استفاده خواهند کرد. اگر به یک گردش کارِ مجوز سفارشی متکی هستید، بررسی کنید که آیا همچنان با سیاستهای امنیتی شما همسو است یا خیر.
- اقدامات پرخطر را شناسایی کنید: خط لولههای CI/CD و اسکریپتهای استقرار (deployment) خود را با سه دسته محرک تطبیق دهید. اسکریپتهایی را که مراحل غیرقابل بازگشت یا تخریبی انجام میدهند، بهگونهای تنظیم کنید که اگر طبقهبندیکننده پیشفرض کافی نبود، شامل محافظهای صریح باشند.
- هشدارهای طبقهبندیکننده را زیر نظر بگیرید: فراوانی و دقت توقفها را پیگیری کنید. بازخوردهای اولیه به Anthropic کمک میکند تا مدل را دقیقتر تنظیم کند و ممکن است شما را ترغیب کند که تاییدهای دستی را برای گردشهای کاری خاص دوباره فعال کنید.
آنچه باید در آینده زیر نظر داشت
تغییر از کلیکهای غریزی انسانی به یک مدل آموزشدیده، تلاشی آشکار برای پر کردن شکاف امنیتی است که در بسیاری از خط لولههای CI وجود داشت.
منبع: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
