آنتروپیک (Anthropic) اعلام کرد که از ۱۴ اوت، Claude Code دیگر از کاربران نمی‌خواهد برای هر فراخوانی ابزار (tool call)، روی گزینه «تایید» (approve) کلیک کنند. در عوض، یک طبقه‌بندی‌کننده ریسک مبتنی بر هوش مصنوعی تصمیم خواهد گرفت که کدام اقدامات نیاز به بررسی انسانی دارند. مطالعه‌ای روی ۱۰۵۳ آزمایش‌کننده نشان داد که ۹۷٪ کلیک‌ها بدون خواندن پیام (prompt) انجام شده‌اند و طبقه‌بندی‌کننده ۸۹٪ از اقدامات مضر را شناسایی کرد، در حالی که انسان‌ها تنها ۱۳.۶٪ را تشخیص دادند.

چرا مدل قدیمی «کلیک برای تایید» ناکارآمد بود

گردش کار قدیمی، انسان را مجبور می‌کرد تا هر اقدام خارجی — مانند push کردن کد یا حذف فایل‌ها — را با کلیک بر روی یک دکمه تایید کند. در عمل، کاربران با این دیالوگ مانند یک تشریفات برخورد می‌کردند و به‌صورت غریزی (reflexively) تایید می‌کردند. اعداد این مطالعه مشکل را آشکار می‌کند: تقریباً هر کلیک یک واکنش غریزی بود و معدود هشدارهای واقعی که مورد توجه قرار گرفتند، اکثر عملیات‌های پرخطر را از دست دادند. وقتی یک دروازه امنیتی از بین می‌رود، امنیت سیستم کاهش می‌یابد.

طبقه‌بندی‌کننده جدید چه کاری انجام می‌دهد

جایگزین Anthropic یک مدل آموزش‌دیده است که هر اقدام در انتظار را ارزیابی می‌کند و تنها زمانی فرآیند را متوقف می‌کند که عملیات در یکی از این سه دسته قرار بگیرد:

  • غیرقابل بازگشت (Irreversible) – اقداماتی که قابل بازگشت نیستند، مانند force-push کردن به یک مخزن (repository) یا حذف یک جدول پایگاه داده (database table).
  • تخریبی (Destructive) – حذف‌های دسته‌جمعی یا بازنویسی فایل‌هایی که می‌تواند باعث پاک شدن کارها شود.
  • رو به بیرون (Outward-facing) – مراحلی که کد یا پیام‌ها را در معرض سیستم‌های خارجی قرار می‌دهند، مانند باز کردن یک pull request یا ارسال یک اعلان در Slack.

اگر اقدامی هیچ‌کدام از این معیارها را نداشته باشد، مدل اجازه می‌دهد به‌طور خودکار پیش برود و به سیل پیام‌هایی که کاربران نادیده می‌گرفتند، پایان می‌دهد.

محدودیت‌های رویکرد مبتنی بر هوش مصنوعیِ محض

این طبقه‌بندی‌کننده یک محافظ همه‌جانبه نیست. این مدل مفاهیم کلی آسیب را یاد گرفته است، نه جزئیات هر کدبیس (codebase) خاص را. پوشه‌ای با نام "tmp" ممکن است در اکثر پروژه‌ها بی‌خطر باشد، اما در پروژه شما می‌تواند حاوی فایل‌های حیاتیِ ساخت (build artifacts) باشد؛ در این صورت مدل احتمالاً آن را ایمن تشخیص می‌دهد. عملکرد ذکر شده در مطالعه، تضمین‌کننده نتایج یکسان در هر محیط عملیاتی (production) نیست. موارد خاص (Edge cases) — به‌ویژه مواردی که شامل ابزارهای سفارشی یا زیرساخت‌های حساس هستند — همچنان به تنظیمات اجازه صریح یا نظارت اضافی نیاز دارند.

آنچه کاربران باید اکنون انجام دهند

  • حالت مجوز جدید را بررسی کنید: طرح‌های Pro، Max و Team به‌طور خودکار از این طبقه‌بندی‌کننده استفاده خواهند کرد. اگر به یک گردش کارِ مجوز سفارشی متکی هستید، بررسی کنید که آیا همچنان با سیاست‌های امنیتی شما همسو است یا خیر.
  • اقدامات پرخطر را شناسایی کنید: خط لوله‌های CI/CD و اسکریپت‌های استقرار (deployment) خود را با سه دسته محرک تطبیق دهید. اسکریپت‌هایی را که مراحل غیرقابل بازگشت یا تخریبی انجام می‌دهند، به‌گونه‌ای تنظیم کنید که اگر طبقه‌بندی‌کننده پیش‌فرض کافی نبود، شامل محافظ‌های صریح باشند.
  • هشدارهای طبقه‌بندی‌کننده را زیر نظر بگیرید: فراوانی و دقت توقف‌ها را پیگیری کنید. بازخوردهای اولیه به Anthropic کمک می‌کند تا مدل را دقیق‌تر تنظیم کند و ممکن است شما را ترغیب کند که تاییدهای دستی را برای گردش‌های کاری خاص دوباره فعال کنید.

آنچه باید در آینده زیر نظر داشت

تغییر از کلیک‌های غریزی انسانی به یک مدل آموزش‌دیده، تلاشی آشکار برای پر کردن شکاف امنیتی است که در بسیاری از خط لوله‌های CI وجود داشت.

منبع: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg