یک اسکنر متن‌باز جدید که «مهارت‌های عامل» (agent skills) هوش مصنوعی را بازرسی می‌کند، پس از آنکه محققان نشان دادند یک مهارت تأییدنشده می‌تواند به‌طور پنهانی کلیدهای SSH و اعتبارنامه‌های ابری را استخراج کند، در حال تبدیل شدن به یک ابزار کاربردی است. این اسکنر ترکیبی از فیلترهای کلمات کلیدی، تحلیل رفتار، استدلال مبتنی بر هوش مصنوعی، اجرای Sandbox و تشخیص تغییرات است تا از موج بعدی حملات زنجیره تأمین علیه توسعه‌دهندگانِ بهره‌مند از هوش مصنوعی جلوگیری کند.

چرا مهارت‌های هوش مصنوعی اکنون اهمیت دارند

دستیارهای مدل زبانی بزرگ (LLM) مانند Claude و GitHub Copilot اکنون به «مهارت‌های عامل» (agent skills) متکی هستند – پوشه‌های کوچک و مستقل که به مدل می‌گویند چگونه یک وظیفه خاص را انجام دهد. GitHub اخیراً یک دستور تک‌خطی اضافه کرده است که به توسعه‌دهندگان اجازه می‌دهد این مهارت‌ها را مستقیماً از مخازن عمومی دریافت کنند و آن‌ها را به یک مدیریت‌کننده بسته (package manager) غیررسمی برای جریان‌های کاری مبتنی بر هوش مصنوعی تبدیل کند.

راحتی کار غیرقابل انکار است: یک مهارت می‌تواند یک درخواست مبهم مانند «این صفحه گسترده را مرتب کن» را به فراخوانی‌های دقیق API، دستکاری فایل‌ها یا ویرایش کد تبدیل کند. همین سادگی اجازه می‌دهد تا کدهای مخرب به درون این بسته‌ها نفوذ کنند.

صفحه هشدار GitHub خاطرنشان می‌کند که مهارت‌ها پیش از نصب، تأیید نمی‌شوند.

چگونه یک محموله مخرب می‌تواند از دید پنهان بماند

برخلاف یک فایل باینری معمولی، یک مهارت هوش مصنوعی تمام محتویات خود را به یکباره بارگذاری نمی‌کند. مدل ابتدا یک خلاصه کوتاه را می‌خواند و سپس تنها زمانی که وظیفه مربوطه تشخیص داده شد، مجموعه دستورالعمل‌های کامل را فراخوانی می‌کند. این بارگذاری مرحله‌ای، فرصتی را ایجاد می‌کند که یک فایل مخرب می‌تواند به‌صورت بی‌حرکت و پنهان از دید کاربر باقی بماند تا زمانی که مدل تصمیم به فراخوانی آن بگیرد.

در یک آزمایش اثبات مفهوم (proof-of-concept)، محقق یک مهارت جعلی به نام csv-formatter ساخت که ادعای مرتب‌سازی صفحات گسترده را داشت. کد قابل مشاهده بی‌خطر به نظر می‌رسید، اما یک دستور پنهان، یک «مرحله تشخیص» (diagnostic step) را اضافه کرده بود. این مرحله هیچ تشخیصی انجام نمی‌داد؛ بلکه سیستم میزبان را برای یافتن کلیدهای خصوصی SSH و توکن‌های دسترسی AWS اسکن می‌کرد و سپس یافته‌ها را به یک سرور خارجی ارسال می‌کرد.

دستور مخرب همچنین در یک فایل تغییرات (changelog) ظاهر شد – جایی که اکثر انسان‌ها هرگز بررسی نمی‌کنند، اما هوش مصنوعی هنگام ارزیابی تاریخچه نسخه‌ها آن را می‌خواند. هوش مصنوعی در حالی که توسعه‌دهنده تصور می‌کرد مهارت صرفاً در حال قالب‌بندی داده‌هاست، یک روتین سرقت اعتبارنامه را به‌طور پنهانی اجرا کرد.

پاسخ متن‌باز

برای پر کردن این شکاف، محقق منطق تشخیص را در قالب یک ابزار بازرسی متن‌باز بسته‌بندی کرد. این اسکنر تنها به یک تکنیک متکی نیست، بلکه چندین لایه دفاعی را به کار می‌گیرد:

  • Keyword matching تلاش‌های آشکار و سطحی را که شامل رشته‌های مخرب شناخته‌شده هستند، شناسایی می‌کند.
  • Behavior analysis دستورالعمل‌هایی را که فایل‌های اعتبارنامه را می‌خوانند و سپس تماس‌های شبکه برقرار می‌کنند، علامت‌گذاری می‌کند.
  • AI reasoning یک مدل ثانویه را برای ارزیابی اینکه آیا دستورالعمل‌های یک مهارت تعمداً از کاربر پنهان شده‌اند یا خیر، اجرا می‌کند.
  • Sandboxing مهارت را در یک محیط ایزوله اجرا می‌کند و اقدامات را به‌صورت لحظه‌ای بدون به خطر انداختن سیستم میزبان مشاهده می‌کند.
  • Change detection مهارت‌های مورد اعتماد را برای تغییرات غیرمنتظره نظارت می‌کند و پیش از نصب نسخه جدید، به نگهدارندگان هشدار می‌دهد.

نویسنده یک مجموعه تست شامل بازتولید حمله csv-formatter و یک بنچمارک عمومی که نرخ تشخیص را در مجموعه‌ای منتخب از مهارت‌های سالم و مخرب اندازه‌گیری می‌کند، ارائه خواهد داد.

آنچه باید در آینده زیر نظر داشت

  • Community benchmarks: با انتشار نمونه‌های بیشتر از مهارت‌های مخرب توسط محققان، بنچمارک عمومی برای به‌روز ماندن نیاز به آپدیت‌های منظم خواهد داشت.

ظهور مهارت‌های عامل هوش مصنوعی نشان‌دهنده مرز جدیدی در ابزارهای توسعه‌دهنده است، اما در عین حال دری را برای حملات زنجیره تأمین باز می‌کند که بررسی‌های سنتی کد را دور می‌زنند. یک اسکنر متن‌باز که بررسی‌های ایستا، مشاهده پویا و استدلال هوش مصنوعی را با هم ترکیب می‌کند، اولین خط دفاعی عملی را ارائه می‌دهد. توسعه‌دهندگانی که با یک مهارت مانند یک درایو USB تصادفی برخورد می‌کنند، به‌زودی خواهند فهمید که هزینه نادیده گرفتن تأییدیه، بسیار فراتر از راحتیِ کمک فوری هوش مصنوعی است.