یک اسکنر متنباز جدید که «مهارتهای عامل» (agent skills) هوش مصنوعی را بازرسی میکند، پس از آنکه محققان نشان دادند یک مهارت تأییدنشده میتواند بهطور پنهانی کلیدهای SSH و اعتبارنامههای ابری را استخراج کند، در حال تبدیل شدن به یک ابزار کاربردی است. این اسکنر ترکیبی از فیلترهای کلمات کلیدی، تحلیل رفتار، استدلال مبتنی بر هوش مصنوعی، اجرای Sandbox و تشخیص تغییرات است تا از موج بعدی حملات زنجیره تأمین علیه توسعهدهندگانِ بهرهمند از هوش مصنوعی جلوگیری کند.
چرا مهارتهای هوش مصنوعی اکنون اهمیت دارند
دستیارهای مدل زبانی بزرگ (LLM) مانند Claude و GitHub Copilot اکنون به «مهارتهای عامل» (agent skills) متکی هستند – پوشههای کوچک و مستقل که به مدل میگویند چگونه یک وظیفه خاص را انجام دهد. GitHub اخیراً یک دستور تکخطی اضافه کرده است که به توسعهدهندگان اجازه میدهد این مهارتها را مستقیماً از مخازن عمومی دریافت کنند و آنها را به یک مدیریتکننده بسته (package manager) غیررسمی برای جریانهای کاری مبتنی بر هوش مصنوعی تبدیل کند.
راحتی کار غیرقابل انکار است: یک مهارت میتواند یک درخواست مبهم مانند «این صفحه گسترده را مرتب کن» را به فراخوانیهای دقیق API، دستکاری فایلها یا ویرایش کد تبدیل کند. همین سادگی اجازه میدهد تا کدهای مخرب به درون این بستهها نفوذ کنند.
صفحه هشدار GitHub خاطرنشان میکند که مهارتها پیش از نصب، تأیید نمیشوند.
چگونه یک محموله مخرب میتواند از دید پنهان بماند
برخلاف یک فایل باینری معمولی، یک مهارت هوش مصنوعی تمام محتویات خود را به یکباره بارگذاری نمیکند. مدل ابتدا یک خلاصه کوتاه را میخواند و سپس تنها زمانی که وظیفه مربوطه تشخیص داده شد، مجموعه دستورالعملهای کامل را فراخوانی میکند. این بارگذاری مرحلهای، فرصتی را ایجاد میکند که یک فایل مخرب میتواند بهصورت بیحرکت و پنهان از دید کاربر باقی بماند تا زمانی که مدل تصمیم به فراخوانی آن بگیرد.
در یک آزمایش اثبات مفهوم (proof-of-concept)، محقق یک مهارت جعلی به نام csv-formatter ساخت که ادعای مرتبسازی صفحات گسترده را داشت. کد قابل مشاهده بیخطر به نظر میرسید، اما یک دستور پنهان، یک «مرحله تشخیص» (diagnostic step) را اضافه کرده بود. این مرحله هیچ تشخیصی انجام نمیداد؛ بلکه سیستم میزبان را برای یافتن کلیدهای خصوصی SSH و توکنهای دسترسی AWS اسکن میکرد و سپس یافتهها را به یک سرور خارجی ارسال میکرد.
دستور مخرب همچنین در یک فایل تغییرات (changelog) ظاهر شد – جایی که اکثر انسانها هرگز بررسی نمیکنند، اما هوش مصنوعی هنگام ارزیابی تاریخچه نسخهها آن را میخواند. هوش مصنوعی در حالی که توسعهدهنده تصور میکرد مهارت صرفاً در حال قالببندی دادههاست، یک روتین سرقت اعتبارنامه را بهطور پنهانی اجرا کرد.
پاسخ متنباز
برای پر کردن این شکاف، محقق منطق تشخیص را در قالب یک ابزار بازرسی متنباز بستهبندی کرد. این اسکنر تنها به یک تکنیک متکی نیست، بلکه چندین لایه دفاعی را به کار میگیرد:
- Keyword matching تلاشهای آشکار و سطحی را که شامل رشتههای مخرب شناختهشده هستند، شناسایی میکند.
- Behavior analysis دستورالعملهایی را که فایلهای اعتبارنامه را میخوانند و سپس تماسهای شبکه برقرار میکنند، علامتگذاری میکند.
- AI reasoning یک مدل ثانویه را برای ارزیابی اینکه آیا دستورالعملهای یک مهارت تعمداً از کاربر پنهان شدهاند یا خیر، اجرا میکند.
- Sandboxing مهارت را در یک محیط ایزوله اجرا میکند و اقدامات را بهصورت لحظهای بدون به خطر انداختن سیستم میزبان مشاهده میکند.
- Change detection مهارتهای مورد اعتماد را برای تغییرات غیرمنتظره نظارت میکند و پیش از نصب نسخه جدید، به نگهدارندگان هشدار میدهد.
نویسنده یک مجموعه تست شامل بازتولید حمله csv-formatter و یک بنچمارک عمومی که نرخ تشخیص را در مجموعهای منتخب از مهارتهای سالم و مخرب اندازهگیری میکند، ارائه خواهد داد.
آنچه باید در آینده زیر نظر داشت
- Community benchmarks: با انتشار نمونههای بیشتر از مهارتهای مخرب توسط محققان، بنچمارک عمومی برای بهروز ماندن نیاز به آپدیتهای منظم خواهد داشت.
ظهور مهارتهای عامل هوش مصنوعی نشاندهنده مرز جدیدی در ابزارهای توسعهدهنده است، اما در عین حال دری را برای حملات زنجیره تأمین باز میکند که بررسیهای سنتی کد را دور میزنند. یک اسکنر متنباز که بررسیهای ایستا، مشاهده پویا و استدلال هوش مصنوعی را با هم ترکیب میکند، اولین خط دفاعی عملی را ارائه میدهد. توسعهدهندگانی که با یک مهارت مانند یک درایو USB تصادفی برخورد میکنند، بهزودی خواهند فهمید که هزینه نادیده گرفتن تأییدیه، بسیار فراتر از راحتیِ کمک فوری هوش مصنوعی است.
