جامعه متنباز اکنون اولین فید اطلاعات تهدید فدرال (federated threat-intel feed) را برای دفاع از مدلهای زبانی بزرگ (LLMs) در برابر حملات تزریق پرامپت (prompt-injection) در اختیار دارد. این فید که همراه با نسخه prompt-shield v0.6.0 منتشر شده است، شامل ۵۶ امضای حمله منتخب است که هر کدام با یک کلید ed25519 امضا شدهاند و میتوان آنها را از طریق یک کلاینت سبک پایتون از یک CDN رایگان دریافت کرد.
چرا دفاع از LLMها فاقد یک منبع اطلاعات مشترک بوده است
لایههای امنیتی سنتی بر امضاهای عمومی و بهروزرسانیشده بهطور منظم تکیه دارند. دیوارههای آتش اپلیکیشنهای وب (WAF) از الگوهای OWASP استفاده میکنند؛ برنامههای آنتیویروس بهروزرسانیهای ClamAV را دریافت میکنند. این فیدها باعث بهروز ماندن دفاعها میشوند. در مقابل، ابزارهای امنیتی LLM بهصورت ایزوله عمل میکنند و هر فروشنده یا پژوهشگر، لیست خصوصی خود را از پرامپتهای مخرب نگهداری میکند.
این شکاف فنی نیست. فروشندگان تجاری با دادههای تهدید مانند یک محصول برخورد میکنند، بنابراین آنها را بسته نگه میدارند. گروههای تحقیقاتی بزرگ نیز فاقد ظرفیت لازم برای مدیریت زیرساختهای «کسلکننده» مورد نیاز یک فید عمومی هستند. بازارهای موجود برای اعتبارسنجی نیز مانند هابهای یکطرفه عمل میکنند و بهجای یک جریان بلادرنگ و جامعهمحور، بهروزرسانیهای ایستا را ارسال میکنند. نتیجه این است: یک سطح دفاعی تکهتکه که در آن تکنیکهای جدید تزریق پرامپت بدون شناسایی از آن عبور میکنند.
فید جدید چگونه کار میکند
این پروژه در یک مخزن عمومی GitHub قرار دارد و شامل سه فایل است:
- signatures.json – ۵۶ امضای حمله که هر کدام الگویی را توصیف میکنند که میتواند خروجی یک LLM را به کنترل خود درآورد (hijack).
- signatures.json.minisig – یک امضای
ed25519که فایل JSON را به کلید خصوصی نگهدارنده (maintainer) متصل میکند. - public.key – کلید عمومی که کتابخانههای کلاینت برای تأیید امضا از آن استفاده میکنند.
یک کلاینت خالص پایتون (pure-Python) در ۲۰۰ خط کد، فایل JSON را دریافت کرده، minisig را با کلید عمومی بررسی میکند و هر قانون جدید را با موتور prompt-shield ادغام میکند. اگر تأیید با شکست مواجه شود، کلاینت به آخرین کش معتبر شناختهشده بازمیگردد تا دادههای غیرقابل اعتماد هرگز به لایه دفاعی نرسند.
سه رکن طراحی، این فید را متمایز میکند:
- Zero telemetry (بدون ارسال دادههای سنجش) – کلاینت تنها یک درخواست HTTP GET ارسال میکند؛ این کلاینت هرگز شناسهها، کلیدهای API یا معیارهای استفاده را ارسال نمیکند.
- Cryptographic verification (تأیید رمزنگاریشده) – هر کسی میتواند فید را دانلود کند، اما تنها دادههایی که با کلید خصوصی نگهدارنده امضا شدهاند پذیرفته میشوند.
- Fail-safe behavior (رفتار ایمن در صورت خطا) – یک امضای خراب باعث از کار افتادن شیلد نمیشود؛ سیستم بهسادگی به استفاده از قوانین تأییدشده قبلی ادامه میدهد.
این امضاها از چندین منبع معتبر استخراج شدهاند: مجموعه قرمز تیم Garak شرکت NVIDIA، نمونههای OWASP LLM Top 10، افشاگریهای عمومی در HackerOne و ارسالهای جامعه که توسط نگهدارنده بازبینی شدهاند.
چه کسانی سود میبرند و مخاطرات چیست
توسعهدهندگانی که اپلیکیشنهای مبتنی بر LLM میسازند، اکنون یک منبع رایگان و قابل تأیید از الگوهای تزریق پرامپت در اختیار دارند که تنها با یک دستور (pip install prompt-shield-ai) ادغام میشود. سازمانهایی که پیش از این به اطلاعات اختصاصی و منبعبسته تکیه میکردند، میتوانند آن فیدها را با یک جایگزین جامعهمحور تقویت کرده یا آنها را جایگزین کنند.
«ضریب اتوبوس» (bus factor) این پروژه — یعنی تعداد افرادی که از دست رفتن آنها باعث از کار افتادن پروژه میشود — در حال حاضر یک نفر است. اگر نگهدارنده امضای بهروزرسانیها را متوقف کند، فید راکد شده و کاربران پاییندستی بدون امضاهای تازه خواهند ماند. نویسنده صراحتاً از مهندسان اضافی برای همکاری در نگهداری مخزن درخواست کرده است تا این تلاش انفرادی را به یک دارایی پایدار برای جامعه تبدیل کند.
نکته کلیدی: یک فید اطلاعات تهدید جامعهمحور و قابل تأیید عمومی برای تزریق پرامپت در LLM اکنون در دسترس است که جایگزینی کمهزینه و شفاف برای راهکارهای اختصاصی ارائه میدهد؛ مشروط بر اینکه جامعه برای زنده نگه داشتن و مرتبط ماندن آن گام بردارد.
