جامعه متن‌باز اکنون اولین فید اطلاعات تهدید فدرال (federated threat-intel feed) را برای دفاع از مدل‌های زبانی بزرگ (LLMs) در برابر حملات تزریق پرامپت (prompt-injection) در اختیار دارد. این فید که همراه با نسخه prompt-shield v0.6.0 منتشر شده است، شامل ۵۶ امضای حمله منتخب است که هر کدام با یک کلید ed25519 امضا شده‌اند و می‌توان آن‌ها را از طریق یک کلاینت سبک پایتون از یک CDN رایگان دریافت کرد.

چرا دفاع از LLMها فاقد یک منبع اطلاعات مشترک بوده است

لایه‌های امنیتی سنتی بر امضاهای عمومی و به‌روزرسانی‌شده به‌طور منظم تکیه دارند. دیواره‌های آتش اپلیکیشن‌های وب (WAF) از الگوهای OWASP استفاده می‌کنند؛ برنامه‌های آنتی‌ویروس به‌روزرسانی‌های ClamAV را دریافت می‌کنند. این فیدها باعث به‌روز ماندن دفاع‌ها می‌شوند. در مقابل، ابزارهای امنیتی LLM به‌صورت ایزوله عمل می‌کنند و هر فروشنده یا پژوهشگر، لیست خصوصی خود را از پرامپت‌های مخرب نگهداری می‌کند.

این شکاف فنی نیست. فروشندگان تجاری با داده‌های تهدید مانند یک محصول برخورد می‌کنند، بنابراین آن‌ها را بسته نگه می‌دارند. گروه‌های تحقیقاتی بزرگ نیز فاقد ظرفیت لازم برای مدیریت زیرساخت‌های «کسل‌کننده» مورد نیاز یک فید عمومی هستند. بازارهای موجود برای اعتبارسنجی نیز مانند هاب‌های یک‌طرفه عمل می‌کنند و به‌جای یک جریان بلادرنگ و جامعه‌محور، به‌روزرسانی‌های ایستا را ارسال می‌کنند. نتیجه این است: یک سطح دفاعی تکه‌تکه که در آن تکنیک‌های جدید تزریق پرامپت بدون شناسایی از آن عبور می‌کنند.

فید جدید چگونه کار می‌کند

این پروژه در یک مخزن عمومی GitHub قرار دارد و شامل سه فایل است:

  • signatures.json – ۵۶ امضای حمله که هر کدام الگویی را توصیف می‌کنند که می‌تواند خروجی یک LLM را به کنترل خود درآورد (hijack).
  • signatures.json.minisig – یک امضای ed25519 که فایل JSON را به کلید خصوصی نگهدارنده (maintainer) متصل می‌کند.
  • public.key – کلید عمومی که کتابخانه‌های کلاینت برای تأیید امضا از آن استفاده می‌کنند.

یک کلاینت خالص پایتون (pure-Python) در ۲۰۰ خط کد، فایل JSON را دریافت کرده، minisig را با کلید عمومی بررسی می‌کند و هر قانون جدید را با موتور prompt-shield ادغام می‌کند. اگر تأیید با شکست مواجه شود، کلاینت به آخرین کش معتبر شناخته‌شده بازمی‌گردد تا داده‌های غیرقابل اعتماد هرگز به لایه دفاعی نرسند.

سه رکن طراحی، این فید را متمایز می‌کند:

  1. Zero telemetry (بدون ارسال داده‌های سنجش) – کلاینت تنها یک درخواست HTTP GET ارسال می‌کند؛ این کلاینت هرگز شناسه‌ها، کلیدهای API یا معیارهای استفاده را ارسال نمی‌کند.
  2. Cryptographic verification (تأیید رمزنگاری‌شده) – هر کسی می‌تواند فید را دانلود کند، اما تنها داده‌هایی که با کلید خصوصی نگهدارنده امضا شده‌اند پذیرفته می‌شوند.
  3. Fail-safe behavior (رفتار ایمن در صورت خطا) – یک امضای خراب باعث از کار افتادن شیلد نمی‌شود؛ سیستم به‌سادگی به استفاده از قوانین تأییدشده قبلی ادامه می‌دهد.

این امضاها از چندین منبع معتبر استخراج شده‌اند: مجموعه قرمز تیم Garak شرکت NVIDIA، نمونه‌های OWASP LLM Top 10، افشاگری‌های عمومی در HackerOne و ارسال‌های جامعه که توسط نگهدارنده بازبینی شده‌اند.

چه کسانی سود می‌برند و مخاطرات چیست

توسعه‌دهندگانی که اپلیکیشن‌های مبتنی بر LLM می‌سازند، اکنون یک منبع رایگان و قابل تأیید از الگوهای تزریق پرامپت در اختیار دارند که تنها با یک دستور (pip install prompt-shield-ai) ادغام می‌شود. سازمان‌هایی که پیش از این به اطلاعات اختصاصی و منبع‌بسته تکیه می‌کردند، می‌توانند آن فیدها را با یک جایگزین جامعه‌محور تقویت کرده یا آن‌ها را جایگزین کنند.

«ضریب اتوبوس» (bus factor) این پروژه — یعنی تعداد افرادی که از دست رفتن آن‌ها باعث از کار افتادن پروژه می‌شود — در حال حاضر یک نفر است. اگر نگهدارنده امضای به‌روزرسانی‌ها را متوقف کند، فید راکد شده و کاربران پایین‌دستی بدون امضاهای تازه خواهند ماند. نویسنده صراحتاً از مهندسان اضافی برای همکاری در نگهداری مخزن درخواست کرده است تا این تلاش انفرادی را به یک دارایی پایدار برای جامعه تبدیل کند.

نکته کلیدی: یک فید اطلاعات تهدید جامعه‌محور و قابل تأیید عمومی برای تزریق پرامپت در LLM اکنون در دسترس است که جایگزینی کم‌هزینه و شفاف برای راهکارهای اختصاصی ارائه می‌دهد؛ مشروط بر اینکه جامعه برای زنده نگه داشتن و مرتبط ماندن آن گام بردارد.