Спільнота open-source отримала свій перший федеративний фід розвідки загроз (threat-intel feed) для захисту великих мовних моделей (LLM) від атак типу prompt-injection. Цей фід, випущений разом із prompt-shield v0.6.0, містить 56 кураторських сигнатур атак, кожна з яких підписана ключем ed25519, і його можна завантажити з безкоштовного CDN за допомогою легкого Python-клієнта.

Чому засобам захисту LLM бракувало спільного джерела розвідки

Традиційні рівні безпеки покладаються на публічні сигнатури, що регулярно оновлюються. Мережеві екрани вебдодатків (WAF) використовують патерни OWASP; антивірусні програми отримують оновлення ClamAV. Ці фіди підтримують актуальність захисту. Натомість інструменти безпеки LLM працюють ізольовано: кожен вендор або дослідник веде власний приватний список шкідливих промптів.

Цей розрив не є технічним. Комерційні вендори розглядають дані про загрози як продукт, тому тримають їх закритими. Великим дослідницьким групам бракує ресурсів для підтримки «нудної» інфраструктури, якої вимагає публічний фід. Існуючі маркетплейси валідаторів діють як односторонні хаби, надаючи статичні оновлення замість потоку даних у реальному часі, керованого спільнотою. Результат: фрагментована поверхня захисту, через яку непоміченими проходять нові техніки prompt-injection.

Як працює новий фід

Проєкт розміщено у публічному репозиторії GitHub і містить три файли:

  • signatures.json – 56 сигнатур атак, кожна з яких описує патерн, що може перехопити вивід LLM.
  • signatures.json.minisig – підпис ed25519, який прив'язує JSON-файл до приватного ключа мейнтейнера.
  • public.key – публічний ключ, який бібліотеки клієнта використовують для перевірки підпису.

Клієнт на чистому Python із 200 рядками коду завантажує JSON, перевіряє minisig за допомогою публічного ключа та об'єднує будь-які нові правила з двигуном prompt-shield. Якщо перевірка не вдається, клієнт перемикається на останній відомий надійний кеш, щоб недовірені дані ніколи не потрапляли на рівень захисту.

Три принципи проєкту виділяють цей фід:

  1. Нульова телеметрія – клієнт робить лише один HTTP GET запит; він ніколи не надсилає ідентифікатори, API-ключі або метрики використання.
  2. Криптографічна перевірка – будь-хто може завантажити фід, але приймаються лише дані, підписані приватним ключем мейнтейнера.
  3. Відмовостійкість – пошкоджена сигнатура не вимикає захист; система просто продовжує використовувати попередньо перевірені правила.

Сигнатури базуються на кількох авторитетних джерелах: корпусі red-team Garak від NVIDIA, прикладах OWASP LLM Top 10, публічних розкриттях на HackerOne та матеріалах від спільноти, перевірених мейнтейнером.

Кому це вигідно і що стоїть на кону

Розробники, які створюють додатки на базі LLM, тепер мають безкоштовне, верифіковане джерело патернів prompt-injection, яке інтегрується однією командою (pip install prompt-shield-ai). Організації, які раніше покладалися на пропрієтарну розвідку з закритим кодом, можуть доповнити або замінити ці фіди альтернативою, що підтримується спільнотою.

«Фактор автобуса» (bus factor) проєкту — кількість людей, втрата яких паралізує його роботу — наразі дорівнює одному. Якщо мейнтейнер припинить підписувати оновлення, фід застаріє, залишивши кінцевих користувачів без свіжих сигнатур. Автор прямо закликає додаткових інженерів до спільного ведення репозиторію, щоб перетворити сольний проєкт на сталий актив спільноти.

Підсумок: Тепер доступний публічно верифікований фід розвідки загроз для LLM prompt injection, керований спільнотою, що пропонує недорогу та прозору альтернативу пропрієтарним рішенням — за умови, що спільнота докладе зусиль, щоб підтримувати його життєздатність та актуальність.