У open-source сообщества появился первый федеративный поток данных об угрозах (threat-intel feed) для защиты больших языковых моделей (LLM) от атак типа prompt-injection. Этот фид, выпущенный вместе с prompt-shield v0.6.0, содержит 56 отобранных сигнатур атак, каждая из которых подписана ключом ed25519, и его можно загрузить из бесплатного CDN с помощью легковесного Python-клиента.
Почему защите LLM не хватало общего источника данных об угрозах
Традиционные уровни безопасности полагаются на публичные, регулярно обновляемые сигнатуры. WAF (Web-application firewalls) используют паттерны OWASP; антивирусные программы поглощают обновления ClamAV. Эти потоки данных поддерживают актуальность защиты. Инструменты безопасности LLM, напротив, работают изолированно: каждый вендор или исследователь поддерживает собственный закрытый список вредоносных промптов.
Проблема не техническая. Коммерческие вендоры рассматривают данные об угрозах как продукт, поэтому держат их в закрытом доступе. У крупных исследовательских групп не хватает ресурсов на поддержку «скучной» инфраструктуры, которой требует публичный фид. Существующие маркетплейсы валидаторов работают как односторонние узлы, предоставляя статические обновления вместо потока данных в реальном времени, управляемого сообществом. В результате получается фрагментированная поверхность защиты, через которую незамеченными проскальзывают новые техники prompt-injection.
Как работает новый фид
Проект размещен в публичном репозитории GitHub и включает три файла:
- signatures.json — 56 сигнатур атак, каждая из которых описывает паттерн, способный перехватить управление выводом LLM.
- signatures.json.minisig — подпись ed25519, которая связывает JSON-файл с закрытым ключом мейнтейнера.
- public.key — открытый ключ, который клиентские библиотеки используют для проверки подписи.
Легковесный клиент на чистом Python (всего 200 строк кода) загружает JSON, проверяет minisig с помощью открытого ключа и объединяет новые правила с движком prompt-shield. Если проверка не проходит, клиент переключается на последний проверенный кэш, чтобы недоверенные данные никогда не попадали на уровень защиты.
Три принципа проектирования выделяют этот фид:
- Zero telemetry — клиент делает только один HTTP GET-запрос; он никогда не отправляет идентификаторы, API-ключи или метрики использования.
- Cryptographic verification — любой может скачать фид, но принимаются только данные, подписанные закрытым ключом мейнтейнера.
- Fail-safe behavior — поврежденная подпись не отключает защиту; система просто продолжает использовать ранее проверенные правила.
Сигнатуры взяты из нескольких авторитетных источников: корпуса red-team Garak от NVIDIA, примеров OWASP LLM Top 10, публичных отчетов на HackerOne и материалов от сообщества, проверенных мейнтейнером.
Кому это полезно и что стоит на кону
Разработчики приложений на базе LLM теперь получили бесплатный, проверяемый источник паттернов prompt-injection, который интегрируется одной командой (pip install prompt-shield-ai). Организации, которые раньше полагались на проприетарные данные из закрытых источников, могут дополнить или заменить их альтернативой, поддерживаемой сообществом.
«Bus factor» проекта (количество людей, потеря которых парализует его работу) на данный момент равен одному. Если мейнтейнер перестанет подписывать обновления, поток данных застаивается, и конечные пользователи останутся без свежих сигнатур. Автор прямо призывает инженеров присоединиться к совместному ведению репозитория, чтобы превратить одиночную инициативу в устойчивый ресурс сообщества.
Итог: Теперь доступен публично проверяемый, управляемый сообществом поток данных об угрозах для защиты от prompt-injection в LLM. Он предлагает недорогой и прозрачный вариант альтернативы проприетарным решениям — при условии, что сообщество приложит усилия для поддержания его актуальности и жизнеспособности.
