Репозиторий LLM Guard был переведен в режим архивации 9 июля 2026 года, что положило конец всем обновлениям кода и моделей.

Почему это важно

LLM Guard был одним из немногих бесплатных наборов инструментов с поддержкой сообщества, которые позволяли разработчикам добавлять «рельсы» (rails) — проверки, работающие до или после большой языковой модели (LLM), — не оплачивая управляемый сервис. С заморозкой проекта эти защитные механизмы исчезают. В то же время рынок безопасности ИИ проходит процесс консолидации: Protect AI была поглощена Palo Alto Networks, Lakera — компанией Check Point, а OpenAI приобрела promptfoo. Рынок переходит от разрозненных инди-проектов к нескольким предложениям платформенного уровня, и разработчикам теперь предстоит решить, где выстроить свою следующую линию обороны.

Три проблемы защитных барьеров, которые нужно решить

  1. Входные барьеры (Input rails) — фильтры, которые проверяют запрос пользователя до того, как он попадет в модель, блокируя попытки инъекций и методы джейлбрейка (jailbreak).
  2. Выходные барьеры (Output rails) — сканеры, которые оценивают ответ модели, подавляя токсичную лексику, защищенный авторским правом контент или непреднамеренное раскрытие конфиденциальных данных.
  3. Тестирование Red-team — набор состязательных тестов, запускаемых в процессе разработки (обычно в CI/CD-конвейерах) для проверки того, насколько модель и её защитные механизмы устойчивы к известным паттернам атак. Этот этап выявляет уязвимости до того, как они попадут в продакшн; это не фильтр времени выполнения (runtime filter).

Отношение к тестированию Red-team как к средству блокировки в реальном времени может создать ложное чувство безопасности.

Open-source альтернативы, которые всё еще актуальны

Инструмент Лицензия Лучшее применение
NeMo Guardrails Apache 2.0 Сложные многоходовые диалоги и генерация с дополненной выборкой (RAG); использует специализированный язык Colang для описания логики барьеров.
Guardrails AI Apache 2.0 Поэтапная валидация — добавление по одному правилу для конкретного риска, такого как нецензурная лексика или запрещенные темы.
Presidio MIT Оффлайн-детектирование и маскирование персональных данных (PII); проект перешел под управление сообщества, но вам придется самостоятельно определять список сущностей, чтобы избежать ложноположительных срабатываний.
Llama Prompt Guard 2 Локальный классификатор, ориентированный на обнаружение инъекций в промпты и попыток джейлбрейка.
promptfoo MIT Фреймворк для Red-team тестирования, интегрируемый в CI-конвейеры; может запускать сотни векторов атак против вашей модели и сообщать о тех, что увенчались успехом.

Эти проекты по-прежнему получают вклад от сообщества, а их исходный код доступен для самостоятельного хостинга или встраивания в кастомные конвейеры.

Управляемые решения, на которые стоит обратить внимание

Если вы предпочитаете готовое решение «под ключ», два крупнейших облачных провайдера теперь включают защитные барьеры в свои предложения для LLM:

  • Amazon Bedrock Guardrails — настраиваемые политики, которые можно переключать для каждого запроса.
  • Azure Prompt Shields — аналогичные фильтры времени выполнения, интегрированные с Azure OpenAI Service.

Оба решения взимают плату за каждый запрос; миллион вызовов может быстро обойтись в несколько сотен долларов. Командам, экономящим бюджет, следует смоделировать ожидаемый трафик перед масштабным внедрением.

Как перестроить ваш стек безопасности

  1. Определите «смертельное трио». Выявите, где ваше приложение взаимодействует с (а) хранилищами конфиденциальных данных, (б) недоверенным пользовательским вводом и (в) внешними сетевыми вызовами. Устранение любого из этих факторов сокращает поверхность атаки сильнее, чем любой отдельный защитный барьер.
  2. Внедряйте Presidio на ранних этапах. Запускайте его на любых данных, которые планируете подавать в модель. Настройте список сущностей — стандартный набор помечает многие безобидные строки как PII, что может нарушить последующую обработку.
  3. Добавьте входной барьер. Начните с легковесного классификатора, такого как Llama Prompt Guard 2, или правила на основе Guardrails AI. Блокируйте очевидные паттерны инъекций до того, как они достигнут модели.
  4. Используйте многоуровневую проверку выхода. NeMo Guardrails или Guardrails AI могут проводить постобработку ответа модели, удаляя токсичную лексику или конфиденциальные фрагменты, которые просочились через фильтры.
  5. Интегрируйте promptfoo в CI. Относитесь к его отчетам как к контрольному списку; каждый новый обнаруженный способ обхода должен быть закодирован в виде правила в вашем входном или выходном барьере.
  6. Логируйте каждую блокировку. Сохраняйте исходный запрос, причину отклонения и предпринятое действие. Без логов вы не сможете настроить пороги срабатывания или провести аудит соответствия требованиям.

Контраргумент: управляемые сервисы против open source

Управляемые guardrails избавляют от операционных расходов на самостоятельный хостинг, установку патчей и масштабирование классификаторов. Однако они привязывают вас к модели ценообразования и политике провайдера, которая может не соответствовать специфическим нормативным требованиям. Инструменты с открытым исходным кодом дают полный контроль и могут работать локально (on-premise), но требуют инженерных усилий для их обновления и мониторинга новых методов атак. Командам следует сопоставить затраты рабочего времени сотрудников с платой за каждый запрос при использовании облачных guardrails.

На что обратить внимание в дальнейшем

  • Дорожные карты вендоров. Следите за анонсами продуктов в области ИИ-безопасности от Palo Alto и Check Point; вероятно, они интегрируют возможности приобретенных инструментов в свои более широкие пакеты решений.
  • Активность сообщества. Оценивайте состояние таких проектов, как NeMo Guardrails и Presidio, по недавней активности pull-request и частоте релизов. Застой в репозитории может сигнализировать о появлении более новых альтернатив.
  • Регуляторные рекомендации. Поскольку правительства ужесточают правила в отношении контента, созданного ИИ, и защиты данных, любая стратегия использования guardrails должна быть проверяемой. Логирование и отслеживаемость станут обязательными во многих юрисдикциях.

Итог

В связи с официальным прекращением поддержки LLM Guard, разработчикам придется комбинировать фильтры входных данных, санитайзеры выходных данных и состязательное тестирование, чтобы обеспечить безопасность своих приложений на базе LLM. Проекты с открытым исходным кодом, такие как NeMo Guardrails, Guardrails AI, Presidio, Llama Prompt Guard 2 и promptfoo, предоставляют базовые компоненты, в то время как облачные (cloud-native) guardrails предлагают удобство за определенную плату. Решающим фактором является не выбор конкретного инструмента, а создание систематического процесса — аудит, защита, тестирование и логирование, — который позволит опережать постоянно меняющуюся среду угроз.