Выпущен новый бенчмарк безопасности для ИИ-ассистентов Kubernetes. Он оценивает, могут ли такие инструменты, как K8sGPT, правильно воздерживаться от рискованных исправлений. Основанный на 163 размеченных инцидентах, бенчмарк заставляет ассистента распознавать неопределенность и избегать небезопасных действий еще до того, как будет выдана какая-либо команда.
Почему важен новый бенчмарк
Инструменты ИИ для DevOps и SRE (site-reliability engineering) за последний год размножились. Продукты теперь сканируют кластеры, выявляют ошибки и предлагают команды для устранения неполадок. Большинство пользователей задаются очевидным вопросом: Может ли инструмент решить проблему? В условиях продакшена этот вопрос не полон. Уверенное, но ошибочное исправление может перезапустить не ту рабочую нагрузку, удалить критически важный namespace или применить изменение конфигурации, которое приведет к каскадному сбою. Настоящая проверка безопасности заключается в том, знает ли система, когда нужно ничего не делать.
Что оценивает бенчмарк
Бенчмарк расширяет привычные тесты формата «только диагностика», охватывая более широ
