Метт Шумер сів за свій комп'ютер і дав своєму ШІ-агенту просту інструкцію: прибери файли. Він запускав цю процедуру сотні разів без жодних проблем. Цього разу помилка розв'язання шляху перетворила звичайне прибирання на справжню катастрофу. Роки коду, документів і фотографій зникли за лічені секунди.

Це не гіпотетичний ризик. Це сталося з реальним розробником на реальній машині, а агент, про якого йдеться, мав бездоганну репутацію аж до моменту збою. ШІ-агенти, які можуть записувати файли, виконувати команди термінала та створювати субагентів, тепер інтегровані в IDE, чат-інтерфейси та конвеєри автоматизації. Їм довіряють прямий доступ до операційних систем, і саме в цій довірі криється небезпека. Ті самі сценарії відмов, що знищили машину Шумера, існують у кожному агенті з доступом до інструментів. Розуміння того, чому вони дають збої та як їх належним чином обмежити, стає базовою навичкою виживання для кожного, хто використовує ці інструменти.

Коли зіставлення шаблонів зустрічається з файловою системою

ШІ-агенти не мислять. Вони зіставляють шаблони. Коли ви кажете «прибери файли», модель шукає у своїй тренувальні пам'яті тисячі подібних взаємодій і генерує команду, яка статистично відповідає шаблону. Якщо інструкція полягає в тому, щоб видалити тимчасові файли в директорії збірки, вона може згенерувати таку команду, як rm -rf /tmp/build-cache/*. Це виглядає логічно, оскільки нагадує всі інші команди очищення, які модель коли-небудь бачила.

Але що стається, коли змінна на кшталт $HOME не розв'язується? Людина побачить порожній рядок або неочікуваний шлях, зупиниться і поставить запитання. Агент бачить, що шаблон усе ще збігається, і натискає Enter. У випадку Шумера команда, яка мала очистити конкретну папку, замість цього націлилася на корінь каталогу користувача. Агент не зупинився, щоб замислитися, чому шлях виглядає дивно. Він не перевірив ціль. Він виконав команду, тому що виконання відповідало шаблону «прибирання».

Це основна невідповідність між великими мовними моделями та системним адмініструванням. Справжнє мислення передбачає розуміння контексту, перевірку припущень і обробку граничних випадків. Зіставлення шаблонів передбачає створення тексту, який статистично нагадує правильну відповідь. Коли цією відповіддю є команда термінала з прапорцем рекурсивного видалення, статистичної схожості недостатньо.

Сліпа зона субагентів

Багато сучасних фреймворків агентів використовують головний оркестратор, який делегує завдання субагентам. Батьківський агент може мати суворі інструкції: ніколи не чіпати домашній каталог, завжди запитувати перед видаленням, вести журнал аудиту. Потім він створює робочий процес із вузьким промптом, наприклад: «очисти старі логи».

Цей субагент часто працює ізольовано. Він успадковує інструменти, але не культуру безпеки батьківського агента. Обмеження, які робили головного агента обережним, стискаються, узагальнюються або повністю втрачаються під час керування контекстним вікном. Субагент отримує завдання та набір інструментів, але він не отримує тих годин ретельного промптингу, які встановили захисні бар'єри.

Результатом є свого роду організаційна амнезія. Правило безпеки, яке міститься в системному промпті батьківського агента, для субагента може просто не існувати. Це особливо небезпечно, оскільки субагентам зазвичай дають повторювані завдання низького рівня важливості, за якими оператори перестають пильно стежити. Ніхто не стежить за завданням з очищення логів, поки воно не видалить робочу базу даних.

Небезпека рішучості

У дизайні ШІ-агентів спостерігається тенденція до максимальної автономії. Ідеальний агент у цьому баченні ніколи не турбує користувача тривіальними питаннями. Він діє рішуче, послідовно викликає інструменти та завершує багатоетапні робочі процеси, не зупиняючись перепочити.

Саме ця рішучість робить такі системи небезпечними. Модель, запрограмовану «діяти рішуче», не перевіряє свою роботу двічі. Вона не зупиняється, коли команда виглядає деструктивною. Вона сприймає вагання як помилку, а не як особливість. Коли модель права, це здається магією. Коли вона помиляється, це здається нестримним руйнуванням. У системі немає природного опору, який міг би сповільнити виконання шкідливої команди.

Агент Shumer працював правильно сотні разів. Такий досвід створив хибне відчуття безпеки. Але надійність протягом сотні випробувань нічого не варта, якщо сто перше випробування стає статистичним викидом, у якому порушується закономірність. У системній безпеці минулі результати мають значення лише тоді, коли режим відмови є поступовим і помітним. Збої ШІ-агентів є раптовими, безшумними та повними. «Він працював сотні разів» — це не показник безпеки. Це опис везіння, яке зрештою закінчується.

Як побудувати справжній захист

Якщо модель не є рівнем безпеки