Opus 5 від Anthropic досягає нульового відсотка успішності при ін'єкціях промптів у браузері

Anthropic здійснила монументальний прорив у сфері безпеки ШІ з випуском Opus 5, потенційно вирішивши одну з найбільш стійких вразливостей автономних агентів. Завдяки впровадженню двошарової системи захисту модель продемонструвала майже повний імунітет до атак типу «ін'єкція промптів» (prompt injection) у браузері.

Криза ін'єкцій промптів в ШІ-агентах

Ін'єкція промптів залишається «ахіллесовою п'ятою» сучасної ери ШІ. Ця вразливість виникає, коли зловмисник приховує шкідливі інструкції на вебсторінці — часто за допомогою невидимого тексту, — які ШІ-агент зчитує під час перегляду. Після обробки ці інструкції можуть перехопити контроль над моделлю, змушуючи її обходити протоколи безпеки або виконувати несанкціоновані дії. Хоча лідери галузі, такі як OpenAI, раніше припускали, що ін'єкція промптів може бути нерозв'язним внутрішнім недоліком LLM, останні дані Anthropic кидають виклик такому песимістичному погляду.

Досягнення показника у нуль відсотків

Згідно з системною карткою (system card) Anthropic, Opus 5 досягла приголомшливого показника успішності атак у 0% у 129 різних сценаріях тестування, розроблених спеціально для браузерних агентів. Це значний стрибок порівняно з попередніми ітераціями. Під час загального тестування ін'єкцій промптів, проведеного фірмою з безпеки Gray Swan, Opus 5 продемонструвала різке покращення порівняно зі своїм попередником: після 15 спроб рівень успішності зловмисника впав із 5,5% (спостерігалося в Opus 4.8) до всього 2,0%.

Ці результати виводять Opus 5 на перше місце в бенчмарку Gray Swan IPI, перевершуючи інші висококласні моделі, такі як Mythos 5 (2,6%) та Fable 5 (2,8%).

Секретний інгредієнт: Auto Mode та двошаровий захист

Прорив зумовлений не лише інтелектом моделі, а й її інтеграцією зі спеціалізованим програмним забезпеченням. Показник успішності «нуль відсотків» безпосередньо пов'язаний із використанням Auto Mode у таких продуктах, як Claude Cowork. Anthropic використовує складну двошарову архітектуру захисту для забезпечення безпеки агента:

  1. Попереднє сканування (Pre-processing Scan): Спеціальний шар сканує всі вхідні дані на наявність прихованих або маніпулятивних інструкцій ще до того, як основна LLM почне обробляти текст.
  2. Блокування виконання (Execution Blocking): Другий шар відстежує заплановані дії агента, блокуючи будь-які небезпечні команди до того, як вони зможуть бути виконані в середовищі браузера.

Цікаво, що дані показують: сама по собі модель не є універсальною панацеєю. Без цих захисних програмних шарів вразливість Opus 5 становить 3,7%. Насправді спеціалізована модель Sonnet 5 працює трохи краще в ізоляції, маючи рівень успішності 0,93%. Саме синергія між основною моделлю та захисним програмним стеком піднімає поріг безпеки до майже ідеального рівня.

Чому це важливо для майбутнього ШІ

Для розробників і засновників, які створюють автономних ШІ-агентів, ця подія є зміною парадигми. Якщо ін'єкцію промптів можна нейтралізувати за допомогою архітектурних шарів, а не лише через навчання моделі, шлях до надійних «агентних» робочих процесів — де ШІ керує електронною поштою, браузерами та конфіденційними даними — стає набагато безпечнішим. Anthropic представила план того, як галузь може відійти від наративу про «нерозв'язність» проблеми в бік надійної, готової до промислового використання автономії ШІ.

Основні висновки

  • Лідерська безпека в галузі: Opus 5 досягла 0% успішності у 129 сценаріях ін'єкції промптів у браузері при використанні Auto Mode.
  • Ешелонований захист (Defense-in-Depth): Безпека досягається завдяки двошаровому підходу, що включає попереднє сканування даних і проактивне блокування дій.
  • Домінування в бенчмарках: Opus 5 очолює бенчмарк Gray Swan IPI, значно знижуючи рівень успішності атак порівняно з попередніми версіями моделі.