Дослідники довели, що зашифровані траси міркувань (reasoning traces) — крихітні пакети даних, які провайдер надсилає на пристрій користувача для перемикання між моделями — можуть бути розшифровані слабшою моделлю того ж сервісу, що призводить до витоку сотень облікових даних і приватних деталей. Результати дослідження, викладені в роботі Stealing Reasoning Traces from Proprietary LLM APIs, ставлять під загрозу функцію зручності, на яку покладаються Anthropic, OpenAI та Google для забезпечення безперервності чатів з ШІ.
Навіщо потрібні зашифровані блоки
Коли ви спілкуєтеся з великою мовною моделлю (LLM), сервіс формує «трасу міркувань» (reasoning trace): ланцюжок внутрішніх промптів, викликів інструментів та кроків «ланцюжка думок» (chain-of-thought), які призвели до відповіді. Щоб дозволити вам перемикатися з більшої моделі на дешевшу без втрати цього ланцюжка, провайдери шифрують трасу, надсилають її на ваш пристрій і очікують, що ви надішлете її назад із наступним запитом. Шифрування має забезпечувати конфіденційність траси, водночас дозволяючи безперервність між сесіями та моделями.
Як працює атака
Дослідники продемонстрували триетапний експлойт, який не потребує зламу самої сильної моделі:
- Перехоплення зашифрованого блоку міркувань, згенерованого потужною моделлю під час звичайного діалогу.
- Передача цього блоку слабшій моделі того ж провайдера з проханням «прочитати» його.
- Оскільки слабша модель має ті ж ключі дешифрування, вона виводить розшифрований вміст у відкритому тексті.
Слабша модель діє як оракул дешифрування. Зловмисники ніколи не торкалися внутрішніх механізмів сильної моделі; вони просто використали власний API провайдера проти нього самого.
Що вдалося відновити дослідникам
- 182 облікові дані — API-ключі, токени та інші секрети, вбудовані в трасу.
- 367 фрагментів приватної інформації — імена, електронні адреси, адреси, які користувачі надавали під час чату.
- Корисне навантаження для промпт-ін'єкцій — шкідливі інструкції, приховані в зашифрованому блоці, які можуть бути виконані пізніше під час повторного відтворення траси.
- Обхід фільтрів безпеки — розшифрована траса виявила кроки, які були б заблоковані, якби їх перевіряли у відкритому тексті, що дозволяє небезпечному контенту проходити крізь систему.
У роботі наголошується, що вразливість не є недоліком криптографічного алгоритму; саме шифрування залишається надійним. Порушення стається через архітектурне рішення дозволити будь-якій моделі у флоті провайдера розшифровувати блок заради зручності користувача.
Компроміс, що лежить в основі проблеми
Провайдери вбудували цю можливість «перемикання моделей» у свої API, оскільки розробники та кінцеві користувачі цінують безперервність. Якби шифрування було прив'язане до одного екземпляра моделі або сесії, плавна передача даних була б неможливою, що змусило б розробників самостійно керувати станом (state management). У роботі стверджується, що безпекою свідомо пожертвували заради гнучкості.
Що розробникам робити зараз
- Ставтеся до зашифрованих трас як до відкритого тексту. Припускайте, що будь-який лог, кеш або система моніторингу, де вони зберігаються, можуть бути прочитані зловмисником.
- Уникайте збереження трас у публічних репозиторіях. Навіть один випадковий блок може викрити десятки секретів.
- Плануйте суворіший контроль. Провайдери можуть посилити безпеку, що може змінити спосіб побудови мультимодельних агентів.
- Переходьте до явного перемикання станів. Замість того, щоб покладатися на приховані міркування, проєктуйте агентів так, щоб вони видавали структуровані дані (JSON, XML тощо), які можна безпечно передавати між моделями без шифрування.
- Аудитуйте свої промпти. Шукайте будь-які конфіденційні дані, які потрапляють у ланцюжок міркувань, і видаляйте їх перед надсиланням запиту.
За чим стежити з боку великих провайдерів
Публікація цієї роботи змусить Anthropic, OpenAI та Google переглянути політику дешифрування, закладену в їхні API.
Ширші наслідки
Це відкриття підкреслює класичну дилему безпеки: зручність часто відкриває «бекдор». Дозволяючи будь-якій моделі розшифровувати блок, що належить користувачеві, провайдери дають зловмисникам легкий шлях до конфіденційних даних. Виправлення, ймовірно, зробить інтеграцію ШІ дещо складнішою, але воно також відновить очікування, що зашифровані дані залишатимуться зашифрованими.
Висновок: Зашифровані траси міркувань не є межею безпеки; це шлях полегшення, який може бути використаний проти вас. Ставтеся до них як до відкритого тексту, видаляйте їх із логів і перепроектовуйте своїх агентів так, щоб вони могли працювати в майбутньому, де лише модель-оригінатор зможе читати власні думки.
