Badacze wykazali, że zaszyfrowane ślady rozumowania (reasoning traces) — małe pakiety przesyłane przez dostawcę na urządzenie użytkownika, aby rozmowa mogła przełączać się między modelami — mogą zostać odszyfrowane przez słabszy model z tej samej usługi, co prowadzi do wycieku setek poświadczeń i prywatnych szczegółów. Wynik ten, szczegółowo opisany w pracy Stealing Reasoning Traces from Proprietary LLM APIs, zagraża funkcji ułatwiającej wygodę, na której polegają Anthropic, OpenAI i Google, aby zapewnić płynność czatów AI.

Dlaczego istnieją zaszyfrowane bloki

Rozmawiając z dużym modelem językowym (LLM), usługa buduje „ślad rozumowania” (reasoning trace): łańcuch wewnętrznych promptów, wywołań narzędzi i kroków typu chain-of-thought, które doprowadziły do odpowiedzi. Aby umożliwić przejście z większego modelu na tańszy bez utraty tego łańcucha, dostawcy szyfrują ślad, przesyłają go na Twoje urządzenie i oczekują, że odeślesz go wraz z kolejnym zapytaniem. Szyfrowanie ma na celu zachowanie prywatności śladu przy jednoczesnym zapewnieniu ciągłości między sesjami i modelami.

Jak działa atak

Badacze zaprezentowali trzystopniowy exploit, który nie wymaga naruszenia samego silnego modelu:

  1. Przechwycenie zaszyfrowanego bloku rozumowania wygenerowanego przez potężny model podczas normalnej rozmowy.
  2. Podanie tego bloku słabszemu modelowi od tego samego dostawcy z prośbą o jego „przeczytanie”.
  3. Ponieważ słabszy model współdzieli te same klucze deszyfrujące, wyświetla on odszyfrowaną treść w formie czystego tekstu.

Słabszy model działa jak wyrocznia deszyfrująca (decryption oracle). Atakujący nigdy nie naruszyli wnętrza silnego modelu; po prostu wykorzystali API samego dostawcy przeciwko niemu.

Co odzyskali badacze

  • 182 poświadczenia – klucze API, tokeny i inne sekrety zaszyte w śladzie.
  • 367 fragmentów prywatnych informacji – imiona, adresy e-mail, adresy, które użytkownicy podali podczas czatu.
  • Payloade prompt-injection – złośliwe instrukcje ukryte w zaszyfrowanym bloku, które mogły zostać wykonane później podczas odtwarzania śladu.
  • Obejścia filtrów bezpieczeństwa – odszyfrowany ślad ujawnił kroki, które zostałyby zablokowane, gdyby zostały sprawdzone w formie czystego tekstu, co pozwala na przemycenie szkodliwych treści.

W pracy podkreślono, że słabość nie wynika z błędu w algorytmie kryptograficznym; samo szyfrowanie jest skuteczne. Naruszenie wynika z decyzji projektowej, która pozwala każdemu modelowi w flocie dostawcy odszyfrować blok w imię wygody użytkownika.

Kompromis leżący u podstaw problemu

Dostawcy zaimplementowali tę funkcję „przełączania modeli” w swoich API, ponieważ programiści i użytkownicy końcowi cenią ciągłość. Gdyby szyfrowanie było powiązane z pojedynczą instancją modelu lub sesją, płynne przekazywanie zadań zostałoby przerwane, zmuszając programistów do samodzielnego budowania zarządzania stanem. Autorzy pracy argumentują, że bezpieczeństwo zostało celowo poświęcone na rzecz elastyczności.

Co programiści powinni zrobić teraz

  • Traktuj zaszyfrowane ślady jak czysty tekst. Przyjmij założenie, że każdy log, pamięć podręczna lub system monitorowania przechowujący te dane może zostać odczytany przez atakującego.
  • Unikaj dodawania śladów do publicznych repozytoriów. Nawet jeden przypadkowy blok może ujawnić dziesiątki sekretów.
  • Przygotuj się na ściślejszą kontrolę. Dostawcy mogą zaostrzyć środki bezpieczeństwa, co może zmienić sposób budowania agentów wielomodelowych.
  • Przejdź na jawne przekazywanie stanu. Zamiast polegać na ukrytym rozumowaniu, projektuj agentów tak, aby generowali ustrukturyzowane dane (JSON, XML itp.), które można bezpiecznie przekazywać między modelami bez szyfrowania.
  • Audytuj swoje prompty. Szukaj wszelkich wrażliwych danych, które trafiają do łańcucha rozumowania, i usuwaj je przed wysłaniem zapytania.

Na co zwrócić uwagę u dużych dostawców

Publikacja pracy skłoni Anthropic, OpenAI i Google do ponownej oceny polityki deszyfrowania wbudowanej w ich API.

Szersze implikacje

Odkrycie to podkreśla klasyczny dylemat bezpieczeństwa: wygoda często otwiera tylne drzwi. Pozwalając każdemu modelowi na odszyfrowanie bloku należącego do użytkownika, dostawcy podali atakującym łatwą drogę do wrażliwych danych. Naprawa tego problemu prawdopodobnie sprawi, że integracje AI będą nieco bardziej uciążliwe, ale przywróci też oczekiwanie, że zaszyfrowane dane pozostaną zaszyfrowane.

Podsumowanie: Zaszyfrowane ślady rozumowania nie stanowią bariery bezpieczeństwa; są jedynie skrótem ułatwiającym wygodę, który może zostać wykorzystany przeciwko Tobie. Traktuj je jak czysty tekst, usuwaj je z logów i projektuj swoich agentów tak, aby przetrwali przyszłość, w której tylko model pierwotny będzie mógł odczytać własne myśli.