Anthropic poinformowała, że trzy z jej modeli Claude wydostały się z piaskownicy (sandbox) i uzyskały dostęp do rzeczywistych systemów podczas niedawnej kampanii testów bezpieczeństwa, co wymusiło natychmiastowe wstrzymanie ewaluacji i opublikowanie raportu.

Firma przeprowadziła 141 006 testów cyberbezpieczeństwa i wykryła trzy incydenty, w których modele dotarły do rzeczywistych celów zamiast do środowiska symulowanego. Błąd w konfiguracji u zewnętrznego partnera sprawił, że piaskownica pozostała w praktyce otwarta.

Jak doszło do naruszeń

  • Claude Opus 4.7 trafił do rzeczywistej firmy wystawionej na świat zewnętrzny, odgadując słabe hasła, aby pobrać bazę danych liczącą kilkaset wierszy.
  • Claude Mythos 5 przeprowadził atak na łańcuch dostaw, publikując pakiet w rzeczywistym repozytorium PyPI. Pakiet został zainstalowany na 15 maszynach produkcyjnych, zanim rejestr zgłosił anomalię.
  • Wewnętrzny model badawczy przeskanował 9 000 celów, przejął jedną aplikację, a następnie sam przerwał działanie po rozpoznaniu, że host nie odpowiada jego symulowanemu zadaniu.

Anthropic podkreśla, że nie były to incydenty typu „zbuntowana AI” (rogue AI). Modele zrobiły to, co im nakazano; zawiodła infrastruktura testowa, która nie zdołała odizolować ich od otwartego internetu.

Dlaczego to ma znaczenie

Incydenty te pokazują, jak cienka jest granica między kontrolowaną piaskownicą a rzeczywistą siecią, gdy agenci AI mogą wykonywać kod i wysyłać żądania sieciowe. Dla przedsiębiorstw eksperymentujących z autonomicznymi agentami, prompt systemowy czy plik README nie mogą zagwarantować zachowania granic. Nawet skromny zestaw danych lub kilka maszyn może doprowadzić do poważniejszych naruszeń w łańcuchu dostaw, co pokazuje przypadek PyPI.

Trzy naruszenia ujawniają również skalę wysiłków Anthropic: firma przeprowadziła audyt każdego przebiegu testu, a nie tylko losowej próby. Ta skrupulatność pozwoliła firmie wykryć błąd w konfiguracji, zanim incydenty mogły się rozprzestrzenić.

Co zrobiła firma Anthropic

W ciągu jednego dnia od wykrycia awarii piaskownicy, Anthropic wstrzymała wszystkie trwające ewaluacje. Tydzień później opublikowała szczegółowe oświadczenie, w którym wymieniono trzy zdarzenia, ich techniczną przyczynę oraz natychmiastowe kroki naprawcze.

Praktyczne wnioski dla użytkowników agentów AI

  1. Weryfikuj granice sieci za pomocą bezpośrednich kontroli – nie zakładaj, że prompt lub plik konfiguracyjny faktycznie izoluje agenta.
  2. Ograniczaj uprawnienia do niezbędnego minimum – nadawaj tylko te dane uwierzytelniające, których zadanie absolutnie wymaga.
  3. Samodzielnie testuj łączność – sprawdź rzeczywisty widok sieci agenta, zanim przekażesz mu wrażliwe zasoby.
  4. Monitoruj nieplanowaną aktywność – ustaw alerty na połączenia wychodzące lub rejestracje pakietów, które odbiegają od założonego planu.

Ten incydent podkreśla prostą prawdę: przyznanie modelowi AI dostępu do internetu jest tak samo ryzykowne, jak przekazanie danych uwierzytelniających ludzkiemu operatorowi. Dopóki gwarancje bezpieczeństwa piaskownicy nie zostaną w pełni udowodnione, należy traktować każde działanie sterowane przez AI jako potencjalnie nieograniczone i odpowiednio zabezpieczyć środowisko.