Matt Shumer usiadł przy komputerze i wydał swojemu agentowi AI proste polecenie: posprzątaj pliki. Uruchamiał tę rutynę setki razy bez żadnego problemu. Tym razem błąd rozwiązywania ścieżki zmienił zwykłe porządki w prawdziwą katastrofę. Lata kodu, dokumentów i zdjęć zniknęły w kilka sekund.

To nie jest hipotetyczne ryzyko. Przytrafiło się to prawdziwemu programiście na prawdziwym sprzęcie, a wspomniany agent miał historię działania, która wydawała się nie do zdarcia aż do momentu awarii. Agenci AI, którzy potrafią zapisywać pliki, wykonywać polecenia w terminalu i tworzyć podagentów, są obecnie zintegrowani z IDE, interfejsami czatu i potokami automatyzacji. Powierza się im bezpośredni dostęp do systemów operacyjnych, a to właśnie w tym zaufaniu kryje się niebezpieczeństwo. Te same tryby awarii, które zniszczyły maszynę Shumera, występują w każdym agencie posiadającym dostęp do narzędzi. Zrozumienie, dlaczego zawodzą i jak je odpowiednio ograniczyć, staje się teraz podstawową umiejętnością przetrwania dla każdego, kto korzysta z tych narzędzi.

Gdy dopasowywanie wzorców spotyka się z systemem plików

Agenci AI nie myślą. Oni dopasowują wzorce. Gdy mówisz „posprzątaj pliki”, model przeszukuje swoją pamięć treningową w poszukiwaniu tysięcy podobnych interakcji i generuje polecenie, które statystycznie pasuje do wzorca. Jeśli instrukcja brzmi „usuń pliki tymczasowe w katalogu budowania”, może wygenerować polecenie typu rm -rf /tmp/build-cache/*. Wygląda ono sensownie, ponieważ przypomina każde inne polecenie czyszczenia, jakie model kiedykolwiek widział.

Ale co się dzieje, gdy zmienna taka jak $HOME nie zostanie poprawnie rozwiązana? Człowiek widzi pusty ciąg znaków lub nieoczekiwaną ścieżkę, zatrzymuje się i zadaje pytania. Agent widzi, że wzorzec nadal się zgadza, i naciska Enter. W przypadku Shumera polecenie, które miało wyczyścić konkretny folder, zamiast tego uderzyło w katalog główny użytkownika. Agent nie zatrzymał się, by zastanowić się, dlaczego ścieżka wygląda dziwnie. Nie zweryfikował celu. Wykonał polecenie, ponieważ wykonanie pasowało do wzorca „sprzątania”.

To sedno niedopasowania między dużymi modelami językowymi a administracją systemami. Prawdziwe rozumowanie polega na rozumieniu kontekstu, weryfikowaniu założeń i radzeniu sobie ze przypadkami brzegowymi. Dopasowywanie wzorców polega na generowaniu tekstu, który statystycznie przypomina poprawną odpowiedź. Gdy tą odpowiedzią jest polecenie terminala zawierające flagę rekurencyjnego usuwania, statystyczne podobieństwo to za mało.

Martwe pole podagentów

Wiele nowoczesnych frameworków agentowych wykorzystuje główny orkiestrator, który deleguje zadania do podagentów. Rodzic może mieć surowe instrukcje: nigdy nie dotykaj katalogu domowego, zawsze pytaj przed usunięciem, prowadź dziennik audytu. Następnie tworzy pracownika z wąskim promptem, takim jak „wyczyść stare logi”.

Ten podagent często działa w izolacji. Dziedziczy narzędzia, ale nie kulturę bezpieczeństwa rodzica. Ograniczenia, które sprawiały, że główny agent był ostrożny, zostają skompresowane, podsumowane lub całkowicie pominięte podczas zarządzania oknem kontekstowym. Podagent otrzymuje zadanie i zestaw narzędzi, ale nie otrzymuje godzin starannego promptowania, które ustanowiło bariery ochronne.

Rezultatem jest rodzaj amnezji organizacyjnej. Zasada bezpieczeństwa zawarta w prompcie systemowym agenta nadrzędnego może dla podagenta w ogóle nie istnieć. Jest to szczególnie niebezpieczne, ponieważ podagentom zazwyczaj przydziela się powtarzalne, mało istotne zadania, których operatorzy przestają uważnie pilnować. Nikt nie obserwuje zadania czyszczenia logów, dopóki nie usunie ono bazy danych produkcyjnej.

Niebezpieczeństwo zdecydowania

W projektowaniu agentów AI widać trend dążenia do maksymalnej autonomii. W tej wizji idealny agent nigdy nie zawraca użytkownikowi głowy błahymi pytaniami. Działa zdecydowanie, łączy wywołania narzędzi w łańcuchy i realizuje wieloetapowe procesy bez chwili oddechu.

To właśnie to zdecydowanie sprawia, że systemy te są niebezpieczne. Model zaprogramowany do „decydowania”, nie sprawdza dwukrotnie swojej pracy. Nie zatrzymuje się, gdy polecenie wygląda na niszczycielskie. Traktuje wahanie jako błąd, a nie funkcję. Gdy model ma rację, wydaje się to magiczne. Gdy się myli, wydaje się niepowstrzymane. W systemie brakuje naturalnego oporu, który mógłby spowolnić błędne polecenie.

Agent Shumera działał poprawnie setki razy. Ta historia sukcesów stworzyła fałszywe poczucie bezpieczeństwa. Jednak niezawodność w stu próbach nie znaczy nic, jeśli próba numer sto jeden jest statystyczną wartością odstającą, w której wzorzec zostaje przerwany. W bezpieczeństwie systemów dotychczasowe wyniki mają znaczenie tylko wtedy, gdy tryb awarii jest stopniowy i widoczny. Awarie agentów AI są nagłe, ciche i całkowite. „Działało setki razy” to nie jest dowód bezpieczeństwa. To opis szczęścia, które w końcu się kończy.

Jak zbudować rzeczywistą ochronę

Jeśli model nie jest warstwą bezpieczeństwa