Anthropic i OpenAI otworzyły nowe ścieżki badawcze, które pozwalają zweryfikowanym zespołom ds. bezpieczeństwa pracować z modelami AI pozbawionymi większości filtrów bezpieczeństwa. „Cyber Verification Program” firmy Anthropic oraz „Trusted Access for Cyber” firmy OpenAI dają zatwierdzonym badaczom bezpośredni dostęp do potężnych modeli językowych, które mogą generować nieograniczony kod, prompty i instrukcje. Ten ruch ma znaczenie, ponieważ tworzy wyraźny podział w łańcuchu dostaw AI: garstka osób z wewnątrz może badać najsłabsze wersje, podczas gdy reszta świata pozostaje za silniejszymi barierami ochronnymi.

Dlaczego powstały te programy

Obie firmy twierdzą, że inicjatywy te mają na celu przyspieszenie wykrywania podatności, które mogłyby zostać wykorzystane przeciwko ich usługom. Przekazując kontrolowanej grupie ekspertów piaskownicę (sandbox) z mniejszą liczbą ograniczeń, mają nadzieję na ujawnienie wektorów ataków, zanim znajdą je cyberprzestępcy. Podejście to odzwierciedla tradycyjne bezpieczeństwo oprogramowania, w którym programiści udostępniają wersje typu „bug-bounty” wybranej grupie odbiorców.

Nowe kalkulacje ryzyka dla obrońców

Druga strona medalu to dwupoziomowy model dostępu, który zmusza każdą organizację do wyznaczenia linii między „badaczem” a „hakerem”. Ta linia staje się teraz potencjalną powierzchnią ataku. Jeśli napastnik wykradnie dane uwierzytelniające, wykorzysta dostęp osoby z wewnątrz lub oszuka proces weryfikacji, może ominąć bariery chroniące większość użytkowników. Gdy już znajdzie się w środku, nieograniczony model można nakłonić do:

  • Generowania skryptów phishingowych omijających detekcję
  • Tworzenia exploitów typu zero-day wraz ze szczegółowymi fragmentami kodu
  • Produkowania przekonujących promptów do socjotechniki, dopasowanych do konkretnych celów

Zespoły ds. bezpieczeństwa, które budowały obronę w oparciu o założenie, że wyniki AI są zawsze filtrowane, muszą zweryfikować to założenie.

Jak obrońcy mogą reagować

  • Traktuj programy jako wektor zagrożenia. Przyjmij założenie, że przeciwnicy będą próbowali przeniknąć do procesu weryfikacji, i monitoruj nietypowe wzorce logowania na platformach AI.
  • Rozszerz detekcję poza chmurę. Szukaj kodu lub tekstu wygenerowanego przez AI w ruchu wychodzącym, szczególnie z kont uprzywilejowanych.
  • Wprowadź sztywne kontrole polityki. Egzekwuj surowe zasady „najmniejszych uprawnień” (least-privilege) dla każdego wewnętrznego wykorzystania zewnętrznych usług AI i segmentuj środowiska, do których może uzyskać dostęp osoba z przejętymi danymi uwierzytelniającymi.
  • Współpracuj z dostawcami. Pozostawaj w kontakcie z kanałami łączności ds. bezpieczeństwa Anthropic i OpenAI, aby otrzymywać powiadomienia o zmianach w kryteriach dostępu lub wykrytych nadużyciach.

Kontrargument

Zwolennicy argumentują, że bez bezpiecznego kanału do głębokich testów, podatności pozostaną ukryte, dopóki nie zostaną wykorzystane w rzeczywistych atakach. Programy te mogą zatem zmniejszyć ogólną powierzchnię ataku poprzez wczesne ujawnianie luk. Ceną za to jest fakt, że poziom „mniej strzeżony” zaprasza do oportunistycznych nadużyć.

Na co zwrócić uwagę

  • Aktualizacje procesu weryfikacji w obu firmach
  • Raporty o nadużyciach wynikających z tych programów
  • Zmiany w skali całej branży w sposobie katalogowania powierzchni ataków związanych z AI

Podsumowując: nowe ścieżki badawcze dają badaczom bezpieczeństwa potężne narzędzia, ale te same narzędzia przekazują każdemu, kto zdoła ominąć bramkę. Zespoły obronne muszą traktować te programy zarówno jako źródło wiedzy, jak i nową drogę ataku.