Nowe narzędzie Deep Research od Claude może przetworzyć 6,57 miliona tokenów w ramach jednego wywołania — coś, co jest możliwe tylko przy ogromnym budżecie obliczeniowym. System nie jest monolitycznym modelem językowym; działa jako rygorystyczny potok (pipeline) map-reduce w JavaScript, który rozprasza wyszukiwania, pobiera dane, zestawia twierdzenia z trzema niezależnymi weryfikatorami, a następnie syntetyzuje raport.

Dlaczego ta architektura ma znaczenie

Większość asystentów badawczych opartych na AI oferuje pojedynczy interfejs typu „zapytaj i odpowiedz”, pozwalając modelowi generować tekst i cytaty za jednym razem. Claude Deep Research wywraca ten model do góry nogami. Dzieli zadanie na odrębne, typowane etapy i zmusza model do przestrzegania mechanizmu kontrolnego (harness). Projektanci stworzyli go tak, aby trzymać halucynacje w ryzach, jednocześnie dostarczając bogate, oparte na źródłach odpowiedzi. Podejście to wywodzi się z automatycznych frameworków do wykrywania błędów, w których generowana jest hipoteza, a następnie celowo próbuje się ją obalić. W terminologii badawczej: twierdzenie zostaje sformułowane, a następnie trzech agentów konfrontacyjnych próbuje je „zabić”, zanim dotrze ono do końcowej syntezy.

Przepływ map-reduce

  1. Wyszukiwanie typu fan-out – orkiestrator tworzy równoległe procesy (workers), które przeszukują szereg źródeł danych.
  2. Pobieranie danych – każdy worker pobiera surowe fragmenty, metadane i wszelkie dostępne informacje ustrukturyzowane.
  3. Weryfikacja konfrontacyjna – trzej niezależni agenci otrzymują każde twierdzenie, a każdy z nich ma instrukcję, aby w przypadku niepewności domyślnie wybierać opcję odrzucone (refuted). Twierdzenie przetrwa tylko wtedy, gdy zbierze wystarczającą liczbę głosów potwierdzających.
  4. Synteza – przetrwałe twierdzenia są łączone w końcowy raport JSON, który użytkownik może wyrenderować jako tekst ciągły.

Wewnątrz mechanizmu kontrolnego (harness)

Harness to cienka warstwa kodu, która definiuje, co model językowy może robić. Jego reguły występują jako zestaw ustrukturyzowanych zadań:

  • SCOPE (ZAKRES) – model otrzymuje zwięzły opis pytania badawczego.
  • SEARCH (WYSZUKIWANIE) – musi wygenerować listę identyfikatorów źródeł, a nie tekst swobodny.
  • EXTRACT (EKSTRAKCJA) – dla każdego źródła model zwraca dosłowny cytat, który potwierdza każde późniejsze twierdzenie.
  • VERDICT (WERDYKT) – generuje obiekt JSON zawierający twierdzenie, wspierający je cytat oraz wynik pewności (confidence score).
  • REPORT (RAPORT) – końcowy etap pakuje wszystkie zweryfikowane twierdzenia w pojedynczy dokument.

Mechanizm wymusza wiązanie dowodów (evidence binding): twierdzenie bez dokładnego cytatu jest automatycznie odrzucane. Wykorzystuje on również stałe polityki (policy constants), które można modyfikować bez zmiany kodu — np. ile głosów potwierdzających musi zebrać twierdzenie, ile źródeł może przeczytać system lub maksymalną liczbę twierdzeń przechodzących do weryfikacji.

Między ekstrakcją a weryfikacją znajduje się etap segregacji (triage). Zamiast wysyłać każde twierdzenie do kosztownych agentów konfrontacyjnych, system szereguje je według ważności i jakości źródła, a następnie przekazuje tylko 25 najważniejszych. Ta selekcja zapobiega niekontrolowanemu wzrostowi zużycia tokenów i kosztów obliczeniowych.

Weryfikacja konfrontacyjna w praktyce

Etap weryfikacji jest celowo surowy. Każdy z trzech agentów otrzymuje to samo twierdzenie i odpowiadający mu cytat źródłowy, a następnie działa zgodnie ze zbiorem instrukcji, który nakazuje mu założyć, że twierdzenie jest fałszywe, chyba że znajdzie rozstrzygający dowód. Jeśli którykolwiek agent ma wątpliwości, głosuje jako odrzucone. Twierdzenie musi zebrać określoną liczbę głosów potwierdzających, aby przetrwać.

Podczas nieformalnych testów warstwa konfrontacyjna wyłapała twierdzenie, w którym błędnie odczytano metrykę zagregowaną jako konkretny wynik precyzji. Model wygenerował pewne stwierdzenie na temat precyzji, podczas gdy źródło raportowało jedynie metrykę zagregowaną.

Co ten projekt mówi o budowaniu systemów AI

  1. Oddzielenie kontroli od rozumowania – model pozostaje odpowiedzialny za wnioskowanie; mechanizm kontrolny wymusza dyscyplinę procesu.
  2. Typowane interfejsy ograniczają halucynacje – poprzez wymuszanie wyjścia w formacie JSON i dokładnych cytatów, system eliminuje dryfowanie w stronę tekstu swobodnego.
  3. Filtrowanie twierdzeń przed kosztownym etapem weryfikacji redukuje zużycie tokenów i koszty obliczeniowe.
  4. Traktowanie zewnętrznych danych jako niepewnych – każdy cytat źródłowy jest sprawdzany przez niezależnych agentów, co zapobiega zanieczyszczeniu odpowiedzi przez pojedynczy błędny dokument.

Zasady te odzwierciedlają szerszy zwrot w stronę architektur typu „model poza modelem” (model-outside-the-model), gdzie deterministyczny kod zajmuje się orkiestracją, walidacją i alokacją zasobów zamiast probabilistycznego modelu językowego.

Potencjalne wady i otwarte pytania

Siła tego potoku — jego rygor — niesie ze sobą również wyzwania.

Kolejnym punktem spornym jest poleganie na dosłownych cytatach. Nie cała wiedza kryje się w precyzyjnych sformułowaniach; niektóre spostrzeżenia wyłaniają się dopiero po syntezie informacji z wielu dokumentów.

Na co warto zwrócić uwagę w przyszłości

Claude’s Deep Research znajduje się wciąż w fazie badawczej, ale jego architektura zapowiada przyszłość, w której duże modele językowe będą osadzone w ściśle kontrolowanych potokach (pipelines), zamiast pozostawiać je samopas. Kluczowe wskaźniki do monitorowania to:

  • Metryki wydajności tokenów – Czy bazowy poziom 6,57 mln tokenów ulegnie zmniejszeniu, gdy system zyska bardziej selektywną logikę segregacji?
  • Trendy opóźnień (latency) – Jak szybko system może zwrócić kompletny raport, gdy w procesie bierze udział trzech agentów weryfikujących?

Wnioski

Claude’s Deep Research pokazuje, że model językowy może generować wiarygodne odpowiedzi oparte na źródłach, gdy zostanie ograniczony do zdyscyplinowanego, wieloetapowego potoku przetwarzania. Prawdziwym przełomem nie jest rozmiar modelu, lecz otaczające go oprogramowanie, które zmusza model do udowadniania każdego twierdzenia, rangowania dowodów przed zużyciem zasobów obliczeniowych i traktowania każdego zewnętrznego fragmentu jako podejrzanego, dopóki trzech agentów nie potwierdzi inaczej. Dla każdego, kto buduje narzędzia oparte na AI, lekcja jest jasna: pozwól modelowi myśleć, ale pozwól kodowi decydować o tym, co może powiedzieć.