Półautonomiczny, czteroagentowy pipeline może ograniczyć halucynacje w eksploracyjnej analizie danych (EDA), odsuwając duże modele językowe (LLM) od obliczeń numerycznych i ograniczając ich rolę wyłącznie do podejmowania decyzji. Projekt ten pozwala modelowi zdecydować, co zbadać, podczas gdy zwykły kod uruchamiany w piaskownicy (sandbox) wykonuje właściwe obliczenia, dostarczając wyniki, które można weryfikować krok po kroku.

Dlaczego pojedyncze wywołanie LLM jest ryzykowne

Polecenie modelowi LLM: „spójrz na ten arkusz kalkulacyjny i powiedz mi, co jest interesujące”, skutkuje pojedynczym blokiem tekstu. Model zmyśla liczby, miesza rozumowanie z wynikiem i nie pozostawia żadnego śladu wskazującego, jak doszedł do danego wniosku. Gdy dochodzi do halucynacji – np. sfałszowanej statystyki lub pozornej korelacji – nie ma punktu kontrolnego, który mógłby wyłapać błąd, zanim trafi on do użytkownika.

Idea stojąca za półautonomicznym pipeline'em

Nowy przepływ pracy (workflow) dzieli EDA na cztery stałe etapy, z których każdy jest obsługiwany przez osobnego agenta. Agenci stosują wzorzec „planuj-potem-działaj” (plan-then-act): najpierw decydują, która operacja jest potrzebna, a następnie przekazują ją do kodu w piaskownicy, który ją faktycznie wykonuje. LLM nigdy nie wykonuje działań arytmetycznych ani manipulacji plikami; ogranicza się jedynie do oceny istotności danych.

Czterej agenci

  1. Agent czyszczenia danych – sprawdza typy kolumn, flaguje brakujące wartości i decyduje o strategiach imputacji lub konwersji typów.
  2. Agent analizy kolumn – wybiera odpowiednie wizualizacje (histogramy, wykresy pudełkowe itp.) dla każdej zmiennej na podstawie jej typu danych i rozkładu.
  3. Agent analizy relacji – ocenia każdą parę kolumn, wybiera te, które zasługują na głębszy test statystyczny, i szereguje je według potencjalnej wartości informacyjnej.
  4. Agent tworzenia raportów – tłumaczy wygenerowane wykresy i obliczone statystyki na wyjaśnienia w języku naturalnym, podkreślając godne uwagi wzorce i zastrzeżenia.

Każdy etap działa niezależnie, dzięki czemu agenci analizy kolumn i analizy relacji mogą pracować równolegle, co skraca całkowity czas trwania procesu.

W jaki sposób ograniczana jest autonomia

Zasada bezpieczeństwa pipeline'u jest prosta: każdy kod napisany przez model uruchamia się wewnątrz piaskownicy, która izoluje go od systemu gospodarza. Jeśli wykonanie się nie powiedzie, błąd jest przekazywany z powrotem do modelu, który ma do dwóch prób poprawienia skryptu, zanim pipeline zostanie przerwany. Zapobiega to powstawaniu nieskończonych pętli i gwarantuje, że model nigdy nie manipuluje bezpośrednio plikami ani nie wykonuje działań arytmetycznych.

Ponieważ rola modelu ogranicza się do decydowania o tym, co obliczyć, rzeczywiste liczby zawsze pochodzą z deterministycznego kodu. Jeśli agent analizy relacji podejrzewa związek między „Order ID” a „Month”, piaskownica uruchamia funkcję korelacji, zwraca precyzyjną wartość, a dopiero wtedy model komentuje, czy korelacja jest prawdopodobnie przyczynowa, czy przypadkowa.

Co to rozwiązuje – i jaki jest koszt

Zmniejszenie liczby halucynacji. Poprzez oddzielenie rozumowania od obliczeń, pipeline eliminuje najczęstsze źródło sfałszowanych statystyk: zgadywanie liczb przez model zamiast pozwolenia kodowi na ich wygenerowanie.

Modularność. Dodanie nowego etapu – na przykład agenta prognozowania szeregów czasowych – nie wymaga przepisywania całego promptu. Każdy agent jest autonomicznym modułem, który można wpiąć w stałą sekwencję.

Zysk prędkości. Równoległe wykonywanie niezależnych agentów skraca czas rzeczywisty w porównaniu z monolitycznym wywołaniem LLM, które musi sekwencyjnie realizować każdy krok.

Narzut złożoności. Kosztem jest bardziej rozbudowana architektura. Zespoły muszą utrzymywać środowisko piaskownicy, obsługiwać pętle zwrotne błędów i koordynować pracę wielu agentów.

Na co warto zwrócić uwagę w przyszłości

  • Integracje narzędziowe. Frameworki open-source, które abstrakcjonizują krok wykonywania w piaskownicy, mogłyby zmniejszyć obciążenie inżynieryjne i uczynić ten wzorzec bardziej dostępnym.
  • Standaryzowane kontrakty agentów. W miarę jak więcej zespołów będzie wdrażać wieloagentowe pipeline'y, mogą pojawić się wspólne interfejsy dla agentów typu „planuj-potem-działaj”, co ułatwi interoperacyjność.

Główna lekcja jest jasna: daj LLM wolność myślenia, a nie moc obliczeniową. Ograniczając jego autonomię do osądu i kierując każdą liczbę przez odizolowany kod, półautonomiczny pipeline EDA generuje wyniki, które można sprawdzić, którym można zaufać i którymi można się dzielić bez obawy o widmowe dane.

Source: https://dev.to/sraveend/agentic-but-only-semi-autonomous-designing-an-eda-pipeline-you-can-trust-4ha9
Community discussion: https://t.me/GyaanSetuAi