Badacze Yuxing Lu, Yicheng Chen i Shanchan Wu udostępnili framework „Procedural Graph”, który pozwala agentom opartym na dużych modelach językowych (LLM) na przepisywanie własnych planów wykonywania zadań w trakcie pracy.
Problem z dzisiejszymi agentami
Większość asystentów napędzanych przez LLM działa jak szef kuchni, który potrafi jedynie recytować przepis. Model przechowuje kroki w pamięci ulotnej, wybiera kolejne narzędzie i liczy na to, że kolejny token zostanie wygenerowany poprawnie. W praktyce często pojawiają się trzy rodzaje błędów:
- Dryf celu – po kilku krokach agent zapomina o pierwotnym celu.
- Niewłaściwe użycie narzędzi – wywołuje API w niewłaściwej kolejności lub wpada w pętlę przy tym samym wywołaniu.
- Błędy, z których nie wyciągnięto wniosków – ten sam błąd powraca w niezwiązanych ze sobą sesjach, ponieważ nic trwałego nie rejestruje niepowodzenia.
Ponieważ rozumowanie pozostaje niejawne, programiści nie mogą zobaczyć, dlaczego podjęto daną akcję, a użytkownicy nie mogą korygować systematycznych błędów.
Przekształcanie promptów w graf
Procedural Graphs zastępują podejście oparte wyłącznie na pamięci jawną, edytowalną strukturą. Framework definiuje trzy kluczowe elementy:
| Element | Rola |
|---|---|
| Węzeł (Node) | Konkretny krok, taki jak „Wyszukaj lot” lub „Zweryfikuj płatność”. |
| Krawędź (Edge) | Przepływ między węzłami – sekwencje liniowe, gałęzie warunkowe (if/then) i pętle. |
| Atrybut (Attribute) | Metadane przypisane do węzła lub krawędzi, np. współczynnik sukcesu, średni czas wykonania lub wynik pewności (confidence score). |
Gdy agent LLM otrzymuje zapytanie, najpierw mapuje je na istniejący graf lub tworzy nowy w locie. Następnie wykonanie podąża wzdłuż krawędzi, wywołuje narzędzia i zapisuje wyniki w atrybutach. Ponieważ graf znajduje się poza strumieniem tokenów modelu, można go inspekcjonować, wizualizować i edytować.
Samodoskonalenie w pięciu krokach
Nowość polega na pętli, która pozwala agentowi ulepszać własny graf:
- Rejestruj każdą ścieżkę, którą porusza się agent, logując dane wejściowe, wywołania narzędzi i wyniki.
- Porównuj ścieżki udane z nieudanymi, wskazując miejsca, w których się rozchodzą.
- Diagnozuj błąd poprzez badanie atrybutów węzłów (np. niski współczynnik sukcesu) i warunków krawędzi.
- Proponuj edycje – LLM otrzymuje analizę niepowodzenia i sugeruje modyfikacje grafu (dodanie brakującego kroku walidacji, usunięcie zbędnej pętli, zaostrzenie warunku).
- Waliduj poprawiony graf na instancji testowej; jeśli wydajność wzrośnie, zmiana zostaje wprowadzona na stałe.
Ponieważ graf służy jako jedyne źródło prawdy, agent może dodawać kroki, usuwać ślepe zaułki lub zmieniać logikę bez pomocy człowieka. Nawet niezdarny, stworzony przez człowieka przepływ pracy może z czasem ulec samonaprawie.
Dlaczego ta zmiana jest ważna
Generalizacja wykraczająca poza zapamiętywanie
Statyczny prompt obejmuje tylko jedną instancję zadania. Graf abstrahuje sposób wykonania („how-to”) dla całej klasy zadań – takich jak wyszukiwanie i rezerwacja, potoki wprowadzania danych czy dialogi rozwiązywania problemów – dzięki czemu ta sama struktura działa z różnymi parametrami. Zespoły nie muszą już ponownie tworzyć promptów dla każdej wariacji.
Przejrzyste podejmowanie decyzji
Graf przypomina schemat blokowy. Interesariusze mogą dokładnie prześledzić, który węzeł wywołał użycie narzędzia i dlaczego wybrano daną gałąź.
Synergia neuro-symboliczna
Procedural Graphs łączą rozpoznawanie wzorców przez głębokie uczenie (zrozumienie języka przez LLM) z rozumowaniem symbolicznym (jawna logika grafu). LLM dostarcza intuicji do generowania lub modyfikowania kroków, natomiast graf wymusza spójność logiczną. Autorzy opisują to jako wyposażenie LLM w mózg typu „System 2” – celowy, sprawdzalny kontroler, który uzupełnia szybki, asocjacyjny „System 1” surowej predykcji tokenów.
Wnioski
Procedural Graphs zapewniają agentom LLM zmienny, podlegający inspekcji kręgosłup, który pozwala im uczyć się na każdej realizacji. Przekształcając ulotne prompty w trwałe struktury, podejście to obiecuje asystentów AI, których trudniej „zepsuć”, łatwiej zrozumieć i które są bardziej adaptowalne do nowych wyzwań.
