Hark, dynamicznie rozwijający się startup wspierany przez 700 milionów dolarów w ramach rundy finansowania serii A, oficjalnie zaprezentował „Handoff” – inteligentnego agenta zaprojektowanego do poruszania się po sieci w sposób zbliżony do ludzkiego. Wykraczając poza proste generowanie tekstu, Handoff ma na celu automatyzację złożonych procesów pracy na stronach internetowych, które nie posiadają oficjalnego wsparcia API.
Nawigowanie po sieci bez API
Jedną z najpoważniejszych przeszkód w automatyzacji jest poleganie na ustrukturyzowanych interfejsach API. Agent Handoff od Hark omija to ograniczenie, analizując zarówno strukturę strony internetowej, jak i dane wizualne, aby wchodzić w interakcję z interfejsami. Pozwala to agentowi na płynną nawigację po popularnych platformach bez API, takich jak Target, Walmart, OpenTable czy LinkedIn.
Agent działa poprzez rozumienie wskazówek wizualnych, co pozwala mu określić, kiedy kliknąć przycisk, przewinąć stronę lub wprowadzić tekst. Podczas niedawnej demonstracji CEO Brett Adcock zaprezentował zdolność agenta do obsługi złożonej, „rozmytej” (fuzzy) logiki – na przykład tworzenia niestandardowego bukietu kwiatów, w którym użytkownik określa: „część kwiatów według wyboru florysty”. Ta zdolność sugeruje poziom rozumienia semantycznego wykraczający poza sztywne wykonywanie poleceń, co umożliwia bardziej naturalną interakcję człowiek-agent.
Przejście od przewidywania kolejnego tokenu do przewidywania kolejnej akcji
Pod względem technicznym Hark odchodzi od standardowego paradygmatu dużych modeli językowych (LLM). Podczas gdy tradycyjne modele LLM są zoptymalizowane pod kątem przewidywania kolejnego tokenu w sekwencji tekstu, model Hark został zaprojektowany tak, aby przewidywać „następną akcję”. Oznacza to, że model oblicza konkretną kolejną interakcję fizyczną lub cyfrową, taką jak konkretne wprowadzenie danych z klawiatury lub kliknięcie myszą w precyzyjnym punkcie na ekranie.
Aby przyspieszyć rozwój, Hark wykorzystuje obecnie model poddany procesowi post-trainingu. Strategia ta pozwala firmie na szybkie dopracowanie infrastruktury szkoleniowej, potoków danych (data pipelines) oraz specjalistycznych technik przed przejściem do pełnej fazy pre-trainingu, zaplanowanej na później w tym roku. To iteracyjne podejście ma na celu optymalizację agenta pod kątem szybkości i efektywności kosztowej.
Krajobraz konkurencyjny agentów do obsługi komputera
Hark wchodzi na zatłoczoną i wysoce konkurencyjną arenę. Wyścig o dominację w dziedzinie „obsługi komputera” (computer-use) obejmuje gigantów technologicznych, takich jak Google, OpenAI i Anthropic, obok wyspecjalizowanych startupów finansowanych przez fundusze VC, takich jak Browser Use, Polar, Strawberry i Aside.
Hark pozycjonuje się jako przełomowa alternatywa, deklarując wyższą prędkość i znacznie niższe koszty operacyjne w porównaniu do potężnych modeli, takich jak GPT 5.5 czy Opus 4.8. Skupiając się na wyspecjalizowanej architekturze zorientowanej na działanie, a nie na ogólnego przeznaczenia modelu tekstowego, Hark dąży do przejęcia rynku wysokoczęstotliwościowej i niskokosztowej automatyzacji przeglądarki.
Firma otworzyła listę oczekujących na swoją platformę i zamierza uruchomić pełną usługę do końca lata. Dla programistów i założycieli sukces Handoff może zwiastować przesunięcie w stronę „modeli akcji” (Action Models), które priorytetyzują realizację zadań ponad samą rozmowę.
Kluczowe wnioski
- Architektura zorientowana na działanie: W przeciwieństwie do standardowych modeli LLM, które przewidują tokeny tekstowe, model Hark przewiduje konkretne działania użytkownika, takie jak kliknięcia i naciśnięcia klawiszy.
- Automatyzacja bez API: Agent Handoff wykorzystuje dane wizualne i strukturalne do nawigowania po stronach takich jak Walmart i LinkedIn, które nie oferują oficjalnych interfejsów API.
- Skupienie na kosztach i szybkości: Hark dąży do obniżenia cen i opóźnień w porównaniu do głównych modeli, takich jak GPT 5.5, celując w wydajną, wielkoskalową automatyzację zadań w przeglądarce.
Na co warto zwrócić uwagę
- Harmonogram wdrożenia – Hark otworzył listę oczekujących i planuje pełne wydanie usługi do końca lata.
- Ewolucja modelu – Hark przechodzi od modelu typu post-trained do pełnej fazy pre-trainingu, zaplanowanej na później w tym roku.
