Hark, ein schnell wachsendes Startup, das durch eine Series-A-Finanzierung in Höhe von 700 Millionen US-Dollar unterstützt wird, hat offiziell „Handoff“ vorgestellt – einen intelligenten Agenten, der darauf ausgelegt ist, das Web genau wie ein Mensch zu navigieren. Indem Handoff über die einfache Textgenerierung hinausgeht, zielt es darauf ab, komplexe Workflows auf Websites zu automatisieren, die über keine offizielle API-Unterstützung verfügen.
Navigation im Web ohne APIs
Eine der größten Hürden bei der Automatisierung ist die Abhängigkeit von strukturierten APIs. Der Handoff-Agent von Hark umgeht diese Einschränkung, indem er sowohl die zugrunde liegende Website-Struktur als auch visuelle Daten analysiert, um mit Benutzeroberflächen zu interagieren. Dies ermöglicht es dem Agenten, nahtlos auf Plattformen mit hohem Traffic ohne API-Unterstützung wie Target, Walmart, OpenTable und LinkedIn zu navigieren.
Der Agent funktioniert, indem er visuelle Hinweise versteht, um zu bestimmen, wann Schaltflächen angeklickt, gescrollt oder Texte eingegeben werden müssen. In einer kürzlichen Demonstration zeigte CEO Brett Adcock die Fähigkeit des Agenten, komplexe „Fuzzy“-Logik zu verarbeiten – wie etwa das Zusammenstellen eines individuellen Blumenstraußes, bei dem der Nutzer angibt: „einige Blumen nach Wahl des Floristen“. Diese Fähigkeit deutet auf ein Maß an semantischem Verständnis hin, das über die starre Befehlsausführung hinausgeht und eine natürlichere Interaktion zwischen Mensch und Agent ermöglicht.
Ein Wandel von der Next-Token- zur Next-Action-Vorhersage
Technisch gesehen bewegt sich Hark weg vom Standard-Paradigma der Large Language Models (LLM). Während herkömmliche LLMs darauf optimiert sind, das nächste Token in einer Textsequenz vorherzusagen, ist das Modell von Hark darauf ausgelegt, die „nächste Aktion“ (next action) vorherzusagen. Das bedeutet, dass das Modell gezielt die nächste physische oder digitale Interaktion berechnet, wie etwa eine bestimmte Tastatureingabe oder einen Mausklick an einer präzisen Koordinate auf dem Bildschirm.
Um die Entwicklung zu beschleunigen, nutzt Hark derzeit ein post-trainiertes Modell. Diese Strategie ermöglicht es dem Unternehmen, seine Trainingsinfrastruktur, Daten-Pipelines und spezialisierten Techniken schnell zu verfeinern, bevor es später in diesem Jahr zur vollständigen Pre-Training-Phase übergeht. Dieser iterative Ansatz ist darauf ausgelegt, den Agenten hinsichtlich Geschwindigkeit und Kosteneffizienz zu optimieren.
Die Wettbewerbslandschaft der Computer-Use-Agenten
Hark tritt in ein bereits dicht besetztes und hart umkämpftes Umfeld ein. Das Rennen um die Vorherrschaft im Bereich „Computer-Use“ umfasst Tech-Giganten wie Google, OpenAI und Anthropic sowie spezialisierte, durch Risikokapital finanzierte Startups wie Browser Use, Polar, Strawberry und Aside.
Hark positioniert sich als disruptive Alternative und behauptet eine überlegene Geschwindigkeit sowie deutlich geringere Betriebskosten im Vergleich zu Schwergewichten wie GPT 5.5 oder Opus 4.8. Durch die Konzentration auf eine spezialisierte, aktionsorientierte Architektur anstelle eines Allzweck-Textmodells versucht Hark, den Markt für hochfrequente, kostengünstige Browser-Automatisierung zu erobern.
Das Unternehmen hat eine Warteliste für seine Plattform eröffnet und beabsichtigt, den vollständigen Service bis Ende des Sommers zu starten. Für Entwickler und Gründer könnte der Erfolg von Handoff einen Wandel hin zu „Action Models“ signalisieren, die die Aufgabenbewältigung gegenüber der bloßen Konversation priorisieren.
Wichtigste Erkenntnisse
- Aktionsorientierte Architektur: Im Gegensatz zu Standard-LLMs, die Text-Tokens vorhersagen, prognostiziert das Modell von Hark spezifische Benutzeraktionen wie Klicks und Tastatureingaben.
- API-lose Automatisierung: Der Handoff-Agent nutzt visuelle und strukturelle Daten, um Websites wie Walmart und LinkedIn zu navigieren, die keine offiziellen APIs anbieten.
- Fokus auf Kosten und Geschwindigkeit: Hark zielt darauf ab, die Preise und Latenzzeiten großer Modelle wie GPT 5.5 zu unterbieten, um eine effiziente Browser-Automatisierung im großen Stil zu ermöglichen.
Worauf man achten sollte
- Zeitplan für den Launch – Hark hat eine Warteliste eröffnet und plant eine vollständige Veröffentlichung bis Ende des Sommers.
- Modellentwicklung – Hark geht von einem post-trainierten Modell zu einer vollständigen Pre-Training-Phase über, die für später in diesem Jahr geplant ist.
