Hark, une startup à forte croissance soutenue par 700 millions de dollars en financement de série A, a officiellement présenté un aperçu de « Handoff », un agent intelligent conçu pour naviguer sur le web tout comme un humain. En allant au-delà de la simple génération de texte, Handoff vise à automatiser des flux de travail complexes sur des sites web qui ne disposent pas de support API officiel.
Naviguer sur le Web sans API
L'un des obstacles les plus importants de l'automatisation est la dépendance aux API structurées. L'agent Handoff de Hark contourne cette limitation en analysant à la fois la structure sous-jacente du site web et les données visuelles pour interagir avec les interfaces. Cela permet à l'agent de naviguer de manière fluide sur des plateformes à fort trafic ne disposant pas d'API, telles que Target, Walmart, OpenTable et LinkedIn.
L'agent fonctionne en comprenant les indices visuels pour déterminer quand cliquer sur des boutons, faire défiler la page ou saisir du texte. Lors d'une récente démonstration, le PDG Brett Adcock a mis en avant la capacité de l'agent à gérer une logique « floue » (fuzzy logic) complexe — comme la création d'un bouquet de fleurs personnalisé où l'utilisateur précise « une partie au choix du fleuriste ». Cette capacité suggère un niveau de compréhension sémantique qui dépasse l'exécution rigide de commandes, permettant une interaction humain-agent plus naturelle.
Un passage de la prédiction du prochain jeton (next-token) à celle de la prochaine action (next-action)
Techniquement, Hark s'éloigne du paradigme standard des grands modèles de langage (LLM). Alors que les LLM traditionnels sont optimisés pour prédire le prochain jeton (token) dans une séquence de texte, le modèle de Hark est conçu pour prédire la « prochaine action ». Cela signifie que le modèle calcule spécifiquement la prochaine interaction physique ou numérique, telle qu'une saisie clavier spécifique ou un clic de souris à une coordonnée précise sur l'écran.
Pour accélérer le développement, Hark utilise actuellement un modèle post-entraîné (post-trained). Cette stratégie permet à l'entreprise d'affiner rapidement son infrastructure d'entraînement, ses pipelines de données et ses techniques spécialisées avant de passer à une phase complète de pré-entraînement prévue plus tard cette année. Cette approche itérative est conçue pour optimiser l'agent en termes de vitesse et de rentabilité.
Le paysage concurrentiel des agents d'utilisation de l'ordinateur
Hark entre dans une arène encombrée et hautement compétitive. La course à la domination de l'« utilisation de l'ordinateur » (computer-use) inclut des géants de la technologie comme Google, OpenAI et Anthropic, aux côtés de startups spécialisées financées par du capital-risque telles que Browser Use, Polar, Strawberry et Aside.
Hark se positionne comme une alternative disruptive en revendiquant une vitesse supérieure et des coûts opérationnels nettement inférieurs à ceux de modèles lourds comme GPT 5.5 ou Opus 4.8. En se concentrant sur une architecture spécialisée orientée vers l'action plutôt que sur un modèle de texte polyvalent, Hark cherche à capturer le marché de l'automatisation de navigateur à haute fréquence et à faible coût.
L'entreprise a ouvert une liste d'attente pour sa plateforme et a l'intention de lancer le service complet d'ici la fin de l'été. Pour les développeurs et les fondateurs, le succès de Handoff pourrait signaler un passage vers les « modèles d'action » (Action Models) qui privilégient l'accomplissement de tâches plutôt que la simple conversation.
Points clés à retenir
- Architecture orientée vers l'action : Contrairement aux LLM standards qui prédisent des jetons de texte, le modèle de Hark prédit des actions utilisateur spécifiques comme des clics et des frappes de touches.
- Automatisation sans API : L'agent Handoff utilise des données visuelles et structurelles pour naviguer sur des sites web comme Walmart et LinkedIn qui ne proposent pas d'API officielles.
- Priorité au coût et à la vitesse : Hark vise à proposer des tarifs et une latence inférieurs à ceux des modèles majeurs comme GPT 5.5, en ciblant une automatisation efficace et à grande échelle des tâches de navigation.
À surveiller
- Calendrier de lancement – Hark a ouvert une liste d'attente et prévoit une sortie complète d'ici la fin de l'été.
- Évolution du modèle – Hark passe d'un modèle post-entraîné à une phase complète de pré-entraînement prévue plus tard cette année.
