Hark, стартап із високими темпами зростання, що отримав 700 мільйонів доларів у межах раунду фінансування серії А, офіційно представив «Handoff» — інтелектуального агента, розробленого для навігації в інтернеті так само, як це робить людина. Виходячи за межі простої генерації тексту, Handoff прагне автоматизувати складні робочі процеси на вебсайтах, які не мають офіційної підтримки API.
Навігація в інтернеті без API
Однією з найзначніших перешкод в автоматизації є залежність від структурованих API. Агент Handoff від Hark обходить це обмеження, аналізуючи як структуру вебсайту, так і візуальні дані для взаємодії з інтерфейсами. Це дозволяє агенту безперешкодно навігувати на популярних платформах без API, таких як Target, Walmart, OpenTable та LinkedIn.
Агент працює шляхом розпізнавання візуальних підказок, щоб визначити, коли натискати кнопки, прокручувати сторінку або вводити текст. Під час нещодавньої демонстрації генеральний директор Brett Adcock продемонстрував здатність агента обробляти складну «нечітку» (fuzzy) логіку — наприклад, створення індивідуального букета квітів, де користувач вказує «деякі квіти на вибір флориста». Ця можливість свідчить про рівень семантичного розуміння, що виходить за межі жорсткого виконання команд, забезпечуючи більш природну взаємодію людини з агентом.
Перехід від передбачення наступного токена до передбачення наступної дії
З технічної точки зору, Hark відходить від стандартної парадигми великих мовних моделей (LLM). У той час як традиційні LLM оптимізовані для передбачення наступного токена в послідовності тексту, архітектура моделі Hark розроблена для передбачення «наступної дії». Це означає, що модель розраховує конкретну фізичну або цифрову взаємодію, таку як введення певного символу з клавіатури або клік мишкою у точних координатах на екрані.
Щоб прискорити розробку, Hark наразі використовує модель після навчання (post-trained model). Ця стратегія дозволяє компанії швидко вдосконалювати інфраструктуру навчання, конвеєри даних та спеціалізовані методи перед переходом до повноцінного етапу попереднього навчання (pre-training), запланованого на кінець цього року. Такий ітеративний підхід покликаний оптимізувати агента за швидкістю та економічною ефективністю.
Конкурентне середовище агентів для використання комп'ютера
Hark виходить на переповнену та висококонкурентну арену. У гонці за домінування у сфері «використання комп'ютера» (computer-use) беруть участь такі технологічні гіганти, як Google, OpenAI та Anthropic, а також спеціалізовані стартапи з венчурним фінансуванням, такі як Browser Use, Polar, Strawberry та Aside.
Hark позиціонує себе як революційну альтернативу, заявляючи про вищу швидкість і значно нижчі операційні витрати порівняно з такими важковаговими моделями, як GPT 5.5 або Opus 4.8. Зосереджуючись на спеціалізованій орієнтованій на дії архітектурі, а не на моделі загального призначення для тексту, Hark прагне захопити ринок високочастотної та недорогої автоматизації браузера.
Компанія відкрила список очікування для своєї платформи та має намір запустити повноцінний сервіс до кінця літа. Для розробників і засновників успіх Handoff може стати сигналом переходу до «моделей дій» (Action Models), які ставлять у пріоритет виконання завдань, а не просто розмову.
Основні висновки
- Орієнтована на дії архітектура: На відміну від стандартних LLM, які передбачають текстові токени, модель Hark передбачає конкретні дії користувача, такі як кліки та натискання клавіш.
- Автоматизація без API: Агент Handoff використовує візуальні та структурні дані для навігації на таких вебсайтах, як Walmart та LinkedIn, які не пропонують офіційних API.
- Фокус на вартості та швидкості: Hark прагне запропонувати ціни та затримку (latency) нижчі, ніж у основних моделей на кшталт GPT 5.5, орієнтуючись на ефективну великомасштабну автоматизацію завдань у браузері.
На що варто звернути увагу
- Графік запуску – Hark відкрила список очікування та планує повноцінний реліз до кінця літа.
- Еволюція моделі – Hark переходить від моделі після навчання (post-trained model) до повноцінного етапу попереднього навчання (pre-training), запланованого на кінець цього року.
