Hark 是一家获得 7 亿美元 A 轮融资的高增长初创公司,近日正式预览了其名为 “Handoff” 的智能体,该智能体旨在像人类一样浏览网页。通过超越简单的文本生成,Handoff 旨在实现那些缺乏官方 API 支持的网站上的复杂工作流自动化。
无需 API 的网页浏览
自动化面临的最重大障碍之一是对结构化 API 的依赖。Hark 的 Handoff 智能体通过分析底层网站结构和视觉数据来与界面进行交互,从而绕过了这一限制。这使得该智能体能够无缝浏览 Target、Walmart、OpenTable 和 LinkedIn 等高流量、非 API 驱动的平台。
该智能体通过理解视觉线索来确定何时点击按钮、滚动或输入文本。在最近的一次演示中,CEO Brett Adcock 展示了该智能体处理复杂“模糊”逻辑的能力——例如,在用户指定“由花艺师自行挑选一些”的情况下制作定制花束。这种能力表明其具备超越僵化指令执行的语义理解水平,从而实现更自然的人机交互。
从“预测下一个 Token”向“预测下一个动作”的转变
从技术角度来看,Hark 正在背离标准的语言大模型 (LLM) 范式。传统的 LLM 经过优化以预测文本序列中的下一个 Token,而 Hark 的模型架构旨在预测“下一个动作 (next action)”。这意味着模型会专门计算下一次物理或数字交互,例如特定的键盘输入或在屏幕精确坐标上的鼠标点击。
为了加速开发,Hark 目前正在使用经过后训练 (post-trained) 的模型。这一策略使公司能够在计划于今年晚些时候进入全面预训练阶段之前,快速完善其训练基础设施、数据流水线和专业技术。这种迭代方法旨在优化智能体的速度和成本效益。
计算机使用智能体的竞争格局
Hark 进入了一个拥挤且竞争激烈的领域。在争夺“计算机使用 (computer-use)”主导地位的竞赛中,既有 Google、OpenAI 和 Anthropic 等科技巨头,也有像 Browser Use、Polar、Strawberry 和 Aside 这样获得风险投资支持的专业初创公司。
Hark 将自己定位为一种颠覆性的替代方案,声称与 GPT 5.5 或 Opus 4.8 等重量级模型相比,它具有更快的速度和显著更低的运营成本。通过专注于专门的面向动作的架构,而非通用文本模型,Hark 试图占领高频、低成本浏览器自动化的市场。
该公司已为其平台开启了候补名单,并计划在夏季结束前推出完整服务。对于开发者和创始人而言,Handoff 的成功可能预示着向“动作模型 (Action Models)”的转变,这类模型优先考虑任务完成,而非仅仅是对话。
核心要点
- 面向动作的架构: 与预测文本 Token 的标准 LLM 不同,Hark 的模型可以预测特定的用户动作,如点击和按键。
- 无 API 自动化: Handoff 智能体利用视觉和结构化数据来浏览 Walmart 和 LinkedIn 等不提供官方 API 的网站。
- 专注于成本与速度: Hark 旨在降低 GPT 5.5 等主流模型的定价和延迟,目标是实现高效、大规模的浏览器任务自动化。
值得关注的动向
- 发布时间线 – Hark 已开启候补名单,并计划在夏季结束前全面发布。
- 模型演进 – Hark 正在从后训练模型向计划于今年晚些时候进行的全面预训练阶段过渡。
