7억 달러 규모의 시리즈 A 투자를 유치한 고성장 스타트업 Hark가 인간처럼 웹을 탐색하도록 설계된 지능형 에이전트 "Handoff"를 공식 공개했습니다. 단순한 텍스트 생성을 넘어, Handoff는 공식 API 지원이 없는 웹사이트 전반의 복잡한 워크플로우를 자동화하는 것을 목표로 합니다.

API 없이 웹 탐색하기

자동화의 가장 큰 장애물 중 하나는 구조화된 API에 대한 의존성입니다. Hark의 Handoff 에이전트는 웹사이트의 기본 구조와 시각적 데이터를 모두 분석하여 인터페이스와 상호작용함으로써 이러한 한계를 극복합니다. 이를 통해 에이전트는 Target, Walmart, OpenTable, LinkedIn과 같이 트래픽이 높지만 API를 제공하지 않는 플랫폼을 원활하게 탐색할 수 있습니다.

에이전트는 시각적 단서를 이해하여 버튼을 클릭하거나, 스크롤하거나, 텍스트를 입력해야 할 시점을 결정하는 방식으로 작동합니다. 최근 시연에서 CEO Brett Adcock는 사용자가 "꽃집의 선택에 따라 적당히"와 같이 모호하게 지정한 조건에서도 맞춤형 꽃다발을 만드는 등, 에이전트가 복잡한 "퍼지(fuzzy)" 로직을 처리할 수 있음을 보여주었습니다. 이러한 능력은 경직된 명령 실행을 넘어선 수준의 의미론적 이해를 시사하며, 인간과 에이전트 간의 더욱 자연스러운 상호작용을 가능하게 합니다.

다음 토큰 예측에서 다음 행동 예측으로의 전환

기술적으로 Hark는 표준 거대 언어 모델(LLM) 패러다임에서 벗어나고 있습니다. 기존 LLM이 텍스트 시퀀스에서 다음 토큰을 예측하도록 최적화되어 있는 반면, Hark의 모델은 "다음 행동(next action)"을 예측하도록 설계되었습니다. 이는 모델이 특정 키보드 입력이나 화면의 정확한 좌표에서의 마우스 클릭과 같은 구체적인 물리적 또는 디지털 상호작용을 직접 계산함을 의미합니다.

개발 속도를 높이기 위해 Hark는 현재 사후 학습(post-trained) 모델을 활용하고 있습니다. 이 전략을 통해 회사는 올해 말로 예정된 전체 사전 학습(pre-training) 단계로 넘어가기 전, 훈련 인프라, 데이터 파이프라인 및 전문 기술을 신속하게 개선할 수 있습니다. 이러한 반복적인 접근 방식은 에이전트의 속도와 비용 효율성을 최적화하기 위해 설계되었습니다.

컴퓨터 사용 에이전트의 경쟁 구도

Hark는 이미 포화 상태인 매우 경쟁적인 분야에 진입했습니다. "컴퓨터 사용(computer-use)" 주도권을 잡기 위한 경쟁에는 Google, OpenAI, Anthropic과 같은 기술 거물뿐만 아니라 Browser Use, Polar, Strawberry, Aside와 같은 전문 VC 투자 스타트업들이 포함되어 있습니다.

Hark는 GPT 5.5 또는 Opus 4.8과 같은 대형 모델에 비해 우수한 속도와 현저히 낮은 운영 비용을 주장하며 파괴적인 대안으로 자리매김하고 있습니다. 범용 텍스트 모델보다는 특화된 행동 중심 아키텍처에 집중함으로써, Hark는 고빈도, 저비용 브라우저 자동화 시장을 선점하고자 합니다.

회사는 플랫폼 대기 명단을 공개했으며 여름 말까지 전체 서비스를 출시할 계획입니다. 개발자와 창업자들에게 Handoff의 성공은 단순한 대화를 넘어 작업 완료를 우선시하는 "액션 모델(Action Models)"로의 전환을 예고할 수 있습니다.

핵심 요약

  • 행동 중심 아키텍처: 텍스트 토큰을 예측하는 표준 LLM과 달리, Hark의 모델은 클릭 및 키 입력과 같은 구체적인 사용자 행동을 예측합니다.
  • API 없는 자동화: Handoff 에이전트는 공식 API를 제공하지 않는 Walmart 및 LinkedIn과 같은 웹사이트를 탐색하기 위해 시각적 및 구조적 데이터를 사용합니다.
  • 비용 및 속도 집중: Hark는 GPT 5.5와 같은 주요 모델의 가격과 지연 시간을 앞지르는 것을 목표로 하며, 효율적이고 대규모인 브라우저 작업 자동화를 겨냥합니다.

주목할 점

  • 출시 일정 – Hark는 대기 명단을 공개했으며 여름 말까지 정식 출시를 계획하고 있습니다.
  • 모델 진화 – Hark는 현재 사후 학습 모델에서 올해 말로 예정된 전체 사전 학습 단계로 전환하고 있습니다.