7億ドルのシリーズA資金調達を実施した急成長中のスタートアップ、Harkは、人間と同じようにウェブをナビゲートするように設計されたインテリジェント・エージェント「Handoff」を正式にプレビューしました。単なるテキスト生成の枠を超え、Handoffは公式のAPIサポートがないウェブサイトにわたる複雑なワークフローの自動化を目指しています。

APIなしでのウェブナビゲーション

自動化における最大の障壁の一つは、構造化されたAPIへの依存です。HarkのHandoffエージェントは、ウェブサイトの基盤となる構造と視覚的なデータの両方を分析してインターフェースを操作することで、この制限を回避します。これにより、Target、Walmart、OpenTable、LinkedInといった、トラフィックが多くAPIを提供していないプラットフォームをシームレスにナビゲートすることが可能になります。

このエージェントは、視覚的な手がかりを理解することで、ボタンのクリック、スクロール、テキスト入力のタイミングを判断します。最近のデモンストレーションでは、CEOのBrett Adcockが、ユーザーが「花屋のお任せでいくつか」と指定してカスタムフラワーブーケを作成するといった、複雑で「曖昧な(fuzzy)」ロジックを処理するエージェントの能力を披露しました。この能力は、厳格なコマンド実行を超えたレベルの意味理解を示唆しており、より自然な人間とエージェントのインタラクションを可能にします。

「次トークン予測」から「次アクション予測」への転換

技術的には、Harkは標準的な大規模言語モデル(LLM)のパラダイムから脱却しようとしています。従来のLLMはテキストシーケンス内の次のトークンを予測するように最適化されていますが、Harkのモデルは「次のアクション(next action)」を予測するように設計されています。これは、特定のキーボード入力や画面上の正確な座標でのマウス操作など、次に起こる物理的またはデジタル的なインタラクションをモデルが具体的に計算することを意味します。

開発を加速させるため、Harkは現在、ポストトレーニング(post-trained)モデルを活用しています。この戦略により、同社は今年後半に予定されている本格的な事前学習(pre-training)フェーズに移行する前に、トレーニングインフラ、データパイプライン、および専門的な技術を迅速に洗練させることができます。この反復的なアプローチは、エージェントの速度とコスト効率を最適化するために設計されています。

コンピュータ操作エージェントの競争環境

Harkが参入するのは、混雑した非常に競争の激しい領域です。「コンピュータ操作」の覇権を巡る争いには、Google、OpenAI、Anthropicといったテックジャイアントに加え、Browser Use、Polar、Strawberry、AsideといったVC(ベンチャーキャピタル)から資金提供を受けている特化型スタートアップも含まれています。

Harkは、GPT 5.5やOpus 4.8のような重量級モデルと比較して、優れた速度と大幅に低い運用コストを謳い、破壊的な代替手段としての地位を確立しようとしています。汎用的なテキストモデルではなく、アクションに特化した専用のアーキテクチャに焦点を当てることで、Harkは高頻度かつ低コストなブラウザ自動化の市場獲得を目指しています。

同社はプラットフォームのウェイティングリストを開放しており、夏末までにフルサービスを開始する予定です。開発者や創業者にとって、Handoffの成功は、単なる会話よりもタスクの完了を優先する「アクションモデル(Action Models)」へのシフトを告げるものになる可能性があります。

主なポイント

  • アクション指向のアーキテクチャ: テキストトークンを予測する標準的なLLMとは異なり、Harkのモデルはクリックやキーストロークなどの具体的なユーザーアクションを予測します。
  • API不要の自動化: Handoffエージェントは、視覚的および構造的なデータを使用して、公式APIを提供していないWalmartやLinkedInなどのウェブサイトをナビゲートします。
  • コストと速度への注力: Harkは、GPT 5.5のような主要モデルの価格とレイテンシを下回ることを目指しており、効率的な大規模ブラウザタスク自動化をターゲットとしています。

注目のポイント

  • ローンチのタイムライン – Harkはウェイティングリストを開放しており、夏末までのフルリリースを計画しています。
  • モデルの進化 – Harkはポストトレーニングモデルから、今年後半に予定されている本格的な事前学習フェーズへと移行しています。