Hark สตาร์ทอัพที่มีการเติบโตสูงและได้รับการสนับสนุนเงินทุนระดับ Series A ถึง 700 ล้านดอลลาร์ ได้เปิดตัวตัวอย่าง "Handoff" อย่างเป็นทางการ ซึ่งเป็นเอเจนต์อัจฉริยะที่ออกแบบมาเพื่อท่องเว็บได้เหมือนกับมนุษย์ โดย Handoff มุ่งหวังที่จะก้าวข้ามการสร้างข้อความแบบธรรมดา ไปสู่การทำงานอัตโนมัติในเวิร์กโฟลว์ที่ซับซ้อนบนเว็บไซต์ที่ไม่มีการรองรับ API อย่างเป็นทางการ

การท่องเว็บโดยไม่ต้องใช้ API

หนึ่งในอุปสรรคที่สำคัญที่สุดในการทำระบบอัตโนมัติคือการต้องพึ่งพา API ที่มีโครงสร้างชัดเจน เอเจนต์ Handoff ของ Hark ก้าวข้ามข้อจำกัดนี้ด้วยการวิเคราะห์ทั้งโครงสร้างเว็บไซต์และข้อมูลภาพเพื่อโต้ตอบกับอินเทอร์เฟซ สิ่งนี้ช่วยให้เอเจนต์สามารถท่องแพลตฟอร์มที่มีผู้ใช้งานสูงและไม่มี API เช่น Target, Walmart, OpenTable และ LinkedIn ได้อย่างราบรื่น

เอเจนต์ทำงานโดยการทำความเข้าใจสัญญาณทางภาพ (visual cues) เพื่อตัดสินใจว่าจะคลิกปุ่ม เลื่อนหน้าจอ หรือป้อนข้อความเมื่อใด ในการสาธิตเมื่อเร็วๆ นี้ CEO Brett Adcock ได้แสดงให้เห็นถึงความสามารถของเอเจนต์ในการจัดการกับตรรกะแบบ "fuzzy" ที่ซับซ้อน เช่น การจัดช่อดอกไม้แบบสั่งทำพิเศษที่ผู้ใช้ระบุเพียงว่า "เลือกตามใจช่างจัดดอกไม้บ้าง" ความสามารถนี้บ่งบอกถึงระดับความเข้าใจด้านความหมาย (semantic understanding) ที่เหนือกว่าการทำตามคำสั่งที่ตายตัว ช่วยให้การปฏิสัมพันธ์ระหว่างมนุษย์และเอเจนต์เป็นไปอย่างธรรมชาติมากขึ้น

การเปลี่ยนผ่านจากการทำนาย Next-Token ไปสู่ Next-Action Prediction

ในทางเทคนิค Hark กำลังเปลี่ยนทิศทางออกจากกระบวนทัศน์ของ Large Language Model (LLM) แบบมาตรฐาน ในขณะที่ LLM แบบดั้งเดิมถูกปรับแต่งมาเพื่อทำนาย token ถัดไปในลำดับข้อความ แต่โมเดลของ Hark ถูกออกแบบสถาปัตยกรรมมาเพื่อทำนาย "การกระทำถัดไป" (next action) ซึ่งหมายความว่าโมเดลจะคำนวณการโต้ตอบทางกายภาพหรือทางดิจิทัลในขั้นตอนถัดไปโดยเฉพาะ เช่น การป้อนข้อมูลผ่านคีย์บอร์ดที่เฉพาะเจาะจง หรือการคลิกเมาส์ ณ พิกัดที่แม่นยำบนหน้าจอ

เพื่อเร่งการพัฒนา ปัจจุบัน Hark กำลังใช้โมเดลแบบ post-trained กลยุทธ์นี้ช่วยให้บริษัทสามารถปรับปรุงโครงสร้างพื้นฐานการฝึกฝน (training infrastructure), ท่อข้อมูล (data pipelines) และเทคนิคเฉพาะทางได้อย่างรวดเร็วก่อนที่จะเข้าสู่ขั้นตอนการทำ pre-training เต็มรูปแบบซึ่งมีกำหนดการในช่วงปลายปีนี้ แนวทางแบบทำซ้ำ (iterative approach) นี้ได้รับการออกแบบมาเพื่อเพิ่มประสิทธิภาพของเอเจนต์ทั้งในด้านความเร็วและความคุ้มค่าด้านต้นทุน

สมรภูมิการแข่งขันของเอเจนต์ที่ใช้งานคอมพิวเตอร์ได้ (Computer-Use Agents)

Hark ก้าวเข้าสู่สนามที่มีการแข่งขันสูงและมีผู้เล่นจำนวนมาก การแข่งขันเพื่อเป็นผู้นำด้าน "computer-use" นั้นรวมถึงยักษ์ใหญ่ทางเทคโนโลยีอย่าง Google, OpenAI และ Anthropic ตลอดจนสตาร์ทอัพที่ได้รับเงินทุนจาก VC ซึ่งมีความเชี่ยวชาญเฉพาะด้านอย่าง Browser Use, Polar, Strawberry และ Aside

Hark วางตำแหน่งตัวเองเป็นทางเลือกที่สร้างความเปลี่ยนแปลง (disruptive alternative) โดยอ้างว่ามีความเร็วที่เหนือกว่าและมีต้นทุนการดำเนินงานที่ต่ำกว่าอย่างมีนัยสำคัญเมื่อเทียบกับโมเดลระดับหนักอย่าง GPT 5.5 หรือ Opus 4.8 ด้วยการมุ่งเน้นไปที่สถาปัตยกรรมที่เน้นการกระทำ (action-oriented architecture) โดยเฉพาะ แทนที่จะเป็นโมเดลข้อความอเนกประสงค์ Hark จึงมุ่งหวังที่จะครองตลาดการทำ browser automation ที่มีความถี่สูงและต้นทุนต่ำ

บริษัทได้เปิดให้ลงชื่อในรายการรอ (waitlist) สำหรับแพลตฟอร์มของตนแล้ว และตั้งใจที่จะเปิดให้บริการเต็มรูปแบบภายในสิ้นฤดูร้อนนี้ สำหรับนักพัฒนาและผู้ก่อตั้ง ความสำเร็จของ Handoff อาจเป็นสัญญาณของการเปลี่ยนผ่านไปสู่ "Action Models" ที่ให้ความสำคัญกับการทำงานให้สำเร็จมากกว่าแค่การสนทนา

สรุปประเด็นสำคัญ

  • สถาปัตยกรรมที่เน้นการกระทำ (Action-Oriented Architecture): ต่างจาก LLM มาตรฐานที่ทำนาย text tokens โมเดลของ Hark จะทำนายการกระทำเฉพาะของผู้ใช้ เช่น การคลิกและการกดแป้นพิมพ์
  • การทำงานอัตโนมัติแบบไม่ต้องใช้ API: เอเจนต์ Handoff ใช้ข้อมูลภาพและโครงสร้างเพื่อท่องเว็บไซต์อย่าง Walmart และ LinkedIn ที่ไม่มี API อย่างเป็นทางการ
  • มุ่งเน้นที่ต้นทุนและความเร็ว: Hark ตั้งเป้าที่จะทำราคาและลดความหน่วง (latency) ให้ต่ำกว่าโมเดลหลักอย่าง GPT 5.5 โดยมุ่งเป้าไปที่การทำ browser task automation ขนาดใหญ่ที่มีประสิทธิภาพ

สิ่งที่ต้องจับตามอง

  • กำหนดการเปิดตัว – Hark ได้เปิดให้ลงชื่อในรายการรอแล้ว และมีแผนจะเปิดตัวเต็มรูปแบบภายในสิ้นฤดูร้อนนี้
  • วิวัฒนาการของโมเดล – Hark กำลังเปลี่ยนจากโมเดลแบบ post-trained ไปสู่ขั้นตอนการทำ pre-training เต็มรูปแบบซึ่งมีกำหนดการในช่วงปลายปีนี้