Anthropic เปิดตัว Claude Opus 5: ประสิทธิภาพระดับแนวหน้าในราคาเพียงครึ่งเดียว

Anthropic ได้เปิดตัว Claude Opus 5 อย่างเป็นทางการ ซึ่งเป็นโมเดลเรือธงตัวใหม่ที่ออกแบบมาเพื่อปฏิวัติตลาด LLM ระดับไฮเอนด์ โดยมอบประสิทธิภาพที่ใกล้เคียงกับ Claude Fable 5 ระดับพรีเมียมในราคาที่ต่ำกว่าอย่างมาก การเคลื่อนไหวเชิงกลยุทธ์นี้มีเป้าหมายเพื่อลดแรงกดดันด้านราคาจากคู่แข่งอย่าง GPT-5.6 Sol พร้อมทั้งมอบเครื่องมือที่มีประสิทธิภาพมากขึ้นให้แก่เหล่านักพัฒนาสำหรับการเขียนโค้ดและงานด้านความรู้ที่ซับซ้อน

ปฏิวัติขีดจำกัดด้านราคาและประสิทธิภาพ

คุณสมบัติที่โดดเด่นที่สุดของ Claude Opus 5 คือโครงสร้างราคาที่ดุดัน ในขณะที่ Claude Fable 5 ระดับสูงสุดมีราคา $10 ต่อหนึ่งล้าน input tokens และ $50 ต่อหนึ่งล้าน output tokens แต่ Opus 5 ได้หั่นราคาเหล่านี้ลงครึ่งหนึ่ง โดยตั้งราคาไว้ที่ $5 ต่อหนึ่งล้าน input และ $25 ต่อหนึ่งล้าน output tokens

เพื่อตอบสนองความต้องการด้านความหน่วง (latency) Anthropic ยังได้เปิดตัว "Fast Mode" ซึ่งช่วยเพิ่มความเร็วในการประมวลผลขึ้น 2.5 เท่า แม้จะต้องแลกมาด้วยราคา token ที่เพิ่มขึ้นเป็นสองเท่าก็ตาม การกำหนดราคาแบบแบ่งระดับนี้ เมื่อรวมกับ context window ขนาดมหึมาถึง 1 ล้าน token ทำให้ Opus 5 กลายเป็นโมเดลเริ่มต้นตัวใหม่สำหรับ Claude Max และเป็นตัวเลือกที่มีความสามารถสูงสุดสำหรับผู้ใช้ Claude Pro

ความเหนือชั้นด้าน Benchmark ในการเขียนโค้ดและการใช้เหตุผล

Opus 5 ไม่ได้เป็นเพียงทางเลือกราคาประหยัดเท่านั้น แต่ยังเป็นขุมพลังด้านประสิทธิภาพในโดเมนเฉพาะทางอีกด้วย ในการเขียนโค้ดผ่าน terminal แบบ agentic โดยใช้ Frontier-Bench v0.1 นั้น Opus 5 ทำคะแนนได้ถึง 43.3% ซึ่งสูงกว่าทั้ง Fable 5 (33.7%) และ GPT-5.6 Sol (34.4%) อย่างมีนัยสำคัญ นอกจากนี้ยังแสดงให้เห็นถึงความโดดเด่นในงานด้านความรู้ โดยเป็นผู้นำใน benchmark GDPval-AA v2 ด้วยคะแนน Elo ที่ 1,861

สถิติที่น่าตกตะลึงที่สุดอาจมาจาก benchmark ARC-AGI-3 ซึ่งใช้วัดความสามารถในการแก้ปัญหาใหม่ๆ โดย Opus 5 ทำคะแนนได้ 30.2% ซึ่งมากกว่า 7.8% ที่ GPT-5.6 Sol ทำได้เกือบสี่เท่า สิ่งนี้บ่งชี้ถึงการก้าวกระโดดครั้งใหญ่ในความสามารถของโมเดลในการจัดการกับงานที่อยู่นอกเหนือรูปแบบข้อมูลที่ใช้ในการฝึกฝน (training data)

การปรับระดับความพยายาม (Effort) และประสิทธิภาพที่ชาญฉลาด

Anthropic ได้นำระบบ "effort" ที่ซับซ้อนมาใช้ ซึ่งช่วยให้ผู้ใช้สามารถสลับระหว่างการตั้งค่าห้าระดับ ได้แก่ low, medium, high, xhigh และ max สิ่งนี้ช่วยให้สามารถแลกเปลี่ยน (trade-off) ระหว่างการใช้ token และความลึกในการใช้เหตุผลได้อย่างละเอียด

แม้ว่า Anthropic จะแนะนำให้ใช้การตั้งค่า "low" และ "medium" สำหรับงานทั่วไปเพื่อเพิ่มประสิทธิภาพด้านต้นทุน แต่พวกเขาก็แนะนำให้ใช้ "xhigh" สำหรับการเขียนโค้ดแบบ agentic ที่ซับซ้อน สิ่งที่น่าสนใจคือ บริษัทสังเกตเห็นผลตอบแทนที่ลดน้อยลง (diminishing return) ในการตั้งค่า "max" โดยทั้งใน Frontier-Bench v0.1 และ Artificial Analysis Coding Agent Index พบว่า Opus 5 มีประสิทธิภาพลดลงเล็กน้อยเมื่อใช้ความพยายามสูงสุดแม้จะมีต้นทุนที่สูงกว่าก็ตาม ซึ่งบ่งชี้ว่าการตั้งค่า "xhigh" อาจเป็นจุดที่คุ้มค่าที่สุด (sweet spot) ในด้านประสิทธิภาพในปัจจุบัน

ความปลอดภัยและความเป็นอิสระที่ได้รับการปรับปรุง

เพื่อตอบสนองต่อความคิดเห็นของผู้ใช้โดยตรง Anthropic ได้ปรับจูน safety classifiers สำหรับ Opus 5 โดยตัวกรองไซเบอร์ (cyber filters) ของโมเดลจะทำงานน้อยลงประมาณ 85% เมื่อเทียบกับ Fable 5 ซึ่งเป็นการแก้ปัญหาข้อวิพากษ์วิจารณ์ก่อนหน้านี้เกี่ยวกับการบล็อกงานวิจัยที่ถูกต้องตามกฎหมายอย่างเข้มงวดเกินไป แม้ว่าโมเดลจะยังคงป้องกันการสร้าง exploit และการสแกนแบบ binary แต่ก็มีความยืดหยุ่นมากขึ้นสำหรับการวิจัยช่องโหว่ของ source code

นอกจากนี้ Opus 5 ยังแสดงให้เห็นถึงความสามารถในการแก้ไขตัวเอง (self-correction) ที่เพิ่มขึ้น ในการทดสอบในโลกแห่งความเป็นจริง โมเดลสามารถสร้างโมเดล 3 มิติใน FreeCAD ได้สำเร็จโดยการเขียน computer vision pipeline ของตัวเองเพื่อตีความเรขาคณิต ซึ่งเป็นงานที่โมเดลคู่แข่งอื่นๆ ทั้งหมดไม่สามารถทำได้

สรุปประเด็นสำคัญ

  • การลดต้นทุนอย่างมหาศาล: Opus 5 มอบประสิทธิภาพระดับเรือธงในราคา token เพียง 50% ของ Claude Fable 5
  • การก้าวกระโดดด้านการใช้เหตุผล: โมเดลแสดงให้เห็นถึงความเป็นผู้นำที่มากกว่าคู่แข่งถึง 4 เท่าใน benchmark ARC-AGI-3 สำหรับการแก้ปัญหาใหม่ๆ
  • เวิร์กโฟลว์ของนักพัฒนาที่ได้รับการปรับปรุง: ด้วย safety classifiers ที่ดีขึ้นและการตั้งค่า "effort" แบบพิเศษ Opus 5 จึงมอบประสบการณ์ที่ราบรื่นยิ่งขึ้นสำหรับการเขียนโค้ดแบบ agentic และการวิจัย