Anthropic Claude Opus 5 ท้าชน Fable 5 ด้วยประสิทธิภาพที่เหนือกว่า
Anthropic ได้ก้าวเข้าสู่ยุคใหม่ของโมเดลระดับแนวหน้า (frontier modeling) อย่างเป็นทางการด้วยการเปิดตัว Claude Opus 5 ซึ่งเป็นโมเดลที่ให้ความฉลาดระดับสูงในราคาที่ต่ำกว่าคู่แข่งรายสำคัญอย่างมีนัยสำคัญ ด้วยการทำคะแนนเทียบเท่าหรือเหนือกว่า Claude Fable 5 และ GPT-5.6 Sol ในเกณฑ์มาตรฐาน (benchmarks) สำคัญหลายรายการ Opus 5 กำลังเข้ามาเปลี่ยนโฉมหน้าด้านเศรษฐศาสตร์ของการใช้เหตุผลด้วย AI ขั้นสูง
ครองความเป็นหนึ่งในด้านการเขียนโค้ดและงานด้านความรู้
Claude Opus 5 ได้พิสูจน์ตัวเองว่าเป็นขุมพลังในโดเมนเฉพาะทาง โดยเฉพาะอย่างยิ่งในด้านวิศวกรรมซอฟต์แวร์และระบบอัตโนมัติในสำนักงาน ในดัชนี Artificial Analysis Intelligence Index ซึ่งเป็นตัวชี้วัดที่ครอบคลุมทั้งการเขียนโค้ด การใช้เหตุผลทางวิทยาศาสตร์ และความถูกต้องของข้อเท็จจริง Opus 5 ทำคะแนนนำอยู่ที่ 61 แซงหน้า Claude Fable 5 (60) และ GPT-5.6 Sol (59)
ในด้านวิศวกรรมอัตโนมัติ (autonomous engineering) Opus 5 เมื่อทำงานร่วมกับ Claude Code ครองอันดับหนึ่งร่วมใน Coding Agent Index ด้วยคะแนน 67 คะแนน นอกจากนี้ยังทำคะแนนได้ถึง 89% ใน Terminal-Bench v2.1 เทียบเท่ากับผู้นำอุตสาหกรรมเดิมอย่าง GPT-5.6 Sol ยิ่งไปกว่านั้น โมเดลนี้ยังแสดงให้เห็นถึงความโดดเด่นที่ไม่มีใครเทียบได้ในงานที่เน้นด้านสำนักงาน โดยในเกณฑ์มาตรฐาน AA-Briefcase ซึ่งวัดผลด้านการวิจัย การนำเสนอ และการวิเคราะห์สเปรดชีต Opus 5 ทำคะแนน Elo ได้ถึง 1720 ซึ่งสูงกว่า Fable 5 ถึง 146 คะแนน
ความย้อนแย้งด้านประสิทธิภาพ: ทำไมระดับ "High" ถึงชนะ "Max"
หนึ่งในการค้นพบที่สำคัญที่สุดสำหรับนักพัฒนาคือความสัมพันธ์ระหว่างระดับการใช้เหตุผล (reasoning tiers) กับการใช้งานจริง แม้ว่า Anthropic จะมีระดับตั้งแต่ "low" ไปจนถึง "max" แต่ข้อมูลบ่งชี้ว่าระดับการใช้เหตุผลที่สูงที่สุดอาจไม่ใช่ระดับที่มีประสิทธิภาพที่สุดสำหรับการนำไปใช้งานจริงเสมอไป
การทดสอบโดย Vals.ai ผ่าน Vibe Code Bench เผยให้เห็นว่าแม้ประสิทธิภาพจะเพิ่มขึ้นตามความซับซ้อน แต่ระดับ "high" มักจะให้โซลูชันที่เรียบง่ายและน่าเชื่อถือกว่า ในทางตรงกันข้าม ระดับ "max" และ "xhigh" มักจะสร้างโซลูชันที่ซับซ้อนเกินไปจนเสี่ยงต่อการเกิดข้อผิดพลาด สิ่งนี้สะท้อนให้เห็นใน Terminal-Bench 2.1 ซึ่งระดับ "high" ทำผลงานได้ดีกว่า "max" เนื่องจากระดับหลังใช้เวลากับการพยายามเพียงครั้งเดียวมากเกินไป จนมักจะใช้เวลาจนหมดโควตาก่อนที่จะทำงานเสร็จ สำหรับกรณีการใช้งานในระดับโปรดักชันส่วนใหญ่ ระดับ "high" จึงเป็นจุดที่ลงตัวที่สุด (sweet spot) ทั้งในด้านความน่าเชื่อถือและความคุ้มค่า
ความฉลาดระดับแนวหน้าในราคาที่คุ้มค่า
แง่มุมที่สร้างความสั่นสะเทือนได้มากที่สุดของ Claude Opus 5 คือโครงสร้างราคาเมื่อเทียบกับความฉลาด ในงานของ AA-Briefcase การใช้ Opus 5 ในระดับการใช้เหตุผล "max" มีต้นทุนประมาณ $17.79 ต่อหนึ่งงาน ซึ่งลดลง 20% จาก $22.30 ของ Fable 5 สำหรับผู้ใช้ที่เลือกใช้ระดับ "high" ต้นทุนจะลดลงเหลือเพียง $10.41 ซึ่งน้อยกว่าครึ่งหนึ่งของคู่แข่งในขณะที่ยังคงรักษาอันดับ Elo ที่เหนือกว่าไว้ได้
Anthropic ยังคงรักษาโมเดลราคาต่อโทเคน (token pricing) ที่แข่งขันได้:
- Input tokens: $5 ต่อล้านโทเคน
- Output tokens: $25 ต่อล้านโทเคน
- Cache hits: $0.50 ต่อล้านโทเคน
ขอบเขตที่แคบลงเรื่อยๆ
แม้จะประสบความสำเร็จ แต่ Opus 5 ก็ไม่ได้ไร้ข้อบกพร่อง ความถูกต้องของข้อเท็จจริงยังคงเป็นความท้าทาย โดยในเกณฑ์มาตรฐาน AA-Omniscience โมเดลนี้ยังตามหลัง Fable 5 และพบว่าอัตราการเกิดอาการประสาทหลอน (hallucination rate) เพิ่มขึ้นถึง 50% เนื่องจากโมเดลพยายามที่จะตอบคำถามบ่อยขึ้นเมื่อมีความไม่แน่ใจ
ส่วนต่างที่น้อยนิดระหว่าง Opus 5, Fable 5 และซีรีส์ GPT-5 ตอกย้ำถึงตลาดที่กำลังเติบโตอย่างรวดเร็ว เมื่อช่องว่างด้านประสิทธิภาพในด้านการใช้เหตุผลทางวิทยาศาสตร์และการเขียนโค้ดเริ่มแคบลง อุตสาหกรรม AI กำลังเคลื่อนเข้าสู่ยุคของการกลายเป็นสินค้าโภคภัณฑ์ (commoditization) ซึ่งประสิทธิภาพ ต้นทุน และการบูรณาการเข้ากับเวิร์กโฟลว์เฉพาะทางจะกลายเป็นปัจจัยหลักในการสร้างความแตกต่าง
สรุปประเด็นสำคัญ
- ประสิทธิภาพเฉพาะทางที่เหนือกว่า: Opus 5 เป็นผู้นำในด้านงานด้านความรู้ (Elo ของ AA-Briefcase อยู่ที่ 1720) และครองอันดับหนึ่งร่วมในเกณฑ์มาตรฐาน coding agent
- ระดับการใช้เหตุผลที่เหมาะสมที่สุด: ระดับการใช้เหตุผล "high" ถูกระบุว่าเป็นค่าที่น่าเชื่อถือและคุ้มค่าที่สุดสำหรับการเขียนโค้ดและงานใน terminal ซึ่งมักจะทำผลงานได้ดีกว่าระดับ "max"
- เศรษฐศาสตร์ต่อหน่วยที่สร้างความสั่นสะเทือน: Opus 5 มอบความฉลาดระดับแนวหน้าด้วยต้นทุนต่อหนึ่งงานที่ต่ำกว่า Claude Fable 5 อย่างมีนัยสำคัญ
