Claude Opus 5 เปิดตัวเมื่อวันที่ 24 กรกฎาคม และตัวเลขที่โดดเด่นของมันสัญญาถึงการก้าวกระโดดถึงสามเท่าเมื่อเทียบกับคู่แข่งที่ใกล้เคียงที่สุด และมีประสิทธิภาพเป็นสองเท่าของ Opus 4.8 ของ Anthropic เอง คำถามที่แท้จริงสำหรับใครก็ตามที่ต้องจ่ายเงินเพื่อผลลัพธ์จาก AI คือ อัตราส่วนเหล่านี้จะเปลี่ยนเป็นผลลัพธ์ที่จับต้องได้โดยไม่ทำให้ราคาพุ่งสูงขึ้นหรือไม่

ทำไมตัวเลขเหล่านี้จึงสำคัญ

นักพัฒนาให้ความสำคัญกับคะแนน SWE-bench Pro มากที่สุด ซึ่งเป็นเกณฑ์มาตรฐานที่ทดสอบโมเดลกับประเด็น (issues) จริงบน GitHub เพื่อดูว่าโมเดลสามารถแก้ไขโค้ดได้ดีเพียงใด Opus 5 ทำคะแนนได้ถึง 79.2% ในขณะที่ Opus 4.8 ทำได้ 69.2% ซึ่งเป็นการเพิ่มขึ้นถึงสิบจุดภายในเวลาเพียงสองเดือน Anthropic ยังคงราคาต่อโทเคนไว้เท่าเดิม ดังนั้นผู้ใช้จึงได้รับผู้ช่วยเขียนโค้ดที่ฉลาดขึ้นอย่างเห็นได้ชัดในราคาเดิม

หากอัตราส่วนที่โดดเด่นเหล่านี้ยังคงรักษาไว้ได้ในการทดสอบอื่นๆ เรื่องของความคุ้มค่าระหว่างต้นทุนและประสิทธิภาพอาจเปลี่ยนวิธีที่บริษัทต่างๆ เลือกใช้โมเดลภาษาสำหรับงานที่เน้นการเขียนโค้ดเป็นหลัก

ประสิทธิภาพของ Opus 5 เมื่อเทียบกับการทดสอบสำคัญ

  • SWE-bench Pro – 79.2% เทียบกับ 69.2% (Opus 4.8) ราคาต่อโทเคนเท่าเดิม แต่อัตราความสำเร็จในการแก้ไขบั๊กในโลกความเป็นจริงสูงขึ้น
  • CursorBench 3.2 – Opus 5 ทำคะแนนได้ใกล้เคียงกับผู้นำอย่าง Fable 5 ภายในระยะ 0.5% ในด้านความเร็วในการทำงานให้สำเร็จ แต่มีราคาต่อภารกิจ ถูกกว่าประมาณครึ่งหนึ่ง
  • ARC-AGI-3 – Opus 5 ทำคะแนนได้ 30.2 ในขณะที่อันดับสองตามหลังอยู่ที่ 7.8 ช่องว่างนี้ชัดเจนมาก ซึ่งบ่งชี้ว่า Opus 5 จัดการกับปัญหาการใช้เหตุผลเชิงนามธรรมได้ดีกว่าโมเดลร่วมสมัยส่วนใหญ่มาก
  • General Reasoning – ในด้านนี้การแข่งขันสูสีกันกว่า โดย GPT-5.6 Sol นำด้วยคะแนนเฉลี่ยที่ 92.5 เฉือนชนะ Opus 5 ที่ทำได้ 90.4 ในจุดนี้ Opus 5 มีความสามารถในการแข่งขันแต่ยังไม่ถึงขั้นครองตลาด

ตัวเลขเหล่านี้แสดงให้เห็นภาพที่ละเอียดอ่อน: Opus 5 โดดเด่นในด้านที่เกี่ยวข้องกับโค้ดและเกณฑ์การทดสอบการใช้เหตุผลบางอย่าง แต่ยังคงตามหลังโมเดลการใช้เหตุผลทั่วไปชั้นนำอยู่

การวิเคราะห์เจาะลึก

ตัวเลขจากเกณฑ์มาตรฐานอาจทำให้เข้าใจผิดได้หากเงื่อนไขการทดสอบไม่ชัดเจน มีสี่จุดที่ช่วยแยกแยะข้อเท็จจริงออกจากกระแสโฆษณา:

  1. ระดับความพยายาม (Effort level) – โมเดลถูกรันด้วยระดับความพยายามต่ำ, ค่าเริ่มต้น หรือระดับสูงสุด? ความพยายามที่สูงขึ้นสามารถเพิ่มคะแนนได้ แต่ก็เพิ่มความหน่วง (latency) และต้นทุนด้วย
  2. จำนวนครั้งในการทดสอบ (Trial count) – การรันเพียงครั้งเดียวอาจได้ค่าที่ผิดปกติจากความโชคดี การทดสอบซ้ำหลายครั้ง (ห้าครั้งหรือมากกว่า) จะให้ภาพที่เสถียรกว่า
  3. แหล่งที่มา (Source) – เกณฑ์มาตรฐานที่ผู้ผลิตจัดทำขึ้นเองนั้นมีประโยชน์สำหรับการดูค่าพื้นฐาน แต่ควรได้รับการยืนยันจากห้องปฏิบัติการอิสระ
  4. เกณฑ์การเปรียบเทียบ (Comparison baseline) – "โมเดลถัดไป" ที่นำมาเทียบนั้นยังคงเป็นผู้นำในปัจจุบัน หรือมีคู่แข่งรายใหม่ที่เพิ่งเข้าสู่สนามตั้งแต่การทดสอบนั้นเริ่มขึ้น?

ผลกระทบต่อผู้ใช้และคู่แข่ง

องค์กรที่รันกระบวนการตรวจสอบโค้ด (code-review pipelines) ขนาดใหญ่สามารถลดเวลาในวงจรการแก้บั๊ก (debugging cycles) ลงได้หลายชั่วโมง และลดค่าใช้จ่ายในการประมวลผลบนคลาวด์ลงได้ ด้วยการเพิ่มขึ้นสิบจุดใน SWE-bench Pro ในขณะที่ราคาต่อโทเคนยังเท่าเดิม ทีมขนาดเล็กจะได้รับผู้ช่วยที่มีความสามารถมากขึ้นโดยไม่จำเป็นต้องเพิ่มงบประมาณ

คะแนน General Reasoning ที่สูสีกันช่วยเตือนนักพัฒนาว่า Opus 5 ไม่ใช่ตัวแทนที่จะมาแทนที่โมเดลอเนกประสงค์ที่ดีที่สุดในปัจจุบันได้ทั้งหมด

สิ่งที่ต้องจับตามองต่อไป

  • การเปิดเผยผลทดสอบจากหน่วยงานอิสระ – ห้องปฏิบัติการภายนอกจะเริ่มทดสอบ Opus 5 ด้วยชุดการทดสอบเดียวกันในระดับความพยายามที่หลากหลายในเร็วๆ นี้ ผลลัพธ์ของพวกเขาจะช่วยยืนยันหรือโต้แย้งคำกล่าวอ้างของ Anthropic

บทสรุป

Claude Opus 5 มอบการเพิ่มประสิทธิภาพการเขียนโค้ดที่ชัดเจนในราคาต่อโทเคนเท่าเดิม ทำให้เป็นการอัปเกรดที่น่าสนใจสำหรับนักพัฒนาที่เน้นงานด้านซอฟต์แวร์ แม้จะยังตามหลังผู้นำอันดับหนึ่งในด้านการใช้เหตุผลทั่วไปหนึ่งก้าว และข้อได้เปรียบที่โฆษณาไว้ยังคงต้องรอการยืนยันจากหน่วยงานอิสระ สำหรับใครก็ตามที่ต้องวางแผนงบประมาณบริการ AI ความคุ้มค่าด้านต้นทุนในการทำงานด้านโค้ดคือเหตุผลที่จับต้องได้ที่สุดในการพิจารณาโมเดลนี้อย่างจริงจัง