OpenAI ระบุว่าโมเดล GPT-5.6 Sol ของตนทำอัตราความสำเร็จได้ถึง 38.3% ในการทดสอบตรรกะเหตุผล (logical-reasoning benchmark) ARC-AGI-3 ซึ่งแซงหน้า Claude Opus 5 ของ Anthropic ที่ทำได้ 30.2% อย่างไรก็ตาม ความได้เปรียบนี้จะปรากฏขึ้นก็ต่อเมื่อโมเดลทำงานผ่าน Responses API ที่ปรับแต่งโดยเฉพาะของ OpenAI เท่านั้น ซึ่งมีการเพิ่มเทคนิคพิเศษในช่วงการอนุมาน (inference-time tricks) สองอย่างที่ชุดทดสอบมาตรฐาน (official test harness) ไม่อนุญาตให้ใช้
ปูมหลัง: สงครามสะสมอาวุธในด้านการทดสอบมาตรฐาน
ARC-AGI-3 ทดสอบความสามารถของโมเดลในการแก้ปัญหาใหม่ๆ ที่มีหลายขั้นตอนโดยไม่พึ่งพาข้อมูลที่จดจำมา เมื่อต้นปีนี้ Anthropic ได้ประกาศความก้าวหน้าแบบก้าวกระโดดถึงสี่เท่าในการทดสอบนี้ ส่งผลให้ Opus 5 ขึ้นครองอันดับหนึ่งในตารางผู้นำ (leaderboard) สาธารณะ ผลลัพธ์ดังกล่าวได้กลายเป็นจุดอ้างอิงใหม่สำหรับความสามารถ "ดิบ" (raw) ของโมเดล เนื่องจากชุดทดสอบมาตรฐานจะตัดกระบวนการให้เหตุผลระหว่างทาง (intermediate reasoning) ทิ้งไปหลังจากจบแต่ละขั้นตอน ทำให้โมเดลต้องเริ่มคิดใหม่ทุกครั้ง
คำกล่าวอ้างของ OpenAI เกิดขึ้นท่ามกลางบรรยากาศการแข่งขันที่รุนแรงเช่นเดียวกัน การประกาศคะแนนที่สูงกว่าเป็นการส่งสัญญาณว่าโมเดลรุ่นล่าสุดของบริษัทไม่เพียงแต่จะเทียบเท่า แต่ยังสามารถก้าวข้ามประสิทธิภาพด้านตรรกะของคู่แข่งรายสำคัญได้ อย่างไรก็ตาม พาดหัวข่าวดังกล่าวกำลังบดบังรายละเอียดทางเทคนิคที่สำคัญ ซึ่งกำลังเปลี่ยนวิธีที่ชุมชนนักพัฒนาใช้ในการอ่านตารางผลการทดสอบมาตรฐาน
ความหมายที่แท้จริงของตัวเลขเหล่านี้
เมื่อ GPT-5.6 Sol ถูกประเมินภายใต้ชุดทดสอบมาตรฐาน ARC-AGI-3 แบบเดียวกับที่ทำให้ Opus 5 ได้คะแนน 30.2% อัตราความสำเร็จของโมเดลกลับลดฮวบลงเหลือเพียง 7.8% ความแตกต่างที่รุนแรงนี้ไม่ใช่ข้อผิดพลาด แต่เป็นผลมาจากฟีเจอร์ที่ถูกออกแบบมาสองอย่างซึ่ง OpenAI รวมไว้กับโมเดล:
- Retained Reasoning – แทนที่จะล้างกระบวนการคิด (chain-of-thought) ทิ้งหลังจากจบแต่ละงานย่อย ระบบจะเก็บข้อความระหว่างทางไว้ ทำให้โมเดลสามารถย้อนกลับไปอ้างอิงการอนุมานก่อนหน้าและสร้างข้อโต้แย้งที่สะสมต่อเนื่องกันได้
- Compaction – แทนที่จะตัดบริบทเก่าทิ้งเพื่อให้เป็นไปตามขีดจำกัดของ token ตัว wrapper จะทำการบีบอัดขั้นตอนก่อนหน้าให้เป็นบทสรุปสั้นๆ เพื่อรักษาลำดับทางตรรกะไว้ในขณะที่ยังควบคุมขนาดของ prompt ให้จัดการได้ง่าย
กลไกทั้งสองนี้ทำงานอยู่ภายใต้ Responses API ซึ่งเป็นกรรมสิทธิ์ของบริษัท การป้อนบริบทที่ต่อเนื่องและเข้มข้นกว่าให้แก่โมเดล ช่วยให้ OpenAI สามารถเพิ่มพูน "ความจำ" ของโมเดลได้อย่างมีประสิทธิภาพ และช่วยให้โมเดลสามารถนำการให้เหตุผลของตัวเองกลับมาใช้ใหม่ได้ ในทางตรงกันข้าม ชุดทดสอบมาตรฐานจะบังคับใช้โหมด "stateless" ที่เข้มงวด ซึ่งจะตัดข้อได้เปรียบเหล่านั้นออกไปทั้งหมด
ทำไมระเบียบวิธีวิจัยจึงสำคัญ
เหตุการณ์นี้ชี้ให้เห็นถึงความแตกแยกที่เพิ่มขึ้นในการประเมินผล AI นั่นคือ ระหว่างคะแนนดิบของโมเดล (raw model scores) กับประสิทธิภาพในระดับระบบ (system-level performance) OpenAI โต้แย้งว่าการทดสอบมาตรฐานควรสะท้อนถึงเทคโนโลยีทั้งชุด (stack) ที่นักพัฒนาจะนำไปใช้งานจริง ซึ่งประกอบด้วย โมเดล, กระบวนการอนุมาน (inference pipeline) และการจัดการหน่วยความจำ หากมองจากมุมนี้ คะแนน 38.3% จะบอกกับทีมพัฒนาผลิตภัณฑ์ว่าโซลูชันแบบครบวงจรนี้สามารถแก้ปัญหาในโลกแห่งความเป็นจริงได้มากกว่าโมเดลที่ถูกประเมินแบบแยกส่วน
นักวิจารณ์กล่าวว่าสิ่งนี้ทำให้ความก้าวหน้าทางวิทยาศาสตร์คลุมเครือ หากทุกห้องปฏิบัติการต่างเพิ่ม wrapper ที่ปรับแต่งขึ้นเอง ตารางผู้นำก็จะกลายเป็นเพียงการรวมเอาเทคนิคทางวิศวกรรมต่างๆ มาปะติดปะต่อกัน มากกว่าจะเป็นการเปรียบเทียบความฉลาดของโมเดลอย่างแท้จริง ชุดทดสอบมาตรฐาน ARC-AGI-3 มีไว้เพื่อสร้างความเท่าเทียม เพื่อให้มั่นใจว่าตัวเลขที่สูงขึ้นหมายถึงโมเดลพื้นฐานที่แข็งแกร่งขึ้นจริงๆ ไม่ใช่แค่การมี wrapper ที่ฉลาดกว่า
เดิมพันสำหรับนักพัฒนาและนักลงทุน
สำหรับสตาร์ทอัพที่สร้างผลิตภัณฑ์ที่ขับเคลื่อนด้วย AI ความแตกต่างนี้มีผลในทางปฏิบัติ โมเดลที่สามารถรักษาการให้เหตุผลและบีบอัดบริบทได้อาจต้องการการทำ prompt engineering ที่น้อยลง มีความหน่วงในการอนุมาน (inference latency) ต่ำลง และใช้การเรียก API น้อยลงเพื่อหาคำตอบ ซึ่งจะส่งผลให้ค่าใช้จ่ายในการประมวลผล (compute bills) ถูกลงและมอบประสบการณ์การใช้งานที่ราบรื่นยิ่งขึ้น บริษัทที่ส่งมอบระบบแบบเบ็ดเสร็จ (turnkey system) ซึ่งประกอบด้วยโมเดลบวกกับชั้นการอนุมานที่ได้รับการปรับแต่งแล้ว จะได้เปรียบในการแข่งขันในด้านความเร็วและต้นทุน
นักลงทุนเฝ้าดูการไต่อันดับในตารางทดสอบมาตรฐานเพื่อใช้เป็นตัวบ่งชี้รายได้ในอนาคต การขึ้นเป็นผู้นำที่ดึงดูดพาดหัวข่าวสามารถเพิ่มมูลค่าบริษัทได้ แม้ว่าความสามารถดิบของโมเดลพื้นฐานจะเท่ากับคู่แข่งก็ตาม ดังนั้น การถกเถียงกันว่าตัวเลขเหล่านี้แสดงถึงอะไร จึงส่งผลต่อทิศทางการไหลเวียนของเงินทุนในภาคส่วน AI
สิ่งที่ต้องจับตามองต่อไป
- การตอบสนองของผู้กำหนดมาตรฐาน – ผู้จัดทำการทดสอบมาตรฐานอาจเพิ่มความเข้มงวดของกฎเกณฑ์เกี่ยวกับเทคนิคการอนุมาน "ภายนอก" หรือเพิ่มหมวดหมู่ "system" แยกต่างหากที่อนุญาตให้ใช้เทคนิคเหล่านี้ได้อย่างชัดเจน การตอบสนองของพวกเขาจะกำหนดทิศทางของตารางผู้นำสาธารณะในระลอกถัดไป
- Open-source wrappers – หากชุมชนนักพัฒนาปล่อยการใช้งาน retained reasoning และ compaction ในรูปแบบโอเพนซอร์ส ความได้เปรียบนี้อาจกลายเป็นฟีเจอร์พื้นฐานแทนที่จะเป็นข้อได้เปรียบเฉพาะตัวของบริษัทใดบริษัทหนึ่ง
- สนามทดสอบในโลกจริง – บริษัทต่างๆ เริ่มเผยแพร่ประสิทธิภาพบนชุดปัญหาที่เป็นกรรมสิทธิ์ของตนเองมากขึ้น (เช่น ชุดทดสอบการสร้างโค้ดภายในองค์กร) แม้ว่าผลลัพธ์เหล่านั้นจะนำมาเปรียบเทียบกันได้ยากกว่า แต่จะเริ่มมีความสำคัญมากกว่าการทดสอบมาตรฐานสาธารณะเพียงอย่างเดียว
ข้อโต้แย้ง: นี่คือการ "เอาเปรียบระบบ" (gaming) การทดสอบมาตรฐานหรือไม่?
Some researchers label the use of custom APIs as “benchmark gaming,” arguing it inflates scores without advancing core model understanding. They point out that a model collapsing to single-digit performance under strict constraints is still far from the AGI goal. The concern is that the field may start rewarding engineering shortcuts over genuine leaps in reasoning ability.
OpenAI’s side stresses that the line between model and system is increasingly artificial. Modern AI applications rarely run a model in a vacuum; they always sit behind a serving layer that handles caching, context stitching, and output post-processing. From that angle, measuring the whole pipeline is more honest about what users actually experience.
Takeaway
The GPT-5.6 Sol story shows that today’s benchmark victories hinge as much on inference engineering as on model size. Whether the community embraces system-level scores or reins in custom wrappers will determine how we read the next “leaderboard” headline. For anyone building or financing AI products, the lesson is clear: raw numbers matter, but the surrounding software can be the decisive factor in real-world performance.
