GPT-5.6-SOL สามารถทำภารกิจคณิตศาสตร์ ฟิสิกส์ และการเขียนโค้ดแบบหลายขั้นตอนได้สำเร็จถึงสามภารกิจ ในขณะที่ Kimi K3 ใช้โควตาโทเคนจนหมดและหมดเวลา (timed out) เมื่อเจอคำสั่งเดียวกัน ซึ่งเผยให้เห็นข้อจำกัดในการใช้งานจริงสำหรับนักพัฒนาที่ต้องการคำตอบที่เชื่อถือได้และครบถ้วนตั้งแต่ต้นจนจบ
ทำไมการทดสอบนี้จึงสำคัญ
โมเดลทั้งสองได้รับคำสั่ง (prompts) ที่เหมือนกันภายใต้เพดานโทเคนเดียวกัน โดยไม่มีการเปิดใช้งานเครื่องมือค้นหาทางอินเทอร์เน็ต การทดสอบนี้มุ่งเน้นไปที่การใช้เหตุผลแบบหลายขั้นตอน (multi-step reasoning) ซึ่งเป็นความต้องการทั่วไปในการคำนวณทางวิทยาศาสตร์และการสร้างโค้ด ในการใช้งานจริง โมเดลที่ใช้โควตาโทเคนจนหมดก่อนที่จะให้ผลลัพธ์สุดท้ายสามารถทำให้กระบวนการทำงาน (pipelines) หยุดชะงักและเพิ่มภาระในการแก้บั๊ก (debugging)
เกิดอะไรขึ้นในการประชันหน้ากัน
GPT-5.6-SOL
- ให้คำตอบที่สมบูรณ์สำหรับทั้งสามความท้าทาย
- ให้การพิสูจน์สูตรทางคณิตศาสตร์และฟิสิกส์ที่ถูกต้อง
- สร้างสคริปต์ Python ที่สามารถคอมไพล์และรันบนอินเทอร์พรีเตอร์ (interpreter) ในเครื่องได้
- พลาดกรณีทดสอบ (test case) หนึ่งในตัวอย่างผลลัพธ์ แต่ตรรกะหลักยังคงถูกต้อง
Kimi K3
- ไม่สามารถแสดงคำตอบที่มองเห็นได้สำหรับปัญหาคณิตศาสตร์และฟิสิกส์
- ติดขีดจำกัดโทเคนซ้ำแล้วซ้ำเล่า ทำให้การใช้เหตุผลถูกตัดตอนก่อนที่จะได้ข้อสรุป
- หยุดทำงานหลังจากผ่านไป 245 วินาทีในภารกิจการเขียนโปรแกรม โดยไม่มีโค้ดที่สามารถรันได้ส่งมาให้
บทเรียนสำคัญสำหรับผู้ปฏิบัติงาน
- โทเคนในการใช้เหตุผล เทียบกับ ผลลัพธ์สุดท้าย – Kimi K3 ใช้โควตาโทเคนส่วนใหญ่ไปกับกระบวนการคิดภายใน (internal thought chains) เมื่อโควตาถูกจำกัด โมเดลจึงมักจะใช้พื้นที่จนหมดก่อนที่จะสามารถแสดงคำตอบออกมาได้ ทำให้ไม่เหมาะกับเวิร์กโฟลว์ที่ต้องการผลลัพธ์ในทันที
- ตรรกะ เทียบกับการทดสอบ – แม้แต่โมเดลที่ใช้เหตุผลได้ถูกต้องก็อาจพลาดรายละเอียดปลีกย่อยได้ กรณีที่ GPT-5.6-SOL ให้กรณีทดสอบที่ไม่ถูกต้องช่วยเตือนให้เราตรวจสอบโค้ดสำหรับตรวจสอบความถูกต้อง (validation code) ที่สร้างขึ้นด้วยตนเองเสมอ
- ความหน่วง (Latency) และเหตุผลในการหยุดทำงานเป็นเรื่องสำคัญ – ในกระบวนการทำงานจริง (production pipelines) ควรบันทึก (log) ไม่เพียงแค่คำตอบสุดท้ายเท่านั้น แต่ยังรวมถึงเหตุผลที่โมเดลหยุดทำงาน (เช่น ขีดจำกัดโทเคน, การหมดเวลา เป็นต้น) และจำนวนโทเคนที่ใช้ไปกับการใช้เหตุผลด้วย
สิ่งที่ควรจับตามองต่อไป
จนกว่าจะมีการเปลี่ยนแปลงดังกล่าว นักพัฒนาที่ต้องการผลลัพธ์แบบ end-to-end ที่เชื่อถือได้ มีแนวโน้มที่จะเลือกใช้โมเดลอย่าง GPT-5.6-SOL สำหรับงานที่เกี่ยวข้องกับการคำนวณแบบต่อเนื่องหรือการสังเคราะห์โค้ด (code synthesis)
สำหรับทีมที่สร้างระบบอัตโนมัติ การทดสอบนี้เน้นย้ำถึงกฎง่ายๆ คือ: ให้ทดสอบทั้งความถูกต้องของคำตอบและความสามารถของโมเดลในการไปถึงคำตอบนั้นภายใต้ข้อจำกัดในการทำงานที่คุณกำหนดไว้ โมเดลที่ "คิด" แต่ไม่เคยทำงานให้เสร็จสิ้น ก็ไม่ต่างอะไรกับทางตัน
