นักวิจัยได้ประกาศเปิดตัวเฟรมเวิร์กการเรียนรู้แบบเสริมกำลัง (reinforcement-learning) ใหม่ที่ชื่อว่า Ring-Zero ซึ่งช่วยให้โมเดลภาษาขนาดหนึ่งล้านล้านพารามิเตอร์ (trillion-parameter) สามารถเรียนรู้วิธีการใช้เหตุผลได้ภายใต้ข้อจำกัดของงบประมาณโทเคน (token-budget) โดยโมเดลนี้ทำคะแนนได้ถึง 84.2% ในการสอบคณิตศาสตร์ AIME ปี 2026 ผลลัพธ์นี้แสดงให้เห็นว่า ณ ขนาดระดับนี้ โมเดลสามารถเรียนรู้พฤติกรรมการแก้ปัญหาแบบเป็นขั้นตอน ซึ่งโดยปกติแล้ววิศวกรจะต้องเขียนคำสั่ง (hard-code) ลงในพรอมต์ (prompt)
ทำไมเรื่องนี้ถึงสำคัญ
ประสิทธิภาพในระดับ AIME เป็นเกณฑ์มาตรฐานสำหรับ "การใช้เหตุผลเชิงปริมาณในระดับมนุษย์" มาอย่างยาวนาน การทำคะแนนได้ในช่วง 84.2% โดยไม่มีตัวอย่างที่เขียนโดยมนุษย์เลยนั้น บ่งชี้ว่าความสามารถในการใช้เหตุผลของโมเดลเกิดขึ้นจากพลวัตของการฝึกฝน (training dynamics) เอง ไม่ใช่จากโครงร่าง (scaffolds) ที่สร้างขึ้นด้วยมือ สำหรับบริษัทที่กำลังสร้าง AI agent นัยสำคัญของเรื่องนี้ชัดเจนมาก นั่นคือ การเขียนและดูแลรักษาชุดคำสั่งพรอมต์ (prompt recipes) ที่ซับซ้อนอาจถูกแทนที่ด้วยลูปการฝึกฝน (training loop) ที่สอนให้โมเดลรู้ว่าเมื่อใดควรคิดให้หนักขึ้น และเมื่อใดที่การใช้ทางลัดแบบประหยัดก็เพียงพอแล้ว
จากการวิศวกรรมพรอมต์สู่พลวัตของการฝึกฝน
เป็นเวลาหลายปีที่นักพัฒนาต้องพึ่งพาเทมเพลตพรอมต์ เช่น "แบ่งปัญหาออกเป็นส่วนๆ" หรือ "ตรวจสอบคำตอบของคุณ" เพื่อจูงใจให้โมเดลภาษาขนาดใหญ่ใช้เหตุผลแบบหลายขั้นตอน เทมเพลตเหล่านั้นทำหน้าที่เป็นโครงร่างภายนอก โดยโมเดลจะปฏิบัติตามคำสั่งแต่ไม่ได้ซึมซับกระบวนการนั้นเข้าเป็นส่วนหนึ่งของตัวเอง Ring-Zero ได้พลิกกระบวนทัศน์นั้น โดยโมเดลจะได้รับคำอธิบายงานพร้อมกับ คำตอบที่ตรวจสอบได้ (verifiable answer) ซึ่งเป็นค่าความจริง (ground-truth) ที่สามารถตรวจสอบได้โดยอัตโนมัติ จากนั้นโมเดลจะสร้างชุดการลองผิดลองถูก และจะได้รับรางวัล (reward) ก็ต่อเมื่อการลองนั้นตรงกับคำตอบที่ตรวจสอบได้เท่านั้น แล้วจึงอัปเดตกลยุทธ์ (policy) ของตนเองผ่านการเรียนรู้แบบเสริมกำลัง
เนื่องจากรางวัลผูกติดกับวัตถุประสงค์ที่ยากต่อการโกง (คำตอบต้องถูกต้อง ไม่ใช่แค่ดูสมเหตุสมผล) โมเดลจึงค้นพบรูปแบบการใช้เหตุผลได้ด้วยตัวเอง งานวิจัยนี้โต้แย้งว่า เมื่อมีสัญญาณรางวัล (reward signal) ที่เชื่อถือได้แล้ว การขยายขนาดโมเดลไปสู่ระดับหนึ่งล้านล้านพารามิเตอร์จะทำให้เทคนิคการวิศวกรรมพรอมต์ที่วิศวกรเคยใส่เข้าไปด้วยมือในโมเดลขนาดเล็ก ปรากฏขึ้นมาโดยอัตโนมัติ
ขั้นตอนการฝึกฝนแบบ 4 ขั้นตอน
การฝึกฝนของ Ring-Zero ดำเนินการผ่าน 4 ระยะที่แตกต่างกัน:
- First-stage RL – โมเดลสำรวจร่องรอยการใช้เหตุผล (reasoning traces) ที่เป็นไปได้ เพื่อเรียนรู้ว่าลำดับของโทเคนแบบใดที่มีแนวโน้มจะนำไปสู่คำตอบที่ถูกต้อง
- Self-distillation – ร่องรอยที่มีคุณภาพสูงจะถูกส่งกลับเข้าไปในโมเดล เพื่อสร้างความเสถียรให้กับรูปแบบการใช้เหตุผลที่กำลังเกิดขึ้น
- Second-stage RL – ลูปที่มีความละเอียดมากขึ้นจะช่วยขัดเกลากลยุทธ์ (policy) ในขณะที่ยังคงรักษาการพัฒนาที่เกิดขึ้นก่อนหน้านี้ไว้
- Tiered training – โมเดลเรียนรู้ที่จะจัดสรรงบประมาณโทเคนอย่างชาญฉลาด โดยเลือกระหว่างเส้นทางการใช้เหตุผลแบบสั้น (≈2,000 โทเคน) และแบบยาว (≈20,000 โทเคน) ขึ้นอยู่กับความยากของปัญหา
การฝึกฝนแบบแบ่งระดับ (Tiered training) เป็นส่วนที่มีความสำคัญที่สุดในการนำไปใช้งานจริง ในการใช้งานจริง โทเคนแต่ละตัวที่เพิ่มขึ้นหมายถึงต้นทุนการประมวลผลที่เพิ่มขึ้น การสอนให้โมเดลรู้จักแยกแยะว่าเมื่อใดที่ปัญหาเรียบง่ายพอสำหรับคำตอบสั้นๆ และเมื่อใดที่ควรใช้การวิเคราะห์เชิงลึกแบบหลายขั้นตอน ทำให้ Ring-Zero เชื่อมโยงคุณภาพของการใช้เหตุผลเข้ากับประสิทธิภาพทางเศรษฐกิจโดยตรง
สองระยะของการเรียนรู้: การค้นพบและการขัดเกลา
ผู้เขียนอธิบายเส้นโค้งการเรียนรู้ว่าเป็นกระบวนการสองระยะ:
- Discovery (การค้นพบ) – ขั้นตอนการเรียนรู้แบบเสริมกำลังในช่วงแรกจะมีความผันผวน (noisy) สูง โมเดลจะทดลองใช้กลยุทธ์ที่หลากหลาย ซึ่งหลายอย่างก็ล้มเหลว ความผันผวนนี้เป็นสิ่งจำเป็นสำหรับการค้นพบเส้นทางการใช้เหตุผลแบบใหม่ๆ
- Sharpening (การขัดเกลา) – เมื่อรูปแบบที่มีแนวโน้มดีปรากฏขึ้น ขั้นตอน RL ในช่วงหลังจะช่วยปรับปรุงกลยุทธ์ให้รัดกุมยิ่งขึ้น ลดความผันผวน และทำให้พฤติกรรมนั้นมั่นคงขึ้น
พัฒนาการนี้สะท้อนถึงวิธีการพัฒนาของมนุษย์ นั่นคือการระดมสมองในช่วงแรกตามด้วยการฝึกฝนอย่างจดจ่อ ประเด็นสำคัญคือควรยอมรับช่วงเริ่มต้นที่ "วุ่นวาย" แทนที่จะพยายามกดมันไว้ เพราะมันคือวัตถุดิบสำหรับการขัดเกลาในภายหลัง
สิ่งที่อาจผิดพลาดได้คืออะไร?
ความเชื่อมั่นในงานวิจัยนี้ขึ้นอยู่กับสมมติฐานบางประการที่ควรได้รับการตรวจสอบ:
- การออกแบบรางวัล (Reward design) – เฟรมเวิร์กนี้ต้องการรางวัลที่ทั้งตรวจสอบได้และยากต่อการใช้ทางลัด สำหรับงานในโลกความเป็นจริงหลายอย่าง การกำหนดรางวัลเช่นนี้ไม่ใช่เรื่องง่าย และอาจต้องใช้กระบวนการทำข้อมูลกำกับ (annotation pipelines) ที่มีค่าใช้จ่ายสูง
- คอขวดด้านสภาพแวดล้อม (Environmental bottlenecks) – ผู้เขียนชี้ให้เห็นว่าประสิทธิภาพของโมเดลไม่ได้ถูกจำกัดด้วยขนาด แต่ถูกจำกัดด้วยโครงสร้างพื้นฐานในการประเมินผลที่อยู่ล้อมรอบ (ชุดทดสอบ, ล็อก, ตัวชี้วัดที่ชัดเจน) การสร้างและดูแลรักษาโครงสร้างพื้นฐานเหล่านั้นอาจต้องใช้ความพยายามทางวิศวกรรมอย่างมหาศาล
- ต้นทุนการประมวลผลในการฝึกฝน (Compute cost of training) – การฝึกฝนโมเดลขนาดหนึ่งล้านล้านพารามิเตอร์ด้วยขั้นตอน RL หลายขั้นตอนนั้นมีราคาแพง แม้ว่าการฝึกฝนแบบแบ่งระดับจะช่วยลดต้นทุนการอนุมาน (inference costs) แต่ต้นทุนการฝึกฝนล่วงหน้ายังคงสูง ซึ่งอาจจำกัดการเข้าถึงแนวทางนี้ไว้เฉพาะในห้องปฏิบัติการที่มีทุนทรัพย์สูงเท่านั้น
สิ่งที่ควรจับตามองต่อไป
ข้อสรุปที่นำไปใช้ได้จริงสำหรับผู้ปฏิบัติงานด้าน AI
- อย่ามองว่า prompt เป็นกลไกเพียงอย่างเดียว – ให้ลองตั้งคำถามว่า พฤติกรรมที่คุณกำลังเขียนลงใน prompt นั้น สามารถเรียนรู้ผ่านลูปการฝึกฝนที่ขับเคลื่อนด้วยรางวัล (reward-driven training loop) แทนได้หรือไม่
- กำหนดให้การใช้งาน token เป็นวัตถุประสงค์หลัก – ใส่สัญญาณที่คำนึงถึงงบประมาณตั้งแต่เนิ่นๆ เพื่อให้โมเดลเรียนรู้ที่จะสร้างสมดุลระหว่างความแม่นยำกับต้นทุนในการประมวลผล (compute cost)
- สร้างวงจรการตอบกลับที่สมบูรณ์ – ติดตั้งระบบที่ป้อนงานโดยอัตโนมัติ วัดผลลัพธ์เทียบกับคำตอบที่ตรวจสอบได้ และส่งผลลัพธ์กลับเข้าสู่กระบวนการฝึกฝน เพราะลูปนี้คือจุดที่โมเดลจะค้นพบเวิร์กโฟลว์ของตัวเอง
เมื่อรางวัลมีความชัดเจนและสภาพแวดล้อมสามารถวัดความสำเร็จได้อย่างน่าเชื่อถือ การขยายขนาดโมเดล (scaling up) จะทำได้มากกว่าแค่การเพิ่มขีดความสามารถดิบๆ แต่มันจะสอนให้โมเดลรู้จัก เลือก วิธีการคิดด้วย การเปลี่ยนผ่านจากการใช้โครงสร้างที่เขียนขึ้นเอง (hand-written scaffolding) ไปสู่การใช้เหตุผลด้วยตนเอง (self-directed reasoning) อาจเปลี่ยนโฉมหน้าวิธีการที่เราสร้างและกำหนดราคา AI agents
