DeepSeek ได้เปิดตัวโมเดล DeepSeek V4 Pro รุ่น GA (general-availability) ผลการวัดเบื้องต้นแสดงให้เห็นว่ามันช่วยลดการใช้ reasoning token ลงได้ตั้งแต่ 18% ถึง 62% เมื่อเทียบกับรุ่น preview ซึ่งเป็นเรื่องสำคัญสำหรับใครก็ตามที่จ่ายเงินตามจำนวน token เพราะตอนนี้การใช้ prompt เดิมจะมีราคาถูกลงอย่างเห็นได้ชัด ในขณะที่ยังคงให้ผลลัพธ์ที่ใกล้เคียงกัน
สิ่งที่นำไปสู่การเปรียบเทียบ
การเปิดตัวรุ่น GA มาโดยไม่มีโพสต์บล็อกหรือบันทึกการเปลี่ยนแปลง (changelog) นักพัฒนาจึงต้องค้นหาความแตกต่างด้วยตัวเอง การทดสอบโดยชุมชนได้รันงานที่เหมือนกันบนทั้งสองเวอร์ชันและพบการเปลี่ยนแปลงที่ใหญ่ที่สุด นั่นคือการลดลงอย่างมากของจำนวน token ที่โมเดลใช้ในการ "คิด" (thinking) ก่อนที่จะตอบ สำหรับการค้นหาข้อมูลทั่วไป (trivial look-ups) รุ่น GA ใช้ reasoning token น้อยลงถึง 62% ส่วนในคำสั่งที่ซับซ้อนมากขึ้น การลดลงอยู่ที่ 18%
ประสิทธิภาพของ token และผลกระทบ
ในเวิร์กโฟลว์การสกัดข้อมูล (extraction workflow) ทั่วไป รุ่น preview ใช้ reasoning token ถึง 159 token เพื่อดึงข้อมูลเพียงไม่กี่ฟิลด์จาก prompt แต่เมื่อเปลี่ยนมาใช้รุ่น GA โดยปิดฟีเจอร์ “thinking” ตัวเลขนั้นจะลดลงเหลือเพียง 40 token สำหรับผู้ใช้ที่ใช้แผนการจ่ายตามการใช้งานจริง (metered plans) การประหยัดนี้จะเปลี่ยนเป็นค่าใช้จ่ายที่ลดลงโดยตรง โดยเฉพาะเมื่อใช้งานในสเกลใหญ่
การสกัด JSON: ปัญหาที่ซ่อนอยู่
ทั้งสองเวอร์ชันมักจะประสบปัญหาเมื่อเปิดโหมด “thinking” ไว้ แม้ว่าจะผ่านการตรวจสอบ JSON schema แต่กลับใส่ค่าตัวเลขที่ผิดพลาด มีเพียงรุ่น GA เท่านั้นที่คืนค่า JSON ได้ถูกต้องเมื่อปิดการ “thinking” ทีมที่ต้องการผลลัพธ์แบบโครงสร้าง (structured output) ควรปิด flag การคิด (thinking flag) สำหรับงานสกัดข้อมูล มิฉะนั้นจะได้รับข้อมูลที่ถูกต้องตามไวยากรณ์ (syntactically valid) แต่ค่าตัวเลขไม่ถูกต้อง
การจัดการการปฏิเสธที่เปลี่ยนไป
โมเดลรุ่น preview สามารถปฏิเสธคำถามที่มันเห็นว่าไม่สามารถตอบได้ โดยตอบว่า “I do not know” แต่โมเดลรุ่น GA จะไม่ทำเช่นนั้นอีกต่อไป แต่จะใช้วิธีใช้ token จนหมดงบประมาณโดยไม่ตอบ หรือไม่ก็สร้างคำตอบปลอมขึ้นมา การเปลี่ยนแปลงนี้ช่วยเพิ่มประสิทธิภาพของ token แต่ก็เป็นการเอาตาข่ายนิรภัยที่ช่วยป้องกันไม่ให้โมเดลเกิดอาการหลอน (hallucinating) ในหัวข้อที่ไม่รู้จักออกไป
การเพิ่มความน่าเชื่อถือ
ลูปที่อันตรายในรุ่น preview ซึ่งถูกกระตุ้นโดยงบประมาณการ “thinking” เพียงเล็กน้อย อาจทำให้โมเดลพูดข้อความเดิมซ้ำๆ จนกระทั่งเต็มหน้าต่าง 8,192 token การเปิดตัวรุ่น GA ได้แก้ไขบั๊กนี้แล้ว ซึ่งช่วยยุติการทำซ้ำแบบไม่หยุดยั้ง (runaway repetition) ที่เคยเสี่ยงต่อการทำให้หน้าต่างคำขอเต็มและทำให้ค่าใช้จ่ายพุ่งสูงขึ้น
สิ่งที่ผู้ใช้ควรระวัง
- ใช้รุ่น GA เพื่อจำนวน token ที่น้อยลง การลดลงที่วัดได้นั้นคงที่ในทุกระดับความซับซ้อนของงาน
- ปิด “thinking” สำหรับการสกัด JSON หรือข้อมูลที่มีโครงสร้าง (structured-data) วิธีนี้จะให้ค่าที่ถูกต้องและรักษาการใช้ token ให้ต่ำที่สุด
- อย่าฝากความหวังไว้กับการปฏิเสธคำถามในตัวโมเดล หาก prompt ถามข้อมูลที่ไม่สามารถตรวจสอบได้ โมเดล GA อาจจะยังคงสร้างคำตอบออกมา ดังนั้นการตรวจสอบความถูกต้องในขั้นตอนถัดไป (downstream validation) จึงยังคงเป็นสิ่งจำเป็น
- ระวังค่าใช้จ่ายในช่วงเวลาที่มีการใช้งานสูง กฎการตั้งราคาใหม่ทำให้การใช้ token ในช่วงที่มีทราฟฟิกสูงส่งผลต่อค่าใช้จ่ายโดยรวมรุนแรงกว่าเมื่อก่อน
บทสรุป
โมเดล DeepSeek V4 Pro GA มอบชัยชนะด้านประสิทธิภาพที่ชัดเจน โดยใช้ reasoning token น้อยลงสูงสุดถึง 62% และแก้ไขบั๊กการทำซ้ำที่สำคัญ อย่างไรก็ตาม การสูญเสียการตอบปฏิเสธที่ชัดเจนและความจำเป็นในการปิดการคิดเพื่อให้ได้ผลลัพธ์ JSON ที่แม่นยำถือเป็นปัจจัยใหม่ที่ต้องพิจารณา ทีมที่ปรับเปลี่ยน pipeline ของตนสามารถลดต้นทุนได้โดยไม่สูญเสียฟังก์ชันการทำงาน
Source: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l
