ทำไมโมเดลใหม่ถึงให้ความรู้สึกว่า "ทำงานหนักขึ้น"

Google สร้าง Gemini 3.8 Flash ขึ้นมาเพื่อเอเจนต์อัตโนมัติ (autonomous agents) ที่ต้องคิดวิเคราะห์ผ่านหลายขั้นตอน ซึ่งต่างจาก Gemini 3.7 Flash ที่มักจะตอบคำถามในการทำงานเพียงรอบเดียว (single pass) แต่รุ่น 3.8 จะย่อยปัญหาออกเป็นคำถามย่อยๆ เรียกใช้ API ภายนอก และทำซ้ำไปเรื่อยๆ จนกว่าจะพอใจ Google เตือนว่าการทำงานที่ซับซ้อนขึ้นนี้จะใช้โทเคน (tokens) มากขึ้น โดยเฉพาะเมื่อตั้งค่า "effort" ไว้ในระดับสูง

ผลการวิเคราะห์จากหน่วยงานอิสระแสดงให้เห็นว่า จำนวนโทเคนขาออก (output tokens) ต่อหนึ่งงานเพิ่มขึ้นประมาณ 30% เมื่อเทียบกับ 3.7 Flash และจำนวนรอบการโต้ตอบ (interaction turns) ก็เพิ่มขึ้นด้วย เนื่องจากค่าธรรมเนียมต่อโทเคนยังคงเท่าเดิม ต้นทุนที่มีผลจริง (effective cost) จึงพุ่งสูงขึ้นประมาณ 40% สำหรับเวิร์กโหลดในโลกความเป็นจริงหลายรูปแบบ

Benchmark ที่สำคัญสำหรับนักพัฒนา

การแลกเปลี่ยนนี้ไม่ใช่แค่เรื่องในเชิงทฤษฎี ในการทดสอบแบบตัวต่อตัวบน DeepSWE v1.1 software-engineering benchmark พบว่า Gemini 3.8 Flash สามารถเอาชนะ Fable 5 ของ Anthropic ได้อย่างขาดลอย นอกจากนี้ โมเดลดังกล่าวยังครองอันดับสูงสุดใน Vals Finance Agent V2 และ Harvey’s Legal Agent benchmarks ซึ่งพิสูจน์ให้เห็นว่าสามารถจัดการกับการคำนวณทางการเงินที่ซับซ้อนและการใช้เหตุผลทางกฎหมายที่มีความละเอียดอ่อนได้

John Ennis ซีอีโอของ Aigora.ai ได้สรุปถึงข้อได้เปรียบนี้ว่า โมเดลนี้ให้ "คุณภาพการเขียนโค้ดระดับ Opus 5" ในขณะที่ใช้ต้นทุนเพียงเศษเสี้ยวและมีความเร็วที่สูงกว่าอย่างเห็นได้ชัด เขายกตัวอย่างกรณีการใช้งาน เช่น การสร้างวิดีโอด้วย Remotion ซึ่งการประมวลผล (inference) ที่รวดเร็วและการสร้างโค้ดที่ซับซ้อนช่วยลดเวลาในกระบวนการผลิต (production pipelines) ลงได้หลายชั่วโมง

เศรษฐศาสตร์ของ AI ที่กำลังเปลี่ยนไป

เมื่อก่อนนักพัฒนามักตัดสินความคุ้มค่าจากราคาต่อโทเคน (price-per-token) แต่เอเจนต์แบบหลายรอบ (multi-turn) ที่เสริมด้วยเครื่องมือ (tool-augmented) ได้เปลี่ยนตัวชี้วัดนั้นไปเป็นราคาต่อหนึ่งงานที่สำเร็จ (price-per-successful-task) สำหรับ Gemini 3.8 Flash ราคาต่อโทเคนที่มีราคาถูกลงไม่ได้การันตีว่าบิลค่าใช้จ่ายจะถูกลงเสมอไป หากโมเดลต้องใช้โทเคนมากขึ้นเพื่อให้ได้ผลลัพธ์แบบเดิม

Google วางตำแหน่งโมเดลนี้ไว้ระหว่างโมเดลระดับแนวหน้า (frontier models) ที่มีราคาแพงมหาศาล กับโมเดลแบบ single-turn ที่มีน้ำหนักเบา การใช้แบรนด์ "intelligence-on-demand" เป็นการส่งสัญญาณว่านักพัฒนาสามารถเข้าถึงพลังการใช้เหตุผลที่สูงขึ้นได้โดยไม่ต้องเผชิญกับความหน่วง (latency) ที่มักจะมาพร้อมกับโมเดลขนาดใหญ่และช้ากว่า การแลกเปลี่ยนนี้ชัดเจนมาก: ผลลัพธ์ที่ซับซ้อนขึ้นหมายถึงจำนวนโทเคนรวมที่สูงขึ้น

เมื่อไหร่ที่ควรใช้เวอร์ชันเดิมต่อไป

ทีมที่ต้องการความแม่นยำในการคาดการณ์ต้นทุน—โดยเฉพาะทีมที่รันงานแบบ batch ขนาดใหญ่หรือทำงานที่มีกำไรต่อหน่วยต่ำ—ควรใช้ Gemini 3.7 Flash ต่อไป โมเดลรุ่นเก่านี้ยังคงให้ความหน่วงต่ำและมีการใช้โทเคน (token footprint) ที่คงที่ ทำให้คาดการณ์ค่าใช้จ่ายรายเดือนได้ง่ายกว่า

สิ่งที่ต้องจับตามองต่อไป

  • ราคาของการเรียกใช้เครื่องมือ (Tool-call pricing):

บทสรุป

Gemini 3.8 Flash แสดงให้เห็นว่าการใช้เหตุผลที่สูงขึ้นสามารถทำได้ด้วยความหน่วงในระดับ flash แต่ต้องแลกมาด้วยการใช้โทเคนต่อการโต้ตอบที่มากขึ้น นักพัฒนาที่สร้างเอเจนต์ AI แบบหลายขั้นตอนที่มีความซับซ้อนจะพบว่าประสิทธิภาพที่เพิ่มขึ้นนั้นคุ้มค่า แต่พวกเขาต้องปรับงบประมาณเพื่อรองรับต้นทุนโทเคนที่ซ่อนอยู่ สำหรับคนอื่นๆ Gemini 3.7 Flash รุ่นเดิมยังคงเป็นตัวเลือกที่ปลอดภัยและคาดการณ์ได้มากกว่า