ในช่วงไม่กี่สัปดาห์ที่ผ่านมา Google ได้เติมเต็มไลน์ผลิตภัณฑ์ Gemini ของตนด้วยข้อความที่ชัดเจนว่า: ความเร็วและความเชี่ยวชาญเฉพาะด้านนั้นมีความสำคัญไม่แพ้กับพลังประมวลผลมหาศาล บริษัทได้เปิดตัว Flash รุ่นใหม่สามรุ่น ซึ่งแต่ละรุ่นได้รับการปรับแต่งมาเพื่อตอบโจทย์กลุ่มนักพัฒนาที่แตกต่างกัน อย่างไรก็ตาม ท่ามกลางแรงขับเคลื่อนทั้งหมดนี้ ยังมีตำแหน่งหนึ่งที่ยังว่างอยู่ นั่นคือ Gemini 3.5 Pro ซึ่งเป็นรุ่นเรือธงที่ยังไม่เปิดตัวสู่สาธารณะ และคู่แข่งก็ไม่ได้รออยู่เฉยๆ

Gemini 3.6 Flash: การแลกพลังประมวลผลมหาศาลกับความคุ้มค่าทางเศรษฐกิจ

หัวใจสำคัญของการประกาศครั้งนี้คือ Gemini 3.6 Flash โดย Google ได้ออกแบบโมเดลนี้มาเพื่อสร้างจุดสมดุล (trade-off) ที่นักพัฒนาจำนวนมากยินดีจะยอมรับ มันยอมสละประสิทธิภาพสูงสุดในด้านพลังประมวลผลดิบ เพื่อแลกกับการปรับปรุงด้านความเร็วและต้นทุนอย่างก้าวกระโดด สำหรับทีมที่รัน autonomous agents, high-throughput APIs หรือ content pipelines ขนาดใหญ่ การแลกเปลี่ยนนี้มักจะเป็นตัวตัดสินระหว่างผลิตภัณฑ์ที่ทำกำไรได้กับผลิตภัณฑ์ที่เป็นเพียงการทดลอง

ประสิทธิภาพที่เพิ่มขึ้นนั้นเห็นได้ชัดเจน จากข้อมูลของ Artificial Analysis Index คาดว่า 3.6 Flash จะใช้ output tokens น้อยกว่ารุ่นก่อนหน้าอย่าง 3.5 Flash ประมาณ 17 เปอร์เซ็นต์ และใน benchmark เฉพาะทางอย่าง DeepSWE Google อ้างว่าสามารถประหยัด token ได้สูงถึง 65 เปอร์เซ็นต์ เมื่อคุณต้องจ่ายเงินตามจำนวน token และต้องประมวลผลคำขอหลายล้านรายการต่อวัน เปอร์เซ็นต์เหล่านี้จะเปลี่ยนเป็นงบประมาณที่ประหยัดได้โดยตรง

การตั้งราคาแสดงให้เห็นถึงการมุ่งเน้นไปที่การเข้าถึงได้ง่าย โดย input tokens มีราคา 1.50 ดอลลาร์ต่อล้าน token ในขณะที่ output tokens อยู่ที่ 7.50 ดอลลาร์ต่อล้าน token ตัวแทนสนับสนุนลูกค้า (customer support agent) หรือผู้ช่วยตรวจสอบโค้ด (code-review assistant) ที่ต้องจัดการกับการโต้ตอบหลายพันครั้งต่อชั่วโมง จะใช้เงินในระดับนี้น้อยกว่าการใช้โมเดลเรือธงมาก สตาร์ทอัพขนาดเล็กและนักพัฒนาอิสระจึงมีโอกาสอย่างแท้จริงในการสร้าง agentic workflows โดยไม่ต้องใช้ cloud credits จนหมดเกลี้ยงภายในสัปดาห์เดียว

โมเดลนี้ไม่ได้แค่ถูกกว่าเท่านั้น แต่ยังฉลาดขึ้นอย่างเห็นได้ชัดในงานด้าน agentic โดยใน MLE Bench คะแนนพุ่งจาก 49.7 เปอร์เซ็นต์ เป็น 63.9 เปอร์เซ็นต์ และ OSWorld-Verified ก็กระโดดจาก 78.4 เปอร์เซ็นต์ เป็น 83 เปอร์เซ็นต์ นี่ไม่ใช่การพัฒนาเพียงเล็กน้อย แต่มันบ่งชี้ว่า 3.6 Flash สามารถวางแผน, ดีบั๊ก (debug) และดำเนินการตามงานหลายขั้นตอนได้อย่างน่าเชื่อถือมากกว่ารุ่นก่อนหน้าอย่างเห็นได้ชัด หากคุณกำลังสร้างผู้ช่วยวิจัยอัตโนมัติหรือ deployment agent ความสามารถที่เพิ่มขึ้นนี้มีความสำคัญมากกว่าพลังประมวลผลสูงสุดในทางทฤษฎี

ผู้เชี่ยวชาญเฉพาะด้าน: Flash-Lite และ Flash Cyber

หาก 3.6 Flash คือโมเดลสารพัดประโยชน์รุ่นใหม่ การเปิดตัวอีกสองรุ่นที่เหลือก็มุ่งเป้าไปที่จุดบกพร่องเฉพาะด้านด้วยความแม่นยำราวกับศัลยแพทย์

Gemini 3.5 Flash-Lite ถูกสร้างขึ้นเพื่อความเร็วโดยเฉพาะ โดยสามารถสร้าง output tokens ได้ถึง 350 token ต่อวินาที และมีราคาเพียง 0.30 ดอลลาร์ต่อล้าน input tokens ซึ่งเป็นราคาที่ยากจะมองข้าม คุณสามารถรันอินเทอร์เฟซแชทแบบเรียลไทม์, classification pipelines หรือการดึงข้อมูลปริมาณมหาศาลได้โดยไม่ต้องกังวลว่าค่าใช้จ่ายในการประมวลผล (inference bill) จะสูงจนแซงหน้ารายได้ของคุณ

สิ่งที่ทำให้ Flash-Lite น่าสนใจเป็นพิเศษคือในบางครั้งมันสามารถทำผลงานได้ดีเกินตัว Google ระบุว่ามันสามารถเอาชนะ Gemini 3 Flash ที่มีขนาดใหญ่กว่าในงานด้าน agentic software engineering และงานด้านการใช้งานคอมพิวเตอร์ (computer-use) บางประเภท อุตสาหกรรมนี้ใช้เวลาหลายปีในการสันนิษฐานว่า "ยิ่งใหญ่ยิ่งดี" แต่ Flash-Lite กำลังท้าทายแนวคิดนั้นด้วยการพิสูจน์ว่าโมเดลขนาดเล็กที่ได้รับการปรับแต่งมาอย่างดีสามารถทำผลงานได้เหนือกว่าโมเดลทั่วไปที่มีขนาดใหญ่กว่าในงานเฉพาะทาง สำหรับวิศวกรที่กำลังเลือกโมเดลสำหรับงานโปรดักชันที่เฉพาะเจาะจง เรื่องราวของการปรับแต่งประสิทธิภาพนี้ถือว่าน่าดึงดูดใจมาก

และยังมี Gemini 3.5 Flash Cyber นี่ไม่ใช่แชทบอททั่วไป แต่มันคือผู้เชี่ยวชาญด้านความปลอดภัยที่รวมเข้ากับ CodeMender agent ของ Google โดยตรง และได้รับการปรับแต่งมาเพื่อเวิร์กโฟลว์ด้านความปลอดภัยทางไซเบอร์ (cybersecurity workflows) โดยเฉพาะ ใน benchmark ของ CyberGym มันทำคะแนนได้ 83.2 เปอร์เซ็นต์ ซึ่งทำให้มันอยู่ในระยะที่ใกล้เคียงกับ