Nemotron 3 Nano 30B A3B ซึ่งเป็นรุ่นก่อนหน้า ถูกวางตำแหน่งให้เป็นทางเลือกที่มีขนาดกะทัดรัดเมื่อเทียบกับโมเดลพื้นฐาน (foundation models) ขนาดใหญ่กว่าอยู่แล้ว ด้วยการเปลี่ยนมาใช้สถาปัตยกรรมแบบไฮบริด Mamba-Transformer และเปิดใช้งานพารามิเตอร์เพียง 3.6 พันล้านพารามิเตอร์ ณ เวลาใดเวลาหนึ่ง Lightning จึงช่วยผลักดันขีดจำกัดด้านประสิทธิภาพ ในขณะที่ยังคงให้ความสามารถในการใช้เหตุผลที่เทียบเท่ากับโมเดลที่มีขนาดใหญ่กว่ามาก

ทำไมความเร็วถึงสำคัญในตอนนี้

AI agent กำลังเปลี่ยนจากการประมวลผลแบบ batch ไปสู่การโต้ตอบแบบต่อเนื่อง แชทบอทที่หยุดชะงักไปหลายวินาทีจะทำให้รู้สึกอืดอาด หรือเครื่องมือช่วยเขียนโค้ด (code-completion tool) ที่พิมพ์ตามไม่ทันนักพัฒนาจะทำให้กระบวนการทำงานสะดุด ในสภาพแวดล้อมเช่นนี้ อัตราการประมวลผล (throughput) ต่อวินาทีจึงส่งผลโดยตรงต่อความรู้สึกถึงการตอบสนองที่รวดเร็ว ตัวเลข 670 token ต่อวินาทีนั้นสูงกว่าประมาณสองเท่าของ 386 token ต่อวินาทีที่รายงานสำหรับ Gemini 3.5 Flash-Lite ของ Google และช่วยลดเวลาในการทำภารกิจ Intelligence Index มาตรฐานลงเหลือเพียงประมาณครึ่งนาที ในทางตรงกันข้าม Qwen 3.6 35B A3B ต้องใช้เวลา 3.5 นาที และ Gemma 4 31B ต้องใช้เวลา 5.8 นาทีสำหรับภารกิจเดียวกัน

ช่องว่างดังกล่าวมีความสำคัญต่อบริการใดก็ตามที่ต้องรองรับคำขอจำนวนมากพร้อมกัน เซิร์ฟเวอร์ที่ประมวลผล token ได้มากกว่าเป็นสองเท่าบนฮาร์ดแวร์ชุดเดิม สามารถช่วยลดต้นทุนหรือเพิ่มความจุได้เป็นสองเท่า ซึ่งเป็นข้อได้เปรียบที่ชัดเจนสำหรับผู้ให้บริการคลาวด์และองค์กรต่างๆ

โมเดลทำตัวเลขเหล่านี้ได้อย่างไร

สถาปัตยกรรมแบบไฮบริดของ Nemotron 3.5 Lightning ผสมผสานจุดแข็งด้านการจดจำรูปแบบระยะไกล (long-range pattern-recognition) ของ Transformers เข้ากับประสิทธิภาพแบบ state-space ของ Mamba blocks การออกแบบนี้รักษาจำนวนพารามิเตอร์รวมไว้ในระดับสูงที่ 31.6 พันล้านพารามิเตอร์ เพื่อคงความสามารถในการสร้างโมเดล แต่จะมีเพียง 3.6 พันล้านพารามิเตอร์เท่านั้นที่ทำงานสำหรับแต่ละ token การเปิดใช้งานแบบเบาบาง (Sparse activation) ช่วยลดการคำนวณต่อ token ซึ่งช่วยเพิ่ม throughput โดยไม่ทำให้คุณภาพลดลงในสัดส่วนที่เท่ากัน

Artificial Analysis วัดคะแนน Intelligence Index ของ Lightning ได้ที่ 24 ซึ่งเพิ่มขึ้นถึง 9 คะแนนจากคะแนน 15 ของโมเดล Nano รุ่นก่อนหน้า สิ่งนี้ทำให้มันอยู่ในระดับเดียวกับ gpt-oss-120b ของ OpenAI แม้ว่า Lightning จะใช้พารามิเตอร์เพียงประมาณหนึ่งในสี่ก็ตาม แม้ว่าจะยังตามหลังโมเดลชั้นนำอย่าง Muse Glimmer ของ Meta (35) และ Qwen 3.6 35B A3B (32) แต่สัดส่วนความฉลาดต่อพารามิเตอร์ (intelligence-to-parameter ratio) ของมันนั้นจัดอยู่ในกลุ่มที่ดีที่สุด

ผลทดสอบ Agentic benchmark บอกเล่าเรื่องราวที่คล้ายกัน

ภาระงานแบบ Agentic (Agentic workloads) เช่น การวางแผน การใช้เครื่องมือ และการใช้เหตุผลแบบหลายขั้นตอน คือจุดที่ Lightning แสดงศักยภาพได้อย่างโดดเด่น ในการทดสอบ GDPval-AA v2 โมเดลนี้ได้รับคะแนน Elo ที่ 824 ซึ่งแซงหน้า gpt-oss-120b ที่มีพารามิเตอร์ 1.2 แสนล้านพารามิเตอร์ (800) และ Nemotron 3 Super ที่มีขนาดใหญ่กว่าของ Nvidia เอง (698) ในการทดสอบ Terminal-Bench v2.1 อัตราความสำเร็จของ Lightning เพิ่มขึ้นจาก 7% เป็น 24.3% ซึ่งใกล้เคียงกับ 26.2% ที่บันทึกโดย gpt-oss-120b

Nvidia ระบุว่าความร่วมมือในการทำ post-training กับพันธมิตรอย่าง CodeRabbit และ Harvey มีส่วนช่วยในการปรับจูนโมเดลสำหรับงานเฉพาะทาง (domain-specific tasks) การปรับปรุงเหล่านี้ช่วยให้โมเดลยังคงความรวดเร็วในขณะที่ยังคงความสามารถในการแข่งขันในภาระงานเฉพาะทาง

การใช้งานและการพิจารณาในทางปฏิบัติ

โมเดลนี้เปิดให้ใช้งานภายใต้ใบอนุญาต OpenMDW-1.1 ที่มีความยืดหยุ่น โดยมีน้ำหนักโมเดล (weights) ในรูปแบบ BF16 และ NVFP4 สำหรับรุ่น NVFP4 จะมีการบีบอัดโมเดลให้เล็กลงโดยสูญเสียคุณภาพเพียงเล็กน้อย ซึ่งเป็นตัวเลือกที่มีประโยชน์สำหรับการใช้งานที่ edge หรืออินสแตนซ์คลาวด์ที่เน้นความคุ้มค่าด้านต้นทุน นอกจากนี้ หน้าต่างบริบท (context window) ขนาดหนึ่งล้าน token ยังช่วยให้โมเดลสามารถจัดการกับ prompt ที่ยาวมากได้โดยไม่ถูกตัดทอน ซึ่งมีค่าอย่างยิ่งสำหรับการวิเคราะห์ในระดับเอกสารหรือชุดโค้ด (codebases) ขนาดใหญ่

การประมวลผลแบบ Serverless inference เริ่มใช้งานได้แล้วบนผู้ให้บริการอย่าง DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius และ Crusoe นักพัฒนาสามารถเริ่มทดลองใช้งานได้โดยไม่ต้องสร้างโครงสร้างพื้นฐานเอง อย่างไรก็ตาม ความคุ้มค่าที่แท้จริงจะขึ้นอยู่กับราคาของแต่ละแพลตฟอร์ม

สรุปประเด็นสำคัญ: Nemotron 3.5 Lightning พิสูจน์ให้เห็นว่าโมเดลสามารถเทียบเท่าระดับการใช้เหตุผลของระบบที่มีพารามิเตอร์ 1.2 แสนล้านพารามิเตอร์ ในขณะที่ให้ throughput ของ token สูงกว่าคู่แข่งชั้นนำเกือบสองเท่า ทำให้มันเป็นตัวเลือกที่แข็งแกร่งสำหรับ AI agent ที่ต้องการความหน่วงต่ำ (latency-sensitive)