ไฮไลท์ผลการทดสอบประสิทธิภาพ
งานประชุม Hot Chips ได้เปิดเผยตัวเลขที่ได้รับการตรวจสอบโดยบริษัทอิสระด้วยชุดเครื่องมือ InferenceX โดย OpenAI เรียก Jalapeño ว่าเป็นตัวเร่งการประมวลผลแบบอนุมาน (inference accelerator) อเนกประสงค์ ซึ่งใช้สำหรับรันโมเดลแต่ไม่ได้ใช้สำหรับฝึกสอน (train) โมเดล จากการทดสอบ ชิปตัวนี้:
- ให้ประสิทธิภาพการทำงานต่อวัตต์ (work per watt) มากกว่าผู้นำตลาดในปัจจุบันอยู่ที่ 1.5 เท่า ถึง 1.9 เท่า ณ อัตราการส่งผ่านข้อมูลสูงสุด (peak throughput)
- ลดความหน่วง (latency) ลง 1.7 เท่า ถึง 3.6 เท่า พร้อมเพิ่มประสิทธิภาพในการโต้ตอบ (interactive gains) ได้ถึง 2.1 เท่า ถึง 4.1 เท่า
ผลลัพธ์เฉพาะสำหรับแต่ละโมเดล:
- GPT-OSS 120B: ~1,400 โทเคน/วินาที/ผู้ใช้
- Deepseek R1 670B: ~700 โทเคน/วินาที ต่อหนึ่งคำขอที่ทำงานพร้อมกัน (single concurrent request)
- Kimi K2.5 1T: ได้รับการทดสอบในชุดทดสอบประสิทธิภาพสูง (ไม่เปิดเผยตัวเลขที่แน่นอน)
OpenAI เน้นย้ำว่าตัวเลขเหล่านี้ได้มาโดยไม่ต้องใช้เทคนิค speculative decoding หรือ multi-token prediction ซึ่งเป็นเทคนิคที่คู่แข่งหลายรายใช้เพื่อปั่นตัวเลขให้ดูสูงขึ้น
เบื้องหลังการสร้าง Jalapeño
OpenAI ออกแบบชิปนี้เสร็จสิ้นภายในเวลาเพียง 9 เดือน โดยร่วมมือกับ Broadcom บริษัทได้นำโมเดลของตนเองเข้าสู่กระบวนการออกแบบ (design loop) เพื่อเร่งขั้นตอนการทำพิมพ์เขียว การเขียนโปรแกรม และการเพิ่มประสิทธิภาพ ซึ่งเป็นวิธีการที่เรียกว่า “AI-assisted silicon design” การเร่งพัฒนาครั้งนี้แสดงให้เห็นถึงการเปลี่ยนแปลงจากวงจรการพัฒนาที่เคยใช้เวลาหลายปีในการสร้างชิปประสิทธิภาพสูง
นัยสำคัญต่อความเป็นผู้นำของ Nvidia
Nvidia พึ่งพาประสิทธิภาพดิบ (raw performance) และระบบนิเวศ CUDA แต่ข้อมูลใหม่นี้ทำให้ความได้เปรียบด้านประสิทธิภาพเริ่มถูกท้าทาย นักวิเคราะห์เตือนว่าหากบริษัท AI รายอื่นเริ่มเปิดตัวชิป inference ที่ออกแบบเองด้วยประสิทธิภาพที่ใกล้เคียงกัน นักพัฒนาอาจเริ่มหันเหออกจาก CUDA ซึ่งจะเปิดโอกาสให้มีซอฟต์แวร์สแตก (stacks) ทางเลือกอื่น ๆ และทำให้ตลาดเกิดการแตกแขนง (fragmented market)
กลยุทธ์แบบผสมผสานของ OpenAI
Kelly Huang ประธานเจ้าหน้าที่ฝ่ายการเงิน ระบุว่า Jalapeño เป็นเพียงส่วนหนึ่งของแผนการประมวลผลที่กว้างขึ้น ไม่ใช่การเข้ามาแทนที่พันธมิตรเดิมทั้งหมด โดย OpenAI ยังคงทำงานร่วมกับ Nvidia, AMD, AWS และ Cerebras ในภาระงาน (workloads) ต่าง ๆ Jalapeño ยังคงเป็นเพียงตัวอย่างทางวิศวกรรม (engineering sample) และยังไม่ได้ทดสอบกับโมเดลขนาดใหญ่ที่กำลังจะมาถึงอย่าง Deepseek V4 Pro ความเห็นของ Huang บ่งชี้ว่า OpenAI จะใช้ชิปของตนเองผสมผสานกับตัวเร่งความเร็วจากบุคคลที่สาม เพื่อแสวงหาความคุ้มค่าระหว่างต้นทุนและประสิทธิภาพ (cost-performance mix) ที่ดีที่สุดสำหรับแต่ละงาน
ข้อโต้แย้ง
ตัวอย่างในระยะเริ่มต้นยังไม่สามารถรับประกันการผลิตจำนวนมาก (volume production) อัตราผลตอบแทนการผลิต (yields) หรือความน่าเชื่อถือในระยะยาวได้ ดังนั้นจึงควรระมัดระวังในการคาดหวัง
สิ่งที่ต้องจับตามองต่อไป
- การเริ่มผลิตจริง: OpenAI จะสามารถเปลี่ยน Jalapeño ให้เป็นชิ้นส่วนที่ผลิตในปริมาณมากได้หรือไม่ และในราคาเท่าใด?
- ซอฟต์แวร์สแตก (Software stack): รูปแบบการเขียนโปรแกรมและชุดเครื่องมือ (toolchain) สำหรับนักพัฒนาจะมีความพร้อมเพียงใด?
- การตอบโต้จากคู่แข่ง: Nvidia และผู้ผลิตรายอื่นจะปรับเปลี่ยนแผนงาน (roadmaps) หรือราคาอย่างไรเพื่อรักษาแชร์ส่วนแบ่งการตลาด?
- การขยายขนาดโมเดล: Jalapeño จะยังคงรักษาความได้เปรียบในโมเดลระดับล้านล้านพารามิเตอร์ (trillion-parameter models) ระลอกถัดไปได้หรือไม่?
บทสรุป: ชิป inference ที่ออกแบบเองกำลังเปลี่ยนผ่านจากการเป็นเพียงการทดลองเฉพาะกลุ่ม ไปสู่การเป็นความท้าทายที่สำคัญต่อการครองตลาดฮาร์ดแวร์ของ Nvidia
