การรันโมเดล AI ขนาดใหญ่ในระดับสเกลได้กลายเป็นปัญหาทางคณิตศาสตร์ที่โหดหินเกี่ยวกับค่าไฟและค่าเช่าดาต้าเซ็นเตอร์ มากกว่าจะเป็นความสำเร็จทางวิทยาศาสตร์เสียอีก ทุกๆ โทเคน (token) ที่ Gemini สร้างขึ้นมีต้นทุนที่จับต้องได้สำหรับ Google ทั้งรอบการทำงานของซิลิคอน (silicon cycles), แบนด์วิดท์หน่วยความจำ (memory bandwidth) และพลังงานวัตต์ที่ดึงมาจากปลั๊กไฟ เมื่อปริมาณการสอบถามเพิ่มขึ้น เศษเสี้ยวของเซนต์ก็สามารถสะสมจนกลายเป็นจำนวนเงินที่กลืนกินกำไรไปได้ทั้งหมด ความเร่งด่วนที่เงียบเชียบนี้เองคือเบื้องหลังของ Frozen v2 โปรเจกต์ชิปเซิร์ฟเวอร์ภายในที่กำลังเป็นรูปเป็นร่างภายใน Google แทนที่จะปรับปรุง Tensor Processing Units (TPUs) ที่เป็นเอนกประสงค์ให้ดีขึ้นอีกรุ่น บริษัทกำลังพยายามทำสิ่งที่ล้ำหน้ากว่านั้นมาก นั่นคือการหล่อโครงร่างของโมเดล Gemini ลงไปในตัวซิลิคอนโดยตรง

จากตัวเร่งความเร็วที่ยืดหยุ่น สู่ซิลิคอนเฉพาะทางสำหรับโมเดล

TPU ของ Google เป็นกำลังหลักของโครงสร้างพื้นฐานมาเกือบหนึ่งทศวรรษ พวกมันใช้ฝึกโมเดล, ขับเคลื่อนอัลกอริทึมการจัดอันดับการค้นหา และแม้แต่ปล่อยเช่าเป็นรายชั่วโมงให้กับลูกค้าคลาวด์ รวมถึง Meta และรายอื่นๆ ที่กำลังมองหาทางเลือกแทน GPU ของ Nvidia ความอเนกประสงค์นี้เองคือสิ่งที่ทำให้ TPU เป็น TPU มันสื่อสารด้วยชุดคำสั่งทั่วไปของการคูณเมทริกซ์ (matrix multiplication) และการเคลื่อนย้ายหน่วยความจำ ซึ่งสามารถใช้งานได้กับโครงข่ายประสาทเทียม (neural network) เกือบทุกรูปแบบที่คุณสามารถอธิบายได้ด้วยซอฟต์แวร์

Frozen v2 จงใจแลกความยืดหยุ่นนั้นทิ้งไป ชิปนี้ถูกออกแบบมาให้เป็นตัวเร่งความเร็วเฉพาะโดเมน (domain-specific accelerator) ที่วงจรภายในสะท้อนถึงส่วนต่างๆ ของสถาปัตยกรรม Gemini โดยตรง ในขณะที่ TPU จะดึงคำสั่งและตีความคำสั่งเหล่านั้นเป็นปฏิบัติการทางซอฟต์แวร์ แต่ Frozen v2 จะฝังพิมพ์เขียวโครงสร้างของโมเดล—การจัดวางเลเยอร์ (layers) และเส้นทางการส่งข้อมูล (data paths)—ลงไปในเลย์เอาต์ของชิปโดยตรง Google คาดหวังว่าการผสานรวมอย่างแนบแน่นระหว่างโมเดลและโลหะนี้จะทำให้ชิปมีประสิทธิภาพมากกว่า TPU ในปัจจุบันถึง 6 ถึง 10 เท่าในการให้บริการคำตอบของ AI การลดขั้นตอนการคำนวณต่อการสอบถามหนึ่งครั้งหมายถึงการใช้เวลารอน้อยลงเพื่อให้โทเคนปรากฏขึ้น และใช้พลังงานในการสร้างมันน้อยลงอย่างมาก

นี่ไม่ใช่แค่เวอร์ชันที่เร็วขึ้นของแนวคิดเดิม แต่มันคือชิปในหมวดหมู่ที่แตกต่างออกไป ซึ่งเป็นการแลกความอเนกประสงค์เพื่อความทุ่มเทให้กับโมเดลตระกูลเดียว

ทำไม “Frozen” รุ่นแรกถึงละลายหายไป

แนวทางนี้มีรากฐานมาจากแนวคิดก่อนหน้านี้ที่เชื่อว่าเป็นของ Jeff Dean หัวหน้านักวิทยาศาสตร์ที่ Google DeepMind ข้อเสนอ “Frozen” ดั้งเดิมเสนอให้เพิ่มความเฉพาะทางให้มากขึ้นไปอีก โดยการฮาร์ดโค้ด (hardcoding) ไม่ใช่แค่สถาปัตยกรรมเท่านั้น แต่รวมถึงค่าน้ำหนักของโมเดล (model weights) จริงๆ ด้วย ซึ่งก็คือพารามิเตอร์หลายพันล้านตัวที่ผ่านการปรับจูนจนกลายเป็นพฤติกรรมที่เรียนรู้ของ Gemini ลงไปในตัวชิปโดยตรง

ตรรกะนั้นสมเหตุสมผล หากคุณรู้แน่ชัดว่าโมเดลจะใช้ตัวเลขใด ทำไมต้องเสียเวลาดึงพวกมันมาจากหน่วยความจำภายนอก? คุณสามารถสลักพวกมันลงในทรานซิสเตอร์และกำจัดความล่าช้าได้ทั้งระบบ

ปัญหาคือความคงทน (permanence) โมเดล AI ไม่เคยหยุดนิ่ง Google อัปเดต Gemini อย่างต่อเนื่อง มีการฝึกฝนใหม่ด้วยข้อมูลใหม่ ปรับพารามิเตอร์ และปล่อยเวอร์ชันที่ปรับปรุงแล้วออกมา ชิปที่มีค่าน้ำหนักถูกแช่แข็งไว้ในซิลิคอนจะกลายเป็นเพียงที่ทับกระดาษทันทีที่มีการส่งโมเดลเวอร์ชันใหม่ การขาดความยืดหยุ่นนี้เองที่ทำให้แนวคิดดั้งเดิมต้องล้มเหลว

สถาปัตยกรรมที่ไร้พันธนาการ

Frozen v2 แก้ปัญหาเรื่องความล้าสมัยด้วยการฮาร์ดโค้ดสถาปัตยกรรมไว้ แต่ปล่อยให้ค่าน้ำหนักสามารถเปลี่ยนแปลงได้ ให้ลองนึกภาพว่ามันคือการเทพื้นสนามแข่งรถที่ออกแบบมาโดยเฉพาะ แทนที่จะเชื่อมรถเข้ากับถนน รูปทรงของวงจรจะถูกกำหนดไว้ตายตัวและปรับให้เหมาะสมกับรูปแบบการคำนวณเฉพาะของ Gemini แต่เนื้อหาที่ไหลผ่านวงจรเหล่านั้นสามารถอัปเดตได้โดยการโหลดค่าน้ำหนักใหม่จากหน่วยความจำ

ความแตกต่างนี้สำคัญมากในทางปฏิบัติ เมื่อวิศวกรฝึกโมเดล Gemini checkpoint ใหม่ พวกเขาสามารถนำไปใช้งานบนฮาร์ดแวร์ Frozen v2 ได้โดยไม่ต้องผลิตชิปใหม่ ระดับของการฮาร์ดโค้ดที่แน่นอนยังคงเป็นคำถามที่เปิดกว้างภายใน Google โดยทีมงานต้องตัดสินใจอย่างแม่นยำว่าองค์ประกอบทางโครงสร้างใดที่ควรได้รับ "ความเป็นอมตะในซิลิคอน" และส่วนใดที่ควรยังสามารถปรับแต่งได้ แต่หลักการนั้นชัดเจนแล้ว ด้วยการแช่แข็งรูปทรงและสลับพารามิเตอร์ได้อย่างลื่นไหล Google จะสามารถรักษาข้อดีด้านประสิทธิภาพไว้ได้โดยไม่สูญเสียความสามารถในการพัฒนาซ้ำ (iterate)

เศรษฐศาสตร์ของการเก็บไว้ใช้เองภายใน

ยังมีอีกเหตุผลหนึ่งที่คุณจะไม่เห็น Frozen v2 ปรากฏอยู่ในรายการราคาของ Google Cloud เนื่องจากชิปนี้ถูกออกแบบมาให้สอดคล้องกับโครงสร้างภายในของ Gemini อย่างใกล้ชิด มันจึงแทบไม่มีประโยชน์สำหรับนักพัฒนาภายนอกที่รัน PyTorch หรือโมเดล Transformer รูปแบบอื่นๆ Google ไม่มีแผนที่จะขายมันเป็นผลิตภัณฑ์เอนกประสงค์ แต่มันจะยังคงเป็นเครื่องมือภายในที่มุ่งเป้าไปที่ความต้องการมหาศาลในการประมวลผล (inference capacity) ภายในดาต้าเซ็นเตอร์ของ Google เอง

ทางเลือกนั้นสะท้อนถึงความเป็นจริงทางเศรษฐกิจที่ชัดเจน ในตลาด Generative AI ปัจจุบัน ความสามารถของโมเดลต่าง ๆ กำลังเข้าใกล้กันอย่างรวดเร็ว ช่องว่างระหว่างคู่แข่งมักจะตัดสินกันที่ว่าใครสามารถรันโมเดลที่ใหญ่ที่สุดได้ด้วยต้นทุนต่อโทเคน (cost per token) ที่ต่ำที่สุด การทำ Inference ไม่ใช่เรื่องที่ตามมาทีหลังการเทรนอีกต่อไป สำหรับผลิตภัณฑ์ที่มีผู้ใช้งานอย่างแพร่หลายอย่าง Gemini มันคือค่าใช้จ่ายหลัก หาก Frozen v2 สามารถลดค่าใช้จ่ายนั้นลงได้ถึง 6 เท่าหรือมากกว่า Google จะมีแต้มต่อที่คู่แข่งไม่สามารถเทียบได้โดยง่าย Google สามารถเลือกที่จะเก็บส่วนต่างที่ประหยัดได้ไว้เป็นกำไร หรือจะส่งต่อความคุ้มค่านี้ด้วยการลดราคาสำหรับผู้ใช้งาน API และการรวมเข้ากับผลิตภัณฑ์อื่น ๆ ซึ่งจะเป็นการบีบคั้น OpenAI, Anthropic และรายอื่น ๆ

สิ่งนี้บ่งบอกอะไรต่ออุตสาหกรรม

ความเคลื่อนไหวของ Google ยังบ่งบอกถึงทิศทางของกลยุทธ์ด้านฮาร์ดแวร์ในภาพรวมด้วย เป็นเวลาหลายปีที่แผนการมาตรฐานคือการสร้างตัวเร่งความเร็ว (accelerator) ที่มีความยืดหยุ่นมากที่สุดเท่าที่จะเป็นไปได้ แล้วปล่อยให้ซอฟต์แวร์เป็นตัวจัดการความเฉพาะทาง GPU ของ Nvidia ครองตลาดเพราะพวกมันสามารถรันได้ทุกอย่าง ตั้งแต่พลศาสตร์โมเลกุล (molecular dynamics) ไปจนถึงวิดีโอเกม และโมเดลภาษาขนาดใหญ่ (large language models) TPU ของ Google เองก็ถูกคิดค้นขึ้นด้วยแนวคิดเรื่องอรรถประโยชน์ที่ครอบคลุมเช่นเดียวกัน

Frozen v2 กำลังฉีกออกจากธรรมเนียมนั้น มันคือการยอมรับว่าเมื่อตระกูลโมเดลใดตระกูลหนึ่งมีปริมาณการสอบถาม (query volume) มากพอ ชิปซิลิคอนที่ออกแบบมาเฉพาะสำหรับโมเดลนั้นก็สามารถคืนทุนได้หลายเท่าตัว ผู้ให้บริการคลาวด์รายใหญ่ (hyperscalers) อื่น ๆ ก็ใช้ตรรกะที่คล้ายกัน เช่น ชิป Trainium และ Inferentia ของ Amazon แต่แนวทางของ Google นั้นลึกซึ้งกว่า โดยการร่วมออกแบบฮาร์ดแวร์ให้สอดคล้องกับสถาปัตยกรรมโมเดลที่เฉพาะเจาะจง แทนที่จะเป็นเครือข่ายประเภททั่วไป

แน่นอนว่าความเสี่ยงคือความตายตัว (rigidity) หากสถาปัตยกรรมของ Gemini พัฒนาไปในทิศทางที่วงจรที่ถูกกำหนดไว้ตายตัวไม่สามารถรองรับได้ Google อาจพบว่าตัวเองมีชิปซิลิคอนราคาแพงที่ไม่สามารถรันแนวคิดใหม่ ๆ ของบริษัทได้ นั่นคือเหตุผลว่าทำไมการประนีประนอมด้วยการเน้นเฉพาะสถาปัตยกรรมจึงมีความสำคัญ มันคือทางสายกลาง: มีความเฉพาะทางเพียงพอที่จะสร้างประสิทธิภาพที่เพิ่มขึ้นอย่างมหาศาล และมีความยืดหยุ่นเพียงพอที่จะไม่ทำให้บริษัทต้องตกที่นั่งลำบาก

บทสรุปที่แท้จริง

Frozen v2 ควรถูกทำความเข้าใจในฐานะการเดิมพันเชิงกลยุทธ์ต่อรูปแบบการแข่งขัน AI ในอนาคต มากกว่าที่จะเป็นเพียงการประกาศเปิดตัวชิป Google กำลังเดิมพันว่าผู้ชนะจะไม่ใช่แค่ผู้ที่สร้างโมเดลที่ดีที่สุด แต่จะเป็นผู้ที่ครอบครองทั้ง Stack ตั้งแต่พิมพ์เขียวของโมเดลไปจนถึงอิเล็กตรอนที่วิ่งผ่านทรานซิสเตอร์ หากโครงการนี้ประสบความสำเร็จ ผลตอบแทนจะไม่ปรากฏในคะแนน Benchmark แต่มันจะปรากฏในช่องต้นทุนของรายงานผลประกอบการรายไตรมาส ซึ่งการประหยัดเงินได้เพียงไม่กี่เซนต์ต่อหนึ่งล้านโทเคน สามารถขีดเส้นแบ่งใหม่ของสิ่งที่เป็นไปได้ในเชิงพาณิชย์สำหรับ Generative AI