ค่าใช้จ่ายรายปีสำหรับ AI tokens ในบางบริษัทเริ่มสูงพอๆ กับเงินเดือนวิศวกรแล้ว และผู้บริหารก็ไม่รู้ว่าควรจะดีใจหรือตื่นตระหนกดี ตลอดไม่กี่ปีที่ผ่านมา องค์กรต่างๆ ทุ่มเงินทุนมหาศาลลงไปใน Large Language Models โดยคาดหวังว่าการทำ inference ที่ถูกลงจะช่วยลดจำนวนพนักงานและทำให้รอบการส่งมอบงานเร็วขึ้นโดยอัตโนมัติ แต่ในทางกลับกัน องค์กรวิศวกรรมหลายแห่งกลับพบว่าตนเองต้องจ่ายเงินสองต่อ: ต่อแรกคือค่าบุคลากรที่พวกเขาหวังจะเสริมศักยภาพ และต่อที่สองคือค่าประมวลผล (compute) ที่ควรจะมาแทนที่คนเหล่านั้น คำถามไม่ใช่ว่า AI เขียนโค้ดได้หรือไม่ แต่คือโค้ดที่มันเขียนนั้นคุ้มค่ากับเงินมหาศาลที่ต้องเสียไปเพื่อผลิตมันออกมาหรือไม่

เกณฑ์มาตรฐานครึ่งหนึ่งของเงินเดือน

Jensen Huang ได้แสดงตัวเลขอย่างตรงไปตรงมาในช่วงปิดท้ายงาน GTC 2026 ขณะพูดใน All-In Podcast โดย CEO ของ Nvidia ได้เสนอให้วัดประสิทธิภาพของวิศวกรด้วยการเปรียบเทียบเงินเดือนของพวกเขากับปริมาณการใช้ AI tokens โดยตรง เกณฑ์ของเขานั้นชัดเจนและรุนแรง หากวิศวกรซอฟต์แวร์คนหนึ่งมีรายได้ 500,000 ดอลลาร์ต่อปี แต่หากวิศวกรคนนั้นใช้ tokens มูลค่าไม่ถึง 250,000 ดอลลาร์ต่อปี หรือประมาณครึ่งหนึ่งของเงินเดือน Huang ถือว่าเป็นสัญญาณเตือน ผู้บริหารควรจะ "ตื่นตระหนกอย่างหนัก" ตามคำพูดของเขา ไม่ใช่เพราะบริษัทใช้จ่ายกับคนมากเกินไป แต่เป็นเพราะพวกเขาน่าจะใช้ศักยภาพของคนเหล่านั้นได้ไม่เต็มที่

ตรรกะนี้พลิกมุมมองการควบคุมต้นทุนแบบเดิม สำหรับหลายปีที่ผ่านมา ทีมการเงินมองว่าค่าประมวลผลเป็นค่าใช้จ่ายผันแปรที่ต้องลดให้เหลือน้อยที่สุด แต่ Huang โต้แย้งในทางตรงกันข้าม วิศวกรค่าตัวแพงที่แทบไม่ได้แตะต้องโมเดลเลย ก็คือวิศวกรค่าตัวแพงที่ทำงานโดยไม่มีตัวคูณพลัง (force multiplier) ความคาดหวังคือบุคลากรที่มีค่าตัวสูงควรทำหน้าที่เหมือนกรวย (funnel) ที่ผลักดันปริมาณงานมหาศาลผ่านระบบ AI ตรวจสอบผลลัพธ์ และควบคุมการทำงานให้เป็นไปตามเป้าหมาย การใช้ token น้อยไม่ได้หมายถึงความประหยัด แต่มันหมายความว่ามนุษย์ยังคงต้องทำงานซ้ำซากที่โมเดลสามารถจัดการแทนได้

รูปแบบการใช้จ่ายในทางปฏิบัติ

เพื่อให้เข้าใจว่าทำไมเกณฑ์มาตรฐานนี้จึงสำคัญ ลองพิจารณาดูว่า tokens มูลค่า 250,000 ดอลลาร์นั้นหมายถึงอะไรกันแน่ เมื่อเทียบกับอัตราปัจจุบันของโมเดลระดับแนวหน้า (frontier models) นั่นไม่ใช่แค่การแนะนำคำอัตโนมัติเพียงไม่กี่ครั้ง แต่มันคือการประมวลผล tokens หลายล้านตัวในทุกวันทำงานผ่านงานที่หลากหลาย มันบ่งบอกถึงวิศวกรที่ไม่ได้เพียงแค่ยอมรับการเติมคำจาก editor แต่กำลังใช้โมเดลในการคิดวิเคราะห์เชิงสถาปัตยกรรมอย่างกว้างขวาง, การทำ refactoring จำนวนมากผ่าน intelligent agents, การสร้าง pipeline สำหรับการทดสอบอัตโนมัติ, การสร้างข้อมูลสังเคราะห์ (synthetic data generation) และการสำรวจการออกแบบแบบวนซ้ำ (iterative design exploration)

วิศวกรอาวุโสที่ทำงานในลักษณะนี้อาจเชื่อมโยงการเรียกใช้โมเดลหลายครั้งเข้าด้วยกันเพื่อสร้างฟีเจอร์เดียว ตั้งแต่การสร้างโครงสร้างพื้นฐาน (scaffolding), การวิเคราะห์ความเชื่อมโยง (dependencies) เพื่อหาจุดที่จะทำให้ระบบพัง (breaking changes), การจำลองพฤติกรรมในกรณีขอบเขต (edge-case behavior) และการสร้างเอกสารประกอบไปพร้อมๆ กัน ผลผลิต (throughput) จะมหาศาลเพราะมนุษย์ไม่ได้เป็นคนพิมพ์ทุกบรรทัดอีกต่อไป แต่พวกเขาทำหน้าที่เป็นผู้ควบคุม (steering) สำหรับ Huang เงินเดือนจะคุ้มค่าก็ต่อเมื่อมนุษย์ทำงานในสเกลนั้น โดยการทวีคูณผลงานของตนผ่านการปฏิสัมพันธ์กับโมเดลอย่างต่อเนื่อง

ผลตอบแทนที่หายไป

แม้จะมีวิสัยทัศน์เช่นนี้ แต่อุตสาหกรรมกำลังเผชิญกับช่องว่างที่กว้างขึ้นระหว่างการใช้จ่ายด้านโครงสร้างพื้นฐานกับผลลัพธ์ที่ได้รับ บริษัทต่างๆ เร่งรีบเข้าสู่กลยุทธ์ที่เน้นการใช้ token จำนวนมาก โดยการทำสัญญาในระดับองค์กรกับผู้ให้บริการ AI และการปรับเปลี่ยน development pipelines ให้เข้ากับเครื่องมือ Generative AI รายจ่ายฝ่ายทุน (capital expenditure) นั้นสูงจนน่าตกใจ แต่ผลตอบแทนด้านผลิตภาพสำหรับหลายๆ แห่งกลับน่าผิดหวัง

นักพัฒนาทำงานที่น่าเบื่อได้เร็วขึ้นจริงๆ โค้ดส่วน boilerplate, โครงสร้าง unit test และการทำงานแบบ CRUD ซ้ำๆ จะเสร็จสิ้นอย่างรวดเร็วเมื่อโมเดลสร้างร่างแรกขึ้นมา แต่การวิศวกรรมซอฟต์แวร์ไม่เคยเป็นเรื่องของความเร็วในการพิมพ์เลย งานที่ยากและมีราคาสูงคือการดูแลรักษาระบบที่ซับซ้อนและแผ่ขยายกว้างขวาง, การใช้เหตุผลผ่านรูปแบบความล้มเหลวแบบกระจายตัว (distributed failure modes), การรับประกันความปลอดภัยผ่านความเชื่อมโยงที่ซ้อนทับกัน และการจัดการหนี้ทางเทคนิค (technical debt) ที่เกิดขึ้นจากการใช้ทางลัดทุกครั้ง