Hugging Face กลายเป็นสิ่งที่มากกว่าแค่แหล่งรวมโมเดล (model zoo) บทความวิจัยที่กำลังเป็นกระแสในนั้นทำหน้าที่เป็นเหมือนเข็มทิศบอกทิศทางที่ชุมชน AI กำลังมุ่งหน้าไปจริงๆ เป็นเวลาหลายปีที่เรื่องเล่าหลักนั้นเรียบง่าย: เพิ่มพารามิเตอร์ เพิ่มข้อมูล เพิ่มพลังการประมวลผล (compute) ยุคนั้นยังไม่ตาย แต่มันไม่ใช่ภาพรวมทั้งหมดอีกต่อไป บทความที่มีอิทธิพลล่าสุดเผยให้เห็นการเปลี่ยนลำดับความสำคัญที่ชัดเจน นักวิจัยและผู้สร้างกำลังตั้งคำถามที่ยากขึ้นว่าระบบเหล่านี้จะอยู่รอดเมื่อต้องเผชิญกับโลกแห่งความเป็นจริงหรือไม่ จุดเน้นกำลังเปลี่ยนจากการขยายขนาด (scale) ไปสู่การนำไปใช้งานจริง (operationalization)—ว่าโมเดลมีกระบวนการคิดอย่างไร ทำงานบนฮาร์ดแวร์ราคาถูกได้อย่างไร ข้ามผ่านจากสภาพแวดล้อมซอฟต์แวร์หนึ่งไปยังอีกแห่งหนึ่งได้อย่างไร และช่วยให้วิทยาศาสตร์ก้าวหน้าเร็วขึ้นได้อย่างไร
การใช้เหตุผลที่ทนทานต่อแรงกดดัน
มีความเหลื่อมล้ำที่เพิ่มขึ้นระหว่างวิธีที่เราฝึกฝนโมเดลภาษาขนาดใหญ่ (LLM) กับวิธีที่เราใช้งานจริง โมเดลอาจจะลดค่า loss ได้อย่างสวยงามในระหว่างการฝึก แต่กลับล้มเหลวเมื่อต้องใช้เหตุผลเพื่อแก้บั๊กในโค้ดหรือพิสูจน์โจทย์คณิตศาสตร์หลายขั้นตอน บทความล่าสุดฉบับหนึ่งโต้แย้งว่าการแก้ไขไม่ใช่แค่เทคนิคการฝึกฝนแบบเดิมๆ แต่เราจำเป็นต้องปรับปรุงการทำงานของโมเดลในระหว่างการอนุมาน (inference) ไม่ใช่แค่คะแนนจากตัวชี้วัดการฝึก (training metrics) เท่านั้น กระบวนการ reinforcement learning ส่วนใหญ่ยังคงวิ่งไล่ตามรางวัลในช่วงเวลาการฝึก (training-time rewards) การคิดใหม่ที่นำเสนอนี้หมายถึงการทำให้ "ลำดับความคิด" (chain of thought) มีความเสถียร สำหรับใครก็ตามที่กำลังสร้างผู้ช่วยเขียนโค้ดหรือติวเตอร์คณิตศาสตร์ นี่คือจุดเปลี่ยนที่นำ
การเขียนงานวิจัยไม่ใช่สิ่งที่ทำให้เหล่านักวิทยาศาสตร์ล่าช้าเสมอไป แต่เป็นพวกโปสเตอร์ วิดีโอสรุปความยาวสามนาที การปรับเนื้อหาลงบล็อก และเธรดในโซเชียลมีเดียต่างหากที่กินเวลาไปทั้งสัปดาห์ เครื่องมือใหม่ๆ ในปัจจุบันสามารถนำงานวิจัยเพียงฉบับเดียวมาประมวลผล และสร้างชุดสื่อสารทั้งหมดนั้นให้โดยอัตโนมัติ ในด้านการค้นพบ ระบบอื่นๆ จะอ่านวรรณกรรมเพื่อหาหลักฐานที่แท้จริง และเสนอทิศทางการวิจัยตามช่องว่างที่มีการบันทึกไว้ ไม่ใช่ตามสัญชาตญาณ ผลลัพธ์ที่ได้คือวงจรการทำงานที่สั้นลง ตั้งแต่การทดลองไปจนถึงการเกิดความเข้าใจอย่างลึกซึ้ง ทั้งนักศึกษาบัณฑิตศึกษาและหัวหน้าโครงการวิจัยสามารถนำเวลาหลายชั่วโมงกลับมาใช้เพื่อการคิด แทนที่จะต้องเสียไปกับการจัดรูปแบบเอกสาร
การเลือก Optimizer ด้วยเรขาคณิต ไม่ใช่การคาดเดา
การเลือกระหว่าง Adam และ Lion ยังคงให้ความรู้สึกเหมือนเป็นความรู้เฉพาะกลุ่มที่ส่งต่อกันผ่านช่องทาง Slack ของห้องแล็บ งานวิจัยใหม่ได้ปรับกรอบปัญหาใหม่โดยใช้ระบบการจำแนกเชิงเรขาคณิต แทนที่จะต้องเสียชั่วโมง GPU ไปกับการสุ่มทดสอบ (sweep) อีกรอบ คุณสามารถเปรียบเทียบ optimizer ด้วยคุณสมบัติทางเรขาคณิต และทำนายได้ว่าแต่ละตัวจะมีปฏิสัมพันธ์กับ loss landscape ของคุณอย่างไร สิ่งนี้เปลี่ยนการเลือกจากการใช้เวทมนตร์ให้กลายเป็นการวินิจฉัย สำหรับผู้ปฏิบัติงาน นี่หมายถึงการลดจำนวนรอบการฝึกฝนที่ล้มเหลวเงียบๆ เนื่องจากเรขาคณิตของ optimizer ขัดแย้งกับเรขาคณิตของข้อมูล
World Models ที่เข้าใจผลลัพธ์ที่ตามมาอย่างแท้จริง
วิดีโอจำลองของหุ่นยนต์ที่กำลังวางแผนเส้นทางอาจดูยอดเยี่ยม แต่ไม่ได้พิสูจน์อะไรเลย บททดสอบที่แท้จริงคือ world model สามารถทำนายผลกระทบระยะยาวจากการกระทำของมันได้หรือไม่ การยกกล่องใบนั้นในตอนนี้ จะทำให้แขนกลติดอยู่หลังชั้นวางในภายหลังหรือไม่? เกณฑ์มาตรฐาน (benchmarks) ใหม่ๆ ได้ตัดความสวยงามทางภาพออกไป และให้คะแนนโมเดลจากความสามารถในการคาดการณ์เชิงเหตุและผล (causal foresight) เพียงอย่างเดียว เรื่องนี้สำคัญเพราะโปรแกรมจำลองที่สวยงามไม่สามารถแก้ไขเซนเซอร์ที่ถูกบดขยี้หรือพาเลทที่ถูกชนล้มได้ นักหุ่นยนต์ต้องการการประเมินที่สอดคล้องกับความเสี่ยงในโลกแห่งความเป็นจริง
การรัน Diffusion โดยไม่ต้องจ่ายค่า GPU มหาศาล
Diffusion models สร้างภาพที่น่าทึ่ง แต่ก็มาพร้อมกับค่าใช้จ่ายในการประมวลผลที่สูงลิ่ว เทคนิคการทำ quantization แบบใหม่ช่วยบีบอัดน้ำหนัก (weights) เหล่านี้สำหรับ GPU ขนาดเล็ก โดยไม่จำเป็นต้องใช้ชุดข้อมูลใหม่จำนวนมหาศาลหรือการฝึกฝนใหม่ทั้งหมด คุณยอมแลกความแม่นยำเพียงเล็กน้อยกับความสามารถในการรันแบบ local, การประมวลผลงานแบบ batch บนฮาร์ดแวร์ที่มีอยู่ หรือการให้บริการ inference โดยไม่ต้องเช่าคลัสเตอร์ระดับพรีเมียม สำหรับสตูดิโอและครีเอเตอร์อิสระ สิ่งนี้จะเปลี่ยนเศรษฐศาสตร์ของสื่อเชิงสร้างสรรค์ (generative media) อุปสรรคในการทดลองสร้างวิดีโอและรูปภาพลดลงอย่างรวดเร็ว
บทสรุปที่สำคัญ
แกนกลางที่เชื่อมโยงงานทั้งหมดนี้เข้าด้วยกันคือการนำไปใช้งานจริง (operationalization) ชุมชนได้ก้าวข้ามผ่านยุคที่ "ใหญ่กว่า" เท่ากับ "ดีกว่า" โดยอัตโนมัติไปแล้ว งานวิจัยที่ได้รับความสนใจกำลังมุ่งเน้นการปรับปรุงความเสถียรในช่วงเวลา inference, กลยุทธ์การผสมข้อมูล (data mixing), หน่วยความจำข้ามแพลตฟอร์ม, การปรับใช้บนอุปกรณ์ปลายทาง (edge deployment) และการค้นพบที่อิงตามหลักฐาน พวกเขามองว่าโมเดลเป็นเพียงส่วนประกอบหนึ่งในระบบที่ใหญ่กว่า ซึ่งรวมถึงข้อจำกัดด้านฮาร์ดแวร์, ส่วนต่อประสานกับผู้ใช้ (user interfaces) และกระบวนการทำงานด้านการวิจัย
หากคุณกำลังพัฒนาผลิตภัณฑ์เพื่อใช้งานจริง สัญญาณที่ส่งออกมานั้นชัดเจนมาก จงปรับปรุงเพื่อความเป็นจริงในการนำไปใช้งาน ไม่ใช่เพื่อตัวชี้วัดในงานวิจัย จงสร้าง agent ที่จดจำได้ และโมเดลที่สามารถทำงานได้บนอุปกรณ์จริง
