งานวิจัย AI ยอดนิยมบน Hugging Face

AI กำลังก้าวไปอย่างรวดเร็ว เทรนด์ในปัจจุบันมุ่งเน้นไปที่ long-term agents, การเรียนรู้แบบเสริมกำลัง (reinforcement learning) สำหรับ LLMs และการควบคุมโมเดลเชิงสร้างสรรค์ (generative models) ที่ดีขึ้น

นี่คือ 10 งานวิจัยที่โดดเด่นจาก Hugging Face:

  1. Program-as-Weights (2607.02512)
  • ปัญหา: การเขียนโค้ดกำหนดงานแบบตายตัว (hard-coding) นั้นทำได้ยาก แต่การรันโมเดลขนาดใหญ่ก็มีค่าใช้จ่ายสูง
  • แนวคิด: เปลี่ยนคำอธิบายด้วยภาษาธรรมชาติให้กลายเป็น neural artifacts ขนาดเล็ก
  • แนวทางใหม่: ใช้คอมไพเลอร์ขนาด 4B เพื่อสร้างแพ็กเกจน้ำหนัก (weight package) ขนาดจิ๋วที่โมเดลขนาด 0.6B สามารถรันได้
  • กรณีการใช้งาน: AI บนอุปกรณ์ (on-device AI) และเครื่องมือในเครื่องที่ทำงานได้อย่างรวดเร็ว
  • GitHub: https://github.com/programasweights/programasweights-python
  1. Training vs. Inference Policy (2606.29526)
  • ปัญหา: โมเดลมักจะมีประสิทธิภาพในการทำงานระหว่างการฝึกฝน (training) แตกต่างจากการใช้งานจริง (inference)
  • แนวคิด: มุ่งเน้นไปที่การปรับปรุงนโยบาย (policy) ที่ใช้ในระหว่างการทำ inference จริง
  • แนวทางใหม่: ปรับเป้าหมายการฝึกฝนให้สอดคล้องกับการตัดสินใจในโลกแห่งความเป็นจริง
  • กรณีการใช้งาน: การให้เหตุผลของ LLM ที่เสถียร และกระบวนการ RLHF
  • Project: https://anitaleungxx.github.io/MIPU/
  1. AgenticSTS (2607.02255)
  • ปัญหา: long-term agents ล้มเหลวเนื่องจากหน่วยความจำ (memory) ไม่เป็นระเบียบ
  • แนวคิด: ใช้การดึงข้อมูลแบบระบุประเภท (typed retrieval) เพื่อจัดระเบียบชิ้นส่วนหน่วยความจำ แทนที่จะเติมข้อมูลลงใน context window จนเต็ม
  • แนวทางใหม่: สร้างเลเยอร์หน่วยความจำที่มีการควบคุมสำหรับข้อมูลระยะสั้นและข้อมูลเชิงกลยุทธ์
  • กรณีการใช้งาน: ผู้ช่วย AI ระยะยาว และเวิร์กโฟลว์ระดับองค์กรที่ซับซ้อน
  • GitHub: https://github.com/AlayaLab/AgenticSTS
  1. EvoPolicyGym (2607.02440)
  • ปัญหา: เรายังขาดวิธีการวัดผลว่า agent สามารถปรับปรุงกฎเกณฑ์ของตัวเองได้หรือไม่
  • แนวคิด: สภาพแวดล้อมที่ agent ต้องแก้ไขนโยบาย (policies) ของตนเอง
  • แนวทางใหม่: ประเมินกระบวนการปรับปรุงตัวเอง ไม่ใช่แค่ดูผลลัพธ์สุดท้าย
  • กรณีการใช้งาน: Auto-agents และหุ่นยนต์ (robotics)
  1. FlashMorph (2606.30562)
  • ปัญหา: การใช้ full attention ใน Transformers มีค่าใช้จ่ายสูงเกินไปสำหรับข้อความที่มีความยาว
  • แนวคิด: ผสมผสาน full attention เข้ากับ linear attention ที่มีราคาถูกกว่า
  • แนวทางใหม่: ใช้เกตแบบแบ่งตามเลเยอร์ (layer-based gate) เพื่อค้นหาการตั้งค่าแบบไฮบริดที่ดีที่สุด
  • กรณีการใช้งาน: การประมวลผลเอกสารขนาดยาว และระบบ RAG
  • GitHub: https://github.com/LanDisen/FlashMorph
  1. MrFlow (2607.01642)
  • ปัญหา: โมเดล Diffusion ทำงานช้าเมื่อใช้ความละเอียดสูง
  • แนวคิด: เร่งความเร็วในการสร้าง (generation) โดยไม่ต้องฝึกฝนเพิ่มเติม
  • แนวทางใหม่: สร้างที่ความละเอียดต่ำก่อน จากนั้นจึงใช้ super-resolution
  • กรณีการใช้งาน: เครื่องมือ text-to-image ที่รวดเร็ว
  • GitHub: https://github.com/Xingyu-Zheng/MrFlow
  1. AgenticDataBench (2607.01647)
  • ปัญหา: เกณฑ์มาตรฐาน (benchmarks) ในปัจจุบันไม่สะท้อนถึงการทำงานด้านวิทยาศาสตร์ข้อมูล (data science) จริงๆ
  • แนวคิด: การทดสอบที่ครอบคลุมสำหรับ data agents ในหลากหลายโดเมน
  • แนวทางใหม่: วัดทักษะเฉพาะด้าน เช่น ความเข้าใจใน schema และการวิเคราะห์ข้อผิดพลาด
  • กรณีการใช้งาน: การประเมินนักวิเคราะห์ข้อมูล AI
  • GitHub: https://github.com/AgenticDataBench/AgenticDataBench
  1. WorldDirector (2607.02517)
  • ปัญหา: การสร้างวิดีโอขาดความต่อเนื่องในระยะยาว
  • แนวคิด: แยกการวางแผนการเคลื่อนไหว (motion planning) ออกจากการเรนเดอร์ภาพ (visual rendering)
  • แนวทางใหม่: ใช้ LLM ในการจัดการเส้นทางของวัตถุ 3D และการเคลื่อนที่ของกล้อง
  • กรณีการใช้งาน: ภาพยนตร์ AI และเนื้อหาในเกม
  1. VLA-Corrector (2607.01804)
  • ปัญหา: หุ่นยนต์ที่ต้องตัดสินใจอย่างรวดเร็วอาจออกนอกเส้นทางได้
  • แนวคิด: เพิ่มระบบตรวจสอบด้วยภาพ (vision monitor) เพื่อตรวจจับข้อผิดพลาดแบบเรียลไทม์
  • แนวทางใหม่: เริ่มการวางแผนใหม่ (replanning) เฉพาะเมื่อเกิดความเบี่ยงเบนเท่านั้น
  • กรณีการใช้งาน: งานหยิบวาง (pick-and-place) ของหุ่นยนต์ที่ซับซ้อน
  • GitHub: https://github.com/ZJU-OmniAI/vla-corrector
  1. MRPO (2606.31825)
  • ปัญหา: ใน AI ทางการแพทย์ ความผิดพลาดเพียงเล็กน้อยสามารถทำลายห่วงโซ่การให้เหตุผลทั้งหมดได้
  • แนวคิด: ให้รางวัลโมเดลสำหรับทุกขั้นตอนที่ถูกต้อง ไม่ใช่แค่คำตอบสุดท้าย
  • แนวทางใหม่: ใช้รางวัลตามกระบวนการในแต่ละขั้นตอน (step-wise process rewards) สำหรับการให้เหตุผลทางการแพทย์
  • กรณีการใช้งาน: Clinical VQA และการสนับสนุนด้านภาพถ่ายทางการแพทย์
  • GitHub: https://github.com/dmis-lab/MRPO

สรุปเทรนด์:

  • Agent ที่ดีขึ้น: มุ่งไปสู่หน่วยความจำที่มีโครงสร้างและการปรับปรุงตัวเอง
  • ประสิทธิภาพที่ดีขึ้น: ลดต้นทุนผ่าน hybrid attention และ multi-resolution flows
  • ความน่าเชื่อถือที่ดีขึ้น: การปรับการฝึกฝนให้สอดคล้องกับการทำ inference และการให้รางวัลสำหรับขั้นตอนตรรกะที่ถูกต้อง

Source: https://dev.to/y_hnhnhan_2f26de65ffcc4/top-ai-papers-on-hugging-face-2026-07-06-225o

Optional learning community: https://t.me/GyaanSetuAi