โมเดลที่มีการดาวน์โหลดมากที่สุดบน Hugging Face ไม่ใช่แชทบอทเลยแม้แต่น้อย แต่มันคือโมเดล sentence-embedding ขนาด 22 ล้านพารามิเตอร์จากปี 2021 ที่ถูกดาวน์โหลดไปแล้วถึง 256 ล้านครั้ง ตัวเลขเหล่านี้บอกเล่าเรื่องราวที่เรียบง่ายว่า: ภาระงาน AI ในโลกความเป็นจริงส่วนใหญ่รันบนโมเดลขนาดเล็กที่ใช้งานกับ CPU ได้ดี ไม่ใช่โมเดลภาษาขนาดใหญ่ (LLMs) ที่เป็นข่าวพาดหัว
สามโมเดลที่ครองตลาดการใช้งานจริง (production)
all-MiniLM-L6-v2 – 256 ล้านดาวน์โหลด
โมเดลขนาด 22 ล้านพารามิเตอร์นี้จะแปลงข้อความให้กลายเป็น dense vector ซึ่งเวกเตอร์นี้สามารถนำไปเปรียบเทียบกับเวกเตอร์อื่นเพื่อวัดความคล้ายคลึงกัน ซึ่งเป็นหัวใจสำคัญของ semantic search, ระบบแนะนำ (recommendation engines) และกระบวนการตรวจจับข้อมูลซ้ำ (duplicate-detection pipelines)
ทำไมมันถึงมีอยู่ทุกที่:
- รันบน CPU ได้ – ไม่ต้องใช้ GPU ราคาแพง
- รวดเร็วสำหรับการประมวลผลแบบกลุ่ม (batch processing) – สามารถทำ embedding ประโยคนับล้านได้ภายในไม่กี่นาที
- โฮสต์ในเครื่องตัวเองได้ฟรี – ช่วยตัดค่าใช้จ่ายด้านบริการคลาวด์และลดความกังวลเรื่องความเป็นส่วนตัวของข้อมูล
cross-encoder/ms-marco-MiniLM-L6-v2 – 87 ล้านดาวน์โหลด
โมเดลนี้ทำหน้าที่เป็น reranker โดยจะรับทั้งคำค้นหา (query) และเอกสารที่คาดว่าจะเป็นคำตอบ (candidate document) เข้ามาพร้อมกัน แล้วส่งค่าคะแนนความเกี่ยวข้อง (relevance score) กลับมา ในโครงสร้าง RAG ทั่วไป ขั้นตอนการทำงานจะเป็นดังนี้:
- ขั้นตอนที่รวดเร็ว (Fast stage) – MiniLM จะดึงเอกสารที่น่าจะเป็นคำตอบมา 50 อันดับแรก
- ขั้นตอนที่แม่นยำ (Accurate stage) – cross-encoder จะทำการให้คะแนนใหม่ (rescoring) กับทั้ง 50 รายการนั้น เพื่อเพิ่มคุณภาพของคำตอบ
จำนวนการกด "like" ที่น้อยบนหน้าโมเดลแสดงให้เห็นว่าผู้ใช้ส่วนใหญ่เรียกใช้งานผ่านโปรแกรมมากกว่าการเข้ามาดูบน hub แต่ปริมาณการดาวน์โหลดนั้นยืนยันได้ว่ามันคือเครื่องมือมาตรฐาน (de-facto tool) ในการเพิ่มความแม่นยำให้กับ production pipelines
amazon/chronos-2 – 35 ล้านดาวน์โหลด
Chronos-2 ปฏิบัติต่อข้อมูลอนุกรมเวลา (time-series data) เสมือนเป็นข้อความ ทำให้โมเดลพื้นฐาน (foundation model) เพียงตัวเดียวสามารถพยากรณ์ยอดขาย, ภาระการทำงานของเซิร์ฟเวอร์ หรือสัญญาณตัวเลขใดๆ ได้โดยไม่ต้องฝึกฝนเฉพาะทาง (task-specific training) จำนวนการดาวน์โหลดในระดับหลายสิบล้านครั้งสำหรับโมเดลพยากรณ์เฉพาะทางนี้ บ่งบอกถึงความต้องการโซลูชันแบบ "train once, run anywhere" อย่างมาก โดยเฉพาะในองค์กรที่หากไม่มีโมเดลนี้ ก็อาจต้องคอยดูแลโมเดลเฉพาะกิจ (bespoke models) จำนวนมหาศาลสำหรับแต่ละตัวชี้วัด
ตัวเลขเหล่านี้มีความหมายอย่างไรต่อทีม AI
กราฟการดาวน์โหลดเผยให้เห็นช่องว่างระหว่างกระแสข่าวในสื่อกับความเป็นจริงในการปฏิบัติงาน แม้ว่า LLMs จะครองพื้นที่ในข่าวประชาสัมพันธ์ แต่ "ม้างาน" (workhorses) ที่ทำให้บริการต่างๆ รันต่อไปได้จริงคือ:
- Embedding models ที่เปลี่ยนข้อความดิบให้กลายเป็นเวกเตอร์ที่ค้นหาได้
- Cross-encoders ที่ช่วยขัดเกลาเวกเตอร์เหล่านั้นให้เป็นการจัดอันดับที่แม่นยำ
- Foundation forecasters ที่ใช้โมเดลเดียวกับข้อมูลอนุกรมตัวเลขที่หลากหลาย
บทสรุปนั้นชัดเจน: หากคุณกำลังสร้าง AI ที่ต้องใช้งานในระดับสเกลใหญ่ (at scale) ให้มองข้ามกระแสข่าวไป โมเดลที่ครองอันดับการดาวน์โหลดบน Hugging Face คือสิ่งที่ทำให้ระบบ production ทำงานได้อย่างราบรื่น และโมเดลเหล่านี้จะเป็นตัวกำหนดทิศทางของการลงทุนในด้าน AI ที่แท้จริงต่อไป
