WeMM-Embedding 2B: เลือกใช้ 256 มิติ แทนที่จะเป็น 2048

คนส่วนใหญ่มักจะหยิบโมเดล embedding มาแล้วใส่เวกเตอร์ขนาดเต็มลงไปใน pipeline ของตนเอง เลิกทำแบบนั้นได้แล้ว

WeMM-Embedding ของ Tencent สามารถจัดการได้ทั้งข้อความ รูปภาพ วิดีโอ และเอกสาร โดยเวอร์ชันที่มีพารามิเตอร์ 2 พันล้านตัวนั้นพร้อมสำหรับการใช้งานจริง (production) แล้ว

ฟีเจอร์เด่นคือ Matryoshka embeddings ซึ่งการประมวลผลเพียงครั้งเดียวสามารถส่งผลลัพธ์เป็นเวกเตอร์ขนาด 64, 128, 256, 512, 1024 หรือ 2048 มิติได้

ทำไมเวกเตอร์ขนาดเล็กถึงสำคัญ

  • ประสิทธิภาพ: ที่ขนาด 256 มิติ งานด้านรูปภาพและวิดีโอยังคงรักษาความแม่นยำไว้ได้ถึง 98.7% เมื่อเทียบกับเวอร์ชัน 2048 มิติ
  • ความเร็ว: เวกเตอร์ขนาดเล็กช่วยให้คุณสร้าง index ใหม่ได้โดยใช้เวลาเพียงเสี้ยวเดียว
  • ต้นทุน: คุณจะเสียค่าใช้จ่ายด้านพื้นที่จัดเก็บและหน่วยความจำน้อยลงมาก
  • ประสิทธิภาพการใช้ทรัพยากร: การใช้ 2048 มิติในขณะที่ 256 มิติก็เพียงพอแล้ว เป็นเพียงการสิ้นเปลืองทรัพยากรโดยเปล่าประโยชน์

โมเดลขนาด 2B นี้ครองอันดับต้นๆ เหนือคู่แข่งที่มีขนาดใหญ่กว่าหลายรายบน MMEB-v2 leaderboard และมันได้กลายเป็นส่วนประกอบสำคัญในระบบงานจริงแล้ว โดย WeChat ใช้โมเดลนี้สำหรับระบบค้นหา อีคอมเมิร์ซ และโซเชียลมีเดีย

เอกสารต้องการพื้นที่มากกว่า

ภาพสกรีนช็อตและเอกสารเชิงภาพอื่นๆ มักจะมีข้อความที่หนาแน่นและเลย์เอาต์ที่ซับซ้อน การลดจำนวนมิติจะส่งผลกระทบต่อเอกสารเหล่านี้มากกว่ารูปภาพทั่วไป

วิธีการทดสอบ

  1. อย่ารื้อระบบทั้งหมดของคุณในคราวเดียว
  2. เลือกคำค้นหา (queries) มา 20 รายการที่ระบบปัจจุบันของคุณยังทำได้ไม่ดี โดยผสมผสานทั้งภาพสกรีนช็อต รูปภาพสินค้า และหน้าเอกสาร
  3. นำคำค้นหาเหล่านั้นไปรันผ่านโมเดล 2B
  4. หากผลลัพธ์ดีขึ้น ก็ให้เริ่มใช้งานการเปลี่ยนแปลงนั้น หากไม่ดีขึ้น คุณก็ยังประหยัดทั้งเวลาและเงินได้

ควรทำตารางคะแนน (scorecard) แยกตามประเภทเนื้อหา รูปภาพสินค้าอาจจะใช้งานได้ดีที่ 256 มิติ ในขณะที่หน้า PDF อาจต้องการค่ามิติขั้นต่ำที่สูงกว่านั้น

ที่มา: https://dev.to/bean_bean/wemm-embedding-2b-chon-vector-256-chieu-vi-2048-2igd