WeMM-Embedding 2B: เลือกใช้ 256 มิติ แทนที่จะเป็น 2048
คนส่วนใหญ่มักจะหยิบโมเดล embedding มาแล้วใส่เวกเตอร์ขนาดเต็มลงไปใน pipeline ของตนเอง เลิกทำแบบนั้นได้แล้ว
WeMM-Embedding ของ Tencent สามารถจัดการได้ทั้งข้อความ รูปภาพ วิดีโอ และเอกสาร โดยเวอร์ชันที่มีพารามิเตอร์ 2 พันล้านตัวนั้นพร้อมสำหรับการใช้งานจริง (production) แล้ว
ฟีเจอร์เด่นคือ Matryoshka embeddings ซึ่งการประมวลผลเพียงครั้งเดียวสามารถส่งผลลัพธ์เป็นเวกเตอร์ขนาด 64, 128, 256, 512, 1024 หรือ 2048 มิติได้
ทำไมเวกเตอร์ขนาดเล็กถึงสำคัญ
- ประสิทธิภาพ: ที่ขนาด 256 มิติ งานด้านรูปภาพและวิดีโอยังคงรักษาความแม่นยำไว้ได้ถึง 98.7% เมื่อเทียบกับเวอร์ชัน 2048 มิติ
- ความเร็ว: เวกเตอร์ขนาดเล็กช่วยให้คุณสร้าง index ใหม่ได้โดยใช้เวลาเพียงเสี้ยวเดียว
- ต้นทุน: คุณจะเสียค่าใช้จ่ายด้านพื้นที่จัดเก็บและหน่วยความจำน้อยลงมาก
- ประสิทธิภาพการใช้ทรัพยากร: การใช้ 2048 มิติในขณะที่ 256 มิติก็เพียงพอแล้ว เป็นเพียงการสิ้นเปลืองทรัพยากรโดยเปล่าประโยชน์
โมเดลขนาด 2B นี้ครองอันดับต้นๆ เหนือคู่แข่งที่มีขนาดใหญ่กว่าหลายรายบน MMEB-v2 leaderboard และมันได้กลายเป็นส่วนประกอบสำคัญในระบบงานจริงแล้ว โดย WeChat ใช้โมเดลนี้สำหรับระบบค้นหา อีคอมเมิร์ซ และโซเชียลมีเดีย
เอกสารต้องการพื้นที่มากกว่า
ภาพสกรีนช็อตและเอกสารเชิงภาพอื่นๆ มักจะมีข้อความที่หนาแน่นและเลย์เอาต์ที่ซับซ้อน การลดจำนวนมิติจะส่งผลกระทบต่อเอกสารเหล่านี้มากกว่ารูปภาพทั่วไป
วิธีการทดสอบ
- อย่ารื้อระบบทั้งหมดของคุณในคราวเดียว
- เลือกคำค้นหา (queries) มา 20 รายการที่ระบบปัจจุบันของคุณยังทำได้ไม่ดี โดยผสมผสานทั้งภาพสกรีนช็อต รูปภาพสินค้า และหน้าเอกสาร
- นำคำค้นหาเหล่านั้นไปรันผ่านโมเดล 2B
- หากผลลัพธ์ดีขึ้น ก็ให้เริ่มใช้งานการเปลี่ยนแปลงนั้น หากไม่ดีขึ้น คุณก็ยังประหยัดทั้งเวลาและเงินได้
ควรทำตารางคะแนน (scorecard) แยกตามประเภทเนื้อหา รูปภาพสินค้าอาจจะใช้งานได้ดีที่ 256 มิติ ในขณะที่หน้า PDF อาจต้องการค่ามิติขั้นต่ำที่สูงกว่านั้น
ที่มา: https://dev.to/bean_bean/wemm-embedding-2b-chon-vector-256-chieu-vi-2048-2igd
