WeMM-Embedding 2B: выбирайте 256 измерений вместо 2048

Большинство разработчиков берут модель эмбеддингов и просто вставляют вектор полного размера в свой пайплайн. Хватит это делать.

WeMM-Embedding от Tencent работает с текстом, изображениями, видео и документами. Её версия с 2 миллиардами параметров готова к промышленному использованию.

Главная особенность — Matryoshka embeddings: за один проход модель может выдать векторы размерностью 64, 128, 256, 512, 1024 или 2048.

Почему важны векторы меньшего размера

  • Производительность: При 256 измерениях точность в задачах с изображениями и видео сохраняется на уровне 98,7 % от версии с 2048 измерениями.
  • Скорость: Векторы меньшего размера позволяют перестраивать индексы в разы быстрее.
  • Стоимость: Вы тратите гораздо меньше на хранение и память.
  • Эффективность: Использование 2048 измерений там, где достаточно 256, — это просто пустая трата ресурсов.

Модель 2B занимает лидирующие позиции среди многих более крупных конкурентов в таблице лидеров MMEB-v2. Она уже используется в продакшене: WeChat полагается на неё в поиске, электронной коммерции и социальных сетях.

Документам нужно больше места

Скриншоты и другие визуальные документы содержат плотный текст и сложную верстку. Уменьшение размерности вредит им больше, чем фотографиям.

Как это протестировать

  1. Не перестраивайте всю систему сразу.
  2. Выберите 20 запросов, на которых ваша текущая система спотыкается — смешайте скриншоты, изображения товаров и страницы документов.
  3. Пропустите эти запросы через модель 2B.
  4. Если результаты улучшатся, внедряйте изменения. Если нет — вы сэкономили время и деньги.

Ведите таблицу результатов для каждого типа контента. Фотографии товаров могут быть вполне удовлетворительными при 256 измерениях, в то время как для страниц PDF может потребоваться более высокий минимум.

Источник: https://dev.to/bean_bean/wemm-embedding-2b-chon-vector-256-chieu-vi-2048-2igd