محققان ReBA routing را معرفی کردند؛ یک طرح مسیریابی توکن مبتنی بر هندسه که توکن‌های بصری و متنی را در مدل‌های ترکیبی متخصص (MoE) چندوجهی متعادل نگه می‌دارد. آزمایش‌های اولیه نشان داد که این روش هنگام افزایش رزولوشن تصویر، آموزش را پایدار نگه می‌دارد؛ سناریویی که در آن مسیریاب‌های متداول معمولاً دچار مشکل می‌شوند.

چرا مدل‌های بینایی-زبان به یک مسیریاب جدید نیاز دارند

مدل‌های بینایی-زبان دو جریان بسیار متفاوت را دریافت می‌کنند: پچ‌های تصویری که تعداد آن‌ها می‌تواند به صدها برسد و تعداد اندکی توکن کلمه. مسیریاب‌های استاندارد MoE با هر توکن به‌گونه‌ای برخورد می‌کنند که گویی همگی از یک نوع داده هستند؛ بنابراین پچ‌های تصویر، چند متخصص را اشباع می‌کنند، در حالی که توکن‌های متنی بلااستفاده می‌مانند. کارهای موجود سعی می‌کنند بار کاری را با یک تابع زیان کمکی (auxiliary loss) اصلاح کنند که تنها تعداد کل توکن‌های اختصاص‌یافته به هر متخصص را برابر می‌کند. از آنجایی که بار عظیم تصاویر می‌تواند بار ناچیز متن را خنثی کند، این تابع زیان عدم تعادل واقعی را تا زمانی که عملکرد کاهش یابد، پنهان می‌کند.

ReBA چگونه بازی مسیریابی را تغییر می‌دهد

ReBA یک مرز وجهی (modality boundary) به فرآیند مسیریابی اضافه می‌کند. به‌جای استفاده از یک استخر واحد که پچ‌ها و کلمات را با هم ترکیب می‌کند، این روش مسیرهای مجزایی ایجاد می‌کند که به چیدمان هندسی توکن‌های تصویر احترام می‌گذارد. هر نمونه تصویر وزن کلی یکسانی دریافت می‌کند که از تبدیل شدن هر متخصص به یک گلوگاه جلوگیری می‌کند. با هدایت چیدمان فضایی پچ‌ها، سیستم حتی هنگام تغییر رزولوشن ورودی نیز پایدار می‌ماند.

مزایای کلیدی گزارش‌شده توسط نویسندگان:

  • اعمال یک تفکیک واضح بین توکن‌های بصری و زبانی.
  • تضمین مشارکت برابر هر تصویر در یک دسته (batch).
  • جلوگیری از اشباع شدن متخصصان توسط یک وجه (modality).
  • حفظ تعادل با افزایش تعداد پچ‌های تصویر.

در چندین تنظیمات بنچمارک، ReBA فارغ از اینکه چه تعداد پچ به یک دسته اضافه شده باشد، بهره‌وری استخر متخصصان را به‌طور یکنواخت حفظ کرد و از رویکرد سنتی تابع زیان کمکی عملکرد بهتری داشت.

محدودیت‌ها و پرسش‌های بی‌پاسخ

این مطالعه ارقامی در مورد سرعت یا میزان مصرف حافظه ارائه نمی‌دهد، بنابراین نمی‌دانیم که آیا منطق مسیریابی اضافی هزینه‌های پنهانی ایجاد می‌کند یا خیر. نویسندگان همچنین فرض می‌کنند که تمام پچ‌های یک تصویر واحد، به‌عنوان یک واحد عمل می‌کنند؛ این فرض ممکن است در دسته‌هایی که تصاویر با رزولوشن‌های مختلف را ترکیب می‌کنند یا حاوی نواحی نیمه‌ماسک‌شده هستند، از کار بیفتد.

آنچه باید در آینده زیر نظر داشت

  • توازن بین عملکرد و کارایی: کارهای آینده باید هرگونه سربار (overhead) ایجاد شده توسط ReBA را کمی‌سازی کنند.
  • رفتار در دسته‌های ترکیبی (mixed-batch): آزمایش روی دسته‌هایی که تصاویر با رزولوشن بالا و پایین را ترکیب می‌کنند، نشان خواهد داد که آیا مرز وجهی (modality boundary) همچنان پابرجا می‌ماند یا خیر.
  • به‌کارگیری در خط لوله‌های (pipelines) مقیاس بزرگ: اگر پایداری مسیریابی منجر به بهبود وظایف پایین‌دستی شود — مانند شرح‌نویسی تصویر (image captioning) یا پاسخگویی به سوالات بصری (visual question answering) — توسعه‌دهندگان ممکن است تابع زیان کمکی استاندارد را با ReBA جایگزین کنند.

اگر در حال ساخت یک خط لوله MoE بینایی-زبان هستید، جایگزین کردن مسیریاب پیش‌فرض با ReBA می‌تواند در هنگام افزایش رزولوشن تصویر، الگوی استفاده یکنواخت‌تری از متخصصان به شما ارائه دهد. پس از اعمال این تغییر، بر معیارهای توزیع توکن نظارت داشته باشید؛ یک توزیع تخت‌تر (flatter distribution) نشان‌دهنده این است که مرز وجهی در حال انجام وظیفه خود است.