Penyelidik memperkenalkan ReBA routing, satu skema penghalaan token berpandukan geometri yang mengekalkan keseimbangan token visual dan tekstual dalam model multimodal mixture-of-experts (MoE). Eksperimen awal menunjukkan kaedah ini menstabilkan latihan apabila resolusi imej ditingkatkan, satu senario di mana penghala konvensional biasanya menghadapi kesukaran.
Mengapa model visi-bahasa memerlukan penghala baharu
Model visi-bahasa memproses dua aliran yang sangat berbeza: tampalan imej (image patches) yang boleh mencecah ratusan jumlahnya dan segelintir token perkataan. Penghala MoE standard melayan setiap token seolah-olah ia adalah jenis data yang sama, menyebabkan tampalan imej membanjiri beberapa pakar (experts) manakala token teks dibiarkan tidak aktif. Kerja sedia ada cuba membetulkan beban tersebut dengan kerugian tambahan (auxiliary loss) yang hanya menyama-ratakan jumlah keseluruhan token yang diperuntukkan kepada setiap pakar. Oleh kerana beban imej yang besar boleh membatalkan beban teks yang kecil, kerugian tersebut menyembunyikan ketidakseimbangan sebenar sehingga prestasi merosot.
Bagaimana ReBA mengubah corak penghalaan
ReBA menambah sempadan modaliti (modality boundary) kepada proses penghalaan. Berbanding satu kumpulan tunggal yang mencampurkan tampalan dan perkataan, ia membina laluan berasingan yang menghormati susun atur geometri token imej. Setiap instans imej menerima pemberat keseluruhan yang sama, menghalang mana-mana pakar tunggal daripada menjadi penghalang (bottleneck). Berpandukan susunan spatial tampalan tersebut, sistem kekal stabil walaupun apabila resolusi input berubah.
Kelebihan utama yang dilaporkan oleh penulis:
- Memastikan pembahagian yang jelas antara token visual dan linguistik.
- Menjamin sumbangan yang sama daripada setiap imej dalam satu kelompok (batch).
- Menghalang pakar daripada dibebani oleh satu modaliti sahaja.
- Mengekalkan keseimbangan apabila bilangan tampalan imej bertambah.
Merentasi beberapa tetapan penanda aras (benchmark), ReBA memastikan kumpulan pakar digunakan secara sekata tanpa mengira berapa banyak tampalan yang ditambah ke dalam satu kelompok, mengatasi pendekatan kerugian tambahan (auxiliary-loss) tradisional.
Had dan persoalan terbuka
Kajian ini tidak menyediakan angka mengenai kelajuan atau penggunaan memori, jadi kita tidak tahu sama ada logik penghalaan tambahan tersebut menambah kos tersembunyi. Penulis juga mengandaikan bahawa semua tampalan daripada satu imej bertindak sebagai satu unit tunggal; andaian tersebut mungkin tidak lagi terpakai dalam kelompok yang mencampurkan imej dengan resolusi berbeza atau mengandungi kawasan yang ditutup sebahagiannya (partially masked regions).
Apa yang perlu diperhatikan seterusnya
- Pertukaran prestasi-lawan-kecekapan: kerja masa hadapan perlu mengukur sebarang beban tambahan (overhead) yang ditambah oleh ReBA.
- Tingkah laku kelompok bercampur: ujian pada kelompok yang menggabungkan imej resolusi tinggi dan resolusi rendah akan mendedahkan sama ada sempadan modaliti tersebut kekal utuh.
- Penggunaan dalam saluran paip (pipeline) skala besar: jika kestabilan penghalaan diterjemahkan kepada tugasan hiliran yang lebih baik—seperti kapsyen imej atau menjawab soalan visual—pembangun mungkin menggantikan kerugian tambahan standard dengan ReBA.
Jika anda sedang membina saluran paip MoE visi-bahasa, menukar penghala lalai kepada ReBA boleh memberikan corak penggunaan pakar yang lebih seragam apabila anda meningkatkan resolusi imej. Perhatikan metrik pengagihan token selepas perubahan tersebut; pengagihan yang lebih rata menandakan bahawa sempadan modaliti sedang menjalankan tugasnya dengan baik.
