Lapisan konvolusi standard bersifat sangat sama rata secara pelik. Ia menyusun berpuluh-puluh — kadangkala beratus-ratus — pengesan ciri, kemudian melayan setiap satunya dengan penghormatan yang sama. Saluran yang telah belajar untuk mengesan tepi pepenjuru mendapat undian yang sama dengan saluran yang mengesan piksel langit biru. Saluran yang aktif pada tekstur bulu dalam foto kucing disiarkan ke hadapan dengan pemberat yang sama seperti saluran yang diaktifkan oleh hingar latar belakang. Keseragaman itu adalah kelemahannya. Tidak semua saluran penting secara saksama bagi setiap imej, dan rangkaian dalam secara sejarahnya kekurangan mekanisme untuk menyatakan perkara tersebut.

Squeeze-and-Excitation, yang diperkenalkan oleh Hu dan rakan sejawat, membaiki perkara ini dengan penambahan yang sangat kecil. Ia menyertakan mekanisme pintu (gating mechanism) yang boleh dipelajari pada mana-mana blok konvolusi supaya rangkaian dapat menentukur semula secara dinamik sejauh mana setiap saluran menyumbang, dan ia melakukan ini secara khusus untuk setiap input. Kos tambahan adalah remeh — kira-kira 2.5 peratus lebih parameter apabila dipasang pada ResNet-50 — tetapi peningkatan dalam kuasa representasi adalah cukup besar sehingga blok SE membantu memenangi ILSVRC 2017 dan kini berada di dalam seni bina pengeluaran seperti MobileNetV3 dan EfficientNet.

Idea ini cukup ringkas untuk dibina dari awal dalam tiga peringkat.

Squeeze: Memberikan Rangkaian Lensa Sudut Lebar

Konvolusi direka secara lokal. Kernel 3×3 meluncur merentasi imej dan hanya melihat kawasan sekitarnya sahaja. Susun lapisan yang mencukupi dan medan reseptif (receptive field) akan berkembang, namun tiada operasi tunggal yang melihat keseluruhan peta ciri dalam satu pandangan. Ini bermakna satu saluran mungkin diaktifkan dengan kuat merentasi keseluruhan keluasan spatial seekor anjing atau sebuah kereta, tetapi lapisan seterusnya tidak pernah menerima ringkasan eksplisit yang menyatakan, "Pengesan ini aktif di mana-mana sahaja."

Langkah squeeze merapatkan jurang tersebut dengan global average pooling. Bagi setiap saluran, setiap nilai dalam grid spatial H×W diratakan kepada satu nombor tunggal. Jika anda mempunyai 512 saluran, anda kini mempunyai 512 skalar. Setiap skalar mengekod kehadiran global bagi apa sahaja yang telah dipelajari oleh saluran tersebut untuk dikesan — sama ada rim roda, jalur rumput, atau tompokan tona kulit. Ia adalah ringkasan berasaskan saluran bagi keseluruhan pemandangan.

Ini penting kerana konteks mengubah makna. Pengesan garis mendatar adalah berguna dalam satu imej kerana ia mengenal pasti ufuk, dan tidak berguna dalam imej lain kerana ia mengesan hingar dalam kanopi hutan. Tanpa agregasi spatial, rangkaian kekurangan isyarat yang jelas untuk membuat perbezaan tersebut.

Excite: Bottleneck yang Memaksa Kerjasama

Sebaik sahaja langkah squeeze menghasilkan vektor deskriptor saluran global, langkah excite mempelajari apa yang perlu dilakukan dengannya. Ini adalah MLP dua lapisan yang kecil. Ia mengambil vektor tersebut, memampatkannya ke satu bottleneck, dan kemudian mengembangkannya semula ke dimensi saluran asal.

Implementasi tipikal menggunakan nisbah pengurangan (reduction ratio) sebanyak 16. Jika input mempunyai 512 saluran, lapisan linear pertama memproyeksikan 512 skalar tersebut kepada 32, satu ReLU berada di antaranya, dan lapisan kedua memetakan semula 32 tersebut kepada 512. Pemampatan itu adalah disengajakan. Ia berfungsi seperti corong: rangkaian tidak boleh sekadar menyalurkan nilai asal tanpa perubahan. Ia mesti mempelajari representasi kongsi yang dimampatkan tentang bagaimana saluran berkaitan antara satu sama lain. Bottleneck tersebut memaksa kebergantungan rentas-saluran untuk muncul. Model mungkin mempelajari, sebagai contoh, bahawa apabila saluran "tekstur kulit kayu" adalah kuat, saluran kontur "batang pokok" juga harus ditekankan, manakala saluran "pantulan air" harus diredamkan.

Pengaktifan (activation) terakhir di sini adalah sangat penting, dan ia adalah tempat biasa di mana intuisi boleh tersilap. Ramai orang secara naluri memilih softmax, kerana ia terasa seperti perhatian (attention) sepatutnya menjadi taburan kebarangkalian. Softmax akan memaksa semua saluran bersaing antara satu sama lain sehingga jumlah pemberat mereka menjadi satu. Jika satu saluran meningkat, yang lain mesti menurun. Itu adalah sangat salah untuk tugasan ini. Sebuah foto matahari terbenam mungkin memerlukan kedua-dua saluran cahaya jingga dan saluran tekstur awan beroperasi pada kekuatan penuh secara serentak. Pintu-pintu tersebut harus bertindak seperti suis pemalap (dimmer switches) yang bebas, bukannya bajet jumlah-sifar (zero-sum budget).

Sigmoid menyelesaikan masalah ini. Ia memampatkan setiap skalar kepada nilai antara sifar dan satu, tetapi setiap saluran bebas untuk bergerak secara bebas. Model boleh meningkatkan mana-mana subset, membiarkan yang lain neutral, dan menekan yang selebihnya, semuanya tanpa persaingan buatan.

Scale: Gunakan Pintu dan Teruskan

Langkah terakhir hampir tidak mendebarkan, dan itulah sebahagian daripada keanggunannya. Setiap peta ciri asal didarabkan dengan nilai gerbang yang diaktifkan oleh sigmoid yang sepadan. Jika gerbang menghampiri satu, saluran tersebut akan melalui tanpa perubahan. Jika gerbang menghampiri sifar, keseluruhan peta ciri tersebut akan diredamkan, memudar ke arah kesunyian. Hasilnya kemudian dimasukkan ke dalam lapisan rangkaian yang seterusnya.

Oleh kerana ini hanyalah pendaraban tulen merentasi peta spatial, ia menambah beban pengiraan yang sangat minimum semasa inferens. Kerja berat telah dilakukan oleh global pooling dan dua unjuran kecil, yang mana jumlahnya adalah remeh berbanding konvolusi 3×3 di sekelilingnya.

Mengapa Reka Bentuk Ini Kekal

Selain daripada matematik yang kemas, Squeeze-and-Excitation bertahan kerana ia menghormati kekangan kejuruteraan.

Parameter murah. Menambah blok SE kepada ResNet-50 hanya menambah kira-kira 2.5 peratus parameter. Lapisan MLP adalah kecil; ia tidak membesarkan model secara berlebihan. Dalam era di mana peningkatan ketepatan sering datang daripada penggandaan saiz model, SE menawarkan sesuatu yang jarang berlaku—keuntungan tanpa kos tambahan yang besar.

Modulariti. SE bukanlah seni bina tulang belakang (backbone architecture) baharu yang memerlukan anda mereka bentuk semula saluran paip (pipeline) anda. Ia adalah modul "drop-in". Anda boleh memasukkannya selepas mana-mana blok konvolusi dalam ResNet, DenseNet, atau timbunan tersuai tanpa perlu menulis semula logik di sekelilingnya. Fleksibiliti tersebut menjadikan penerimaannya pantas, bermula dalam penyelidikan dan kemudian dalam rangkaian yang dioptimumkan untuk peranti mudah alih.

Tingkah laku adaptif input. Tidak seperti pemberat saluran statik yang dipelajari semasa latihan dan dibekukan, gerbang SE dikira secara langsung untuk setiap laluan ke hadapan (forward pass). Berikan rangkaian imej langit yang rata dan tanpa ciri, maka saluran yang relevan akan kekal diredamkan. Tunjukkan kepadanya suasana jalan raya yang sibuk dengan pejalan kaki, papan tanda, dan kenderaan, dan gerbang tersebut akan dikalibrasi semula untuk meningkatkan pengesan yang penting bagi imej khusus tersebut. Rangkaian yang sama melaraskan sensitivitinya sendiri mengikut setiap babak.

Daripada Pemenang Pertandingan kepada Penggunaan Harian

Blok SE merangkul tempat teratas di ILSVRC 2017, tetapi pengesahan sebenar mereka datang kemudian. Ia telah digabungkan ke dalam MobileNetV3, di mana ia membantu model ringan memberikan prestasi luar biasa tanpa menghabiskan bateri peranti mudah alih. Ia juga muncul dalam resipi penskalaan kompaun (compound scaling) EfficientNet, membuktikan bahawa perhatian saluran (channel attention) bukanlah satu kemewahan untuk pelayan berat, sebaliknya merupakan alat praktikal untuk reka bentuk yang cekap.

Jika anda ingin melihat betapa sedikitnya kod yang diperlukan untuk ini, demo langsung ini memperincikan blok tersebut baris demi baris:

Dan jika anda membina bersama komuniti: https://t.me/GyaanSetuAi

Intipati Sebenar

Model penglihatan yang lebih baik tidak sentiasa memerlukan timbunan yang lebih dalam atau penapis yang lebih lebar. Kadangkala, mereka hanya memerlukan seketika untuk bertanya saluran mana yang sebenarnya penting bagi imej di hadapan mereka. Squeeze-and-Excitation memberikan saat tersebut dengan hanya menggunakan purata gabungan (pooled average), MLP yang mampat, dan gerbang sigmoid. Hasilnya ialah rangkaian yang berhenti menjeritkan setiap ciri pada tahap kelantangan yang sama, sebaliknya belajar untuk berbisik, menekankan, atau mendiamkan setiap saluran tepat pada masanya apabila babak tersebut memerlukannya.