Artikel: Satu "Attention Sink Detector" baharu mengesan token yang mengumpul sebahagian besar jisim perhatian semasa peringkat prefill inferens model bahasa besar (LLM). Alat ini menunjukkan bahawa membuang token sink ini daripada cache kunci-nilai (KV) melumpuhkan prestasi model, menjadikannya penambat penting untuk penjanaan yang stabil.

Mengapa peringkat prefill penting

Kebanyakan penyelidikan LLM menumpukan kepada gelung penjanaan token demi token, tetapi kerja yang berlaku sebelum token pertama—prefill—menentukan hala tuju bagi segala-galanya yang menyusul. Semasa prefill, model memproses keseluruhan prom, membina cache KV, dan menyebarkan perhatian ke setiap kedudukan. Oleh kerana softmax yang menghasilkan pemberat perhatian mesti berjumlah 1, model tidak boleh menyatakan "tiada apa yang relevan." Ia mencurahkan baki jisim kebarangkalian kepada token yang mudah dirujuk, biasanya token pertama dalam urutan tersebut. Token itu menjadi sebuah attention sink.

Apa itu attention sink, dalam istilah mudah

Dalam sebuah Transformer, setiap kepala (head) mengira pemberat untuk setiap pasangan token. Apabila taburan sangat condong, satu token mungkin menerima bahagian pemberat perhatian yang tidak seimbang. Fenomena ini bukanlah pepijat; ia berpunca daripada kekangan softmax. Token pertama (selalunya penanda permulaan ayat) bertindak sebagai "injap pelepas" bagi kebarangkalian baki yang tidak dapat diperuntukkan ke tempat lain.

Risiko dalam pengurusan cache KV

Cache KV menyimpan vektor kunci dan nilai untuk setiap token yang telah diproses, membolehkan carian pantas semasa penjanaan. Dalam senario konteks panjang, pengamal memangkas cache untuk kekal dalam had memori GPU. Pengesan baharu ini menunjukkan bahawa memadam token yang kelihatan "tidak penting" secara semberono juga akan memadam sink yang menjadi sandaran model, menyebabkan prestasi merosot. Menetapkan (pinning) token sink dalam cache dapat mengekalkan keseimbangan dalaman model dan memastikan penjanaan kekal stabil.

Bagaimana pengesan ini berfungsi

  • Eager attention: Pelaksanaan ini memintas kernel pantas seperti FlashAttention, yang memampatkan matriks perhatian penuh, dan sebaliknya merekod skor perhatian mentah untuk setiap kepala.
  • Agregasi seluruh lapisan: Skor dirata-puratakan merentasi semua lapisan dan kepala untuk menghasilkan satu profil jisim perhatian bagi setiap token.
  • Log-median absolute deviation (MAD): Oleh kerana pemberat perhatian sangat condong ke kanan, ujian min-sisihan-piawai yang mudah akan salah mengelaskan varians normal sebagai pencilan (outliers). Penukaran log pada pemberat menormalkan taburan tersebut; penggunaan MAD kemudiannya menandakan token yang jisim perhatiannya melebihi taburan tipikal.

Dua kelas sink yang ditemui

  1. Sink sebenar – Token permulaan ayat (BOS) secara konsisten menyerap bahagian perhatian yang besar, tanpa mengira kandungan prom.
  2. Sink struktur – Token yang tergolong dalam prom tahap sistem, seperti penanda yang digunakan dalam ChatML (<im_start>, <im_end>), membentuk kelompok kecil yang juga menarik perhatian. Ia bertindak sebagai sempadan logik, membantu model memisahkan mesej pengguna daripada arahan sistem.

Hujah balas: Adakah kita benar-benar memerlukan matriks mentah?

Penulis menyatakan bahawa tanpa angka mentah, fenomena sink akan kekal tersembunyi, dan sebarang polisi pemangkasan cache yang berdasarkan data tidak lengkap berisiko menjejaskan kestabilan model.

Apa yang perlu diperhatikan seterusnya

Pengesan ini merupakan bahagian kedua dalam siri empat bahagian yang bermula dengan penjejak entropi untuk kualiti penjanaan. Bahagian akan datang akan menyepadukan pengesanan sink dengan penyahkodan spekulatif berpandukan entropi (entropy-guided speculative decoding). Kajian terakhir pula akan menjadi satu kajian empirikal.

Rumusan: Attention sink bukanlah satu keanehan yang tidak penting; ia adalah tiang struktur yang memastikan taburan perhatian Transformer berfungsi dengan baik semasa prefill. Sebarang strategi pemangkasan cache KV yang mengabaikannya akan menjejaskan kestabilan model. Mengesan dan mengekalkan token ini adalah langkah keselamatan kos rendah yang boleh menjadikan inferens konteks panjang lebih dipercayai dan cekap.