Melampaui Transformer: Syarikat Pemula yang Mendefinisikan Semula Era Seterusnya LLM

Era transformer kini menghadapi kekangan asas apabila tuntutan pengkomputeran bagi model bahasa besar (LLM) mencapai tahap kritikal. Walaupun kertas kerja "Attention Is All You Need" pada tahun 2017 telah meletakkan asas bagi lonjakan AI semasa, generasi baharu syarikat pemula kini sedang berlumba-lumba untuk menggantikan atau mencipta semula seni bina teras bagi mencapai kecekapan yang sebenar.

Kekangan Transformer: Mengapa "Dense Attention" Gagal

Selama hampir sedekad, transformer telah menjadi enjin industri AI, yang dikuasakan oleh mekanisme yang dikenali sebagai "dense attention" (perhatian padat). Proses ini membandingkan setiap token dalam satu blok teks dengan setiap token yang lain melalui pendaraban berskala besar. Walaupun sangat tepat dalam menangkap makna semantik, kerumitan matematiknya sukar untuk diskalakan.

Sebagai contoh, sebuah dokumen dengan 10,000 patah perkataan boleh memerlukan transformer untuk melakukan kira-kira 50 juta pendaraban. Pertumbuhan kuadratik dalam pengkomputeran ini membawa kepada dua cabaran besar: penggunaan tenaga yang melonjak tinggi dan tetingkap konteks (context windows) yang terhad. Dengan laporan bahawa OpenAI bakal membelanjakan $50 bilion untuk pengkomputeran tahun ini dan permintaan elektrik pusat data dijangka meningkat dua kali ganda menjelang 2030, industri ini sedang menghadapi tembok dari segi kos dan juga fizik.

Memikirkan Semula Perhatian: Kebangkitan Mekanisme "Sparse"

Untuk menyelesaikan krisis kecekapan ini, beberapa syarikat pemula sedang cuba beralih daripada "dense attention" kepada "sparse attention" (perhatian jarang). Daripada mengira setiap pasangan perkataan yang mungkin, "sparse attention" hanya menumpukan pada sambungan yang paling relevan, sekali gus mengurangkan beban pengkomputeran secara ketara.

Syarikat pemula yang berpangkalan di Miami, Subquadratic, merupakan peneraju dalam ruang ini dengan model SubQ miliknya. Tidak seperti mekanisme "sparse" sebelum ini yang bergelut untuk mengekalkan ketepatan, Subquadratic mendakwa teknologinya mampu menyaingi LLM arus perdana dalam tugas khusus seperti pengekodan dan carian. Pendekatan mereka melibatkan sistem dinamik yang mengenal pasti perkataan mana yang sebenarnya penting bagi sesuatu teks secara langsung, berbanding membazirkan kitaran pengkomputeran pada token yang tidak relevan.

"Power Retention": Beralih ke Arah "Rolling Summaries"

Pendekatan lain melibatkan peralihan sepenuhnya daripada mekanisme perhatian. Manifest AI yang berpangkalan di San Francisco sedang mempelopori teknik yang dipanggil "power retention". Walaupun model "sparse attention" seperti SubQ masih cuba mengekalkan gambaran kasar keseluruhan tetingkap konteks, "power retention" berfungsi dengan membekalkan model tersebut dengan ringkasan berputar (rolling summary) bagi memorinya.

Apabila maklumat baharu memasuki tetingkap konteks, model tersebut akan mengenal pasti dan membuang data yang kurang relevan, bagi memastikan beban pengkomputeran kekal terkawal tanpa mengira saiz input. Manifest AI telah pun menunjukkan daya maju pendekatan ini dengan:

  • Menukarkan model sumber terbuka StarCoder kepada PowerCoder menggunakan "power retention".
  • Melancarkan Brumby, sebuah model yang mereka dakwa mampu menyaingi model sumber terbuka Qwen yang popular daripada Alibaba.

Keupayaan untuk menyesuaikan model transformer sedia ada kepada model "power retention" dengan latihan semula yang minimum menunjukkan bahawa peralihan kepada "LLMs+"—generasi model seterusnya—boleh berlaku jauh lebih cepat daripada yang dijangkakan.

Ringkasan Utama

  • Had Transformer: Penskalaan kuadratik "dense attention" menjadikan LLM semasa sangat mahal untuk dijalankan dan sukar untuk diskalakan bagi set data yang besar atau penaakulan bentuk panjang.
  • Sparse vs. Retention: Syarikat pemula menangani masalah ini dari dua sudut: Subquadratic mengoptimumkan perhatian melalui pengiraan "sparse" (SubQ), manakala Manifest AI menggantikannya dengan ringkasan berputar (Power Retention).
  • Keperluan Ekonomi: Memandangkan kos pengkomputeran AI mencecah puluhan bilion dolar, pemenang era AI seterusnya berkemungkinan besar adalah pihak yang menyelesaikan isu kecekapan, dan bukannya sekadar skala mentah.