LongStraw mengumumkan bahawa teknik branch-replay miliknya boleh memproses 2.1 juta kedudukan token untuk pasca-latihan pembelajaran pengukuhan (RL) dengan hanya menggunakan lapan GPU H20, sekali gus mengurangkan kos perkakasan secara drastik. Dakwaan ini penting kerana latihan model konteks panjang secara tradisinya memerlukan berpuluh-puluh GPU kelas atasan, yang menjadi penghalang bagi kebanyakan makmal penyelidikan dan syarikat pemula.

Mengapa RL konteks panjang itu mahal

Penalaan halus (fine-tuning) berasaskan RL bagi model bahasa besar biasanya menjalankan rollout yang menjana banyak pelengkap alternatif bagi prom yang sama. Setiap rollout mesti melalui proses back-propagation, jadi kos pengkomputeran meningkat seiring dengan jumlah keseluruhan kedudukan token yang diproses. Saluran paip (pipeline) semasa yang menyasarkan konteks sejuta token sering memerlukan 64 hingga 128 GPU untuk selesai dalam tempoh masa yang munasabah. Kos perkakasan tersebut, ditambah dengan keperluan elektrik dan penyejukan, mengehadkan sejauh mana pengamal boleh meningkatkan panjang konteks.

Bagaimana branch replay mengurangkan beban kerja

Pendekatan LongStraw bergantung kepada dua pemerhatian tentang penjanaan transformer:

  • Prom dan bahagian awal respons adalah serupa merentasi semua rollout.
  • Hanya bahagian hujung yang berbeza bagi setiap respons yang memerlukan pengkomputeran baharu.

Sistem ini membina timbunan pelaksanaan yang peka terhadap seni bina (architecture-aware execution stack) yang merekodkan pengaktifan bagi awalan (prefix) yang dikongsi. Apabila cawangan baharu diterokai, ia memainkan semula awalan yang telah disimpan dalam cache dan bukannya mengira semula, kemudian menjalankan backward pass hanya pada segmen baharu tersebut. Dalam praktiknya, ini bermakna backward pass menyentuh jauh lebih sedikit kedudukan token, memberikan pengurangan pengkomputeran mentah sebanyak 8 hingga 16 kali ganda.

Impak segera

  • 2.1 juta kedudukan token diproses pada lapan GPU H20, satu bajet perkakasan yang biasanya hanya mampu menyokong sebahagian kecil daripada beban kerja tersebut.
  • Menyasarkan secara langsung kekangan (bottleneck) dalam RL konteks panjang, di mana kos memori dan pengkomputeran melonjak apabila konteks bertambah besar.
  • Makmal boleh mengalihkan peruntukan GPU: perkakasan yang sama, yang utamanya merupakan pemecut inferens (inference accelerator), kini boleh digunakan untuk latihan, walaupun hasilnya mungkin berbeza pada kad lain.

Persoalan terbuka dan had

Pengumuman tersebut tidak menyatakan angka kelajuan latihan dan lengkung penumpuan (convergence curves), jadi kita tidak tahu sama ada pengurangan pengkomputeran itu diterjemahkan kepada masa dunia nyata (wall-clock time) yang lebih pantas atau sekadar penggunaan GPU yang lebih rendah. Kaedah ini diterangkan untuk pensampelan autoregresif; tingkah lakunya dengan strategi bukan autoregresif atau hibrid masih belum diuji. Oleh kerana H20 terutamanya adalah pemecut inferens, prestasi pada kad latihan yang lebih biasa seperti H100 atau B200 mungkin berbeza.

Penanda aras bebas masih belum mengesahkan angka LongStraw. Tanpa pengesahan pihak ketiga, komuniti harus menganggap keputusan tersebut sebagai menjanjikan tetapi bersifat sementara.

Apa yang dipertaruhkan

Jika idea branch-replay ini diperluaskan kepada algoritma penalaan halus RL yang lain seperti Direct Preference Optimization (DPO) atau Proximal Policy Optimization (PPO), halangan kos bagi model konteks panjang mungkin akan terhapus.

Perkara untuk diperhatikan

  • Percubaan replikasi pihak ketiga pada pelbagai seni bina GPU.
  • Kemas kini daripada LongStraw mengenai daya pemprosesan (throughput) latihan dan kualiti model akhir berbanding dengan saluran paip asas (baseline pipelines).