RadixAttention milik SGLang memangkas masa pemanasan time-to-first-token kepada 68 ms pada sistem dwi-RTX 3090, manakala PagedAttention milik vLLM kekal pada 184 ms—jurang kependaman sebanyak 82.9% yang menjadikan interaksi ejen berbilang pusingan terasa jauh lebih lancar.

Kedua-dua projek ini cuba mempercepatkan inferens model bahasa besar (LLM), tetapi penanda aras ini menyasarkan beban kerja yang menggerakkan pembantu autonomi: system prompt yang panjang, skema pemanggilan alatan (tool-calling), dan sejarah pusingan pengguna-pembantu yang berterusan. Token yang berulang itu tersimpan dalam memori GPU; jika cache tidak diuruskan dengan cekap, ia akan menjadi hambatan pengkomputeran (compute bottleneck) yang melambatkan perbualan.

Beban kerja yang mengubah keadaan

Pelayan LLM tradisional mengoptimumkan untuk satu pertukaran sahaja—prompt pengguna, jawapan model, selesai. Walau bagaimanapun, ejen moden mengekalkan "keadaan perbualan" (conversation state) yang boleh merangkumi berpuluh-puluh pusingan, di mana setiap pusingan menambah beratus-ratus token ke dalam cache. Set ujian tersebut memainkan semula gelung berbilang pusingan sedemikian pada dua kad RTX 3090, dengan mengukur:

  • Masa pemanasan time-to-first-token (TTFT) – kelewatan sebelum token pertama muncul selepas pusingan baharu bermula.
  • Kependaman keseluruhan – purata masa bagi setiap token sepanjang keseluruhan gelung.
  • Hasil (throughput) berterusan – token yang diproses sesaat apabila gelung berjalan secara berterusan.
  • Nisbah padanan cache (cache-hit ratio) – nisbah token yang digunakan semula daripada cache kunci-nilai (KV) berbanding dikira semula.

SGLang mengatasi vLLM dalam setiap metrik: TTFT 68 ms berbanding 184 ms, pengurangan kependaman sebanyak 82.9%, throughput 39.8% lebih tinggi, dan nisbah padanan cache sebanyak 96.8% berbanding 84.2% milik vLLM.

PagedAttention lwn RadixAttention

Kedua-dua enjin menyimpan pasangan KV perantara dalam memori GPU, tetapi mereka menyusun memori tersebut secara berbeza.

  • PagedAttention (vLLM) membahagikan cache kepada blok bersaiz tetap. Jika sesuatu prompt berakhir di tengah-tengah blok, token yang berbaki mesti dikira semula pada setiap pusingan kerana blok tersebut tidak boleh digunakan semula secara separa. Pendekatan ini ringkas dan berkesan apabila prompt selari dengan sempadan blok, tetapi ia membazirkan kitaran pemprosesan pada token "tepi" yang paling kerap berubah dalam gelung ejen.
  • RadixAttention (SGLang) menganggap cache sebagai sebuah pohon (tree). Ia mencari awalan sepunya (common prefix) yang terpanjang antara prompt semasa dengan apa yang telah tersimpan dalam cache, tanpa mengira had blok, dan memangkas dahan yang tidak digunakan. Ini membolehkan system prompt yang besar kekal terpaku dalam memori GPU sementara hanya pusingan terbaharu sahaja yang diproses, sekali gus meningkatkan nisbah padanan cache dan mengurangkan kerja berulang.

Bilakah setiap enjin menyerlah

Senario Enjin pilihan
Ejen autonomi berbilang pusingan, pemanggilan alatan yang berat, penaakulan tree-of-thought SGLang (RadixAttention)
Sokongan perkakasan yang luas (termasuk pemecut AMD dan Gaudi), speculative decoding, model bahasa-penglihatan vLLM (PagedAttention)

Perbezaannya bukan sekadar prestasi; ia juga melibatkan ekosistem. Keserasian perkakasan vLLM yang lebih luas menjadikannya pilihan lalai yang lebih selamat untuk organisasi dengan kluster pengkomputeran heterogen. Ciri speculative decoding miliknya—menjana beberapa calon token secara selari—boleh mempercepatkan penjanaan pusingan tunggal, satu bidang khusus di mana pengkacuhan berasaskan pohon RadixAttention menawarkan lebih sedikit kelebihan.

Kesimpulan

Bagi pembangun yang membina ejen berbilang pusingan yang mengendalikan prompt panjang dan kemas kini berperingkat, RadixAttention milik SGLang memberikan pengalaman yang jauh lebih pantas dan lebih cekap cache pada GPU pengguna. Pasukan yang memerlukan liputan perkakasan yang luas atau pakar dalam penjanaan pusingan tunggal mungkin masih cenderung menggunakan vLLM. Pilihan kini bergantung kepada sama ada beban kerja tersebut bersifat "berat ejen" (agent-heavy) atau "pelbagai perkakasan" (hardware-diverse).