RadixAttention milik SGLang memangkas warm-up time-to-first-token menjadi 68 ms pada perangkat dual-RTX 3090, sementara PagedAttention milik vLLM tertahan di 184 ms—sebuah celah latensi sebesar 82,9% yang membuat interaksi agen multi-turn terasa jauh lebih lancar.

Kedua proyek ini mencoba mempercepat inferensi large language model (LLM), tetapi tolok ukur ini menargetkan beban kerja yang menggerakkan asisten otonom: system prompt yang panjang, skema tool-calling, dan riwayat percakapan pengguna-asisten yang terus berjalan. Token-token yang berulang tersebut tersimpan di memori GPU; jika cache tidak dikelola secara efisien, mereka akan menjadi hambatan komputasi yang menghambat percakapan.

Beban kerja yang mengubah keadaan

Server LLM tradisional dioptimalkan untuk satu pertukaran tunggal—prompt pengguna, jawaban model, selesai. Namun, agen modern menyimpan "status percakapan" yang dapat mencakup puluhan giliran, di mana setiap giliran menambahkan ratusan token ke dalam cache. Rangkaian pengujian mengulang loop multi-turn tersebut pada dua kartu RTX 3090, dengan mengukur:

  • Warm time-to-first-token (TTFT) – penundaan sebelum token pertama muncul setelah giliran baru dimulai.
  • Latensi keseluruhan – rata-rata waktu per token di seluruh loop.
  • Throughput berkelanjutan – token yang diproses per detik saat loop berjalan terus-menerus.
  • Rasio cache-hit – proporsi token yang digunakan kembali dari key-value (KV) cache alih-alih dihitung ulang.

SGLang mengungguli vLLM di setiap metrik: TTFT 68 ms vs 184 ms, pemangkasan latensi sebesar 82,9%, throughput 39,8% lebih tinggi, dan rasio cache-hit sebesar 96,8% dibandingkan dengan 84,2% milik vLLM.

PagedAttention vs RadixAttention

Kedua mesin ini menyimpan pasangan KV perantara di memori GPU, tetapi mereka mengelola memori tersebut secara berbeda.

  • PagedAttention (vLLM) membagi cache menjadi blok-blok berukuran tetap. Jika sebuah prompt berakhir di tengah blok, token yang tersisa harus dihitung ulang pada setiap giliran karena blok tersebut tidak dapat digunakan kembali sebagian. Pendekatan ini sederhana dan berfungsi baik ketika prompt selaras dengan batas blok, tetapi membuang-buang siklus pada token "tepi" yang paling sering berubah dalam loop agen.
  • RadixAttention (SGLang) memperlakukan cache sebagai sebuah pohon (tree). Ia mencari awalan umum terpanjang (longest common prefix) antara prompt saat ini dengan apa yang sudah ada di cache, tanpa mempedulikan batasan blok, dan memangkas daun yang tidak digunakan. Hal ini memungkinkan system prompt yang masif tetap tertanam di memori GPU sementara hanya giliran terbaru yang diproses, sehingga meningkatkan rasio cache-hit dan mengurangi pekerjaan redundan.

Kapan masing-masing mesin unggul

Skenario Mesin pilihan
Agen otonom multi-turn, tool calling yang intens, penalaran tree-of-thought SGLang (RadixAttention)
Dukungan perangkat keras yang luas (termasuk akselerator AMD dan Gaudi), speculative decoding, model visi-bahasa vLLM (PagedAttention)

Perbedaannya bukan hanya soal performa; ini juga soal ekosistem. Kompatibilitas perangkat keras vLLM yang lebih luas menjadikannya pilihan standar yang lebih aman bagi organisasi dengan klaster komputasi heterogen. Fitur speculative decoding-nya—menghasilkan beberapa kandidat token secara paralel—dapat mempercepat generasi single-turn, sebuah ceruk di mana caching berbasis pohon milik RadixAttention menawarkan keuntungan yang lebih sedikit.

Kesimpulan

Bagi pengembang yang membangun agen multi-turn yang menangani prompt panjang dan pembaruan inkremental, RadixAttention milik SGLang memberikan pengalaman yang jauh lebih cepat dan lebih efisien dalam penggunaan cache pada GPU konsumen. Tim yang membutuhkan cakupan perangkat keras yang luas atau berspesialisasi dalam generasi single-turn mungkin masih akan mengandalkan vLLM. Pilihan kini bergantung pada apakah beban kerjanya bersifat "berat pada agen" (agent-heavy) atau "beragam secara perangkat keras" (hardware-diverse).