Mengapa Netflix meninggalkan fitur buatan tangan

Selama sebagian besar sejarahnya, alur rekomendasi Netflix bergantung pada ribuan atribut yang ditentukan secara manual—vektor numerik yang mendeskripsikan pengguna, judul, dan setiap interaksi di antara mereka. Para insinyur menghabiskan waktu berminggu-minggu untuk menerjemahkan jenis konten baru—olahraga langsung, podcast, atau game—menjadi serangkaian fitur baru sebelum sistem dapat mulai merekomendasikannya. Proses ini memakan biaya besar, rapuh, dan sulit untuk disinkronkan dengan ekspansi katalog yang cepat.

Model bahasa besar (LLM) yang tersedia di pasaran tidak langsung bekerja dengan baik. Model-model tersebut cenderung memilih judul-judul paling populer, sesekali berhalusinasi tentang item yang tidak ada, dan kesulitan untuk menerapkan aturan bisnis yang menjaga rekomendasi tetap aman dan relevan. Oleh karena itu, Netflix membangun alur berbasis LLM khusus yang mempertahankan kekuatan model bahasa sambil tetap menghormati batasan produksi.

Di balik GenRec: alur pelatihan dua tahap

GenRec terdiri dari dua fase yang berbeda:

  1. Fine-tuning model dasar – Netflix memulai dari model bahasa open-weight dan melakukan fine-tuning pada data tontonan internal. Hal ini mengajarkan model tentang kosakata katalog dan pola perilaku pengguna tanpa mengubah arsitektur intinya.
  2. Ranking rekomendasi – Putaran pelatihan kedua mengubah model yang telah di-fine-tune menjadi sebuah ranker yang memberikan skor pada judul kandidat untuk pengguna tertentu. Netflix memperbarui tahap ini secara berkala agar model tetap mutakhir dengan rilis baru dan tren yang berubah.

Perbedaan utama dari sistem lama adalah bagaimana riwayat pengguna dimasukkan ke dalam model. Alih-alih mengompresi sesi menonton menjadi vektor padat, GenRec menerjemahkan setiap interaksi—durasi putar, jempol ke atas atau ke bawah, penghentian dini—menjadi kalimat bahasa Inggris biasa. Model tersebut kemudian membaca seluruh sesi sebagai dialog singkat, menangkap pergeseran halus dalam preferensi genre atau suasana hati tanpa rekayasa fitur (feature engineering) eksplisit apa pun.

Peningkatan performa dan efisiensi

Dalam eksperimen selama empat minggu yang mengekspos 10% trafik Netflix ke GenRec, sistem baru ini menghasilkan peningkatan yang signifikan secara statistik di dua kelompok metrik:

  • Keterlibatan jangka pendek – kenaikan 0,115% pada sinyal click-through utama dan waktu tonton yang mendorong rekomendasi harian.
  • Metrik inti jangka panjang – peningkatan 0,006% dalam retensi pelanggan dan skor kepuasan keseluruhan yang paling penting bagi bisnis.

Secara offline, kualitas ranking pada dataset yang disisihkan (held-out dataset) meningkat sebesar 1,6% dibandingkan dengan baseline produksi. Yang lebih mencolok adalah efisiensi data: tahap pelatihan kedua membutuhkan sekitar 1/40 dari contoh berlabel yang dibutuhkan alur tradisional untuk mencapai tingkat performa yang sama.

Untuk menjaga biaya komputasi tetap terkendali, Netflix menjalankan model dengan vLLM, sebuah serving stack yang memberikan skor pada setiap kandidat dalam satu kali proses forward pass, alih-alih menghasilkan teks. Sistem ini juga menerapkan penyaringan agresif sehingga hanya peristiwa dengan sinyal tinggi yang menempati jendela konteks (context window) model, memangkas token yang tidak perlu dan mengurangi latensi.

Apa arti pergeseran dari “fitur” ke “konteks”

GenRec adalah bagian dari gerakan yang lebih luas di mana "context engineering" menggantikan fitur buatan tangan. Alih-alih merancang arsitektur khusus untuk setiap tugas rekomendasi, para insinyur memutuskan sinyal mana yang akan dimasukkan ke dalam prompt teks dan membiarkan model bahasa menalar di atasnya. Pendekatan ini mempercepat proses onboarding jenis konten baru: sebuah episode podcast atau game siaran langsung dapat dijelaskan dalam satu kalimat dan segera bergabung ke dalam kumpulan rekomendasi, melewati sprint definisi fitur yang memakan waktu berbulan-bulan.

Hambatan yang tersisa

Pemberi rekomendasi berbasis LLM bukanlah solusi ajaib (silver bullet). Kecenderungan mereka untuk terlalu menekankan item populer masih menimbulkan bias pada katalog, dan kebutuhan akan GPU yang kuat meningkatkan biaya operasional. Bahkan dengan vLLM dan penyaringan agresif, menjalankan model bahasa besar pada skala Netflix menuntut rekayasa yang cermat untuk memenuhi target latensi.