Netflix가 수동으로 제작된 피처를 버린 이유
Netflix 역사의 대부분 동안, Netflix의 추천 파이프라인은 수천 개의 수동으로 정의된 속성(사용자, 타이틀, 그리고 그들 사이의 모든 상호작용을 설명하는 수치 벡터)에 의존해 왔습니다. 엔지니어들은 새로운 콘텐츠 유형(라이브 스포츠, 팟캐스트 또는 게임)을 시스템이 추천할 수 있도록 새로운 피처 세트로 변환하는 데 몇 주를 소비해야 했습니다. 이 과정은 비용이 많이 들고, 취약하며, 빠르게 확장되는 카탈로그와 동기화하기 어려웠습니다.
기성 대규모 언어 모델(LLM)은 바로 적용하기에 적합하지 않았습니다. 모델들은 가장 인기 있는 타이틀에만 치우치는 경향이 있었고, 때로는 존재하지 않는 아이템을 환각(hallucination)하기도 했으며, 추천의 안전성과 관련성을 유지하는 비즈니스 규칙을 강제하는 데 어려움을 겪었습니다. 이에 Netflix는 언어 모델의 강점을 유지하면서도 운영상의 제약 조건을 준수하는 맞춤형 LLM 기반 파이프라인을 구축했습니다.
GenRec 내부 살펴보기: 2단계 학습 파이프라인
GenRec은 두 가지 별개의 단계로 구성됩니다:
- 베이스 모델 미세 조정(Base model fine-tuning) – Netflix는 오픈 웨이트(open-weight) 언어 모델에서 시작하여 내부 시청 데이터를 바탕으로 미세 조정을 진행합니다. 이를 통해 핵심 아키텍처를 변경하지 않고도 모델에게 카탈로그의 어휘와 사용자 행동 패턴을 학습시킵니다.
- 추천 랭킹(Recommendation ranking) – 두 번째 학습 단계에서는 미세 조정된 모델을 특정 사용자에 대한 후보 타이틀의 점수를 매기는 랭커(ranker)로 변환합니다. Netflix는 모델이 신작 및 변화하는 트렌드에 맞춰 최신 상태를 유지할 수 있도록 이 단계를 빈번하게 갱신합니다.
기존 시스템과의 핵심적인 차이점은 사용자 이력을 모델에 전달하는 방식입니다. 시청 세션을 밀집 벡터(dense vectors)로 압축하는 대신, GenRec은 재생 시간, 좋아요 또는 싫어요, 조기 이탈 등 각 상호작용을 평이한 영어 문장으로 변환합니다. 그러면 모델은 전체 세션을 짧은 대화처럼 읽어 들여, 명시적인 피처 엔지니어링 없이도 장르 선호도나 기분의 미묘한 변화를 포착합니다.
성능 및 효율성 향상
Netflix 트래픽의 10%를 GenRec에 노출시킨 4주간의 실험에서, 새로운 시스템은 두 가지 지표군에서 통계적으로 유의미한 상승을 기록했습니다:
- 단기 참여도 – 일일 추천을 주도하는 주요 클릭률(CTR) 및 시청 시간 신호가 0.115% 상승했습니다.
- 장기 핵심 지표 – 비즈니스에 가장 중요한 구독자 유지율 및 전반적인 만족도 점수가 0.006% 증가했습니다.
오프라인 테스트에서는 홀드아웃(held-out) 데이터셋에 대한 랭킹 품질이 기존 운영 베이스라인 대비 1.6% 향상되었습니다. 더욱 놀라운 점은 데이터 효율성입니다. 두 번째 학습 단계는 기존 파이프라인이 동일한 성능 수준에 도달하는 데 필요한 라벨링된 예시의 약 1/40만 필요했습니다.
컴퓨팅 비용을 관리하기 위해, Netflix는 텍스트를 생성하는 대신 단일 포워드 패스(forward pass)로 모든 후보의 점수를 매기는 서빙 스택인 vLLM을 사용하여 모델을 실행합니다. 또한 시스템은 공격적인 필터링을 적용하여 고신호(high-signal) 이벤트만 모델의 컨텍스트 윈도우(context window)를 차지하게 함으로써, 불필요한 토큰을 줄이고 지연 시간(latency)을 단축합니다.
"피처(features)"에서 "컨텍스트(context)"로의 전환이 의미하는 것
GenRec은 "컨텍스트 엔지니어링(context engineering)"이 수동으로 제작된 피처를 대체하는 광범위한 움직임의 일부입니다. 각 추천 작업에 맞춤형 아키텍처를 설계하는 대신, 엔지니어는 어떤 신호를 텍스트 프롬프트에 삽입할지 결정하고 언어 모델이 이를 바탕으로 추론하게 합니다. 이 접근 방식은 새로운 콘텐츠 유형의 온보딩 속도를 높입니다. 팟캐스트 에피소드나 라이브 스트리밍 게임을 한 문장으로 설명하여 즉시 추천 풀에 합류시킬 수 있으며, 몇 달씩 걸리는 피처 정의 스프린트를 건너뛸 수 있습니다.
남은 과제들
LLM 기반 추천 시스템이 만능 해결책(silver bullet)은 아닙니다. 인기 아이템을 과도하게 강조하는 경향은 여전히 카탈로그에 편향을 일으키며, 강력한 GPU의 필요성은 운영 비용을 높입니다. vLLM과 공격적인 필터링을 사용하더라도, Netflix 규모에서 대규모 언어 모델을 서빙하려면 지연 시간 목표를 달성하기 위한 세심한 엔지니어링이 요구됩니다.
