Pandora's AI Model Routing Box
DeepMind의 새로운 논문은 작업 성능을 유지하면서 라우팅 오버헤드를 최대 70%까지 절감하는 “Pandora’s Box” 프레임워크를 제안합니다.
라우팅 비용이 중요한 이유
서비스에 요청이 들어오면, 대개 여러 모델 중 하나를 선택해야 하는 메뉴를 갖게 됩니다. 어떤 모델은 빠르지만 정밀도가 낮고, 어떤 모델은 느리지만 정확합니다. 최적의 모델을 선택하는 과정에는 컴퓨팅 자원과 비용이 소모됩니다. 어떤 모델이 적합한지 판단하기 위해 빠른 테스트를 실행하거나, 외부 데이터를 가져오거나, 보조 도구를 호출해야 할 수도 있습니다.
Pandora’s Box 비유
DeepMind는 라우팅 문제를 고전적인 '판도라의 상자' 퍼즐에 대입했습니다. 각 모델은 현재 쿼리에 대한 성능을 숨기고 있는 밀봉된 상자와 같습니다. 상자를 여는 데는 자원이 소모되므로, 잠재적인 이득이 비용을 정당화할 수 있는지 결정해야 합니다. 이 프레임워크는 이러한 트레이드오프(trade-off)를 공식화하고 두 가지 구체적인 메커니즘을 제공합니다.
Pandora’s Router – 중앙 집중식 의사 결정자
라우터는 먼저 저렴하고 노이즈가 있는 추정기(estimator)를 실행하여 모델의 가능성을 측정합니다. 현재 최적의 모델보다 기대되는 개선 효과가 미리 설정된 “예약 가격(reservation price)”을 초과하는 경우에만 더 정확한 평가를 위해 비용을 지불합니다. 모든 모델을 조사하는 대신, 라우터는 조사 예산을 대폭 절감하면서도 최고의 성능을 내는 옵션을 찾아냅니다.
Pandora’s Bidder – 분산형 시장
Bidder 변형 모델에서는 각 모델 제공자가 계약을 따낼 수 있는 자기 평가(self-assessment)에 비용을 지불할지 여부를 결정합니다. 제공자는 평가 비용보다 계약 성공 가능성에 따른 이득이 더 클 것으로 예상될 때만 입찰합니다. 이를 통해 보상이 충분히 높을 때만 비용이 많이 드는 평가가 이루어지는 시장이 형성됩니다.
세 가지 영역에서의 결과
저자들은 다음 세 가지 영역에서 두 메커니즘을 테스트했습니다:
- 수학적 추론(Math reasoning) – 문제를 가장 정확하게 해결하는 모델을 선택.
- 검색 증강 생성(Retrieval-augmented generation, RAG) – 언어 모델이 답변을 생성하기 전, 가장 관련성 높은 컨텍스트를 제공하는 검색 시스템을 선택.
- 대규모 임베딩 선택(Large-scale embedding selection) – 유사도 검색을 위해 최적의 벡터 표현을 생성하는 인코더를 선택.
모든 경우에서 Pandora’s Router는 비용과 오류를 결합한 지표(cost-plus-error metric)에서 가장 낮은 수치를 기록하며, 모든 모델을 항상 조사하거나 아예 조사하지 않는 베이스라인 모델들을 능가했습니다. 이 시스템은 자동으로 적응합니다. 조사 비용이 상승하면 조사할 모델 수를 줄이고, 비용이 낮아지면 조사를 강화합니다. 보고된 라우팅 비용 절감 효과는 30%에서 70%에 달하며, 다운스트림 작업의 품질 저하는 측정되지 않았습니다.
시사점: 추론 예산이 급증함에 따라, 더 나은 모델을 찾기 위한 탐색을 언제 멈출지 결정하는 것이 모델 자체를 선택하는 것만큼이나 중요해지고 있습니다. Pandora’s Box는 숨겨진 비용을 통제 가능한 레버로 바꿔줍니다.
