연구팀은 추론 비용을 절감하기 위해 저렴한 언어 모델이 코딩 요청을 처리할 수 있는지 결정하는 라우터를 구축했으나, 이 라우터는 '절대 에스컬레이션하지 않음(never-escalate)'이라는 베이스라인조차 넘어서지 못했습니다. 이러한 실패는 왜 정확도 중심의 지표가 캐스케이드(cascade) 구조를 오도하는지 보여주며, 실제로 난이도를 포착할 수 있는 신호가 무엇인지 시사합니다.

라우터가 중요했던 이유

모델 캐스케이드는 각 요청을 정답을 맞힐 수 있는 가장 작은 모델로 보냅니다. 만약 라우터가 단순한 프롬프트를 저렴한 모델로 보낸다면, 시스템은 더 큰 모델에 필요한 고비용 연산을 건너뛸 수 있습니다. 연구팀은 539개의 실제 코딩 작업(쉬운 작업 428개, 어려운 작업 111개)을 바탕으로 라우터를 학습시켜, 저렴한 모델로도 충분한 시점이 언제인지 학습시키고자 했습니다.

기대에 미치지 못한 수치들

  • 홀드아웃 AUC (ROC 곡선 아래 면적): 0.594
  • 5-겹 교차 검증 범위: 0.55 – 0.57
  • 최적 임계값: '절대 에스컬레이션하지 않음' 정책과 일치

홀드아웃 AUC는 0.594였고 교차 검증 범위는 0.55에서 0.57 사이였습니다. 이는 분류기가 쉬운 사례와 어려운 사례를 거의 구분하지 못함을 의미합니다. 최적의 임계값이 비싼 모델을 전혀 사용하지 않는 정책과 동일하게 나타난다면, 해당 라우터는 아무런 가치를 더하지 못하는 것입니다. 이는 의사 결정자가 아닌 상수 예측기처럼 동작하는 것과 같습니다.

실험을 통해 테스트한 항목

연구진은 세 가지 특징 세트(feature sets)를 비교했습니다.

특징 세트 AUC
11개의 단순 표면 특징 (예: 토큰 수, 키워드 존재 여부) 0.610
1024차원 프롬프트 임베딩 (의미론적 벡터) 0.552
두 가지 결합 0.609

놀랍게도 경량 표면 특징이 고차원 의미론적 임베딩보다 더 나은 성능을 보였습니다. 임베딩은 프롬프트의 주제는 포착했지만, 내재적인 난이도는 포착하지 못했습니다. 저렴한 모델의 초안(draft)을 라우터에 입력했을 때 AUC는 0.640으로 상승했는데, 이는 생성 과정에서 나타나는 신호가 프롬프트에만 존재하는 신호보다 더 많은 정보를 제공함을 시사합니다.

두 가지 근본적인 함정

1. 정확도는 잘못된 척도이다

라우터는 단순히 정답 여부를 예측하는 것이 아니라, 단순한 정책과 비교했을 때 비용-정확도 트레이드오프를 개선해야 합니다. 만약 '절대 에스컬레이션하지 않음'보다 나은 성능을 내지 못한다면, 원시 정확도(raw accuracy)가 아무리 높더라도 비용 절감 효과는 없습니다. AUC와 같은 전통적인 지표는 캐스케이드의 경제적 차원을 무시합니다.

2. '항상 에스컬레이션'이 한계는 아니다

이번 실험은 비싼 모델이 무결하다고 가정하여, '항상 큰 모델을 사용함'을 상한선으로 간주했습니다. 하지만 실제로는 큰 모델이 저렴한 모델이 맞힌 답변을 오히려 망가뜨리는 경우도 있었습니다. 저렴한 모델을 유지해야 할 시점을 정확히 아는 완벽한 라우터가 있다면, 선택된 비용 지표에서 '항상 에스컬레이션' 베이스라인을 약 4.2포인트 정도 앞설 수 있습니다. 이 격차는 비싼 모델의 성능 상한선이 예상보다 낮을 수 있음을 보여줍니다.

더 나은 라우팅 신호 설계하기

연구 결과는 세 가지 실질적인 방향을 제시합니다.

  • 생성 시점의 단서를 포함할 것. 저렴한 모델의 중간 출력물(초안)을 라우터에 입력하면 프롬프트만으로는 숨겨져 있던 난이도를 포착할 수 있습니다.
  • 작업 특화 표면 특징을 우선시할 것. 길이, 특정 연산자의 존재, 또는 코드 스타일 마커와 같은 단순한 지표가 일반적인 의미론적 임베딩보다 더 예측력이 높을 수 있습니다.
  • 비용을 고려한 지표로 성공을 측정할 것. 순수 정확도나 AUC 대신, 목표 품질 수준을 유지하면서 얼마나 많은 고비용 호출을 피했는지를 평가해야 합니다.

핵심 요약: 정확도만을 최적화하는 라우터는 비용 절감을 보장할 수 없습니다. 효과적인 라우팅을 위해서는 생성 시점의 증거와 비용을 고려한 평가가 필요합니다.