Исследовательская группа разработала роутер, чтобы определять, справится ли дешевая языковая модель с запросом на написание кода, в надежде снизить затраты на инференс, но роутер не смог превзойти базовый уровень стратегии «никогда не повышать уровень» (never-escalate). Этот провал показывает, почему метрики, ориентированные на точность, вводят в заблуждение при построении каскадов, и указывает на сигналы, которые действительно отражают сложность задачи.
Почему роутер имел значение
Каскады моделей отправляют каждый запрос самой маленькой модели, способной ответить на него правильно. Если роутер направляет простой промпт дешевой модели, система пропускает дорогостоящие вычисления, необходимые для более крупной модели. Команда обучила роутер на 539 реальных задачах по программированию — 428 легких и 111 сложных, — ожидая, что он научится понимать, когда будет достаточно дешевой модели.
Цифры, которые не оправдали ожиданий
- AUC на отложенной выборке (площадь под ROC-кривой): 0.594
- Диапазон 5-кратной кросс-валидации: 0.55 – 0.57
- Лучший порог: соответствует стратегии «никогда не повышать уровень»
AUC на отложенной выборке составил 0.594, а значения кросс-валидации варьировались от 0.55 до 0.57, что означает, что классификатор едва справляется с разделением легких и сложных случаев. Когда оптимальный порог воспроизводит стратегию, при которой дорогая модель никогда не используется, роутер не приносит никакой пользы. Он ведет себя как константный предиктор, а не как инструмент принятия решений.
Что проверяли эксперименты
Исследователи сравнили три набора признаков:
| Набор признаков | AUC |
|---|---|
| 11 простых поверхностных признаков (например, количество токенов, наличие ключевых слов) | 0.610 |
| 1024-мерное эмбеддинг-представление промпта (семантический вектор) | 0.552 |
| Оба набора вместе | 0.609 |
Удивительно, но легковесные поверхностные признаки превзошли высокоразмерное семантическое эмбеддинг-представление. Эмбеддинг улавливал тему промпта, но не его внутреннюю сложность. Подача черновика (draft) от дешевой модели в роутер подняла AUC до 0.640, что говорит о том, что сигналы, появляющиеся в процессе генерации, более информативны, чем те, что присутствуют только в промпте.
Две фундаментальные ловушки
1. Точность — неверный критерий
Роутер должен улучшать баланс между стоимостью и точностью по сравнению с наивной стратегией, а не просто предсказывать правильность ответа. Если он не может превзойти стратегию «никогда не повышать уровень», он не дает никакой экономии, независимо от чистой точности. Традиционные метрики, такие как AUC, игнорируют экономический аспект каскада.
2. Стратегия «всегда повышать уровень» — это не потолок
В эксперименте предполагалось, что дорогая модель непогрешима, и стратегия «всегда использовать большую модель» рассматривалась как верхняя граница. На самом деле большая модель иногда портила ответы, с которыми успешно справлялась дешевая модель. Идеальный роутер, знающий, когда стоит остановиться на дешевой модели, может превзойти базовый уровень «всегда повышать уровень» примерно на 4,2 пункта в выбранной метрике стоимости. Этот разрыв показывает, что потолок производительности дорогой модели ниже, чем предполагалось.
Проектирование более эффективных сигналов маршрутизации
Результаты указывают на три практических направления:
- Использовать сигналы, возникающие в процессе генерации. Подача промежуточного результата (черновика) дешевой модели в роутер позволяет уловить сложность, которую скрывает один лишь промпт.
- Отдавать приоритет специфичным для задачи поверхностным признакам. Простые метрики — такие как длина, наличие определенных операторов или маркеров стиля кода — могут быть более прогностическими, чем универсальные семантические эмбеддинги.
- Измерять успех с помощью метрик, учитывающих стоимость. Вместо чистой точности или AUC оценивайте, сколько дорогостоящих вызовов удалось избежать при сохранении целевого уровня качества.
Вывод: Роутер, оптимизированный только под точность, не может гарантировать экономию средств; эффективная маршрутизация требует использования данных, полученных в процессе генерации, и оценки с учетом стоимости.
