AWS добавила опцию «prefix-aware routing» (маршрутизация с учетом префиксов) в Amazon SageMaker Inference, обещая более высокий коэффициент попадания в кэш и заметно более низкую задержку для клиентов, запускающих большие языковые модели (LLM) на собственной инфраструктуре. Это изменение важно, так как оно обеспечивает ощутимо меньшую задержку и снижение затрат на вычисления на GPU.
Почему важна задержка LLM
Когда LLM получает запрос, она обычно заново вычисляет механизм внимания (attention) для всего промпта — это ресурсозатратный этап, стоимость которого растет с каждым новым токеном. Если модель может повторно использовать кэш внимания из предыдущего запроса, ей нужно обработать только новую часть текста. Рабочие нагрузки, которые многократно отправляют один и тот же системный промпт или поддерживают историю диалога, являются идеальными кандидатами для повторного использования кэша.
В стандартной настройке SageMaker входящие запросы распределяются случайным образом по пулу инстансов инференса. Случайное распределение означает, что запрос, который мог бы попасть в «теплый» кэш, часто попадает на «холодный» инстанс, что вынуждает модель выполнять полное перевычисление. Результатом становятся более высокая задержка и лишние циклы GPU, что напрямую ведет к росту расходов.
Как работает маршрутизация с учетом префиксов
Новый режим маршрутизации хранит облегченную карту недавних префиксов запросов — по сути, первую часть промпта, которая обычно остается неизменной при разных вызовах. Когда поступает новый запрос, SageMaker проверяет карту и перенаправляет запрос на инстанс, который уже обрабатывал тот же префикс. Если инстанс все еще хранит соответствующий кэш внимания, модель может пропустить основную часть работы и сгенерировать ответ быстрее.
Основные моменты:
- Не требуется изменений в коде — функция полностью реализована на уровне сервиса инференса.
- Применяется только к self-hosted моделям — управляемые решения, такие как API от OpenAI или сервис от Anthropic, не затронуты.
- Прозрачно для приложений — тот же URL эндпоинта SageMaker и тот же API-контракт остаются прежними.
Кто получит выгоду
Предприятия, размещающие LLM на SageMaker, делают это по разным причинам: от конфиденциальности данных до контроля затрат. Для тех, кто запускает чат-ботов поддержки, ассистентов по продажам или любых интерактивных агентов, которые многократно используют фиксированный системный промпт, эта настройка маршрутизации может сократить среднее время ответа. С точки зрения затрат, каждое попадание в кэш избавляет GPU от необходимости повторно вычислять общую часть промпта.
Ограничения и контраргументы
Преимущество зависит от наличия повторяющихся префиксов. Высокоизменчивые промпты — такие как разовые запросы или динамически генерируемые системные сообщения — не получат такого преимущества от кэширования.
Поскольку функция ограничена развертываниями self-hosted, клиенты, привязанные к управляемым сервисам LLM, не смогут ею воспользоваться.
Итог: Маршрутизация с учетом префиксов дает пользователям SageMaker простой способ без изменения кода снизить задержку при повторяющихся нагрузках LLM, одновременно сокращая расходы на GPU. Для организаций, которые уже размещают модели на этой платформе, это обновление является низкорискованным улучшением, которое может привести к более быстрому взаимодействию с пользователями и снижению счетов.
