AWS додала опцію «маршрутизації з урахуванням префіксів» (prefix-aware routing) до Amazon SageMaker Inference, обіцяючи вищі показники влучання в кеш і помітно нижчу затримку для клієнтів, які запускають великі мовні моделі (LLM) на власній інфраструктурі. Ця зміна є важливою, оскільки вона забезпечує відчутно меншу затримку та знижує витрати на обчислення GPU.
Чому затримка LLM має значення
Коли LLM отримує запит, вона зазвичай перераховує механізм уваги (attention) над усім промптом — це витратний крок, вартість якого зростає з кожним доданим токеном. Якщо модель може повторно використовувати кеш уваги з попереднього запиту, їй потрібно обробити лише нову частину тексту. Робочі навантаження, які повторно надсилають той самий системний промпт або підтримують історію розмови, є ідеальними кандидатами для повторного використання кешу.
У стандартній конфігурації SageMaker вхідні запити розподіляються випадковим чином між пулом інстансів інференсу. Випадковий розподіл означає, що запит, який міг би потрапити в «теплий» кеш, часто потрапляє на «холодний» інстанс, що змушує модель виконувати повний перерахунок. Результатом є вища затримка та додаткові цикли GPU, що безпосередньо призводить до збільшення витрат.
Як працює маршрутизація з урахуванням префіксів
Новий режим маршрутизації зберігає легку карту нещодавніх префіксів запитів — по суті, першу частину промпту, яка зазвичай залишається незмінною між викликами. Коли надходить новий запит, SageMaker перевіряє карту і перенаправляє запит на інстанс, який уже обробляв той самий префікс. Якщо інстанс усе ще зберігає відповідний кеш уваги, модель може пропустити основну частину роботи та швидше згенерувати відповідь.
Ключові моменти:
- Жодних змін у коді не потрібно — функція працює повністю на рівні сервісу інференсу.
- Застосовується лише до self-hosted моделей — керовані сервіси, такі як API від OpenAI або сервіс від Anthropic, не підпадають під цю дію.
- Прозорість для додатків — той самий URL-адреса кінцевої точки SageMaker та API-контракт залишаються без змін.
Хто отримає вигоду
Підприємства, які розміщують LLM на SageMaker, роблять це з різних причин: від конфіденційності даних до контролю витрат. Для тих, хто запускає чат-ботів підтримки, асистентів з продажів або будь-яких інтерактивних агентів, які повторно використовують фіксований системний промпт, це налаштування маршрутизації може скоротити середній час відповіді. Що стосується витрат, то кожне влучання в кеш рятує GPU від повторної оцінки спільної частини промпту.
Обмеження та контраргументи
Перевага залежить від наявності повторюваних префіксів. Високозмінні промпти — наприклад, одноразові запити або динамічно згенеровані системні повідомлення — не отримають такої переваги від влучання в кеш.
Оскільки ця функція обмежена лише self-hosted розгортаннями, клієнти, які використовують керовані сервіси LLM, не зможуть скористатися нею.
Підсумок: Маршрутизація з урахуванням префіксів дає користувачам SageMaker простий спосіб без написання коду мінімізувати затримку у повторюваних навантаженнях LLM, одночасно скорочуючи витрати на GPU. Для організацій, які вже розміщують моделі на цій платформі, це оновлення є низькоризиковим покращенням, яке може забезпечити швидшу взаємодію з користувачами та менші рахунки.
