AWS imeongeza chaguo la “prefix-aware routing” kwenye Amazon SageMaker Inference, ikiahidi viwango vya juu vya cache-hit na latency ndogo sana kwa wateja wanaojiendeshea mitindo mikubwa ya lugha (LLMs) kwenye miundombinu yao wenyewe. Mabadiliko haya ni muhimu kwa sababu yanatoa latency ndogo na kupunguza gharama za GPU compute.
Kwa nini latency ya LLM ni muhimu
Wakati LLM inapokea ombi, kwa kawaida hupiga hesabu upya ya attention juu ya prompt nzima—hatua yenye gharama kubwa inayoongezeka kwa kila token inayoongezwa. Ikiwa mtindo unaweza kutumia tena cache ya attention kutoka ombi lililopita, unahitaji tu kuchakata sehemu mpya ya maandishi. Kazi zinazotuma mara kwa mara system prompt ileile au zinazohifadhi historia ya mazungumzo ni chaguo bora kwa utumiaji wa cache upya.
Katika mipangilio ya kawaida ya SageMaker, maombi yanayokuja yanasambazwa kwa nasibu kwenye kundi la instance za inference. Usambazaji wa nasibu unamaanisha ombi ambalo lingeweza kupata warm cache mara nyingi huangukia kwenye cold instance, hali inayolazimisha upigaji hesabu upya wa kila kitu. Matokeo yake ni latency kubwa na mzunguko wa ziada wa GPU ambayo inatafsiriwa moja kwa moja kuwa matumizi makubwa ya fedha.
Jinsi prefix-aware routing inavyofanya kazi
Njia mpya ya uongozaji inahifadhi ramani nyepesi ya prefix za maombi ya hivi karibuni—kiini chake ni sehemu ya kwanza ya prompt ambayo huwa haibadiliki katika maombi mbalimbali. Ombi jipya linapowasili, SageMaker hukagua ramani hiyo na kuelekeza ombi kwenye instance ambayo tayari imeshatatua prefix hiyo hiyo. Ikiwa instance hiyo bado inashikilia cache ya attention inayohusika, mtindo unaweza kuruka sehemu kubwa ya kazi na kutoa jibu kwa haraka zaidi.
Mambo muhimu:
- Hakuna mabadiliko ya kodi yanayohitajika – kipengele hiki kipo kikamilifu katika tabaka la huduma ya inference.
- Hutumika kwa mitindo inayojiendesha tu (self-hosted models) – huduma zinazosimamiwa kama vile API ya OpenAI au huduma ya Anthropic hazijaathiriwa.
- Haikuhitaji mabadiliko upande wa programu – URL ileile ya SageMaker endpoint na mkataba wa API unabaki vilevile.
Nani anayefaidika
Mashirika yanayohifadhi LLMs kwenye SageMaker hufanya hivyo kwa sababu mbalimbali kuanzia faragha ya data hadi udhibiti wa gharama. Kwa wale wanaojiendesha na chatbots za usaidizi, wasaidizi wa mauzo, au wakala wowote wa kidijitali anayetumia mara kwa mara system
