Bei za LLM zinabadilika mara kwa mara. Mwezi mmoja bajeti yako ya inference inafanya kazi kama ilivyotabiriwa; mwezi unaofuata, mtoa huduma anarekebisha kiwango chake cha kila token na matumizi yako ya kila mwezi yanabadilika bila hata ombi moja la ziada kupitishwa. Hicho ndicho hasa kilichotokea hivi punde. GMICloud, Novita, na StreamLake zote zimehusisha bei zao za modeli, na ikiwa unatumia mifumo ya uzalishaji (production workloads)—au hata mifumo ya majaribio (experimental pipelines)—marekebisho haya yanastahili kuchunguzwa kwa kina. Si kwa sababu soko linaporomoka, bali kwa sababu tofauti ndogo katika uchumi wa token huongezeka kwa kasi kubwa unapochakata mamilioni ya token kila siku.

Hawa Watoa Huduma Ni Nani

GMICloud, Novita, na StreamLake kila moja inashiriki jukumu tofauti katika mfumo wa miundombinu ya AI, lakini sasa zinashindana moja kwa moja kuhusu gharama ya kuendesha mifumo mikubwa ya lugha (large language models).

GMICloud inaendesha wingu la GPU lenye utendaji wa juu na inatoa orodha inayokua ya LLM zilizohifadhiwa kwa ajili ya watengenezaji wanaotaka ufikiaji wa API bila kusimamia vikundi vyao (clusters) wenyewe. Novita ilijenga sifa yake kupitia ukodishaji wa GPU wa bei nafuu na utoaji wa modeli, ikivutia wahandisi wanaopendelea modeli za open-weight kwa bei ya punguzo ikilinganishwa na bei kubwa zinazotozwa na makampuni makubwa zaidi (hyperscalers). StreamLake, iliyochipuka kutoka kwenye mfumo wa wingu na vyombo vya habari wa ByteDance, inaleta utaalamu wa miundombinu ya video katika mashindano ya inference na inatoa modeli kupitia jukwaa ambalo pia linashughulikia kazi nzito za usindikaji wa vyombo vya habari.

Hakuna hata mmoja wao ambaye ni jina maarufu kama OpenAI au Anthropic. Hiyo ndiyo sababu mabadiliko yao ya bei ni muhimu. Wapo katika ngazi ya kati ya soko yenye ushindani mkali, ambapo faida ni ndogo, punguzo ni la kawaida, na mbio za kuvutia watengenezaji ni za kila wakati. Wakati majukwaa matatu katika ngazi hii yanapobadilisha viwango vyao vya bei karibu wakati mmoja, kwa pamoja wanarekebisha kipimo cha kile ambacho kuendesha modeli za open-source au fine-tuned kinapaswa kugharimu.

Nini Kimebadilika

Maboresho hayo yaliathiri bei za matumizi ya LLM katika huduma zote tatu. Naren, akiongea kama narevbot kwenye Dev.to, aliandika maelezo mahususi katika chapisho linalochambua marekebisho ya kila modeli kwa GMICloud, Novita, na StreamLake. Unaweza kusoma ulinganisho kamili hapa.

Badala ya kutaja takwimu za senti kwa kila token ambazo zinaweza kubadilika tena kabla hujamaliza kusoma aya hii, jambo muhimu ni kwamba mabadiliko hayo ni ya kimfumo. Kila mtoa huduma uliweka upya jinsi unavyotoza kwa token, na katika baadhi ya hali, marekebisho hayo yanabadilisha ni modeli gani ni ya bei rahisi zaidi kwa kazi fulani. Hii mara chache huwa ni ongezeko au upungufu rahisi wa jumla. Mtoa huduma mmoja anaweza kupunguza bei za pembejeo (input) huku akipandisha bei za matokeo (output). Mwingine anaweza kuacha modeli ndogo za parameter bila mabadiliko lakini akapandisha viwango vya maeneo ya long-context endpoints. Kwa sababu wote watatu wanasaidia mchanganyiko tofauti wa Llama, Qwen, Mistral, na usanifu mwingine, hasara au faida inategemea kabisa ni modeli gani unayopitisha kupitia API gani.

Kwa Nini Ankara Yako Inabadilika Hata Kama Trafiki Haibadiliki

Ili kuelewa athari, angalia jinsi malipo ya LLM yanavyofanya kazi hasa. Karibu kila wakati unatozwa kando kwa token za pembejeo (input) na token za matokeo (output), na uwiano kati yao huamua gharama yako halisi. Bot ya huduma kwa wateja inayoshughulikia mazungumzo elfu kumi kwa siku inaweza kuwa na wastani wa token mbili elfu za pembejeo na token mia nne za matokeo kwa kila mazungumzo. Kwa bei mchanganyiko ya dola tatu kwa milioni moja ya token, hiyo ni takriban dola themanini na nne kwa siku. Ikiwa mtoa huduma atapandisha bei yake ya matokeo kwa asilimia ishirini tu, gharama ya kila siku itapanda hadi zaidi ya dola tisini. Katika robo mwaka, hiyo ni karibu dola elfu moja ya matumizi ya ziada kwa trafiki ile ile.

Ongeza kiwango hicho kwenye mfumo wa uzalishaji wa maudhui au mfumo wa retrieval-augmented generation unaoshughulikia mamilioni ya token kwa saa, na mtoa huduma unayechagua anakuwa kipengele muhimu sana katika bajeti yako. GMICloud, Novita, na StreamLake wanajua hili. Mabadiliko yao ya bei ni hatua za makusudi za kujipanga zinazolenga matumizi mahususi: kazi nyingi za pamoja (batch jobs), programu za mazungumzo zenye ucheleweshaji mdogo (low-latency chat applications), au kazi za muhtasari wa muktadha mrefu (long-context summarization tasks).

Ugumu unaongeza tabaka lingine. Baadhi ya majukwaa yanaongeza malipo ya chini kwa kila ombi, ada za kutokuwa na kazi (idle fees) kwa uwezo uliotengwa (provisioned throughput), au malipo ya ziada kwa ongezeko la ghafla la ombi (rate-limit bursts). Mabadiliko katika malipo ya chini ya ombi yanawadhuru watumiaji wenye matumizi madogo zaidi kuliko wale wenye matumizi makubwa. Mabadiliko katika punguzo la batch inference yanaweza kupunguza gharama ya uzalishaji wa ripoti yako ya usiku huku yakiiacha bila mabadiliko ankara yako ya API ya wakati halisi. Kusoma kichwa cha habari “updated pricing” hakutoshi. Lazima usome jedwali zima.

Jinsi ya Kuitikia Bila Kuchukua Hatua Kali Kupita Kiasi

Viwango vinapobadilika, timu nyingi za uhandisi hufanya moja kati ya makosa mawili. Ama wanapuuza mabadiliko hayo na kuhimili ongezeko la gharama kimyakimya, au wanaingia katika taharuki.