Novita hivi karibuni imesasisha bei zake za LLM. Kwa timu zinazotumia huduma ya inference kwenye jukwaa hilo, sentensi hiyo inapaswa kuchochea ukaguzi wa haraka wa matumizi yako ya sasa. Mabadiliko ya bei za API mara chache huja wakati unaofaa, na yanapofika kwenye viwango mbalimbali vya modeli, athari yake kwenye matumizi yako ya kila mwezi inaweza kuwa kubwa kuliko ilivyotarajiwa.

Kwa Nini Bei ya Inference Inastahili Kuzingatiwa

Programu nyingi za kisasa za AI hazijajengwa kwenye GPU clusters zinazosimamiwa wenyewe. Watengenezaji hutuma maombi kwa watoa huduma za inference kama Novita kwa sababu mbadala wake unahusisha kupata vifaa (hardware), kusimamia usambazaji wa vLLM au TGI, na kushughulikia "cold starts" wakati wa ongezeko la trafiki. Urahisi huo una thamani. Pia unajumuishwa kwenye malipo. Kila token inayozalishwa inaongeza bili ambayo inaendelea kukua kupitia vikao vya watumiaji, kazi za nyuma (background jobs), na zana za ndani.

Mtoa huduma anaporekebisha bei zake, athari yake huenea katika mfumo wako mzima (stack). Chatbot inayoshughulikia mazungumzo ya wateja elfu kumi kwa siku inaweza kutumia token milioni arobini za kuingiza (input tokens) na milioni kumi na mbili za kutolea (output tokens) kwa wiki moja. Ukibadilisha bei ya kila milioni hata kwa dola chache, tofauti ya kila mwezi inakuwa kubwa haraka sana. Kwa bidhaa zinazojiendesha zenyewe (bootstrapped) au timu zinazofanya kazi kwa faida ndogo, tofauti hiyo inaweza kufuta faida. Msaidizi wa uandishi wa kodi (coding assistant) unaofanya kazi kama browser extension, mfumo wa muhtasari wa batch unaofanya kazi usiku kucha, au zana ya utafutaji ya ndani inayouliza modeli kila inapofunguliwa ukurasa, vyote vina hatari hiyo hiyo. Uchumi wao wa kila kitengo (unit economics) unategemea bei kamili ya token inayofuata.

Nini Kimebadilika Kwenye Novita

Novita imetambulisha gharama mpya zinazoathiri modeli tofauti katika katalogi yake. Kampuni haijatoa ongezeko au punguzo la asilimia linalolingana kwa wote. Badala yake, marekebisho yanatofautiana kulingana na modeli, kumaanisha kuwa bili yako itabadilika kulingana na ni endpoints gani unazotumia hasa.

Ikiwa programu yako inatuma trafiki yote kupitia modeli moja ya lugha kubwa (large language model), hesabu yako ni rahisi. Linganisha bei ya zamani na mpya na utabiri hasara au akiba. Lakini mipangilio mingi ya uzalishaji (production) ni migumu zaidi. Timu mara nyingi hutumia mantiki ya uelekezaji (routing logic) inayotuma maswali rahisi kwa modeli nyepesi na kuhifadhi modeli nzito kwa kazi ngumu za kufikiri. Wengine hufanya A/B tests kwenye modeli kadhaa ili kulinganisha latency na ubora. Katika hali hizo, mabadiliko ya bei kwenye modeli moja au mbili tu yanaweza kuvuruga muundo wako mzima wa gharama.

Takwimu mahususi za kila token na kila ombi zimeainishwa katika mchanganuo wa kina uliochapishwa na Narevbot kwenye Dev.to. Unaweza kupitia orodha ya bei kamili hapa: https://dev.to/narevbot/changes-to-llm-pricing-novita-3plc

Usitegemee kumbukumbu au picha ya zamani (screenshot) iliyofichwa kwenye nyaraka zako. Chukua namba za sasa moja kwa moja kutoka kwenye chanzo hicho kabla ya kupanga bajeti yako ya robo mwaka ijayo.

Jinsi ya Kukagua Hatari Yako

Anza na data, siyo dhana. Ingia kwenye dashboard yako ya Novita na utoe historia yako ya matumizi kwa miezi miwili hadi mitatu iliyopita. Gawanya data hiyo kwa modeli na kwa aina ya operesheni. Unataka kujua ni endpoints gani zinatumia sehemu kubwa ya bajeti yako na zipi zinazozalisha token nyingi zaidi kwa kila ombi.

Angalia mifumo hii:

  • Hatari ya mkusanyiko (Concentration risk). Ikiwa asilimia sabini ya matumizi yako yanapitia modeli moja na modeli hiyo ikapata ongezeko la bei, uhitaji wako wa kuchukua hatua ni wazi. Ikiwa matumizi yako yamesambaa kwenye modeli nane na tatu kati yake zimebadilika bei, hesabu itachukua muda mrefu zaidi lakini hatari bado ipo.
  • Uongezekaji wa token (Token bloat). Angalia ikiwa maelekezo yako (prompts) yanazidi kuwa marefu kwa muktadha usiohitajika. System prompts ndefu, mifano ya "few-shot" inayojirudia, na uundaji wa XML wenye maneno mengi yote huongeza gharama za kuingiza (input costs). Sasisho la bei ni sababu nzuri ya kupunguza gharama zisizo za lazima.
  • Ufanisi mdogo wa matokeo (Output inefficiency). Ikiwa programu yako inaomba majibu marefu lakini inatumia sentensi chache tu za mwanzo, unalipia token unazozitupa. Rekebisha mipaka yako ya max_token na mfuatano wa kusimama (stop sequences).
  • Kazi za nyuma zisizofanya kazi (Idle background jobs). Kazi iliyopangwa inayozalisha ripoti au kuingiza nyaraka (embed documents) inaweza kuwa inafanya kazi mara nyingi zaidi kuliko inavyohitajika. Hakiki ratiba ya cron na ukubwa wa batch.