LLM ధరలు నిరంతరం మారుతూ ఉంటాయి. ఒక నెలలో మీ ఇన్ఫరెన్స్ బడ్జెట్ అంచనా వేసినట్లుగానే ఉంటుంది; మరుసటి నెలలో, ఒక ప్రొవైడర్ తన పర్-టోకెన్ రేటును సర్దుబాటు చేస్తే, ఒక్క అదనపు రిక్వెస్ట్ కూడా రాకపోయినా మీ నెలవారీ ఖర్చు మారిపోతుంది. సరిగ్గా ఇదే ఇప్పుడు జరిగింది. GMICloud, Novita, మరియు StreamLake అన్నీ తమ మోడల్ ధరలను అప్‌డేట్ చేశాయి. మీరు ప్రొడక్షన్ వర్క్‌లోడ్‌లను—లేదా ప్రయోగాత్మక పైప్‌లైన్‌లను—నడుపుతుంటే, ఈ మార్పులను నిశితంగా పరిశీలించాల్సి ఉంటుంది. మార్కెట్ కుప్పకూలిపోతున్నందున కాదు, కానీ మీరు రోజుకు మిలియన్ల కొద్దీ టోకెన్లను ప్రాసెస్ చేస్తున్నప్పుడు, టోకెన్ ఎకనామిక్స్‌లో వచ్చే చిన్న తేడాలు కూడా భారీగా ప్రభావం చూపుతాయి.

ఈ ప్రొవైడర్లు ఎవరు

AI ఇన్‌ఫ్రాస్ట్రక్చర్ స్టాక్‌లో GMICloud, Novita, మరియు StreamLake 각각 ఒక ప్రత్యేక పాత్ర పోషిస్తాయి, కానీ ఇప్పుడు లార్జ్ లాంగ్వేజ్ మోడల్స్‌ను నడపడానికి అయ్యే ఖర్చు విషయంలో ఇవి నేరుగా ఒకదానితో ఒకటి పోటీపడుతున్నాయి.

GMICloud ఒక హై-పెర్ఫార్మెన్స్ GPU క్లౌడ్‌ను నిర్వహిస్తుంది మరియు తమ సొంత క్లస్టర్‌లను నిర్వహించకుండా API యాక్సెస్ కావాలనుకునే డెవలపర్‌ల కోసం హోస్టెడ్ LLMల యొక్క విస్తృతమైన జాబితాను అందిస్తుంది. Novita తక్కువ ధరకే GPU రెంటల్స్ మరియు మోడల్ సర్వింగ్‌తో పేరు పొందింది, ఇది పెద్ద హైపర్‌స్కేలర్లు వసూలు చేసే ప్రీమియం ధరల కంటే తక్కువ ధరకు ఓపెన్-వెయిట్ మోడల్స్‌ను కోరుకునే ఇంజనీర్లను ఆకర్షిస్తోంది. ByteDance యొక్క క్లౌడ్ మరియు మీడియా ఎకోసిస్టమ్ నుండి ఉద్భవించిన StreamLake, ఇన్ఫరెన్స్ రేసులోకి వీడియో ఇన్‌ఫ్రాస్ట్రక్చర్ నైపుణ్యాన్ని తీసుకువస్తుంది మరియు భారీ మీడియా ప్రాసెసింగ్ వర్క్‌లోడ్‌లను కూడా నిర్వహించే ప్లాట్‌ఫారమ్ ద్వారా మోడల్స్‌ను అందిస్తుంది.

OpenAI లేదా Anthropic లాగా వీరు అందరికీ తెలిసిన పేర్లు కాకపోవచ్చు. అందుకే వీరి ధరల మార్పులు చాలా ముఖ్యం. వీరు మార్కెట్‌లో పోటీతత్వంతో కూడిన మిడిల్ టియర్‌లో ఉంటారు, ఇక్కడ లాభాల మార్జిన్లు తక్కువగా ఉంటాయి, డిస్కౌంట్లు సాధారణం, మరియు డెవలపర్‌లను ఆకర్షించడానికి నిరంతరం పోటీ ఉంటుంది. ఈ టియర్‌లోని మూడు ప్లాట్‌ఫారమ్‌లు దాదాపు ఒకే సమయంలో తమ రేట్ కార్డ్‌లను మార్చినప్పుడు, ఓపెన్-సోర్స్ లేదా ఫైన్-ట్యూన్డ్ మోడల్స్‌ను నడపడానికి అయ్యే ఖర్చుకు సంబంధించి ఒక కొత్త బెంచ్‌మార్క్‌ను అవి సృష్టించాయి.

ఏమి మారింది

ఈ అప్‌డేట్‌లు మూడు సర్వీసులలోని LLM వినియోగ ధరలను ప్రభావితం చేశాయి. Dev.toలో narevbot పేరుతో రాసిన నరేన్, GMICloud, Novita, మరియు StreamLake కోసం మోడల్ వారీగా జరిగిన ఖచ్చితమైన సర్దుబాటులను ఒక పోస్ట్‌లో వివరించారు. మీరు పూర్తి పోలికను ఇక్కడ చదవవచ్చు.

మీరు ఈ పేరాగ్రాఫ్‌ను చదవడం పూర్తి చేసేలోపే మళ్ళీ మారిపోయే సెంట్-పర్-టోకెన్ గణాంకాలను చెప్పడం కంటే, ఈ మార్పులు నిర్మాణాత్మకమైనవి (structural) అనేదే ముఖ్యమైన విషయం. ప్రతి ప్రొవైడర్ టోకెన్ల కోసం వసూలు చేసే విధానాన్ని పునఃసమీక్షించింది, మరియు కొన్ని సందర్భాల్లో ఈ మార్పులు ఒక నిర్దిష్ట వర్క్‌లోడ్‌కు ఏ మోడల్ తక్కువ ధరలో లభిస్తుందో మారుస్తాయి. ఇది అరుదుగా అన్నింటికీ ఒకేలా పెరగడం లేదా తగ్గడం వంటిది కాదు. ఒక ప్రొవైడర్ ఇన్‌పుట్ ధరలను తగ్గించి, అవుట్‌పుట్ ధరలను పెంచవచ్చు. మరొకరు చిన్న పారామీటర్ మోడల్స్‌ను అలాగే ఉంచి, లాంగ్-కాంటెక్స్ట్ ఎండ్‌పాయింట్ల రేట్లను పెంచవచ్చు. ఈ మూడు కూడా Llama, Qwen, Mistral మరియు ఇతర ఆర్కిటెక్చర్‌ల వివిధ కాంబినేషన్లను సపోర్ట్ చేస్తారు కాబట్టి, మీకు కలిగే నష్టం లేదా లాభం మీరు ఏ మోడల్‌ను ఏ API ద్వారా ఉపయోగిస్తున్నారు అనే దానిపై పూర్తిగా ఆధారపడి ఉంటుంది.

ట్రాఫిక్ మారకపోయినా మీ బిల్లు ఎందుకు పెరుగుతుంది

దీని ప్రభావాన్ని అర్థం చేసుకోవడానికి, LLM బిల్లింగ్ నిజంగా ఎలా పనిచేస్తుందో చూడండి. మీకు ఇన్‌పుట్ టోకెన్లు మరియు అవుట్‌పుట్ టోకెన్ల కోసం దాదాపు ఎప్పుడూ విడివిడిగా ఛార్జ్ చేస్తారు, మరియు వాటి మధ్య నిష్పత్తి మీ అసలు ఖర్చును నిర్ణయిస్తుంది. రోజుకు పది వేల సంభాషణలను నిర్వహించే కస్టమర్ సపోర్ట్ బాట్, ప్రతి చాట్‌కు సగటున రెండు వేల ఇన్‌పుట్ టోకెన్లు మరియు నాలుగు వందల అవుట్‌పుట్ టోకెన్లను ఉపయోగించవచ్చు. మిలియన్ టోకెన్లకు సగటున మూడు డాలర్ల రేటుతో చూస్తే, అది రోజుకు సుమారు ఎనభై నాలుగు డాలర్లు అవుతుంది. ఒక ప్రొవైడర్ తన అవుట్‌పుట్ ధరను కేవలం ఇరవై శాతం పెంచినా, రోజువారీ ఖర్చు తొంభై డాలర్ల కంటే ఎక్కువ అవుతుంది. మూడు నెలల కాలంలో, అదే ట్రాఫిక్ కోసం ఇది దాదాపు వెయ్యి డాలర్ల అదనపు ఖర్చు అవుతుంది.

దీనిని గంటకు మిలియన్ల కొద్దీ టోకెన్లను నిర్వహించే కంటెంట్ జనరేషన్ పైప్‌లైన్ లేదా రిట్రీవల్-ఆగ్మెంటెడ్ జనరేషన్ (RAG) సిస్టమ్‌కు వర్తింపజేస్తే, మీరు ఎంచుకునే ప్రొవైడర్ మీ ఖర్చులో ఒక ప్రధాన అంశం అవుతుంది. GMICloud, Novita, మరియు StreamLake దీనిని తెలుసు. వారి ధరల మార్పులు నిర్దిష్ట వినియోగ సందర్భాలను (use cases) లక్ష్యంగా చేసుకున్న ఉద్దేశపూర్వక వ్యూహాలు: అధిక పరిమాణంలో ఉండే బ్యాచ్ జాబ్స్, తక్కువ లాటెన్సీ కలిగిన చాట్ అప్లికేషన్లు, లేదా లాంగ్-కాంటెక్స్ట్ సమ్మరైజేషన్ టాస్క్‌లు.

సంక్లిష్టత దీనికి మరో పొరను జోడిస్తుంది. కొన్ని ప్లాట్‌ఫారమ్‌లు ప్రతి రిక్వెస్ట్‌కు కనీస ఛార్జీలు (minimum charges), ప్రొవిజన్డ్ త్రూపుట్ కోసం ఐడిల్ ఫీజులు (idle fees), లేదా రేట్-లిమిట్ బర్స్ట్‌ల కోసం సర్ఛార్జీలను జోడిస్తాయి. కనీస రిక్వెస్ట్ ఛార్జీలో మార్పు వల్ల తక్కువ వాల్యూమ్ ఉన్న వినియోగదారులు, ఎక్కువ వాల్యూమ్ ఉన్నవారి కంటే ఎక్కువగా నష్టపోతారు. బ్యాచ్ ఇన్ఫరెన్స్ డిస్కౌంట్లలో మార్పు వల్ల మీ నైట్లీ రిపోర్ట్ జనరేషన్ ఖర్చు తగ్గొచ్చు, కానీ మీ రియల్-టైమ్ API బిల్లులో మార్పు ఉండకపోవచ్చు. కేవలం “అప్‌డేటెడ్ ప్రైసింగ్” అనే హెడ్‌లైన్ చదవడం సరిపోదు. మీరు పూర్తి వివరాలను (the matrix) లోతుగా చదవాలి.

అతిగా స్పందించకుండా ఎలా స్పందించాలి

రేట్లు మారినప్పుడు, చాలా ఇంజనీరింగ్ బృందాలు రెండు రకాల తప్పులలో ఏదో ఒకటి చేస్తాయి. అవి ఆ మార్పును విస్మరించి, పెరిగిన ఖర్చును నిశ్శబ్దంగా భరిస్తాయి లేదా కంగారు పడతాయి.