LLM ధరలు నిరంతరం మారుతూ ఉంటాయి. ఒక నెలలో మీ ఇన్ఫరెన్స్ బడ్జెట్ అంచనా వేసినట్లుగానే ఉంటుంది; మరుసటి నెలలో, ఒక ప్రొవైడర్ తన పర్-టోకెన్ రేటును సర్దుబాటు చేస్తే, ఒక్క అదనపు రిక్వెస్ట్ కూడా రాకపోయినా మీ నెలవారీ ఖర్చు మారిపోతుంది. సరిగ్గా ఇదే ఇప్పుడు జరిగింది. GMICloud, Novita, మరియు StreamLake అన్నీ తమ మోడల్ ధరలను అప్డేట్ చేశాయి. మీరు ప్రొడక్షన్ వర్క్లోడ్లను—లేదా ప్రయోగాత్మక పైప్లైన్లను—నడుపుతుంటే, ఈ మార్పులను నిశితంగా పరిశీలించాల్సి ఉంటుంది. మార్కెట్ కుప్పకూలిపోతున్నందున కాదు, కానీ మీరు రోజుకు మిలియన్ల కొద్దీ టోకెన్లను ప్రాసెస్ చేస్తున్నప్పుడు, టోకెన్ ఎకనామిక్స్లో వచ్చే చిన్న తేడాలు కూడా భారీగా ప్రభావం చూపుతాయి.
ఈ ప్రొవైడర్లు ఎవరు
AI ఇన్ఫ్రాస్ట్రక్చర్ స్టాక్లో GMICloud, Novita, మరియు StreamLake 각각 ఒక ప్రత్యేక పాత్ర పోషిస్తాయి, కానీ ఇప్పుడు లార్జ్ లాంగ్వేజ్ మోడల్స్ను నడపడానికి అయ్యే ఖర్చు విషయంలో ఇవి నేరుగా ఒకదానితో ఒకటి పోటీపడుతున్నాయి.
GMICloud ఒక హై-పెర్ఫార్మెన్స్ GPU క్లౌడ్ను నిర్వహిస్తుంది మరియు తమ సొంత క్లస్టర్లను నిర్వహించకుండా API యాక్సెస్ కావాలనుకునే డెవలపర్ల కోసం హోస్టెడ్ LLMల యొక్క విస్తృతమైన జాబితాను అందిస్తుంది. Novita తక్కువ ధరకే GPU రెంటల్స్ మరియు మోడల్ సర్వింగ్తో పేరు పొందింది, ఇది పెద్ద హైపర్స్కేలర్లు వసూలు చేసే ప్రీమియం ధరల కంటే తక్కువ ధరకు ఓపెన్-వెయిట్ మోడల్స్ను కోరుకునే ఇంజనీర్లను ఆకర్షిస్తోంది. ByteDance యొక్క క్లౌడ్ మరియు మీడియా ఎకోసిస్టమ్ నుండి ఉద్భవించిన StreamLake, ఇన్ఫరెన్స్ రేసులోకి వీడియో ఇన్ఫ్రాస్ట్రక్చర్ నైపుణ్యాన్ని తీసుకువస్తుంది మరియు భారీ మీడియా ప్రాసెసింగ్ వర్క్లోడ్లను కూడా నిర్వహించే ప్లాట్ఫారమ్ ద్వారా మోడల్స్ను అందిస్తుంది.
OpenAI లేదా Anthropic లాగా వీరు అందరికీ తెలిసిన పేర్లు కాకపోవచ్చు. అందుకే వీరి ధరల మార్పులు చాలా ముఖ్యం. వీరు మార్కెట్లో పోటీతత్వంతో కూడిన మిడిల్ టియర్లో ఉంటారు, ఇక్కడ లాభాల మార్జిన్లు తక్కువగా ఉంటాయి, డిస్కౌంట్లు సాధారణం, మరియు డెవలపర్లను ఆకర్షించడానికి నిరంతరం పోటీ ఉంటుంది. ఈ టియర్లోని మూడు ప్లాట్ఫారమ్లు దాదాపు ఒకే సమయంలో తమ రేట్ కార్డ్లను మార్చినప్పుడు, ఓపెన్-సోర్స్ లేదా ఫైన్-ట్యూన్డ్ మోడల్స్ను నడపడానికి అయ్యే ఖర్చుకు సంబంధించి ఒక కొత్త బెంచ్మార్క్ను అవి సృష్టించాయి.
ఏమి మారింది
ఈ అప్డేట్లు మూడు సర్వీసులలోని LLM వినియోగ ధరలను ప్రభావితం చేశాయి. Dev.toలో narevbot పేరుతో రాసిన నరేన్, GMICloud, Novita, మరియు StreamLake కోసం మోడల్ వారీగా జరిగిన ఖచ్చితమైన సర్దుబాటులను ఒక పోస్ట్లో వివరించారు. మీరు పూర్తి పోలికను ఇక్కడ చదవవచ్చు.
మీరు ఈ పేరాగ్రాఫ్ను చదవడం పూర్తి చేసేలోపే మళ్ళీ మారిపోయే సెంట్-పర్-టోకెన్ గణాంకాలను చెప్పడం కంటే, ఈ మార్పులు నిర్మాణాత్మకమైనవి (structural) అనేదే ముఖ్యమైన విషయం. ప్రతి ప్రొవైడర్ టోకెన్ల కోసం వసూలు చేసే విధానాన్ని పునఃసమీక్షించింది, మరియు కొన్ని సందర్భాల్లో ఈ మార్పులు ఒక నిర్దిష్ట వర్క్లోడ్కు ఏ మోడల్ తక్కువ ధరలో లభిస్తుందో మారుస్తాయి. ఇది అరుదుగా అన్నింటికీ ఒకేలా పెరగడం లేదా తగ్గడం వంటిది కాదు. ఒక ప్రొవైడర్ ఇన్పుట్ ధరలను తగ్గించి, అవుట్పుట్ ధరలను పెంచవచ్చు. మరొకరు చిన్న పారామీటర్ మోడల్స్ను అలాగే ఉంచి, లాంగ్-కాంటెక్స్ట్ ఎండ్పాయింట్ల రేట్లను పెంచవచ్చు. ఈ మూడు కూడా Llama, Qwen, Mistral మరియు ఇతర ఆర్కిటెక్చర్ల వివిధ కాంబినేషన్లను సపోర్ట్ చేస్తారు కాబట్టి, మీకు కలిగే నష్టం లేదా లాభం మీరు ఏ మోడల్ను ఏ API ద్వారా ఉపయోగిస్తున్నారు అనే దానిపై పూర్తిగా ఆధారపడి ఉంటుంది.
ట్రాఫిక్ మారకపోయినా మీ బిల్లు ఎందుకు పెరుగుతుంది
దీని ప్రభావాన్ని అర్థం చేసుకోవడానికి, LLM బిల్లింగ్ నిజంగా ఎలా పనిచేస్తుందో చూడండి. మీకు ఇన్పుట్ టోకెన్లు మరియు అవుట్పుట్ టోకెన్ల కోసం దాదాపు ఎప్పుడూ విడివిడిగా ఛార్జ్ చేస్తారు, మరియు వాటి మధ్య నిష్పత్తి మీ అసలు ఖర్చును నిర్ణయిస్తుంది. రోజుకు పది వేల సంభాషణలను నిర్వహించే కస్టమర్ సపోర్ట్ బాట్, ప్రతి చాట్కు సగటున రెండు వేల ఇన్పుట్ టోకెన్లు మరియు నాలుగు వందల అవుట్పుట్ టోకెన్లను ఉపయోగించవచ్చు. మిలియన్ టోకెన్లకు సగటున మూడు డాలర్ల రేటుతో చూస్తే, అది రోజుకు సుమారు ఎనభై నాలుగు డాలర్లు అవుతుంది. ఒక ప్రొవైడర్ తన అవుట్పుట్ ధరను కేవలం ఇరవై శాతం పెంచినా, రోజువారీ ఖర్చు తొంభై డాలర్ల కంటే ఎక్కువ అవుతుంది. మూడు నెలల కాలంలో, అదే ట్రాఫిక్ కోసం ఇది దాదాపు వెయ్యి డాలర్ల అదనపు ఖర్చు అవుతుంది.
దీనిని గంటకు మిలియన్ల కొద్దీ టోకెన్లను నిర్వహించే కంటెంట్ జనరేషన్ పైప్లైన్ లేదా రిట్రీవల్-ఆగ్మెంటెడ్ జనరేషన్ (RAG) సిస్టమ్కు వర్తింపజేస్తే, మీరు ఎంచుకునే ప్రొవైడర్ మీ ఖర్చులో ఒక ప్రధాన అంశం అవుతుంది. GMICloud, Novita, మరియు StreamLake దీనిని తెలుసు. వారి ధరల మార్పులు నిర్దిష్ట వినియోగ సందర్భాలను (use cases) లక్ష్యంగా చేసుకున్న ఉద్దేశపూర్వక వ్యూహాలు: అధిక పరిమాణంలో ఉండే బ్యాచ్ జాబ్స్, తక్కువ లాటెన్సీ కలిగిన చాట్ అప్లికేషన్లు, లేదా లాంగ్-కాంటెక్స్ట్ సమ్మరైజేషన్ టాస్క్లు.
సంక్లిష్టత దీనికి మరో పొరను జోడిస్తుంది. కొన్ని ప్లాట్ఫారమ్లు ప్రతి రిక్వెస్ట్కు కనీస ఛార్జీలు (minimum charges), ప్రొవిజన్డ్ త్రూపుట్ కోసం ఐడిల్ ఫీజులు (idle fees), లేదా రేట్-లిమిట్ బర్స్ట్ల కోసం సర్ఛార్జీలను జోడిస్తాయి. కనీస రిక్వెస్ట్ ఛార్జీలో మార్పు వల్ల తక్కువ వాల్యూమ్ ఉన్న వినియోగదారులు, ఎక్కువ వాల్యూమ్ ఉన్నవారి కంటే ఎక్కువగా నష్టపోతారు. బ్యాచ్ ఇన్ఫరెన్స్ డిస్కౌంట్లలో మార్పు వల్ల మీ నైట్లీ రిపోర్ట్ జనరేషన్ ఖర్చు తగ్గొచ్చు, కానీ మీ రియల్-టైమ్ API బిల్లులో మార్పు ఉండకపోవచ్చు. కేవలం “అప్డేటెడ్ ప్రైసింగ్” అనే హెడ్లైన్ చదవడం సరిపోదు. మీరు పూర్తి వివరాలను (the matrix) లోతుగా చదవాలి.
అతిగా స్పందించకుండా ఎలా స్పందించాలి
రేట్లు మారినప్పుడు, చాలా ఇంజనీరింగ్ బృందాలు రెండు రకాల తప్పులలో ఏదో ఒకటి చేస్తాయి. అవి ఆ మార్పును విస్మరించి, పెరిగిన ఖర్చును నిశ్శబ్దంగా భరిస్తాయి లేదా కంగారు పడతాయి.
