LLM-prijzen zijn een bewegend doelwit. De ene maand gedraagt je inference-budget zich precies zoals voorspeld; de volgende maand past een provider zijn tarief per token aan en verschuift je maandelijkse uitgaven zonder dat er ook maar één extra verzoek is verwerkt. Dat is precies wat er onlangs is gebeurd. GMICloud, Novita en StreamLake hebben allemaal hun modelprijzen bijgewerkt, en als je productiewerkbelastingen — of zelfs experimentele pipelines — draait, verdienen deze revisies een kritische blik. Niet omdat de markt instort, maar omdat kleine verschillen in token-economie meedogenloos opstapelen wanneer je miljoenen tokens per dag verwerkt.
Wie deze providers zijn
GMICloud, Novita en StreamLake spelen elk een eigen rol in de AI-infrastructuurstack, maar ze overlappen elkaar nu direct op de kosten van het draaien van large language models.
GMICloud beheert een high-performance GPU-cloud en biedt een groeiende catalogus van gehoste LLM's voor ontwikkelaars die API-toegang willen zonder hun eigen clusters te beheren. Novita heeft zijn reputatie opgebouwd rond betaalbare GPU-verhuur en model-serving, waardoor ingenieurs worden aangetrokken die de voorkeur geven aan open-weight modellen met een korting ten opzichte van de premies die de grootste hyperscalers vragen. StreamLake, dat voortkwam uit het cloud- en media-ecosysteem van ByteDance, brengt expertise in video-infrastructuur naar de inference-race en levert modellen via een platform dat ook zware mediaverwerkingswerkbelastingen afhandelt.
Geen van hen is een bekende naam zoals OpenAI of Anthropic. Dat is precies waarom hun prijsaanpassingen ertoe doen. Ze bevinden zich in het agressieve middensegment van de markt, waar de marges dun zijn, kortingen gebruikelijk zijn en de race om ontwikkelaars aan te trekken constant is. Wanneer drie platforms in dit segment hun tarieven ongeveer op hetzelfde moment wijzigen, herstellen ze collectief de benchmark voor wat het draaien van open-source of fine-tuned modellen zou moeten kosten.
Wat er is veranderd
De updates hebben de prijzen voor LLM-gebruik bij alle drie de services beïnvloed. Naren, schrijvend als narevbot op Dev.to, documenteerde de details in een bericht waarin de exacte model-voor-model aanpassingen voor GMICloud, Novita en StreamLake worden uiteengezet. Je kunt de volledige vergelijking hier lezen.
In plaats van cent-per-token-cijfers op te noemen die mogelijk weer veranderen voordat je deze paragraaf hebt uitgelezen, is het cruciale punt dat de wijzigingen structureel zijn. Elke provider heeft de manier waarop tokens in rekening worden gebracht opnieuw in evenwicht gebracht, en in sommige gevallen veranderen de revisies welk model het goedkoopst is voor een bepaalde werklast. Dit is zelden een eenvoudige algemene verhoging of verlaging. De ene provider kan de prijzen voor input verlagen terwijl de prijzen voor output stijgen. Een andere provider kan modellen met weinig parameters ongemoeid laten, maar de tarieven voor long-context endpoints verhogen. Omdat alle drie de providers verschillende combinaties van Llama, Qwen, Mistral en andere architecturen ondersteunen, hangt de schade of het voordeel volledig af van welk model je via welke API routeert.
Waarom je factuur stijgt, zelfs als het verkeer gelijk blijft
Om de impact te begrijpen, moet je kijken naar hoe LLM-facturering eigenlijk werkt. Je wordt bijna altijd apart gefactureerd voor input-tokens en output-tokens, en de verhouding daartussen bepaalt je effectieve kosten. Een klantenservicebot die tienduizend gesprekken per dag afhandelt, gebruikt gemiddeld tweeduizend input-tokens en vierhonderd output-tokens per chat. Bij een gecombineerd tarief van drie dollar per miljoen tokens is dat ongeveer vierentachtig dollar per dag. Als een provider de prijs voor output met slechts twintig procent verhoogt, stijgen de dagelijkse kosten naar meer dan negentig dollar. Over een kwartaal is dat bijna duizend dollar aan extra uitgaven voor exact hetzelfde verkeer.
Schaal dit op naar een pipeline voor contentgeneratie of een retrieval-augmented generation-systeem dat miljoenen tokens per uur verwerkt, en de provider die je kiest wordt een serieuze kostenpost. GMICloud, Novita en StreamLake weten dit. Hun prijsveranderingen zijn bewuste positioneringsacties gericht op specifieke use cases: batchjobs met een hoog volume, chatapplicaties met een lage latentie of samenvattingsopdrachten met een lange context.
Complexiteit voegt nog een extra laag toe. Sommige platforms rekenen minimale kosten per verzoek, idle fees voor provisioned throughput, of toeslagen voor rate-limit bursts. Een wijziging in de minimale kosten per verzoek raakt gebruikers met een laag volume veel harder dan gebruikers met een hoog volume. Een verschuiving in kortingen voor batch-inference kan de kosten van je nachtelijke rapportage verlagen, terwijl je factuur voor de real-time API ongewijzigd blijft. Alleen de kop "bijgewerkte prijzen" lezen is niet genoeg. Je moet de matrix lezen.
Hoe te reageren zonder over te reageren
Wanneer tarieven veranderen, maken de meeste engineeringteams een van de twee fouten. Ze negeren de verandering en vangen de kostenoverschrijding stilletjes op, of ze raken in paniek
