Los precios de los LLM son un objetivo móvil. Un mes, su presupuesto de inferencia se comporta exactamente como se pronosticó; al siguiente, un proveedor ajusta su tarifa por token y su gasto mensual cambia sin que pase una sola solicitud adicional. Eso es precisamente lo que acaba de suceder. GMICloud, Novita y StreamLake han actualizado los precios de sus modelos y, si ejecuta cargas de trabajo de producción —o incluso pipelines experimentales—, estas revisiones merecen un análisis profundo. No porque el mercado esté colapsando, sino porque las pequeñas diferencias en la economía de los tokens se acumulan de forma brutal cuando se procesan millones de tokens al día.
Quiénes son estos proveedores
GMICloud, Novita y StreamLake desempeñan cada uno un papel distinto en el stack de infraestructura de IA, pero ahora coinciden directamente en el coste de ejecutar modelos de lenguaje extensos.
GMICloud opera una nube de GPU de alto rendimiento y ofrece un catálogo creciente de LLM alojados para desarrolladores que desean acceso vía API sin tener que gestionar sus propios clústeres. Novita construyó su reputación en torno al alquiler de GPU asequibles y al servicio de modelos, atrayendo a ingenieros que prefieren modelos de pesos abiertos con descuento frente a las primas que cobran los mayores hiperescaladores. StreamLake, que surgió del ecosistema de medios y nube de ByteDance, aporta su experiencia en infraestructura de video a la carrera de la inferencia y ofrece modelos a través de una plataforma que también gestiona cargas de trabajo pesadas de procesamiento de medios.
Ninguno de ellos es un nombre familiar de la misma manera que OpenAI o Anthropic. Por eso mismo, sus movimientos de precios son importantes. Se sitúan en el agresivo nivel medio del mercado, donde los márgenes son estrechos, los descuentos son comunes y la carrera por atraer desarrolladores es constante. Cuando tres plataformas de este nivel cambian sus tarifas aproximadamente al mismo tiempo, restablecen colectivamente el punto de referencia de lo que debería costar ejecutar modelos de código abierto o ajustados (fine-tuned).
Qué ha cambiado
Las actualizaciones afectaron los precios de uso de LLM en los tres servicios. Naren, escribiendo como narevbot en Dev.to, documentó los detalles específicos en una publicación que desglosa los ajustes exactos modelo por modelo para GMICloud, Novita y StreamLake. Puede leer la comparación completa aquí.
En lugar de recitar cifras de centavos por token que podrían cambiar de nuevo antes de que termine de leer este párrafo, el punto crucial es que los cambios son estructurales. Cada proveedor reequilibró la forma en que cobra por los tokens y, en algunos casos, las revisiones alteran qué modelo es el más económico para una carga de trabajo determinada. Esto rara vez es un simple aumento o disminución generalizada. Un proveedor podría bajar los precios de entrada mientras sube los de salida. Otro podría dejar intactos los modelos de pocos parámetros pero aumentar las tarifas en los endpoints de contexto largo. Debido a que los tres admiten diferentes combinaciones de Llama, Qwen, Mistral y otras arquitecturas, el daño o el beneficio depende totalmente de qué modelo esté dirigiendo a través de qué API.
Por qué su factura varía incluso cuando el tráfico se mantiene estable
Para entender el impacto, observe cómo funciona realmente la facturación de los LLM. Casi siempre se le cobra por separado por los tokens de entrada y los tokens de salida, y la proporción entre ellos determina su costo efectivo. Un bot de atención al cliente que gestiona diez mil conversaciones al día podría promediar dos mil tokens de entrada y cuatrocientos tokens de salida por chat. Con un promedio combinado de tres dólares por millón de tokens, eso son aproximadamente ochenta y cuatro dólares al día. Si un proveedor aumenta su precio de salida solo un veinte por ciento, el costo diario supera los noventa dólares. En un trimestre, eso supone casi mil dólares de gasto adicional para un tráfico idéntico.
Si escala eso a un pipeline de generación de contenido o a un sistema de generación aumentada por recuperación (RAG) que gestiona millones de tokens por hora, el proveedor que elija se convierte en una partida de gasto importante. GMICloud, Novita y StreamLake lo saben. Sus cambios de precios son movimientos de posicionamiento deliberados dirigidos a casos de uso específicos: trabajos por lotes de alto volumen, aplicaciones de chat de baja latencia o tareas de resumen de contexto largo.
La complejidad añade otra capa. Algunas plataformas añaden cargos mínimos por solicitud, tarifas de inactividad por rendimiento aprovisionado o recargos por ráfagas de límite de velocidad. Un cambio en el cargo mínimo por solicitud perjudica mucho más a los usuarios de bajo volumen que a los de alto volumen. Un cambio en los descuentos de inferencia por lotes podría reducir el costo de su generación de informes nocturnos mientras deja sin cambios su factura de la API en tiempo real. Leer el titular “precios actualizados” no es suficiente. Tiene que leer la matriz.
Cómo responder sin reaccionar de forma exagerada
Cuando las tasas cambian, la mayoría de los equipos de ingeniería cometen uno de dos errores. O bien ignoran el cambio y absorben silenciosamente el sobrecosto, o entran en pánico.
