Цены на LLM — это постоянно меняющаяся величина. В один месяц ваш бюджет на инференс ведет себя именно так, как было спрогнозировано; в следующий — провайдер корректирует тариф за токен, и ваши ежемесячные расходы меняются, хотя количество запросов осталось прежним. Именно это только что и произошло. GMICloud, Novita и StreamLake обновили цены на свои модели, и если вы запускаете рабочие нагрузки в продакшене — или даже экспериментальные пайплайны — эти изменения заслуживают пристального внимания. Не потому, что рынок рушится, а потому, что незначительные различия в экономике токенов превращаются в огромные суммы, когда вы обрабатываете миллионы токенов в день.
Кто эти провайдеры
GMICloud, Novita и StreamLake играют разные роли в стеке ИИ-инфраструктуры, но теперь они напрямую конкурируют в стоимости запуска больших языковых моделей.
GMICloud управляет высокопроизводительным GPU-облаком и предлагает растущий каталог хостинговых LLM для разработчиков, которым нужен доступ через API без необходимости управлять собственными кластерами. Novita заработала репутацию благодаря доступной аренде GPU и обслуживанию моделей (model serving), привлекая инженеров, которые предпочитают модели с открытыми весами (open-weight models) со скидкой по сравнению с высокими ценами крупнейших гиперскейлеров. StreamLake, выросшая из облачной и медийной экосистемы ByteDance, привносит опыт работы с видеоинфраструктурой в гонку инференса и предоставляет доступ к моделям через платформу, которая также справляется с тяжелыми нагрузками по обработке медиаданных.
Ни один из них не является брендом, известным каждому, как OpenAI или Anthropic. Именно поэтому их изменения в ценообразовании так важны. Они занимают агрессивный средний сегмент рынка, где маржа невелика, скидки — обычное дело, а борьба за привлечение разработчиков идет непрерывно. Когда три платформы в этом сегменте меняют свои тарифные сетки примерно в одно и то же время, они коллективно устанавливают новый ориентир того, сколько должно стоить использование моделей с открытым исходным кодом или дообученных (fine-tuned) моделей.
Что изменилось
Обновления затронули стоимость использования LLM во всех трех сервисах. Нарен (Naren), пишущий под ником narevbot на Dev.to, задокументировал детали в посте, где подробно разобраны изменения цен для каждой модели GMICloud, Novita и StreamLake. Вы можете прочитать полное сравнение здесь.
Вместо того чтобы перечислять цифры в центах за токен, которые могут снова измениться, пока вы дочитаете этот абзац, важно понимать следующее: изменения носят структурный характер. Каждый провайдер пересмотрел принципы тарификации токенов, и в некоторых случаях эти правки меняют то, какая модель является самой дешевой для конкретной задачи. Это редко бывает простым повсеместным повышением или понижением цен. Один провайдер может снизить цены на входные токены (input tokens), одновременно повысив цены на выходные (output tokens). Другой может оставить без изменений модели с малым количеством параметров, но поднять тарифы на эндпоинты с длинным контекстом. Поскольку все три платформы поддерживают различные комбинации Llama, Qwen, Mistral и других архитектур, выгода или убытки будут полностью зависеть от того, какую модель вы направляете через какой API.
Почему ваш счет растет, даже если трафик не изменился
Чтобы понять масштаб последствий, посмотрите, как на самом деле работает биллинг LLM. Как правило, плата за входные и выходные токены взимается отдельно, и соотношение между ними определяет вашу эффективную стоимость. Бот службы поддержки, обрабатывающий десять тысяч диалогов в день, может тратить в среднем две тысячи входных токенов и четыреста выходных токенов на чат. При смешанной цене в три доллара за миллион токенов это составит примерно восемьдесят четыре доллара в день. Если провайдер поднимет цену на выходные токены всего на двадцать процентов, ежедневные расходы вырастут до более чем девяноста долларов. За квартал это составит почти тысячу долларов дополнительных расходов при идентичном трафике.
Масштабируйте это на конвейер генерации контента или систему RAG (retrieval-augmented generation), обрабатывающую миллионы токенов в час, и выбранный провайдер станет серьезной статьей расходов. GMICloud, Novita и StreamLake знают об этом. Их изменения в ценообразовании — это продуманные шаги по позиционированию, нацеленные на конкретные сценарии использования: высокообъемные пакетные задачи, чат-приложения с низкой задержкой или задачи суммаризации с длинным контекстом.
Сложность добавляет еще один уровень. Некоторые платформы вводят минимальную плату за запрос, плату за простой (idle fees) при выделенной пропускной способности или наценки за всплески запросов сверх лимита (rate-limit bursts). Изменение минимальной платы за запрос сильнее бьет по пользователям с малым объемом трафика, чем по крупным клиентам. Сдвиг в скидках на пакетный (batch) инференс может снизить стоимость вашей ночной генерации отчетов, оставив счет за API в реальном времени без изменений. Прочитать заголовок «обновление цен» недостаточно. Вам нужно изучить всю матрицу.
Как реагировать, не поддаваясь панике
Когда меняются ставки, большинство инженерных команд совершают одну из двух ошибок. Они либо игнорируют изменения и молча принимают на себя перерасход бюджета, либо впадают в панику.
