На этой неделе на рынке появились Qwen2.5-Max от Alibaba и V3-Flash от DeepSeek, и каждая из них выбрала свой путь к удешевлению инференса ИИ. Alibaba активирует лишь около 95 миллиардов параметров на запрос благодаря своей архитектуре Mixture-of-Experts (MoE) с общим объемом в 2,4 триллиона параметров; DeepSeek же оптимизирует архитектуру, чтобы резко снизить цену за токен. Гонка вооружений в сфере ИИ теперь измеряется долларами за токен, а не только размером модели.
От «большего количества параметров» к «меньшей стоимости»
В течение многих лет ключевым показателем в разработке больших языковых моделей (LLM) было количество параметров. OpenAI, Google и другие компании хвастались преодолением барьера в триллион параметров, полагая, что чем больше модель, тем она умнее. Alibaba и DeepSeek показывают, что правила игры изменились.
Qwen2.5-Max от Alibaba по-прежнему делает ставку на масштаб, но добавляет трюк для экономии средств. В плотной (dense) модели каждый параметр задействуется при каждом инференсе, превращая сеть из 2,4 триллиона параметров в крайне энергозатратного «зверя». MoE разделяет сеть на множество «экспертов» и направляет каждый запрос к определенному подмножеству. Роутер Qwen2.5-Max выбирает примерно 95 миллиардов параметров для любого промпта, обеспечивая логическую мощность системы с триллионом параметров, при этом удерживая задержку и энергопотребление под контролем.
DeepSeek же вовсе отказывается от амбиций по достижению триллиона параметров. Ее модель V3-Flash создана для дешевой, быстрой и масштабируемой работы. Компания позиционирует модель на основе «сверхнизкой стоимости инференса», ориентируясь на разработчиков, которые обрабатывают миллионы токенов ежедневно, не разоряясь при этом. Точная цена не разглашается, но посыл ясен: если стартап не может позволить себе западные тарифы за токен, V3-Flash становится жизнеспособной альтернативой.
Почему стоимость инференса становится конкурентным преимуществом
Стоимость инференса приобретает значение, когда модели выходят из лабораторий в промышленную эксплуатацию. Предприятия, внедряющие LLM в чат-боты, конвейеры анализа документов или рекомендательные системы, быстро обнаруживают, что ценообразование на уровне токенов доминирует в операционных расходах. Модель, которая стоит вдвое дешевле за токен, может удвоить бюджет на другие инициативы — больше данных, выше трафик или дополнительные функции.
Две китайские фирмы нацелены на разные сегменты рынка. MoE от Alibaba обещает высокую производительность для сложных задач, требующих глубоких рассуждений, сохраняя при этом умеренный бюджет на вычисления для каждого запроса. Тем временем более легкая модель DeepSeek привлекает высоконагруженные рабочие процессы, чувствительные к задержкам, где «грубая сила» менее важна, чем предсказуемая стоимость.
Обе стратегии могут потеснить западных провайдеров, которые предлагают крупные модели по премиальным ценам. Если разработчики смогут достичь сопоставимых результатов при более низкой цене за токен, стимул оставаться на дорогих API ослабнет.
Ставки для глобальной экосистемы ИИ
- Стартапы и малый/средний бизнес: Низкая стоимость инференса снижает порог входа для продуктов на базе ИИ. Команды, которым раньше требовался дополнительный капитал для оплаты счетов за API, теперь могут создавать прототипы и запускать продукты с более ограниченным бюджетом.
- Крупные предприятия: Корпорации, использующие внутренние ИИ-сервисы, могут сократить операционные расходы, высвобождая средства для сбора данных, дообучения моделей или дополнительных вычислительных мощностей.
- Западные провайдеры: Их модели доходов основаны на оплате за каждый токен. Сдвиг в сторону альтернатив, ориентированных на стоимость, вынуждает их снижать цены или дифференцироваться за счет возможностей, с которыми более дешевые модели пока не могут сравниться.
- Регуляторы и политики: Более доступный ИИ может ускорить его внедрение в различных секторах, что поднимет вопросы надзора, конфиденциальности данных и темпов автоматизации.
Компромиссы и контраргументы
Модели MoE, такие как Qwen2.5-Max, не являются «бесплатным обедом». Логика маршрутизации усложняет инженерную часть, а разреженная активация может приводить к неравномерной производительности для разных типов запросов. Если роутер ошибется, запрос может быть направлен к неоптимальным экспертам, что снизит качество ответа. Более того, аппаратное обеспечение все еще отдает предпочтение плотным вычислениям; специализированные ускорители для инференса MoE пока не распространены, что может ограничить реальный прирост эффективности.
Философия DeepSeek, ориентированная прежде всего на стоимость, также несет в себе риски. Агрессивное ценообразование часто означает более жесткие ограничения на размер модели и объем обучающих данных, что потенциально ограничивает производительность. Для приложений, требующих тонких рассуждений, более дешевая модель может оказаться недостаточно эффективной, заставляя пользователей возвращаться к более крупным и дорогим альтернативам.
Наконец, «интеллект на доллар» — это лишь одна из осей конкуренции. Задержка, надежность, поддержка экосистемы и соответствие региональным нормам остаются решающими факторами. Компании, которые предложат сбалансированный пакет по всем этим направлениям, скорее всего, будут доминировать, а не только те, кто выиграет ценовую войну.
За чем следить дальше
- Результаты бенчмарков: Независимые оценки эффективности маршрутизации MoE в Qwen2.5-Max и стоимости токена в V3-Flash покажут, превращается ли хайп в реальную измеримую экономию.
- Развитие аппаратного обеспечения: Внедрение ускорителей, оптимизированных для разреженной активации (sparse activation), может усилить преимущества MoE, в то время как универсальные GPU могут позволить плотным (dense) моделям сохранять конкурентоспособность.
- Реакция на ценообразование: Западные провайдеры могут скорректировать свои тарифные планы или добавить функции для снижения затрат, такие как скидки на пакетный инференс (batch inference) или on-premise лицензирование.
- Регуляторные инициативы: По мере распространения более дешевого ИИ правительства могут внедрять стандарты прозрачности и безопасности, что может повлиять на масштабируемое развертывание этих моделей.
Итог
Модель Qwen2.5-Max от Alibaba на базе MoE и бюджетная V3-Flash от DeepSeek показывают, что гонка ИИ теперь зависит от бюджета не меньше, чем от количества параметров. Компании, которые обеспечат сложные языковые возможности при низкой стоимости токена, сделают ИИ доступным для более широкого круга пользователей, меняя динамику конкуренции, которая долгое время играла на руку самым крупным и дорогим моделям.
