Июньский отчет Vercel о доле токенов показывает, что модели с открытыми весами обрабатывают 29 % токенов через шлюз, по сравнению с 11 % в апреле, при этом одна только DeepSeek обеспечила 22,6 % этого объема. Такой скачок сигнализирует о стремительном сдвиге: разработчики отказываются от поиска одной «лучшей» модели и начинают относиться к моделям ИИ как к маршрутизируемой инфраструктуре.

Почему разработчики относятся к моделям как к инфраструктуре

Дешевые модели с открытыми весами — многие из которых предоставляются китайскими провайдерами — стоят лишь малую часть от цены премиальных решений, таких как Anthropic. Для рутинных задач, таких как извлечение кода, очистка текста или простой поиск данных, модель, которая стоит центы вместо долларов, может быть более привлекательной, даже если она на несколько процентов менее точна.

Результатом становится новый паттерн проектирования. Приложение сначала отправляет запрос недорогой модели для выполнения «скучной» части работы. Если результат проходит простую проверку качества, конвейер продолжается; если нет — вызывается более дорогая модель для повторного прохода или принятия окончательного решения. Критически важным элементом становится логика маршрутизации, а не выбор одной конкретной модели.

О чем говорят цифры

Данные Vercel, полученные через ее шлюз, который взаимодействует с множеством AI-провайдеров, показывают, что модели с открытыми весами переходят из периферии в мейнстрим. В апреле на них приходилось чуть более одной десятой всех токенов; к июню их доля приблизилась к одной трети. DeepSeek, китайская модель, самостоятельно обеспечила более одной пятой всего объема токенов.

Высокоуровневые модели по-прежнему доминируют в расходах. Anthropic, например, продолжает поглощать основную часть денежных затрат, поскольку цена за токен у нее выше. Математика проста: дешевые модели забирают себе высокообъемные задачи с низкой маржой, в то время как дорогие модели сохраняют за собой высокомаржинальные задачи с критической важностью.

Последствия для AI-агентов

AI-агент обычно выполняет последовательность шагов: планирование, извлечение данных, вызов инструментов и уточнение результата. Когда каждый шаг можно поручить наиболее экономически эффективной модели, общие операционные расходы резко снижаются.

  • Извлечение и поиск данных часто требуют лишь базового понимания языка — задачи, в которой дешевые модели преуспевают.
  • Окончательное решение — этап, определяющий, является ли ответ приемлемым, — остается прерогативой премиальных моделей, обладающих более высокой надежностью.

Такой многослойный подход позволяет разработчикам автоматизировать более масштабные рабочие нагрузки, не раздувая бюджеты. Это также заставляет перейти от стратегии «выбери лучшую модель» к стратегии «измеряй успех на каждом шаге и маршрутизируй соответствующим образом».

Риски и ограничения

Экономическая выгода очевидна, но переход не обходится без трений.

  • Комплаенс: некоторые юрисдикции накладывают строгие правила обработки данных, что может ограничить использование моделей, размещенных на зарубежных серверах.
  • Сложность хостинга: крупные премиальные модели трудно запускать локально, поэтому организации вынуждены полагаться на внешние API, что может повысить задержки и вызвать опасения по поводу привязки к поставщику (vendor lock-in).

Из-за этих факторов дешевые модели вряд ли полностью заменят премиальные. Вместо этого они станут стандартом для рутинной работы, в то время как премиальные модели останутся на «уровне принятия решений», где их высокая стоимость оправдана.

За чем следить дальше

  • Инструментарий для маршрутизации: по мере того как уровень маршрутизации становится более центральным, можно ожидать волны SDK и платформ, которые автоматизируют выбор модели на основе задержки, стоимости и порогов уверенности.

Разработчики, которые начнут измерять успех на уровне задач, отслеживать повторные попытки и четко отделять «объем» от «суждений», будут лучше всего подготовлены к извлечению выгоды из формирующегося инфраструктурного мышления.

Главный вывод: Стек ИИ трансформируется из выбора одной модели в задачу маршрутизации, где дешевые модели с открытыми весами берут на себя основной объем работы, а премиальные модели резервируются для принятия критически важных решений. Освоение этой маршрутизации станет следующим конкурентным преимуществом для создателей ИИ-решений.