Nvidia представила Nemotron 3.5 Lightning 11 августа. Эта модель на базе архитектуры Mixture-of-Experts (MoE) с 30 миллиардами параметров работает всего с 3 миллиардами активных параметров, а её сопутствующая библиотека маршрутизации NeMo Switchyard уже вызвала споры о стоимости инференса и эффективности кэширования. То, как Switchyard перенаправляет запросы между моделями, может приводить к сбросу кэшей промптов и потенциально удваивать счет за одну сессию инференса.

Модель, созданная для агентов с открытыми весами

Nemotron 3.5 Lightning ориентирована на ИИ-агентов, которые вызывают инструменты, проверяют результаты и ведут цепочку рассуждений. Три технических решения выделяют её:

  • Гибридная архитектура — она объединяет ядро на базе state-space модели Mamba-2 с традиционным Transformer, доказывая, что не-Transformer архитектуры могут конкурировать на таком масштабе.
  • 4-битное квантование с плавающей запятой — использование низкой точности позволяет модели на 30 млрд параметров выдавать примерно 100 токенов в секунду на MacBook Pro с чипом M5 Max — скорость, с которой модели с полной точностью будет трудно сравниться.
  • Полная открытость — Nvidia опубликовала файлы весов и полный рецепт обучения, что является редкостью для моделей, предназначенных для высокопроизводительного инференса.

Первые пользователи отмечают, что модель может «слишком много думать», выдавая длинные цепочки рассуждений, которые иногда содержат ошибки. Разработчики получают мощный, открытый инструмент для исполнения агентов, но должны тщательно составлять промпты, чтобы избежать излишней многословности.

Почему уровень маршрутизации имеет значение

NeMo Switchyard — это библиотека Nvidia для динамической маршрутизации запроса к «лучшей» модели из пула кандидатов. Теоретически роутер может повысить качество ответов, выбирая специализированную модель для каждого запроса. На практике же решение о маршрутизации вступает в конфликт с механизмами кэширования промптов, на которые полагаются многие конвейеры инференса.

  • Кэши промптов хранят эмбеддинги токенов начального промпта, чтобы последующие генерации могли повторно использовать их без необходимости заново вычислять этап «prefill».
  • Переключение маршрутов переносит запрос с Модели А на Модель Б после первых нескольких токенов, заставляя систему отбрасывать кэшированный промпт и вычислять его заново для новой модели.

Поскольку большая часть затрат на ИИ уходит на чтение кэшированного промпта, а не на генерацию новых токенов, один переход маршрута может фактически удвоить стоимость запроса.

Борьба за стоимость

Что на горизонте

Дискуссия разгорается в тот момент, когда стратегия Nvidia по открытым весам сталкивается с прямой конкуренцией. 15 августа выйдет Qwen 3.8-27B, и первые бенчмарки показывают, что она может составить конкуренцию Nemotron 3.5 Lightning в сценариях локальной разработки.

Стратегия Nvidia — открытые веса, открытые рецепты обучения и открытый уровень маршрутизации — похоже, призвана сделать её GPU стандартом оборудования для всех, кто запускает эти модели локально. Раскрывая программный стек, Nvidia надеется привязать разработчиков к своей экосистеме, даже если логика маршрутизации влечет за собой скрытые дополнительные расходы.

Итог

Если вы планируете запускать Nemotron 3.5 Lightning на своем собственном устройстве, спрашивайте не только «насколько быстро она может генерировать?», но и «как часто Switchyard будет заставлять меня сбрасывать кэш промпта?». Именно этот ответ определит, станет ли обещание открытых весов реальной экономией или дорогим экспериментом. С появлением альтернатив вроде Qwen, баланс между гибкостью маршрутизации и эффективностью затрат за счет кэширования решит, какой инструментарий — и, в конечном счете, какая аппаратная платформа — победит.