Alibaba представляет Qwen3.8-Flash-Next: новая эра эффективного ИИ

Команда Qwen из Alibaba официально представила Qwen3.8-Flash-Next — революционную мультимодальную модель на базе архитектуры Mixture-of-Experts (MoE), разработанную для обеспечения элитной производительности при значительно меньших затратах по сравнению с традиционными решениями. Служа архитектурным анонсом грядущей Qwen4, эта модель бросает вызов доминированию гораздо более крупных LLM за счет оптимизации способов активации и хранения параметров.

Революционная архитектура: инновация N-gram эмбеддингов

Главным техническим достижением Qwen3.8-Flash-Next является уникальный подход к балансу масштаба и эффективности. Хотя модель обладает в общей сложности 125 миллиардами параметров, она использует разреженную (sparse) архитектуру MoE, которая активирует лишь 6 миллиардов параметров на токен. Это обеспечивает высокую скорость инференса без ущерба для широты знаний, характерной для более плотных моделей.

Важной инновацией, запланированной для полноценного релиза Qwen4, является внедрение слоя N-gram эмбеддингов объемом 51 миллиард параметров. Этот слой функционирует как «словарь фраз», сохраняя распространенные группы слов в виде отдельных записей. Что крайне важно, этот слой спроектирован для размещения в обычной системной оперативной памяти (RAM), а не в дорогостоящей видеопамяти GPU, что значительно снижает аппаратные требования для запуска модели. Кроме того, модель нативно поддерживает огромное контекстное окно в 262 144 токена с возможностью масштабирования до одного миллиона токенов с помощью YaRN.

Превосходство над гигантами в кодинге и продуктивности

Несмотря на меньшее количество активных параметров, Qwen3.8-Flash-Next демонстрирует результаты в бенчмарках, которые зачастую превосходят показатели гораздо более крупных конкурентов, таких как DeepSeek-V4-Flash (284 млрд параметров) и Claude Opus 4.6 (Max) от Anthropic. Модель проявляет особую силу в «агентских» (agentic) задачах — сценариях, где ИИ должен самостоятельно ориентироваться в сложных программных средах для решения проблем.

В специализированных тестах Flash-Next набрала 62,5 балла в SWE-bench Pro и 58,7 в DeepSWE, опередив как DeepSeek, так и Claude. Разрыв в производительности еще более заметен в профессиональных рабочих процессах: в CoWorkBench Flash-Next набрала 73,9 балла, почти вдвое превысив результат DeepSeek-V4-Flash (45,1). В JobBench она показала 55,7 балла, что является колоссальным скачком по сравнению с 27,6, зафиксированными у предыдущей модели Qwen3.7-Plus.

Революционное ценообразование и конкурентная среда

Alibaba конкурирует не только за счет интеллекта, но и за счет экстремальной экономической эффективности. Продакшн-версия, поставляемая под названием Qwen3.8-Flash через QwenCloud, имеет ошеломляющую цену: всего $0,16 за миллион входных токенов и $0,47 за миллион выходных токенов. Для сравнения: модель работает почти так же эффективно, как флагманская Qwen3.8-Max, но примерно в двенадцать раз дешевле.

Эта агрессивная стратегия ценообразования оказывает огромное давление на западных лидеров ИИ, таких как OpenAI и Anthropic. Доказывая, что модель, обученная за одну девятую часть стоимости от своей предшественницы, может показывать превосходные результаты в программировании и офисных задачах, Alibaba сигнализирует об индустриальном сдвиге: будущее ИИ может принадлежать не самым крупным моделям, а самым архитектурно эффективным.

Основные выводы

  • Архитектурный анонс: Qwen3.8-Flash-Next представляет слой N-gram эмбеддингов объемом 51 млрд параметров, который использует системную RAM для снижения зависимости от GPU, что является предвестником архитектуры Qwen4.
  • Доминирование в бенчмарках: Модель превосходит более крупных конкурентов, таких как Claude Opus 4.6 и DeepSeek-V4-Flash, в агентском кодинге (SWE-bench Pro) и профессиональной продуктивности (CoWorkBench).
  • Экстремальная экономическая эффективность: Благодаря тому, что количество активных параметров составляет всего 6 млрд на токен, модель предлагает интеллект высочайшего уровня за малую долю стоимости флагманских моделей, меняя текущий ландшафт ценообразования в сфере ИИ.