Alibaba представляє Qwen3.8-Flash-Next: нова ера ефективного ШІ

Команда Qwen від Alibaba офіційно випустила Qwen3.8-Flash-Next — революційну мультимодальну модель Mixture-of-Experts (MoE), розроблену для забезпечення елітної продуктивності за частку традиційної вартості. Слугуючи архітектурним прев'ю для майбутньої Qwen4, ця модель кидає виклик домінуванню набагато більших LLM завдяки оптимізації способів активації та зберігання параметрів.

Революційна архітектура: інновація N-gram embedding

Визначним технічним досягненням у Qwen3.8-Flash-Next є унікальне поєднання масштабу та ефективності. Хоча модель має загалом 125 мільярдів параметрів, вона використовує підхід sparse MoE, який активує лише 6 мільярдів параметрів на токен. Це дозволяє здійснювати високошвидкісний інференс без втрати глибини знань, притаманної щільнішим моделям.

Важливою інновацією, запланованою для повноцінного релізу Qwen4, є включення N-gram embedding шару із 51 мільярдом параметрів. Цей шар функціонує як «словник фраз», зберігаючи поширені групи слів як окремі записи. Що критично важливо, цей шар розроблений для розміщення в звичайній системній оперативній пам'яті (RAM), а не в дорогому відеопам'яті GPU, що значно знижує апаратні витрати, необхідні для запуску моделі. Крім того, модель нативно підтримує величезне контекстне вікно у 262 144 токени з можливістю масштабування до одного мільйона токенів за допомогою YaRN.

Перевершує гігантів у програмуванні та продуктивності

Попри меншу кількість активних параметрів, Qwen3.8-Flash-Next демонструє результати в бенчмарках, які часто перевершують набагато більших конкурентів, таких як DeepSeek-V4-Flash (284 млрд параметрів) та Claude Opus 4.6 (Max) від Anthropic. Модель демонструє особливу силу в «агентських» (agentic) завданнях — сценаріях, де ШІ має самостійно орієнтуватися в складних програмних середовищах для вирішення проблем.

У спеціалізованих бенчмарках Flash-Next досягла показника 62,5 у SWE-bench Pro та 58,7 у DeepSWE, перевершивши як DeepSeek, так і Claude. Розрив у продуктивності ще помітніший у професійних робочих процесах: у CoWorkBench Flash-Next набрала 73,9, що майже вдвічі перевищує результат DeepSeek-V4-Flash (45,1). У JobBench вона набрала 55,7, що є величезним стрибком порівняно з 27,6, зафіксованими у попередній моделі Qwen3.7-Plus.

Революційне ціноутворення та конкурентне середовище

Alibaba конкурує не лише інтелектом, а й екстремальною економічною ефективністю. Продуктивна версія, що постачається як Qwen3.8-Flash через QwenCloud, має вражаючу ціну: 0,16 долара за мільйон вхідних токенів та 0,47 долара за мільйон вихідних токенів. Для порівняння: модель працює майже так само добре, як флагманська Qwen3.8-Max, але приблизно за одну дванадцяту вартість.

Така агресивна стратегія ціноутворення чинить величезний тиск на західних лідерів ШІ, таких як OpenAI та Anthropic. Доводячи, що модель, навчена за одну дев'яту вартість порівняно з попередницею, може забезпечувати кращі результати в програмуванні та офісних завданнях, Alibaba сигналізує про зміну в індустрії: майбутнє ШІ може належати не найбільшим моделям, а найбільш архітектурно ефективним.

Основні висновки

  • Архітектурне прев'ю: Qwen3.8-Flash-Next представляє N-gram embedding шар на 51 млрд параметрів, який використовує системну RAM для зменшення залежності від GPU, що є попередником архітектури Qwen4.
  • Домінування в бенчмарках: Модель перевершує більших конкурентів, таких як Claude Opus 4.6 та DeepSeek-V4-Flash, в агентському програмуванні (SWE-bench Pro) та професійній продуктивності (CoWorkBench).
  • Екстремальна економічна ефективність: Маючи лише 6 млрд активних параметрів на токен, модель пропонує інтелект високого рівня за частку вартості флагманських моделей, змінюючи сучасний ландшафт ціноутворення в галузі ШІ.