Alibaba представляє Qwen3.8-Max: гігант із 2,4 трильйона параметрів для ШІ-агентів

Команда Qwen від Alibaba оголосила про випуск Qwen3.8-Max — масивної флагманської моделі з 2,4 трильйона параметрів, розробленої для переходу від простих чат-запитів до автономного міркування з довгостроковим горизонтом планування. Зосереджуючись на багатоденних робочих процесах та виконанні складних завдань, ця модель знаменує собою значний перехід від реактивних LLM до проактивних ШІ-агентів.

Масштабування параметрів для автономного інтелекту

Qwen3.8-Max — це справжня технічна потужність, що використовує загалом 2,4 трильйона параметрів, з 95 мільярдами активних параметрів на кожен запит. Базуючись на архітектурі Qwen3.5, модель спеціально оптимізована для завдань із «довгим горизонтом» — складних цілей, які потребують від ШІ автономної роботи протягом днів або навіть тижнів.

Важливим кроком для спільноти open-source став підтверджений факт, що ваги для класу Qwen-Max будуть оприлюднені наступного тижня, що кидає виклик домінуванню закритих передових моделей, таких як GPT та Claude.

Доведення автономії через програмування та дослідження

Щоб продемонструвати свої агентні можливості, Alibaba представила кілька критично важливих кейсів, у яких модель працювала без втручання людини:

  • Програмна інженерія: Протягом 16 днів Qwen3.8-Max автономно розробила інструмент командного рядка oh-my-cli. Вона самостійно керувала завданнями (issues) у GitHub, писала код, запускала тести, виконала 265 комітів та 127 пул-реквестів.
  • Наукова репродукція: Отримавши завдання відтворити результати статті «Unified Data Selection for LLM Reasoning», модель витратила 125 годин обчислювального часу на написання 7600 рядків коду. Вона не лише відтворила оригінальне дослідження, а й покращила результат у математичному бенчмарку AIME24 на 2,7 бала.
  • Конкурентна наука про дані: У змаганні WWW2025 Multimodal Dialogue Intent Recognition Challenge модель перевершила 458 із 526 команд людей, підвищивши свою точність із 0,60 до 0,853 протягом 24 годин.

Поза межами програмного забезпечення: дизайн чипів та фінансове моделювання

Здатність Qwen3.8-Max до міркування поширюється на апаратне забезпечення та економіку. У завданні з проєктування криптографічної схеми модель ітеративно скоротила «роздутий» дизайн із 8298 логічних вентилів до лише 678. Використання інструменту OpenROAD дозволило зменшити фізичну площу чипа на 81%.

У складному симуляторі роздрібної торгівлі під назвою E-Commerce-Bench модель керувала кількома онлайн-магазинами протягом симульованого фінансового року. Почавши зі 100 000 юанів, вона вела переговори з постачальниками, виявила 152 шахраїв та долала збої в ланцюгах постачання, закінчивши з 416 252 юанами — що вчетверо перевищило її початковий капітал і значно перевершило результат другого місця, GLM 5.2.

Мультимодальні горизонти та домінування в бенчмарках

Модель також розширює межі мультимодальної обробки, здатність опрацьовувати 200-сторінкові документи та відео тривалістю понад 100 годин. Alibaba також представляє RecreationBench — бенчмарк, який тестує здатність агента реконструювати працюючі додатки (на Windows, macOS, Android тощо) виключно через візуальну взаємодію та клавіатуру, без доступу до вихідного коду.

Згідно з внутрішніми тестами, Qwen3.8-Max безпосередньо конкурує з моделями найвищого рівня, посідаючи позиції поруч або вище Claude Opus 4.8 та GPT-5.6 Sol у кількох категоріях, включаючи провідний результат 93 у PaperBench.

Основні висновки

  • Масштабність: Qwen3.8-Max має загалом 2,4 трильйона параметрів і 95 мільярдів активних параметрів, оптимізованих для багатоденних автономних робочих процесів.
  • Агентна майстерність: Модель продемонструвала здатність автономно справлятися зі складним програмним забезпеченням, оптимізацією дизайну чипів та повномасштабним фінансовим управлінням.
  • Вплив відкритих ваг: На відміну від багатьох передових моделей, Alibaba планує випустити ваги для класу Qwen-Max, надаючи розробникам безпрецедентний доступ до агентного інтелекту високого рівня.