Alibaba представила Qwen3.8-Max — модель на базе архитектуры Mixture-of-Experts (MoE) с 2,4 триллионами параметров, которая показала результат 86,1% в бенчмарке OSWorld-Verified. По заявлениям Alibaba, этот показатель превосходит результаты GPT-5.6, Sol Max и Fable 5. Данный бенчмарк оценивает способность ИИ взаимодействовать с операционной системой, устанавливать программное обеспечение и отлаживать код — набор навыков, лежащих в основе автономных агентов для разработки ПО.

Гонка за автономными агентами

Большие языковые модели эволюционировали от чат-ассистентов к инструментам, способным писать, тестировать и даже развертывать код. Компании, которые смогут надежно делегировать рутинные инженерные задачи ИИ, смогут сократить расходы на персонал и ускорить циклы разработки продуктов. Бенчмарк OSWorld-Verified стал фактическим мерилом «агентских» возможностей, поскольку он требует не просто генерации статического текста, а реального взаимодействия с системой.

Возможности Qwen3.8-Max

  • Архитектура MoE с 2,4 трлн параметров — для каждого токена может задействоваться до 64 экспертных подсетей; по утверждению Alibaba, такая архитектура снижает вычислительные затраты примерно на 40%.
  • Мультимодальная обработка промптов — модель принимает текст, изображения и структурированные данные одновременно, что позволяет одним запросом описать пользовательский интерфейс, приложить скриншот и предоставить конфигурационные файлы.
  • Контекстное окно в 64k токенов — достаточный объем для целых кодовых баз, лог-файлов или длинных технических отчетов без необходимости разбивать их на части.

Эти функции ориентированы на сквозные (end-to-end) рабочие процессы, на которые команды разработчиков тратят часы: загрузку зависимостей, сканирование логов, исправление багов и генерацию документации.

Цифры под микроскопом

Задача Заявленный показатель
OSWorld-Verified (агентское взаимодействие с ОС) 86,1% успеха
Генерация кода (HumanEval-Plus) 78,4% пройдено
Мультимодальные рассуждения (MM-Bench) 84,3%
Резюмирование длинного контекста (тест на 50k токенов) 90,2%

Все данные получены в ходе внутреннего тестирования Alibaba. Если они подтвердятся, модель предоставит предприятиям единый API, способный работать с кодом, изображениями и объемными документами, сохраняя при этом стоимость инференса ниже, чем у многих конкурентов на базе плотных (dense) моделей.

Риски и необходимость независимой проверки

Отсутствие сторонней верификации — это самое серьезное предостережение. Бенчмарки можно подстраивать, промпты — оптимизировать, а тестовые наборы — фильтровать в пользу конкретной архитектуры. Без внешнего воспроизведения утверждение о том, что Qwen3.8-Max «бьет» GPT-5.6, остается лишь предварительным. Более того, модели MoE могут демонстрировать неравномерную производительность: некоторые токены могут направляться к недостаточно обученным экспертам, что приводит к периодическим галлюцинациям или противоречивым результатам — проблемам, которые критичны, когда от ИИ ожидается модификация рабочих (production) систем.

За чем следить дальше

  • Независимое воспроизведение — исследователи и облачные клиенты, скорее всего, запустят тот же набор тестов OSWorld-Verified и HumanEval-Plus на общедоступном оборудовании.
  • Ценообразование и задержка (latency) — стоимость API Alibaba Cloud покажет, превратится ли 40-процентная экономия вычислительных ресурсов в реальное ценовое преимущество для разработчиков.
  • Инструменты безопасности — по мере того как автономные агенты получают все больший контроль над инфраструктурой, экосистеме потребуются механизмы мониторинга, отката (rollback) и аудита, которые все еще находятся на ранних стадиях разработки.

Если Qwen3.8-Max оправдает заявленные показатели, разрыв между разговорным ассистентом и самодостаточным инженерным ботом резко сократится. Следующие несколько месяцев покажут, выдержит ли производительность модели проверку и начнут ли предприятия использовать ее в качестве основы своих автоматизированных конвейеров разработки.