Alibaba представила Qwen3.8-Max — модель на базе архитектуры Mixture-of-Experts (MoE) с 2,4 триллионами параметров, которая показала результат 86,1% в бенчмарке OSWorld-Verified. По заявлениям Alibaba, этот показатель превосходит результаты GPT-5.6, Sol Max и Fable 5. Данный бенчмарк оценивает способность ИИ взаимодействовать с операционной системой, устанавливать программное обеспечение и отлаживать код — набор навыков, лежащих в основе автономных агентов для разработки ПО.
Гонка за автономными агентами
Большие языковые модели эволюционировали от чат-ассистентов к инструментам, способным писать, тестировать и даже развертывать код. Компании, которые смогут надежно делегировать рутинные инженерные задачи ИИ, смогут сократить расходы на персонал и ускорить циклы разработки продуктов. Бенчмарк OSWorld-Verified стал фактическим мерилом «агентских» возможностей, поскольку он требует не просто генерации статического текста, а реального взаимодействия с системой.
Возможности Qwen3.8-Max
- Архитектура MoE с 2,4 трлн параметров — для каждого токена может задействоваться до 64 экспертных подсетей; по утверждению Alibaba, такая архитектура снижает вычислительные затраты примерно на 40%.
- Мультимодальная обработка промптов — модель принимает текст, изображения и структурированные данные одновременно, что позволяет одним запросом описать пользовательский интерфейс, приложить скриншот и предоставить конфигурационные файлы.
- Контекстное окно в 64k токенов — достаточный объем для целых кодовых баз, лог-файлов или длинных технических отчетов без необходимости разбивать их на части.
Эти функции ориентированы на сквозные (end-to-end) рабочие процессы, на которые команды разработчиков тратят часы: загрузку зависимостей, сканирование логов, исправление багов и генерацию документации.
Цифры под микроскопом
| Задача | Заявленный показатель |
|---|---|
| OSWorld-Verified (агентское взаимодействие с ОС) | 86,1% успеха |
| Генерация кода (HumanEval-Plus) | 78,4% пройдено |
| Мультимодальные рассуждения (MM-Bench) | 84,3% |
| Резюмирование длинного контекста (тест на 50k токенов) | 90,2% |
Все данные получены в ходе внутреннего тестирования Alibaba. Если они подтвердятся, модель предоставит предприятиям единый API, способный работать с кодом, изображениями и объемными документами, сохраняя при этом стоимость инференса ниже, чем у многих конкурентов на базе плотных (dense) моделей.
Риски и необходимость независимой проверки
Отсутствие сторонней верификации — это самое серьезное предостережение. Бенчмарки можно подстраивать, промпты — оптимизировать, а тестовые наборы — фильтровать в пользу конкретной архитектуры. Без внешнего воспроизведения утверждение о том, что Qwen3.8-Max «бьет» GPT-5.6, остается лишь предварительным. Более того, модели MoE могут демонстрировать неравномерную производительность: некоторые токены могут направляться к недостаточно обученным экспертам, что приводит к периодическим галлюцинациям или противоречивым результатам — проблемам, которые критичны, когда от ИИ ожидается модификация рабочих (production) систем.
За чем следить дальше
- Независимое воспроизведение — исследователи и облачные клиенты, скорее всего, запустят тот же набор тестов OSWorld-Verified и HumanEval-Plus на общедоступном оборудовании.
- Ценообразование и задержка (latency) — стоимость API Alibaba Cloud покажет, превратится ли 40-процентная экономия вычислительных ресурсов в реальное ценовое преимущество для разработчиков.
- Инструменты безопасности — по мере того как автономные агенты получают все больший контроль над инфраструктурой, экосистеме потребуются механизмы мониторинга, отката (rollback) и аудита, которые все еще находятся на ранних стадиях разработки.
Если Qwen3.8-Max оправдает заявленные показатели, разрыв между разговорным ассистентом и самодостаточным инженерным ботом резко сократится. Следующие несколько месяцев покажут, выдержит ли производительность модели проверку и начнут ли предприятия использовать ее в качестве основы своих автоматизированных конвейеров разработки.
