Qwen 3.6 демонстрирует такую же пропускную способность токенов, как и Qwen 3.5 на RTX 4070 — 38,76 токенов в секунду против 36,7 т/с, — но справляется с автономными агентами и помощью в написании кода заметно лучше. Это важно для всех, кто создает инструменты на базе ИИ на потребительском оборудовании.
Почему эти цифры важны
Обе модели имеют одинаковое количество активных параметров, поэтому чистая скорость должна быть схожей. Первое тестирование показало резкое замедление версии 3.6, но это произошло из-за стороннего процесса, который потреблял 11 ГБ видеопамяти (VRAM), вынуждая модель использовать оперативную память системы. После остановки этого процесса пропускная способность вернулась к ожидаемым значениям, что подтверждает: обе версии работают практически с одинаковой скоростью при бюджете видеопамяти в 12 ГБ.
В чем реальная разница
Обновление заключается в возможностях, а не в скорости генерации токенов. Согласно бенчмаркам разработчиков:
- Задачи по генерации фронтенда улучшились на 43 %
- Задачи по работе в терминале улучшились на 27 %
- Задачи, связанные с программированием, улучшились на 11 %
Все три показателя зависят от способности модели вызывать инструменты, удерживать длинное контекстное окно и выстраивать цепочки из нескольких этапов рассуждения. На практике версия 3.6 более надежно исправляет ошибки, следует сложным инструкциям и справляется с многоэтапными рабочими процессами, включающими использование оболочки (shell) или IDE.
Кому это выгодно
- Разработчики агентов — когда ИИ выполняет команды, редактирует файлы или управляет сервисами, новая модель сокращает количество неудачных попыток и уменьшает необходимость ручной правки.
- Ассистенты для кодинга — умеренный прирост в задачах программирования означает меньше галлюцинаций в коде и более точные предложения по рефакторингу.
- Исследователи с ограниченным бюджетом — возможность запускать новую модель с той же скоростью на одной RTX 4070 позволяет командам обновляться без покупки дополнительных GPU.
Кому это не нужно
Если ваша основная нагрузка — это простые ответы на вопросы или генерация коротких текстов, разница в производительности исчезает. Показатель токенов в секунду остается прежним, а потребление видеопамяти не увеличивается, так что переход ничего вам не будет стоить.
Итог: Qwen 3.6 — это не ускорение, а расширение возможностей. На той же потребительской видеокарте она предоставляет разработчикам более надежного и автономного ИИ-партнера, не увеличивая при этом затраты на оборудование.
