Alibaba, AI 에이전트를 위한 2.4조 파라미터 거대 모델 Qwen3.8-Max 공개
Alibaba의 Qwen 팀은 단순한 채팅 프롬프트를 넘어 장기적(long-horizon) 자율 추론을 목표로 설계된 2.4조 파라미터 규모의 거대 플래그십 모델 Qwen3.8-Max를 발표했습니다. 이 모델은 며칠씩 이어지는 워크플로우와 복잡한 작업 실행에 집중함으로써, 반응형 LLM에서 선제적 AI 에이전트로의 중대한 전환을 예고합니다.
자율 지능을 위한 파라미터 스케일링
Qwen3.8-Max는 총 2.4조 개의 파라미터를 활용하며, 쿼리당 950억 개의 활성 파라미터를 사용하는 기술적 강자입니다. Qwen3.5 아키텍처를 기반으로 구축된 이 모델은 AI가 며칠 또는 몇 주 동안 독립적으로 작동해야 하는 복잡한 목표인 '장기적(long-horizon)' 작업에 최적화되어 있습니다.
오픈 소스 커뮤니티에 있어 중요한 진전으로, Alibaba는 Qwen-Max 클래스의 가중치(weights)를 다음 주에 공개할 것이라고 확인했습니다. 이는 GPT나 Claude와 같은 폐쇄형 프런티어 모델들의 독점에 도전하는 행보입니다.
코딩과 연구를 통한 자율성 입증
에이전트로서의 역량을 입증하기 위해, Alibaba는 인간의 개입 없이 모델이 작동한 몇 가지 고난도 사례 연구를 제시했습니다:
- 소프트웨어 엔지니어링: 16일 동안 Qwen3.8-Max는 커맨드라인 도구인
oh-my-cli를 자율적으로 개발했습니다. 스스로 GitHub 이슈를 관리하고, 코드를 작성하며, 테스트를 실행하고, 265개의 커밋과 127개의 풀 리퀘스트(pull requests)를 수행했습니다. - 과학적 재현: "Unified Data Selection for LLM Reasoning" 논문의 결과를 재현하는 과제를 수행하며, 모델은 7,600줄의 코드를 작성하는 데 125시간의 연산 시간을 사용했습니다. 모델은 기존 연구를 재현했을 뿐만 아니라 AIME24 수학 벤치마크 점수를 2.7점 향상시켰습니다.
- 경쟁 데이터 과학: WWW2025 멀티모달 대화 의도 인식 챌린지(Multimodal Dialogue Intent Recognition Challenge)에서 이 모델은 526개의 인간 팀 중 458개 팀보다 뛰어난 성적을 거두었으며, 24시간 이내에 정확도를 0.60에서 0.853으로 끌어올렸습니다.
소프트웨어를 넘어: 칩 설계 및 재무 시뮬레이션
Qwen3.8-Max의 추론 능력은 하드웨어와 경제학 영역까지 확장됩니다. 암호화 회로 설계 작업에서 모델은 '비대해진' 설계를 8,298개의 로직 게이트에서 단 678개로 반복적으로 축소했습니다. OpenROAD 도구를 사용한 결과, 물리적 칩 면적이 81% 감소했습니다.
E-Commerce-Bench라고 불리는 복잡한 소매 시뮬레이션에서 모델은 가상의 회계 연도 동안 여러 온라인 상점을 운영했습니다. 10만 위안으로 시작하여 공급업체 협상을 진행하고, 152명의 사기꾼을 식별하며, 공급망 중단 사태를 관리한 끝에 416,252 위안을 달성했습니다. 이는 초기 자본의 4배가 넘는 수치로, 2위인 GLM 5.2를 크게 앞지른 성과입니다.
멀티모달의 경계와 벤치마크 장악
이 모델은 200페이지 분량의 문서와 100시간이 넘는 영상을 처리할 수 있는 멀티모달 처리의 한계를 넓히고 있습니다. 또한 Alibaba는 소스 코드에 접근하지 않고 오직 시각적 및 키보드 상호작용만으로 실행 중인 애플리케이션(Windows, macOS, Android 등)을 재구성하는 에이전트의 능력을 테스트하는 벤치마크인 RecreationBench를 도입하고 있습니다.
내부 벤치마크에 따르면, Qwen3.8-Max는 여러 카테고리에서 Claude Opus 4.8 및 GPT-5.6 Sol과 대등하거나 그 이상의 성능을 보이며 최상위 모델들과 직접 경쟁하고 있으며, PaperBench에서는 93점이라는 선두 점수를 기록했습니다.
핵심 요약
- 거대한 규모: Qwen3.8-Max는 총 2.4조 개의 파라미터와 950억 개의 활성 파라미터를 특징으로 하며, 며칠간 지속되는 자율 워크플로우에 최적화되어 있습니다.
- 에이전트 역량의 숙달: 이 모델은 복잡한 소프트웨어 엔지니어링, 칩 설계 최적화, 그리고 전면적인 재무 관리를 자율적으로 수행할 수 있는 능력을 입증했습니다.
- 오픈 웨이트의 영향력: 많은 프런티어 모델과 달리, Alibaba는 Qwen-Max 클래스의 가중치를 공개할 계획이어서 개발자들에게 고차원적인 에이전트 지능에 대한 전례 없는 접근성을 제공할 예정입니다.
