Alibaba onthult Qwen3.8-Max: een gigant met 2,4 biljoen parameters voor AI-agents

Het Qwen-team van Alibaba heeft Qwen3.8-Max aangekondigd, een enorm vlaggenschipmodel met 2,4 biljoen parameters dat is ontworpen om verder te gaan dan eenvoudige chat-prompts en te bewegen richting autonome redenering over een lange termijn (long-horizon). Door zich te richten op workflows die meerdere dagen beslaan en de uitvoering van complexe taken, markeert dit model een belangrijke verschuiving van reactieve LLM's naar proactieve AI-agents.

Schalen van parameters voor autonome intelligentie

Qwen3.8-Max is een technisch krachtpatser, met in totaal 2,4 biljoen parameters en 95 miljard actieve parameters per query. Voortbouwend op de Qwen3.5-architectuur is het model specifiek geoptimaliseerd voor "long-horizon"-taken: complexe doelstellingen die van de AI vereisen dat deze dagen of zelfs wekenlang onafhankelijk opereert.

In een belangrijke stap voor de open-source community heeft Alibaba bevestigd dat de gewichten (weights) voor de Qwen-Max-klasse volgende week publiekelijk beschikbaar worden gesteld, wat de gesloten dominantie van frontier-modellen zoals GPT en Claude uitdaagt.

Autonomie bewijzen door middel van coderen en onderzoek

Om de agent-capaciteiten te demonstreren, presenteerde Alibaba verschillende cruciale casestudy's waarbij het model zonder menselijke tussenkomst opereerde:

  • Software Engineering: Over een periode van 16 dagen ontwikkelde Qwen3.8-Max autonoom de command-line tool oh-my-cli. Het beheerde eigen GitHub-issues, schreef code, voerde tests uit en realiseerde 265 commits en 127 pull requests.
  • Wetenschappelijke reproductie: Met als taak het reproduceren van de resultaten van het paper "Unified Data Selection for LLM Reasoning", besteedde het model 125 uur aan rekentijd om 7.600 regels code te schrijven. Het repliceerde niet alleen het oorspronkelijke onderzoek, maar verbeterde ook de AIME24 math benchmark-score met 2,7 punten.
  • Competitieve Data Science: In de WWW2025 Multimodal Dialogue Intent Recognition Challenge presteerde het model beter dan 458 van de 526 menselijke teams, waarbij de nauwkeurigheid binnen 24 uur steeg van 0,60 naar 0,853.

Verder dan software: chipontwerp en fiscale simulatie

Het redeneervermogen van Qwen3.8-Max strekt zich uit tot hardware en economie. Bij een taak voor het ontwerpen van cryptografische circuits reduceerde het model iteratief een "overgedimensioneerd" ontwerp van 8.298 logische poorten naar slechts 678 poorten. Met behulp van de OpenROAD-tool resulteerde dit in een reductie van 81% in het fysieke chipoppervlak.

In een complexe retailsimulatie genaamd E-Commerce-Bench beheerde het model meerdere online winkels gedurende een gesimuleerd fiscaal jaar. Beginnend met 100.000 yuan, navigeerde het door leveranciersonderhandelingen, identificeerde het 152 oplichters en beheerde het verstoringen in de toeleveringsketen om te eindigen met 416.252 yuan — waarmee het startkapitaal werd verviervoudigd en het de nummer twee, GLM 5.2, ruim achter zich liet.

Multimodale grenzen en benchmark-dominantie

Het model verlegt ook de grenzen van multimodale verwerking en is in staat om documenten van 200 pagina's en video's van meer dan 100 uur te verwerken. Alibaba introduceert ook RecreationBench, een benchmark die het vermogen van een agent test om draaiende applicaties (op Windows, macOS, Android, etc.) te reconstrueren uitsluitend via visuele interactie en toetsenbordinteractie, zonder toegang tot de broncode.

Volgens interne benchmarks concurreert Qwen3.8-Max direct met topmodellen en scoort het in verschillende categorieën nabij of boven Claude Opus 4.8 en GPT-5.6 Sol, waaronder een leidende score van 93 op PaperBench.

Belangrijkste conclusies

  • Enorme schaal: Qwen3.8-Max beschikt over in totaal 2,4 biljoen parameters en 95 miljard actieve parameters, geoptimaliseerd voor autonome workflows die meerdere dagen beslaan.
  • Agent-beheersing: Het model heeft bewezen in staat te zijn om complexe software engineering, optimalisatie van chipontwerp en volledige fiscale bedrijfsvoering autonoom af te handelen.
  • Impact van open gewichten: In tegenstelling tot veel frontier-modellen is Alibaba van plan de gewichten voor de Qwen-Max-klasse vrij te geven, waardoor ontwikkelaars ongekende toegang krijgen tot hoogwaardige agent-intelligentie.