Alibaba Qwen3.8-Maxను ఆవిష్కరించింది: AI ఏజెంట్ల కోసం 2.4 ట్రిలియన్ పారామీటర్ల భారీ మోడల్

Alibaba యొక్క Qwen బృందం Qwen3.8-Maxను ప్రకటించింది. ఇది కేవలం సాధారణ చాట్ ప్రాంప్ట్‌ల స్థాయికి పరిమితం కాకుండా, సుదీర్ఘ కాలపరిమితి కలిగిన స్వయంప్రతిపత్తి గల తార్కికత (long-horizon autonomous reasoning) వైపు వెళ్లేలా రూపొందించబడిన భారీ 2.4 ట్రిలియన్ పారామీటర్ల ఫ్లాగ్‌షిప్ మోడల్. బహుళ రోజుల వర్క్‌ఫ్లోలు మరియు సంక్లిష్టమైన పనుల అమలుపై దృష్టి సారించడం ద్వారా, ఈ మోడల్ రియాక్టివ్ LLMల నుండి ప్రోయాక్టివ్ AI ఏజెంట్ల వైపు ఒక ముఖ్యమైన మార్పును సూచిస్తుంది.

స్వయంప్రతిపత్తి కలిగిన మేధస్సు కోసం పారామీటర్ల విస్తరణ

Qwen3.8-Max ఒక సాంకేతిక శక్తివంతమైన మోడల్, ఇది మొత్తం 2.4 ట్రిలియన్ పారామీటర్లను ఉపయోగిస్తుంది మరియు ప్రతి క్వెరీకి 95 బిలియన్ యాక్టివ్ పారామీటర్లను కలిగి ఉంటుంది. Qwen3.5 ఆర్కిటెక్చర్‌పై ఆధారపడి రూపొందించబడిన ఈ మోడల్, "long-horizon" పనుల కోసం ప్రత్యేకంగా ఆప్టిమైజ్ చేయబడింది—అంటే AI రోజులు లేదా వారాల పాటు స్వతంత్రంగా పనిచేయవలసిన సంక్లిష్టమైన లక్ష్యాలు.

ఓపెన్-సోర్స్ కమ్యూనిటీ కోసం ఒక ముఖ్యమైన అడుగు వేస్తూ, Qwen-Max క్లాస్ యొక్క వెయిట్స్ (weights) వచ్చే వారం బహిరంగంగా అందుబాటులోకి వస్తాయని Alibaba ధృవీకరించింది. ఇది GPT మరియు Claude వంటి ఫ్రంటియర్ మోడళ్ల గుత్తాధిపత్యాన్ని సవాలు చేస్తుంది.

కోడింగ్ మరియు పరిశోధన ద్వారా స్వయంప్రతిపత్తిని నిరూపించడం

తన ఏజెంటిక్ సామర్థ్యాలను ప్రదర్శించడానికి, Alibaba కొన్ని కీలకమైన కేస్ స్టడీలను సమర్పించింది, ఇక్కడ మోడల్ మానవ జోక్యం లేకుండా పనిచేసింది:

  • Software Engineering: 16 రోజుల కాలంలో, Qwen3.8-Max స్వతంత్రంగా oh-my-cli అనే కమాండ్-లైన్ టూల్‌ను అభివృద్ధి చేసింది. ఇది తన స్వంత GitHub ఇష్యూలను నిర్వహించింది, కోడ్ రాసింది, టెస్ట్‌లను రన్ చేసింది మరియు 265 కమిట్లు (commits) మరియు 127 పుల్ రిక్వెస్ట్‌లను (pull requests) అమలు చేసింది.
  • Scientific Reproduction: "Unified Data Selection for LLM Reasoning" పేపర్ ఫలితాలను పునరుత్పత్తి చేయవలసి వచ్చినప్పుడు, ఈ మోడల్ 7,600 లైన్ల కోడ్ రాయడానికి 125 గంటల కంప్యూట్ సమయాన్ని వెచ్చించింది. ఇది కేవలం అసలు పరిశోధనను పునరావృతం చేయడమే కాకుండా, AIME24 మ్యాథ్ బెంచ్‌మార్క్ స్కోర్‌ను 2.7 పాయింట్లు మెరుగుపరిచింది.
  • Competitive Data Science: WWW2025 Multimodal Dialogue Intent Recognition Challengeలో, ఈ మోడల్ 526 మానవ బృందాలలో 458 బృందాల కంటే మెరుగైన ప్రదర్శన కనబరిచింది, 24 గంటల వ్యవధిలో తన ఖచ్చితత్వాన్ని (accuracy) 0.60 నుండి 0.853కి పెంచుకుంది.

సాఫ్ట్‌వేర్ మాత్రమే కాకుండా: చిప్ డిజైన్ మరియు ఆర్థిక అనుకరణ

Qwen3.8-Max యొక్క తార్కికత హార్డ్‌వేర్ మరియు ఆర్థిక శాస్త్రం వరకు విస్తరించింది. ఒక క్రిప్టోగ్రాఫిక్ సర్క్యూట్ డిజైన్ టాస్క్‌లో, మోడల్ 8,298 లాజిక్ గేట్ల ఉన్న ఒక "అతిగా ఉన్న" (bloated) డిజైన్‌ను క్రమంగా తగ్గించి కేవలం 678 గేట్లకు మాత్రమే పరిమితం చేసింది. OpenROAD టూల్‌ను ఉపయోగించడం ద్వారా, దీనివల్ల ఫిజికల్ చిప్ ఏరియాలో 81% తగ్గుదల నమోదైంది.

E-Commerce-Bench అని పిలువబడే ఒక సంక్లిష్టమైన రిటైల్ సిమ్యులేషన్‌లో, మోడల్ ఒక సిమ్యులేటెడ్ ఆర్థిక సంవత్సరంలో బహుళ ఆన్‌లైన్ స్టోర్‌లను నిర్వహించింది. 100,000 యువాన్‌లతో ప్రారంభించి, ఇది సప్లయర్ చర్చలను నిర్వహించింది, 152 స్కామర్లను గుర్తించింది మరియు సప్లై చైన్ అంతరాయాలను సమర్థవంతంగా ఎదుర్కొని 416,252 యువాన్‌లతో ముగించింది—ఇది తన ప్రారంభ మూలధనాన్ని నాలుగు రెట్లు పెంచడమే కాకుండా, రన్నర్-అప్ GLM 5.2 కంటే గణనీయంగా మెరుగైన ఫలితాలను సాధించింది.

మల్టీమోడల్ సరిహద్దులు మరియు బెంచ్‌మార్క్ ఆధిపత్యం

ఈ మోడల్ మల్టీమోడల్ ప్రాసెసింగ్ సరిహద్దులను కూడా విస్తరిస్తోంది, ఇది 200 పేజీల పత్రాలను మరియు 100 గంటలకు పైగా ఉండే వీడియోలను కూడా హ్యాండిల్ చేయగలదు. Alibaba RecreationBenchను కూడా పరిచయం చేస్తోంది. ఇది సోర్స్ కోడ్ యాక్సెస్ లేకుండా, కేవలం విజువల్ మరియు కీబోర్డ్ ఇంటరాక్షన్ ద్వారా రన్ అవుతున్న అప్లికేషన్‌లను (Windows, macOS, Android మొదలైన వాటిలో) పునర్నిర్మించే ఏజెంట్ సామర్థ్యాన్ని పరీక్షించే ఒక బెంచ్‌మార్క్.

అంతర్గత బెంచ్‌మార్క్‌ల ప్రకారం, Qwen3.8-Max టాప్-టైర్ మోడళ్లతో నేరుగా పోటీ పడుతోంది. PaperBenchలో 93 అనే అగ్రగామి స్కోర్‌తో సహా, అనేక విభాగాలలో ఇది Claude Opus 4.8 మరియు GPT-5.6 Sol కి సమానంగా లేదా వాటి కంటే మెరుగ్గా ఉంది.

ముఖ్య అంశాలు

  • Massive Scale: Qwen3.8-Max మొత్తం 2.4 ట్రిలియన్ పారామీటర్లు మరియు 95 బిలియన్ యాక్టివ్ పారామీటర్లను కలిగి ఉంది, ఇది బహుళ రోజుల స్వయంప్రతిపత్తి గల వర్క్‌ఫ్లోల కోసం ఆప్టిమైజ్ చేయబడింది.
  • Agentic Mastery: ఈ మోడల్ సంక్లిష్టమైన సాఫ్ట్‌వేర్ ఇంజనీరింగ్, చిప్ డిజైన్ ఆప్టిమైజేషన్ మరియు పూర్తి స్థాయి ఆర్థిక నిర్వహణను స్వతంత్రంగా నిర్వహించగల సామర్థ్యాన్ని ప్రదర్శించింది.
  • Open-Weight Impact: అనేక ఫ్రంటియర్ మోడళ్లలా కాకుండా, Alibaba Qwen-Max క్లాస్ యొక్క వెయిట్స్‌ను విడుదల చేయాలని యోచిస్తోంది, తద్వారా డెవలపర్‌లకు ఉన్నత స్థాయి ఏజెంటిక్ ఇంటెలిజెన్స్‌ను అపూర్వమైన రీతిలో అందుబాటులోకి తెస్తుంది.