Alibaba ਨੇ Qwen3.8-Max ਪੇਸ਼ ਕੀਤਾ: AI Agents ਲਈ ਇੱਕ 2.4 ਟ੍ਰਿਲੀਅਨ ਪੈਰਾਮੀਟਰ ਵਾਲਾ ਵਿਸ਼ਾਲ ਮਾਡਲ
Alibaba ਦੀ Qwen ਟੀਮ ਨੇ Qwen3.8-Max ਦਾ ਐਲਾਨ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਵਿਸ਼ਾਲ 2.4 ਟ੍ਰਿਲੀਅਨ ਪੈਰਾਮੀਟਰ ਵਾਲਾ ਫਲੈਗਸ਼ਿਪ ਮਾਡਲ ਹੈ। ਇਸ ਨੂੰ ਸਧਾਰਨ ਚੈਟ ਪ੍ਰੋਂਪਟਾਂ ਤੋਂ ਅੱਗੇ ਵਧ ਕੇ ਲੰਬੇ ਸਮੇਂ ਦੇ ਖੁਦਮੁਖਤਿਆਰ ਤਰਕ (long-horizon autonomous reasoning) ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ। ਕਈ ਦਿਨਾਂ ਦੇ ਵਰਕਫਲੋ ਅਤੇ ਗੁੰਝਲਦਾਰ ਕੰਮਾਂ ਦੇ ਸੰਚਾਲਨ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਕੇ, ਇਹ ਮਾਡਲ ਰਿਐਕਟਿਵ (reactive) LLMs ਤੋਂ ਪ੍ਰੋਐਕਟਿਵ (proactive) AI agents ਵੱਲ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਤਬਦੀਲੀ ਦਾ ਪ੍ਰਤੀਕ ਹੈ।
ਖੁਦਮੁਖਤਿਆਰ ਬੁੱਧੀ ਲਈ ਪੈਰਾਮੀਟਰਾਂ ਦਾ ਵਿਸਤਾਰ
Qwen3.8-Max ਇੱਕ ਤਕਨੀਕੀ ਸ਼ਕਤੀਸ਼ਾਲੀ ਮਾਡਲ ਹੈ, ਜੋ ਕਿ ਪ੍ਰਤੀ ਕੁਐਰੀ (query) 95 ਬਿਲੀਅਨ ਐਕਟਿਵ ਪੈਰਾਮੀਟਰਾਂ ਦੇ ਨਾਲ ਕੁੱਲ 2.4 ਟ੍ਰਿਲੀਅਨ ਪੈਰਾਮੀਟਰਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ। Qwen3.5 ਆਰਕੀਟੈਕਚਰ 'ਤੇ ਅਧਾਰਤ, ਇਹ ਮਾਡਲ ਖਾਸ ਤੌਰ 'ਤੇ "long-horizon" ਕੰਮਾਂ ਲਈ ਆਪਟੀਮਾਈਜ਼ ਕੀਤਾ ਗਿਆ ਹੈ—ਜਿਵੇਂ ਕਿ ਉਹ ਗੁੰਝਲਦਾਰ ਉਦੇਸ਼ ਜਿਨ੍ਹਾਂ ਲਈ AI ਨੂੰ ਕਈ ਦਿਨਾਂ ਜਾਂ ਹਫ਼ਤਿਆਂ ਤੱਕ ਸੁਤੰਤਰ ਰੂਪ ਵਿੱਚ ਕੰਮ ਕਰਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
ਓਪਨ-ਸੋਰਸ ਕਮਿਊਨਿਟੀ ਲਈ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਕਦਮ ਵਜੋਂ, Alibaba ਨੇ ਪੁਸ਼ਟੀ ਕੀਤੀ ਹੈ ਕਿ Qwen-Max ਕਲਾਸ ਦੇ weights ਅਗਲੇ ਹਫ਼ਤੇ ਜਨਤਕ ਤੌਰ 'ਤੇ ਉਪਲਬਧ ਕਰਵਾ ਦਿੱਤੇ ਜਾਣਗੇ, ਜੋ ਕਿ GPT ਅਤੇ Claude ਵਰਗੇ ਫਰੰਟੀਅਰ ਮਾਡਲਾਂ ਦੇ closed-door ਦਬਦਬੇ ਨੂੰ ਚੁਣੌਤੀ ਦਿੰਦੇ ਹਨ।
ਕੋਡਿੰਗ ਅਤੇ ਖੋਜ ਰਾਹੀਂ ਖੁਦਮੁਖਤਿਆਰੀ ਨੂੰ ਸਾਬਤ ਕਰਨਾ
ਆਪਣੀਆਂ agentic ਸਮਰੱਥਾਵਾਂ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਕਰਨ ਲਈ, Alibaba ਨੇ ਕਈ ਉੱਚ-ਅਹੁਦੇ ਵਾਲੇ ਕੇਸ ਅਧਿਐਨ (case studies) ਪੇਸ਼ ਕੀਤੇ ਜਿੱਥੇ ਮਾਡਲ ਨੇ ਮਨੁੱਖੀ ਦਖਲਅੰਦਾਜ਼ੀ ਤੋਂ ਬਿਨਾਂ ਕੰਮ ਕੀਤਾ:
- Software Engineering: 16 ਦਿਨਾਂ ਦੀ ਮਿਆਦ ਦੌਰਾਨ, Qwen3.8-Max ਨੇ ਖੁਦਮੁਖਤਿਆਰ ਰੂਪ ਵਿੱਚ command-line tool
oh-my-cliਵਿਕਸਿਤ ਕੀਤਾ। ਇਸ ਨੇ ਆਪਣੇ GitHub issues ਨੂੰ ਸੰਭਾਲਿਆ, ਕੋਡ ਲਿਖਿਆ, ਟੈਸਟ ਕੀਤੇ, ਅਤੇ 265 commits ਅਤੇ 127 pull requests ਨੂੰ ਅਮਲ ਵਿੱਚ ਲਿਆਂਦਾ। - Scientific Reproduction: "Unified Data Selection for LLM Reasoning" ਪੇਪਰ ਦੇ ਨਤੀਜਿਆਂ ਨੂੰ ਦੁਬਾਰਾ ਪੈਦਾ ਕਰਨ ਦੇ ਕੰਮ ਵਿੱਚ, ਮਾਡਲ ਨੇ 7,600 ਲਾਈਨਾਂ ਦਾ ਕੋਡ ਲਿਖਣ ਲਈ 125 ਘੰਟੇ ਦਾ ਕੰਪਿਊਟ ਟਾਈਮ ਲਗਾਇਆ। ਇਸ ਨੇ ਨਾ ਸਿਰਫ਼ ਅਸਲ ਖੋਜ ਦੀ ਨਕਲ ਕੀਤੀ ਬਲਕਿ AIME24 ਮੈਥ ਬੈਂਚਮਾਰਕ ਸਕੋਰ ਵਿੱਚ 2.7 ਅੰਕਾਂ ਦਾ ਸੁਧਾਰ ਵੀ ਕੀਤਾ।
- Competitive Data Science: WWW2025 Multimodal Dialogue Intent Recognition Challenge ਵਿੱਚ, ਮਾਡਲ ਨੇ 526 ਮਨੁੱਖੀ ਟੀਮਾਂ ਵਿੱਚੋਂ 458 ਨੂੰ ਪਛਾੜ ਦਿੱਤਾ, ਅਤੇ 24 ਘੰਟਿਆਂ ਦੇ ਅੰਦਰ ਆਪਣੀ ਸ਼ੁੱਧਤਾ (accuracy) ਨੂੰ 0.60 ਤੋਂ ਵਧਾ ਕੇ 0.853 ਕਰ ਦਿੱਤਾ।
ਸਾਫਟਵੇਅਰ ਤੋਂ ਪਰੇ: ਚਿੱਪ ਡਿਜ਼ਾਈਨ ਅਤੇ ਵਿੱਤੀ ਸਿਮੂਲੇਸ਼ਨ
Qwen3.8-Max ਦਾ ਤਰਕ ਹਾਰਡਵੇਅਰ ਅਤੇ ਅਰਥ ਸ਼ਾਸਤਰ ਤੱਕ ਫੈਲਿਆ ਹੋਇਆ ਹੈ। ਇੱਕ ਕ੍ਰਿਪਟੋਗ੍ਰਾਫਿਕ ਸਰਕਟ ਡਿਜ਼ਾਈਨ ਕਾਰਜ ਵਿੱਚ, ਮਾਡਲ ਨੇ ਇੱਕ "bloated" ਡਿਜ਼ਾਈਨ ਨੂੰ 8,298 ਲੌਜਿਕ ਗੇਟਾਂ ਤੋਂ ਘਟਾ ਕੇ ਸਿਰਫ਼ 678 ਗੇਟਾਂ ਤੱਕ ਲਿਆਉਣ ਲਈ ਵਾਰ-ਵਾਰ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ। OpenROAD ਟੂਲ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ਇਸ ਦੇ ਨਤੀਜੇ ਵਜੋਂ ਫਿਜ਼ੀਕਲ ਚਿੱਪ ਖੇਤਰ ਵਿੱਚ 81% ਦੀ ਕਮੀ ਆਈ।
E-Commerce-Bench ਨਾਮਕ ਇੱਕ ਗੁੰਝਲਦਾਰ ਰਿਟੇਲ ਸਿਮੂਲੇਸ਼ਨ ਵਿੱਚ, ਮਾਡਲ ਨੇ ਇੱਕ ਸਿਮੂਲੇਟਡ ਵਿੱਤੀ ਸਾਲ ਦੌਰਾਨ ਕਈ ਆਨਲਾਈਨ ਸਟੋਰਾਂ ਦਾ ਪ੍ਰਬੰਧਨ ਕੀਤਾ। 100,000 ਯੂਆਨ ਨਾਲ ਸ਼ੁਰੂ ਕਰਕੇ, ਇਸ ਨੇ ਸਪਲਾਇਰਾਂ ਨਾਲ ਗੱਲਬਾਤ ਕੀਤੀ, 152 ਠੱਗਾਂ ਦੀ ਪਛਾਣ ਕੀਤੀ, ਅਤੇ ਸਪਲਾਈ ਚੇਨ ਵਿੱਚ ਆ ਰਹੀਆਂ ਰੁਕਾਵਟਾਂ ਦਾ ਪ੍ਰਬੰਧਨ ਕੀਤਾ, ਜਿਸ ਨਾਲ ਅੰਤ ਵਿੱਚ 416,252 ਯੂਆਨ ਬਚੇ—ਜਿਸ ਨਾਲ ਇਸਦੀ ਸ਼ੁਰੂਆਤੀ ਪੂੰਜੀ ਚਾਰ ਗੁਣਾ ਹੋ ਗਈ ਅਤੇ ਇਹ ਦੂਜੇ ਨੰਬਰ 'ਤੇ ਰਹਿਣ ਵਾਲੇ GLM 5.2 ਨਾਲੋਂ ਕਾਫ਼ੀ ਬਿਹਤਰ ਰਿਹਾ।
ਮਲਟੀਮੋਡਲ ਸਰਹੱਦਾਂ ਅਤੇ ਬੈਂਚਮਾਰਕ ਦਬਦਬਾ
ਇਹ ਮਾਡਲ ਮਲਟੀਮੋਡਲ ਪ੍ਰੋਸੈਸਿੰਗ ਦੀਆਂ ਸੀਮਾਵਾਂ ਨੂੰ ਵੀ ਵਧਾਉਂਦਾ ਹੈ, ਜੋ ਕਿ 200 ਪੰਨਿਆਂ ਦੇ ਦਸਤਾਵੇਜ਼ਾਂ ਅਤੇ 100 ਘੰਟਿਆਂ ਤੋਂ ਵੱਧ ਦੇ ਵੀਡੀਓਜ਼ ਨੂੰ ਸੰਭਾਲਣ ਦੇ ਯੋਗ ਹੈ। Alibaba RecreationBench ਵੀ ਪੇਸ਼ ਕਰ ਰਿਹਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਅਜਿਹਾ ਬੈਂਚਮਾਰਕ ਹੈ ਜੋ ਸਿਰਫ਼ ਵਿਜ਼ੂਅਲ ਅਤੇ ਕੀਬੋਰਡ ਇੰਟਰੈਕਸ਼ਨ ਰਾਹੀਂ (ਸੋਰਸ ਕੋਡ ਤੱਕ ਪਹੁੰਚ ਤੋਂ ਬਿਨਾਂ) ਚੱਲ ਰਹੀਆਂ ਐਪਲੀਕੇਸ਼ਨਾਂ (Windows, macOS, Android, ਆਦਿ 'ਤੇ) ਨੂੰ ਮੁੜ ਸਿਰਜਣ ਦੀ ਇੱਕ ਏਜੰਟ ਦੀ ਯੋਗਤਾ ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ।
ਅੰਦਰੂਨੀ ਬੈਂਚਮਾਰਕਾਂ ਅਨੁਸਾਰ, Qwen3.8-Max ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਉੱਚ-ਦਰਜੇ ਦੇ ਮਾਡਲਾਂ ਨਾਲ ਮੁਕਾਬਲਾ ਕਰਦਾ ਹੈ, ਜੋ ਕਈ ਸ਼੍ਰੇਣੀਆਂ ਵਿੱਚ Claude Opus 4.8 ਅਤੇ GPT-5.6 Sol ਦੇ ਨੇੜੇ ਜਾਂ ਉੱਪਰ ਹੈ, ਜਿਸ ਵਿੱਚ PaperBench 'ਤੇ 93 ਦਾ ਲੀਡਿੰਗ ਸਕੋਰ ਵੀ ਸ਼ਾਮਲ ਹੈ।
ਮੁੱਖ ਗੱਲਾਂ
- Massive Scale: Qwen3.8-Max ਵਿੱਚ ਕੁੱਲ 2.4 ਟ੍ਰਿਲੀਅਨ ਪੈਰਾਮੀਟਰ ਅਤੇ 95 ਬਿਲੀਅਨ ਐਕਟਿਵ ਪੈਰਾਮੀਟਰ ਹਨ, ਜੋ ਕਿ ਕਈ ਦਿਨਾਂ ਦੇ ਖੁਦਮੁਖਤਿਆਰ ਵਰਕਫਲੋ ਲਈ ਆਪਟੀਮਾਈਜ਼ ਕੀਤੇ ਗਏ ਹਨ।
- Agentic Mastery: ਮਾਡਲ ਨੇ ਗੁੰਝਲਦਾਰ ਸਾਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ, ਚਿੱਪ ਡਿਜ਼ਾਈਨ ਆਪਟੀਮਾਈਜ਼ੇਸ਼ਨ, ਅਤੇ ਪੂਰੇ ਪੱਧਰ ਦੇ ਵਿੱਤੀ ਪ੍ਰਬੰਧਨ ਨੂੰ ਖੁਦਮੁਖਤਿਆਰ ਰੂਪ ਵਿੱਚ ਸੰਭਾਲਣ ਦੀ ਯੋਗਤਾ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਕੀਤਾ ਹੈ।
- Open-Weight Impact: ਕਈ ਫਰੰਟੀਅਰ ਮਾਡਲਾਂ ਦੇ ਉਲਟ, Alibaba Qwen-Max ਕਲਾਸ ਦੇ weights ਨੂੰ ਰਿਲੀਜ਼ ਕਰਨ ਦੀ ਯੋਜਨਾ ਬਣਾ ਰਿਹਾ ਹੈ, ਜੋ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਉੱਚ-ਪੱਧਰੀ agentic ਬੁੱਧੀ ਤੱਕ ਬੇਮਿਸਾਲ ਪਹੁੰਚ ਪ੍ਰਦਾਨ ਕਰੇਗਾ।
