Alibaba ਨੇ Qwen3.8-Max ਨੂੰ ਪੇਸ਼ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ 2.4 ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ Mixture-of-Experts (MoE) ਮਾਡਲ ਹੈ ਜਿਸ ਨੇ OSWorld-Verified ਬੈਂਚਮਾਰਕ 'ਤੇ 86.1% ਸਫਲਤਾ ਦਰ ਪ੍ਰਦਰਸ਼ਿਤ ਕੀਤੀ ਹੈ—Alibaba ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਇਹ ਸਕੋਰ GPT-5.6, Sol Max ਅਤੇ Fable 5 ਨੂੰ ਪਛਾੜ ਦਿੰਦਾ ਹੈ। ਇਹ ਬੈਂਚਮਾਰਕ ਇੱਕ AI ਦੀ ਆਪਰੇਟਿੰਗ ਸਿਸਟਮ ਨਾਲ ਇੰਟਰੈਕਟ ਕਰਨ, ਸੌਫਟਵੇਅਰ ਇੰਸਟਾਲ ਕਰਨ ਅਤੇ ਕੋਡ ਨੂੰ ਡੀਬੱਗ ਕਰਨ ਦੀ ਯੋਗਤਾ ਨੂੰ ਮਾਪਦਾ ਹੈ, ਜੋ ਕਿ ਖੁਦਮੁਖਤਿਆਰ (autonomous) ਸੌਫਟਵੇਅਰ-ਇੰਜੀਨੀਅਰਿੰਗ ਏਜੰਟਾਂ ਦਾ ਅਧਾਰ ਹਨ।

ਖੁਦਮੁਖਤਿਆਰ ਏਜੰਟਾਂ (autonomous agents) ਦੀ ਦੌੜ

ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲ (Large language models) ਚੈਟ-ਸ਼ੈਲੀ ਦੇ ਸਹਾਇਕਾਂ ਤੋਂ ਅੱਗੇ ਵਧ ਕੇ ਅਜਿਹੇ ਟੂਲ ਬਣ ਗਏ ਹਨ ਜੋ ਕੋਡ ਲਿਖ ਸਕਦੇ ਹਨ, ਟੈਸਟ ਕਰ ਸਕਦੇ ਹਨ ਅਤੇ ਇੱਥੋਂ ਤੱਕ ਕਿ ਡਿਪਲੋਏ (deploy) ਵੀ ਕਰ ਸਕਦੇ ਹਨ। ਉਹ ਕੰਪਨੀਆਂ ਜੋ ਭਰੋਸੇਯੋਗਤਾ ਨਾਲ ਰੁਟੀਨ ਇੰਜੀਨੀਅਰਿੰਗ ਕੰਮ AI ਨੂੰ ਸੌਂਪ ਸਕਦੀਆਂ ਹਨ, ਉਹ ਸਟਾਫਿੰਗ ਲਾਗਤਾਂ ਨੂੰ ਘਟਾ ਸਕਦੀਆਂ ਹਨ ਅਤੇ ਪ੍ਰੋਡਕਟ ਚੱਕਰਾਂ ਨੂੰ ਤੇਜ਼ ਕਰ ਸਕਦੀਆਂ ਹਨ। OSWorld-Verified ਬੈਂਚਮਾਰਕ "ਏਜੈਂਟਿਕ" (agentic) ਯੋਗਤਾ ਲਈ ਇੱਕ ਅਸਲ ਮਾਪਦੰਡ ਬਣ ਗਿਆ ਹੈ ਕਿਉਂਕਿ ਇਸ ਲਈ ਸਿਰਫ਼ ਸਟੈਟਿਕ ਟੈਕਸਟ ਜਨਰੇਸ਼ਨ ਤੋਂ ਵੱਧ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ; ਇਹ ਇੱਕ ਸਿਸਟਮ ਨਾਲ ਅਸਲ ਦੁਨੀਆ ਦੇ ਇੰਟਰੈਕਸ਼ਨ ਦੀ ਮੰਗ ਕਰਦਾ ਹੈ।

Qwen3.8-Max ਕੀ ਲੈ ਕੇ ਆਉਂਦਾ ਹੈ

  • 2.4 T ਪੈਰਾਮੀਟਰਾਂ ਵਾਲੀ MoE ਆਰਕੀਟੈਕਚਰ – ਹਰੇਕ ਟੋਕਨ ਲਈ 64 ਤੱਕ ਐਕਸਪਰਟ ਸਬ-ਨੈੱਟਵਰਕਾਂ ਦੀ ਸਲਾਹ ਲਈ ਜਾ ਸਕਦੀ ਹੈ, ਇੱਕ ਅਜਿਹਾ ਡਿਜ਼ਾਈਨ ਜਿਸ ਬਾਰੇ Alibaba ਦਾ ਦਾਅਵਾ ਹੈ ਕਿ ਇਹ ਕੰਪਿਊਟ ਖਰਚੇ ਨੂੰ ਲਗਭਗ 40% ਤੱਕ ਘਟਾਉਂਦਾ ਹੈ।
  • ਮਲਟੀਮੋਡਲ ਪ੍ਰੋਂਪਟ ਹੈਂਡਲਿੰਗ – ਇਹ ਮਾਡਲ ਟੈਕਸਟ, ਚਿੱਤਰ (images) ਅਤੇ ਸਟ੍ਰਕਚਰਡ ਡੇਟਾ ਨੂੰ ਇਕੱਠੇ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਇੱਕ ਸਿੰਗਲ ਰਿਕੁਐਸਟ ਇੱਕ UI ਦਾ ਵਰਣਨ ਕਰ ਸਕਦੀ ਹੈ, ਸਕ੍ਰੀਨਸ਼ੌਟ ਦਿਖਾ ਸਕਦੀ ਹੈ ਅਤੇ ਕੌਂਫਿਗਰੇਸ਼ਨ ਫਾਈਲਾਂ ਸਪਲਾਈ ਕਰ ਸਕਦੀ ਹੈ।
  • 64 k ਟੋਕਨ ਕੰਟੈਕਸਟ ਵਿੰਡੋ – ਪੂਰੇ ਕੋਡਬੇਸ, ਲੌਗ ਫਾਈਲਾਂ ਜਾਂ ਲੰਬੀਆਂ ਤਕਨੀਕੀ ਰਿਪੋਰਟਾਂ ਨੂੰ ਟੁਕੜਿਆਂ ਵਿੱਚ ਵੰਡੇ ਬਿਨਾਂ ਰੱਖਣ ਲਈ ਕਾਫ਼ੀ ਜਗ੍ਹਾ।

ਇਹ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਉਨ੍ਹਾਂ "end-to-end" ਵਰਕਫਲੋਜ਼ ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦੀਆਂ ਹਨ ਜਿਨ੍ਹਾਂ 'ਤੇ ਸੌਫਟਵੇਅਰ ਟੀਮਾਂ ਘੰਟਿਆਂ ਬਿਤਾਉਂਦੀਆਂ ਹਨ: ਡਿਪੈਂਡੈਂਸੀਆਂ (dependencies) ਖਿੱਚਣਾ, ਲੌਗ ਸਕੈਨ ਕਰਨਾ, ਬੱਗ ਪੈਚ ਕਰਨਾ ਅਤੇ ਦਸਤਾਵੇਜ਼ (documentation) ਤਿਆਰ ਕਰਨਾ।

ਮਾਈਕਰੋਸਕੋਪ ਦੇ ਅਧੀਨ ਅੰਕੜੇ

ਕੰਮ (Task) ਰਿਪੋਰਟ ਕੀਤੇ ਗਏ ਮੈਟ੍ਰਿਕ (Reported metric)
OSWorld-Verified (ਏਜੈਂਟਿਕ OS ਇੰਟਰੈਕਸ਼ਨ) 86.1% ਸਫਲਤਾ
ਕੋਡ ਜਨਰੇਸ਼ਨ (HumanEval-Plus) 78.4% ਪਾਸ
ਮਲਟੀਮੋਡਲ ਰੀਜ਼ਨਿੰਗ (MM-Bench) 84.3%
ਲੌਂਗ-ਕੰਟੈਕਸਟ ਸਮਰੀਜ਼ੇਸ਼ਨ (50 k-ਟੋਕਨ ਟੈਸਟ) 90.2%

ਸਾਰੇ ਅੰਕੜੇ Alibaba ਦੇ ਅੰਦਰੂਨੀ ਟੈਸਟਿੰਗ ਤੋਂ ਹਨ। ਜੇਕਰ ਇਹ ਸਹੀ ਸਾਬਤ ਹੁੰਦੇ ਹਨ, ਤਾਂ ਇਹ ਮਾਡਲ ਉਦਯੋਗਾਂ (enterprises) ਨੂੰ ਇੱਕ ਸਿੰਗਲ API ਪ੍ਰਦਾਨ ਕਰੇਗਾ ਜੋ ਕੋਡ, ਚਿੱਤਰ ਅਤੇ ਵੱਡੇ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਸੰਭਾਲ ਸਕਦਾ ਹੈ, ਜਦੋਂ ਕਿ ਇਨਫਰੈਂਸ (inference) ਲਾਗਤਾਂ ਨੂੰ ਕਈ ਡੈਂਸ-ਮਾਡਲ (dense-model) ਪ੍ਰਤੀਯੋਗੀਆਂ ਨਾਲੋਂ ਘੱਟ ਰੱਖਦਾ ਹੈ।

ਜੋਖਮ ਅਤੇ ਸੁਤੰਤਰ ਵੈਲੀਡੇਸ਼ਨ ਦੀ ਲੋੜ

ਤੀਜੀ-ਪਾਰਟੀ ਵੈਰੀਫਿਕੇਸ਼ਨ ਦੀ ਅਣਹੋਂਦ ਸਭ ਤੋਂ ਤੁਰੰਤ ਚੇਤਾਵਨੀ ਹੈ। ਬੈਂਚਮਾਰਕਾਂ ਨੂੰ ਟਿਊਨ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ, ਪ੍ਰੋਂਪਟਾਂ ਨੂੰ ਅਪਟੀਮਾਈਜ਼ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ ਜਾਂ ਕਿਸੇ ਖਾਸ ਆਰਕੀਟੈਕਚਰ ਦੇ ਪੱਖ ਵਿੱਚ ਟੈਸਟ ਸੈੱਟਾਂ ਨੂੰ ਫਿਲਟਰ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ। ਬਾਹਰੀ ਰੀਪਲੀਕੇਸ਼ਨ ਤੋਂ ਬਿਨਾਂ, ਇਹ ਦਾਅਵਾ ਕਿ Qwen3.8-Max GPT-5.6 ਨੂੰ "ਪਛਾੜ" ਦਿੰਦਾ ਹੈ, ਅਸਥਾਈ ਰਹਿੰਦਾ ਹੈ। ਇਸ ਤੋਂ ਇਲਾਵਾ, MoE ਮਾਡਲ ਅਸਮਾਨ ਪ੍ਰਦਰਸ਼ਨ ਦਿਖਾ ਸਕਦੇ ਹਨ: ਕੁਝ ਟੋਕਨ ਘੱਟ-ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਐਕਸਪਰਟਾਂ ਵੱਲ ਜਾ ਸਕਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਕਦੇ-ਕਦੇ ਹੈਲੂਸੀਨੇਸ਼ਨ (hallucinations) ਜਾਂ ਅਸੰਗਤ ਆਉਟਪੁੱਟ ਹੋ ਸਕਦਾ ਹੈ—ਇਹ ਉਹ ਮੁੱਦੇ ਹਨ ਜੋ ਉਦੋਂ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦੇ ਹਨ ਜਦੋਂ ਇੱਕ AI ਤੋਂ ਪ੍ਰੋਡਕਸ਼ਨ ਸਿਸਟਮਾਂ ਨੂੰ ਸੋਧਣ ਦੀ ਉਮੀਦ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।

ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ

  • ਸੁਤੰਤਰ ਰੀਪਲੀਕੇਸ਼ਨ – ਖੋਜਕਰਤਾ ਅਤੇ ਕਲਾਉਡ ਗਾਹਕ ਸੰਭਵ ਤੌਰ 'ਤੇ ਜਨਤਕ ਤੌਰ 'ਤੇ ਉਪਲਬਧ ਹਾਰਡਵੇਅਰ 'ਤੇ ਉਹੀ OSWorld-Verified ਸੂਟ ਅਤੇ HumanEval-Plus ਟੈਸਟ ਚਲਾਉਣਗੇ।
  • ਕੀਮਤ ਅਤੇ ਲੇਟੈਂਸੀ (latency) – Alibaba Cloud ਦੀ API ਕੀਮਤ ਇਹ ਪ੍ਰਗਟ ਕਰੇਗੀ ਕਿ ਕੀ 40% ਕੰਪਿਊਟ ਬਚਤ ਡਿਵੈਲਪਰਾਂ ਲਈ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਲਾਗਤ ਲਾਭ ਵਿੱਚ ਬਦਲਦੀ ਹੈ।
  • ਸੁਰੱਖਿਆ ਲਈ ਟੂਲਿੰਗ – ਜਿਵੇਂ-ਜਿਵੇਂ ਖੁਦਮੁਖਤਿਆਰ ਏਜੰਟ ਇਨਫਰਾਸਟ੍ਰਕਚਰ 'ਤੇ ਵਧੇਰੇ ਨਿਯੰਤਰਣ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ, ਈਕੋਸਿਸਟਮ ਨੂੰ ਨਿਗਰਾਨੀ, ਰੋਲਬੈਕ (rollback) ਅਤੇ ਆਡਿਟ ਪ੍ਰਕਿਰਿਆਵਾਂ ਦੀ ਲੋੜ ਹੋਵੇਗੀ ਜੋ ਅਜੇ ਵੀ ਸ਼ੁਰੂਆਤੀ ਪੜਾਵਾਂ ਵਿੱਚ ਹਨ।

ਜੇਕਰ Qwen3.8-Max ਆਪਣੇ ਮੁੱਖ ਅੰਕੜਿਆਂ 'ਤੇ ਖਰਾ ਉਤਰਦਾ ਹੈ, ਤਾਂ ਇੱਕ ਗੱਲਬਾਤ ਕਰਨ ਵਾਲੇ ਸਹਾਇਕ ਅਤੇ ਇੱਕ ਸਵੈ-ਨਿਰਭਰ ਇੰਜੀਨੀਅਰਿੰਗ ਬੋਟ ਵਿਚਕਾਰ ਦਾ ਪਾੜਾ ਡਰਾਮੇਟਿਕ ਤੌਰ 'ਤੇ ਘਟ ਜਾਵੇਗਾ। ਅਗਲੇ ਕੁਝ ਮਹੀਨੇ ਇਹ ਦਿਖਾਉਣਗੇ ਕਿ ਕੀ ਮਾਡਲ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਜਾਂਚ ਵਿੱਚ ਟਿਕਦਾ ਹੈ ਅਤੇ ਕੀ ਉਦਯੋਗ ਇਸਨੂੰ ਆਪਣੇ ਆਟੋਮੇਟਡ ਡਿਵੈਲਪਮੈਂਟ ਪਾਈਪਲਾਈਨਾਂ ਦੇ ਰੀੜ੍ਹ ਦੀ ਹੱਡੀ ਵਜੋਂ ਅਪਣਾਉਂਦੇ ਹਨ।