20 ਵੱਡੇ-ਭਾਸ਼ਾ ਮਾਡਲਾਂ (LLMs) ਦਾ ਇੱਕ ਨਵਾਂ ਬੈਂਚਮਾਰਕ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ 2026 ਵਿੱਚ ਕੋਈ ਵੀ ਇੱਕ ਮਾਡਲ ਕਿਸੇ ਵੀ ਕੰਮ 'ਤੇ ਹਾਵੀ ਨਹੀਂ ਹੈ। ਹਰੇਕ ਕੰਮ ਨੂੰ ਇੱਕ ਮਾਹਰ (specialist) ਕੋਲ ਭੇਜਣ ਨਾਲ ਲਾਗਤ ਘਟਾਈ ਜਾ ਸਕਦੀ ਹੈ ਅਤੇ ਕੰਮ ਦੀ ਡਿਲੀਵਰੀ ਤੇਜ਼ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ। ਇਸ ਅਧਿਐਨ ਵਿੱਚ Anthropic, OpenAI, Google, xAI, Meta ਅਤੇ ਕਈ ਚੀਨੀ ਲੈਬਾਂ ਦੀ ਤੁਲਨਾ ਕੀਤੀ ਗਈ, ਅਤੇ ਪਾਇਆ ਗਿਆ ਕਿ ਗਲਤ ਮਾਡਲ ਦੀ ਚੋਣ ਕਰਨ ਨਾਲ ਪੈਸਾ ਅਤੇ ਸਮਾਂ ਬਰਬਾਦ ਹੁੰਦਾ ਹੈ।
ਇੱਕ ਸਿੰਗਲ LLM ਹੁਣ ਕਿਉਂ ਕੰਮ ਨਹੀਂ ਕਰਦਾ
ਇੱਕ ਸਾਲ ਪਹਿਲਾਂ, ਜ਼ਿਆਦਾਤਰ ਡਿਵੈਲਪਰ ਕੋਡ ਤੋਂ ਲੈ ਕੇ ਖੋਜ ਦੇ ਜਵਾਬਾਂ ਤੱਕ, ਹਰ ਚੀਜ਼ ਲਈ ਇੱਕ ਹੀ ਮਾਡਲ ਦੀ ਚੋਣ ਕਰਦੇ ਸਨ। ਕੋਡਿੰਗ, ਟੂਲ ਆਰਕੇਸਟ੍ਰੇਸ਼ਨ (tool orchestration), ਡੂੰਘੀ ਤਰਕਸ਼ਕਤੀ (deep reasoning) ਅਤੇ ਸ਼ੁੱਧ ਲਾਗਤ-ਪ੍ਰਭਾਵਸ਼ੀਲਤਾ (cost-effectiveness) ਲਈ ਬਣਾਏ ਗਏ ਮਾਡਲਾਂ ਵਿਚਕਾਰ ਪਾੜਾ ਇੰਨਾ ਵੱਧ ਗਿਆ ਹੈ ਕਿ ਹੁਣ "ਸਭ ਲਈ ਇੱਕੋ ਜਿਹਾ" (one-size-fits-all) ਪਹੁੰਚ ਫਾਇਦੇ ਨਾਲੋਂ ਨੁਕਸਾਨ ਜ਼ਿਆਦਾ ਕਰਦੀ ਹੈ।
ਬੈਂਚਮਾਰਕ ਕਿਵੇਂ ਬਣਾਇਆ ਗਿਆ
ਮੈਂ ਸਾਰੇ 20 ਮਾਡਲਾਂ 'ਤੇ ਇੱਕੋ ਜਿਹਾ ਕੰਮ (task set) ਚਲਾਇਆ, ਵੈਂਡਰਾਂ ਦੇ ਮਾਰਕੀਟਿੰਗ ਦਾਅਵਿਆਂ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕੀਤਾ ਅਤੇ ਸੁਤੰਤਰ, ਦੁਹਰਾਉਣਯੋਗ ਡੇਟਾ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕੀਤਾ। ਕੰਮਾਂ ਨੂੰ ਚਾਰ ਸ਼੍ਰੇਣੀਆਂ ਵਿੱਚ ਵੰਡਿਆ ਗਿਆ ਸੀ:
- ਕੋਡਿੰਗ ਅਤੇ ਖੁਦਮੁਖਤਿਆਰੀ (Coding and autonomy) – ਪ੍ਰੋਡਕਸ਼ਨ-ਗ੍ਰੇਡ ਕੋਡ ਤਿਆਰ ਕਰਨਾ, ਏਜੈਂਟਿਕ ਲੂਪਸ (agentic loops) ਨੂੰ ਸੰਭਾਲਣਾ।
- ਟੂਲ ਦੀ ਵਰਤੋਂ ਅਤੇ ਆਰਕੇਸਟ੍ਰੇਸ਼ਨ (Tool use and orchestration) – ਬਾਹਰੀ APIs ਨੂੰ ਕਾਲ ਕਰਨਾ, ਫਾਈਲਾਂ ਨੂੰ ਸੰਭਾਲਣਾ, ਕੰਪਿਊਟਰ ਚਲਾਉਣਾ।
- ਤਰਕ ਅਤੇ ਵਿਗਿਆਨ (Reasoning and science) – ਗਣਿਤ ਦੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰਨਾ, ਖੋਜ ਡੇਟਾ ਦੀ ਵਿਆਖਿਆ ਕਰਨਾ।
- ਮੁੱਲ (Value) – ਘੱਟ ਤੋਂ ਘੱਟ ਸੰਭਵ ਲਾਗਤ 'ਤੇ ਸਵੀਕਾਰਯੋਗ ਗੁਣਵੱਤਾ ਪ੍ਰਦਾਨ ਕਰਨਾ।
ਨਤੀਜਾ ਇੱਕ ਅਜਿਹਾ ਮੈਟ੍ਰਿਕਸ (matrix) ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ ਜੋ ਇੰਜੀਨੀਅਰਾਂ ਨੂੰ ਸਭ ਤੋਂ ਪ੍ਰਚਲਿਤ ਨਾਮ ਦੀ ਚੋਣ ਕਰਨ ਦੀ ਬਜਾਏ, ਕਿਸੇ ਕੰਮ ਦੀ ਲੋੜ ਨੂੰ ਮਾਡਲ ਦੀ ਤਾਕਤ ਨਾਲ ਮਿਲਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ।
ਕਿਹੜੇ ਮਾਡਲ ਹਰੇਕ ਸ਼੍ਰੇਣੀ ਦੀ ਅਗਵਾਈ ਕਰਦੇ ਹਨ
ਕੋਡਿੰਗ ਅਤੇ ਖੁਦਮੁਖਤਿਆਰੀ – Claude Opus 5 ਅਤੇ Fable 5 ਨੇ ਲਗਾਤਾਰ ਸੂਚੀ ਵਿੱਚ ਸਿਖਰ 'ਤੇ ਰਹਿ ਕੇ, ਸਭ ਤੋਂ ਘੱਟ ਕੋਸ਼ਿਸ਼ਾਂ (retries) ਨਾਲ ਗੁੰਝਲਦਾਰ ਕੋਡ ਜਨਰੇਸ਼ਨ ਅਤੇ ਮਲਟੀ-ਸਟੈਪ ਲੂਪਸ ਨੂੰ ਸੰਭਾਲਿਆ। GPT-5.6 Sol ਇਸ ਤੋਂ ਬਿਲਕੁਲ ਪਿੱਛੇ ਰਿਹਾ, ਜੋ ਉਦੋਂ ਇੱਕ ਮਜ਼ਬੂਤ ਵਿਕਲਪ ਵਜੋਂ ਕੰਮ ਕਰਦਾ ਹੈ ਜਦੋਂ ਉਪਰਲੇ ਦੋ ਮਾਡਲ ਉਪਲਬਧ ਨਹੀਂ ਹੁੰਦੇ।
ਟੂਲ ਦੀ ਵਰਤੋਂ ਅਤੇ ਆਰਕੇਸਟ੍ਰੇਸ਼ਨ – ਬਾਹਰੀ ਟੂਲਸ ਨੂੰ ਕਾਲ ਕਰਨ ਵਿੱਚ Meta ਦਾ Muse Spark 1.1 ਸਭ ਤੋਂ ਭਰੋਸੇਮੰਦ ਸਾਬਤ ਹੋਇਆ, ਜਦੋਂ ਕਿ Gemini 3.6 Flash ਸਪ੍ਰੈਡਸ਼ੀਟ ਮੈਨੀਪੂਲੇਸ਼ਨ ਅਤੇ UI ਆਟੋਮੇਸ਼ਨ ਵਰਗੇ ਸ਼ੁੱਧ ਕੰਪਿਊਟਰ-ਵਰਤੋਂ ਦੇ ਦ੍ਰਿਸ਼ਾਂ ਵਿੱਚ ਉੱਤਮ ਰਿਹਾ।
ਤਰਕ ਅਤੇ ਵਿਗਿਆਨ – ਗਣਿਤ ਅਤੇ ਖੋਜ ਲਈ GPT-5.6 Sol ਅਤੇ Gemini 3.1 Pro ਚੋਟੀ ਦੀਆਂ ਚੋਣਾਂ ਸਨ।
ਵੱਧ ਤੋਂ ਵੱਧ ਮੁੱਲ – Open-weight ਚੀਨੀ ਮਾਡਲ—GLM-5.2 ਅਤੇ DeepSeek V4—ਫਲੈਗਸ਼ਿਪ ਆਫਰਿੰਗਜ਼ ਦੀ ਪ੍ਰਤੀ-ਟੋਕਨ ਕੀਮਤ ਦੇ ਇੱਕ ਹਿੱਸੇ 'ਤੇ ਫਰੰਟੀਅਰ-ਲੇਵਲ ਦੀ ਗੁਣਵੱਤਾ ਤੱਕ ਪਹੁੰਚ ਗਏ। ਉਹ ਟੀਮਾਂ ਜੋ ਥੋੜ੍ਹੀ ਜਿਹੀ ਗੁਣਵੱਤਾ ਵਿੱਚ ਕਮੀ ਨੂੰ ਸਹਿ ਸਕਦੀਆਂ ਹਨ, ਉਹਨਾਂ ਨੂੰ ਸਭ ਤੋਂ ਵਧੀਆ ਫਾਇਦਾ ਮਿਲਦਾ ਹੈ।
Open-weight ਲੀਡਰ – Kimi K3 ਵਰਤਮਾਨ ਵਿੱਚ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਖੁੱਲ੍ਹੇ ਤੌਰ 'ਤੇ ਰਿਲੀਜ਼ ਕੀਤੇ ਗਏ ਮਾਡਲ ਵਜੋਂ ਖੜ੍ਹਾ ਹੈ। Meta ਦਾ Llama 4 ਪਿੱਛੇ ਰਹਿ ਗਿਆ ਹੈ।
ਸਿੱਟਾ: "ਸਭ ਤੋਂ ਸਮਾਰਟ" ਮਾਡਲ ਹਮੇਸ਼ਾ ਕਿਸੇ ਖਾਸ ਕੰਮ ਲਈ ਸਭ ਤੋਂ ਕਿਫਾਇਤੀ ਜਾਂ ਤੇਜ਼ ਨਹੀਂ ਹੁੰਦਾ।
ਪ੍ਰੋਡਕਸ਼ਨ ਸਿਸਟਮਾਂ ਲਈ ਰੂਟਿੰਗ ਰਣਨੀਤੀ
- ਰੂਟ ਕਰੋ, ਸਟੈਂਡਰਡਾਈਜ਼ ਨਾ ਕਰੋ – ਮਾਡਲ ਦੀ ਚੋਣ ਨੂੰ ਇੱਕ ਗਤੀਸ਼ੀਲ ਫੈਸਲੇ ਵਜੋਂ ਲਓ, ਨਾ ਕਿ ਇੱਕ ਸਥਿਰ ਡਿਫੌਲਟ ਵਜੋਂ।
- ਡਿਫੌਲਟ ਵਜੋਂ ਸਸਤਾ ਚੁਣੋ, ਅਸਫਲਤਾ 'ਤੇ ਅੱਗੇ ਵਧੋ – ਉਸ ਸਭ ਤੋਂ ਘੱਟ-ਲਾਗਤ ਵਾਲੇ ਮਾਡਲ ਨਾਲ ਸ਼ੁਰੂ ਕਰੋ ਜੋ ਕੰਮ ਨੂੰ ਸੰਭਾਲ ਸਕਦਾ ਹੈ; ਜੇਕਰ ਇਹ ਅਸਫਲ ਰਹਿੰਦਾ ਹੈ, ਤਾਂ ਉੱਚ-ਦਰਜੇ ਦੇ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕਰੋ।
- ਪਲਾਨਰ ਨੂੰ ਵਰਕਰ ਤੋਂ ਵੱਖ ਕਰੋ – ਕਿਸੇ ਸਮੱਸਿਆ ਨੂੰ ਕਦਮਾਂ ਵਿੱਚ ਤੋੜਨ ਲਈ ਇੱਕ ਮਜ਼ਬੂਤ ਤਰਕਸ਼ਕਤਾ ਵਾਲੇ ਮਾਡਲ (ਜਿਵੇਂ ਕਿ Opus 5) ਦੀ ਵਰਤੋਂ ਕਰੋ, ਫਿਰ ਦੁਹਰਾਉਣਯੋਗ ਸਬ-ਟਾਸਕਾਂ ਨੂੰ ਇੱਕ ਸਸਤੇ ਐਗਜ਼ੀਕਿਊਟਰ (ਜਿਵੇਂ ਕਿ Gemini Flash) ਨੂੰ ਸੌਂਪ ਦਿਓ।
- ਸਿਰਫ ਟੋਕਨ ਦੀ ਵਰਤੋਂ ਹੀ ਨਹੀਂ, ਸਫਲਤਾ ਨੂੰ ਵੀ ਮਾਪੋ – ਇੱਕ ਸਸਤਾ ਮਾਡਲ ਜੋ ਤਿੰਨ ਵਾਰ ਕੋਸ਼ਿਸ਼ ਕਰਦਾ ਹੈ, ਉਹ ਇੱਕ ਮਹਿੰਗੇ ਮਾਡਲ ਨਾਲੋਂ ਵਧੇਰੇ ਖਰਚਾ ਕਰ ਸਕਦਾ ਹੈ ਜੋ ਪਹਿਲੀ ਵਾਰ ਵਿੱਚ ਹੀ ਸਹੀ ਕੰਮ ਕਰਦਾ ਹੈ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਰੂਟਿੰਗ ਮੈਪ ਨੂੰ ਇੱਕ ਜੀਵਤ ਦਸਤਾਵੇਜ਼ ਵਜੋਂ ਮੰਨਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਹਰੇਕ ਮਹੱਤਵਪੂਰਨ ਰਿਲੀਜ਼ ਦੇ ਨਾਲ ਮਾਡਲ ਦੀਆਂ ਚੋਣਾਂ ਦੀ ਮੁੜ-ਜਾਂਚ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ।
ਸਿੱਟਾ
2026 ਵਿੱਚ, ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦਾ ਫਾਇਦਾ ਉਹਨਾਂ ਟੀਮਾਂ ਨੂੰ ਮਿਲੇਗਾ ਜੋ LLMs ਨੂੰ ਇੱਕ ਸਿੰਗਲ ਸਵਿਸ-ਆਰਮੀ ਨਾਈਫ ਦੀ ਬਜਾਏ ਇੱਕ ਟੂਲਬਾਕਸ ਵਜੋਂ ਮੰਨਦੀਆਂ ਹਨ। ਕੰਮਾਂ ਨੂੰ ਉਸ ਮਾਡਲ ਨਾਲ ਮਿਲਾ ਕੇ ਜੋ ਉਹਨਾਂ ਵਿੱਚ ਉੱਤਮ ਹੈ, ਸੰਸਥਾਵਾਂ AI ਖਰਚੇ ਵਿੱਚ ਕਟੌਤੀ ਕਰਦੀਆਂ ਹਨ ਅਤੇ ਨਤੀਜੇ ਤੇਜ਼ੀ ਨਾਲ ਪ੍ਰਦਾਨ ਕਰਦੀਆਂ ਹਨ। ਅਸਲੀ ਜਿੱਤ ਕੋਈ ਨਵਾਂ ਹੈੱਡਲਾਈਨ ਮਾਡਲ ਨਹੀਂ ਹੈ; ਇਹ ਇੱਕ ਅਨੁਸ਼ਾਸਿਤ ਰੂਟਿੰਗ ਰਣਨੀਤੀ ਹੈ ਜੋ ਸਹੀ ਬੁੱਧੀ ਨੂੰ ਉੱਥੇ ਪਹੁੰਚਾਉਂਦੀ ਹੈ ਜਿੱਥੇ ਇਸਦੀ ਸਭ ਤੋਂ ਵੱਧ ਲੋੜ ਹੁੰਦੀ ਹੈ।
