Anthropic Claude Opus 5 ਨੇ ਬਿਹਤਰ ਕੁਸ਼ਲਤਾ ਨਾਲ Fable 5 ਨੂੰ ਚੁਣੌਤੀ ਦਿੱਤੀ

Anthropic ਨੇ Claude Opus 5 ਦੀ ਰਿਲੀਜ਼ ਨਾਲ ਫਰੰਟੀਅਰ ਮਾਡਲਿੰਗ ਦੇ ਇੱਕ ਨਵੇਂ ਯੁੱਗ ਵਿੱਚ ਅਧਿਕਾਰਤ ਤੌਰ 'ਤੇ ਪ੍ਰਵੇਸ਼ ਕੀਤਾ ਹੈ, ਇੱਕ ਅਜਿਹਾ ਮਾਡਲ ਜੋ ਆਪਣੇ ਮੁੱਖ ਵਿਰੋਧੀਆਂ ਦੇ ਮੁਕਾਬਲੇ ਕਾਫ਼ੀ ਘੱਟ ਕੀਮਤ 'ਤੇ ਉੱਚ-ਦਰਜੇ ਦੀ ਬੁੱਧੀ ਦਾ ਵਾਅਦਾ ਕਰਦਾ ਹੈ। ਕਈ ਮਹੱਤਵਪੂਰਨ ਬੈਂਚਮਾਰਕਸ ਵਿੱਚ Claude Fable 5 ਅਤੇ GPT-5.6 Sol ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਦੇ ਬਰਾਬਰ ਜਾਂ ਉਸ ਤੋਂ ਵੱਧ ਪ੍ਰਦਰਸ਼ਨ ਕਰਕੇ, Opus 5 ਉੱਨਤ AI ਤਰਕ (reasoning) ਦੀ ਅਰਥ ਸ਼ਾਸਤਰ ਨੂੰ ਮੁੜ ਸੁਰਜੀਤ ਕਰ ਰਿਹਾ ਹੈ।

ਕੋਡਿੰਗ ਅਤੇ ਗਿਆਨ ਦੇ ਕੰਮਾਂ ਵਿੱਚ ਦਬਦਬਾ

Claude Opus 5 ਨੇ ਵਿਸ਼ੇਸ਼ ਖੇਤਰਾਂ, ਖਾਸ ਕਰਕੇ ਸਾਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ ਅਤੇ ਦਫ਼ਤਰੀ ਆਟੋਮੇਸ਼ਨ ਵਿੱਚ ਆਪਣੀ ਇੱਕ ਮਜ਼ਬੂਤ ਪਛਾਣ ਬਣਾਈ ਹੈ। Artificial Analysis Intelligence Index 'ਤੇ—ਜੋ ਕੋਡਿੰਗ, ਵਿਗਿਆਨਕ ਤਰਕ ਅਤੇ ਤੱਥਾਂ ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ ਕਵਰ ਕਰਨ ਵਾਲਾ ਇੱਕ ਵਿਆਪਕ ਮਾਪਦੰਡ ਹੈ—Opus 5 ਨੇ 61 ਦਾ ਲੀਡਿੰਗ ਸਕੋਰ ਹਾਸਲ ਕੀਤਾ, ਜਿਸ ਨਾਲ ਉਸਨੇ Claude Fable 5 (60) ਅਤੇ GPT-5.6 Sol (59) ਨੂੰ ਪਿੱਛੇ ਛੱਡ ਦਿੱਤਾ।

ਆਟੋਨੋਮਸ ਇੰਜੀਨੀਅਰਿੰਗ ਦੇ ਖੇਤਰ ਵਿੱਚ, Claude Code ਦੇ ਨਾਲ ਮਿਲ ਕੇ Opus 5 ਨੇ 67 ਅੰਕਾਂ ਦੇ ਨਾਲ Coding Agent Index 'ਤੇ ਸਿਖਰਲਾ ਸਥਾਨ ਹਾਸਲ ਕੀਤਾ ਹੈ। ਇਸ ਨੇ Terminal-Bench v2.1 'ਤੇ ਵੀ 89% ਦਾ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕੀਤਾ, ਜੋ ਕਿ ਪਿਛਲੇ ਉਦਯੋਗਿਕ ਲੀਡਰ, GPT-5.6 Sol ਦੇ ਬਰਾਬਰ ਹੈ। ਇਸ ਤੋਂ ਇਲਾਵਾ, ਇਹ ਮਾਡਲ ਦਫ਼ਤਰੀ ਕੰਮਾਂ ਵਿੱਚ ਬੇਮਿਸਾਲ ਦਬਦਬਾ ਦਿਖਾਉਂਦਾ ਹੈ। AA-Briefcase ਬੈਂਚਮਾਰਕ 'ਤੇ, ਜੋ ਖੋਜ, ਪ੍ਰਸਤੁਤੀ (presentation) ਅਤੇ ਸਪ੍ਰੈਡਸ਼ੀਟ ਵਿਸ਼ਲੇਸ਼ਣ ਨੂੰ ਮਾਪਦਾ ਹੈ, Opus 5 ਨੇ 1720 ਦਾ Elo ਪ੍ਰਾਪਤ ਕੀਤਾ, ਜੋ Fable 5 ਨਾਲੋਂ 146 ਅੰਕਾਂ ਨਾਲ ਬਿਹਤਰ ਹੈ।

ਕੁਸ਼ਲਤਾ ਦਾ ਵਿਰੋਧਾਭਾਸ: "High" "Max" ਨੂੰ ਕਿਉਂ ਹਰਾਉਂਦਾ ਹੈ

ਡਿਵੈਲਪਰਾਂ ਲਈ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਖੋਜਾਂ ਵਿੱਚੋਂ ਇੱਕ ਤਰਕ ਪੱਧਰਾਂ (reasoning tiers) ਅਤੇ ਅਸਲ ਉਪਯੋਗਤਾ ਵਿਚਕਾਰ ਸਬੰਧ ਹੈ। ਹਾਲਾਂਕਿ Anthropic "low" ਤੋਂ ਲੈ ਕੇ "max" ਤੱਕ ਦੇ ਵੱਖ-ਵੱਖ ਪੱਧਰ ਪੇਸ਼ ਕਰਦਾ ਹੈ, ਪਰ ਡੇਟਾ ਦੱਸਦਾ ਹੈ ਕਿ ਸਭ ਤੋਂ ਉੱਚੇ ਤਰਕ ਪੱਧਰ ਹਮੇਸ਼ਾ ਵਿਹਾਰਕ ਲਾਗੂ ਕਰਨ ਲਈ ਸਭ ਤੋਂ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਨਹੀਂ ਹੁੰਦੇ।

Vibe Code Bench ਰਾਹੀਂ Vals.ai ਦੁਆਰਾ ਕੀਤੇ ਗਏ ਟੈਸਟਾਂ ਤੋਂ ਪਤਾ ਲੱਗਾ ਹੈ ਕਿ ਜਿੱਥੇ ਗੁੰਝਲਦਾਰਤਾ ਦੇ ਨਾਲ ਕਾਰਗੁਜ਼ਾਰੀ ਵਧਦੀ ਹੈ, ਉੱਥੇ ਹੀ "high" ਪੱਧਰ ਅਕਸਰ ਵਧੇਰੇ ਭਰੋਸੇਯੋਗ ਅਤੇ ਸਰਲ ਹੱਲ ਪੈਦਾ ਕਰਦਾ ਹੈ। ਇਸ ਦੇ ਉਲਟ, "max" ਅਤੇ "xhigh" ਪੱਧਰ ਅਕਸਰ ਵਧੇਰੇ ਗੁੰਝਲਦਾਰ ਹੱਲ ਤਿਆਰ ਕਰਦੇ ਹਨ ਜੋ ਗਲਤੀਆਂ ਦੇ ਕਾਰਨ ਬਣ ਸਕਦੇ ਹਨ। ਇਹ Terminal-Bench 2.1 ਵਿੱਚ ਵੀ ਦੇਖਿਆ ਗਿਆ ਹੈ, ਜਿੱਥੇ "high" ਪੱਧਰ "max" ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ ਕਿਉਂਕਿ ਬਾਅਦ ਵਾਲਾ (max) ਇੱਕੋ ਇੱਕ ਕੋਸ਼ਿਸ਼ 'ਤੇ ਬਹੁਤ ਜ਼ਿਆਦਾ ਸਮਾਂ ਖਰਚ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਅਕਸਰ ਕੰਮ ਪੂਰਾ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਸਮਾਂ ਸੀਮਾ ਖਤਮ ਹੋ ਜਾਂਦੀ ਹੈ। ਜ਼ਿਆਦਾਤਰ ਪ੍ਰੋਡਕਸ਼ਨ ਵਰਤੋਂ ਦੇ ਮਾਮਲਿਆਂ ਲਈ, "high" ਪੱਧਰ ਭਰੋਸੇਯੋਗਤਾ ਅਤੇ ਲਾਗਤ-ਪ੍ਰਭਾਵਸ਼ੀਲਤਾ ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਸੰਤੁਲਨ ਹੈ।

ਲਾਗਤ-ਪ੍ਰਭਾਵਸ਼ੀਲ ਫਰੰਟੀਅਰ ਇੰਟੈਲੀਜੈਂਸ

Claude Opus 5 ਦਾ ਸਭ ਤੋਂ ਵੱਡਾ ਵਿਘਨਕਾਰੀ ਪਹਿਲੂ ਇਸਦੀ ਬੁੱਧੀ ਦੇ ਮੁਕਾਬਲੇ ਇਸਦੀ ਕੀਮਤ ਦੀ ਬਣਤਰ ਹੈ। AA-Briefcase ਕੰਮਾਂ ਵਿੱਚ, "max" ਤਰਕ ਵਾਲਾ Opus 5 ਲਗਭਗ $17.79 ਪ੍ਰਤੀ ਕੰਮ ਖਰਚ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ Fable 5 ਦੇ $22.30 ਦੇ ਮੁਕਾਬਲੇ 20% ਦੀ ਕਮੀ ਹੈ। "high" ਪੱਧਰ ਚੁਣਨ ਵਾਲੇ ਉਪਭੋਗਤਾਵਾਂ ਲਈ, ਕੀਮਤ ਘਟ ਕੇ ਸਿਰਫ਼ $10.41 ਰਹਿ ਜਾਂਦੀ ਹੈ—ਜੋ ਕਿ ਇਸਦੇ ਮੁਕਾਬਲੇਬਾਜ਼ ਦੀ ਅੱਧੀ ਕੀਮਤ ਤੋਂ ਵੀ ਘੱਟ ਹੈ, ਜਦੋਂ ਕਿ ਇਹ ਅਜੇ ਵੀ ਉੱਤਮ Elo ਰੈਂਕਿੰਗ ਬਣਾਈ ਰੱਖਦਾ ਹੈ।

Anthropic ਨੇ ਇੱਕ ਮੁਕਾਬਲੇਬਾਜ਼ ਟੋਕਨ ਕੀਮਤ ਮਾਡਲ ਬਣਾਈ ਰੱਖਿਆ ਹੈ:

  • Input tokens: $5 ਪ੍ਰਤੀ ਮਿਲੀਅਨ
  • Output tokens: $25 ਪ੍ਰਤੀ ਮਿਲੀਅਨ
  • Cache hits: $0.50 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਟੋਕਨ

ਇੱਕ ਸੁੰਗੜਦਾ ਫਰੰਟੀਅਰ

ਆਪਣੀਆਂ ਸਫਲਤਾਵਾਂ ਦੇ ਬਾਵਜੂਦ, Opus 5 ਵਿੱਚ ਕਮੀਆਂ ਵੀ ਹਨ। ਤੱਥਾਂ ਦੀ ਸ਼ੁੱਧਤਾ ਇੱਕ ਚੁਣੌਤੀ ਬਣੀ ਹੋਈ ਹੈ; AA-Omniscience ਬੈਂਚਮਾਰਕ 'ਤੇ, ਇਹ ਮਾਡਲ Fable 5 ਤੋਂ ਪਿੱਛੇ ਹੈ ਅਤੇ ਇਸਦੀ ਹਲੂਸੀਨੇਸ਼ਨ (hallucination) ਦਰ 50% ਤੱਕ ਵਧ ਗਈ ਹੈ ਕਿਉਂਕਿ ਇਹ ਅਨਿਸ਼ਚਿਤ ਹੋਣ 'ਤੇ ਵਾਰ-ਵਾਰ ਜਵਾਬ ਦੇਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦਾ ਹੈ।

Opus 5, Fable 5, ਅਤੇ GPT-5 ਸੀਰੀਜ਼ ਦੇ ਵਿਚਕਾਰ ਬਹੁਤ ਘੱਟ ਅੰਤਰ ਇੱਕ ਤੇਜ਼ੀ ਨਾਲ ਪਰਿਪੱਕ ਹੁੰਦੇ ਬਾਜ਼ਾਰ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ। ਜਿਵੇਂ-ਜਿਵੇਂ ਵਿਗਿਆਨਕ ਤਰਕ ਅਤੇ ਕੋਡਿੰਗ ਵਿੱਚ ਕਾਰਗੁਜ਼ਾਰੀ ਦੇ ਪਾੜੇ ਘਟ ਰਹੇ ਹਨ, AI ਉਦਯੋਗ ਕਮੋਡੀਟਾਈਜ਼ੇਸ਼ਨ (commoditization) ਦੇ ਦੌਰ ਵੱਲ ਵਧ ਰਿਹਾ ਹੈ ਜਿੱਥੇ ਕੁਸ਼ਲਤਾ, ਲਾਗਤ, ਅਤੇ ਵਿਸ਼ੇਸ਼ ਵਰਕਫਲੋ ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਮੁੱਖ ਅੰਤਰ ਕਰਨ ਵਾਲੇ ਕਾਰਕ ਬਣ ਜਾਣਗੇ।

ਮੁੱਖ ਗੱਲਾਂ

  • ਬਿਹਤਰ ਵਿਸ਼ੇਸ਼ ਪ੍ਰਦਰਸ਼ਨ: Opus 5 ਗਿਆਨ ਦੇ ਕੰਮਾਂ (AA-Briefcase Elo 1720) ਵਿੱਚ ਅਗਵਾਈ ਕਰਦਾ ਹੈ ਅਤੇ ਕੋਡਿੰਗ ਏਜੰਟ ਬੈਂਚਮਾਰਕਸ ਵਿੱਚ ਸਿਖਰਲੇ ਸਥਾਨ ਨੂੰ ਸਾਂਝਾ ਕਰਦਾ ਹੈ।
  • ਅਨੁਕੂਲਿਤ ਤਰਕ ਪੱਧਰ: "high" ਤਰਕ ਪੱਧਰ ਨੂੰ ਕੋਡਿੰਗ ਅਤੇ ਟਰਮੀਨਲ ਕੰਮਾਂ ਲਈ ਸਭ ਤੋਂ ਭਰੋਸੇਯੋਗ ਅਤੇ ਲਾਗਤ-ਪ੍ਰਭਾਵਸ਼ੀਲ ਸੈਟਿੰਗ ਵਜੋਂ ਪਛਾਣਿਆ ਗਿਆ ਹੈ, ਜੋ ਅਕਸਰ "max" ਪੱਧਰ ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ।
  • ਵਿਘਨਕਾਰੀ ਯੂਨਿਟ ਇਕਨਾਮਿਕਸ: Opus 5, Claude Fable 5 ਦੇ ਮੁਕਾਬਲੇ ਪ੍ਰਤੀ ਕੰਮ ਕਾਫ਼ੀ ਘੱਟ ਲਾਗਤ 'ਤੇ ਫਰੰਟੀਅਰ-ਪੱਧਰ ਦੀ ਬੁੱਧੀ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।