Anthropic ਨੇ Claude Opus 5 ਨੂੰ ਕੀਤਾ ਪ੍ਰਕਾਸ਼ਿਤ: ਅੱਧੀ ਕੀਮਤ 'ਤੇ ਸ਼ਾਨਦਾਰ ਪ੍ਰਦਰਸ਼ਨ
Anthropic ਨੇ ਅਧਿਕਾਰਤ ਤੌਰ 'ਤੇ Claude Opus 5 ਲਾਂਚ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਨਵਾਂ ਫਲੈਗਸ਼ਿਪ ਮਾਡਲ ਹੈ। ਇਸ ਨੂੰ ਪ੍ਰੀਮੀਅਮ Claude Fable 5 ਦੇ ਬਰਾਬਰ ਪ੍ਰਦਰਸ਼ਨ, ਪਰ ਕਾਫ਼ੀ ਘੱਟ ਕੀਮਤ 'ਤੇ ਪ੍ਰਦਾਨ ਕਰਕੇ ਉੱਚ-ਪੱਧਰੀ LLM ਮਾਰਕੀਟ ਵਿੱਚ ਕ੍ਰਾਂਤੀ ਲਿਆਉਣ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ। ਇਸ ਰਣਨੀਤਕ ਕਦਮ ਦਾ ਉਦੇਸ਼ GPT-5.6 Sol ਵਰਗੇ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਤੋਂ ਕੀਮਤ ਦੇ ਦਬਾਅ ਨੂੰ ਖਤਮ ਕਰਨਾ ਹੈ ਅਤੇ ਨਾਲ ਹੀ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਕੋਡਿੰਗ ਅਤੇ ਗੁੰਝਲਦਾਰ ਗਿਆਨ ਭਰਪੂਰ ਕੰਮਾਂ ਲਈ ਇੱਕ ਵਧੇਰੇ ਕੁਸ਼ਲ ਸਾਧਨ ਪ੍ਰਦਾਨ ਕਰਨਾ ਹੈ।
ਕੀਮਤ-ਪ੍ਰਦਰਸ਼ਨ ਦੀ ਸੀਮਾ ਵਿੱਚ ਕ੍ਰਾਂਤੀ
Claude Opus 5 ਦੀ ਸਭ ਤੋਂ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਵਿਸ਼ੇਸ਼ਤਾ ਇਸਦੀ ਆਕਰਸ਼ਕ ਕੀਮਤ ਬਣਤਰ ਹੈ। ਜਿੱਥੇ ਉੱਚ-ਪੱਧਰੀ Claude Fable 5 ਦੀ ਕੀਮਤ $10 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਇਨਪੁਟ ਟੋਕਨ ਅਤੇ $50 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਆਉਟਪੁੱਟ ਟੋਕਨ ਹੈ, ਉੱਥੇ Opus 5 ਇਹਨਾਂ ਦਰਾਂ ਨੂੰ ਅੱਧੀ ਕਰ ਦਿੰਦਾ ਹੈ, ਜਿਸਦੀ ਕੀਮਤ $5 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਇਨਪੁਟ ਅਤੇ $25 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਆਉਟਪੁੱਟ ਟੋਕਨ ਹੈ।
ਲੇਟੈਂਸੀ (latency) ਦੀਆਂ ਲੋੜਾਂ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ, Anthropic ਨੇ ਇੱਕ "Fast Mode" ਵੀ ਪੇਸ਼ ਕੀਤਾ ਹੈ, ਜੋ ਪ੍ਰੋਸੈਸਿੰਗ ਦੀ ਰਫ਼ਤਾਰ ਨੂੰ 2.5 ਗੁਣਾ ਵਧਾ ਦਿੰਦਾ ਹੈ, ਹਾਲਾਂਕਿ ਇਸ ਲਈ ਟੋਕਨ ਦੀ ਕੀਮਤ ਦੁੱਗਣੀ ਹੋ ਜਾਂਦੀ ਹੈ। ਇਹ ਪੱਧਰੀ ਕੀਮਤ, 1 ਮਿਲੀਅਨ-ਟੋਕਨ ਦੇ ਵਿਸ਼ਾਲ ਕੰਟੈਕਸਟ ਵਿੰਡੋ (context window) ਦੇ ਨਾਲ ਮਿਲ ਕੇ, Opus 5 ਨੂੰ Claude Max ਲਈ ਨਵਾਂ ਡਿਫੌਲਟ ਮਾਡਲ ਅਤੇ Claude Pro ਉਪਭੋਗਤਾਵਾਂ ਲਈ ਸਭ ਤੋਂ ਸਮਰੱਥ ਵਿਕਲਪ ਬਣਾਉਂਦੀ ਹੈ।
ਕੋਡਿੰਗ ਅਤੇ ਤਰਕ (Reasoning) ਵਿੱਚ ਬੈਂਚਮਾਰਕ ਸੁਪਰੀਮੇਸੀ
Opus 5 ਸਿਰਫ਼ ਇੱਕ ਬਜਟ ਵਿਕਲਪ ਨਹੀਂ ਹੈ; ਇਹ ਖਾਸ ਖੇਤਰਾਂ ਵਿੱਚ ਪ੍ਰਦਰਸ਼ਨ ਦਾ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਮਾਡਲ ਹੈ। Frontier-Bench v0.1 ਰਾਹੀਂ ਏਜੈਂਟਿਕ ਟਰਮੀਨਲ ਕੋਡਿੰਗ ਵਿੱਚ, Opus 5 ਨੇ 43.3% ਸਕੋਰ ਪ੍ਰਾਪਤ ਕੀਤਾ, ਜੋ ਕਿ Fable 5 (33.7%) ਅਤੇ GPT-5.6 Sol (34.4%) ਦੋਵਾਂ ਨਾਲੋਂ ਕਾਫ਼ੀ ਬਿਹਤਰ ਹੈ। ਇਸਨੇ ਗਿਆਨ ਭਰਪੂਰ ਕੰਮਾਂ ਵਿੱਚ ਵੀ ਆਪਣਾ ਦਬਦਬਾ ਦਿਖਾਇਆ, ਜਿੱਥੇ ਇਸਨੇ 1,861 ਦੇ Elo ਸਕੋਰ ਨਾਲ GDPval-AA v2 ਬੈਂਚਮਾਰਕ ਵਿੱਚ ਮੋਹਰੀ ਰਹਿ ਕੇ ਆਪਣੀ ਪ੍ਰਧਾਨਤਾ ਸਾਬਤ ਕੀਤੀ।
ਸ਼ਾਇਦ ਸਭ ਤੋਂ ਹੈਰਾਨੀਜਨਕ ਅੰਕੜਾ ARC-AGI-3 ਬੈਂਚਮਾਰਕ ਤੋਂ ਆਉਂਦਾ ਹੈ, ਜੋ ਨਵੇਂ ਸਮੱਸਿਆ-ਹੱਲ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਨੂੰ ਮਾਪਦਾ ਹੈ। Opus 5 ਨੇ 30.2% ਸਕੋਰ ਪ੍ਰਾਪਤ ਕੀਤਾ, ਜੋ ਕਿ GPT-5.6 Sol ਦੁਆਰਾ ਪ੍ਰਾਪਤ ਕੀਤੇ ਗਏ 7.8% ਦੇ ਲਗਭਗ ਚਾਰ ਗੁਣਾ ਹੈ। ਇਹ ਮਾਡਲ ਦੀ ਉਹਨਾਂ ਕੰਮਾਂ ਨੂੰ ਸੰਭਾਲਣ ਦੀ ਸਮਰੱਥਾ ਵਿੱਚ ਇੱਕ ਵੱਡੀ ਛਾਲ ਦਾ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ ਜੋ ਇਸਦੇ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਪੈਟਰਨਾਂ ਤੋਂ ਬਾਹਰ ਹਨ।
ਬੁੱਧੀਮਾਨ ਕੋਸ਼ਿਸ਼ (Effort) ਸਕੇਲਿੰਗ ਅਤੇ ਕੁਸ਼ਲਤਾ
Anthropic ਨੇ ਇੱਕ ਉੱਨਤ "effort" ਸਿਸਟਮ ਪੇਸ਼ ਕੀਤਾ ਹੈ, ਜੋ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਪੰਜ ਸੈਟਿੰਗਾਂ: low, medium, high, xhigh, ਅਤੇ max ਵਿਚਕਾਰ ਬਦਲਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ। ਇਹ ਟੋਕਨ ਦੀ ਖਪਤ ਅਤੇ ਤਰਕ ਦੀ ਡੂੰਘਾਈ ਵਿਚਕਾਰ ਇੱਕ ਸਟੀਕ ਸੰਤੁਲਨ ਬਣਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ।
ਹਾਲਾਂਕਿ Anthropic ਲਾਗਤ ਨੂੰ ਘਟਾਉਣ ਲਈ ਆਮ ਕੰਮਾਂ ਲਈ "low" ਅਤੇ "medium" ਸੈਟਿੰਗਾਂ ਦੀ ਸਿਫਾਰਸ਼ ਕਰਦਾ ਹੈ, ਪਰ ਉਹ ਗੁੰਝਲਦਾਰ ਏਜੈਂਟਿਕ ਕੋਡਿੰਗ ਲਈ "xhigh" ਦੀ ਵਰਤੋਂ ਕਰਨ ਦੀ ਸਲਾਹ ਦਿੰਦੇ ਹਨ। ਦਿਲਚਸਪ ਗੱਲ ਇਹ ਹੈ ਕਿ ਕੰਪਨੀ ਨੇ "max" ਸੈਟਿੰਗ 'ਤੇ ਘਟਦੇ ਫਾਇਦਿਆਂ (diminishing returns) ਵੱਲ ਇਸ਼ਾਰਾ ਕੀਤਾ ਹੈ; Frontier-Bench v0.1 ਅਤੇ Artificial Analysis Coding Agent Index ਦੋਵਾਂ 'ਤੇ, Opus 5 ਨੇ ਵਧੇਰੇ ਲਾਗਤ ਦੇ ਬਾਵਜੂਦ ਵੱਧ ਤੋਂ ਵੱਧ ਕੋਸ਼ਿਸ਼ (maximum effort) 'ਤੇ ਪ੍ਰਦਰਸ਼ਨ ਵਿੱਚ ਮਾਮੂਲੀ ਗਿਰਾਵਟ ਦੇਖੀ, ਜੋ ਇਹ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਕੁਸ਼ਲਤਾ ਲਈ "xhigh" ਸੈਟਿੰਗ ਵਰਤਮਾਨ ਵਿੱਚ ਸਭ ਤੋਂ ਵਧੀਆ (sweet spot) ਹੋ ਸਕਦੀ ਹੈ।
ਸੁਧਰੀ ਹੋਈ ਸੁਰੱਖਿਆ ਅਤੇ ਖੁਦਮੁਖਤਿਆਰੀ
ਉਪਭੋਗਤਾਵਾਂ ਦੇ ਫੀਡਬੈਕ ਦੇ ਸਿੱਧੇ ਜਵਾਬ ਵਜੋਂ, Anthropic ਨੇ Opus 5 ਲਈ ਸੁਰੱਖਿਆ ਕਲਾਸੀਫਾਇਰਾਂ (safety classifiers) ਨੂੰ ਬਿਹਤਰ ਬਣਾਇਆ ਹੈ। ਮਾਡਲ ਦੇ ਸਾਈਬਰ ਫਿਲਟਰ Fable 5 ਦੇ ਮੁਕਾਬਲੇ ਲਗਭਗ 85% ਘੱਟ ਵਾਰ ਚਾਲੂ ਹੁੰਦੇ ਹਨ, ਜੋ ਕਿ ਜਾਇਜ਼ ਖੋਜ ਨੂੰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਰੋਕਣ ਦੇ ਪਿਛਲੇ ਆਲੋਚਨਾਵਾਂ ਦਾ ਹੱਲ ਕਰਦੇ ਹਨ। ਹਾਲਾਂਕਿ ਇਹ ਅਜੇ ਵੀ ਐਕਸਪਲੋਇਟ (exploit) ਜਨਰੇਸ਼ਨ ਅਤੇ ਬਾਈਨਰੀ-ਅਧਾਰਤ ਸਕੈਨਿੰਗ ਨੂੰ ਰੋਕਦਾ ਹੈ, ਪਰ ਇਹ ਸੋਰਸ ਕੋਡ ਦੀ ਕਮਜ਼ੋਰੀਆਂ (vulnerability) ਦੀ ਖੋਜ ਲਈ ਬਹੁਤ ਜ਼ਿਆਦਾ ਖੁੱਲ੍ਹਾ ਹੈ।
ਇਸ ਤੋਂ ਇਲਾਵਾ, Opus 5 ਵਧੇਰੇ ਸੁਧਰੀ ਹੋਈ ਸਵੈ-ਸੁਧਾਰ (self-correction) ਸਮਰੱਥਾ ਦਿਖਾਉਂਦਾ ਹੈ। ਅਸਲ ਦੁਨੀਆ ਦੇ ਟੈਸਟਿੰਗ ਵਿੱਚ, ਮਾਡਲ ਨੇ ਜਿਓਮੈਟਰੀ ਦੀ ਵਿਆਖਿਆ ਕਰਨ ਲਈ ਆਪਣਾ ਕੰਪਿਊਟਰ ਵਿਜ਼ਨ ਪਾਈਪਲਾਈਨ ਲਿਖ ਕੇ FreeCAD ਵਿੱਚ ਇੱਕ 3D ਮਾਡਲ ਸਫਲਤਾਪੂਰਵਕ ਬਣਾਇਆ—ਇੱਕ ਅਜਿਹਾ ਕੰਮ ਜਿਸ ਨੇ ਬਾਕੀ ਸਾਰੇ ਮੁਕਾਬਲੇਬਾਜ਼ ਮਾਡਲਾਂ ਨੂੰ ਹੈਰਾਨ ਕਰ ਦਿੱਤਾ।
ਮੁੱਖ ਗੱਲਾਂ
- ਲਾਗਤ ਵਿੱਚ ਭਾਰੀ ਕਮੀ: Opus 5, Claude Fable 5 ਦੀ ਟੋਕਨ ਲਾਗਤ ਦੇ 50% 'ਤੇ ਫਲੈਗਸ਼ਿਪ-ਪੱਧਰ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
- ਤਰਕ ਵਿੱਚ ਵੱਡੀ ਸਫਲਤਾ: ਮਾਡਲ ਨੇ ਨਵੇਂ ਸਮੱਸਿਆ-ਹੱਲ ਕਰਨ ਲਈ ARC-AGI-3 ਬੈਂਚਮਾਰਕ ਵਿੱਚ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਦੇ ਮੁਕਾਬਲੇ 4 ਗੁਣਾ ਵੱਡੀ ਲੀਡ ਦਿਖਾਈ।
- ਅਨੁਕੂਲ ਡਿਵੈਲਪਰ ਵਰਕਫਲੋ: ਸੁਧਰੇ ਹੋਏ ਸੁਰੱਖਿਆ ਕਲਾਸੀਫਾਇਰਾਂ ਅਤੇ ਵਿਸ਼ੇਸ਼ "effort" ਸੈਟਿੰਗਾਂ ਦੇ ਨਾਲ, Opus 5 ਏਜੈਂਟਿਕ ਕੋਡਿੰਗ ਅਤੇ ਖੋਜ ਲਈ ਵਧੇਰੇ ਸੁਚਾਰੂ ਅਨੁਭਵ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
