Kimi K3 ਦੀ ਹਿੰਮਤ ਮੁੱਕ ਗਈ ਜਦੋਂ ਕਿ GPT-5.6-SOL ਨੇ ਤਿੰਨ ਭਾਰੀ ਪ੍ਰੋਂਪਟਾਂ—ਇੱਕ ਸੰਭਾਵਨਾ (probability) ਦੀ ਸਮੱਸਿਆ, ਇੱਕ ਪੁਲੀ-ਇਨਰਸ਼ੀਆ (pulley-inertia) ਸਥਿਤੀ, ਅਤੇ ਇੱਕ ਗੁੰਝਲਦਾਰ Python ਬੈਕਪੈਕ ਸਕ੍ਰਿਪਟ—ਤੇ ਆਪਣੀ ਜਿੱਤ ਦਰਜ ਕਰਵਾਈ। ਇਹ ਅੰਤਰ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਜਦੋਂ ਤੁਹਾਨੂੰ ਅਜਿਹੇ ਮਾਡਲ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ ਜੋ ਰੁਕੇ ਬਿਨਾਂ ਬਹੁਤ ਸਾਰੇ ਪੜਾਵਾਂ ਵਾਲੀ ਗਣਿਤ, ਭੌਤਿਕ ਵਿਗਿਆਨ ਅਤੇ ਕੋਡ ਰਾਹੀਂ ਤਰਕ ਕਰ ਸਕੇ, ਤਾਂ ਟੋਕਨ ਬਜਟਿੰਗ ਅਤੇ ਲੇਟੈਂਸੀ (latency) ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹਨ।
ਬੈਂਚਮਾਰਕ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਡਿਵੈਲਪਰ ਅਤੇ ਖੋਜਕਰਤਾ ਅਕਸਰ LLM ਦੀ ਚੋਣ ਹੈੱਡਲਾਈਨ ਸਕੋਰਾਂ ਦੇ ਆਧਾਰ 'ਤੇ ਕਰਦੇ ਹਨ, ਨਾ ਕਿ ਇਸ ਆਧਾਰ 'ਤੇ ਕਿ ਇਹ ਅਸਲ ਦੁਨੀਆ ਦੇ ਦਬਾਅ ਹੇਠ ਕਿਵੇਂ ਕੰਮ ਕਰਦਾ ਹੈ। ਇਸ ਸਾਈਡ-ਬਾਈ-ਸਾਈਡ ਟੈਸਟ ਵਿੱਚ, ਹਰੇਕ ਮਾਡਲ ਨੇ ਅਜਿਹੀ ਸਮੱਸਿਆ ਦਾ ਸਾਹਮਣਾ ਕੀਤਾ ਜਿਸ ਵਿੱਚ ਤਰਕ ਦੀ ਇੱਕ ਲੰਬੀ ਲੜੀ ਦੀ ਲੋੜ ਸੀ। GPT-5.6-SOL ਨੇ ਤਿੰਨਾਂ ਖੇਤਰਾਂ ਵਿੱਚ ਪੂਰੇ ਅਤੇ ਸਹੀ ਜਵਾਬ ਦਿੱਤੇ; Kimi K3 ਆਪਣਾ ਟੋਕਨ ਬਜਟ ਖਤਮ ਕਰ ਗਿਆ ਜਾਂ ਕੁਝ ਵੀ ਵਰਤੋਂ ਯੋਗ ਪੈਦਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਟਾਈਮ-ਆਊਟ ਹੋ ਗਿਆ।
ਟੈਸਟ ਦਾ ਸੈੱਟ-ਅੱਪ
- ਗਣਿਤ (Math) – ਇੱਕ ਸੰਭਾਵਨਾ ਵਾਲਾ ਸਵਾਲ ਜਿਸ ਵਿੱਚ ਪੈਟਰਨ-ਓਵਰਲੈਪ ਸੰਭਾਵਨਾ ਅਤੇ ਉਮੀਦ (expectation) ਤੇ ਵੈਰੀਐਂਸ (variance - ਦੂਜੇ ਮੋਮੈਂਟਸ) ਦੋਵਾਂ ਦੀ ਗਣਨਾ ਕਰਨੀ ਸੀ।
- ਭੌਤਿਕ ਵਿਗਿਆਨ (Physics) – ਇੱਕ ਪੁਲੀ ਦੀ ਇਨਰਸ਼ੀਆ ਮਾਡਲਿੰਗ ਅਤੇ ਸਪਰਿੰਗ-ਟੈਂਸ਼ਨ ਵਾਲੀ ਕੇਬਲ ਦੇ ਢਿੱਲੇ ਹੋਣ 'ਤੇ ਹੋਣ ਵਾਲੇ ਊਰਜਾ ਦੇ ਨੁਕਸਾਨ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ।
- ਪ੍ਰੋਗਰਾਮਿੰਗ (Programming) – ਗੁੰਝਲਦਾਰ ਨਿਰਭਰਤਾਵਾਂ (dependencies) ਅਤੇ ਟਾਈ-ਬ੍ਰੇਕ ਨਿਯਮਾਂ ਵਾਲੀ ਬੈਕਪੈਕ-ਪੈਕਿੰਗ ਸਮੱਸਿਆ ਲਈ ਇੱਕ Python ਹੱਲ ਲਿਖਣਾ, ਅਤੇ ਫਿਰ ਛੇ ਸੁਤੰਤਰ ਟੈਸਟ ਕੇਸਾਂ ਦੇ ਵਿਰੁੱਧ ਆਉਟਪੁੱਟ ਦੀ ਜਾਂਚ ਕਰਨਾ।
ਅੰਕੜੇ ਕੀ ਕਹਿੰਦੇ ਹਨ
GPT-5.6-SOL
- ਗਣਿਤ – ਉਮੀਦ ਕੀਤੇ ਮੁੱਲ (expected value) ਅਤੇ ਵੈਰੀਐਂਸ ਨੂੰ ਸਪਸ਼ਟ ਰੂਪ ਵਿੱਚ ਪੇਸ਼ ਕਰਦੇ ਹੋਏ ਇੱਕ ਪੂਰਾ, ਸਹੀ ਹੱਲ ਦਿੱਤਾ।
- ਭੌਤਿਕ ਵਿਗਿਆਨ – ਇਨਰਸ਼ੀਆ ਮਾਡਲ ਨੂੰ ਸਹੀ ਤਰੀਕੇ ਨਾਲ ਬਣਾਇਆ ਅਤੇ ਊਰਜਾ ਦੇ ਨੁਕਸਾਨ ਦਾ ਹਿਸਾਬ ਰੱਖਿਆ, ਜੋ ਕਿ ਵਿਸ਼ਲੇਸ਼ਣਾਤਮਕ ਜਵਾਬ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਸੀ।
- ਪ੍ਰੋਗਰਾਮਿੰਗ – ਅਜਿਹਾ ਕੋਡ ਤਿਆਰ ਕੀਤਾ ਜੋ ਕੰਪਾਈਲ ਹੋਇਆ, ਚੱਲਿਆ, ਅਤੇ ਸਾਰੇ ਛੇ ਬਾਹਰੀ ਚੈੱਕਾਂ ਵਿੱਚੋਂ ਲੰਘ ਗਿਆ। ਇੱਕ ਅੰਦਰੂਨੀ ਟੈਸਟ ਅਸਰਸ਼ਨ (assertion) ਗਲਤ ਸੀ, ਜੋ ਸਾਨੂੰ ਯਾਦ ਦਿਵਾਉਂਦੀ ਹੈ ਕਿ ਮਾਡਲ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੇ ਟੈਸਟ ਅਟੁੱਟ ਨਹੀਂ ਹੁੰਦੇ।
Kimi K3
- ਗਣਿਤ – ਆਪਣੀ ਟੋਕਨ ਸੀਮਾ (ਪਹਿਲਾਂ 6,500 ਟੋਕਨਾਂ 'ਤੇ, ਫਿਰ 10,000 'ਤੇ) ਤੱਕ ਪਹੁੰਚ ਗਿਆ ਅਤੇ ਕੋਈ ਵੀ ਜਵਾਬ ਦਿਖਾਏ ਬਿਨਾਂ ਰੁਕ ਗਿਆ।
- ਭੌਤਿਕ ਵਿਗਿਆਨ – ਕੋਈ ਵੀ ਦਿਖਾਈ ਦੇਣ ਵਾਲਾ ਆਉਟਪੁੱਟ ਆਉਣ ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਟੋਕਨ ਖਤਮ ਹੋ ਗਏ।
- ਪ੍ਰੋਗਰਾਮਿੰਗ – 245 ਸੈਕਿੰਡਾਂ ਬਾਅਦ ਟਾਈਮ-ਆਊਟ ਹੋ ਗਿਆ, ਅਤੇ ਮੁਲਾਂਕਣ ਲਈ ਕੁਝ ਵੀ ਨਹੀਂ ਦਿੱਤਾ।
ਤਰਕ ਦੀ ਕੁਸ਼ਲਤਾ ਬਨਾਮ ਕੱਚੀ ਸ਼ਕਤੀ
ਪ੍ਰੋਡਕਸ਼ਨ ਪਾਈਪਲਾਈਨ ਬਣਾਉਣ ਵਾਲੇ ਕਿਸੇ ਵੀ ਵਿਅਕਤੀ ਲਈ ਇਸਦਾ ਮਤਲਬ ਸਪਸ਼ਟ ਹੈ: ਇੱਕ ਮਾਡਲ ਜੋ ਆਉਟਪੁੱਟ ਦਿੱਤੇ ਬਿਨਾਂ ਟੋਕਨ ਖਤਮ ਕਰ ਦਿੰਦਾ ਹੈ, ਉਹ ਅਗਲੇ ਪ੍ਰਕਿਰਿਆਵਾਂ (downstream processes) ਨੂੰ ਰੋਕ ਸਕਦਾ ਹੈ, ਲਾਗਤ ਵਧਾ ਸਕਦਾ ਹੈ ਅਤੇ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਨਿਰਾਸ਼ ਕਰ ਸਕਦਾ ਹੈ।
ਭਰੋਸੇਯੋਗਤਾ ਅਤੇ "ਪਰਫੈਕਟ" ਕੋਡ ਦੀ ਲੁਕੀ ਹੋਈ ਲਾਗਤ
ਜੇਤੂ ਮਾਡਲ ਤੋਂ ਵੀ ਗਲਤੀ ਹੋ ਗਈ: GPT-5.6-SOL ਦੇ ਆਪਣੇ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੇ ਟੈਸਟ ਕੇਸ ਵਿੱਚ ਇੱਕ ਗਲਤ ਅਸਰਸ਼ਨ (assertion) ਸੀ। ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਮਾਡਲ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੀ ਗਈ ਵੈਲੀਡੇਸ਼ਨ ਮਨੁੱਖੀ ਸਮੀਖਿਆ ਦਾ ਬਦਲ ਨਹੀਂ ਹੈ। ਜਦੋਂ ਕੋਈ ਮਾਡਲ ਕੋਡ ਲਿਖਦਾ ਹੈ, ਤਾਂ ਤੁਹਾਨੂੰ ਅਜੇ ਵੀ ਸੁਤੰਤਰ ਚੈੱਕ ਕਰਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
- ਫਿਨਿਸ਼ ਰੀਜ਼ਨ ਟ੍ਰੈਕਿੰਗ (Finish reason tracking) – ਰਿਕਾਰਡ ਕਰੋ ਕਿ ਕੀ ਕੋਈ ਜਵਾਬ ਟੋਕਨ ਸੀਮਾ ਤੱਕ ਪਹੁੰਚਣ ਕਾਰਨ, ਟਾਈਮ-ਆਊਟ ਕਾਰਨ, ਜਾਂ ਕੁਦਰਤੀ ਰੁਕਾਵਟ ਕਾਰਨ ਖਤਮ ਹੁੰਦਾ ਹੈ।
- ਤਰਕ ਟੋਕਨ ਕਾਊਂਟ (Reasoning token count) – ਤੁਲਨਾ ਕਰੋ ਕਿ ਹਰੇਕ ਮਾਡਲ ਅੰਤਿਮ ਆਉਟਪੁੱਟ ਦੇ ਮੁਕਾਬਲੇ ਅੰਦਰੂਨੀ ਵਿਚਾਰ-ਵਟਾਂਦਰੇ 'ਤੇ ਕਿੰਨੇ ਟੋਕਨ ਖਰਚ ਕਰਦਾ ਹੈ।
- ਲੇਟੈਂਸੀ ਮਾਨੀਟਰਿੰਗ (Latency monitoring) – ਹਰੇਕ ਕਦਮ ਲਈ ਸਮੇਂ ਨੂੰ ਮਾਪੋ; ਇੱਕ ਮਾਡਲ ਜੋ ਪ੍ਰਤੀ ਕੁਐਰੀ ਮਿੰਟਾਂ ਦਾ ਸਮਾਂ ਲੈਂਦਾ ਹੈ, ਉਹ ਇੰਟਰਐਕਟਿਵ ਐਪਸ ਲਈ ਅਣਉਚਿਤ ਹੋ ਸਕਦਾ ਹੈ।
ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਇਹਨਾਂ ਮੈਟ੍ਰਿਕਸ ਨੂੰ ਸਿਰਫ਼ ਅੰਤਿਮ ਜਵਾਬ ਵਜੋਂ ਨਹੀਂ, ਸਗੋਂ ਮੁੱਖ ਸੰਕੇਤਾਂ (first-class signals) ਵਜੋਂ ਦੇਖਣਾ ਚਾਹੀਦਾ ਹੈ।
ਨਿਚੋੜ
GPT-5.6-SOL ਪੂਰਨਤਾ (completeness) ਵਿੱਚ Kimi K3 ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ। ਇਹ ਟੈਸਟ ਸਾਨੂੰ ਇਹ ਵੀ ਯਾਦ ਦਿਵਾਉਂਦਾ ਹੈ ਕਿ ਇੱਕ ਮਾਡਲ ਜੋ "ਸਹੀ ਕਰਦਾ ਹੈ" ਉਹ ਵੀ ਗਲਤ ਅੰਦਰੂਨੀ ਚੈੱਕ ਪੈਦਾ ਕਰ ਸਕਦਾ ਹੈ, ਇਸ ਲਈ ਮਨੁੱਖੀ ਨਿਗਰਾਨੀ ਜ਼ਰੂਰੀ ਰਹਿੰਦੀ ਹੈ। ਫਿਨਿਸ਼ ਰੀਜ਼ਨ, ਟੋਕਨ ਦੀ ਵਰਤੋਂ ਅਤੇ ਲੇਟੈਂਸੀ ਨੂੰ ਟ੍ਰੈਕ ਕਰਨਾ ਤੁਹਾਨੂੰ ਕਿਸੇ ਚੁੱਪ ਟਾਈਮ-ਆਊਟ ਵਿੱਚ ਫਸੇ ਬਿਨਾਂ ਕੰਮ ਲਈ ਸਹੀ ਸਾਧਨ ਚੁਣਨ ਵਿੱਚ ਮਦਦ ਕਰੇਗਾ।
