GPT-5.6-SOL ਨੇ ਗਣਿਤ, ਭੌਤਿਕ ਵਿਗਿਆਨ ਅਤੇ ਕੋਡਿੰਗ ਦੇ ਤਿੰਨ ਬਹੁ-ਪੜਾਅ ਵਾਲੇ ਕੰਮ ਪੂਰੇ ਕੀਤੇ, ਜਦੋਂ ਕਿ Kimi K3 ਉਸੇ ਪ੍ਰੋਂਪਟ 'ਤੇ ਟੋਕਨ ਬਜਟ ਖਤਮ ਹੋਣ ਅਤੇ ਟਾਈਮ-ਆਊਟ ਹੋਣ ਕਾਰਨ ਅਸਫਲ ਰਿਹਾ, ਜੋ ਕਿ ਉਹਨਾਂ ਡਿਵੈਲਪਰਾਂ ਲਈ ਇੱਕ ਵਿਹਾਰਕ ਸੀਮਾ ਨੂੰ ਉਜਾਗਰ ਕਰਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਭਰੋਸੇਯੋਗ, ਅੰਤ-ਤੱਕ (end-to-end) ਜਵਾਬਾਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।

ਇਹ ਟੈਸਟ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਦੋਵਾਂ ਮਾਡਲਾਂ ਨੂੰ ਇੱਕੋ ਜਿਹੇ ਟੋਕਨ ਸੀਲਿੰਗ ਦੇ ਅਧੀਨ ਇੱਕੋ ਜਿਹੇ ਪ੍ਰੋਂਪਟ ਦਿੱਤੇ ਗਏ ਸਨ, ਅਤੇ ਕੋਈ ਇੰਟਰਨੈਟ-ਸਰਚ ਟੂਲ ਚਾਲੂ ਨਹੀਂ ਸੀ। ਇਹ ਬੈਂਚਮਾਰਕ ਬਹੁ-ਪੜਾਅ ਵਾਲੀ ਤਰਕਸ਼ੀਲਤਾ (multi-step reasoning) 'ਤੇ ਕੇਂਦਰਿਤ ਸੀ—ਜੋ ਕਿ ਵਿਗਿਆਨਕ ਗਣਨਾਵਾਂ ਅਤੇ ਕੋਡ ਜਨਰੇਸ਼ਨ ਵਿੱਚ ਇੱਕ ਆਮ ਲੋੜ ਹੈ। ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ, ਇੱਕ ਮਾਡਲ ਜੋ ਅੰਤਿਮ ਨਤੀਜਾ ਦੇਣ ਤੋਂ ਪਹਿਲਾਂ ਆਪਣਾ ਟੋਕਨ ਅਲਾਟਮੈਂਟ ਖਤਮ ਕਰ ਦਿੰਦਾ ਹੈ, ਉਹ ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਰੋਕ ਸਕਦਾ ਹੈ ਅਤੇ ਡੀਬੱਗਿੰਗ ਦੇ ਕੰਮ ਨੂੰ ਵਧਾ ਸਕਦਾ ਹੈ।

ਆਹਮੋ-ਸਾਹਮਣੇ ਮੁਕਾਬਲੇ ਵਿੱਚ ਕੀ ਹੋਇਆ

GPT-5.6-SOL

  • ਤਿੰਨਾਂ ਚੁਣੌਤੀਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਇੱਕ ਮੁਕੰਮਲ ਜਵਾਬ ਦਿੱਤਾ।
  • ਸਹੀ ਗਣਿਤ ਅਤੇ ਭੌਤਿਕ ਵਿਗਿਆਨ ਦੇ ਡੈਰੀਵੇਸ਼ਨ (derivations) ਦਿੱਤੇ।
  • ਇੱਕ Python ਸਕ੍ਰਿਪਟ ਤਿਆਰ ਕੀਤੀ ਜੋ ਇੱਕ ਲੋਕਲ ਇੰਟਰਪ੍ਰੀਟਰ 'ਤੇ ਕੰਪਾਈਲ ਅਤੇ ਚੱਲੀ।
  • ਉਦਾਹਰਣ ਆਉਟਪੁੱਟ ਵਿੱਚ ਇੱਕ ਟੈਸਟ ਕੇਸ ਰਹਿ ਗਿਆ, ਪਰ ਮੁੱਖ ਤਰਕ (core logic) ਸਹੀ ਰਿਹਾ।

Kimi K3

  • ਗਣਿਤ ਅਤੇ ਭੌਤਿਕ ਵਿਗਿਆਨ ਦੀਆਂ ਸਮੱਸਿਆਵਾਂ ਲਈ ਕੋਈ ਦਿਖਾਈ ਦੇਣ ਵਾਲਾ ਹੱਲ ਪ੍ਰਦਾਨ ਕਰਨ ਵਿੱਚ ਅਸਫਲ ਰਿਹਾ।
  • ਵਾਰ-ਵਾਰ ਟੋਕਨ ਸੀਮਾ ਤੱਕ ਪਹੁੰਚ ਗਿਆ, ਜਿਸ ਕਾਰਨ ਨਤੀਜਾ ਆਉਣ ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਉਸਦੀ ਤਰਕਸ਼ੀਲਤਾ ਅਧੂਰੀ ਰਹਿ ਗਈ।
  • ਪ੍ਰੋਗਰਾਮਿੰਗ ਟਾਸਕ 'ਤੇ 245 ਸੈਕਿੰਡਾਂ ਬਾਅਦ ਰੁਕ ਗਿਆ, ਅਤੇ ਕੋਈ ਵੀ ਚੱਲਣਯੋਗ ਕੋਡ ਨਹੀਂ ਦਿੱਤਾ।

ਮਾਹਿਰਾਂ ਲਈ ਮੁੱਖ ਗੱਲਾਂ

  • Reasoning tokens ਬਨਾਮ ਅੰਤਿਮ ਆਉਟਪੁੱਟ – Kimi K3 ਆਪਣੇ ਟੋਕਨ ਬਜਟ ਦਾ ਇੱਕ ਵੱਡਾ ਹਿੱਸਾ ਅੰਦਰੂਨੀ ਵਿਚਾਰਾਂ (internal thought chains) 'ਤੇ ਖਰਚ ਕਰ ਦਿੰਦਾ ਹੈ। ਜਦੋਂ ਬਜਟ ਨਿਸ਼ਚਿਤ ਹੁੰਦਾ ਹੈ, ਤਾਂ ਮਾਡਲ ਅਕਸਰ ਜਵਾਬ ਦੇਣ ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਖਤਮ ਹੋ ਜਾਂਦਾ ਹੈ, ਜੋ ਕਿ ਉਹਨਾਂ ਵਰਕਫਲੋਜ਼ ਲਈ ਅਣਉਚਿਤ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਤੁਰੰਤ ਨਤੀਜੇ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
  • ਤਰਕ ਬਨਾਮ ਟੈਸਟਿੰਗ – ਇੱਕ ਮਾਡਲ ਜੋ ਤਰਕ ਸਹੀ ਕਰਦਾ ਹੈ, ਉਹ ਵੀ ਸਹਾਇਕ ਵੇਰਵਿਆਂ ਵਿੱਚ ਗਲਤੀ ਕਰ ਸਕਦਾ ਹੈ। GPT-5.6-SOL ਦਾ ਗਲਤ ਟੈਸਟ ਕੇਸ ਸਾਨੂੰ ਤਿਆਰ ਕੀਤੇ ਗਏ ਵੈਲੀਡੇਸ਼ਨ ਕੋਡ ਦੀ ਮੈਨੂਅਲੀ ਜਾਂਚ ਕਰਨ ਦੀ ਯਾਦ ਦਿਵਾਉਂਦਾ ਹੈ।
  • ਲੇਟੈਂਸੀ (Latency) ਅਤੇ ਰੁਕਣ ਦੇ ਕਾਰਨ ਮਹੱਤਵਪੂਰਨ ਹਨ – ਪ੍ਰੋਡਕਸ਼ਨ ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਨਾ ਸਿਰਫ਼ ਅੰਤਿਮ ਜਵਾਬ, ਸਗੋਂ ਇਹ ਵੀ ਲੌਗ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਮਾਡਲ ਕਿਉਂ ਰੁਕਿਆ (ਟੋਕਨ ਸੀਮਾ, ਟਾਈਮ-ਆਊਟ, ਆਦਿ) ਅਤੇ ਉਸਨੇ ਤਰਕ ਕਰਨ ਵਿੱਚ ਕਿੰਨੇ ਟੋਕਨ ਖਰਚ ਕੀਤੇ।

ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ

ਜਦੋਂ ਤੱਕ ਅਜਿਹੇ ਬਦਲਾਅ ਨਹੀਂ ਆਉਂਦੇ, ਉਹ ਡਿਵੈਲਪਰ ਜਿਨ੍ਹਾਂ ਨੂੰ ਭਰੋਸੇਯੋਗ ਅੰਤ-ਤੱਕ (end-to-end) ਨਤੀਜਿਆਂ ਦੀ ਲੋੜ ਹੈ, ਉਹ ਸ਼ਾਇਦ ਚੇਨਡ ਕੈਲਕੂਲੇਸ਼ਨਾਂ ਜਾਂ ਕੋਡ ਸਿੰਥੇਸਿਸ ਵਾਲੇ ਕੰਮਾਂ ਲਈ GPT-5.6-SOL ਵਰਗੇ ਮਾਡਲਾਂ ਨੂੰ ਤਰਜੀਹ ਦੇਣਗੇ।

ਆਟੋਮੇਟਡ ਸਿਸਟਮ ਬਣਾਉਣ ਵਾਲੀਆਂ ਟੀਮਾਂ ਲਈ, ਇਹ ਬੈਂਚਮਾਰਕ ਇੱਕ ਸਧਾਰਨ ਨਿਯਮ 'ਤੇ ਜ਼ੋਰ ਦਿੰਦਾ ਹੈ: ਜਵਾਬ ਦੀ ਸਹੀਤਾ ਅਤੇ ਤੁਹਾਡੇ ਦੁਆਰਾ ਲਗਾਈਆਂ ਗਈਆਂ ਕਾਰਜਸ਼ੀਲ ਸੀਮਾਵਾਂ ਦੇ ਅੰਦਰ ਉਸ ਜਵਾਬ ਤੱਕ ਪਹੁੰਚਣ ਦੀ ਮਾਡਲ ਦੀ ਯੋਗਤਾ, ਦੋਵਾਂ ਦੀ ਜਾਂਚ ਕਰੋ। ਇੱਕ ਮਾਡਲ ਜੋ "ਸੋਚਦਾ" ਹੈ ਪਰ ਕਦੇ ਖਤਮ ਨਹੀਂ ਹੁੰਦਾ, ਉਹ ਇੱਕ ਨਾਕਾਮ ਰਾਹ ਤੋਂ ਵੱਧ ਕੁਝ ਨਹੀਂ ਹੈ।