Moonshot AI ਦੇ ਨਵੇਂ Kimi K3 ਨੇ AA-Briefcase ਬੈਂਚਮਾਰਕ 'ਤੇ GPT-5.6 ਨੂੰ ਪਛਾੜ ਦਿੱਤਾ ਹੈ, ਜਿਸ ਵਿੱਚ ਇਸ ਨੇ 1,527 ਸਕੋਰ ਕੀਤਾ ਹੈ ਜਦੋਂ ਕਿ ਦੂਜੇ ਨੇ 1,495 ਸਕੋਰ ਕੀਤਾ ਸੀ। ਇਹ ਜਿੱਤ ਇੱਕ ਅਜਿਹੇ ਪ੍ਰਾਈਸਿੰਗ ਮਾਡਲ ਦੇ ਨਾਲ ਆਉਂਦੀ ਹੈ ਜੋ 2.8-ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲੇ ਇਸ open-weight ਮਾਡਲ ਨੂੰ ਲੰਬੇ ਕੋਡਿੰਗ ਕੰਮਾਂ ਲਈ ਇੱਕ ਹੈਰਾਨੀਜਨਕ ਤੌਰ 'ਤੇ ਸਸਤਾ ਵਿਕਲਪ ਬਣਾਉਂਦੀ ਹੈ।

ਬੈਂਚਮਾਰਕ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

AA-Briefcase ਇਕੱਲੇ-ਦੁਹਲੇ (isolated) trivia ਸਵਾਲਾਂ ਦੀ ਬਜਾਏ ਲਗਾਤਾਰ, ਅਸਲ-ਦੁਨੀਆ ਦੇ ਕੰਮਾਂ (workloads) 'ਤੇ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਮਾਪਦਾ ਹੈ। ਉੱਚਾ ਸਕੋਰ ਇਸ ਗੱਲ ਦਾ ਸੰਕੇਤ ਹੈ ਕਿ ਇੱਕ ਮਾਡਲ ਹਜ਼ਾਰਾਂ ਟੋਕਨਾਂ ਦੇ ਦੌਰਾਨ ਸੰਦਰਭ (context) ਬਣਾਈ ਰੱਖ ਸਕਦਾ ਹੈ, ਅੱਗੇ ਦੀ ਯੋਜਨਾ ਬਣਾ ਸਕਦਾ ਹੈ ਅਤੇ ਕੰਮ 'ਤੇ ਟਿਕੇ ਰਹਿ ਸਕਦਾ ਹੈ - ਬਿਲਕੁਲ ਉਹੀ ਸਥਿਤੀਆਂ ਜਿਨ੍ਹਾਂ ਦਾ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਅਸਿਸਟੈਂਟ, ਕੋਡ ਜਨਰੇਟਰ ਜਾਂ ਰਿਸਰਚ ਅਸਿਸਟੈਂਟ ਬਣਾਉਂਦੇ ਸਮੇਂ ਸਾਹਮਣਾ ਕਰਨਾ ਪੈਂਦਾ ਹੈ। GPT-5.6 ਦੇ ਮੁਕਾਬਲੇ Kimi K3 ਦੀ ਵਾਧੂ ਕਾਬਲੀਅਤ ਇਹ ਦਿਖਾਉਂਦੀ ਹੈ ਕਿ ਇੱਕ open ਮਾਡਲ ਹੁਣ ਉੱਥੇ ਮੁਕਾਬਲਾ ਕਰ ਸਕਦਾ ਹੈ ਜਿੱਥੇ ਰਵਾਇਤੀ ਤੌਰ 'ਤੇ closed ਵਿਰੋਧੀਆਂ ਦਾ ਰਾਜ ਰਿਹਾ ਹੈ।

ਤਕਨੀਕੀ ਤਸਵੀਰ

  • Size – 2.8 ਟ੍ਰਿਲੀਅਨ ਪੈਰਾਮੀਟਰ, ਜੋ ਕਿ ਹੁਣ ਤੱਕ ਰਿਲੀਜ਼ ਕੀਤਾ ਗਿਆ ਸਭ ਤੋਂ ਵੱਡਾ open-weight ਮਾਡਲ ਹੈ।
  • Architecture – 896 experts ਦੇ ਨਾਲ Stable LatentMoE (Mixture-of-Experts), ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਕੋਈ ਵੀ 16 ਮਾਡਲ ਕਿਸੇ ਵੀ ਸਮੇਂ ਸਰਗਰਮ (active) ਹੁੰਦੇ ਹਨ।
  • Context window – 1 ਮਿਲੀਅਨ ਤੋਂ ਵੱਧ ਟੋਕਨ, ਜੋ ਪੂਰੀਆਂ ਕਿਤਾਬਾਂ ਜਾਂ ਲੰਬੇ codebase ਨੂੰ ਰੱਖਣ ਲਈ ਕਾਫ਼ੀ ਹਨ।
  • Attention – Kimi Delta Attention, ਇੱਕ ਕਸਟਮ ਸੁਧਾਰ (tweak) ਜਿਸ ਦਾ ਦਾਅਵਾ ਹੈ ਕਿ ਇਹ scaling ਕੁਸ਼ਲਤਾ ਨੂੰ ਸੁਧਾਰਦਾ ਹੈ।

ਇਹ ਚੋਣਾਂ ਮਾਡਲ ਨੂੰ “long-horizon” ਕੰਮਾਂ ਨੂੰ ਸੰਭਾਲਣ ਦੀ ਸਮਰੱਥਾ ਦਿੰਦੀਆਂ ਹਨ, ਪਰ ਇਹ ਕੰਪਿਊਟਿੰਗ ਦੀਆਂ ਲੋੜਾਂ ਨੂੰ ਵੀ ਵਧਾਉਂਦੀਆਂ ਹਨ, ਜੋ ਕਿ ਸਪੀਡ ਅਤੇ ਲਾਗਤ ਦੇ ਅੰਕੜਿਆਂ ਵਿੱਚ ਦਿਖਾਈ ਦਿੰਦੀਆਂ ਹਨ।

ਅੱਖਾਂ ਖਿੱਚਣ ਵਾਲੀ ਕੀਮਤ (Pricing)

Moonshot ਟੋਕਨ ਕੀਮਤ ਨੂੰ ਤਿੰਨ ਹਿੱਸਿਆਂ ਵਿੱਚ ਵੰਡਦਾ ਹੈ:

ਵਰਤੋਂ ਦੀ ਕਿਸਮ (Usage type) ਪ੍ਰਤੀ 1 ਮਿਲੀਅਨ ਟੋਕਨ ਦੀ ਲਾਗਤ
Input – cache miss $3.00
Input – cache hit $0.30
Output $15.00

ਕੰਪਨੀ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਕੋਡਿੰਗ ਕੰਮਾਂ ਵਿੱਚ 90% cache-hit ਦਰ ਦੇਖੀ ਜਾਂਦੀ ਹੈ। ਜੇਕਰ ਇਹ ਸੱਚ ਹੈ, ਤਾਂ ਇਹ ਕੋਡਿੰਗ ਏਜੰਟਾਂ ਲਈ ਇੱਕ ਬਹੁਤ ਹੀ ਸਸਤਾ ਵਿਕਲਪ ਹੈ।

ਉਹ ਸਮਝੌਤੇ (trade-offs) ਜੋ ਤੁਸੀਂ ਮਹਿਸੂਸ ਕਰੋਗੇ

  • Speed – ਮਾਡਲ ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਲਗਭਗ 62 ਟੋਕਨ ਪ੍ਰੋਸੈਸ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ ਮੌਜੂਦਾ ਮਿਆਰ (median) ਤੋਂ ਘੱਟ ਹੈ। ਇੱਕ ਲੰਬਾ ਪ੍ਰੋਂਪਟ (prompt) ਮਿੰਟਾਂ ਤੱਕ ਲੰਬਾ ਹੋ ਸਕਦਾ ਹੈ, ਜੋ ਕਿ ਇੰਟਰਐਕਟਿਵ ਵਰਤੋਂ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ।
  • Reasoning cost – Kimi K3 ਡਿਫੌਲਟ ਰੂਪ ਵਿੱਚ “max reasoning effort” ਨਾਲ ਚੱਲਦਾ ਹੈ ਅਤੇ ਇਸ ਨੂੰ ਘਟਾਉਣ ਲਈ ਕੋਈ ਵਿਕਲਪ ਨਹੀਂ ਦਿੰਦਾ। ਇਸ ਲਈ, ਸਧਾਰਨ ਸਵਾਲ ਵੀ ਉਨੇ ਹੀ ਟੋਕਨ ਖਰਚ ਕਰਦੇ ਹਨ ਜਿੰਨੇ ਗੁੰਝਲਦਾਰ ਸਵਾਲ, ਜਿਸ ਨਾਲ ਰੋਜ਼ਾਨਾ ਦੇ ਕੰਮਾਂ ਲਈ ਲਾਗਤ ਵਧ ਜਾਂਦੀ ਹੈ।
  • Hidden token usage – ਕੁਝ ਉਪਭੋਗਤਾਵਾਂ ਨੇ ਇੱਕ ਵੱਡੇ ਸਿਸਟਮ ਪ੍ਰੋਂਪਟ ਦੀ ਰਿਪੋਰਟ ਦਿੱਤੀ ਹੈ ਜੋ ਮਾਡਲ ਆਪਣੇ ਆਪ ਜੋੜ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਅਜਿਹੇ ਟੋਕਨ ਵਧ ਜਾਂਦੇ ਹਨ ਜਿਨ੍ਹਾਂ ਦਾ ਬਿੱਲ ਤਾਂ ਭਰਿਆ ਜਾਂਦਾ ਹੈ ਪਰ ਉਹ ਉਪਭੋਗਤਾ ਦੀ ਬੇਨਤੀ ਵਿੱਚ ਦਿਖਾਈ ਨਹੀਂ ਦਿੰਦੇ।

ਇਹ ਕਾਰਕ ਮਤਲਬ ਹੈ ਕਿ ਅਸਲ ਵਿੱਚ ਹੇਡਲਾਈਨ ਵਿੱਚ ਦਿਖਾਈ ਗਈ ਘੱਟ ਕੀਮਤ, ਹੌਲੀ ਰਫਤਾਰ ਅਤੇ ਵਧੇ ਹੋਏ ਟੋਕਨ ਦੀ ਵਰਤੋਂ ਕਾਰਨ ਵਧ ਸਕਦੀ ਹੈ।

ਉਪਲਬਧਤਾ ਅਤੇ ਅਗਲਾ ਰਾਹ

API ਅੱਜ ਲਾਈਵ ਹੈ, ਜੋ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਤੁਰੰਤ ਪ੍ਰਯੋਗ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ। ਮਾਡਲ ਵੇਟਸ (weights) ਖੁਦ 27 ਜੁਲਾਈ ਨੂੰ ਰਿਲੀਜ਼ ਕੀਤੇ ਜਾਣਗੇ, ਜਿਸ ਤੋਂ ਬਾਅਦ ਸੈਲਫ-ਹੋਸਟਿੰਗ ਸੰਭਵ ਹੋਵੇਗੀ। ਉਦੋਂ ਤੱਕ, ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ Moonshot ਦੀ ਹੋਸਟਡ ਸੇਵਾ 'ਤੇ ਨਿਰਭਰ ਰਹਿਣਾ ਪਵੇਗਾ ਅਤੇ ਇਸ ਨਾਲ ਜੁੜੀ ਲੇਟੈਂਸੀ (latency) ਅਤੇ ਪ੍ਰਾਈਸਿੰਗ ਢਾਂਚੇ ਨੂੰ ਸਵੀਕਾਰ ਕਰਨਾ ਪਵੇਗਾ।

Closed-model ਪੱਖ ਤੋਂ ਵਿਰੋਧੀ ਵਿਚਾਰ

ਨਿਕਲ ਕੇ ਆਉਣ ਵਾਲਾ ਮੁੱਖ ਨੁਕਤਾ

ਮੁੱਖ ਨੁਕਤਾ closed ਮਾਡਲਾਂ ਅਤੇ open ਮਾਡਲਾਂ ਵਿਚਕਾਰ ਘਟ ਰਹੀ ਦੂਰੀ ਹੈ। Kimi K3 ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ open-weight ਮਾਡਲ ਗੁੰਝਲਦਾਰ, long-horizon ਕੰਮਾਂ ਨੂੰ ਸੰਭਾਲ ਸਕਦੇ ਹਨ।