Kimi K3 ਦੀ API ਕਾਗਜ਼ੀ ਤੌਰ 'ਤੇ ਸਸਤੀ ਲੱਗਦੀ ਹੈ, ਪਰ ਲੁਕਵੀਆਂ ਫੀਸਾਂ ਅਤੇ ਤਕਨੀਕੀ ਵੇਰਵਿਆਂ ਦੀ ਘਾਟ ਇਸਨੂੰ ਮੁੱਖ ਅੰਕੜਿਆਂ ਦੀ ਤੁਲਨਾ ਵਿੱਚ ਕਿਤੇ ਜ਼ਿਆਦਾ ਮਹਿੰਗਾ ਬਣਾ ਸਕਦੀ ਹੈ।

ਜੋ ਚਰਚਾ ਵਿੱਚ ਨਹੀਂ ਆ ਰਿਹਾ

Moonshot AI ਦੀ ਲਾਂਚ ਸਮੱਗਰੀ ਇੱਕ 2.8 ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਮਾਡਲ ਦਾ ਦਾਅਵਾ ਕਰਦੀ ਹੈ ਜੋ "ਸਸਤਾ" ਅਤੇ "ਓਪਨ" ਹੈ। ਪ੍ਰੈਸ ਰਿਲੀਜ਼ ਵਿੱਚ ਜਲਦੀ ਹੀ ਡਾਊਨਲੋਡ ਕਰਨ ਯੋਗ weights ਮਿਲਣ ਦਾ ਵਾਅਦਾ ਵੀ ਕੀਤਾ ਗਿਆ ਹੈ। ਪਰ ਇਹਨਾਂ ਵਿੱਚੋਂ ਕੋਈ ਵੀ ਦਾਅਵਾ ਸਹੀ ਸਾਬਤ ਨਹੀਂ ਹੁੰਦਾ।

  • Weights ਉਪਲਬਧ ਨਹੀਂ ਹਨ – Moonshot ਨੇ ਪਬਲਿਕ ਚੈੱਕਪੁਆਇੰਟ ਲਈ 27 ਜੁਲਾਈ 2026 ਦੀ ਸਮਾਂ ਸੀਮਾ ਰੱਖੀ ਹੈ। ਉਦੋਂ ਤੱਕ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਹੋਸਟਡ API ਦੀ ਵਰਤੋਂ ਕਰਨੀ ਪਵੇਗੀ, ਇਸ ਲਈ "ਓਪਨ-ਸੋਰਸ" ਦਾ ਵਾਅਦਾ ਕੁਝ ਵੀ ਵਰਤੋਂ ਯੋਗ ਨਹੀਂ ਦਿੰਦਾ।
  • 2.8 T ਪੈਰਾਮੀਟਰ ਸਾਰੇ ਸਰਗਰਮ (active) ਨਹੀਂ ਹਨ – ਇਹ ਅੰਕ ਆਰਕੀਟੈਕਚਰ ਦੀ ਕੁੱਲ ਸਮਰੱਥਾ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ। K3 ਦਾ Mixture-of-Experts ਡਿਜ਼ਾਈਨ ਹਰੇਕ ਟੋਕਨ ਨੂੰ 896 ਐਕਸਪਰਟ ਸਬ-ਨੈੱਟਵਰਕਾਂ ਵਿੱਚੋਂ 16 ਰਾਹੀਂ ਭੇਜਦਾ ਹੈ। Moonshot ਨੇ ਇਹ ਨਹੀਂ ਦੱਸਿਆ ਕਿ ਇੱਕ ਰਿਕੁਐਸਟ ਲਈ ਕਿੰਨੇ ਪੈਰਾਮੀਟਰ ਚੱਲਦੇ ਹਨ, ਜਿਸ ਕਾਰਨ ਮੈਮੋਰੀ ਅਤੇ ਕੰਪਿਊਟ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣਾ ਅਸੰਭਵ ਹੈ।

ਕੀਮਤ ਜੋ ਵਧੀਆ ਲੱਗਦੀ ਹੈ – ਜਦੋਂ ਤੱਕ ਤੁਸੀਂ ਸ਼ਬਦਾਂ ਦੀ ਗਿਣਤੀ ਨਹੀਂ ਕਰਦੇ

ਪ੍ਰਕਾਸ਼ਿਤ ਦਰਾਂ:

  • Cache-hit input: $0.30 ਪ੍ਰਤੀ 1 ਮਿਲੀਅਨ ਟੋਕਨ
  • Uncached input: $3.00 ਪ੍ਰਤੀ 1 ਮਿਲੀਅਨ ਟੋਕਨ
  • Output: $15.00 ਪ੍ਰਤੀ 1 ਮਿਲੀਅਨ ਟੋਕਨ

ਉਹ ਦਰਾਂ ਮਾਮੂਲੀ ਲੱਗਦੀਆਂ ਹਨ, ਪਰ ਉਹ ਟੋਕਨ ਦੀ ਮਾਤਰਾ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਦੀਆਂ ਹਨ।

ਇੱਕ ਤਾਜ਼ਾ ਟੈਸਟ ਵਿੱਚ K3 ਦਾ ਆਉਟਪੁੱਟ 130 ਮਿਲੀਅਨ ਟੋਕਨ ਮਾਪਿਆ ਗਿਆ, ਜੋ ਕਿ ਉਸੇ ਕੰਮ ਲਈ ਹੋਰ ਪ੍ਰਮੁੱਖ ਮਾਡਲਾਂ ਦੁਆਰਾ ਪੈਦਾ ਕੀਤੇ ਗਏ 63 ਮਿਲੀਅਨ ਟੋਕਨਾਂ ਨਾਲੋਂ ਦੁੱਗਣੇ ਤੋਂ ਵੀ ਵੱਧ ਹੈ। ਮਾਡਲ ਦੀ ਜ਼ਿਆਦਾ ਸ਼ਬਦਾਂ ਦੀ ਵਰਤੋਂ (verbosity) ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਆਉਟਪੁੱਟ ਬਿੱਲ ਨੂੰ ਵਧਾ ਦਿੰਦੀ ਹੈ—ਦੁੱਗਣੇ ਸ਼ਬਦਾਂ ਦਾ ਮਤਲਬ ਹੈ ਦੁੱਗਣੀ ਲਾਗਤ। ਕੋਡ ਜਨਰੇਸ਼ਨ, ਲੇਖਾਂ, ਜਾਂ ਚੈਟ ਏਜੰਟਾਂ ਲਈ, $15 ਪ੍ਰਤੀ ਮਿਲੀਅਨ-ਟੋਕਨ ਦੀ ਦਰ ਖਰਚੇ ਨੂੰ ਕਾਫ਼ੀ ਵਧਾ ਸਕਦੀ ਹੈ।

ਵੱਖ-ਵੱਖ ਉਪਭੋਗਤਾਵਾਂ ਲਈ ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ

ਡਿਵੈਲਪਰ ਅਤੇ ਖੋਜਕਰਤਾ

ਜੇਕਰ ਤੁਸੀਂ ਕੋਡਿੰਗ ਸਹਾਇਤਾ ਜਾਂ ਡੇਟਾ-ਅਧਾਰਤ ਖੋਜ ਲਈ K3 ਦਾ ਟੈਸਟ ਕਰਦੇ ਹੋ, ਤਾਂ ਟੋਕਨ ਆਉਟਪੁੱਟ 'ਤੇ ਸਖ਼ਤ ਸੀਮਾਵਾਂ (hard caps) ਲਗਾਓ। ਇੱਕ A/B ਟੈਸਟ ਜੋ K3 ਦੀ ਤੁਲਨਾ ਇੱਕ ਬੇਸਲਾਈਨ ਮਾਡਲ ਨਾਲ ਕਰਦਾ ਹੈ ਜਿਸਦੀ ਆਉਟਪੁੱਟ ਸੀਮਾ ਇੱਕੋ ਜਿਹੀ ਹੋਵੇ, ਇਹ ਦਿਖਾਏਗਾ ਕਿ ਕੀ ਵਧੇਰੇ ਟੋਕਨ ਦੀ ਵਰਤੋਂ ਮਾਡਲ ਕਾਰਨ ਹੋ ਰਹੀ ਹੈ ਜਾਂ ਪ੍ਰੋਂਪਟ ਡਿਜ਼ਾਈਨ ਕਾਰਨ।

ਬਜਟ ਪ੍ਰਤੀ ਸੁਚੇਤ ਟੀਮਾਂ

Cache-hit ਛੋਟ ਸਿਰਫ਼ ਉਦੋਂ ਲਾਗੂ ਹੁੰਦੀ ਹੈ ਜਦੋਂ ਇੱਕੋ ਜਿਹਾ ਇਨਪੁੱਟ ਦੁਹਰਾਇਆ ਜਾਂਦਾ ਹੈ। ਅਜਿਹੇ ਸਥਿਰ ਪ੍ਰੋਂਪਟ ਪ੍ਰੀਫਿਕਸ ਤਿਆਰ ਕਰੋ ਜੋ ਇੱਕੋ ਜਿਹੇ ਇਨਪੁੱਟ ਸਟ੍ਰਿੰਗ ਬਣਾਉਂਦੇ ਹਨ ਤਾਂ ਜੋ ਵਧੇਰੇ ਰਿਕੁਐਸਟਾਂ ਨੂੰ $0.30 ਵਾਲੇ ਪੱਧਰ ਵਿੱਚ ਲਿਆਂਦਾ ਜਾ ਸਕੇ; ਇਹ ਸਿਰਫ਼ ਬਹੁਤ ਜ਼ਿਆਦਾ ਦੁਹਰਾਉਣ ਵਾਲੇ ਕੰਮਾਂ (ਜਿਵੇਂ ਕਿ ਟੈਂਪਲੇਟਡ ਕੁਐਰੀਆਂ) ਲਈ ਕੰਮ ਕਰਦਾ ਹੈ। ਜ਼ਿਆਦਾਤਰ ਵੱਖ-ਵੱਖ ਇਨਪੁੱਟ $3.00 ਦੀ uncached ਦਰ 'ਤੇ ਆ ਜਾਣਗੇ।

ਸੈਲਫ-ਹੋਸਟਿੰਗ 'ਤੇ ਵਿਚਾਰ ਕਰਨ ਵਾਲੀਆਂ ਕੰਪਨੀਆਂ

ਚੈੱਕਪੁਆਇੰਟ ਰਿਲੀਜ਼ ਦੀ ਉਡੀਕ ਕਰਨਾ ਸਿਆਣਪ ਹੈ। ਮਾਡਲ ਨੂੰ ਹੋਸਟ ਕਰਨ ਨਾਲ ਪ੍ਰਤੀ-ਟੋਕਨ ਫੀਸ ਖਤਮ ਹੋ ਜਾਂਦੀ ਹੈ ਪਰ ਅਣਐਲਾਨਿਤ ਲਾਇਸੈਂਸਿੰਗ ਅਤੇ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦੀਆਂ ਲਾਗਤਾਂ ਵਧ ਜਾਂਦੀਆਂ ਹਨ। ਜਦੋਂ ਤੱਕ weights ਜਨਤਕ ਨਹੀਂ ਹੁੰਦੇ, ਹੋਸਟਡ API ਹੀ ਇੱਕੋ ਇੱਕ ਵਿਹਵਾਸਯੋਗ ਵਿਕਲਪ ਹੈ।

ਪ੍ਰੋਡਕਸ਼ਨ ਵਾਤਾਵਰਣ (Production environments)

ਸਿਰਫ਼ ਇਸ ਲਈ ਬਦਲਾਅ ਨਾ ਕਰੋ ਕਿਉਂਕਿ ਮੁੱਖ ਕੀਮਤ ਵਿਰੋਧੀਆਂ ਨਾਲੋਂ ਘੱਟ ਲੱਗਦੀ ਹੈ। ਟੋਕਨ ਦੀ ਲਾਗਤ ਦੀ ਬਜਾਏ, ਇੱਕ ਪਾਇਲਟ ਚਲਾਓ ਜੋ ਲੰਬੇ ਜਵਾਬਾਂ ਤੋਂ ਹੋਣ ਵਾਲੇ ਲੁਕੇ ਹੋਏ ਵਾਧੂ ਖਰਚੇ ਸਮੇਤ ਪੂਰੇ ਕੀਤੇ ਗਏ ਕੰਮ ਦੀ ਲਾਗਤ ਨੂੰ ਮਾਪੇ। ਉਦੋਂ ਹੀ ਤੁਸੀਂ ਫੈਸਲਾ ਕਰ ਸਕਦੇ ਹੋ ਕਿ ਕੀ K3 ਪੈਸੇ ਬਚਾਉਂਦਾ ਹੈ।

ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ

  • 27 ਜੁਲਾਈ 2026 ਚੈੱਕਪੁਆਇੰਟ ਰਿਲੀਜ਼ – ਉਸ ਮਿਤੀ 'ਤੇ weights ਰਿਲੀਜ਼ ਕੀਤੇ ਜਾਣੇ ਹਨ।
  • Active-parameter ਖੁਲਾਸਾ – ਇਹ ਜਾਣਨਾ ਕਿ ਪ੍ਰਤੀ ਟੋਕਨ 2.8 T ਪੈਰਾਮੀਟਰਾਂ ਵਿੱਚੋਂ ਕਿੰਨੇ ਚੱਲਦੇ ਹਨ, ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਹਾਰਡਵੇਅਰ ਦਾ ਸਹੀ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰੇਗਾ।

ਨਿਚੋੜ

K3 ਦੀ ਇਸ਼ਤਿਹਾਰਬੱਧ $15 ਪ੍ਰਤੀ ਮਿਲੀਅਨ-ਟੋਕਨ ਆਉਟਪੁੱਟ ਕੀਮਤ ਸਿਰਫ਼ ਅੱਧੀ ਕਹਾਣੀ ਦੱਸਦੀ ਹੈ। ਸਾਥੀਆਂ ਦੇ ਮੁਕਾਬਲੇ ਦੁੱਗਣੇ ਟੋਕਨ ਪੈਦਾ ਕਰਨ ਦੀ ਇਸਦੀ ਪ੍ਰਵਿਰਤੀ ਕਿਸੇ ਵੀ ਮੁੱਖ ਬਚਤ ਨੂੰ ਖਤਮ ਕਰ ਸਕਦੀ ਹੈ, ਖਾਸ ਕਰਕੇ ਲੰਬੇ ਜਵਾਬ ਵਾਲੇ ਕੰਮਾਂ ਲਈ। ਜਦੋਂ ਤੱਕ weights ਉਪਲਬਧ ਨਹੀਂ ਹੁੰਦੇ ਅਤੇ active-parameter ਦੀ ਗਿਣਤੀ ਸਪੱਸ਼ਟ ਨਹੀਂ ਹੁੰਦੀ, K3 ਨੂੰ ਇੱਕ ਸਸਤੇ ਵਿਕਲਪ ਦੀ ਬਜਾਏ ਇੱਕ ਪ੍ਰੀਮੀਅਮ, ਸੰਭਾਵਿਤ ਤੌਰ 'ਤੇ ਜ਼ਿਆਦਾ ਸ਼ਬਦਾਂ ਵਾਲੀ (verbose) ਸੇਵਾ ਵਜੋਂ ਮੰਨੋ। ਟੋਕਨ-ਬਜਟ ਟੈਸਟ ਕਰੋ, ਆਉਟਪੁੱਟ ਸੀਮਾਵਾਂ ਲਗਾਓ, ਅਤੇ ਸਿਰਫ਼ ਉਦੋਂ ਹੀ ਬਦਲਾਅ ਕਰੋ ਜਦੋਂ ਤੁਸੀਂ ਮੁਕੰਮਲ ਕੀਤੇ ਕੰਮ ਦੀ ਅਸਲ ਲਾਗਤ ਨੂੰ ਮਾਪ ਲਿਆ ਹੋਵੇ।