Moonshot AI ਨੇ 27 ਜੁਲਾਈ, 2026 ਨੂੰ 2.8-ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ Kimi K3 ਮਾਡਲ ਰਿਲੀਜ਼ ਕੀਤਾ, ਜਿਸ ਵਿੱਚ 96 ਸ਼ਾਰਡਸ (shards) ਵਿੱਚ 1.56 TB ਵੇਟਸ (weights) ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤੇ ਗਏ ਹਨ ਅਤੇ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਘੱਟੋ-ਘੱਟ 64 ਐਕਸਲਰੇਟਰਾਂ ਵਾਲੇ "supernode" ਕਲੱਸਟਰਾਂ 'ਤੇ ਇਸਨੂੰ ਚਲਾਉਣ ਦੀ ਅਪੀਲ ਕੀਤੀ ਗਈ ਹੈ। ਇਹ ਰਿਲੀਜ਼ ਇਸ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਇਹ ਇੱਕ ਅਤਿ-ਆਧੁਨਿਕ LLM ਨੂੰ ਉਹਨਾਂ ਸੰਸਥਾਵਾਂ ਦੀ ਪਹੁੰਚ ਵਿੱਚ ਲਿਆਉਂਦੀ ਹੈ ਜੋ ਹਾਰਡਵੇਅਰ ਦਾ ਖਰਚਾ ਚੁੱਕ ਸਕਦੀਆਂ ਹਨ, ਪਰ ਇੱਕ ਆਮ ਵਰਕਸਟੇਸ਼ਨ ਜਾਂ ਇੱਕ ਸਿੰਗਲ GPU ਇਸ ਲਈ ਕਾਫ਼ੀ ਨਹੀਂ ਹੋਵੇਗਾ।

ਹਾਰਡਵੇਅਰ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

Kimi K3 ਦਾ ਵਿਸ਼ਾਲ ਪੈਮਾਨਾ ਹਰ ਅਗਲੇਰੀ ਲੋੜ ਨੂੰ ਨਿਰਧਾਰਤ ਕਰਦਾ ਹੈ। ਮਾਡਲ ਦੀ ਐਕਟਿਵ-ਪੈਰਾਮੀਟਰ ਗਿਣਤੀ—ਪ੍ਰਤੀ ਟੋਕਨ 104 ਬਿਲੀਅਨ—ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਹਰ ਟੋਕਨ ਨੈੱਟਵਰਕ ਦੇ ਇੱਕ ਬਹੁਤ ਵੱਡੇ ਹਿੱਸੇ ਨੂੰ ਛੂਹੰਦਾ ਹੈ। ਇਸਦਾ ਕੰਟੈਕਸਟ ਵਿੰਡੋ (context window) 1,048,576 ਟੋਕਨਾਂ ਤੱਕ ਫੈਲਿਆ ਹੋਇਆ ਹੈ, ਜਿਸਦਾ ਆਕਾਰ ਸਿਰਫ਼ ਇੱਕ ਵਿਸ਼ਾਲ KV (key-value) ਕੈਸ਼ ਹੀ ਸਹਿ ਸਕਦਾ ਹੈ। ਵੇਟ ਫਾਈਲਾਂ 1.56 TB ਦੀਆਂ ਹਨ, ਪਰ ਇਸ ਅੰਕੜੇ ਵਿੱਚ ਰਨ-ਟਾਈਮ, ਐਕਟੀਵੇਸ਼ਨ ਸਟੋਰੇਜ, ਅਤੇ KV ਕੈਸ਼ ਲਈ ਲੋੜੀਂਦੀ VRAM ਸ਼ਾਮਲ ਨਹੀਂ ਹੈ। ਅਸਲ ਵਿੱਚ, ਇੱਕ ਅਜਿਹਾ ਡਿਪਲਾਈਮੈਂਟ ਜੋ ਪੂਰੇ 1-ਮਿਲੀਅਨ-ਟੋਕਨ ਵਿੰਡੋ ਦੀ ਵਰਤੋਂ ਕਰਨ ਦਾ ਟੀਚਾ ਰੱਖਦਾ ਹੈ, ਉਹ ਮੈਮੋਰੀ ਦੇ ਬਹੁਤ ਜ਼ਿਆਦਾ ਬੋਝ (overhead) ਨੂੰ ਵਧਾ ਦਿੰਦਾ ਹੈ।

ਡਿਪਲਾਈਮੈਂਟ ਤੋਂ ਪਹਿਲਾਂ ਤਿੰਨ ਚੈੱਕ

1. ਸਟੋਰੇਜ ਚੈੱਕ

ਸ਼ਾਰਡਸ ਨੂੰ ਡਾਊਨਲੋਡ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ, ਇਹ ਪੁਸ਼ਟੀ ਕਰੋ ਕਿ ਤੁਹਾਡੇ ਕੋਲ ਲੋੜੀਂਦੀ ਡਿਸਕ ਸਪੇਸ ਹੈ ਅਤੇ ਸਟੋਰੇਜ ਸਬਸਿਸਟਮ ਉੱਚ-ਥਰੂਪੁੱਟ (high-throughput) ਰੀਡਸ ਨੂੰ ਸਹਿ ਸਕਦਾ ਹੈ। ਜੇਕਰ 96 ਸ਼ਾਰਡਸ ਹੌਲੀ ਸਟੋਰੇਜ 'ਤੇ ਹਨ, ਤਾਂ ਮਾਡਲ ਆਪਣਾ ਜ਼ਿਆਦਾਤਰ ਸਮਾਂ ਡੇਟਾ ਦੀ ਉਡੀਕ ਕਰਨ ਵਿੱਚ ਬਿਤਾਏਗਾ।

2. ਹਾਰਡਵੇਅਰ ਚੈੱਕ

Moonshot ਦੀ ਤਕਨੀਕੀ ਰਿਪੋਰਟ 64 ਜਾਂ ਇਸ ਤੋਂ ਵੱਧ ਐਕਸਲਰੇਟਰਾਂ ਦੇ ਕਲੱਸਟਰ ਦੀ ਸਿਫਾਰਸ਼ ਕਰਦੀ ਹੈ। ਇੱਕ ਸਿੰਗਲ GPU, ਇੱਥੋਂ ਤੱਕ ਕਿ ਇੱਕ ਉੱਚ-ਦਰਜੇ ਦਾ GPU ਵੀ, ਮਾਡਲ ਦੇ ਵੇਟਸ ਅਤੇ ਰਨ-ਟਾਈਮ ਬਫਰਾਂ ਨੂੰ ਇਕੱਠਾ ਨਹੀਂ ਰੱਖ ਸਕਦਾ।

3. ਰਨ-ਟਾਈਮ ਚੈੱਕ

ਮਾਡਲ vLLM, SGLang, ਜਾਂ TokenSpeed ਵਰਗੇ ਵਿਸ਼ੇਸ਼ ਇਨਫਰੈਂਸ ਇੰਜਣਾਂ 'ਤੇ ਚੱਲਦਾ ਹੈ। ਹਰੇਕ ਇੰਜਣ MXFP4-ਫਾਰਮੈਟਡ ਵੇਟਸ ਨੂੰ ਲੋਡ ਕਰਨ, KV ਕੈਸ਼ ਨੂੰ ਅਲਾਟ ਕਰਨ, ਅਤੇ ਟੈਂਸਰ ਆਪਰੇਸ਼ਨਾਂ ਨੂੰ ਸ਼ਡਿਊਲ ਕਰਨ ਲਈ ਇੱਕ ਵਿਧੀ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਇੱਕ ਇੰਜਣ ਚੁਣੋ, ਉਸਦੀ ਗਾਈਡ ਦੀ ਬਿਲਕੁਲ ਪਾਲਣਾ ਕਰੋ, ਅਤੇ ਵੱਖ-ਵੱਖ ਰਨ-ਟਾਈਮਾਂ ਦੇ ਕੰਪੋਨੈਂਟਾਂ ਨੂੰ ਮਿਲਾਉਣ ਤੋਂ ਬਚੋ।

ਪ੍ਰੈਕਟੀਕਲ ਚੈੱਕਲਿਸਟ

  • ਡਾਊਨਲੋਡ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ – 96 ਸ਼ਾਰਡਸ ਪ੍ਰਾਪਤ ਕਰਨ ਤੋਂ ਬਾਅਦ, ਦਿੱਤਾ ਗਿਆ checksum ਜਾਂ hash ਸਕ੍ਰਿਪਟ ਚਲਾਓ। ਖਰਾਬ ਸ਼ਾਰਡਸ ਬਾਅਦ ਵਿੱਚ ਚੁੱਪਚਾਪ ਫੇਲ੍ਹ ਹੋਣ ਦਾ ਕਾਰਨ ਬਣ ਸਕਦੇ ਹਨ।
  • ਲਾਇਸੈਂਸ ਪੜ੍ਹੋ – Kimi K3 ਲਾਇਸੈਂਸ ਵਿੱਚ ਵਰਤੋਂ ਦੀਆਂ ਸੀਮਾਵਾਂ ਅਤੇ ਐਟਰੀਬਿਊਸ਼ਨ (attribution) ਦੀਆਂ ਲੋੜਾਂ ਸ਼ਾਮਲ ਹਨ ਜੋ ਆਨਲਾਈਨ ਮੌਜੂਦ ਸੰਖੇਪ ਸਾਰਾਂਸ਼ਾਂ ਤੋਂ ਵੱਖਰੀਆਂ ਹਨ। ਇਸ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਨ ਨਾਲ ਤੁਸੀਂ ਕਾਨੂੰਨੀ ਜੋਖਮ ਵਿੱਚ ਪੈ ਸਕਦੇ ਹੋ।
  • ਆਪਣੀ ਟੋਪੋਲੋਜੀ (topology) ਦਾ ਨਕਸ਼ਾ ਤਿਆਰ ਕਰੋ – ਹਰੇਕ ਐਕਸਲਰੇਟਰ, ਹਰੇਕ ਇੰਟਰਕਨੈਕਟ (interconnect) ਦੀ ਬੈਂਡਵਿਡਥ, ਅਤੇ ਹੋਸਟ RAM ਦੀ ਮਾਤਰਾ ਦੀ ਸੂਚੀ ਬਣਾਓ। ਇਹ ਨਕਸ਼ਾ ਤੁਹਾਨੂੰ ਇਹ ਦੱਸਣ ਵਿੱਚ ਮਦਦ ਕਰੇਗਾ ਕਿ ਤੁਸੀਂ ਡਿਵਾਈਸਾਂ ਵਿੱਚ ਮਾਡਲ ਨੂੰ ਕਿਵੇਂ ਵੰਡਣਾ ਹੈ।
  • ਕੰਟੈਕਸਟ ਲੈਂਥ (context length) ਨਾਲ ਛੋਟੀ ਸ਼ੁਰੂਆਤ ਕਰੋ – ਪਹਿਲਾਂ 32 K, ਫਿਰ 128 K, ਅਤੇ ਅੰਤ ਵਿੱਚ 256 K ਟੋਕਨ ਵਿੰਡੋਜ਼ ਨਾਲ ਟੈਸਟ ਕਰੋ। ਇਹਨਾਂ ਕਦਮਾਂ ਤੋਂ ਬਾਅਦ ਹੀ ਤੁਹਾਨੂੰ ਪੂਰੀ 1 M-ਟੋਕਨ ਵਿੰਡੋ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ; ਹਰ ਕਦਮ ਮੈਮੋਰੀ ਦੇ ਦਬਾਅ ਨੂੰ ਕਈ ਗੁਣਾ ਵਧਾ ਦਿੰਦਾ ਹੈ।
  • ਫੇਲ੍ਹ ਹੋਣ ਦੀ ਸਿਮੂਲੇਸ਼ਨ ਕਰੋ – ਟੈਸਟ ਰਨ ਦੌਰਾਨ ਇੱਕ ਐਕਸਲਰੇਟਰ ਨੂੰ ਡਿਸਕਨੈਕਟ ਕਰੋ ਜਾਂ ਇੱਕ ਸ਼ਾਰਡ ਨੂੰ ਖਰਾਬ ਕਰੋ। ਪੁਸ਼ਟੀ ਕਰੋ ਕਿ ਤੁਹਾਡਾ ਆਰਕੈਸਟ੍ਰੇਸ਼ਨ (orchestration) ਲੇਅਰ ਖਰਾਬੀ ਦਾ ਪਤਾ ਲਗਾਉਂਦੀ ਹੈ, ਗੁੰਮ ਹੋਏ ਹਿੱਸੇ ਨੂੰ ਦੁਬਾਰਾ ਲੋਡ ਕਰਦੀ ਹੈ, ਅਤੇ ਸੇਵਾ ਨੂੰ ਚਾਲੂ ਰੱਖਦੀ ਹੈ।
  • **ਫਾਲਬੈਕ