ਇੱਕ 150-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ Mixture-of-Experts ਮਾਡਲ ਇੱਕ ਸਟੈਂਡਰਡ ਡਿਵੈਲਪਰ ਲੈਪਟਾਪ 'ਤੇ ਟੈਕਸਟ ਜਨਰੇਟ ਕਰ ਸਕਦਾ ਹੈ। ਇਹ ਪ੍ਰਯੋਗ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਅਸਲ ਪ੍ਰਦਰਸ਼ਨ ਸੀਮਾ (limiter) SSD ਦੀ ਰਫ਼ਤਾਰ ਨਹੀਂ, ਸਗੋਂ RAM ਹੈ। ਇਹ ਇਸ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਇਹ ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ ਫਰੰਟੀਅਰ-ਸਕੇਲ ਮਾਡਲਾਂ ਨੂੰ ਕਲਾਉਡ ਕੰਪਿਊਟਿੰਗ 'ਤੇ ਖਰਚਾ ਕੀਤੇ ਬਿਨਾਂ ਸਥਾਨਕ (locally) ਤੌਰ 'ਤੇ ਟੈਸਟ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।

ਟੈਸਟ

ਅਸੀਂ DeepSeek V4 Flash ਮਾਡਲ—ਇੱਕ REAP-pruned 150 B-parameter MoE—ਨੂੰ ਓਪਨ-ਸੋਰਸ Colibrì inference engine ਰਾਹੀਂ ਚਲਾਇਆ। ਹਾਰਡਵੇਅਰ ਇੱਕ AMD Ryzen AI 9 365 ਲੈਪਟਾਪ ਸੀ ਜਿਸ ਵਿੱਚ 61 GB RAM ਅਤੇ 1 TB NVMe SSD ਸੀ। ਅਸੀਂ ਤਿੰਨ ਮਿੰਟ ਦੇ ਜਨਰੇਸ਼ਨ ਰਨ ਦਾ ਸਮਾਂ ਨਿਰਧਾਰਤ ਕੀਤਾ ਅਤੇ ਹਰ ਡਿਸਕ ਐਕਸੈਸ (disk access) ਨੂੰ ਰਿਕਾਰਡ ਕੀਤਾ।

ਅੰਕੜੇ ਕੀ ਦੱਸਦੇ ਹਨ

  • ਡਿਸਕ ਗਤੀਵਿਧੀ ਬਹੁਤ ਘੱਟ ਸੀ। ਤਿੰਨ ਮਿੰਟ ਦੇ ਜਨਰੇਸ਼ਨ ਦੌਰਾਨ SSD ਨੇ 11 ਸੈਕਿੰਡ ਤੋਂ ਵੀ ਘੱਟ ਸਮਾਂ ਡਾਟਾ ਪੜ੍ਹਿਆ (reads)। ਜੇਕਰ ਡਰਾਈਵ ਡਾਟਾ ਤੁਰੰਤ ਪੜ੍ਹ ਸਕਦੀ ਸੀ, ਤਾਂ ਵੀ ਕੁੱਲ ਥਰੂਪੁੱਟ (throughput) ਵਿੱਚ ਸਿਰਫ਼ ਲਗਭਗ 6 ਪ੍ਰਤੀਸ਼ਤ ਦਾ ਸੁਧਾਰ ਹੁੰਦਾ।
  • RAM ਦੇ ਆਕਾਰ ਨੇ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਰਫ਼ਤਾਰ 'ਤੇ ਅਸਰ ਪਾਇਆ। RAM ਕੈਸ਼ (cache) ਨੂੰ ਅੱਧਾ ਕਰਨ ਨਾਲ ਥਰੂਪੁੱਟ ਲਗਭਗ 15 ਪ੍ਰਤੀਸ਼ਤ ਘਟ ਗਿਆ। CPU ਨੇ ਕੈਸ਼ ਮਿਸਿਸ (cache misses) ਨੂੰ ਸੰਭਾਲਣ—ਜਿਵੇਂ ਕਿ ਡੀ-ਕੁਆਂਟਾਈਜ਼ਿੰਗ (de-quantising), ਕਾਪੀ ਕਰਨਾ ਅਤੇ ਡਾਟਾ ਪ੍ਰਬੰਧਿਤ ਕਰਨਾ—ਵਿੱਚ ਲਗਭਗ ਉਨਾ ਹੀ ਸਮਾਂ ਲਗਾਇਆ ਜਿੰਨਾ ਕਿ ਡਿਸਕ ਦੀ ਉਡੀਕ ਕਰਨ ਵਿੱਚ।

ਇਹ ਅੰਕੜੇ ਇਸ ਆਮ ਵਿਸ਼ਵਾਸ ਨੂੰ ਰੱਦ ਕਰਦੇ ਹਨ ਕਿ ਲੈਪਟਾਪ 'ਤੇ ਵੱਡੇ-ਮਾਡਲ ਇਨਫਰੈਂਸ (inference) ਲਈ ਸਟੋਰੇਜ ਬੈਂਡਵਿਡਥ ਮੁੱਖ ਰੁਕਾਵਟ ਹੈ।

RAM, SSD ਤੋਂ ਬਿਹਤਰ ਕਿਉਂ ਹੈ

ਜਦੋਂ ਕੋਈ ਮਾਡਲ ਪੈਰਾਮੀਟਰ ਪਹਿਲਾਂ ਹੀ RAM ਵਿੱਚ ਨਹੀਂ ਹੁੰਦਾ, ਤਾਂ ਸਿਸਟਮ ਨੂੰ ਇਹ ਕਰਨਾ ਪੈਂਦਾ ਹੈ:

  1. SSD ਤੋਂ ਡਾਟਾ ਕੱਢਣਾ।
  2. ਇਸ ਨੂੰ ਡੀਕੋਡ ਕਰਨਾ ਅਤੇ ਕੰਪਿਊਟੇਸ਼ਨ ਲਈ CPU ਰਜਿਸਟਰਾਂ ਵਿੱਚ ਭੇਜਣਾ।

ਦੋਵੇਂ ਕਦਮ ਸਾਈਕਲ (cycles) ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ। ਪਹਿਲਾ ਕਦਮ SSD ਦੀ ਬੈਂਡਵਿਡਥ ਦੁਆਰਾ ਸੀਮਤ ਹੁੰਦਾ ਹੈ; ਦੂਜਾ ਕਦਮ ਲਗਭਗ ਉਨਾ ਹੀ ਦੇਰੀ ਕਰਦਾ ਹੈ ਕਿਉਂਕਿ CPU ਨੂੰ ਡਾਟਾ ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਆਉਂਦਾ ਹੈ, ਇਸ ਦੀ ਪਰਵਾਹ ਕੀਤੇ ਬਿਨਾਂ ਉਸ ਨੂੰ ਡੀ-ਕੁਆਂਟਾਈਜ਼ ਕਰਨਾ ਪੈਂਦਾ ਹੈ। ਇਸ ਲਈ, ਇੱਕ ਤੇਜ਼ SSD ਤੋਂ ਮਿਲਣ ਵਾਲਾ ਲਾਭ ਸੀਮਤ ਹੁੰਦਾ ਹੈ, ਜਦੋਂ ਕਿ ਵਧੇਰੇ RAM ਮਾਡਲ ਦੇ ਵੱਧ ਹਿੱਸੇ ਨੂੰ RAM ਵਿੱਚ ਰੱਖਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ ਅਤੇ ਖ਼ਪਤਕਾਰ ਵਾਲੇ ਰੌਂਡ-ਟ੍ਰਿਪ (round-trip) ਨੂੰ ਖਤਮ ਕਰਦੀ ਹੈ।

ਡਿਵੈਲਪਰਾਂ ਲਈ ਪ੍ਰਭਾਵ

  • ਸਟੋਰੇਜ ਵਿੱਚ ਨਹੀਂ, ਮੈਮੋਰੀ ਵਿੱਚ ਨਿਵੇਸ਼ ਕਰੋ।
  • ਸਥਾਨਕ ਟੈਸਟਿੰਗ ਵਿਹਾਰਯੋਗ ਬਣ ਜਾਂਦੀ ਹੈ। ਡਿਵੈਲਪਰ ਕਲਾਉਡ ਕ੍ਰੈਡਿਟਸ ਲਈ ਭੁਗਤਾਨ ਕੀਤੇ ਬਿਨਾਂ ਮੌਜੂਦਾ ਮਸ਼ੀਨਾਂ 'ਤੇ open-weight MoE ਮਾਡਲਾਂ ਨੂੰ ਚਲਾ ਸਕਦੇ ਹਨ, ਅਤੇ ਸ਼ੈਲੀ (style), ਟੂਲ-ਕਾਲਿੰਗ ਵਿਵਹਾਰ, ਅਤੇ ਆਊਟਪੁੱਟ ਗੁਣਵੱਤਾ ਦੀ ਜਾਂਚ ਕਰ ਸਕਦੇ ਹਨ।
  • ਬੈਚ ਇਵੈਲੂਏਸ਼ਨ (Batch evaluation) ਯਥਾਰਥਵਾਦੀ ਹੈ। ਰੀਅਲ-ਟਾਈਮ ਚੈਟ ਅਜੇ ਵੀ ਸੁਸਤ ਮਹਿਸੂਸ ਹੋ ਸਕਦੀ ਹੈ, ਪਰ ਕਿਊਡ (queued) ਕੰਮ—ਜਿਵੇਂ ਕਿ ਖੋਜ ਲਈ ਦਰਜਨਾਂ ਪ੍ਰੋਂਪਟ ਜਨਰੇਟ ਕਰਨਾ—ਲੈਪਟਾਪ 'ਤੇ ਆਰਾਮ ਨਾਲ ਚੱਲ ਸਕਦੇ ਹਨ।

ਸੰਭਾਵੀ ਵਿਰੋਧੀ ਦਲੀਲ

ਕੁਝ ਲੋਕ ਇਹ ਦਲੀਲ ਦੇ ਸਕਦੇ ਹਨ ਕਿ ਉਹਨਾਂ ਵਰਕਲੋਡਸ ਲਈ SSD ਲੇਟੈਂਸੀ (latency) ਅਜੇ ਵੀ ਮਹੱਤਵਪੂਰਨ ਹੈ ਜੋ ਵਾਰ-ਵਾਰ ਨਵੇਂ ਐਕਸਪਰਟ ਵੇਟਸ (expert weights) ਲੋਡ ਕਰਦੇ ਹਨ।

ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ

  • ਮੈਮੋਰੀ-ਕੁਸ਼ਲ (Memory-efficient) ਮਾਡਲ ਵੇਰੀਐਂਟਸ।
  • ਵੱਡੇ ਆਨ-ਚਿੱਪ ਕੈਸ਼ (on-chip caches) ਵਾਲਾ ਹਾਰਡਵੇਅਰ।
  • ਸਾਫਟਵੇਅਰ-ਪੱਧਰ ਦੀ ਕੈਸ਼ਿੰਗ ਰਣਨੀਤੀਆਂ।

ਸਿੱਟਾ ਸਪੱਸ਼ਟ ਹੈ: ਜੋ ਡਿਵੈਲਪਰ ਲੈਪਟਾਪ 'ਤੇ ਵਿਸ਼ਾਲ MoE ਮਾਡਲਾਂ ਨਾਲ ਪ੍ਰਯੋਗ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹਨ, ਉਨ੍ਹਾਂ ਨੂੰ ਵਧੇਰੇ RAM ਖਰੀਦਣੀ ਚਾਹੀਦੀ ਹੈ। SSD ਅੱਪਗ੍ਰੇਡ ਸਿਰਫ਼ ਕੁਝ ਪ੍ਰਤੀਸ਼ਤ ਹੀ ਘਟਾਉਂਦੇ ਹਨ, ਜਦੋਂ ਕਿ ਵਾਧੂ ਮੈਮੋਰੀ ਇਨਫਰੈਂਸ ਸਮੇਂ ਨੂੰ ਦੋ-ਅੰਕੀ ਪ੍ਰਤੀਸ਼ਤਾਂ ਤੱਕ ਘਟਾ ਸਕਦੀ ਹੈ। ਇਹ AI ਪ੍ਰੋਟੋਟਾਈਪਿੰਗ ਲਈ ਲਾਗਤ ਦੇ ਹਿਸਾਬ-ਕਿਤਾਬ ਨੂੰ ਬਦਲ ਦਿੰਦਾ ਹੈ ਅਤੇ ਉਨ੍ਹਾਂ ਮਾਡਲਾਂ ਦੀ ਸਥਾਨਕ, ਮੁਫ਼ਤ ਟੈਸਟਿੰਗ ਦਾ ਰਾਹ ਖੋਲ੍ਹਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਲਈ ਪਹਿਲਾਂ ਸਮਰਪਿਤ ਕਲਾਉਡ ਕਲਸਟਰਾਂ ਦੀ ਲੋੜ ਮੰਨੀ ਜਾਂਦੀ ਸੀ।