LLM ਦੀ ਕੀਮਤ ਇੱਕ ਬਦਲਦਾ ਹੋਇਆ ਨਿਸ਼ਾਨਾ ਹੈ। ਇੱਕ ਮਹੀਨੇ ਤੁਹਾਡਾ ਇਨਫਰੈਂਸ (inference) ਬਜਟ ਬਿਲਕੁਲ ਅਨੁਮਾਨ ਅਨੁਸਾਰ ਚੱਲਦਾ ਹੈ; ਅਗਲੇ ਮਹੀਨੇ, ਇੱਕ ਪ੍ਰੋਵਾਈਡਰ ਆਪਣੀ ਪ੍ਰਤੀ-ਟੋਕਨ ਦਰ ਨੂੰ ਐਡਜਸਟ ਕਰ ਦਿੰਦਾ ਹੈ ਅਤੇ ਤੁਹਾਡਾ ਮਹੀਨਾਵਾਰ ਖਰਚਾ ਬਿਨਾਂ ਕਿਸੇ ਵਾਧੂ ਰਿਕੁਐਸਟ ਦੇ ਬਦਲ ਜਾਂਦਾ ਹੈ। ਬਿਲਕੁਲ ਇਹੀ ਹੁਣੇ ਹੋਇਆ ਹੈ। GMICloud, Novita, ਅਤੇ StreamLake ਸਾਰਿਆਂ ਨੇ ਆਪਣੀਆਂ ਮਾਡਲ ਕੀਮਤਾਂ ਨੂੰ ਅਪਡੇਟ ਕੀਤਾ ਹੈ, ਅਤੇ ਜੇਕਰ ਤੁਸੀਂ ਪ੍ਰੋਡਕਸ਼ਨ ਵਰਕਲੋਡ—ਜਾਂ ਪ੍ਰਯੋਗਿਕ ਪਾਈਪਲਾਈਨਾਂ—ਚਲਾਉਂਦੇ ਹੋ, ਤਾਂ ਇਹ ਸੋਧਾਂ 'ਤੇ ਗੰਭੀਰਤਾ ਨਾਲ ਨਜ਼ਰ ਮਾਰਨ ਦੀ ਲੋੜ ਹੈ। ਇਸ ਲਈ ਨਹੀਂ ਕਿ ਮਾਰਕੀਟ ਡਿੱਗ ਰਹੀ ਹੈ, ਸਗੋਂ ਇਸ ਲਈ ਕਿ ਜਦੋਂ ਤੁਸੀਂ ਰੋਜ਼ਾਨਾ ਲੱਖਾਂ ਟੋਕਨਾਂ ਦੀ ਪ੍ਰੋਸੈਸਿੰਗ ਕਰ ਰਹੇ ਹੁੰਦੇ ਹੋ, ਤਾਂ ਟੋਕਨ ਇਕਨਾਮਿਕਸ ਵਿੱਚ ਛੋਟੇ ਅੰਤਰ ਵੀ ਬਹੁਤ ਵੱਡਾ ਅਸਰ ਪਾਉਂਦੇ ਹਨ।
ਇਹ ਪ੍ਰੋਵਾਈਡਰ ਕੌਣ ਹਨ
GMICloud, Novita, ਅਤੇ StreamLake, ਹਰੇਕ AI ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਸਟੈਕ ਵਿੱਚ ਇੱਕ ਵੱਖਰੀ ਭੂਮਿਕਾ ਨਿਭਾਉਂਦੇ ਹਨ, ਪਰ ਹੁਣ ਉਹ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ (LLMs) ਨੂੰ ਚਲਾਉਣ ਦੀ ਲਾਗਤ ਦੇ ਮਾਮਲੇ ਵਿੱਚ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਇੱਕ ਦੂਜੇ ਦੇ ਸਾਹਮਣੇ ਹਨ।
GMICloud ਇੱਕ ਹਾਈ-ਪਰਫਾਰਮੈਂਸ GPU ਕਲਾਉਡ ਚਲਾਉਂਦਾ ਹੈ ਅਤੇ ਉਹਨਾਂ ਡਿਵੈਲਪਰਾਂ ਲਈ ਹੋਸਟ ਕੀਤੇ LLMs ਦੀ ਵਧਦੀ ਹੋਈ ਕੈਟਾਲਾਗ ਪੇਸ਼ ਕਰਦਾ ਹੈ ਜੋ ਆਪਣੇ ਕਲੱਸਟਰਾਂ ਨੂੰ ਪ੍ਰਬੰਧਿਤ ਕੀਤੇ ਬਿਨਾਂ API ਐਕਸੈਸ ਚਾਹੁੰਦੇ ਹਨ। Novita ਨੇ ਕਿਫਾਇਤੀ GPU ਕਿਰਾਏ ਅਤੇ ਮਾਡਲ ਸਰਵਿੰਗ ਦੇ ਆਲੇ-ਦੁਆਲੇ ਆਪਣੀ ਸਾਖ ਬਣਾਈ ਹੈ, ਜੋ ਉਹਨਾਂ ਇੰਜੀਨੀਅਰਾਂ ਨੂੰ ਆਕਰਸ਼ਿਤ ਕਰਦਾ ਹੈ ਜੋ ਵੱਡੇ ਹਾਈਪਰਸਕੇਲਰਾਂ ਦੁਆਰਾ ਲਾਏ ਗਏ ਵਾਧੂ ਖਰਚਿਆਂ ਦੇ ਮੁਕਾਬਲੇ ਛੋਟ 'ਤੇ open-weight ਮਾਡਲਾਂ ਨੂੰ ਤਰਜੀਹ ਦਿੰਦੇ ਹਨ। StreamLake, ਜੋ ByteDance ਦੇ ਕਲਾਉਡ ਅਤੇ ਮੀਡੀਆ ਈਕੋਸਿਸਟਮ ਤੋਂ ਉੱਪਜਿਆ ਹੈ, ਇਨਫਰੈਂਸ ਦੀ ਦੌੜ ਵਿੱਚ ਵੀਡੀਓ ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਦੀ ਮੁਹਾਰਤ ਲਿਆਉਂਦਾ ਹੈ ਅਤੇ ਇੱਕ ਅਜਿਹੇ ਪਲੇਟਫਾਰਮ ਰਾਹੀਂ ਮਾਡਲਾਂ ਦੀ ਸੇਵਾ ਕਰਦਾ ਹੈ ਜੋ ਭਾਰੀ ਮੀਡੀਆ ਪ੍ਰੋਸੈਸਿੰਗ ਵਰਕਲੋਡ ਨੂੰ ਵੀ ਸੰਭਾਲਦਾ ਹੈ।
ਉਹਨਾਂ ਵਿੱਚੋਂ ਕੋਈ ਵੀ OpenAI ਜਾਂ Anthropic ਵਾਂਗ ਘਰ-ਘਰ ਵਿੱਚ ਜਾਣਿਆ ਜਾਂਦਾ ਨਾਮ ਨਹੀਂ ਹੈ। ਬਿਲਕੁਲ ਇਸੇ ਕਰਕੇ ਉਹਨਾਂ ਦੀਆਂ ਕੀਮਤਾਂ ਵਿੱਚ ਹੋਣ ਵਾਲੀਆਂ ਹਰਕਤਾਂ ਮਹੱਤਵਪੂਰਨ ਹਨ। ਉਹ ਮਾਰਕੀਟ ਦੇ ਹਮਲਾਵਰ ਮੱਧ ਪੱਧਰ (middle tier) ਵਿੱਚ ਹਨ, ਜਿੱਥੇ ਮਾਰਜਿਨ ਘੱਟ ਹਨ, ਛੋਟਾਂ ਆਮ ਹਨ, ਅਤੇ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਆਕਰਸ਼ਿਤ ਕਰਨ ਦੀ ਦੌੜ ਲਗਾਤਾਰ ਚੱਲ ਰਹੀ ਹੈ। ਜਦੋਂ ਇਸ ਪੱਧਰ ਦੇ ਤਿੰਨ ਪਲੇਟਫਾਰਮ ਲਗਭਗ ਇੱਕੋ ਸਮੇਂ ਆਪਣੀਆਂ ਰੇਟ ਕਾਰਡਾਂ ਨੂੰ ਬਦਲਦੇ ਹਨ, ਤਾਂ ਉਹ ਸਮੂਹਿਕ ਤੌਰ 'ਤੇ ਇਸ ਗੱਲ ਦਾ ਮਾਪਦੰਡ (benchmark) ਰੀਸੈੱਟ ਕਰ ਦਿੰਦੇ ਹਨ ਕਿ open-source ਜਾਂ fine-tuned ਮਾਡਲਾਂ ਨੂੰ ਚਲਾਉਣ ਦੀ ਲਾਗਤ ਕੀ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ।
ਕੀ ਬਦਲਿਆ
ਇਹ ਅਪਡੇਟਸ ਤਿੰਨਾਂ ਸੇਵਾਵਾਂ ਵਿੱਚ LLM ਵਰਤੋਂ ਦੀ ਕੀਮਤ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦੇ ਹਨ। Naren, Dev.to 'ਤੇ narevbot ਵਜੋਂ ਲਿਖਦੇ ਹੋਏ, ਇੱਕ ਪੋਸਟ ਵਿੱਚ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਨੂੰ ਦਸਤਾਵੇਜ਼ੀ ਰੂਪ ਵਿੱਚ ਪੇਸ਼ ਕੀਤਾ ਹੈ ਜੋ GMICloud, Novita, ਅਤੇ StreamLake ਲਈ ਮਾਡਲ-ਦਰ-ਮਾਡਲ ਸਹੀ ਐਡਜਸਟਮੈਂਟਾਂ ਦਾ ਵੇਰਵਾ ਦਿੰਦੀ ਹੈ। ਤੁਸੀਂ ਪੂਰੀ ਤੁਲਨਾ ਇੱਥੇ ਪੜ੍ਹ ਸਕਦੇ ਹੋ।
ਇਸ ਪੈਰਾਗ੍ਰਾਫ ਨੂੰ ਪੜ੍ਹਨ ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਦੁਬਾਰਾ ਬਦਲਣ ਵਾਲੇ 'ਸੈਂਟ-ਪ੍ਰਤੀ-ਟੋਕਨ' ਦੇ ਅੰਕੜਿਆਂ ਨੂੰ ਦੱਸਣ ਦੀ ਬਜਾਏ, ਮਹੱਤਵਪੂਰਨ ਨੁਕਤਾ ਇਹ ਹੈ ਕਿ ਇਹ ਬਦਲਾਅ ਸੰਰਚਨਾਤਮਕ (structural) ਹਨ। ਹਰੇਕ ਪ੍ਰੋਵਾਈਡਰ ਨੇ ਟੋਕਨਾਂ ਲਈ ਚਾਰਜ ਕਰਨ ਦੇ ਤਰੀਕੇ ਨੂੰ ਮੁੜ ਸੰਤੁਲਿਤ ਕੀਤਾ ਹੈ, ਅਤੇ ਕੁਝ ਮਾਮਲਿਆਂ ਵਿੱਚ, ਇਹ ਸੋਧਾਂ ਇਹ ਬਦਲ ਦਿੰਦੀਆਂ ਹਨ ਕਿ ਕਿਸੇ ਖਾਸ ਵਰਕਲੋਡ ਲਈ ਕਿਹੜਾ ਮਾਡਲ ਸਭ ਤੋਂ ਸਸਤਾ ਹੈ। ਇਹ ਸ਼ਾਇਦ ਹੀ ਕਦੇ ਸਾਰਿਆਂ ਲਈ ਇੱਕੋ ਜਿਹਾ ਵਾਧਾ ਜਾਂ ਘਾਟਾ ਹੁੰਦਾ ਹੈ। ਇੱਕ ਪ੍ਰੋਵਾਈਡਰ ਇਨਪੁਟ ਕੀਮਤਾਂ ਘਟਾ ਸਕਦਾ ਹੈ ਜਦੋਂ ਕਿ ਆਉਟਪੁੱਟ ਕੀਮਤਾਂ ਵਧਾ ਸਕਦਾ ਹੈ। ਦੂਜਾ ਛੋਟੇ ਪੈਰਾਮੀਟਰ ਮਾਡਲਾਂ ਨੂੰ ਬਿਨਾਂ ਕਿਸੇ ਬਦਲਾਅ ਦੇ ਛੱਡ ਸਕਦਾ ਹੈ ਪਰ ਲੌਂਗ-ਕੰਟੈਕਸਟ (long-context) ਐਂਡਪੁਆਇੰਟਾਂ 'ਤੇ ਦਰਾਂ ਵਧਾ ਸਕਦਾ ਹੈ। ਕਿਉਂਕਿ ਤਿੰਨੋਂ Llama, Qwen, Mistral, ਅਤੇ ਹੋਰ ਆਰਕੀਟੈਕਚਰਾਂ ਦੇ ਵੱਖ-ਵੱਖ ਸੁਮੇਲ ਦਾ ਸਮਰਥਨ ਕਰਦੇ ਹਨ, ਇਸ ਲਈ ਨੁਕਸਾਨ ਜਾਂ ਫਾਇਦਾ ਪੂਰੀ ਤਰ੍ਹਾਂ ਇਸ ਗੱਤੇ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਕਿਸ ਮਾਡਲ ਨੂੰ ਕਿਸ API ਰਾਹੀਂ ਰੂਟ ਕਰ ਰਹੇ ਹੋ।
ਤੁਹਾਡਾ ਬਿੱਲ ਕਿਉਂ ਵਧਦਾ ਹੈ ਭਾਵੇਂ ਟ੍ਰੈਫਿਕ ਸਥਿਰ ਰਹੇ
ਪ੍ਰਭਾਵ ਨੂੰ ਸਮਝਣ ਲਈ, ਦੇਖੋ ਕਿ LLM ਬਿਲਿੰਗ ਅਸਲ ਵਿੱਚ ਕਿਵੇਂ ਕੰਮ ਕਰਦੀ ਹੈ। ਤੁਹਾਨੂੰ ਲਗਭਗ ਹਮੇਸ਼ਾ ਇਨਪੁਟ ਟੋਕਨਾਂ ਅਤੇ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਲਈ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਚਾਰਜ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਉਹਨਾਂ ਵਿਚਕਾਰ ਅਨੁਪਾਤ ਤੁਹਾਡੀ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਲਾਗਤ ਨੂੰ ਨਿਰਧਾਰਤ ਕਰਦਾ ਹੈ। ਇੱਕ ਕਸਟਮਰ ਸਪੋਰਟ ਬੋਟ ਜੋ ਦਿਨ ਵਿੱਚ ਦਸ ਹਜ਼ਾਰ ਗੱਲਬਾਤ ਸੰਭਾਲਦਾ ਹੈ, ਪ੍ਰਤੀ ਚੈਟ ਦਸ ਹਜ਼ਾਰ ਇਨਪੁਟ ਟੋਕਨ ਅਤੇ ਚਾਰ ਸੌ ਆਉਟਪੁੱਟ ਟੋਕਨ ਦਾ ਔਸਤ ਹੋ ਸਕਦਾ ਹੈ। ਮਿਲੇ-ਜੁਲੇ ਤਿੰਨ ਡਾਲਰ ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਟੋਕਨਾਂ 'ਤੇ, ਇਹ ਲਗਭਗ ਚਰਾਸੀ ਡਾਲਰ ਰੋਜ਼ਾਨਾ ਹੈ।
ਜਦੋਂ ਦਰਾਂ ਬਦਲਦੀਆਂ ਹਨ, ਤਾਂ ਜ਼ਿਆਦਾਤਰ ਇੰਜੀਨੀਅਰਿੰਗ ਟੀਮਾਂ ਦੋ ਵਿੱਚੋਂ ਇੱਕ ਗਲਤੀ ਕਰਦੀਆਂ ਹਨ। ਉਹ ਜਾਂ ਤਾਂ ਬਦਲਾਅ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਦੀਆਂ ਹਨ ਅਤੇ ਚੁੱਪਚਾਪ ਲਾਗਤ ਦੇ ਵਾਧੇ ਨੂੰ ਸਹਿ ਲੈਂਦੀਆਂ ਹਨ, ਜਾਂ ਫਿਰ ਉਹ ਘਬਰਾ ਜਾਂਦੀਆਂ ਹਨ।
