Novita ਨੇ ਹਾਲ ਹੀ ਵਿੱਚ ਆਪਣੀ LLM pricing ਨੂੰ ਅਪਡੇਟ ਕੀਤਾ ਹੈ। ਉਹਨਾਂ ਟੀਮਾਂ ਲਈ ਜੋ ਪਲੇਟਫਾਰਮ ਰਾਹੀਂ production inference ਚਲਾ ਰਹੀਆਂ ਹਨ, ਇਹ ਵਾਕ ਤੁਹਾਡੇ ਮੌਜੂਦਾ ਖਰਚੇ ਦੇ ਤੁਰੰਤ ਆਡਿਟ ਦੀ ਲੋੜ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ। API ਰੇਟ ਵਿੱਚ ਬਦਲਾਅ ਸ਼ਾਇਦ ਹੀ ਕਦੇ ਸੁਵਿਧਾਜਨਕ ਸਮੇਂ 'ਤੇ ਆਉਂਦੇ ਹਨ, ਅਤੇ ਜਦੋਂ ਉਹ ਕਈ ਮਾਡਲ ਤਰ੍ਹਾਂ (tiers) 'ਤੇ ਲਾਗੂ ਹੁੰਦੇ ਹਨ, ਤਾਂ ਤੁਹਾਡੇ ਮਹੀਨਾਵਾਰ ਖਰਚੇ 'ਤੇ ਅਸਰ ਉਮੀਦ ਤੋਂ ਕਿਤੇ ਜ਼ਿਆਦਾ ਹੋ ਸਕਦਾ ਹੈ।
Inference Pricing 'ਤੇ ਤੁਹਾਡਾ ਧਿਆਨ ਕਿਉਂ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ
ਜ਼ਿਆਦਾਤਰ ਆਧੁਨਿਕ AI ਐਪਲੀਕੇਸ਼ਨਾਂ ਸਵੈ-ਪ੍ਰਬੰਧਿਤ GPU ਕਲੱਸਟਰਾਂ 'ਤੇ ਨਹੀਂ ਬਣੀਆਂ ਹੁੰਦੀਆਂ। ਡਿਵੈਲਪਰ Novita ਵਰਗੇ inference ਪ੍ਰਦਾਤਾਵਾਂ ਨੂੰ ਰਿਕਵੈਸਟਾਂ ਭੇਜਦੇ ਹਨ ਕਿਉਂਕਿ ਵਿਕਲਪ ਵਿੱਚ ਹਾਰਡਵੇਅਰ ਪ੍ਰਾਪਤ ਕਰਨਾ, vLLM ਜਾਂ TGI ਡਿਪਲਾਈਮੈਂਟਸ ਨੂੰ ਪ੍ਰਬੰਧਿਤ ਕਰਨਾ, ਅਤੇ ਟ੍ਰੈਫਿਕ ਵਧਣ ਦੌਰਾਨ cold starts ਨੂੰ ਸੰਭਾਲਣਾ ਸ਼ਾਮਲ ਹੁੰਦਾ ਹੈ। ਉਹ ਸਹੂਲਤ ਕੀਮਤੀ ਹੈ। ਪਰ ਇਹ ਮਾਪੀ (metered) ਵੀ ਹੈ। ਹਰ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਟੋਕਨ ਇੱਕ ਅਜਿਹੇ ਬਿੱਲ ਵਿੱਚ ਵਾਧਾ ਕਰਦਾ ਹੈ ਜੋ ਯੂਜ਼ਰ ਸੈਸ਼ਨਾਂ, ਬੈਕਗ੍ਰਾਊਂਡ ਜੌਬਸ ਅਤੇ ਅੰਦਰੂਨੀ ਟੂਲਜ਼ ਰਾਹੀਂ ਵਧਦਾ ਜਾਂਦਾ ਹੈ।
ਜਦੋਂ ਕੋਈ ਪ੍ਰਦਾਤਾ ਆਪਣੀ ਕੀਮਤ ਨੂੰ ਐਡਜਸਟ ਕਰਦਾ ਹੈ, ਤਾਂ ਇਸਦਾ ਅਸਰ ਤੁਹਾਡੇ ਪੂਰੇ ਸਟੈਕ 'ਤੇ ਪੈਂਦਾ ਹੈ। ਇੱਕ ਚੈਟਬੋਟ ਜੋ ਦਿਨ ਵਿੱਚ ਦਸ ਹਜ਼ਾਰ ਗਾਹਕਾਂ ਨਾਲ ਗੱਲਬਾਤ ਕਰਦਾ ਹੈ, ਉਹ ਇੱਕ ਹਫ਼ਤੇ ਵਿੱਚ ਚਾਲੀ ਮਿਲੀਅਨ input tokens ਅਤੇ ਬਾਰਾਂ ਮਿਲੀਅਨ output tokens ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦਾ ਹੈ। ਜੇਕਰ ਪ੍ਰਤੀ-ਮਿਲੀਅਨ ਰੇਟ ਵਿੱਚ ਕੁਝ ਡਾਲਰਾਂ ਦਾ ਵੀ ਬਦਲਾਅ ਹੁੰਦਾ ਹੈ, ਤਾਂ ਮਹੀਨਾਵਾਰ ਅੰਤਰ ਜਲਦੀ ਹੀ ਵੱਡਾ ਹੋ ਜਾਂਦਾ ਹੈ। ਬੂਟਸਟ੍ਰੈਪਡ (bootstrapped) ਉਤਪਾਦਾਂ ਜਾਂ ਘੱਟ ਮੁਨਾਫੇ 'ਤੇ ਕੰਮ ਕਰਨ ਵਾਲੀਆਂ ਟੀਮਾਂ ਲਈ, ਇਹ ਫਰਕ ਮੁਨਾਫੇ ਨੂੰ ਖਤਮ ਕਰ ਸਕਦਾ ਹੈ। ਇੱਕ ਕੋਡਿੰਗ ਅਸਿਸਟੈਂਟ ਜੋ ਬ੍ਰਾਊਜ਼ਰ ਐਕਸਟੈਂਸ਼ਨ ਵਜੋਂ ਚੱਲਦਾ ਹੈ, ਇੱਕ ਬੈਚ ਸਮਰੀਜ਼ੇਸ਼ਨ ਪਾਈਪਲਾਈਨ ਜੋ ਰਾਤੋ-ਰਾਤ ਪ੍ਰੋਸੈਸ ਹੁੰਦੀ ਹੈ, ਜਾਂ ਇੱਕ ਅੰਦਰੂਨੀ ਲੁੱਕਅੱਪ ਟੂਲ ਜੋ ਹਰ ਪੇਜ ਲੋਡ 'ਤੇ ਮਾਡਲ ਨੂੰ ਕੁਐਰੀ ਕਰਦਾ ਹੈ, ਸਭ ਇੱਕੋ ਜਿਹੀ ਕਮਜ਼ੋਰੀ ਸਾਂਝੀ ਕਰਦੇ ਹਨ। ਉਹਨਾਂ ਦੀ unit economics ਅਗਲੇ ਟੋਕਨ ਦੀ ਸਹੀ ਕੀਮਤ 'ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ।
Novita ਵਿੱਚ ਕੀ ਬਦਲਿਆ ਹੈ
Novita ਨੇ ਨਵੀਆਂ ਕੀਮਤਾਂ ਲਾਗੂ ਕੀਤੀਆਂ ਹਨ ਜੋ ਇਸਦੇ ਕੈਟਾਲਾਗ ਵਿੱਚ ਵੱਖ-ਵੱਖ ਮਾਡਲਾਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦੀਆਂ ਹਨ। ਕੰਪਨੀ ਨੇ ਸਾਰੇ ਮਾਡਲਾਂ ਲਈ ਇੱਕੋ ਜਿਹਾ ਪ੍ਰਤੀਸ਼ਤ ਵਾਧਾ ਜਾਂ ਕਟੌਤੀ ਨਹੀਂ ਕੀਤੀ ਹੈ। ਇਸ ਦੀ ਬਜਾਏ, ਐਡਜਸਟਮੈਂਟ ਮਾਡਲ ਅਨੁਸਾਰ ਵੱਖ-ਵੱਖ ਹਨ, ਜਿਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਤੁਹਾਡਾ ਬਿੱਲ ਇਸ ਗੱਲ 'ਤੇ ਨਿਰਭਰ ਕਰੇਗਾ ਕਿ ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਕਿਹੜੇ endpoints ਦੀ ਵਰਤੋਂ ਕਰ ਰਹੇ ਹੋ।
ਜੇਕਰ ਤੁਹਾਡੀ ਐਪਲੀਕੇਸ਼ਨ ਸਾਰਾ ਟ੍ਰੈਫਿਕ ਇੱਕ ਸਿੰਗਲ large language model ਰਾਹੀਂ ਭੇਜਦੀ ਹੈ, ਤਾਂ ਤੁਹਾਡੀ ਗਣਨਾ ਸਧਾਰਨ ਹੈ। ਪੁਰਾਣੇ ਰੇਟ ਦੀ ਨਵੇਂ ਰੇਟ ਨਾਲ ਤੁਲਨਾ ਕਰੋ ਅਤੇ ਨੁਕਸਾਨ ਜਾਂ ਬਚਤ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾਓ। ਪਰ ਜ਼ਿਆਦਾਤਰ production ਸੈੱਟਅੱਪ ਵਧੇਰੇ ਗੁੰਝਲਦਾਰ ਹੁੰਦੇ ਹਨ। ਟੀਮਾਂ ਅਕਸਰ ਅਜਿਹੀ ਰੂਟਿੰਗ ਲੌਜਿਕ ਰੱਖਦੀਆਂ ਹਨ ਜੋ ਸਧਾਰਨ ਕੁਐਰੀਆਂ ਨੂੰ ਹਲਕੇ ਮਾਡਲਾਂ ਨੂੰ ਭੇਜਦੀਆਂ ਹਨ ਅਤੇ ਭਾਰੀ ਮਾਡਲਾਂ ਨੂੰ ਗੁੰਝਲਦਾਰ ਤਰਕ ਵਾਲੇ ਕੰਮਾਂ ਲਈ ਰਾਖਵਾਂ ਰੱਖਦੀਆਂ ਹਨ। ਹੋਰ ਕਈ ਮਾਡਲਾਂ 'ਤੇ latency ਅਤੇ ਗੁਣਵੱਤਾ ਦੀ ਤੁਲਨਾ ਕਰਨ ਲਈ A/B ਟੈਸਟ ਕਰਦੇ ਹਨ। ਅਜਿਹੇ ਮੌਕਿਆਂ 'ਤੇ, ਸਿਰਫ਼ ਇੱਕ ਜਾਂ ਦੋ ਮਾਡਲਾਂ ਦੀ ਕੀਮਤ ਵਿੱਚ ਬਦਲਾਅ ਤੁਹਾਡੇ ਪੂਰੇ ਲਾਗਤ ਢਾਂਚੇ ਨੂੰ ਵਿਗਾੜ ਸਕਦਾ ਹੈ।
ਵਿਸ਼ੇਸ਼ ਪ੍ਰਤੀ-ਟੋਕਨ ਅਤੇ ਪ੍ਰਤੀ-ਰਿਕਵੈਸਟ ਅੰਕੜੇ Dev.to 'ਤੇ Narevbot ਦੁਆਰਾ ਪ੍ਰਕਾਸ਼ਿਤ ਇੱਕ ਵਿਸਤ੍ਰਿਤ ਵੇਰਵੇ ਵਿੱਚ ਦਿੱਤੇ ਗਏ ਹਨ। ਤੁਸੀਂ ਇੱਥੇ ਸਹੀ ਰੇਟ ਕਾਰਡ ਦੀ ਸਮੀਖਿਆ ਕਰ ਸਕਦੇ ਹੋ: https://dev.to/narevbot/changes-to-llm-pricing-novita-3plc
ਆਪਣੀ ਯਾਦਦਾਸ਼ਤ ਜਾਂ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਦੱਬੇ ਹੋਏ ਕਿਸੇ ਪੁਰਾਣੇ ਸਕ੍ਰੀਨਸ਼ੌਟ 'ਤੇ ਭਰੋਸਾ ਨਾ ਕਰੋ। ਆਪਣੇ ਅਗਲੇ ਕੁਆਰਟਰ ਦੀ ਯੋਜਨਾ ਬਣਾਉਣ ਤੋਂ ਪਹਿਲਾਂ ਸਿੱਧੇ ਉਸ ਸਰੋਤ ਤੋਂ ਮੌਜੂਦਾ ਅੰਕੜੇ ਪ੍ਰਾਪਤ ਕਰੋ।
ਆਪਣੇ Exposure ਦਾ ਆਡਿਟ ਕਿਵੇਂ ਕਰੀਏ
ਅੰਦਾਜ਼ਿਆਂ ਨਾਲ ਨਹੀਂ, ਸਗੋਂ ਡੇਟਾ ਨਾਲ ਸ਼ੁਰੂ ਕਰੋ। ਆਪਣੇ Novita ਡੈਸ਼ਬੋਰਡ ਵਿੱਚ ਲੌਗਇਨ ਕਰੋ ਅਤੇ ਪਿਛਲੇ ਦੋ ਤੋਂ ਤਿੰਨ ਮਹੀਨਿਆਂ ਦਾ ਆਪਣਾ ਵਰਤੋਂ ਇਤਿਹਾਸ ਐਕਸਪੋਰਟ ਕਰੋ। ਉਸ ਡੇਟਾ ਨੂੰ ਮਾਡਲ ਅਤੇ ਆਪਰੇਸ਼ਨ ਦੀ ਕਿਸਮ ਅਨੁਸਾਰ ਵੱਖ ਕਰੋ। ਤੁਸੀਂ ਇਹ ਜਾਣਨਾ ਚਾਹੁੰਦੇ ਹੋ ਕਿ ਕਿਹੜੇ endpoints ਤੁਹਾਡੇ ਬਜਟ ਦਾ ਵੱਡਾ ਹਿੱਸਾ ਵਰਤ ਰਹੇ ਹਨ ਅਤੇ ਕਿਹੜੇ ਪ੍ਰਤੀ ਰਿਕਵੈਸਟ ਸਭ ਤੋਂ ਵੱਧ ਟੋਕਨ ਪੈਦਾ ਕਰ ਰਹੇ ਹਨ।
ਇਹਨਾਂ ਪੈਟਰਨਾਂ ਦੀ ਭਾਲ ਕਰੋ:
- Concentration risk. ਜੇਕਰ ਤੁਹਾਡੇ ਖਰਚੇ ਦਾ ਸੱਤਰ ਪ੍ਰਤੀਸ਼ਤ ਇੱਕ ਮਾਡਲ ਰਾਹੀਂ ਹੁੰਦਾ ਹੈ ਅਤੇ ਉਸ ਮਾਡਲ ਦੀ ਕੀਮਤ ਵਧ ਗਈ ਹੈ, ਤਾਂ ਤੁਹਾਡੀ ਤੁਰੰਤ ਕਾਰਵਾਈ ਦੀ ਲੋੜ ਸਪੱਸ਼ਟ ਹੈ। ਜੇਕਰ ਤੁਹਾਡਾ ਖਰਚਾ ਅੱਠ ਮਾਡਲਾਂ ਵਿੱਚ ਵੰਡਿਆ ਹੋਇਆ ਹੈ ਅਤੇ ਉਹਨਾਂ ਵਿੱਚੋਂ ਤਿੰਨਾਂ ਦੀਆਂ ਕੀਮਤਾਂ ਬਦਲ ਗਈਆਂ ਹਨ, ਤਾਂ ਗਣਨਾ ਕਰਨ ਵਿੱਚ ਜ਼ਿਆਦਾ ਸਮਾਂ ਲੱਗੇਗਾ ਪਰ ਖਤਰਾ ਅਜੇ ਵੀ ਅਸਲੀ ਹੈ।
- Token bloat. ਚੈੱਕ ਕਰੋ ਕਿ ਕੀ ਤੁਹਾਡੇ prompts ਬੇਲੋੜੇ ਸੰਦਰਭ (context) ਨਾਲ ਵਧ ਰਹੇ ਹਨ। ਲੰਬੇ system prompts, ਵਾਰ-ਵਾਰ ਵਰਤੇ ਜਾਣ ਵਾਲੇ few-shot ਉਦਾਹਰਣਾਂ, ਅਤੇ ਵਧੇਰੇ XML ਫਾਰਮੈਟਿੰਗ ਸਾਰੇ input ਲਾਗਤਾਂ ਨੂੰ ਵਧਾਉਂਦੇ ਹਨ। ਕੀਮਤਾਂ ਵਿੱਚ ਅਪਡੇਟ ਫਾਲਤੂ ਖਰਚਿਆਂ ਨੂੰ ਘਟਾਉਣ ਦਾ ਇੱਕ ਵਧੀਆ ਮੌਕਾ ਹੈ।
- Output inefficiency. ਜੇਕਰ ਤੁਹਾਡੀ ਐਪਲੀਕੇਸ਼ਨ ਲੰਬੇ completions ਦੀ ਬੇਨਤੀ ਕਰਦੀ ਹੈ ਪਰ ਸਿਰਫ਼ ਪਹਿਲੇ ਕੁਝ ਵਾਕਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੀ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਉਹਨਾਂ ਟੋਕਨਾਂ ਲਈ ਭੁਗਤਾਨ ਕਰ ਰਹੇ ਹੋ ਜਿਨ੍ਹਾਂ ਨੂੰ ਤੁਸੀਂ ਰੱਦ ਕਰ ਦਿੰਦੇ ਹੋ। ਆਪਣੀਆਂ max_token ਸੀਮਾਵਾਂ ਅਤੇ stop sequences ਨੂੰ ਟਿਊਨ ਕਰੋ।
- Idle background jobs. ਇੱਕ ਸ਼ਡਿਊਲਡ ਟਾਸਕ ਜੋ ਰਿਪੋਰਟਾਂ ਤਿਆਰ ਕਰਦਾ ਹੈ ਜਾਂ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਇੰਬੈਡ ਕਰਦਾ ਹੈ, ਸ਼ਾਇਦ ਲੋੜ ਤੋਂ ਵੱਧ ਵਾਰ ਚੱਲ ਰਿਹਾ ਹੋਵੇ। cron ਸ਼ਡਿਊਲ ਅਤੇ batch size ਦੀ ਜਾਂਚ ਕਰੋ।
