LLM ಬೆಲೆಗಳು ನಿರಂತರವಾಗಿ ಬದಲಾಗುತ್ತಿರುತ್ತವೆ. ಒಂದು ತಿಂಗಳು ನಿಮ್ಮ ಇನ್ಫರೆನ್ಸ್ ಬಜೆಟ್ (inference budget) ನಿರೀಕ್ಷೆಯಂತೆ ಇರುತ್ತದೆ; ಆದರೆ ಮರು ತಿಂಗಳು, ಒಂದು ಸೇವಾ ಪೂರೈಕೆದಾರರು ತಮ್ಮ ಪ್ರತಿ-ಟೋಕನ್ ದರವನ್ನು (per-token rate) ಹೊಂದಾಣಿಕೆ ಮಾಡಿದರೆ, ನೀವು ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ವಿನಂತಿಗಳನ್ನು ಮಾಡದಿದ್ದರೂ ನಿಮ್ಮ ಮಾಸಿಕ ವೆಚ್ಚ ಬದಲಾಗುತ್ತದೆ. ಈಗ ಅಂತಹದ್ದೇ ಘಟನೆ ನಡೆದಿದೆ. GMICloud, Novita, ಮತ್ತು StreamLake ಎಲ್ಲವೂ ತಮ್ಮ ಮಾಡೆಲ್ ಬೆಲೆಗಳನ್ನು ಅಪ್‌ಡೇಟ್ ಮಾಡಿವೆ. ನೀವು ಪ್ರೊಡಕ್ಷನ್ ವರ್ಕ್‌ಲೋಡ್‌ಗಳನ್ನು—ಅಥವಾ ಪ್ರಯೋಗಾತ್ಮಕ ಪೈಪ್‌ಲೈನ್‌ಗಳನ್ನು—ಚಲಾಯಿಸುತ್ತಿದ್ದರೆ, ಈ ತಿದ್ದುಪಡಿಗಳನ್ನು ಗಂಭೀರವಾಗಿ ಪರಿಶೀಲಿಸಬೇಕಾಗುತ್ತದೆ. ಮಾರುಕಟ್ಟೆಯು ಕುಸಿಯುತ್ತಿರುವುದರಿಂದಲ್ಲ, ಬದಲಾಗಿ ನೀವು ಪ್ರತಿದಿನ ಲಕ್ಷಾಂತರ ಟೋಕನ್‌ಗಳನ್ನು ಪ್ರೊಸೆಸ್ ಮಾಡುವಾಗ ಟೋಕನ್ ಎಕನಾಮಿಕ್ಸ್‌ನಲ್ಲಿನ ಸಣ್ಣ ವ್ಯತ್ಯಾಸಗಳು ಭಾರಿ ಪರಿಣಾಮ ಬೀರುತ್ತವೆ ಎಂಬ ಕಾರಣಕ್ಕೆ ಇದನ್ನು ಗಮನಿಸಬೇಕು.

ಈ ಸೇವಾ ಪೂರೈಕೆದಾರರು ಯಾರು

GMICloud, Novita, ಮತ್ತು StreamLake ಪ್ರತಿಯೊಂದೂ AI ಮೂಲಸೌಕರ್ಯ ಸ್ಟ್ಯಾಕ್‌ನಲ್ಲಿ ವಿಭಿನ್ನ ಪಾತ್ರವನ್ನು ವಹಿಸುತ್ತವೆ, ಆದರೆ ಈಗ ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳನ್ನು (large language models) ನಡೆಸುವ ವೆಚ್ಚದ ವಿಷಯದಲ್ಲಿ ಇವುಗಳು ನೇರವಾಗಿ ಒಂದೇ ಕ್ಷೇತ್ರದಲ್ಲಿ ಸ್ಪರ್ಧಿಸುತ್ತಿವೆ.

GMICloud ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆಯ GPU ಕ್ಲೌಡ್ ಅನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ ಮತ್ತು ತಮ್ಮದೇ ಆದ ಕ್ಲಸ್ಟರ್‌ಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಅಗತ್ಯವಿಲ್ಲದೆ API ಪ್ರವೇಶವನ್ನು ಬಯಸುವ ಡೆವಲಪರ್‌ಗಳಿಗಾಗಿ ಬೆಳೆಯುತ್ತಿರುವ ಹೋಸ್ಟೆಡ್ LLMಗಳ катаಲಾಗ್ ಅನ್ನು ನೀಡುತ್ತದೆ. Novita ತನ್ನ ಮೌಲ್ಯಯುತ GPU ಬಾಡಿಗೆ ಮತ್ತು ಮಾಡೆಲ್ ಸರ್ವಿಂಗ್ ಮೂಲಕ ಹೆಸರು ಮಾಡಿದೆ; ಇದು ದೊಡ್ಡ ಹೈಪರ್ಸ್ಕೇಲರ್‌ಗಳು ವಿಧಿಸುವ ಹೆಚ್ಚಿನ ದರಗಳಿಗಿಂತ ಕಡಿಮೆ ಬೆಲೆಯಲ್ಲಿ ಓಪನ್-ವೇಟ್ ಮಾಡೆಲ್‌ಗಳನ್ನು ಬಯಸುವ ಎಂಜಿನಿಯರ್‌ಗಳನ್ನು ಆಕರ್ಷಿಸುತ್ತದೆ. ByteDance ನ ಕ್ಲೌಡ್ ಮತ್ತು ಮೀಡಿಯಾ ಎಕೋಸಿಸ್ಟಮ್‌ನಿಂದ ಬೆಳೆದು ಬಂದಿರುವ StreamLake, ಇನ್ಫರೆನ್ಸ್ ಸ್ಪರ್ಧೆಗೆ ವೀಡಿಯೊ ಮೂಲಸೌಕರ್ಯದ ಪರಿಣತಿಯನ್ನು ತರುತ್ತದೆ ಮತ್ತು ಭಾರೀ ಮೀಡಿಯಾ ಪ್ರೊಸೆಸಿಂಗ್ ವರ್ಕ್‌ಲೋಡ್‌ಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಪ್ಲಾಟ್‌ಫಾರ್ಮ್ ಮೂಲಕ ಮಾಡೆಲ್‌ಗಳನ್ನು ಒದಗಿಸುತ್ತದೆ.

OpenAI ಅಥವಾ Anthropic ನಂತೆ ಇವರಲ್ಲಿ ಯಾರೂ ಎಲ್ಲರಿಗೂ ಪರಿಚಿತರಲ್ಲ. ಅವರ ಬೆಲೆಗಳಲ್ಲಿನ ಬದಲಾವಣೆಗಳು ಮುಖ್ಯವಾಗುವುದು ಇದೇ ಕಾರಣಕ್ಕೆ. ಇವರು ಮಾರುಕಟ್ಟೆಯ ತೀವ್ರ ಸ್ಪರ್ಧಾತ್ಮಕ ಮಧ್ಯಮ ಹಂತದಲ್ಲಿ (middle tier) ಇರುತ್ತಾರೆ, ಇಲ್ಲಿ ಲಾಭದ ಮಾರ್ಜಿನ್‌ಗಳು ಕಡಿಮೆ ಇರುತ್ತವೆ, ರಿಯಾಯಿತಿಗಳು ಸಾಮಾನ್ಯವಾಗಿರುತ್ತವೆ ಮತ್ತು ಡೆವಲಪರ್‌ಗಳನ್ನು ಆಕರ್ಷಿಸಲು ನಿರಂತರ ಪೈಪೋಟಿ ಇರುತ್ತದೆ. ಈ ಹಂತದ ಮೂರು ಪ್ಲಾಟ್‌ಫಾರ್ಮ್‌ಗಳು ಅಂದಾಜು ಒಂದೇ ಸಮಯದಲ್ಲಿ ತಮ್ಮ ರೇಟ್ ಕಾರ್ಡ್‌ಗಳನ್ನು ಬದಲಾಯಿಸಿದಾಗ, ಓಪನ್-ಸೋರ್ಸ್ ಅಥವಾ ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡೆಲ್‌ಗಳನ್ನು ನಡೆಸಲು ಎಷ್ಟು ವೆಚ್ಚವಾಗಬೇಕು ಎಂಬುದರ ಮಾನದಂಡವು ಬದಲಾಗುತ್ತದೆ.

ಏನು ಬದಲಾಗಿದೆ

ಈ ಅಪ್‌ಡೇಟ್‌ಗಳು ಮೂರೂ ಸೇವೆಗಳಲ್ಲಿನ LLM ಬಳಕೆಯ ಬೆಲೆಗಳ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರಿದೆ. Naren, Dev.to ನಲ್ಲಿ narevbot ಎಂಬ ಹೆಸರಿನಲ್ಲಿ ಬರೆದ ಲೇಖನದಲ್ಲಿ, GMICloud, Novita, ಮತ್ತು StreamLake ಗಾಗಿ ಮಾಡೆಲ್-दर-ಮಾಡೆಲ್ ಬದಲಾವಣೆಗಳ ವಿವರಗಳನ್ನು ದಾಖಲಿಸಿದ್ದಾರೆ. ನೀವು ಸಂಪೂರ್ಣ ಹೋಲಿಕೆಯನ್ನು ಇಲ್ಲಿ ಓದಬಹುದು.

ಈ ಪ್ಯಾರಾಗ್ರಾಫ್ ಓದಿ ಮುಗಿಸುವಷ್ಟರಲ್ಲಿ ಮತ್ತೆ ಬದಲಾಗಬಹುದಾದ ಪ್ರತಿ ಟೋಕನ್‌ಗೆ ಎಷ್ಟು ಸೆಂಟ್ಸ್ ಎಂಬ ಅಂಕಿಅಂಶಗಳನ್ನು ಹೇಳುವ ಬದಲು, ಇಲ್ಲಿನ ಪ್ರಮುಖ ಅಂಶವೆಂದರೆ ಈ ಬದಲಾವಣೆಗಳು ರಚನಾತ್ಮಕವಾಗಿವೆ (structural). ಪ್ರತಿಯೊಬ್ಬ ಪೂರೈಕೆದಾರರು ಟೋಕನ್‌ಗಳಿಗಾಗಿ ವಿಧಿಸುವ ದರವನ್ನು ಮರುಸಮತೋಲನಗೊಳಿಸಿದ್ದಾರೆ ಮತ್ತು ಕೆಲವು ಸಂದರ್ಭಗಳಲ್ಲಿ ಈ ತಿದ್ದುಪಡಿಗಳು ನಿರ್ದಿಷ್ಟ ವರ್ಕ್‌ಲೋಡ್‌ಗೆ ಯಾವ ಮಾಡೆಲ್ ಅಗ್ಗವಾಗುತ್ತದೆ ಎಂಬುದನ್ನೇ ಬದಲಾಯಿಸುತ್ತವೆ. ಇದು ಕೇವಲ ಎಲ್ಲಾ ಬೆಲೆಗಳ ಏರಿಕೆ ಅಥವಾ ಇಳಿಕೆಯಾಗಿ ಇರುವುದಿಲ್ಲ. ಒಬ್ಬ ಪೂರೈಕೆದಾರರು ಇನ್‌ಪುಟ್ ಬೆಲೆಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಿ, ಔಟ್‌ಪುಟ್ ಬೆಲೆಗಳನ್ನು ಹೆಚ್ಚಿಸಬಹುದು. ಇನ್ನೊಬ್ಬರು ಸಣ್ಣ ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್‌ಗಳ ಬೆಲೆಯನ್ನು ಹಾಗೆಯೇ ಇಟ್ಟು, ಲಾಂಗ್-ಕಾಂಟೆಕ್ಸ್ಟ್ ಎಂಡ್‌ಪಾಯಿಂಟ್‌ಗಳ ದರವನ್ನು ಹೆಚ್ಚಿಸಬಹುದು. ಈ ಮೂರೂ ಪ್ಲಾಟ್‌ಫಾರ್ಮ್‌ಗಳು Llama, Qwen, Mistral ಮತ್ತು ಇತರ ವಿಭಿನ್ನ ಆರ್ಕಿಟೆಕ್ಚರ್‌ಗಳ ಸಂಯೋಜನೆಯನ್ನು ಬೆಂಬಲಿಸುವುದರಿಂದ, ಇದರಿಂದ ಆಗುವ ಲಾಭ ಅಥವಾ ನಷ್ಟವು ನೀವು ಯಾವ API ಮೂಲಕ ಯಾವ ಮಾಡೆಲ್ ಅನ್ನು ಬಳಸುತ್ತಿದ್ದೀರಿ ಎಂಬುದರ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ.

ಟ್ರಾಫಿಕ್ ಸ್ಥಿರವಾಗಿದ್ದರೂ ನಿಮ್ಮ ಬಿಲ್ ಏಕೆ ಬದಲಾಗುತ್ತದೆ

ಇದರ ಪರಿಣಾಮವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, LLM ಬಿಲ್ಲಿಂಗ್ ಹೇಗೆ ಕೆಲಸ ಮಾಡುತ್ತದೆ ಎಂಬುದನ್ನು ನೋಡಿ. ನಿಮಗೆ ಇನ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳು ಮತ್ತು ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳಿಗಾಗಿ ಪ್ರತ್ಯೇಕವಾಗಿ ಶುಲ್ಕ ವಿಧಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ಅವುಗಳ ನಡುವಿನ ಅನುಪಾತವು ನಿಮ್ಮ ಪರಿಣಾಮಕಾರಿ ವೆಚ್ಚವನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. ದಿನಕ್ಕೆ ಹತ್ತು ಸಾವಿರ ಸಂಭಾಷಣೆಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಕಸ್ಟಮರ್ ಸಪೋರ್ಟ್ ಬಾಟ್, ಪ್ರತಿ ಚಾಟ್‌ಗೆ ಸರಾಸರಿ ಎರಡು ಸಾವಿರ ಇನ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳು ಮತ್ತು ನಾಲ್ಕು ನೂರರಷ್ಟು ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳನ್ನು ಬಳಸಬಹುದು ಎಂದು ಭಾವಿಸೋಣ. ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗೆ ಸರಾಸರಿ ಮೂರು ಡಾಲರ್ ದರದಲ್ಲಿ, ಇದು ದಿನಕ್ಕೆ ಅಂದಾಜು ಎಂಬೆತ್ಮತ್ತು ಎಂಟು ಸತತ್ ಎಂಭತ್ತನಾಲ್ಕು ಡಾಲರ್ ಆಗುತ್ತದೆ. ಒಂದು ವೇಳೆ ಪೂರೈಕೆದಾರರು ಔಟ್‌ಪುಟ್ ಬೆಲೆಯನ್ನು ಕೇವಲ ಇಪ್ಪತ್ತು ಪ್ರತಿಶತ ಹೆಚ್ಚಿಸಿದರೆ, ದೈನಂದಿನ ವೆಚ್ಚ ತೊಂಬತ್ತು ಡಾಲರ್‌ಗಿಂತ ಹೆಚ್ಚಾಗುತ್ತದೆ. ಒಂದು ತ್ರೈಮಾಸಿಕದಲ್ಲಿ, ಅಷ್ಟೇ ಟ್ರಾಫಿಕ್ ಇದ್ದರೂ ಇದು ಸುಮಾರು ಒಂದು ಸಾವಿರ ಡಾಲರ್ ಹೆಚ್ಚುವರಿ ವೆಚ್ಚವಾಗುತ್ತದೆ.

ಇದನ್ನು ಪ್ರತಿ ಗಂಟೆಗೆ ಲಕ್ಷಾಂತರ ಟೋಕನ್‌ಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಕಂಟೆಂಟ್ ಜನರೇಷನ್ ಪೈಪ್‌ಲೈನ್ ಅಥವಾ ರಿಟ್ರಿವಲ್-ಆಗ್ಮೆಂಟೆಡ್ ಜನರೇಷನ್ (RAG) ಸಿಸ್ಟಮ್‌ಗೆ ಅನ್ವಯಿಸಿದರೆ, ನೀವು ಆಯ್ಕೆ ಮಾಡುವ ಸೇವಾ ಪೂರೈಕೆದಾರರು ನಿಮ್ಮ ವೆಚ್ಚದ ಪಟ್ಟಿಯಲ್ಲಿ ಪ್ರಮುಖ ಪಾತ್ರ ವಹಿಸುತ್ತಾರೆ. GMICloud, Novita, ಮತ್ತು StreamLake ಇದನ್ನು ಚೆನ್ನಾಗಿ ತಿಳಿದಿದ್ದಾರೆ. ಅವರ ಬೆಲೆ ಬದಲಾವಣೆಗಳು ನಿರ್ದಿಷ್ಟ ಬಳಕೆಗಳಿಗಾಗಿ ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಮಾಡಲಾದ ಕ್ರಮಗಳಾಗಿವೆ: ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದ ಬ್ಯಾಚ್ ಕೆಲಸಗಳು (high-volume batch jobs), ಕಡಿಮೆ ವಿಳಂಬದ (low-latency) ಚಾಟ್ ಅಪ್ಲಿಕೇಶನ್‌ಗಳು ಅಥವಾ ಲಾಂಗ್-ಕಾಂಟೆಕ್ಸ್ಟ್ ಸಮ್ಮರೈಸೇಶನ್ ಕಾರ್ಯಗಳು.

ಸಂಕೀರ್ಣತೆಯು ಮತ್ತೊಂದು ಪದರವನ್ನು ಸೇರಿಸುತ್ತದೆ. ಕೆಲವು ಪ್ಲಾಟ್‌ಫಾರ್ಮ್‌ಗಳು ಪ್ರತಿ ವಿನಂತಿಗೆ ಕನಿಷ್ಠ ಶುಲ್ಕವನ್ನು (minimum charges), ಪ್ರೊವಿಷನ್ ಮಾಡಲಾದ ಥ್ರೂಪುಟ್‌ಗಾಗಿ ಐಡಲ್ ಶುಲ್ಕವನ್ನು (idle fees), ಅಥವಾ ರೇಟ್-ಲಿಮಿಟ್ ಬರ್ಸ್ಟ್‌ಗಳಿಗಾಗಿ ಹೆಚ್ಚುವರಿ ಶುಲ್ಕವನ್ನು ವಿಧಿಸುತ್ತವೆ. ಕನಿಷ್ಠ ವಿನಂತಿ ಶುಲ್ಕದಲ್ಲಿನ ಬದಲಾವಣೆಯು ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದ ಬಳಕೆದಾರರಿಗಿಂತ ಕಡಿಮೆ ಪ್ರಮಾಣದ ಬಳಕೆದಾರರಿಗೆ ಹೆಚ್ಚು ತೊಂದರೆ ನೀಡುತ್ತದೆ. ಬ್ಯಾಚ್ ಇನ್ಫರೆನ್ಸ್ ರಿಯಾಯಿತಿಗಳಲ್ಲಿನ ಬದಲಾವಣೆಯು ನಿಮ್ಮ ರಾತ್ರಿ ಸಮಯದ ವರದಿ ತಯಾರಿಕೆಯ ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು, ಆದರೆ ನಿಮ್ಮ ರಿಯಲ್-ಟೈಮ್ API ಬಿಲ್ ಅನ್ನು ಬದಲಾಯಿಸದೆ ಇಡಬಹುದು. ಕೇವಲ "ಅಪ್‌ಡೇಟ್ ಮಾಡಲಾದ ಬೆಲೆಗಳು" ಎಂಬ ಹೆಡ್‌ಲೈನ್ ಓದಿದರೆ ಸಾಲದು. ನೀವು ಅದರ ಸಂಪೂರ್ಣ ವಿವರಗಳನ್ನು (matrix) ಗಮನಿಸಬೇಕಾಗುತ್ತದೆ.

ಅತಿಯಾಗಿ ಪ್ರತಿಕ್ರಿಯಿಸದೆ ಹೇಗೆ ಸ್ಪಂದಿಸಬೇಕು

ದರಗಳು ಬದಲಾದಾಗ, ಹೆಚ್ಚಿನ ಎಂಜಿನಿಯರಿಂಗ್ ತಂಡಗಳು ಎರಡು ತಪ್ಪುಗಳಲ್ಲಿ ಒಂದನ್ನು ಮಾಡುತ್ತವೆ. ಅವು ಬದಲಾವಣೆಯನ್ನು ನಿರ್ಲಕ್ಷಿಸಿ ಹೆಚ್ಚುವರಿ ವೆಚ್ಚವನ್ನು ಮೌನವಾಗಿ ಭರಿಸುತ್ತವೆ ಅಥವಾ ಗಾಬರಿಯಾಗುತ್ತವೆ.