ಹೊಸ ವೆಚ್ಚ ವಿಶ್ಲೇಷಣೆಯ ಪ್ರಕಾರ, ಒಂದು ಸಂಸ್ಥೆಯು ಪ್ರತಿ ತಿಂಗಳು ಅಂದಾಜು 5 ಮಿಲಿಯನ್ನಿಂದ 10 ಮಿಲಿಯನ್ ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಿದಾಗ ಮಾತ್ರ ಲಾರ್ಜ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ ಅನ್ನು ಸ್ವತಃ ಹೋಸ್ಟ್ ಮಾಡುವುದು (self-hosting) ವಾಣಿಜ್ಯ APIಗಳಿಗಿಂತ ಲಾಭದಾಯಕವಾಗಿರುತ್ತದೆ. AI ಸೇವೆಗಳಿಗಾಗಿ ಬಜೆಟ್ ಸಿದ್ಧಪಡಿಸುವವರಿಗೆ, "ಉಚಿತ" ಓಪನ್ ವೇಟ್ಸ್ನ ಆಕರ್ಷಣೆಯು ನಿಜವಾದ ಉಳಿತಾಯವಾಗಿ ಬದಲಾಗುತ್ತದೆಯೇ ಅಥವಾ ಇಲ್ಲವೇ ಎಂಬುದನ್ನು 'ಬ್ರೇಕ್-ಈವೆನ್ ಪಾಯಿಂಟ್' (break-even point) ನಿರ್ಧರಿಸುತ್ತದೆ.
API ಮಾದರಿ
API ಪೂರೈಕೆದಾರರು ಪ್ರತಿ ಟೋಕನ್ಗೆ ಶುಲ್ಕ ವಿಧಿಸುತ್ತಾರೆ ಮತ್ತು ಎಲ್ಲಾ ಹಾರ್ಡ್ವೇರ್, ವಿದ್ಯುತ್ ಮತ್ತು ಕೂಲಿಂಗ್ ವ್ಯವಸ್ಥೆಗಳನ್ನು ನಿರ್ವಹಿಸುತ್ತಾರೆ. ಪ್ರಸ್ತುತ ಸಾರ್ವಜನಿಕ ದರಗಳು ಹೀಗಿವೆ:
- Claude Sonnet 5 – ಪ್ರತಿ ಮಿಲಿಯನ್ ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳಿಗೆ $2
- GPT-5.6 – ಪ್ರತಿ ಮಿಲಿಯನ್ ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳಿಗೆ ಸುಮಾರು $1
- Meta Muse Spark – ಪ್ರತಿ ಮಿಲಿಯನ್ ಇನ್ಬೌಂಡ್ ಟೋಕನ್ಗಳಿಗೆ $1.25, ಔಟ್ಬೌಂಡ್ ಟೋಕನ್ಗಳಿಗೆ $4.25
ಈ ಮಾದರಿಯು 'ಪೇ-ಆಸ್-ಯೂ-ಗೋ' (pay-as-you-go) ತತ್ವದ ಮೇಲೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಟ್ರಾಫಿಕ್ ಶೂನ್ಯಕ್ಕೆ ಇಳಿದಾಗ, ಬಿಲ್ ಕೂಡ ಶೂನ್ಯವಾಗುತ್ತದೆ. ಬಳಕೆದಾರರು GPU ವೈಫಲ್ಯಗಳು, ಫರ್ಮ್ವೇರ್ ಅಪ್ಡೇಟ್ಗಳು ಮತ್ತು ಸಾಮರ್ಥ್ಯದ ಯೋಜನೆಗಳ (capacity planning) ತಲೆನೋವಿನಿಂದಲೂ ತಪ್ಪಿಸಿಕೊಳ್ಳಬಹುದು.
ಸೆಲ್ಫ್-ಹೋಸ್ಟಿಂಗ್ ಮಾದರಿ
ನಿಮ್ಮ ಸ್ವಂತ ಹಾರ್ಡ್ವೇರ್ನಲ್ಲಿ ಓಪನ್-ವೇಟ್ ಮಾಡೆಲ್ ಅನ್ನು ರನ್ ಮಾಡುವುದು ಎಂದರೆ, ಬಳಕೆಯ Notwithstanding ಕಂಪ್ಯೂಟ್ ವೆಚ್ಚವು ನಿಮ್ಮ ಮೇಲಿರುತ್ತದೆ. LLM ಇನ್ಫರೆನ್ಸ್ಗಾಗಿ ಸಾಮಾನ್ಯವಾಗಿ ಬಳಸಲಾಗುವ NVIDIA H100 ಒಂದರ ವೆಚ್ಚ ಹೀಗಿದೆ:
- ಸಾಮಾನ್ಯ GPU ಕ್ಲೌಡ್ ಸೇವೆಗಳಲ್ಲಿ ಪ್ರತಿ ಗಂಟೆಗೆ $2 – $3
- ಪ್ರಮುಖ ಕ್ಲೌಡ್ ಪ್ಲಾಟ್ಫಾರ್ಮ್ಗಳಲ್ಲಿ (AWS, Azure) ಪ್ರತಿ ಗಂಟೆಗೆ $7 – $12
ಇದು ಒಂದು H100 ಅನ್ನು ನಿರಂತರವಾಗಿ ನಡೆಸಲು ತಿಂಗಳಿಗೆ ಅಂದಾಜು $1,800 – $2,000 ವೆಚ್ಚವಾಗುತ್ತದೆ. ಹಾರ್ಡ್ವೇರ್ ಬೆಲೆಯು ಬಿಲ್ನ ಕೇವಲ ಗೋಚರ ಭಾಗವಷ್ಟೇ ಆಗಿದೆ.
ಅಂಕಿಅಂಶಗಳು ಎಲ್ಲಿ ಸಂಧಿಸುತ್ತವೆ
ಮಾಸಿಕ ಇನ್ಪುಟ್ ಟೋಕನ್ ಪ್ರಮಾಣವು 5 ಮಿಲಿಯನ್ನಿಂದ 10 ಮಿಲಿಯನ್ ವ್ಯಾಪ್ತಿಗೆ ತಲುಪಿದ ತಕ್ಷಣ, ಸೆಲ್ಫ್-ಹೋಸ್ಟಿಂಗ್ ಮಾಡುವುದು ಪ್ರೀಮಿಯಂ APIಗಳಿಗಿಂತ ಅಗ್ಗವಾಗುತ್ತದೆ ಎಂದು ವಿಶ್ಲೇಷಣೆಯು ತಿಳಿಸುತ್ತದೆ. ಆ ಮಿತಿಗಿಂತ ಕಡಿಮೆ ಇದ್ದಾಗ, ಪ್ರತಿ ಟೋಕನ್ಗೆ ಇರುವ API ದರಗಳೇ ಲಾಭದಾಯಕ. ತಿಂಗಳಿಗೆ 100 ಮಿಲಿಯನ್ ಟೋಕನ್ಗಳು ಅಥವಾ ಅದಕ್ಕಿಂತ ಹೆಚ್ಚು ಪ್ರಮಾಣವಿದ್ದಾಗ, ಕೇವಲ ಹಾರ್ಡ್ವೇರ್ ವೆಚ್ಚದ ರೇಖೆಯು API ರೇಖೆಗಿಂತ ಕೆಳಗೆ ಇಳಿಯುತ್ತದೆ, ಇದು ಕಾಗದದ ಮೇಲೆ ಸೆಲ್ಫ್-ಹೋಸ್ಟಿಂಗ್ ಅನ್ನು ಆಕರ್ಷಕವಾಗಿ ಕಾಣುವಂತೆ ಮಾಡುತ್ತದೆ.
ಗುಪ್ತ ಕಾರ್ಯಾಚರಣಾ ವೆಚ್ಚಗಳು
ಪ್ರೊಡಕ್ಷನ್ನಲ್ಲಿ ಮಾಡೆಲ್ ಅನ್ನು ರನ್ ಮಾಡುವ ನಿಜವಾದ ವೆಚ್ಚದಲ್ಲಿ GPU ಬಾಡಿಗೆಯು ಕೇವಲ 30% ಮಾತ್ರ. ಉಳಿದ ವೆಚ್ಚಗಳು ಇಲ್ಲಿಂದ ಬರುತ್ತವೆ:
- ನೆಟ್ವರ್ಕಿಂಗ್ ಮತ್ತು ಸ್ಟೋರೇಜ್ – ಹೆಚ್ಚಿನ ಥ್ರೂಪುಟ್ ಲಿಂಕ್ಗಳು ಮತ್ತು ವೇಗದ ಡಿಸ್ಕ್ಗಳು ವಿಳಂಬವನ್ನು (latency) ಕಡಿಮೆ ಇಡುತ್ತವೆ.
- ರೆಡಂಡನ್ಸಿ ಮತ್ತು ಮಾನಿಟರಿಂಗ್ – ಬಹು ಇನ್ಸ್ಟೆನ್ಸ್ಗಳು, ಹೆಲ್ತ್ ಚೆಕ್ಗಳು ಮತ್ತು ಅಲರ್ಟ್ ಪೈಪ್ಲೈನ್ಗಳು ಸಾಫ್ಟ್ವೇರ್ ಮತ್ತು ಹಾರ್ಡ್ವೇರ್ ಎರಡರ ಮೇಲಿನ ವೆಚ್ಚವನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ.
- ಎಂಜಿನಿಯರಿಂಗ್ ಪ್ರತಿಭೆ – ಮಾಡೆಲ್ ಅನ್ನು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಆನ್ಲೈನ್ನಲ್ಲಿಡಲು ಸಾಮಾನ್ಯವಾಗಿ 1.5 – 2 ಪೂರ್ಣಾವಧಿ ಎಂಜಿನಿಯರ್ಗಳ ಅಗತ್ಯವಿರುತ್ತದೆ. ಮಾರುಕಟ್ಟೆ ದರಗಳ ಪ್ರಕಾರ, ಇದು ವಾರ್ಷಿಕ ವೆಚ್ಚಕ್ಕೆ $270,000 – $550,000 ಅನ್ನು ಸೇರಿಸುತ್ತದೆ.
ಈ ಎಲ್ಲಾ ಅಂಶಗಳನ್ನು ಸೇರಿಸಿದಾಗ, ಕೇವಲ ಹಾರ್ಡ್ವೇರ್ನಿಂದ ಸಿಗುವ ಅನ್ವಯಿಕ ಉಳಿತಾಯವು ಶೀಘ್ರದಲ್ಲೇ ಮಾಯವಾಗುತ್ತದೆ.
ಯಾರು ಸೆಲ್ಫ್-ಹೋಸ್ಟಿಂಗ್ ಅನ್ನು ಪರಿಗಣಿಸಬೇಕು?
ಸೆಲ್ಫ್-ಹೋಸ್ಟಿಂಗ್ ನಿರ್ದಿಷ್ಟ ಪರಿಸ್ಥಿತಿಗಳ ಅಡಿಯಲ್ಲಿ ಮಾತ್ರ ಅರ್ಥಪೂರ್ಣವಾಗಿದೆ:
- ನಿರಂತರವಾಗಿ ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದ ಬಳಕೆ – ಸಂಸ್ಥೆಯು ನಿಯಮಿತವಾಗಿ 5 ಮಿಲಿಯನ್ ಟೋಕನ್ ಮಿತಿಯನ್ನು ಮೀರಬೇಕು, ಇಲ್ಲದಿದ್ದರೆ ಪ್ರತಿ ಟೋಕನ್ಗೆ API ಬೆಲೆಯು ಕಡಿಮೆಯಿರುತ್ತದೆ.
- ನಿಯಂತ್ರಕ ಅಥವಾ ಡೇಟಾ-ಪ್ರೈವೆಸಿ ನಿರ್ಬಂಧಗಳು – ಕೆಲವು ವಲಯಗಳು ಮಾಲೀಕತ್ವದ ಅಥವಾ ವೈಯಕ್ತಿಕ ಡೇಟಾವನ್ನು ಮೂರನೇ ವ್ಯಕ್ತಿಯ ಎಂಡ್ಪಾಯಿಂಟ್ಗಳಿಗೆ ಕಳುಹಿಸುವುದನ್ನು ನಿಷೇಧಿಸುತ್ತವೆ.
- ವಿಶೇಷಗೊಳಿಸಿದ ಕಸ್ಟಮೈಸೇಶನ್ ಅಥವಾ ವಿಳಂಬದ ಗ್ಯಾರಂಟಿ (latency guarantees) – ಮಾಡೆಲ್ ಅನ್ನು ಆಂತರಿಕ ಡೇಟಾದ ಮೇಲೆ ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಬೇಕಾದಾಗ ಅಥವಾ ಸೆಕೆಂಡಿಗಿಂತ ಕಡಿಮೆ ಸಮಯದಲ್ಲಿ ಪ್ರತಿಕ್ರಿಯೆ ನೀಡಬೇಕಾದಾಗ, ಸ್ವಂತ ಸ್ಟ್ಯಾಕ್ ಅನ್ನು ಹೊಂದಿರುವುದು ಸಮರ್ಥನೀಯವಾಗಬಹುದು.
ಈ ಯಾವುದೇ ಒತ್ತಡಗಳು ಇಲ್ಲದಿದ್ದರೆ, ಗುಪ್ತ ಸಿಬ್ಬಂದಿ ಮತ್ತು ಮೂಲಸೌಕರ್ಯ ವೆಚ್ಚಗಳು ಹೆಚ್ಚಾಗಿ ಹಾರ್ಡ್ವೇರ್ ಉಳಿತಾಯಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿರುತ್ತವೆ.
ಹೈಬ್ರಿಡ್ ಪ್ಲಾನ್ (A Hybrid Playbook)
ಸೆಲ್ಫ್-ಹೋಸ್ಟಿಂಗ್ ಕಾರ್ಯಸಾಧ್ಯವಾಗುವ ಮಟ್ಟಕ್ಕೆ ತಲುಪಿದ ಹೆಚ್ಚಿನ ತಂಡಗಳು ಇಂದಿಗೂ ಮಿಶ್ರ ವಿಧಾನವನ್ನೇ ಅನುಸರಿಸುತ್ತವೆ:
- APIಗಳೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸಿ – ಇವು ಅಗ್ಗವಾಗಿವೆ, ಸುಲಭವಾಗಿ ಸಂಯೋಜಿಸಬಹುದು ಮತ್ತು ಪ್ರಯೋಗ ಅಥವಾ ಕಡಿಮೆ ಪ್ರಮಾಣದ ಕೆಲಸಗಳಿಗೆ ಸೂಕ್ತವಾಗಿವೆ.
- ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದ ಸ್ಟ್ರೀಮ್ಗಳನ್ನು ಸ್ಥಳಾಂತರಿಸಿ – ಟೋಕನ್ ಸಂಖ್ಯೆಯು ನಿರಂತರವಾಗಿ ಬ್ರೇಕ್-ಈವೆನ್ ಪಾಯಿಂಟ್ ಅನ್ನು ಮೀರಿದ ನಂತರ, ಆ ಪೈಪ್ಲೈನ್ಗಳನ್ನು ಇನ್-ಹೌಸ್ ಕ್ಲಸ್ಟರ್ಗೆ ಬದಲಾಯಿಸಿ.
- ಸುರಕ್ಷತಾ ಜಾಲವನ್ನು ಉಳಿಸಿಕೊಳ್ಳಿ – ಸ್ಥಳೀಯ ಮೂಲಸೌಕರ್ಯಗಳ (on-prem resources) ಅತಿಯಾದ ಸಿದ್ಧತೆಯನ್ನು ತಪ್ಪಿಸಲು ಸಾಂದರ್ಭಿಕ ಅಥವಾ ಅನಿರೀಕ್ಷಿತ ಬೇಡಿಕೆಗಳನ್ನು APIಗಳ ಮೂಲಕವೇ ನಿರ್ವಹಿಸಿ.
ನಿಯಮಿತವಾಗಿ ಟೋಕನ್ ಲೆಕ್ಕಾಚಾರವನ್ನು ಮಾಡಿ, ನಂತರ ಕೇವಲ ಹಾರ್ಡ್ವೇರ್ ಬೆಲೆಯಲ್ಲಿ ಸೇರಿಲ್ಲದ ಕಾರ್ಯಾಚರಣಾ ವೆಚ್ಚಗಳನ್ನು ಸೇರಿಸಿ. ಈ ಸಂಪೂರ್ಣ ಚಿತ್ರಣದ ಆಧಾರದ ಮೇಲೆ ತೆಗೆದುಕೊಳ್ಳುವ ನಿರ್ಧಾರಗಳು ಕೇವಲ ವದಂತಿಗಳಿಂದ ಅಥವಾ ತಪ್ಪು ಕಲ್ಪನೆಗಳಿಂದ ವಿಚಲಿತವಾಗುವ ಸಾಧ್ಯತೆ ಕಡಿಮೆ ಇರುತ್ತದೆ.
ಸಾರಾಂಶ (Takeaway)
ನಿಮ್ಮ AI ಉತ್ಪನ್ನವು ಪ್ರತಿ ತಿಂಗಳು ಕೆಲವು ಮಿಲಿಯನ್ ಟೋಕನ್ಗಳಿಗಿಂತ ಕಡಿಮೆ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುತ್ತಿದ್ದರೆ, ಅತ್ಯಂತ ಸರಳ ಮತ್ತು ಅಗ್ಗದ ಮಾರ್ಗವೆಂದರೆ API ಅನ್ನು ಬಳಸುವುದು. ನಿರಂತರವಾದ, ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದ ಬೇಡಿಕೆ, ಕಟ್ಟುನಿಟ್ಟಾದ ಅನುಸರಣೆ (compliance), ಅಥವಾ ಕಸ್ಟಮ್ ವಿಳಂಬದ ಅಗತ್ಯಗಳು ಉಂಟಾದಾಗ ಮಾತ್ರ ಸೆಲ್ಫ್-ಹೋಸ್ಟಿಂಗ್ ಆರ್ಥಿಕವಾಗಿ ಕಾರ್ಯಸಾಧ್ಯವಾಗುತ್ತದೆ—ಮತ್ತು ಅಂತಹ ಸಂದರ್ಭದಲ್ಲೂ, ನೀವು ಕ್ಲೌಡ್ ಮೇಲೆ ವಿಜಯ ಸಾಧಿಸಿದ್ದೀರಾ ಎಂದು ಘೋಷಿಸುವ ಮೊದಲು ಸಿಬ್ಬಂದಿ ಮತ್ತು ಮೂಲಸೌಕರ್ಯಗಳ ಗುಪ್ತ ವೆಚ್ಚವನ್ನು ಪರಿಗಣಿಸಲೇಬೇಕು.
