ಈ ತಿಂಗಳು ನಮ್ಮ AI-ಸೇವೆಯ ಬಿಲ್ $31,000 ಕ್ಕೆ ಏರಿತು—ನಾವು ನಿಗದಿಪಡಿಸಿದ ಬಜೆಟ್ಗಿಂತ ಮೂರು ಪಟ್ಟು ಹೆಚ್ಚು—ಏಕೆಂದರೆ ಕೇವಲ ಒಂದು ಸಾಲಿನ ಕೋಡ್ ನಮ್ಮ 80 % ಟ್ರಾಫಿಕ್ ಅನ್ನು ಅತ್ಯಂತ ದುಬಾರಿ ಮಾಡೆಲ್ ಆದ GPT-4o ಗೆ ಕಳುಹಿಸಿತ್ತು.
ಬಿಲ್ ಏಕೆ ಅತಿಯಾಗಿ ಏರಿತು
ನಾವು ಈ ವ್ಯವಸ್ಥೆಯನ್ನು ವಿಶ್ವಾಸಾರ್ಹತೆಗಾಗಿ ನಿರ್ಮಿಸಿದ್ದೆವು: ವೇಗದ ಪ್ರತಿಕ್ರಿಯೆಗಳು, ಶೂನ್ಯ ಡೌನ್ಟೈಮ್ ಮತ್ತು ಸುಗಮ ಸ್ಕೇಲಿಂಗ್. ಆ ಆಯ್ಕೆಯು ಟೋಕನ್ ಬಳಕೆಯಲ್ಲಿ ಒಂದು ರೀತಿಯ "ಮೆಮೊರಿ ಲೀಕ್" (memory leak) ಅನ್ನು ಸೃಷ್ಟಿಸಿತು—ಹೆಚ್ಚಿನ ಸಂವಹನಗಳಿಗೆ ಅಗತ್ಯವಿಲ್ಲದಿದ್ದರೂ, ಅತಿಯಾದ ಸಾಮರ್ಥ್ಯವುಳ್ಳ ಮಾಡೆಲ್ಗಾಗಿ ಟೋಕನ್ಗಳು ಖರ್ಚಾಗುತ್ತಲೇ ಇದ್ದವು.
ಎಂಜಿನಿಯರಿಂಗ್ ಬದಲಾವಣೆ: ವೆಚ್ಚವನ್ನು ಒಂದು ಆರ್ಕಿಟೆಕ್ಚರಲ್ ಕಾಳಜಿಯಾಗಿ ಪರಿಗಣಿಸುವುದು
AI ವೆಚ್ಚವನ್ನು ಕೇವಲ ಹಣಕಾಸಿನ ಸಮಸ್ಯೆಯಾಗಿ ನೋಡುವುದರಿಂದ ನಿಜವಾದ ಪರಿಹಾರವು ಮರೆಯಾಗುತ್ತದೆ: ಅದೆಂದರೆ, ಪ್ರತಿ ವಿನಂತಿಯನ್ನು (request) ಯಾವ ಮಾಡೆಲ್ ನಿರ್ವಹಿಸಬೇಕು ಎಂದು ನಿರ್ಧರಿಸುವ ಕೋಡ್. ಮಾಡೆಲ್ ಆಯ್ಕೆಯನ್ನು ರೂಟಿಂಗ್ ಲೇಯರ್ಗೆ (routing layer) ವರ್ಗಾಯಿಸುವುದರಿಂದ, ಅಡಗಿದ್ದ ವೆಚ್ಚವನ್ನು ನಿಯಂತ್ರಿಸಬಹುದಾದ ಚರಾಂಶವನ್ನಾಗಿ (controllable variable) ಬದಲಾಯಿಸಲು ಸಾಧ್ಯವಾಯಿತು.
1. ಕೆಲಸಕ್ಕೆ ತಕ್ಕಂತೆ ಮಾಡೆಲ್ ಅನ್ನು ಆಯ್ಕೆಮಾಡುವುದು
ನಿಯಮ ಸರಳವಾಗಿದೆ: ಗುಣಮಟ್ಟದ ಅಗತ್ಯತೆಯನ್ನು ಪೂರೈಸುವ ಅತ್ಯಂತ ಸಣ್ಣ ಮಾಡೆಲ್ ಅನ್ನು ಬಳಸಿ. ನಾವು ನಾಲ್ಕು ಸಾಮಾನ್ಯ ವಿನಂತಿ ಪ್ರಕಾರಗಳನ್ನು ಅಗ್ಗದ ಪರ್ಯಾಯಗಳಿಗೆ ಹೊಂದಿಸಿದ್ದೇವೆ:
- ಸರಳ ಚಾಟ್ → DeepSeek V4 Flash (97.5 % ಉಳಿತಾಯ)
- ವರ್ಗೀಕರಣ (Classification) → Qwen3-8B (98.3 % ಉಳಿತಾಯ)
- ಕೋಡ್ ಜನರೇಷನ್ → DeepSeek Coder (97.5 % ಉಳಿತಾಯ)
- ಸಾರಾಂಶ (Summarization) → Qwen3-32B (97.2 % ಉಳಿತಾಯ)
ಈ ಶೇಕಡಾವಾರು ಪ್ರಮಾಣವು ಆಯ್ಕೆಮಾಡಿದ ಮಾಡೆಲ್ ಮತ್ತು GPT-4o ನಡುವಿನ ನೇರ ಟೋಕನ್-ಬೆಲೆ ವ್ಯತ್ಯಾಸವನ್ನು ಪ್ರತಿಬಿಂಬಿಸುತ್ತದೆ. ಇದರ ಬದಲಾಗಿ, ಉನ್ನತ ಮಟ್ಟದ ತಾರ್ಕಿಕ ಸಾಮರ್ಥ್ಯದ ಅಗತ್ಯವಿಲ್ಲದ ಕೆಲಸಗಳಲ್ಲಿ ಸಾಮರ್ಥ್ಯದಲ್ಲಿ ಸಣ್ಣ ಮಟ್ಟದ ಇಳಿಕೆಯಾಗಬಹುದು.
2. CDN ನಂತೆ ಹಂತ ಹಂತದ ರೂಟಿಂಗ್ (Tiered routing)
ನಾವು ಎರಡು ಹಂತದ ರೂಟರ್ ಅನ್ನು ನಿರ್ಮಿಸಿದ್ದೇವೆ, ಇದು ಮೊದಲು ಪ್ರತಿಯೊಂದು ವಿನಂತಿಯನ್ನು ಅಗ್ಗದ ಮಾಡೆಲ್ಗೆ ಕಳುಹಿಸುತ್ತದೆ. ಒಂದು ವೇಳೆ ಪ್ರತಿಕ್ರಿಯೆಯು ಗುಣಮಟ್ಟದ ತಪಾಸಣೆಯಲ್ಲಿ ವಿಫಲವಾದರೆ—ಅಂದರೆ ನಿರೀಕ್ಷಿತ ಮಟ್ಟದ ವಿಶ್ವಾಸಾರ್ಹತೆ ಇಲ್ಲದಿದ್ದರೆ ಅಥವಾ ಅಗತ್ಯ ಮಾಹಿತಿ ಇಲ್ಲದಿದ್ದರೆ—ನಾವು ಅದನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಉನ್ನತ ಹಂತದ ಮಾಡೆಲ್ಗೆ ಮರು-ರೂಟ್ ಮಾಡುತ್ತೇವೆ. ಈ ಫಾಲ್ಬ್ಯಾಕ್ (fallback) ವ್ಯವಸ್ಥೆಯು ಬಳಕೆದಾರರ ಅನುಭವವನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳುತ್ತದೆ ಮತ್ತು ನಿಜವಾಗಿಯೂ ಅಗತ್ಯವಿದ್ದಾಗ ಮಾತ್ರ ಪ್ರೀಮಿಯಂ ಮಾಡೆಲ್ ಬಳಕೆಗೆ ಅವಕಾಶ ನೀಡುತ್ತದೆ.
3. ಪುನರಾವರ್ತಿತ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಕ್ಯಾಶ್ (Cache) ಮಾಡುವುದು
ಅನೇಕ ಸಂವಹನಗಳು ಒಂದೇ ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ ಅಥವಾ FAQ ಪಠ್ಯವನ್ನು ಮರುಬಳಕೆ ಮಾಡುತ್ತವೆ. ಅಂತಹ ಔಟ್ಪುಟ್ಗಳನ್ನು ಕ್ಯಾಶ್ ಮಾಡುವುದರಿಂದ, ಒಂದೇ ರೀತಿಯ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಮತ್ತೆ ಲೆಕ್ಕಾಚಾರ ಮಾಡುವುದನ್ನು ತಪ್ಪಿಸಬಹುದು. ನಮ್ಮ ಪರೀಕ್ಷೆಗಳಲ್ಲಿ, ಇನ್-ಮೆಮೊರಿ ಕ್ಯಾಶ್ (in-memory cache) ಪುನರಾವರ್ತಿತ ಪ್ರಾಂಪ್ಟ್ ವೆಚ್ಚವನ್ನು ಸುಮಾರು 30 % ರಷ್ಟು ಕಡಿಮೆ ಮಾಡಿದೆ.
4. ಕಳುಹಿಸುವ ಮೊದಲು ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಸಂಕುಚಿತಗೊಳಿಸುವುದು (Compress)
ಉದ್ದವಾದ ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ಗಳು ಬಳಕೆದಾರರ ವಿಷಯದಷ್ಟೇ ವೇಗವಾಗಿ ಟೋಕನ್ಗಳನ್ನು ಬಳಸುತ್ತವೆ. ನಾವು ಒಂದು ಪ್ರಿ-ಪ್ರೊಸೆಸರ್ ಅನ್ನು ಸೇರಿಸಿದ್ದೇವೆ, ಇದು ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಅಗ್ಗದ ಸಾರಾಂಶಕಾರದ (summarizer) ಮೂಲಕ ಹಾದುಹೋಗುವಂತೆ ಮಾಡಿ, ದುಬಾರಿ ಮಾಡೆಲ್ಗೆ ಕಳುಹಿಸುವ ಮೊದಲು ಅಗತ್ಯವಿರುವ ಮಾಹಿತಿಗೆ ಮಾತ್ರ ಸೀಮಿತಗೊಳಿಸುತ್ತದೆ. ಈ ಒಂದು ಹಂತವು ಟೋಕನ್ ವೆಚ್ಚದಲ್ಲಿ ವರ್ಷಕ್ಕೆ ಸಾವಿರಾರು ಡಾಲರ್ಗಳನ್ನು ಉಳಿಸಿದೆ.
ನೈಜ ಪ್ರಭಾವ
ಒಂದು ಚಾಟ್ಬಾಟ್ ಮೊದಲು ತಿಂಗಳಿಗೆ $420 ವೆಚ್ಚ ಮಾಡುತ್ತಿತ್ತು. ಅದರ 85 % ಪ್ರಶ್ನೆಗಳನ್ನು ಅಗ್ಗದ ಮಾಡೆಲ್ಗೆ ರೂಟ್ ಮಾಡಿ ಮತ್ತು ಕ್ಯಾಶಿಂಗ್ ಅನ್ವಯಿಸಿದ ನಂತರ, ಬಿಲ್ ಕೇವಲ $28 ಕ್ಕೆ ಇಳಿಯಿತು. ಹಗುರವಾದ ಮಾಡೆಲ್ ವೇಗವಾಗಿ ಪ್ರತಿಕ್ರಿಯಿಸುವುದರಿಂದ ವಿಳಂಬ (latency) ಕಡಿಮೆಯಾಯಿತು ಮತ್ತು ಫಾಲ್ಬ್ಯಾಕ್ ಹಾದಿಯು ಬಹಳ ಅಪರೂಪವಾಗಿ ಬಳಕೆಯಾಯಿತು.
ಮುಖ್ಯ ಅಂಶ
AI ವೆಚ್ಚವನ್ನು ಒಂದು ಪ್ರಮುಖ ಆರ್ಕಿಟೆಕ್ಚರಲ್ ನಿರ್ಧಾರವಾಗಿ ಪರಿಗಣಿಸಿ. ವಿನಂತಿಗಳನ್ನು ಸೂಕ್ತ ಮಾಡೆಲ್ಗೆ ರೂಟ್ ಮಾಡಿ, ಗುಣಮಟ್ಟ ಆಧಾರಿತ ಫಾಲ್ಬ್ಯಾಕ್ ಸೇರಿಸಿ, ಪುನರಾವರ್ತಿತ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಕ್ಯಾಶ್ ಮಾಡಿ ಮತ್ತು ಇನ್ಪುಟ್ಗಳನ್ನು ಸಂಕುಚಿತಗೊಳಿಸಿ—ಇದರ ಮೂಲಕ ವಿಶ್ವಾಸಾರ್ಹತೆಯನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳುತ್ತಲೇ ವೆಚ್ಚವನ್ನು ಗಣನೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡಬಹುದು.
