AWS ತನ್ನ Bedrock ಸೇವೆಗೆ query-aware compression ಅನ್ನು ಸೇರಿಸಿದೆ, ಇದು ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ಗೆ ತಲುಪುವ ಮೊದಲು ಅಪ್ರಸ್ತುತ ದಾಖಲೆಗಳ ತುಣುಕುಗಳನ್ನು (document chunks) ಕಡಿತಗೊಳಿಸಲು ಡೆವಲಪರ್ಗಳಿಗೆ ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಮಾಡೆಲ್ಗೆ ಹೋಗುವ ಟೋಕನ್ಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಮೂಲಕ, ಈ ಫೀಚರ್ Retrieval-Augmented Generation (RAG) ಪೈಪ್ಲೈನ್ಗಳ ಕಂಪ್ಯೂಟ್ ಬಿಲ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು.
RAG ಪೈಪ್ಲೈನ್ಗಳು ಹಣವನ್ನು ಏಕೆ ವ್ಯರ್ಥ ಮಾಡುತ್ತವೆ
RAG ಸಿಸ್ಟಮ್ಗಳು ಮೊದಲು ಜ್ಞಾನ ಕೋಶದಿಂದ (knowledge base) ಪಠ್ಯದ ಭಾಗಗಳನ್ನು ಪಡೆಯುತ್ತವೆ, ನಂತರ ಬಳಕೆದಾರರ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸಲು ಆ ಭಾಗಗಳನ್ನು ಜನರೇಟಿವ್ ಮಾಡೆಲ್ಗೆ ನೀಡುತ್ತವೆ. ಹೆಚ್ಚಿನ ಅನುಷ್ಠಾನಗಳಲ್ಲಿ (implementations), ಪಠ್ಯದ ದೊಡ್ಡ ಭಾಗಗಳು ಪ್ರಶ್ನೆಗೆ ಸಂಬಂಧಿಸದಿದ್ದರೂ ಸಹ, ಪಡೆಯಲಾದ ಪ್ರತಿಯೊಂದು ತುಣುಕನ್ನು ನೇರವಾಗಿ ಮಾಡೆಲ್ಗೆ ಕಳುಹಿಸಲಾಗುತ್ತದೆ. ಪ್ರತಿಯೊಂದು ಹೆಚ್ಚುವರಿ ಪದವು ಒಂದು ಟೋಕನ್ ಆಗುತ್ತದೆ ಮತ್ತು ಮಾಡೆಲ್ ಪ್ರೊಸೆಸ್ ಮಾಡುವ ಪ್ರತಿಯೊಂದು ಟೋಕನ್ ಅಡಿಯಲ್ಲಿರುವ API ಮೇಲಿನ ಶುಲ್ಕವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. ಸಪೋರ್ಟ್ ಬಾಟ್ಗಳು ಅಥವಾ ಆಂತರಿಕ ಹುಡುಕಾಟ ಸಾಧನಗಳನ್ನು ನಡೆಸುವ ಸಣ್ಣ ಮತ್ತು ಮಧ್ಯಮ ಗಾತ್ರದ ಕಂಪನಿಗಳಿಗೆ, ಟೋಕನ್ ವೆಚ್ಚವು ಮಾಡೆಲ್ ಕರೆಗಳ ವೆಚ್ಚಕ್ಕಿಂತಲೂ ವೇಗವಾಗಿ ಹೆಚ್ಚಾಗಬಹುದು.
query-aware compression ಏನು ಮಾಡುತ್ತದೆ
ಹೊಸ Bedrock ಸಾಮರ್ಥ್ಯವು ರಿಟ್ರಿೀವಲ್ (retrieval) ಮತ್ತು ಜನರೇಷನ್ (generation) ನಡುವೆ ಫಿಲ್ಟರಿಂಗ್ ಹಂತವನ್ನು ಸೇರಿಸುತ್ತದೆ:
- ಸಿಸ್ಟಮ್ ಇಂದಿಗೂ ಪ್ರಶ್ನೆಗಾಗಿ ಅದೇ ದಾಖಲೆಗಳ ಸೆಟ್ ಅನ್ನು ಪಡೆಯುತ್ತದೆ.
- ಮಾಡೆಲ್ ಯಾವುದೇ ಪಠ್ಯವನ್ನು ನೋಡುವ ಮೊದಲು, ಒಂದು ಲಘು ಪ್ರೊಸೆಸರ್ (lightweight processor) ಪ್ರತಿಯೊಂದು ಭಾಗವನ್ನು ನಿರ್ದಿಷ್ಟ ಪ್ರಶ್ನೆಗೆ ಅನುಗುಣವಾಗಿ ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತದೆ.
- ಸಂಬಂಧಿತ ಎಂದು ನಿರ್ಧರಿಸಲಾದ ಭಾಗಗಳನ್ನು ಮಾತ್ರ ಇರಿಸಿಕೊಳ್ಳಲಾಗುತ್ತದೆ; ಉಳಿದವುಗಳನ್ನು ಶಬ್ದ (noise) ಎಂದು ಕೈಬಿಡಲಾಗುತ್ತದೆ.
ನಿಮಗೆ ಹೊಸ ಇಂಡೆಕ್ಸ್, ಎಂಬೆಡ್ಡಿಂಗ್ ಮಾಡೆಲ್ ಅಥವಾ ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಲಾದ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ ಅಗತ್ಯವಿಲ್ಲ. ಈ ಬದಲಾವಣೆಯು ಕೇವಲ ಕಂಪ್ರೆಷನ್ ಲೇಯರ್ ಅನ್ನು ಬಳಸುವಂತೆ ಪೈಪ್ಲೈನ್ ಅನ್ನು ಮರು-ವೈರಿಂಗ್ ಮಾಡುವುದು ಮಾತ್ರ.
ವ್ಯಾಪಾರ ಪ್ರಭಾವ
ಮಾಡೆಲ್ಗೆ ಕಳುಹಿಸುವ ಪಠ್ಯದ ಪ್ರಮಾಣಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಟೋಕನ್ ಶುಲ್ಕಗಳು ಹೆಚ್ಚಾಗುವುದರಿಂದ, ಅಪ್ರಸ್ತುತ ತುಣುಕುಗಳನ್ನು ತೆಗೆದುಹಾಕುವುದರಿಂದ ಬಿಲ್ ಅನ್ನು ಹಂತ ಹಂತವಾಗಿ ಕಡಿಮೆ ಮಾಡಬಹುದು. ಬಳಕೆಯೊಂದಿಗೆ RAG ವೆಚ್ಚಗಳು ಹೆಚ್ಚಾಗುತ್ತಿರುವುದನ್ನು ಗಮನಿಸಿದ ಕಂಪನಿಗಳಿಗೆ ಇದರಿಂದ ಹೆಚ್ಚಿನ ಪ್ರಯೋಜನವಾಗಲಿದೆ.
ಮುಂದೆ ಗಮನಿಸಬೇಕಾದವುಗಳು
- ನಿಮ್ಮ ಸ್ವಂತ ಡೇಟಾದ ಮೇಲೆ ಈ ಫೀಚರ್ ಅನ್ನು ಪೈಲಟ್ ಮಾಡಿ: ಪ್ರಮಾಣಿತ RAG ಫ್ಲೋ ಮತ್ತು query-aware compression ಒಳಗೊಂಡಿರುವ ಫ್ಲೋ ನಡುವೆ ಸೈಡ್-ಬೈ-ಸೈಡ್ ಪರೀಕ್ಷೆಯನ್ನು ನಡೆಸಿ. ಟೋಕನ್ ಸಂಖ್ಯೆ, ವಿಳಂಬ (latency) ಮತ್ತು ಉತ್ತರದ ಪ್ರಸ್ತುತತೆಯನ್ನು ಅಳೆಯಿರಿ.
- ವೆಂಡರ್ ಪಾರದರ್ಶಕತೆ: ಥರ್ಡ್-ಪಾರ್ಟಿ RAG ಪ್ಲಾಟ್ಫಾರ್ಮ್ಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವಾಗ, ಅವರು ತಮ್ಮ ರಿಟ್ರಿೀವಲ್ ಪೈಪ್ಲೈನ್ಗಳಲ್ಲಿ ಕಂಪ್ರೆಷನ್ ಅಥವಾ ಫಿಲ್ಟರಿಂಗ್ ಅನ್ನು ಬಳಸುತ್ತಾರೆಯೇ ಎಂದು ಕೇಳಿ. ಕಚ್ಚಾ ತುಣುಕುಗಳನ್ನು (raw chunks) ಕಳುಹಿಸುವ ವೆಂಡರ್ ಹೆಚ್ಚಿನ ಮಾಸಿಕ ಇನ್ವಾಯ್ಸ್ಗಳನ್ನು ನೀಡುವ ಸಾಧ್ಯತೆಯಿದೆ.
ಸಾರಾಂಶ
ಪೈಪ್ಲೈನ್ನಲ್ಲಿ ಮಾಡುವ ಒಂದು ಸಣ್ಣ ಬದಲಾವಣೆ—ಮಾಡೆಲ್ಗೆ ತಲುಪುವ ಮೊದಲು ಅಪ್ರಸ್ತುತ ಪಠ್ಯವನ್ನು ಫಿಲ್ಟರ್ ಮಾಡುವುದು—ಅದೃಶ್ಯ ವೆಚ್ಚವನ್ನು ನಿಯಂತ್ರಿಸಬಹುದಾದ ವೆಚ್ಚವಾಗಿ ಬದಲಾಯಿಸಬಹುದು. ಈಗಾಗಲೇ Bedrock ಆಧಾರಿತ RAG ಬಳಸುತ್ತಿರುವ ಸಂಸ್ಥೆಗಳಿಗೆ, query-aware compression ಅನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುವುದು ಕಡಿಮೆ ಶ್ರಮದ ಪ್ರಯೋಗವಾಗಿದೆ, ಆದರೆ ಉಳಿತಾಯವು ನಿಮ್ಮ ನಿರ್ದಿಷ್ಟ ಡೇಟಾ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ.
