AWS ने त्याच्या Bedrock सेवेमध्ये query-aware compression जोडले आहे, ज्यामुळे डेव्हलपर्सना लँग्वेज मॉडेलपर्यंत पोहोचण्यापूर्वी अप्रासंगिक दस्तऐवज तुकडे (document chunks) कमी करता येतात. मॉडेलकडे पाठवले जाणारे टोकन्स कमी करून, हे फीचर Retrieval-Augmented Generation (RAG) पाइपलाइन्ससाठी लागणारा कॉम्प्युट खर्च कमी करू शकते.

RAG पाइपलाइन्समध्ये खर्च का वाढतो?

RAG सिस्टम्स प्रथम नॉलेज बेसमधून मजकुराचे उतारे (text passages) मिळवतात आणि नंतर वापरकर्त्याच्या प्रश्नाचे उत्तर देण्यासाठी ते उतारे जनरेटिव्ह मॉडेलला देतात. बहुतेक अंमलबजावणीमध्ये, रिट्रिव्हड चंक (retrieved chunk) थेट मॉडेलकडे पाठवले जातात, जरी मजकुराचा मोठा भाग प्रश्नाशी संबंधित नसला तरीही. प्रत्येक अतिरिक्त शब्द एक टोकन बनतो आणि मॉडेल जेवढे टोकन्स प्रोसेस करते, तेवढा मूळ API वरील खर्च वाढतो. सपोर्ट बॉट्स किंवा अंतर्गत शोध साधने (internal search tools) चालवणाऱ्या लहान आणि मध्यम आकाराच्या कंपन्यांसाठी, टोकनवरील खर्च मॉडेल कॉल्सच्या खर्चापेक्षा वेगाने वाढू शकतो.

query-aware compression काय करते?

नवीन Bedrock क्षमता रिट्रिव्हल आणि जनरेशन दरम्यान एक फिल्टरिंग स्टेप समाविष्ट करते:

  • सिस्टम अजूनही प्रश्नासाठी दस्तऐवजांचा तोच संच मिळवते.
  • मॉडेलने कोणताही मजकूर पाहण्यापूर्वी, एक हलका प्रोसेसर (lightweight processor) प्रत्येक उताऱ्याचे विशिष्ट प्रश्नाशी असलेले मूल्यमापन करतो.
  • केवळ संबंधित असल्याचे आढळलेले भागच ठेवले जातात; बाकी सर्व माहिती 'नॉईज' (noise) म्हणून काढून टाकली जाते.

तुम्हाला नवीन इंडेक्स, एम्बेडिंग मॉडेल किंवा फाईन-ट्यून केलेल्या लँग्वेज मॉडेलची गरज नाही. हा बदल केवळ कॉम्प्रेशन लेयर कार्यान्वित करण्यासाठी पाइपलाइनमध्ये केलेला एक बदल आहे.

व्यवसायावर होणारा परिणाम

मॉडेलला पाठवल्या जाणाऱ्या मजकुराच्या प्रमाणानुसार टोकन फी वाढत असल्याने, अप्रासंगिक माहिती काढून टाकल्यामुळे बिलामध्ये मोठी घट होऊ शकते. ज्या कंपन्यांचा वापर वाढल्यामुळे RAG खर्चही वाढत आहे, त्यांना याचा सर्वाधिक फायदा होईल.

पुढे काय पाहावे?

  • तुमच्या स्वतःच्या डेटावर या फीचरचा पायलट प्रोजेक्ट करा: एक मानक RAG फ्लो आणि query-aware compression समाविष्ट असलेला फ्लो यांच्यात तुलनात्मक चाचणी करा. टोकन संख्या, लॅटन्सी (latency) आणि उत्तराची सुसंगतता मोजा.
  • व्हेंडर पारदर्शकता (Vendor transparency): थर्ड-पार्टी RAG प्लॅटफॉर्म्सचा विचार करताना, ते त्यांच्या रिट्रिव्हल पाइपलाइन्समध्ये कॉम्प्रेशन किंवा फिल्टरिंगचा वापर करतात का, हे विचारा. जे व्हेंडर रॉ चंक्स (raw chunks) पाठवतात, त्यांचे मासिक बिल जास्त येण्याची शक्यता असते.

थोडक्यात सांगायचे तर

पाइपलाइनमध्ये केलेला एक छोटासा बदल—मॉडेलपर्यंत पोहोचण्यापूर्वी अप्रासंगिक मजकूर फिल्टर करणे—एका छुपा खर्चाला नियंत्रित करता येण्याजोग्या खर्चात बदलू शकतो. जे संगठन आधीच Bedrock-आधारित RAG साठी पैसे मोजत आहेत, त्यांच्यासाठी query-aware compression सक्षम करणे हा एक कमी मेहनतीचा प्रयोग आहे, परंतु बचत तुमच्या विशिष्ट डेटावर अवलंबून असेल.