AWS తన Bedrock సర్వీస్‌కు query-aware compressionను జోడించింది, దీనివల్ల డెవలపర్లు డాక్యుమెంట్ చంక్‌లు (chunks) లాంగ్వేజ్ మోడల్‌కు చేరుకోకముందే వాటిలోని అనవసరమైన భాగాలను తొలగించవచ్చు. మోడల్‌కు పంపే టోకెన్ల సంఖ్యను తగ్గించడం ద్వారా, ఈ ఫీచర్ Retrieval-Augmented Generation (RAG) పైప్‌లైన్‌ల కోసం అయ్యే కంప్యూట్ ఖర్చును తగ్గించగలదు.

RAG పైప్‌లైన్‌లు ఎందుకు ఎక్కువ ఖర్చు చేస్తాయి

RAG సిస్టమ్‌లు మొదట ఒక నాలెడ్జ్ బేస్ నుండి టెక్స్ట్ పేసేజ్‌లను సేకరిస్తాయి, ఆపై వినియోగదారుని ప్రశ్నకు సమాధానం ఇవ్వడానికి ఆ పేసేజ్‌లను ఒక జనరేటివ్ మోడల్‌కు పంపిస్తాయి. చాలా సందర్భాలలో, టెక్స్ట్‌లోని పెద్ద భాగాలు ప్రశ్నకు సంబంధం లేకపోయినప్పటికీ, సేకరించిన ప్రతి చంక్‌ను నేరుగా మోడల్‌కు పంపిస్తారు. ప్రతి అదనపు పదం ఒక టోకెన్‌గా మారుతుంది మరియు మోడల్ ప్రాసెస్ చేసే ప్రతి టోకెన్ అండర్లయింగ్ API ఖర్చును పెంచుతుంది. సపోర్ట్ బాట్‌లు లేదా అంతర్గత సెర్చ్ టూల్స్‌ను నడిపే చిన్న మరియు మధ్యతరహా కంపెనీలకు, మోడల్ కాల్స్ ఖర్చు కంటే టోకెన్ల కోసం అయ్యే ఖర్చు వేగంగా పెరిగిపోవచ్చు.

query-aware compression ఏం చేస్తుంది

కొత్త Bedrock సామర్థ్యం రిట్రీవల్ (retrieval) మరియు జనరేషన్ (generation) మధ్య ఒక ఫిల్టరింగ్ దశను జోడిస్తుంది:

  • సిస్టమ్ ఇప్పటికీ ఒక క్వరీ కోసం అదే డాక్యుమెంట్ల సెట్‌ను సేకరిస్తుంది.
  • మోడల్ టెక్స్ట్‌ను చూడకముందే, ఒక లైట్‌వెయిట్ ప్రాసెసర్ ప్రతి పేసేజ్‌ను నిర్దిష్ట ప్రశ్నకు అనుగుణంగా విశ్లేషిస్తుంది.
  • సంబంధం ఉన్న భాగాలు మాత్రమే ఉంచబడతాయి; మిగిలినవన్నీ అనవసరమైనవిగా (noise) భావించి తొలగించబడతాయి.

దీని కోసం మీకు కొత్త ఇండెక్స్, ఎంబెడ్డింగ్ మోడల్ లేదా ఫైన్-ట్యూన్ చేసిన లాంగ్వేజ్ మోడల్ అవసరం లేదు. కేవలం కంప్రెషన్ లేయర్‌ను ఉపయోగించేలా పైప్‌లైన్‌ను మార్చడం ద్వారా ఈ మార్పు సాధ్యమవుతుంది.

వ్యాపార ప్రభావం

మోడల్‌కు పంపే టెక్స్ట్ పరిమాణంతో పాటు టోకెన్ ఫీజులు పెరుగుతాయి కాబట్టి, అనవసరమైన ముక్కలను తొలగించడం ద్వారా బిల్లును గణనీయంగా తగ్గించవచ్చు. వినియోగం పెరిగే కొద్దీ తమ RAG ఖర్చులు భారీగా పెరగడాన్ని గమనించిన కంపెనీలకు ఇది గొప్ప ప్రయోజనాన్ని అందిస్తుంది.

తదుపరి ఏమి గమనించాలి

  • మీ స్వంత డేటాపై ఈ ఫీచర్‌ను పైలట్ (Pilot) చేయండి: సాధారణ RAG ఫ్లో మరియు query-aware compression ఉన్న ఫ్లో మధ్య పోలికను పరీక్షించండి. టోకెన్ల సంఖ్య, లాటెన్సీ (latency) మరియు సమాధానం యొక్క సంబంధితతను (relevance) కొలవండి.
  • వెండర్ పారదర్శకత (Vendor transparency): థర్డ్-పార్టీ RAG ప్లాట్‌ఫారమ్‌లను అంచనా వేసేటప్పుడు, వారు తమ రిట్రీవల్ పైప్‌లైన్‌లలో కంప్రెషన్ లేదా ఫిల్టరింగ్‌ను ఉపయోగిస్తున్నారా అని అడగండి. ముడి చంక్‌లను (raw chunks) పంపే వెండర్ల నుండి వచ్చే నెలవారీ ఇన్‌వాయిస్‌లు ఎక్కువగా ఉండే అవకాశం ఉంది.

ముగింపు

పైప్‌లైన్‌లో చేసే చిన్న మార్పు—అంటే టెక్స్ట్ మోడల్‌కు చేరుకోకముందే అనవసరమైన భాగాన్ని ఫిల్టర్ చేయడం—దాగి ఉన్న ఖర్చును నియంత్రించదగిన అంశంగా మారుస్తుంది. ఇప్పటికే Bedrock ఆధారిత RAG కోసం చెల్లిస్తున్న సంస్థలకు, query-aware compressionను ఎనేబుల్ చేయడం అనేది తక్కువ శ్రమతో కూడిన ప్రయోగం, అయితే పొదుపు అనేది మీ నిర్దిష్ట డేటాపై ఆధారపడి ఉంటుంది.