ఒక ఒంటరి పరిశోధకుడు తన LLM-ఆధారిత రీసెర్చ్ ఏజెంట్ నెల మొత్తం వినియోగించిన ప్రతి టోకెన్ను లాగ్ (log) చేసి, బిల్లును 31% తగ్గించారు. ఖర్చు $945 నుండి $651కి తగ్గింది, అదే సమయంలో సక్సెస్ రేట్ 91% నుండి 93%కి పెరిగింది. ఖర్చుపై దృష్టి పెట్టే AI వర్క్ఫ్లోలను నడిపేవారు ఈ ఫలితాన్ని ఖచ్చితంగా గమనిస్తారు.
టోకెన్-లెవల్ డేటా ఎందుకు ముఖ్యం
చాలా మంది LLM వినియోగదారులు కేవలం చివరి ఇన్వాయిస్ను మాత్రమే చూస్తారు – ఇది ప్రతి సబ్-టాస్క్ (sub-task) ఖర్చును దాచిపెట్టే ఒక మొత్తం మొత్తంగా ఉంటుంది. ఆ పరిశోధకుడి ఏజెంట్ మూడు ప్రధాన పనులను చేసింది: SEC ఫైలింగ్ల కోసం వెతకడం, నివేదికలను డ్రాఫ్ట్ చేయడం మరియు రీసెర్చ్ సింథసిస్లను క్రోడీకరించడం. గ్రాన్యులర్ (granular) డేటా లేకపోతే, జూన్లో అతను చెల్లించిన $312 సరిగ్గా ఖర్చు చేయబడిందో లేదో అతను చెప్పలేడు.
దాగి ఉన్న ఖర్చును గుర్తించడానికి, అతను మోడల్ పేరు, టోకెన్ కౌంట్, టాస్క్ రకం మరియు ప్రతి కాల్ (call) ఖర్చును క్యాప్చర్ చేసే PostgreSQL లాగింగ్ లేయర్ను జోడించారు. 30 రోజుల తర్వాత డేటా ఒక స్పష్టమైన చిత్రాన్ని చూపించింది:
- SEC ఫైలింగ్ సెర్చ్ – మొత్తం ఖర్చులో 41%
- రిపోర్ట్ డ్రాఫ్టింగ్ – 28%
- రీసెర్చ్ సింథసిస్ – 17%
- క్వాలిటీ చెక్స్ – 9%
- ఇతరములు – 5%
అత్యంత ఖరీదైన దశ మోడల్ కాదని, ఏజెంట్ ముడి సెర్చ్ ఫలితాలను (raw search results) ప్రాంప్ట్లలోకి ఎలా పంపిస్తుందనేదే ప్రధాన కారణమని ఆ అంకెలు చూపించాయి.
పొదుపుకు దారితీసిన మూడు మార్పులు
1. ప్రాంప్ట్ ఇచ్చే ముందు సమ్మరైజ్ చేయండి
మొదట, ఏజెంట్ ప్రతి ప్రాంప్ట్లో 20 ముడి సెర్చ్ ఫలితాలను నింపేది, దీనివల్ల ఇన్పుట్ టోకెన్ల సంఖ్య భారీగా పెరిగేది. అతను ముందుగా ఒక తక్కువ ఖర్చుతో కూడిన సమ్మరైజర్ను (summarizer) చేర్చారు, దీనివల్ల ఇన్పుట్ గణనీయంగా తగ్గింది. సెర్చ్ టాస్క్ యొక్క ఖర్చు $0.84 నుండి $0.19కి తగ్గింది – అంటే 77% తగ్గింపు.
2. సాధారణ చెక్లను తక్కువ ఖర్చుతో కూడిన మోడల్కు పంపండి
క్వాలిటీ చెక్స్ ప్రతి చెక్కు $0.09 ఖర్చయ్యే హై-ఎండ్ మోడల్పై నడిచేవి. అతను చాలా వరకు పాస్/ఫెయిల్ (pass/fail) చెక్ల కోసం తక్కువ ధర కలిగిన మోడల్ను ఉపయోగించారు, దీనివల్ల ప్రతి చెక్ ధర $0.01కి తగ్గింది. తక్కువ ఖర్చుతో కూడిన మోడల్ 89% సార్లు సరిగ్గా సమాధానం ఇచ్చింది; ఏదైనా విఫలమైతే అది అసలు మోడల్కు పంపబడేది (escalated), తద్వారా ఖర్చును 87% తగ్గించేట jednocześnie ఖచ్చితత్వాన్ని కాపాడారు.
3. కాన్ఫిడెన్స్ ఎక్కువగా ఉన్నప్పుడు చెక్లను వదిలివేయండి
టాస్క్ యొక్క చారిత్రక సక్సెస్ రేట్ ఎక్కువగా ఉన్నప్పుడు మరియు అవుట్పుట్ పొడవు ఆశించిన పరిధిలో ఉన్నప్పుడు, క్వాలిటీ-చెక్ దశను దాటవేసేలా (bypass) అతను ఒక రూల్ను జోడించారు. దీనివల్ల అనవసరంగా జరిగే చెక్లలో సుమారు 60% తొలగిపోయాయి.
ఫలితం
ఈ మూడు మార్పులను అమలు చేసిన తర్వాత, నెలవారీ లెడ్జర్ ఇలా ఉంది:
- మొత్తం ఖర్చు: $945 → $651 (31% తగ్గింపు)
- టాస్క్ દીట SEC సెర్చ్ ఖర్చు: $0.84 → $0.19 (77% తగ్గింపు)
- టాస్క్ દીట క్వాలిటీ-చెక్ ఖర్చు: $0.09 → $0.01 (87% తగ్గింపు)
- మొత్తం సక్సెస్ రేట్: 91% → 93%
సక్సెస్ రేట్ పెరగడం వల్ల, చిన్న ప్రాంప్ట్లు నాయిస్ను (noise) తగ్గించాయని మరియు మోడల్ ప్రధాన ప్రశ్నపై దృష్టి పెట్టడానికి సహాయపడిందని అర్థమవుతోంది.
జాగ్రత్తలు మరియు ఇతర అంశాలు
ఈ విధానం రెండు ఊహలపై ఆధారపడి ఉంటుంది. మొదటిది, తక్కువ ఖర్చుతో కూడిన సమ్మరైజర్ తదుపరి రీజనింగ్ (reasoning) కోసం తగినంత సమాచారాన్ని నిలుపుకోవాలి; ఒకవేళ అది కీలకమైన వివరాలను వదిలేస్తే, అవుట్పుట్ నాణ్యత దెబ్బతినవచ్చు. రెండవది, క్వాలిటీ చెక్ల కోసం ఉపయోగించే తక్కువ ఖర్చుతో కూడిన మోడల్ పరిపూర్ణం కాదు; దాని 89% ఖచ్చితత్వం అంటే తక్కువ శాతం తప్పులు ఇంకా ఫైనల్ ప్రొడక్ట్కు చేరుతాయి, అయితే ఎస్కలేషన్ పాత్ (escalation path) వాటిలో చాలా వరకు పట్టుకుంటుంది. కఠినమైన నిబంధనలు (compliance) పాటించాల్సిన వినియోగదారులు మరింత కఠినమైన థ్రెషోల్డ్లు (thresholds) లేదా అదనపు వాలిడేషన్ దశలను అవసరపడవచ్చు.
LLM ప్రాక్టీషనర్లకు దీని అర్థం ఏమిటి
- గ్రాన్యులర్ డాష్బోర్డ్లే విజేతలు. హై-లెవల్ ఖర్చు నివేదికలు టోకెన్ వృధాను దాచిపెడతాయి. టాస్క్ వారీగా వినియోగాన్ని రికార్డ్ చేయడం వల్ల, లేకపోతే బయటపడని అసమర్థతలను (inefficiencies) గుర్తించవచ్చు.
- ఫ్రంటియర్ మోడల్స్ (Frontier models) ఎల్లప్పుడూ అవసరం లేదు. మొత్తం నాణ్యతను దెబ్బతీయకుండా ఒక తక్కువ ఖర్చుతో కూడిన మోడల్ డేటాను కంప్రెస్ చేయగలదు లేదా సాధారణ బైనరీ నిర్ణయాలను తీసుకోగలదు.
ఒక LLM ఏజెంట్ యొక్క దాగి ఉన్న ఖర్చు తరచుగా అది చేసే కొలవబడని పనిలో ఉంటుంది. టోకెన్ ఫ్లోను పర్యవేక్షించడం మరియు లక్షిత ఆప్టిమైజేషన్లను (targeted optimizations) అన్వయించడం ద్వారా, ఆ పరిశోధకుడు తన నెలవారీ $945 బిల్లును మరింత సమర్థవంతమైన $651 ఆపరేషన్గా మార్చడమే కాకుండా, పనితీరును కూడా పెంచారు. AI వర్క్లోడ్ల కోసం బడ్జెట్ వేసే ఎవరికైనా ఈ పాఠం స్పష్టంగా ఉంది: ప్రతి టోకెన్ను కొలవండి, ఆపై డేటా ఆధారంగా ఎక్కడ తగ్గించాలో నిర్ణయించుకోండి.
