ఒక ఒంటరి పరిశోధకుడు తన LLM-ఆధారిత రీసెర్చ్ ఏజెంట్ నెల మొత్తం వినియోగించిన ప్రతి టోకెన్‌ను లాగ్ (log) చేసి, బిల్లును 31% తగ్గించారు. ఖర్చు $945 నుండి $651కి తగ్గింది, అదే సమయంలో సక్సెస్ రేట్ 91% నుండి 93%కి పెరిగింది. ఖర్చుపై దృష్టి పెట్టే AI వర్క్‌ఫ్లోలను నడిపేవారు ఈ ఫలితాన్ని ఖచ్చితంగా గమనిస్తారు.

టోకెన్-లెవల్ డేటా ఎందుకు ముఖ్యం

చాలా మంది LLM వినియోగదారులు కేవలం చివరి ఇన్వాయిస్‌ను మాత్రమే చూస్తారు – ఇది ప్రతి సబ్-టాస్క్ (sub-task) ఖర్చును దాచిపెట్టే ఒక మొత్తం మొత్తంగా ఉంటుంది. ఆ పరిశోధకుడి ఏజెంట్ మూడు ప్రధాన పనులను చేసింది: SEC ఫైలింగ్‌ల కోసం వెతకడం, నివేదికలను డ్రాఫ్ట్ చేయడం మరియు రీసెర్చ్ సింథసిస్‌లను క్రోడీకరించడం. గ్రాన్యులర్ (granular) డేటా లేకపోతే, జూన్‌లో అతను చెల్లించిన $312 సరిగ్గా ఖర్చు చేయబడిందో లేదో అతను చెప్పలేడు.

దాగి ఉన్న ఖర్చును గుర్తించడానికి, అతను మోడల్ పేరు, టోకెన్ కౌంట్, టాస్క్ రకం మరియు ప్రతి కాల్ (call) ఖర్చును క్యాప్చర్ చేసే PostgreSQL లాగింగ్ లేయర్‌ను జోడించారు. 30 రోజుల తర్వాత డేటా ఒక స్పష్టమైన చిత్రాన్ని చూపించింది:

  • SEC ఫైలింగ్ సెర్చ్ – మొత్తం ఖర్చులో 41%
  • రిపోర్ట్ డ్రాఫ్టింగ్ – 28%
  • రీసెర్చ్ సింథసిస్ – 17%
  • క్వాలిటీ చెక్స్ – 9%
  • ఇతరములు – 5%

అత్యంత ఖరీదైన దశ మోడల్ కాదని, ఏజెంట్ ముడి సెర్చ్ ఫలితాలను (raw search results) ప్రాంప్ట్‌లలోకి ఎలా పంపిస్తుందనేదే ప్రధాన కారణమని ఆ అంకెలు చూపించాయి.

పొదుపుకు దారితీసిన మూడు మార్పులు

1. ప్రాంప్ట్ ఇచ్చే ముందు సమ్మరైజ్ చేయండి

మొదట, ఏజెంట్ ప్రతి ప్రాంప్ట్‌లో 20 ముడి సెర్చ్ ఫలితాలను నింపేది, దీనివల్ల ఇన్‌పుట్ టోకెన్ల సంఖ్య భారీగా పెరిగేది. అతను ముందుగా ఒక తక్కువ ఖర్చుతో కూడిన సమ్మరైజర్‌ను (summarizer) చేర్చారు, దీనివల్ల ఇన్‌పుట్ గణనీయంగా తగ్గింది. సెర్చ్ టాస్క్ యొక్క ఖర్చు $0.84 నుండి $0.19కి తగ్గింది – అంటే 77% తగ్గింపు.

2. సాధారణ చెక్‌లను తక్కువ ఖర్చుతో కూడిన మోడల్‌కు పంపండి

క్వాలిటీ చెక్స్ ప్రతి చెక్‌కు $0.09 ఖర్చయ్యే హై-ఎండ్ మోడల్‌పై నడిచేవి. అతను చాలా వరకు పాస్/ఫెయిల్ (pass/fail) చెక్‌ల కోసం తక్కువ ధర కలిగిన మోడల్‌ను ఉపయోగించారు, దీనివల్ల ప్రతి చెక్ ధర $0.01కి తగ్గింది. తక్కువ ఖర్చుతో కూడిన మోడల్ 89% సార్లు సరిగ్గా సమాధానం ఇచ్చింది; ఏదైనా విఫలమైతే అది అసలు మోడల్‌కు పంపబడేది (escalated), తద్వారా ఖర్చును 87% తగ్గించేట jednocześnie ఖచ్చితత్వాన్ని కాపాడారు.

3. కాన్ఫిడెన్స్ ఎక్కువగా ఉన్నప్పుడు చెక్‌లను వదిలివేయండి

టాస్క్ యొక్క చారిత్రక సక్సెస్ రేట్ ఎక్కువగా ఉన్నప్పుడు మరియు అవుట్‌పుట్ పొడవు ఆశించిన పరిధిలో ఉన్నప్పుడు, క్వాలిటీ-చెక్ దశను దాటవేసేలా (bypass) అతను ఒక రూల్‌ను జోడించారు. దీనివల్ల అనవసరంగా జరిగే చెక్‌లలో సుమారు 60% తొలగిపోయాయి.

ఫలితం

ఈ మూడు మార్పులను అమలు చేసిన తర్వాత, నెలవారీ లెడ్జర్ ఇలా ఉంది:

  • మొత్తం ఖర్చు: $945 → $651 (31% తగ్గింపు)
  • టాస్క్ દીట SEC సెర్చ్ ఖర్చు: $0.84 → $0.19 (77% తగ్గింపు)
  • టాస్క్ દીట క్వాలిటీ-చెక్ ఖర్చు: $0.09 → $0.01 (87% తగ్గింపు)
  • మొత్తం సక్సెస్ రేట్: 91% → 93%

సక్సెస్ రేట్ పెరగడం వల్ల, చిన్న ప్రాంప్ట్‌లు నాయిస్‌ను (noise) తగ్గించాయని మరియు మోడల్ ప్రధాన ప్రశ్నపై దృష్టి పెట్టడానికి సహాయపడిందని అర్థమవుతోంది.

జాగ్రత్తలు మరియు ఇతర అంశాలు

ఈ విధానం రెండు ఊహలపై ఆధారపడి ఉంటుంది. మొదటిది, తక్కువ ఖర్చుతో కూడిన సమ్మరైజర్ తదుపరి రీజనింగ్ (reasoning) కోసం తగినంత సమాచారాన్ని నిలుపుకోవాలి; ఒకవేళ అది కీలకమైన వివరాలను వదిలేస్తే, అవుట్‌పుట్ నాణ్యత దెబ్బతినవచ్చు. రెండవది, క్వాలిటీ చెక్‌ల కోసం ఉపయోగించే తక్కువ ఖర్చుతో కూడిన మోడల్ పరిపూర్ణం కాదు; దాని 89% ఖచ్చితత్వం అంటే తక్కువ శాతం తప్పులు ఇంకా ఫైనల్ ప్రొడక్ట్‌కు చేరుతాయి, అయితే ఎస్కలేషన్ పాత్ (escalation path) వాటిలో చాలా వరకు పట్టుకుంటుంది. కఠినమైన నిబంధనలు (compliance) పాటించాల్సిన వినియోగదారులు మరింత కఠినమైన థ్రెషోల్డ్‌లు (thresholds) లేదా అదనపు వాలిడేషన్ దశలను అవసరపడవచ్చు.

LLM ప్రాక్టీషనర్లకు దీని అర్థం ఏమిటి

  • గ్రాన్యులర్ డాష్‌బోర్డ్‌లే విజేతలు. హై-లెవల్ ఖర్చు నివేదికలు టోకెన్ వృధాను దాచిపెడతాయి. టాస్క్ వారీగా వినియోగాన్ని రికార్డ్ చేయడం వల్ల, లేకపోతే బయటపడని అసమర్థతలను (inefficiencies) గుర్తించవచ్చు.
  • ఫ్రంటియర్ మోడల్స్ (Frontier models) ఎల్లప్పుడూ అవసరం లేదు. మొత్తం నాణ్యతను దెబ్బతీయకుండా ఒక తక్కువ ఖర్చుతో కూడిన మోడల్ డేటాను కంప్రెస్ చేయగలదు లేదా సాధారణ బైనరీ నిర్ణయాలను తీసుకోగలదు.

ఒక LLM ఏజెంట్ యొక్క దాగి ఉన్న ఖర్చు తరచుగా అది చేసే కొలవబడని పనిలో ఉంటుంది. టోకెన్ ఫ్లోను పర్యవేక్షించడం మరియు లక్షిత ఆప్టిమైజేషన్లను (targeted optimizations) అన్వయించడం ద్వారా, ఆ పరిశోధకుడు తన నెలవారీ $945 బిల్లును మరింత సమర్థవంతమైన $651 ఆపరేషన్‌గా మార్చడమే కాకుండా, పనితీరును కూడా పెంచారు. AI వర్క్‌లోడ్‌ల కోసం బడ్జెట్ వేసే ఎవరికైనా ఈ పాఠం స్పష్టంగా ఉంది: ప్రతి టోకెన్‌ను కొలవండి, ఆపై డేటా ఆధారంగా ఎక్కడ తగ్గించాలో నిర్ణయించుకోండి.