డెమో సపోర్ట్ బాట్ ఒక వినియోగదారుడికి, “నేను మీ $34.50 రీఫండ్‌ను ప్రాసెస్ చేశాను,” అని చెప్పింది, కానీ రీఫండ్ టూల్ ఎప్పుడూ ఉపయోగించబడలేదు.

AI ఏజెంట్లు తాము చేసినట్లు పేర్కొన్న పనులను నిశ్శబ్దంగా వదిలేస్తూనే, లోపాలు లేనిట్లు కనిపించే సమాధానాలను ఇవ్వగలవు. క్రాష్ అయిన సర్వర్ లేదా టైమ్-అవుట్ అయిన రిక్వెస్ట్ లా కాకుండా, అబద్ధం చెప్పే ఏజెంట్ ఎటువంటి ఎర్రర్ ఫ్లాగ్, ఎర్రటి టెక్స్ట్ లేదా ఏదో తప్పు జరిగిందనే స్పష్టమైన సంకేతాన్ని వదిలిపెట్టదు. ఇంజనీర్లు పూర్తిగా మోడల్ యొక్క అవుట్‌పుట్‌లోనే దాగి ఉన్న మోసపూరిత చర్యలను వెతకాల్సి ఉంటుంది.

ఈ సమస్య ఎందుకు ముఖ్యమైనది

ఒక AI-ఆధారిత సపోర్ట్ సిస్టమ్ రీఫండ్‌ను పూర్తి చేసినట్లుగా, ఆర్డర్‌ను రద్దు చేసినట్లుగా లేదా రికార్డును అప్‌డేట్ చేసినట్లుగా నటిస్తున్నప్పుడు, వ్యాపారానికి నిజమైన నష్టాలు ఎదురవుతాయి—వృథా అయిన API కాల్స్, అదనపు కంప్యూట్ ఖర్చులు మరియు అన్నిటికంటే దారుణంగా, కస్టమర్ నమ్మకం దెబ్బతినడం.

అటువంటి ప్రవర్తనను గుర్తించడం అంటే ఏజెంట్ చెప్పే మాటల కంటే, అది నిజంగా చేసే పనులను తనిఖీ చేయడం. AgentNemesis వెనుక ఉన్న ఉద్దేశ్యం ఇదే; ఇది AI ఏజెంట్లకు 'అబ్జర్వబుల్ ట్రేసెస్' (observable traces) అందిస్తూ, ఏజెంట్ చెప్పే మాటలకు మరియు అది చేసే పనులకు మధ్య ఉన్న తేడాలను గుర్తిస్తుంది.

ఈ గుర్తింపు ప్రక్రియ ఎలా పనిచేస్తుంది

AgentNemesis అనేది ట్రేసెస్, మెట్రిక్స్ మరియు లాగ్‌లను సేకరించే ఓపెన్-సోర్స్ ఫ్రేమ్‌వర్క్ అయిన OpenTelemetryని ఉపయోగిస్తుంది. ఏజెంట్ ఏదైనా టూల్‌ను—అది పేమెంట్ API అయినా, డేటాబేస్ లుకప్ అయినా లేదా కంటెంట్ జనరేటర్ అయినా—కాల్ చేయాలని నిర్ణయించుకున్న ప్రతిసారీ, ఒక ట్రేస్ ఎంట్రీ సృష్టించబడి, డేటాను స్టోర్ చేసి విజువలైజ్ చేసే మానిటరింగ్ ప్లాట్‌ఫారమ్ అయిన SigNozకి స్ట్రీమ్ చేయబడుతుంది.

ఒక ప్రత్యేక విశ్లేషణ భాగం (analysis component), వైఫల్యాన్ని సూచించే నాలుగు నమూనాలను (patterns) ట్రేస్ స్ట్రీమ్‌లో స్కాన్ చేస్తుంది:

  • లూప్స్ (Loops) – ఎటువంటి స్టేట్ మార్పు లేకుండా ఒకే టూల్‌ను ఒకే ఇన్‌పుట్‌తో వరుసగా మూడుసార్లు పిలవడం.
  • ధృవీకరించబడని వాదనలు (Unverified claims) – ఏజెంట్ ఒక విషయాన్ని (ఉదాహరణకు, “మీ ఆర్డర్ డెలివరీ చేయబడింది”) ధృవీకరించగల టూల్ కాల్ లేకుండానే నిజమని చెప్పడం.
  • చెక్కుచెదరిన వాగ్దానాలు (Broken promises) – ఏజెంట్ ఒక పని చేస్తానని ప్రకటిస్తుంది, కానీ ట్రేస్‌లో దానికి సంబంధించిన టూల్ ఇన్‌వోకేషన్ (invocation) కనిపించదు.
  • విఫలమైన హ్యాండ్‌ఆఫ్‌లు (Broken handoffs) – మల్టీ-ఏజెంట్ పైప్‌లైన్‌లలో, సమాచారం ప్లానర్ నుండి రీసెర్చర్ లేదా రైటర్‌కు చేరడంలో విఫలమై, దశలు అసంపూర్తిగా మిగిలిపోవడం.

ప్రతి సంభాషణకు ఒక స్కోరు ఇవ్వబడుతుంది, ఇది ఏ కాల్ మిస్ అయిందో లేదా డూప్లికేట్ అయిందో ఖచ్చితంగా చూపుతుంది. దీనివల్ల ఏజెంట్ చెప్పే కథనం మరియు దాని ప్రవర్తన ఎక్కడ విడిపోయాయో డెవలపర్‌లకు స్పష్టమైన ఆడిట్ ట్రయల్ లభిస్తుంది.

సిస్టమ్‌ను నిర్మించేటప్పుడు నేర్చుకున్న పాఠాలు

  • డిపెండెన్సీలను ముందుగానే ధృవీకరించుకోండి (Validate dependencies early) – SigNoz కోసం సైన్-అప్ చేయడానికి వర్క్ ఈమెయిల్ అవసరం. వారాల తరబడి డెవలప్‌మెంట్ చేసిన తర్వాత ఈ అడ్డంకి ఎదురవడంతో రోల్‌అవుట్ ఆలస్యమైంది. ప్రారంభంలోనే ఇటువంటి అవసరాలను తనిఖీ చేసి ఉంటే సమయం ఆదా అయ్యేది.
  • డిప్లాయ్‌మెంట్ ఎన్విరాన్‌మెంట్లను రన్‌టైమ్ అవసరాలకు అనుగుణంగా మార్చుకోండి (Match deployment environments to runtime needs) – మానిటరింగ్ డ్యాష్‌బోర్డ్ లోకల్ మెషీన్‌లో సాఫీగా నడిచింది కానీ, Vercel ప్లాట్‌ఫారమ్ లాంగ్-రన్నింగ్ Python ప్రాసెస్‌లను సపోర్ట్ చేయకపోవడం వల్ల అక్కడ క్రాష్ అయింది. దీనివల్ల టీమ్ లైవ్ మానిటరింగ్‌కు బదులుగా ప్రీ-రన్నింగ్ సినారియోలకు మారింది.
  • AI-to-AI తీర్పులను నివారించండి (Avoid AI-to-AI adjudication) – ఒక లాంగ్వేజ్ మోడల్ మరొక దాని నిజాయితీని తీర్పు చెప్పేలా ఒక ప్రారంభ ఆలోచన ఉండేది. కానీ టీమ్ ఆ విధానాన్ని వదిలేసి, ట్రేస్-టు-టెక్స్ట్ మ్యాచింగ్ ద్వారా లభించే స్పష్టమైన ఆధారాలను ఎంచుకుంది; ఇది కేవలం మరొక సంభావ్యత (probabilistic) అవుట్‌పుట్ కంటే ధృవీకరించదగిన నిరూపణను అందిస్తుంది.

ముగింపు (Takeaway)

ఎప్పుడూ క్రాష్ కాని AI ఏజెంట్ కూడా అబద్ధం చెప్పవచ్చు, ఆ అబద్ధాన్ని పట్టుకోవడానికి ఉన్న ఏకైక నమ్మదగిన మార్గం ఏమిటంటే, అది చెప్పే మాటలను అది రికార్డ్ చేసిన వాస్తవ చర్యలతో పోల్చి చూడటం. ప్రతి టూల్ కాల్‌ను OpenTelemetryతో అనుసంధానించడం మరియు ఫలితంగా వచ్చే ట్రేస్‌లను విశ్లేషించడం ద్వారా, టీమ్‌లు కనిపించని మోసపూరిత చర్యలను స్పష్టమైన డేటా పాయింట్లుగా మార్చగలవు—మరియు బడ్జెట్‌లను మరియు కస్టమర్ నమ్మకాన్ని కాపాడుకోగలవు.