ఒక సెమీ-ఆటోనమస్ (semi-autonomous), నాలుగు ఏజెంట్లు కలిగిన పైప్‌లైన్, ఎక్స్‌ప్లోరేటరీ డేటా అనాలిసిస్ (EDA)లో హాలూసినేషన్లను (hallucinations) తగ్గించగలదు. ఇది లార్జ్ లాంగ్వేజ్ మోడల్స్ (LLMs)ను సంఖ్యాపరమైన గణనల (number-crunching) నుండి దూరంగా ఉంచి, కేవలం నిర్ణయాలు తీసుకోవడం (judgment calls) కోసం మాత్రమే ఉపయోగిస్తుంది. ఈ డిజైన్ ద్వారా మోడల్ దేనిని పరిశీలించాలో నిర్ణయిస్తుంది, అయితే సాండ్‌బాక్స్ (sandbox)లో నడిచే సాధారణ కోడ్ అసలు గణనలను చేస్తుంది, తద్వారా ప్రతి దశను తనిఖీ చేయగలిగే ఫలితాలను అందిస్తుంది.

ఒకే LLM కాల్ ఎందుకు ప్రమాదకరమో

"ఈ స్ప్రెడ్‌షీట్‌ను చూడండి మరియు ఇందులో ఆసక్తికరంగా ఏముందో చెప్పండి" అని LLMకి ప్రాంప్ట్ ఇస్తే, అది ఒకే ఒక టెక్స్ట్ బ్లాక్‌ను అందిస్తుంది. మోడల్ నంబర్లను సొంతంగా సృష్టిస్తుంది, తర్కాన్ని (reasoning) అవుట్‌పుట్‌తో కలిపేస్తుంది మరియు ఒక ముగింపుకు ఎలా చేరుకున్నారో ఎటువంటి ఆధారాలను చూపదు. అది హాలూసినేట్ చేసినప్పుడు—అంటే ఒక తప్పుడు గణాంకాన్ని లేదా తప్పుగా ఉన్న సంబంధాన్ని (spurious correlation) చూపినప్పుడు—ఆ తప్పు వినియోగదారుడికి చేరకముందే దానిని పట్టుకోవడానికి ఎటువంటి చెక్‌పాయింట్ ఉండదు.

సెమీ-ఆటోనమస్ పైప్‌లైన్ వెనుక ఉన్న ఆలోచన

ఈ కొత్త వర్క్‌ఫ్లో EDAను నాలుగు స్థిరమైన దశలుగా విభజిస్తుంది, ప్రతి దశను దాని స్వంత ఏజెంట్ నిర్వహిస్తుంది. ఈ ఏజెంట్లు "ప్లాన్-దెన్-యాక్ట్" (plan-then-act) విధానాన్ని అనుసరిస్తాయి: అవి మొదట ఆపరేషన్ అవసరమో నిర్ణయిస్తాయి, ఆపై ఆ ఆపరేషన్‌ను సాండ్‌బాక్స్ కోడ్‌కు అప్పగిస్తాయి, అది ఆ పనిని నిర్వహిస్తుంది. LLM ఎప్పుడూ అరిథమెటిక్ లేదా ఫైల్ మానిప్యులేషన్‌ను చేయదు; అది కేవలం సంబంధితత (relevance) గురించి మాత్రమే నిర్ణయం తీసుకుంటుంది.

నాలుగు ఏజెంట్లు

  1. డేటా-క్లీనింగ్ ఏజెంట్ (Data-cleaning agent) – కాలమ్ రకాలను (column types) తనిఖీ చేస్తుంది, మిస్సింగ్ వాల్యూస్‌ను గుర్తిస్తుంది మరియు ఇంప్యుటేషన్ (imputation) లేదా టైప్ కన్వర్షన్ వ్యూహాలను నిర్ణయిస్తుంది.
  2. కాలమ్-అనాలిసిస్ ఏజెంట్ (Column-analysis agent) – ప్రతి వేరియబుల్ యొక్క డేటా రకం మరియు డిస్ట్రిబ్యూషన్ ఆధారంగా తగిన విజువలైజేషన్లను (హిస్టోగ్రామ్స్, బాక్స్ ప్లాట్లు మొదలైనవి) ఎంచుకుంటుంది.
  3. రిలేషన్‌షిప్-అనాలిసిస్ ఏజెంట్ (Relationship-analysis agent) – ప్రతి కాలమ్ జంటను (pair of columns) విశ్లేషిస్తుంది, ఏ జంటలకు లోతైన గణాంక పరీక్ష (statistical test) అవసరమో ఎంచుకుంటుంది మరియు వాటిని పొందే అవకాశం ఉన్న ఇన్సైట్స్ ఆధారంగా క్రమబద్ధీకరిస్తుంది.
  4. రిపోర్ట్-రైటింగ్ ఏజెంట్ (Report-writing agent) – రూపొందించిన చార్ట్‌లు మరియు గణించిన గణాంకాలను సహజ భాషా వివరణలుగా (natural-language explanations) మారుస్తుంది, ముఖ్యమైన నమూనాలు (patterns) మరియు హెచ్చరికలను (caveats) హైలైట్ చేస్తుంది.

ప్రతి దశ స్వతంత్రంగా నడుస్తుంది, కాబట్టి కాలమ్-అనాలిసిస్ మరియు రిలేషన్‌షిప్-అనాలిసిస్ ఏజెంట్లు సమాంతరంగా (in parallel) పనిచేయగలవు, దీనివల్ల మొత్తం వర్క్‌ఫ్లో సమయం తగ్గుతుంది.

స్వయంప్రతిపత్తిని (autonomy) ఎలా నియంత్రించాలో

ఈ పైప్‌లైన్ యొక్క భద్రతా నియమం సరళమైనది: మోడల్ రాసే ఏ కోడ్ అయినా హోస్ట్ సిస్టమ్ నుండి వేరుచేసే సాండ్‌బాక్స్ లోపల నడుస్తుంది. ఒకవేళ ఎగ్జిక్యూషన్ విఫలమైతే, ఆ ఎర్రర్ మోడల్‌కు తిరిగి వెళ్తుంది, పైప్‌లైన్ ఆగిపోకముందు స్క్రిప్ట్‌ను సరిదిద్దడానికి మోడల్‌కు రెండు ప్రయత్నాల వరకు అవకాశం ఉంటుంది. ఇది అనవసరమైన లూప్‌లను (runaway loops) నిరోధిస్తుంది మరియు మోడల్ ఎప్పుడూ ఫైల్‌లను నేరుగా మానిప్యులేట్ చేయదని లేదా అరిథమెటిక్ చేయదని హామీ ఇస్తుంది.

మోడల్ పాత్ర కేవలం దేనిని లెక్కించాలో నిర్ణయించడానికే పరిమితం కాబట్టి, అసలు సంఖ్యలు ఎల్లప్పుడూ డెటెర్మినಿಸ್ಟిక్ కోడ్ (deterministic code) నుండి వస్తాయి. ఒకవేళ రిలేషన్‌షిప్-అనాలిసిస్ ఏజెంట్ "Order ID" మరియు "Month" మధ్య సంబంధం ఉందని అనుమానిస్తే, సాండ్‌బాక్స్ ఒక కోరిలేషన్ ఫంక్షన్‌ను రన్ చేసి, ఖచ్చితమైన విలువను తిరిగి ఇస్తుంది, అప్పుడు మాత్రమే ఆ కోరిలేషన్ కారణం వల్ల (causal) ఏర్పడిందా లేదా యాదృచ్ఛికంగా (coincidental) జరిగిందా అనే దానిపై మోడల్ వ్యాఖ్యానిస్తుంది.

ఇది దేనిని పరిష్కరిస్తుంది – మరియు దీని వల్ల కలిగే ఖర్చు ఏమిటి

తగ్గిన హాలూసినేషన్లు. తర్కాన్ని (reasoning) గణనల (calculation) నుండి వేరు చేయడం ద్వారా, ఈ పైప్‌లైన్ తప్పుడు గణాంకాలకు ప్రధాన కారణాన్ని తొలగిస్తుంది: అంటే కోడ్ ద్వారా సంఖ్యలను సృష్టించకుండా, మోడల్ సంఖ్యలను ఊహించడం.

మాడ్యులారిటీ (Modularity). కొత్త దశను జోడించడం—ఉదాహరణకు, టైమ్-సిరీస్ ఫోర్‌కాస్టింగ్ ఏజెంట్—మొత్తం ప్రాంప్ట్‌ను తిరిగి రాయాల్సిన అవసరం లేదు. ప్రతి ఏజెంట్ ఒక స్వతంత్ర మాడ్యూల్, ఇది నిర్ణీత క్రమంలో సులభంగా కలిసిపోతుంది.

వేగవంతమైన ఫలితాలు. ప్రతి దశను వరుసగా చేయాల్సిన మోనోలిథిక్ LLM కాల్‌తో పోలిస్తే, స్వతంత్ర ఏజెంట్ల సమాంతర అమలు (parallel execution) సమయాన్ని గణనీయంగా తగ్గిస్తుంది.

సంక్లిష్టత మరియు నిర్వహణ భారం (Complexity overhead). దీనికి ప్రతిఫలంగా మరింత క్లిష్టమైన ఆర్కిటెక్చర్ అవసరమవుతుంది. బృందాలు సాండ్‌బాక్స్ వాతావరణాన్ని నిర్వహించాల్సి ఉంటుంది, ఎర్రర్-రిటర్న్ లూప్‌లను హ్యాండిల్ చేయాలి మరియు బహుళ ఏజెంట్లను సమన్వయం (orchestrate) చేయాలి.

తదుపరి గమనించవలసినవి

  • టూలింగ్ ఇంటిగ్రేషన్లు (Tooling integrations). సాండ్‌బాక్స్-ఎగ్జిక్యూషన్ దశను సులభతరం చేసే ఓపెన్-సోర్స్ ఫ్రేమ్‌వర్క్‌లు ఇంజనీరింగ్ భారాన్ని తగ్గించి, ఈ విధానాన్ని మరింత అందుబాటులోకి తీసుకురాగలవు.
  • ప్రామాణిక ఏజెంట్ కాంట్రాక్టులు (Standardised agent contracts). ఎక్కువ బృందాలు మల్టీ-ఏజెంట్ పైప్‌లైన్‌లను స్వీకరించే కొద్దీ, "ప్లాన్-దెన్-యాక్ట్" ఏజెంట్ల కోసం సాధారణ ఇంటర్‌ఫేస్‌లు ఉద్భవించవచ్చు, ఇది పరస్పర సామర్థ్యాన్ని (interoperability) సులభతరం చేస్తుంది.

దీని నుండి నేర్చుకోవాల్సిన ముఖ్యమైన పాఠం స్పష్టంగా ఉంది: LLMకి ఆలోచించే స్వేచ్ఛను ఇవ్వండి, కానీ లెక్కించే శక్తిని ఇవ్వకండి. దాని స్వయంప్రతిపత్తిని కేవలం నిర్ణయాలకు మాత్రమే పరిమితం చేయడం మరియు ప్రతి సంఖ్యను వేరు చేయబడిన కోడ్ ద్వారా పంపడం ద్వారా, ఒక సెమీ-ఆటోనమస్ EDA పైప్‌లైన్ మీరు తనిఖీ చేయగలిగే, నమ్మగలిగే మరియు తప్పుడు గణాంకాల భయం లేకుండా పంచుకోగలిగే ఫలితాలను అందిస్తుంది.

Source: https://dev.to/sraveend/agentic-but-only-semi-autonomous-designing-an-eda-pipeline-you-can-trust-4ha9
Community discussion: https://t.me/GyaanSetuAi