మ్యాట్ షుమర్ తన కంప్యూటర్ ముందు కూర్చుని తన AI ఏజెంట్‌కు ఒక సాధారణ సూచన ఇచ్చారు: ఫైళ్లను క్లీన్ చేయి (clean up the files). ఆయన ఈ పనిని వందల సార్లు ఎటువంటి సమస్య లేకుండా చేశారు. కానీ ఈసారి, ఒక పాత్ రిజల్యూషన్ ఎర్రర్ (path resolution error) సాధారణ ఇంటి పనుల వంటి ఈ ప్రక్రియను ఒక పెద్ద విపత్తుగా మార్చేసింది. సంవత్సరాల తరబడి సేకరించిన కోడ్, డాక్యుమెంట్లు మరియు ఫోటోలు క్షణాల్లో మాయమైపోయాయి.

ఇది కేవలం ఊహాజనితమైన ప్రమాదం కాదు. ఇది ఒక నిజమైన డెవలపర్‌కు, నిజమైన మెషీన్‌తో జరిగింది. ఆ ఏజెంట్ విఫలమయ్యే క్షణం వరకు దాని పనితీరు ఎంతో నమ్మదగినదిగా కనిపించింది. ఫైళ్లను రాయగలిగే, టెర్మినల్ కమాండ్లను అమలు చేయగలిగే మరియు సబ్-ఏజెంట్లను (subagents) సృష్టించగలిగే AI ఏజెంట్లు ఇప్పుడు IDEలు, చాట్ ఇంటర్‌ఫేస్‌లు మరియు ఆటోమేషన్ పైప్‌లైన్‌లలో అంతర్భాగమయ్యాయి. వాటికి ఆపరేటింగ్ సిస్టమ్‌లపై ప్రత్యక్ష ప్రాప్తిని (direct access) నమ్మకంతో ఇస్తున్నారు, ఆ నమ్మకమే అసలైన ప్రమాదానికి మూలం. షుమర్ మెషీన్‌ను నాశనం చేసిన అదే రకమైన వైఫల్యాలు, టూల్ యాక్సెస్ ఉన్న ప్రతి ఏజెంట్‌లోనూ ఉండే అవకాశం ఉంది. అవి ఎందుకు విఫలమవుతాయి మరియు వాటిని ఎలా సరిగ్గా నియంత్రించాలి (cage them properly) అని అర్థం చేసుకోవడం, ఈ సాధనాలను ఉపయోగించే ఎవరికైనా ఇప్పుడు ఒక ప్రాథమిక మనుగడ నైపుణ్యం (survival skill).

ప్యాటర్న్ మ్యాచింగ్ ఫైల్ సిస్టమ్‌తో కలిసినప్పుడు

AI ఏజెంట్లు ఆలోచించవు. అవి కేవలం ప్యాటర్న్‌లను మ్యాచ్ చేస్తాయి. మీరు “clean up files” అని చెప్పినప్పుడు, ఆ మోడల్ తన శిక్షణ మెమరీలో వేలాది సారూప్య ఇంటరాక్షన్ల కోసం వెతికి, గణాంకపరంగా (statistically) ఆ ప్యాటర్న్‌కు సరిపోయేలా ఒక కమాండ్‌ను రూపొందిస్తుంది. ఒకవేళ బిల్డ్ డైరెక్టరీలోని తాత్కాలిక ఫైళ్లను తొలగించమని సూచిస్తే, అది rm -rf /tmp/build-cache/* వంటి కమాండ్‌ను సృష్టించవచ్చు. మోడల్ ఇంతకుముందు చూసిన ఇతర క్లీనప్ కమాండ్‌ల మాదిరిగానే ఉండటం వల్ల ఇది సరైనదిగా అనిపిస్తుంది.

కానీ $HOME వంటి వేరియబుల్ రిజాల్వ్ (resolve) కానప్పుడు ఏం జరుగుతుంది? ఒక మనిషి ఖాళీ స్ట్రింగ్ లేదా ఊహించని పాత్‌ను చూసి, ఆగి, ప్రశ్నలు అడుగుతారు. కానీ ఒక ఏజెంట్ ఆ ప్యాటర్న్ ఇంకా సరిపోతుందని భావించి, ఎంటర్ నొక్కుతుంది. షుమర్ విషయంలో, ఒక నిర్దిష్ట ఫోల్డర్‌ను క్లీన్ చేయాల్సిన కమాండ్, పొరపాటున యూజర్ డైరెక్టరీ యొక్క రూట్ (root) ను లక్ష్యంగా చేసుకుంది. ఆ పాత్ ఎందుకు వింతగా ఉందో అని ఏజెంట్ ఆగి ఆలోచించలేదు. అది లక్ష్యాన్ని ధృవీకరించలేదు (verify). "క్లీన్ అప్" అనే ప్యాటర్న్‌కు ఆ కమాండ్ సరిపోతుంది కాబట్టి అది దానిని అమలు చేసింది.

లార్జ్ లాంగ్వేజ్ మోడల్స్ మరియు సిస్టమ్ అడ్మినిస్ట్రేషన్ మధ్య ఉన్న ప్రధాన వ్యత్యాసం ఇదే. నిజమైన తర్కం (reasoning) అంటే సందర్భాన్ని అర్థం చేసుకోవడం, ఊహలను ధృవీకరించడం మరియు ఎడ్జ్ కేస్‌లను (edge cases) నిర్వహించడం. ప్యాటర్న్ మ్యాచింగ్ అంటే గణాంకపరంగా సరైన సమాధానంలా కనిపించే వచనాన్ని (text) రూపొందించడం మాత్రమే. ఆ సమాధానం ఒక రికర్సివ్ డిలీట్ ఫ్లాగ్ (recursive delete flag) ఉన్న టెర్మినల్ కమాండ్ అయినప్పుడు, కేవలం గణాంక సారూప్యత సరిపోదు.

సబ్-ఏజెంట్ బ్లైండ్ స్పాట్

అనేక ఆధునిక ఏజెంట్ ఫ్రేమ్‌వర్క్‌లు సబ్-ఏజెంట్‌లకు పనులను అప్పగించే ఒక మెయిన్ ఆర్కెస్ట్రేటర్ (main orchestrator)ను ఉపయోగిస్తాయి. పేరెంట్ ఏజెంట్‌కు కఠినమైన సూచనలు ఉండవచ్చు: హోమ్ డైరెక్టరీని ఎప్పుడూ తాకవద్దు, తొలగించే ముందు ఎల్లప్పుడూ అడగండి, ఆడిట్ లాగ్‌ను నిర్వహించండి. ఆ తర్వాత అది “clean up old logs” వంటి పరిమితమైన ప్రాంప్ట్‌తో ఒక వర్కర్‌ను సృష్టిస్తుంది.

ఆ సబ్-ఏజెంట్ తరచుగా ఒక ప్రత్యేక విభాగంలో (silo) పనిచేస్తుంది. అది టూల్స్‌ను పొందుతుంది కానీ పేరెంట్ ఏజెంట్ యొక్క భద్రతా సంస్కృతిని (safety culture) కాదు. మెయిన్ ఏజెంట్‌ను జాగ్రత్తగా ఉంచే పరిమితులు (constraints), కాంటెక్స్ట్ విండో మేనేజ్‌మెంట్ సమయంలో కుదించబడతాయి, సారాంశం చేయబడతాయి లేదా పూర్తిగా తొలగించబడతాయి. సబ్-ఏజెంట్‌కు ఒక పని మరియు టూల్‌కిట్ అందుతాయి, కానీ గార్డ్‌రైల్స్‌ను (guardrails) ఏర్పాటు చేసిన గంటల కొద్దీ జాగ్రత్తగా చేసిన ప్రాంప్టింగ్ దానికి అందదు.

దీని ఫలితం ఒక రకమైన సంస్థాగత మరుపు (organizational amnesia). పేరెంట్ ఏజెంట్ యొక్క సిస్టమ్ ప్రాంప్ట్‌లో ఉన్న భద్రతా నియమం, సబ్-ఏజెంట్‌కు లేనట్లే అవుతుంది. ఇది చాలా ప్రమాదకరమైనది, ఎందుకంటే సబ్-ఏజెంట్‌లకు సాధారణంగా పునరావృతమయ్యే, తక్కువ ప్రాధాన్యత కలిగిన పనులను అప్పగిస్తారు, వీటిని ఆపరేటర్లు నిశితంగా పర్యవేక్షించడం మానేస్తారు. లాగ్ క్లీనప్ జాబ్ ప్రొడక్షన్ డేటాబేస్‌ను డిలీట్ చేసే వరకు ఎవరూ దానిని గమనించరు.

నిర్ణయాత్మకతలోని ప్రమాదం

AI ఏజెంట్లలో గరిష్ట స్వయంప్రతిపత్తి (maximum autonomy) వైపు ఒక డిజైన్ ట్రెండ్ కనిపిస్తోంది. ఈ దృక్పథంలో, ఒక ఆదర్శవంతమైన ఏజెంట్ చిన్న చిన్న ప్రశ్నలతో వినియోగదారుని ఎప్పుడూ ఇబ్బంది పెట్టదు. అది నిర్ణయాత్మకంగా వ్యవహరిస్తుంది, టూల్ కాల్స్‌ను ఒకదానితో ఒకటి అనుసంధానిస్తుంది మరియు ఎక్కడా ఆగకుండా బహుళ దశల వర్క్‌ఫ్లోలను పూర్తి చేస్తుంది.

ఆ నిర్ణయాత్మకతయే ఈ వ్యవస్థలను అసురక్షితంగా మారుస్తుంది. “act decisively” అని ప్రోగ్రామ్ చేయబడిన మోడల్ తన పనిని మళ్ళీ సరిచూసుకోదు. ఒక కమాండ్ వినాశకరంగా అనిపించినప్పుడు అది ఆగదు. అది సంకోచాన్ని ఒక ఫీచర్‌గా కాకుండా బగ్‌గా (bug) పరిగణిస్తుంది. మోడల్ సరిగ్గా పనిచేసినప్పుడు, ఇది అద్భుతంగా అనిపిస్తుంది. కానీ అది తప్పు చేసినప్పుడు, అది ఆగకుండా వినాశనం చేస్తుంది. ఒక తప్పుడు కమాండ్‌ను నెమ్మదింపజేయడానికి వ్యవస్థలో ఎటువంటి సహజమైన అడ్డంకి (natural friction) ఉండదు.

Shumer యొక్క ఏజెంట్ వందల సార్లు సరిగ్గా పనిచేసింది. ఆ ట్రాక్ రికార్డ్ తప్పుడు భద్రతా భావాన్ని కలిగించింది. కానీ వంద ప్రయత్నాల వరకు నమ్మకశీలత ఉన్నప్పటికీ, వంద ఒకటవ ప్రయత్నం ఒక గణాంక వైవిధ్యం (statistical outlier) గా మారి నమూనా దెబ్బతింటే, ఆ నమ్మకానికి అర్థం ఉండదు. సిస్టమ్స్ సేఫ్టీలో, వైఫల్యం క్రమంగా మరియు స్పష్టంగా కనిపిస్తేనే గత పనితీరు ప్రాముఖ్యత కలిగి ఉంటుంది. AI ఏజెంట్ వైఫల్యాలు అకస్మాత్తుగా, నిశ్శబ్దంగా మరియు పూర్తిగా జరుగుతాయి. “ఇది వందల సార్లు పనిచేసింది” అనేది భద్రతా రికార్డు కాదు. అది చివరికి ముగిసిపోయే అదృష్టానికి సంబంధించిన వివరణ మాత్రమే.

నిజమైన రక్షణను ఎలా నిర్మించాలి

ఒకవేళ మోడల్ భద్రతా పొర (safety layer) కాకపోతే