મેટ શુમર તેના કમ્પ્યુટર પર બેઠા અને તેના AI એજન્ટને એક સાદું સૂચન આપ્યું: ફાઇલો સાફ કરો (clean up the files). તેમણે આ પ્રક્રિયા સેંકડો વખત કોઈપણ સમસ્યા વગર કરી હતી. આ વખતે, પાથ રિઝોલ્યુશન (path resolution) ની ભૂલને કારણે એક સામાન્ય ઘરકામ જેવું કાર્ય સંપૂર્ણ વિનાશમાં ફેરવાઈ ગયું. વર્ષોનો કોડ, દસ્તાવેજો અને ફોટા સેકન્ડોમાં ગાયબ થઈ ગયા.
આ કોઈ કાલ્પનિક જોખમ નથી. આ એક વાસ્તવિક ડેવલપર સાથે તેની વાસ્તવિક મશીન પર બન્યું હતું, અને જે એજન્ટની વાત છે તેનો ટ્રેક રેકોર્ડ નિષ્ફળ જવાની ક્ષણ સુધી એકદમ સુરક્ષિત દેખાતો હતો. AI એજન્ટો જે ફાઇલો લખી શકે છે, ટર્મિનલ કમાન્ડ્સ ચલાવી શકે છે અને સબ-એજન્ટ્સ (subagents) બનાવી શકે છે, તે હવે IDEs, ચેટ ઇન્ટરફેસ અને ઓટોમેશન પાઇપલાઇન્સમાં સમાવિષ્ટ છે. તેમને ઓપરેટિંગ સિસ્ટમ્સના સીધા એક્સેસ સાથે વિશ્વાસ કરવામાં આવે છે, અને એ જ વિશ્વાસમાં જોખમ છુપાયેલું છે. શુમરના મશીનને નષ્ટ કરનારા એ જ પ્રકારના નિષ્ફળતાના મોડ્સ (failure modes) ટૂલ એક્સેસ ધરાવતા દરેક એજન્ટમાં જોવા મળે છે. તેઓ શા માટે નિષ્ફળ જાય છે અને તેમને યોગ્ય રીતે કેવી રીતે નિયંત્રિત કરવા, તે હવે આ સાધનોનો ઉપયોગ કરનાર કોઈપણ વ્યક્તિ માટે જીવન ટકાવી રાખવા જેવી પાયાની કુશળતા છે.
જ્યારે પેટર્ન મેચિંગ ફાઇલ સિસ્ટમ સાથે મળે છે
AI એજન્ટો વિચારતા નથી. તેઓ પેટર્ન મેચ કરે છે. જ્યારે તમે “clean up files” કહો છો, ત્યારે મોડેલ તેના ટ્રેનિંગ મેમરીમાં હજારો સમાન ઇન્ટરેક્શન શોધે છે અને આંકડાકીય રીતે પેટર્નને અનુરૂપ હોય તેવો કમાન્ડ જનરેટ કરે છે. જો સૂચના બિલ્ડ ડિરેક્ટરીમાં કામચલાઉ ફાઇલો ડિલીટ કરવાની હોય, તો તે rm -rf /tmp/build-cache/* જેવો કમાન્ડ જનરેટ કરી શકે છે. તે વ્યાજબી લાગે છે કારણ કે તે મોડેલે અત્યાર સુધી જોયેલા અન્ય તમામ ક્લીનઅપ કમાન્ડ્સ જેવું જ લાગે છે.
પરંતુ જ્યારે $HOME જેવું વેરિએબલ રિઝોલ્વ કરવામાં નિષ્ફળ જાય ત્યારે શું થાય છે? એક માણસ ખાલી સ્ટ્રિંગ અથવા અણધાર્યો પાથ જુએ છે, થોભે છે અને પ્રશ્નો પૂછે છે. એક એજન્ટ જુએ છે કે પેટર્ન હજુ પણ મેચ થાય છે અને એન્ટર દબાવી દે છે. શુમરના કિસ્સામાં, જે કમાન્ડ કોઈ ચોક્કસ ફોલ્ડરને સાફ કરવાનો હતો, તેના બદલે તેણે યુઝર ડિરેક્ટરીના રૂટ (root) ને નિશાન બનાવ્યું. એજન્ટ એ વિચારવા માટે રોકાયો નહીં કે પાથ વિચિત્ર કેમ દેખાય છે. તેણે લક્ષ્યની ચકાસણી કરી નહીં. તેણે કમાન્ડ ચલાવ્યો કારણ કે તે “clean up” ની પેટર્ન સાથે મેળ ખાતો હતો.
આ લાર્જ લેંગ્વેજ મોડેલ્સ અને સિસ્ટમ એડમિનિસ્ટ્રેશન વચ્ચેની મુખ્ય વિસંગતતા છે. વાસ્તવિક તર્ક (reasoning) માં સંદર્ભ સમજવો, ધારણાઓની ચકાસણી કરવી અને એજ કેસ (edge cases) હેન્ડલ કરવાનો સમાવેશ થાય છે. પેટર્ન મેચિંગમાં એવું ટેક્સ્ટ બનાવવાનો સમાવેશ થાય છે જે આંકડાકીય રીતે સાચા જવાબ જેવું લાગે છે. જ્યારે તે જવાબ રિકર્સિવ ડિલીટ ફ્લેગ (recursive delete flag) ધરાવતો ટર્મિનલ કમાન્ડ હોય, ત્યારે માત્ર આંકડાકીય સામ્યતા પૂરતી નથી.
સબ-એજન્ટનો અંધપોઇન્ટ (The Subagent Blind Spot)
ઘણા આધુનિક એજન્ટ ફ્રેમવર્ક એક મુખ્ય ઓર્કેસ્ટ્રેટર (orchestrator) નો ઉપયોગ કરે છે જે સબ-એજન્ટ્સને કાર્યો સોંપે છે. પેરેન્ટ એજન્ટ પાસે કડક સૂચનાઓ હોઈ શકે છે: હોમ ડિરેક્ટરીને ક્યારેય અડવું નહીં, ડિલીટ કરતા પહેલા હંમેશા પૂછવું, ઓડિટ લોગ જાળવવો. પછી તે “clean up old logs” જેવા મર્યાદિત પ્રોમ્પ્ટ સાથે એક વર્કર બનાવે છે.
તે સબ-એજન્ટ ઘણીવાર અલગતામાં (silo) કામ કરે છે. તે ટૂલ્સ વારસામાં મેળવે છે પરંતુ પેરેન્ટની સેફ્ટી કલ્ચર (safety culture) નહીં. કોન્ટેક્સ્ટ વિન્ડો મેનેજમેન્ટ દરમિયાન મુખ્ય એજન્ટને સાવધ રાખતા નિયંત્રણો સંકુચિત, સારાંશિત અથવા સંપૂર્ણપણે છોડી દેવામાં આવે છે. સબ-એજન્ટને કાર્ય અને ટૂલકિટ મળે છે, પરંતુ તેને તે કલાકોના કાળજીપૂર્વક પ્રોમ્પ્ટિંગ મળતા નથી જેણે ગાર્ડરેલ્સ (guardrails) સ્થાપિત કર્યા હતા.
તેનું પરિણામ એક પ્રકારનું સંગઠનાત્મક વિસ્મરણ (organizational amnesia) છે. પેરેન્ટ એજન્ટના સિસ્ટમ પ્રોમ્પ્ટમાં રહેલો સેફ્ટી નિયમ સબ-એજન્ટ માટે અસ્તિત્વમાં જ નથી તેમ કહી શકાય. આ ખાસ કરીને જોખમી છે કારણ કે સબ-એજન્ટ્સને સામાન્ય રીતે એવા પુનરાવર્તિત, ઓછા મહત્વના કાર્યો આપવામાં આવે છે જેનું ઓપરેટર્સ નજીકથી નિરીક્ષણ કરવાનું બંધ કરી દે છે. જ્યાં સુધી લોગ ક્લીનઅપનું કામ પ્રોડક્શન ડેટાબેઝને ડિલીટ ન કરી દે, ત્યાં સુધી કોઈ તેના પર ધ્યાન આપતું નથી.
નિર્ણાયકતાનું જોખમ (The Danger of Decisiveness)
AI એજન્ટોમાં મહત્તમ સ્વાયત્તતા (autonomy) તરફ એક ડિઝાઇન ટ્રેન્ડ જોવા મળે છે. આ વિઝનમાં, આદર્શ એજન્ટ ક્યારેય ક્ષુલ્લક પ્રશ્નો સાથે યુઝરને હેરાન કરતો નથી. તે નિર્ણાયક રીતે કાર્ય કરે છે, ટૂલ કોલ્સને એકસાથે જોડે છે અને શ્વાસ લેવા માટે પણ અટક્યા વગર મલ્ટી-સ્ટેપ વર્કફ્લો પૂર્ણ કરે છે.
આ નિર્ણાયકતા જ આ સિસ્ટમોને અસુરક્ષિત બનાવે છે. “નિર્ણાયક રીતે કાર્ય કરવા” માટે પ્રોગ્રામ કરેલ મોડેલ તેના કામની ફરીથી ચકાસણી કરતું નથી. જ્યારે કોઈ કમાન્ડ વિનાશક લાગે ત્યારે તે અટકતું નથી. તે ખચકાટને ફીચરને બદલે બગ (bug) તરીકે ગણે છે. જ્યારે મોડેલ સાચું હોય છે, ત્યારે આ જાદુઈ લાગે છે. જ્યારે તે ખોટું હોય છે, ત્યારે તે અત્યંત વિનાશક લાગે છે. સિસ્ટમમાં કોઈ ખરાબ કમાન્ડને ધીમો પાડવા માટે કોઈ કુદરતી અવરોધ (friction) હોતો નથી.
Shumer ના એજન્ટે સેંકડો વખત સાચી રીતે કામ કર્યું હતું. તે રેકોર્ડથી સુરક્ષાની ખોટી ભાવના જન્મી હતી. પરંતુ જો ૧૦૧મો પ્રયાસ એવો આંકડાકીય અપવાદ (statistical outlier) હોય જ્યાં પેટર્ન તૂટી જાય, તો સો પ્રયાસોની વિશ્વસનીયતાનો કોઈ અર્થ નથી રહેતો. સિસ્ટમ્સ સેફ્ટીમાં, ભૂતકાળનું પ્રદર્શન ત્યારે જ મહત્વનું છે જો નિષ્ફળતાનું સ્વરૂપ ધીમું અને દેખીતું હોય. AI એજન્ટની નિષ્ફળતાઓ અચાનક, શાંત અને સંપૂર્ણ હોય છે. “તે સેંકડો વખત કામ કરી ગયું” એ સુરક્ષાનો રેકોર્ડ નથી. તે નસીબનું વર્ણન છે જે આખરે ખૂટી જાય છે.
વાસ્તવિક સુરક્ષા કેવી રીતે બનાવવી
જો મોડેલ સુરક્ષા સ્તર (safety layer) ન હોય તો
