મેં મારા પરિવારના નાણાકીય વ્યવહારોનો એક્સેસ એક AI એજન્ટને આપ્યો અને તેને MCP સર્વર દ્વારા મારી સાથે વાત કરવા દીધી. મિનિટોની અંદર તે જવાબ આપી શકતું હતું કે “ગયા મહિને આપણે કરિયાણા પાછળ કેટલો ખર્ચ કર્યો હતો?” અને બચત ખાતામાં પૈસા પણ મોકલી શકતું હતું. આ જ ઇન્ટરફેસે તેને એક જ કમાન્ડથી આખા વર્ષનો વ્યવહાર ઇતિહાસ (transaction history) ભૂંસી નાખવાની પણ મંજૂરી આપી. એજન્ટ દ્વારા કૉલ કરી શકાય તેવા ટૂલ્સમાં રહેલા એક હાર્ડ-કોડેડ સેફ્ટી ચેકે તેને ડિલીટ થતું અટકાવ્યું—કોઈ ચતુર સિસ્ટમ પ્રોમ્પ્ટ દ્વારા નહીં.
આ સમસ્યા શા માટે મહત્વની છે
બાહ્ય સેવાઓનો ઉપયોગ કરતા AI એજન્ટ્સ હવે રિસર્ચ ડેમોમાંથી રોજિંદા સહાયકો (assistants) તરફ આગળ વધી રહ્યા છે. બેંક-SMS એલર્ટ વાંચતા, રકમનું વિશ્લેષણ કરતા અને તેને પર્સનલ ફાઇનાન્સ એપમાં રેકોર્ડ કરતા બજેટિંગ બોટ આજે અસ્તિત્વ ધરાવે છે. આ જ પેટર્ન કસ્ટમર-સપોર્ટ ચેટબોટ્સ, કોડ-જનરેશન હેલ્પર્સ અને સપ્લાય-ચેન પ્લાનર્સને પણ સજ્જ કરે છે. એકવાર એજન્ટ mutating (ફેરફાર કરનારા) અથવા destructive (વિનાશક) કમાન્ડ આપી શકે—જેમ કે ફાઇલ ડિલીટ કરવી, ડેટાબેઝ ટેબલ ડ્રોપ કરવું અથવા ફંડ ફરીથી ફાળવવું—ત્યારે જોખમ વધી જાય છે. એક ખોટી રીતે સમજાયેલી વિનંતી, મોડેલ-ડ્રિફ્ટની ઘટના અથવા દૂષિત (malicious) પ્રોમ્પ્ટ કાયમી નુકસાન પહોંચાડી શકે છે. 2025 માં, એક AI કોડિંગ આસિસ્ટન્ટે, તેને ક્યારેય વિનાશક કામગીરી ન કરવા માટે કહેવા છતાં, પ્રોડક્શન ડેટાબેઝ ડિલીટ કરી નાખ્યો, જેના કારણે કંપનીને અઠવાડિયા સુધી કામ અટકવું પડ્યું.
જોખમ વાસ્તવિક છે. વપરાશકર્તાઓ સંવેદનશીલ ડેટા અને મહત્વપૂર્ણ વર્કફ્લો માટે AI એજન્ટ્સ પર વિશ્વાસ મૂકે છે. જ્યારે તે વિશ્વાસ તૂટે છે, ત્યારે તેનો સ્વીકાર અટકી જાય છે, નિયમનકારો હસ્તક્ષેપ કરી શકે છે, અને નાણાકીય અસર ગંભીર હોઈ શકે છે. મુખ્ય પ્રશ્ન એ છે કે: આપણે કેવી રીતે ખાતરી કરી શકીએ કે એજન્ટ ક્યારેય વાસ્તવિક માનવ નિર્ણય વિના ક્યારેય અપરિવર્તનીય (irreversible) ક્રિયા ન કરે?
પ્રોમ્પ્ટ એન્જિનિયરિંગ એ સુરક્ષાનો ખોટો ભરોસો છે
ડેવલપર્સ ઘણીવાર સિસ્ટમ પ્રોમ્પ્ટને વધુ કડક બનાવે છે, જેમાં “પૂછ્યા વગર ક્યારેય ડેટા ડિલીટ કરશો નહીં” અથવા “બેલેન્સ બદલતા પહેલા હંમેશા કન્ફર્મ કરો” જેવા નિયમો ઉમેરે છે. પ્રોમ્પ્ટ એન્જિનિયરિંગ મોડેલના વર્તનને સૂચનોના સમૂહ તરીકે જુએ છે જે મોડેલ અનુસરે અથવા ન અનુસરે. વ્યવહારમાં, મોડેલ્સ શબ્દોનું પાલન કરે છે જ્યાં સુધી ટેમ્પરેચર સેટિંગ્સ, ટોકન લિમિટ અથવા સંદર્ભમાં સૂક્ષ્મ ફેરફાર તેમને નિયમ સ્કીપ કરવા માટે મજબૂર ન કરે. 2025 ની ડેટાબેઝ ડિલીશન ઘટનાએ સાબિત કર્યું કે જ્યારે મોડેલનું આંતરિક તર્ક અલગ પડે છે, ત્યારે સ્પષ્ટ સૂચના પણ અવગણી શકાય છે.
ગદ્ય-સ્તરના (Prose-level) નિયંત્રણો જાળવણીના પ્રશ્નો પણ ઊભા કરે છે. દરેક નવું ટૂલ, વર્ઝન અપડેટ અથવા લેંગ્વેજ-મોડેલ ફેરફાર પ્રોમ્પ્ટ ટેક્સ્ટના નવા ઓડિટને ફરજિયાત બનાવે છે. માનવ સમીક્ષકોએ કુદરતી ભાષાના લાંબા બ્લોક્સ વાંચવા પડે છે, તેનો અર્થ કાઢવો પડે છે અને આશા રાખવી પડે છે કે મોડેલ તેનું સન્માન કરશે. પરિણામ એક નાજુક સુરક્ષા જાળ છે જે વાસ્તવિક દુનિયાના ઉપયોગમાં તૂટી જાય છે.
સુરક્ષાને પ્રોમ્પ્ટમાંથી ટૂલ (tool) માં ખસેડવી
વધારે વિશ્વસનીય અભિગમ એ છે કે જ્યાં AI કાર્ય કરે છે—એટલે કે ટૂલ પોતે—ત્યાં સુરક્ષા લાગુ કરવી. મારા પ્રયોગમાં મેં Lester નામનો એક બજેટિંગ એજન્ટ બનાવ્યો. વર્કફ્લો આવો હતો:
- એક ફોન એપ ઇનબાઉન્ડ બેંક SMS મેસેજ કેપ્ચર કરે છે.
- એક લાઇટવેઇટ, લોકલી હોસ્ટેડ લેંગ્વેજ મોડેલ વ્યવહારની રકમ અને મર્ચન્ટનું નામ કાઢે છે.
- Lester એક API કોલ દ્વારા બજેટિંગ એપમાં રેકોર્ડ
