Anthropic એ જાહેરાત કરી છે કે, 14 ઓગસ્ટથી, Claude Code દરેક ટૂલ કોલ માટે વપરાશકર્તાઓને “approve” પર ક્લિક કરવા માટે કહેવાનું બંધ કરશે. તેના બદલે, એક AI-સંચાલિત રિસ્ક ક્લાસિફાયર નક્કી કરશે કે કઈ ક્રિયાઓ માટે માનવીય સમીક્ષાની જરૂર છે. 1,053 ટેસ્ટર્સના અભ્યાસમાં જાણવા મળ્યું કે 97% ક્લિક્સ પ્રોમ્પ્ટ વાંચ્યા વિના કરવામાં આવી હતી, અને ક્લાસિફાયરે 89% હાનિકારક ક્રિયાઓને પકડી લીધી હતી જ્યારે માનવીઓ માત્ર 13.6% જ પકડી શક્યા હતા.
શા માટે જૂનું “click to approve” મોડેલ નિષ્ફળ ગયું
જૂની કાર્યપ્રણાલીમાં દરેક બાહ્ય ક્રિયા—જેમ કે કોડ પુશ કરવો, ફાઇલો ડિલીટ કરવી—ની પુષ્ટિ કરવા માટે માનવીએ બટન પર ક્લિક કરવું પડતું હતું. વ્યવહારમાં, વપરાશકર્તાઓ આ ડાયલોગને માત્ર એક ઔપચારિકતા તરીકે ગણતા હતા અને રિફ્લેક્સ તરીકે (reflexively) મંજૂરી આપી દેતા હતા. અભ્યાસના આંકડા સમસ્યાને ઉજાગર કરે છે: લગભગ દરેક ક્લિક એક રિફ્લેક્સ હતી, અને જે થોડી અસલી ચેતવણીઓ પર ધ્યાન આપવામાં આવ્યું હતું, તેમાં મોટાભાગની જોખમી કામગીરીઓ રહી ગઈ હતી. જ્યારે સુરક્ષાનો દરવાજો (safety gate) અદૃશ્ય થઈ જાય છે, ત્યારે સિસ્ટમની સુરક્ષા નબળી પડે છે.
નવું ક્લાસિફાયર શું કરે છે
Anthropic દ્વારા લાવવામાં આવેલ વિકલ્પ એક તાલીમબદ્ધ મોડેલ છે જે દરેક પેન્ડિંગ ક્રિયાનું મૂલ્યાંકન કરે છે અને માત્ર ત્યારે જ અવરોધ ઉભો કરે છે જ્યારે કામગીરી નીચેની ત્રણ શ્રેણીઓમાંથી એકમાં આવે છે:
- Irreversible (અફર) – એવી ક્રિયાઓ જેને પાછી ખેંચી શકાતી નથી, જેમ કે રિપોઝિટરીમાં force-push કરવું અથવા ડેટાબેઝ ટેબલ ડિલીટ કરવું.
- Destructive (વિનાશક) – મોટા પાયે ડિલીટ કરવું અથવા ફાઇલોને ઓવરરાઈટ કરવી જેનાથી કામ ભૂંસાઈ શકે છે.
- Outward-facing (બાહ્ય-મુખી) – એવા પગલાં જે કોડ અથવા સંદેશાઓને બાહ્ય સિસ્ટમો સામે ખુલ્લા પાડે છે, જેમ કે pull request ખોલવી અથવા Slack નોટિફિકેશન મોકલવું.
જો કોઈ ક્રિયા આમાંથી કોઈપણ માપદંડને પૂર્ણ ન કરતી હોય, તો મોડેલ તેને આપમેળે આગળ વધવા દે છે, જેનાથી વપરાશકર્તાઓ દ્વારા અવગણવામાં આવતા પ્રોમ્પ્ટ્સના પ્રવાહનો અંત આવે છે.
માત્ર AI-આધારિત અભિગમની મર્યાદાઓ
ક્લાસિફાયર એ કોઈ સાર્વત્રિક સુરક્ષા સાધન નથી. તેણે નુકસાનની સામાન્ય વિભાવનાઓ શીખી છે, કોઈ ચોક્કસ કોડબેઝની વિગતો નહીં. “tmp” નામનું ફોલ્ડર મોટાભાગના પ્રોજેક્ટ્સમાં નુકસાનકારક ન હોઈ શકે પરંતુ તમારા પ્રોજેક્ટમાં તે મહત્વપૂર્ણ બિલ્ડ આર્ટિફેક્ટ્સ (build artifacts) ધરાવી શકે છે; મોડેલ તેને સંભવિત રીતે સુરક્ષિત ગણશે. અભ્યાસનું પ્રદર્શન દરેક પ્રોડક્શન એન્વાયરમેન્ટમાં સમાન પરિણામોની ખાતરી આપતું નથી. એજ કેસ (Edge cases)—ખાસ કરીને જે કસ્ટમ ટૂલિંગ અથવા સંવેદનશીલ ઇન્ફ્રાસ્ટ્રક્ચર સાથે સંકળાયેલા હોય—તેમાં હજુ પણ સ્પષ્ટ પરવાનગી સેટિંગ્સ અથવા વધારાના મોનિટરિંગની જરૂર છે.
વપરાશકર્તાઓએ હવે શું કરવાની જરૂર છે
- નવા પરમિશન મોડની સમીક્ષા કરો: Pro, Max, અને Team પ્લાન્સ આપમેળે ક્લાસિફાયર અપનાવશે. જો તમે કસ્ટમ પરમિશન વર્કફ્લો પર આધાર રાખતા હોવ, તો ખાતરી કરો કે તે હજુ પણ તમારી સુરક્ષા નીતિઓ સાથે સુસંગત છે.
- ઉચ્ચ-જોખમી ક્રિયાઓને ઓળખો: તમારા CI/CD પાઇપલાઇન્સ અને ડિપ્લોયમેન્ટ સ્ક્રિપ્ટ્સને ત્રણ ટ્રિગર શ્રેણીઓ સાથે મેપ કરો. જો ડિફોલ્ટ ક્લાસિફાયર અપૂરતું હોય, તો અફર અથવા વિનાશક પગલાં લેતી સ્ક્રિપ્ટ્સમાં સ્પષ્ટ સુરક્ષા સાધનો (safeguards) ઉમેરવા માટે તેને એડજસ્ટ કરો.
- ક્લાસિફાયર એલર્ટ્સનું મોનિટરિંગ કરો: અવરોધોની આવૃત્તિ અને ચોકસાઈને ટ્રેક કરો. વહેલો પ્રતિસાદ Anthropic ને મોડેલને વધુ સચોટ બનાવવામાં મદદ કરશે અને તમને ચોક્કસ વર્કફ્લો માટે મેન્યુઅલ કન્ફર્મેશન ફરીથી સક્રિય કરવા માટે પ્રોત્સાહિત કરી શકે છે.
આગળ શું જોવું
માનવીય રિફ્લેક્સ ક્લિક્સમાંથી તાલીમબદ્ધ મોડેલ પર સ્વિચ કરવું એ ઘણા CI પાઇપલાઇન્સમાં રહેલી સુરક્ષાની ખામીને દૂર કરવાનો એક સ્પષ્ટ પ્રયાસ છે.
સ્ત્રોત: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
