ચાર સ્વાયત્ત AI એજન્ટ્સ હવે સોફ્ટવેર ગ્લીચ (glitch) શોધી શકે છે, ભૂલવાળા કોડને એડિટ કરી શકે છે અને ફિક્સની પુષ્ટિ કરી શકે છે—આ બધું જ એક મિનિટથી ઓછા સમયમાં, SigNoz હેકાથોન માટે બનાવવામાં આવેલા નવા observability-driven વર્કફ્લોને કારણે.

AgentOps નામની આ સિસ્ટમ, SigNoz માં એરર સ્પાઇક્સ (error spikes) પર નજર રાખે છે, સંબંધિત લોગ્સ અને ટ્રેસ (logs and traces) મેળવે છે, જવાબદાર ચોક્કસ ફાઇલ અને લાઇન શોધી કાઢે છે, સેન્ડબોક્સમાં સોર્સ એડિટ કરે છે, અને પછી બગ દૂર થઈ ગયો છે તે સાબિત કરવા માટે રિક્વેસ્ટ ફરીથી રન કરે છે. દરેક સંપૂર્ણ સાયકલ 30-60 સેકન્ડમાં પૂર્ણ થાય છે, અને આખી પ્રક્રિયા માનવીય પ્રોમ્પ્ટ વગર ચાલે છે.

AI એજન્ટ્સ માટે observability શા માટે મહત્વની છે

પરંપરાગત SRE પદ્ધતિ લોગ્સ, મેટ્રિક્સ અને ડિસ્ટ્રિબ્યુટેડ ટ્રેસને સર્વિસની 'આંખો' તરીકે ગણે છે. જ્યારે કોઈ રિક્વેસ્ટ નિષ્ફળ જાય છે, ત્યારે એન્જિનિયર તે ઘટક સુધી પહોંચવા માટે ટ્રેસને ફોલો કરે છે. આ જ સિદ્ધાંત હવે AgentOps ને સજ્જ કરે છે, પરંતુ અહીં જે "સર્વિસ" નું નિરીક્ષણ કરવામાં આવે છે તે પોતે AI એજન્ટ છે.

એજન્ટ દ્વારા ઉપયોગમાં લેવાતા દરેક ટૂલ—પછી તે language model call હોય, file-system edit હોય કે test runner હોય—ટ્રેસમાં એક span બનાવે છે. એક span શરૂઆતનો સમય, સમયગાળો અને સફળતાની સ્થિતિ રેકોર્ડ કરે છે, જેથી એજન્ટ જોઈ શકે કે દરેક reasoning step માં કેટલો સમય લાગ્યો અને તે સફળ રહ્યો કે નહીં. આ spans ને એકસાથે જોડીને, એજન્ટ તેની પોતાની વિચાર પ્રક્રિયાનું સંપૂર્ણ ચિત્ર બનાવે છે, જેમ કે કોઈ માણસ મેન્યુઅલી ડિબગિંગ કરતી વખતે કરે છે.

મુખ્ય પરિવર્તન "reporting layer તરીકે observability" થી બદલાઈને "perception તરીકે observability" તરફ છે. AgentOps ટ્રેસ ડેટાને ફરીથી એજન્ટ્સમાં ફીડ કરે છે, જેનાથી તેઓ રિયલ ટાઇમમાં તેમના પોતાના કાર્યો વિશે તર્ક કરી શકે છે. પરિણામે એક એવું લૂપ બને છે જ્યાં AI માત્ર એક hypothesis જ નથી બનાવતું, પરંતુ તે સમસ્યા શોધવા માટે જે telemetry નો ઉપયોગ કરે છે તેના આધારે તેને ચકાસે છે પણ છે.

ચાર-પગલાંનો વર્કફ્લો

  1. Monitor – એક લાઇટવેઇટ વોચર (watcher) નવા રિપોર્ટ થયેલા એરર્સ માટે SigNoz ને સ્કેન કરે છે.
  2. Diagnose – એજન્ટ સંબંધિત લોગ્સ અને ટ્રેસ મેળવે છે, સ્ટેક એક્સટ્રેક્ટ કરે છે, અને નિષ્ફળતા માટે જવાબદાર સોર્સ ફાઇલ અને લાઇન નંબરને અલગ કરે છે.
  3. Fix – સેન્ડબોક્સ ફાઇલ-સિસ્ટમ સર્વરનો ઉપયોગ કરીને, એજન્ટ ઓળખાયેલી લાઇન પર પેચ લખે છે. સેન્ડબોક્સ કડક પરવાનગીઓ લાગુ કરે છે અને જો એડિટ પોલિસીનું ઉલ્લંઘન કરે તો આપમેળે roll back કરે છે.
  4. Verify – એજન્ટ પેચ કરેલા કોડ સામે મૂળ રિક્વેસ્ટ ફરીથી મોકલે છે. જો ટ્રેસ ક્લીન રન બતાવે છે, તો ફિક્સ કમિટ કરવામાં આવે છે; અન્યથા એજન્ટ ફરીથી પ્રયાસ કરે છે.

તમામ પગલાં એજન્ટ્સના સમાન સેટ દ્વારા સંચાલિત (orchestrated) છે, જેમાં દરેક એક સ્વાયત્ત micro-service તરીકે કાર્ય કરે છે. આખી ચેઇન OpenTelemetry-સુસંગત spans દ્વારા જોઈ શકાય છે, જેને SigNoz ઇન્જેસ્ટ કરે છે અને વિઝ્યુલાઇઝ કરે છે.

વિશ્વસનીયતા (reliability) પરના કઠિન પાઠ

Error clarity

એક સામાન્ય "failed" સ્ટેટસ કંઈ જ જણાવતું નથી. ટીમે વિગતવાર નિષ્ફળતાના કારણો ઉમેર્યા છે—દા.ત., "wrong hypothesis" અથવા "patch broke process"—જેથી ડાઉનસ્ટ્રીમ એજન્ટ્સ નક્કી કરી શકે કે ફરીથી પ્રયાસ કરવો, પાછા જવું કે અટકવું. આ માનવ post-mortems જે રીતે મૂળ કારણોને લેબલ કરે છે તેનું પ્રતિબિંબ પાડે છે.

Data latency

Telemetry તરત જ દેખાતી નથી. એજન્ટ્સ હવે ફિક્સની ખાતરી કરતા પહેલા જરૂરી લોગ્સ આવી ગયા છે તેની ખાતરી કરવા માટે એક નાનો વિરામ અને sanity check સામેલ કરે છે. આ સુરક્ષા વિના, એજન્ટ અધૂરા ડેટા પર કામ કરી શકે છે અને false positive પરિણામ આપી શકે છે.

Security boundaries

AI ને કોડ લખવાની મંજૂરી આપવી એ privilege escalation જોખમ છે. સેન્ડબોક્સ એક સમર્પિત filesystem સર્વર પાછળ ચાલે છે જે write scope ને લક્ષ્ય રિપોઝિટરી સુધી મર્યાદિત રાખે છે અને જો ટેસ્ટ નિષ્ફળ જાય તો આપમેળે અગાઉની સ્થિતિ પુનઃસ્થાપિત કરે છે. આ containment model AI ની શક્તિને નિયંત્રણમાં રાખે છે.

Token limits

Large language models API tokensનો વપરાશ કરે છે, અને તપાસ દરમિયાન દૈનિક ક્વોટા ખતમ થઈ શકે છે. AgentOps દરેક ઇન્સિડેન્ટ દીઠ token usage ને ટ્રેક કરે છે અને થ્રેશોલ્ડ પર પહોંચતા જ વધુ calls ને મર્યાદિત (throttle) કરે છે, જેથી ક્વોટા ખતમ થઈ જાય ત્યારે નિષ્ફળ ફિક્સની સાંકળ બનતી અટકાવી શકાય.

ડેમોએ શું સાબિત કર્યું

ટીમે કોડબેઝમાં ક્યારેય ન દેખાય તેવો એક બ્રાન્ડ ન્યૂ બગ ઇન્જેક્ટ કર્યો. AgentOps એ વિસંગતતા શોધી કાઢી, તેને ચોક્કસ લાઇન સુધી ટ્રેસ કરી, સુધારાત્મક એડિટ જનરેટ કર્યું, સેન્ડબોક્સમાં પેચ લાગુ કર્યો અને રિક્વેસ્ટ સફળ થઈ છે તેની ચકાસણી કરી—આ બધું જ કોઈપણ મેન્યુઅલ કોડ ફેરફાર અથવા નવા પ્રોમ્પ્ટ વગર કરવામાં આવ્યું. એન્ડ-ટુ-એન્ડ સમય એક મિનિટથી ઓછો રહ્યો, જે અહેવાલ મુજબના 30-60 સેકન્ડના સમયગાળા સાથે સુસંગત છે.

Counter-point: autonomy એ કોઈ જાદુઈ લાકડી (silver bullet) નથી

આગળ શું જોવું

  • મોડેલ-સ્વતંત્ર ટેલિમેટ્રી – જેમ જેમ વધુ વેન્ડર્સ OpenTelemetry-સુસંગત સ્પેન્સ (spans) પ્રદાન કરશે, તેમ આ અભિગમ વેન્ડર-તટસ્થ બની શકે છે, જે વિવિધ પ્રકારના સ્ટેક્સ (heterogeneous stacks) માં તેનો સ્વીકાર સરળ બનાવશે.
  • પોલિસી-આધારિત ગાર્ડરેલ્સ – કન્ફિગરેબલ પોલિસીઓને સમાવિષ્ટ કરવા, જે એજન્ટ કઈ ફાઇલો એડિટ કરી શકે છે અથવા કમિટ (commit) પહેલા કયા ટેસ્ટ સ્યુટ્સ પાસ કરવા જોઈએ તે નક્કી કરે છે, તે ગવર્નન્સ સંબંધિત ચિંતાઓનું નિરાકરણ લાવશે.
  • ખર્ચ-જાગૃત ટોકન બજેટિંગ – ઘટનાની ગંભીરતાના આધારે ડાયનેમિક ટોકન ફાળવણી ક્વોટા ખતમ થતો અટકાવી શકે છે અને સાથે સાથે ઉચ્ચ-અસર ધરાવતા બગ્સને હેન્ડલ કરવાની ક્ષમતા પણ જાળવી રાખશે.

AgentOps દર્શાવે છે કે બગ-ફિક્સ સાયકલ 30-60 સેકન્ડ લઈ શકે છે. આ પ્રયોગ એક પ્રૂફ-ઓફ-કોન્સેપ્ટ રજૂ કરે છે કે ઓબ્ઝર્વેબિલિટીનો ઉપયોગ સ્વાયત્ત સોફ્ટવેર આસિસ્ટન્ટ્સ દ્વારા કરી શકાય છે.