એક AI-સંચાલિત આસિસ્ટન્ટે સાત દિવસ સુધી મારી ઓન-કોલ (on-call) ફરજો સંભાળી, 11 એલર્ટ્સનું પ્રોસેસિંગ કર્યું અને સમસ્યા સુધારવા માટેનો મારો સરેરાશ સમય 45 મિનિટથી ઘટાડીને 20 મિનિટ કરી દીધો. આ પ્રયોગ મહત્વપૂર્ણ છે કારણ કે મર્યાદિત વ્યાપ્તિ ધરાવતું લેંગ્વેજ મોડલ કડક માનવીય દેખરેખ સાથે ઇન્સિડન્ટ રિસ્પોન્સ (incident response) માંથી અડધો કલાક ઘટાડી શકે છે.

મેં AI ને ઓન-કોલ પર કેમ રાખ્યો

ક્લાઉડ ટીમો તેમનો મોટાભાગનો શિફ્ટ લોગ્સ (logs) તપાસવામાં, તાજેતરના ડિપ્લોયમેન્ટ્સ (deployments) ચકાસવામાં અને સ્કેલિંગ રિક્વેસ્ટ સુરક્ષિત છે કે નહીં તેની ખાતરી કરવામાં વિતાવે છે. તે "બોરિંગ" કાર્યો પુનરાવર્તિત, ડેટા-ભારે અને માનવીય થાકને કારણે ભૂલભરેલા હોય છે. લાર્જ લેંગ્વેજ મોડલ્સમાં તાજેતરની પ્રગતિએ બરાબર આ જ પેટર્ન-મેચિંગ કામને ઓટોમેટ કરવાનું વચન આપ્યું છે, પરંતુ મોટાભાગના પબ્લિક ડેમો સેન્ડબોક્સ (sandbox) વાતાવરણમાં ચાલે છે. હું જોવા માંગતો હતો કે શું આ હાઇપ (hype) ખરેખર પેઇડ કસ્ટમર્સને સેવા આપતા પ્રોડક્શન-ગ્રેડ ક્લસ્ટરમાં ટકી શકે છે કે નહીં.

ટેસ્ટ સેટઅપ

  • એક્સેસ (Access) – એજન્ટ દરેક મેટ્રિક, લોગ અને ડિપ્લોયમેન્ટ ડેફિનેશન વાંચી શકતો હતો. તે ફક્ત એક મર્યાદિત વ્હાઇટલિસ્ટ (whitelist) માં જ લખી શકતો હતો: પોડ (pod) રિસ્ટાર્ટ કરવો, રેપ્લિકા કાઉન્ટ વધારવો અથવા ડિપ્લોયમેન્ટ સ્કેલ કરવું. આનાથી પરના કોઈપણ કાર્યો માટે મારી સ્પષ્ટ મંજૂરી જરૂરી હતી.
  • ભૂમિકા (Role) – મેં મોડલને તેની પ્રથમ ઓન-કોલ શિફ્ટ પરના જુનિયર એન્જિનિયર તરીકે ગણ્યું. તેને એલર્ટ મળતું, તે તેનું વિશ્લેષણ કરતું અને ઇન્સિડન્ટ ચેનલમાં ભલામણ પોસ્ટ કરતું.
  • સેફ્ટી નેટ્સ (Safety nets) – તમામ રાઈટ એક્શન્સ (write actions) મેન્યુઅલ "હા/ના" પ્રોમ્પ્ટ દ્વારા નિયંત્રિત હતા. મેં ખર્ચને અનુમાનિત રાખવા માટે મોડલના ટોકન વપરાશ પર પણ મર્યાદા મૂકી હતી.

જ્યાં AI સફળ રહ્યું

એજન્ટની ઝડપ એ સૌથી નોંધપાત્ર ફાયદો હતો. જેવું એલર્ટ આવ્યું, તેણે સંબંધિત લોગ્સ મેળવ્યા, તાજેતરના મેટ્રિક્સ પ્લોટ કર્યા અને છેલ્લા ત્રણ ડિપ્લોયમેન્ટ્સની યાદી બનાવી. જ્યારે મેં મારું લેપટોપ ખોલ્યું, ત્યાં સુધીમાં પ્રાથમિક તપાસ પહેલેથી જ થઈ ગઈ હતી. 11 એલર્ટ્સમાંથી:

  • 8 રૂટિન સમસ્યાઓ હતી (મેમરી સ્પાઇક્સ, કન્ટેનર રિસ્ટાર્ટ્સ, સાદી મિસકોન્ફિગરેશન). AI એ દરેક વખતે સાચું મૂળ કારણ (root cause) ઓળખ્યું.
  • તેણે સમસ્યા વ્યાપક બનીને રાત્રે 2 વાગ્યે આઉટેજ (outage) માં ફેરવાઈ જાય તે પહેલાં જ માઇક્રોસર્વિસમાં મેમરીમાં ધીમો વધારો નોંધ્યો, જેનાથી ટીમને વહેલી તકે પગલાં લેવાની તક મળી.
  • આખા અઠવાડિયા માટે ટોકન વપરાશ આશરે $30 રહ્યો, જે મર્યાદામાં રાખવામાં આવે ત્યારે સામાન્ય ઓન-કોલ બજેટની અંદર જ છે.

આ પરિણામો મીન ટાઇમ ટુ રિઝોલ્યુશન (MTTR) માં 45 મિનિટથી ઘટાડીને 20 મિનિટ સુધીના માપી શકાય તેવા ઘટાડામાં પરિણમે છે, જેનાથી એન્જિનિયરો ઉચ્ચ-અસરકારક કામ પર ધ્યાન કેન્દ્રિત કરવા માટે મુક્ત થાય છે.

જ્યાં તે નિષ્ફળ ગયું

આત્મવિશ્વાસ એટલે ચોકસાઈ નહીં. AI 11 માંથી 3 એલર્ટ્સ પર આત્મવિશ્વાસ સાથે ખોટું હતું:

  1. તેણે ડેટાબેઝ કનેક્ટિવિટી નિષ્ફળતા માટે તાજેતરના કોડ ડિપ્લોયમેન્ટને દોષ આપ્યો, પરંતુ તે સ્પષ્ટીકરણ ખોટું હતું.
  2. અજાણી નેટવર્કિંગ અનોમલી (anomaly) સામે આવતા, તેણે સામાન્ય ફિક્સ સૂચવ્યા જે મૂળ સમસ્યાનું નિરાકરણ લાવ્યા નહીં.
  3. લોડ સંબંધિત એલર્ટ દરમિયાન, તેણે સર્વિસને 3 થી 30 રેપ્લિકા સુધી સ્કેલ કરવાનું સૂચન કર્યું. સમસ્યા લોડની નહોતી; ખરાબ કોન્ફિગરેશનની હતી.

કારણ કે મારા ગાર્ડરેલ્સ (guardrails) માં કોઈપણ રાઈટ ઓપરેશન માટે મેન્યુઅલ મંજૂરી જરૂરી હતી, તેથી મોડલની ભૂલો નુકસાન પહોંચાડતા પહેલા જ પકડાઈ ગઈ હતી. તેમ છતાં, આ ઘટનાએ એક મુખ્ય જોખમને રેખાંકિત કર્યું: મોડલ વ્યાજબી લાગતા પણ અચોક્કસ સૂચનો આપી શકે છે, ખાસ કરીને નવી સમસ્યાઓ માટે.

ખર્ચ અને જોખમ વ્યવસ્થાપન

$30નું ટોકન બિલ દર્શાવે છે કે જો વપરાશ પર દેખરેખ રાખવામાં આવે તો પ્રોડક્શન લૂપમાં LLM ચલાવવું સસ્તું હોઈ શકે છે. જોકે, વાસ્તવિક ખર્ચ ઓપરેશનલ જોખમ છે. ડિપ્લોયમેન્ટને ખોટી રીતે સ્કેલ કરવાથી ક્લાઉડ ખર્ચ અનિયંત્રિત રીતે વધી શકે છે, અને સારા રિલીઝને રોલબેક કરવાથી ગ્રાહકનો વિશ્વાસ તૂટી શકે છે. પ્રયોગે બે સુરક્ષાત્મક પગલાંઓને મજબૂત બનાવ્યા:

  • એક્શન ગેટિંગ (Action gating) – મોડલને માત્ર સૂચન કરવા દેવું, માનવીય ક્લિક વગર ક્યારેય ઉચ્ચ-અસરકારક ફેરફારો અમલમાં મૂકવા નહીં.
  • બજેટ કેપ્સ (Budget caps) – ટોકન વપરાશ પર કડક મર્યાદાઓ સેટ કરો અને જ્યારે મોડલ મર્યાદાની નજીક પહોંચે ત્યારે ટીમને એલર્ટ કરો.

આગળ શું જોવું

ત્યાં સુધી, ટીમોએ:

  • મેન્યુઅલ ઓવરરાઈડની જરૂર પડે તેવા AI-જનરેટેડ સૂચનોના પ્રમાણને ટ્રેક કરો.
  • વિવિધ ઇન્સિડન્ટ કેટેગરીઝ (રૂટિન વિરુદ્ધ નવીન) માં MTTR પરના પ્રભાવને માપો.
  • કોઈપણ પ્રોડક્શન રાઈટ રાઈટ્સ (write rights) આપતા પહેલા સ્ટેજિંગ એન્વાયરમેન્ટમાં સિન્થેટિક એલર્ટ્સ સાથે મોડલનું પરીક્ષણ કરો.

ઓપ્સ (ops) ટીમો માટે મુખ્ય બાબતો

  • 80% બોરિંગ કામોને ઓટોમેટ કરો – લોગ એગ્રીગેશન, મેટ્રિક કોરિલેશન અને પ્રારંભિક હાયપોથેસિસ જનરેશન માટે AI નો ઉપયોગ કરો.
  • જોખમી 20% માનવીઓ માટે રાખો – મર્યાદિત થ્રેશોલ્ડથી વધુ સ્કેલિંગ, રોલબેક્સ અને ડિલીટ કરવા જેવા કાર્યો મેન્યુઅલ મંજૂરીના સ્ટેપ હેઠળ રહેવા જોઈએ.
  • મોડલને ભાગીદાર તરીકે ગણો, રિપ્લેસમેન્ટ તરીકે નહીં – સિસ્ટમ જાણતો એન્જિનિયર નવા આવનાર વ્યક્તિ કરતા AI ના આઉટપુટને ઝડપથી ચકાસી શકે છે, જે આસિસ્ટન્ટને એક ફોર્સ મલ્ટિપ્લાયર (force multiplier) માં ફેરવે છે.

એક AI એજન્ટ હજુ સુધી ક્લાઉડ ઓપરેશન એકલા હાથે ચલાવી શકતું નથી, પરંતુ ટ્રાયજ પાર્ટનર તરીકે તે પહેલેથી જ નોંધપાત્ર ઝડપ પૂરી પાડે છે. મુખ્ય બાબત એ છે કે આત્મવિશ્વાસને નિયંત્રણમાં રાખવો, કડક ગાર્ડરેલ્સ લાગુ કરવા અને મોડેલને પુનરાવર્તિત કંટાળાજનક કામો સંભાળવા દેવા, જ્યારે માનવીય કુશળતા નિર્ણાયક નિર્ણયો લેવામાં માર્ગદર્શન આપે.