એક અર્ધ-સ્વાયત્ત (semi-autonomous), ચાર-એજન્ટ પાઇપલાઇન એક્સપ્લોરેટરી ડેટા એનાલિસિસ (EDA) માં થતા hallucinations ઘટાડી શકે છે, કારણ કે તે લાર્જ લેંગ્વેજ મોડલ્સ (LLMs) ને સંખ્યાકીય ગણતરીઓથી દૂર રાખીને માત્ર નિર્ણય લેવાની પ્રક્રિયા સુધી મર્યાદિત રાખે છે. આ ડિઝાઇન મોડલને શું તપાસવું તે નક્કી કરવા દે છે, જ્યારે સેન્ડબોક્સમાં ચાલતો સાદો કોડ વાસ્તવિક ગણતરીઓ કરે છે, જેનાથી સ્ટેપ-બાય-સ્ટેપ ચકાસી શકાય તેવા પરિણામો મળે છે.

શા માટે એક સિંગલ LLM કોલ જોખમી છે

LLM ને “આ સ્પ્રેડશીટ જુઓ અને મને જણાવો કે શું રસપ્રદ છે” એવું પ્રોમ્પ્ટ આપવાથી ટેક્સ્ટનો એક જ બ્લોક મળે છે. મોડલ સંખ્યાઓ જાતે બનાવે છે, તર્કને આઉટપુટ સાથે મિક્સ કરી દે છે, અને તારણ કેવી રીતે આવ્યું તેનો કોઈ પુરાવો આપતું નથી. જ્યારે તે hallucinate કરે છે—જેમ કે કોઈ બનાવટી આંકડો અથવા ખોટો સંબંધ (spurious correlation) દર્શાવે છે—ત્યારે વપરાશકર્તા સુધી પહોંચતા પહેલા ભૂલ પકડવા માટે કોઈ ચેકપોઈન્ટ હોતું નથી.

અર્ધ-સ્વાયત્ત પાઇપલાઇન પાછળનો વિચાર

આ નવું વર્કફ્લો EDA ને ચાર નિશ્ચિત તબક્કાઓમાં વિભાજિત કરે છે, જેમાંથી દરેકને તેનો પોતાનો એજન્ટ સંભાળે છે. એજન્ટો “plan-then-act” પેટર્ન અનુસરે છે: તેઓ પહેલા નક્કી કરે છે કે કઈ પ્રક્રિયાની જરૂર છે, અને પછી તે પ્રક્રિયા સેન્ડબોક્સ કોડને સોંપે છે જે વાસ્તવિક રીતે તેને ચલાવે છે. LLM ક્યારેય અંકગણિત કે ફાઇલ મેનીપ્યુલેશન કરતું નથી; તે માત્ર સુસંગતતા વિશે નિર્ણય લે છે.

ચાર એજન્ટો

  1. Data-cleaning agent – કોલમ પ્રકારોની તપાસ કરે છે, ખૂટતી કિંમતો (missing values) ને ફ્લેગ કરે છે, અને imputation અથવા ટાઇપ કન્વર્ઝન વ્યૂહરચનાઓ નક્કી કરે છે.
  2. Column-analysis agent – ડેટા પ્રકાર અને વિતરણના આધારે દરેક વેરિએબલ માટે યોગ્ય વિઝ્યુલાઇઝેશન (histograms, box plots, વગેરે) પસંદ કરે છે.
  3. Relationship-analysis agent – કોલમના દરેક જોડાણનું મૂલ્યાંકન કરે છે, કયા જોડાણો માટે ઊંડાણપૂર્વક સ્ટેટિસ્ટિકલ ટેસ્ટની જરૂર છે તે પસંદ કરે છે, અને સંભવિત ઇનસાઇટ્સ મુજબ તેને ક્રમબદ્ધ કરે છે.
  4. Report-writing agent – જનરેટ થયેલા ચાર્ટ્સ અને ગણતરી કરેલા આંકડાઓને કુદરતી ભાષામાં સમજૂતીમાં રૂપાંતરિત કરે છે, જેમાં નોંધપાત્ર પેટર્ન અને સાવચેતીઓ (caveats) પર પ્રકાશ પાડે છે.

દરેક તબક્કો સ્વતંત્ર રીતે ચાલે છે, તેથી column-analysis અને relationship-analysis એજન્ટો સમાંતર (parallel) રીતે કામ કરી શકે છે, જેનાથી સમગ્ર વર્કફ્લોનો સમય બચે છે.

સ્વાયત્તતા કેવી રીતે મર્યાદિત કરવામાં આવે છે

પાઇપલાઇનનો સુરક્ષા નિયમ સરળ છે: મોડલ દ્વારા લખવામાં આવેલો કોઈપણ કોડ સેન્ડબોક્સની અંદર ચાલે છે જે તેને હોસ્ટ સિસ્ટમથી અલગ રાખે છે. જો એક્ઝિક્યુશન નિષ્ફળ જાય, તો ભૂલ મોડલને પાછી મોકલવામાં આવે છે, જેને પાઇપલાઇન અટકાવતા પહેલા સ્ક્રિપ્ટ સુધારવા માટે બે પ્રયાસો મળે છે. આનાથી અનિયંત્રિત લૂપ્સ અટકે છે અને ખાતરી થાય છે કે મોડલ ક્યારેય સીધી રીતે ફાઇલો સાથે છેડછાડ કરતું નથી અથવા અંકગણિત કરતું નથી.

કારણ કે મોડલની ભૂમિકા માત્ર શું ગણતરી કરવી તે નક્કી કરવા પૂરતી મર્યાદિત છે, તેથી વાસ્તવિક આંકડા હંમેશા ડિટરમિનિસ્ટિક (deterministic) કોડમાંથી આવે છે. જો relationship-analysis એજન્ટ “Order ID” અને “Month” વચ્ચે કોઈ સંબંધ હોવાની શંકા કરે છે, તો સેન્ડબોક્સ કોરિલેશન ફંક્શન ચલાવે છે, ચોક્કસ મૂલ્ય પરત કરે છે, અને ત્યાર પછી જ મોડલ ટિપ્પણી કરે છે કે તે કોરિલેશન કારણભૂત (causal) હોવાની શક્યતા છે કે માત્ર સંયોગ (coincidental).

આ શું ઉકેલે છે – અને તેની કિંમત શું છે

ઘટેલા hallucinations. તર્કને ગણતરીથી અલગ કરીને, પાઇપલાઇન બનાવટી આંકડાઓના સૌથી સામાન્ય સ્ત્રોતને દૂર કરે છે: મોડલ દ્વારા સંખ્યાઓનું અનુમાન લગાવવાને બદલે કોડ દ્વારા તેને જનરેટ કરવા દેવું.

મોડ્યુલારિટી (Modularity). નવો તબક્કો ઉમેરવો—ધારો કે, ટાઈમ-સીરીઝ ફોરકાસ્ટિંગ એજન્ટ—તેના માટે આખો પ્રોમ્પ્ટ ફરીથી લખવાની જરૂર નથી. દરેક એજન્ટ એક સ્વતંત્ર મોડ્યુલ છે જે નિશ્ચિત ક્રમમાં જોડાઈ શકે છે.

ઝડપમાં વધારો. સ્વતંત્ર એજન્ટોના સમાંતર અમલીકરણથી સમયમાં ઘટાડો થાય છે, જે મોનોલિથિક LLM કોલની સરખામણીમાં વધુ ઝડપી છે જેમાં દરેક સ્ટેપને ક્રમબદ્ધ (serialize) કરવું પડે છે.

જટિલતાનો વધારો (Complexity overhead). આનો બદલામાં વધુ વિસ્તૃત આર્કિટેક્ચરની જરૂર પડે છે. ટીમોએ સેન્ડબોક્સ એન્વાયરમેન્ટ જાળવવું પડે છે, એરર-રિટર્ન લૂપ્સ હેન્ડલ કરવા પડે છે અને અનેક એજન્ટોનું સંચાલન (orchestrate) કરવું પડે છે.

આગળ શું જોવું

  • ટૂલિંગ ઇન્ટિગ્રેશન. ઓપન-સોર્સ ફ્રેમવર્ક જે સેન્ડબોક્સ-એક્ઝિક્યુશન સ્ટેપને સરળ બનાવે છે તે એન્જિનિયરિંગના બોજને ઘટાડી શકે છે અને આ પેટર્નને વધુ સુલભ બનાવી શકે છે.
  • સ્ટાન્ડર્ડાઇઝ્ડ એજન્ટ કોન્ટ્રાક્ટ્સ. જેમ જેમ વધુ ટીમો મલ્ટી-એજન્ટ પાઇપલાઇન્સ અપનાવશે, તેમ તેમ “plan-then-act” એજન્ટો માટે સામાન્ય ઇન્ટરફેસ ઉભરી શકે છે, જે ઇન્ટરઓપરેબિલિટી (interoperability) ને સરળ બનાવશે.

મુખ્ય પાઠ સ્પષ્ટ છે: LLM ને વિચારવાની સ્વતંત્રતા આપો, ગણતરી કરવાની શક્તિ નહીં. તેની સ્વાયત્તતાને માત્ર નિર્ણય લેવા પૂરતી મર્યાદિત રાખીને અને દરેક સંખ્યાને અલગ કોડ દ્વારા મોકલીને, એક અર્ધ-સ્વાયત્ત EDA પાઇપલાઇન એવા પરિણામો આપે છે જેને તમે કાલ્પનિક આંકડાઓની બીક વગર ચકાસી, વિશ્વાસ કરી અને શેર કરી શકો છો.

Source: https://dev.to/sraveend/agentic-but-only-semi-autonomous-designing-an-eda-pipeline-you-can-trust-4ha9
Community discussion: https://t.me/GyaanSetuAi