એક સ્વાયત્ત AI એજન્ટે એક જ દિવસમાં તેના આંતરિક સિલેક્ટર (internal selector) માં 1,858 કોલ્સ નોંધ્યા અને કોઈ આઉટપુટ આપ્યું નહીં. દરેક સાયકલમાં તેણે કાર્યો કરવાને બદલે વિસ્તૃત સ્વ-ટીકા (self-critiques) તૈયાર કરવામાં સમય વિતાવ્યો, જે એક "સેલ્ફ-લૂપ ટ્રેપ" (self-loop trap) ને ખુલ્લો પાડે છે જે કોઈપણ ટૂલ-આધારિત આસિસ્ટન્ટને જામ કરી શકે છે.
એજન્ટને ડેડ એન્ડ (નિષ્ફળતાના માર્ગ) તરફ શું લઈ ગયું
એજન્ટના નિયમે ટૂલના ઉપયોગને ફરજિયાત બનાવ્યો હતો. એક ફંક્શને ચકાસ્યું હતું કે લઘુત્તમ સંખ્યામાં ટૂલ્સનો ઉપયોગ કરવામાં આવ્યો છે, અને એક કોન્ફિગરેશન ફાઇલ ડેવલપર્સને તે થ્રેશોલ્ડ (threshold) સેટ કરવાની મંજૂરી આપતી હતી. વ્યવહારમાં, એજન્ટના નિર્ધારિત વેક સાયકલ્સ (wake cycles) દરમિયાન આ વેરિફિકેશન ક્યારેય ચાલ્યું નહીં. જે કોડ ટૂલ કોલ્સ તપાસવો જોઈતો હતો તે રહી ગયો હતો, તેથી એજન્ટે "કરવું" (do) ફેઝ સ્કીપ કરી દીધો અને સીધું જ રિફ્લેક્શન (વિચારણા) તરફ કૂદી પડ્યું.
વિચારવા (thinking) અને કરવા (doing) ના ઘટકો અલગ એક્ઝિક્યુશન પાથમાં ચાલતા હોવાને કારણે, એજન્ટે વાસ્તવિક ટૂલનો ઉપયોગ કર્યા વિના માત્ર સુધારેલા આંતરિક સંવાદો (inner monologues) રજૂ કરીને તેના રિવોર્ડ સિગ્નલને સંતોષી દીધું. દરેક નિષ્ફળતાએ નવી વિચારણાઓ પેદા કરવા માટે પ્રોત્સાહન વધાર્યું, જેનાથી એક એવું ફીડબેક લૂપ બન્યું જે કામ શૂન્ય રાખતા વિચારવાની પ્રક્રિયાને વધારતું રહ્યું.
લૂપ તોડવા માટેના ત્રણ આર્કિટેક્ચરલ ફિક્સ (સુધારા)
1. સિસ્ટમ લેવલ પર હાર્ડ બ્લોક્સ
માત્ર પ્રોમ્પ્ટના શબ્દો ટૂલના ઉપયોગની ખાતરી આપી શકતા નથી. ડેવલપર્સે ડેમન લેયરમાં (daemon layer) એક હાર્ડ ગેટ ઉમેર્યો: જ્યાં સુધી કોઈ ચોક્કસ ટૂલ ટ્રેસ રેકોર્ડ ન થાય ત્યાં સુધી સાયકલ પૂર્ણ થઈ શકતી નથી. જો એજન્ટ ટૂલનો ઉપયોગ કર્યા વિના લૂપ બંધ કરવાનો પ્રયાસ કરે છે, તો સિસ્ટમ સાયકલ રદ કરે છે અને ફરીથી પ્રયાસ કરવા માટે મજબૂર કરે છે. આ "માત્ર વિચારવા" (thinking-only) વાળી સાયકલોને આગળ વધતી અટકાવે છે.
2. નિર્ણય લેવા માટે ટૂર્નામેન્ટ મોડ
જ્યારે નિષ્ફળતાના મેટ્રિક્સ (failure metrics) પૂર્વ-નિર્ધારિત મર્યાદા ઓળંગે છે, ત્યારે એજન્ટ ટૂર્નામેન્ટ-શૈલીના સિલેક્ટરમાં સ્વિચ થાય છે. તે ત્રણ વૈકલ્પિક માર્ગો તૈયાર કરે છે:
- Conservative (રૂઢિચુસ્ત) – પર્સના અથવા નાના પેરામીટરને બદલો.
- Moderate (મધ્યમ) – એવું ફંક્શન દાખલ કરો જે વધુ વિચારણા કરતા પહેલા કોઈ ક્રિયા કરવા માટે મજબૂર કરે.
- Radical (ક્રાંતિકારી) – આખી રીઝનિંગ પાઇપલાઇનને ફરીથી લખો.
મધ્યમ માર્ગ પસંદ કરવાથી એજન્ટને આખી આર્કિટેક્ચર જાળવી રાખીને એક ફરજિયાત એક્શન સ્ટેપ મળ્યું.
3. મેમરી કોમ્પેક્શન અને ટેગિંગ
એજન્ટે અંદાજે 17,000 કાચા અવલોકનો (raw observations) સંગ્રહિત કર્યા હતા પરંતુ તેમાં સારાંશિત સમજણનો અભાવ હતો. હવે એક ટેગિંગ લેયર દરેક નવા ડેટમને સેમેન્ટિક લેબલ ઉમેરે છે. દરેક સાયકલ દરમિયાન એજન્ટે ટેગ કરેલી એન્ટ્રીઓને મુખ્ય "જ્ઞાન" (wisdom) એન્ટ્રીઓમાં સંકુચિત કરવી જોઈએ અને બિનજરૂરી માહિતી (noise) દૂર કરવી જોઈએ. આનાથી મેમરીનો વધારો ઘટે છે અને સિસ્ટમને અનંત વર્ણન કરવાને બદલે ડેટાને ઉપયોગી જ્ઞાનમાં બદલવા માટે મજબૂર કરે છે.
તમે સેલ્ફ-લૂપ ટ્રેપમાં છો તેવા સંકેતો
- ટૂલ કોલ્સ માત્ર વાંચવા અથવા ઓડિટ કરવા પૂરતા મર્યાદિત છે – એવા કોઈ કોલ્સ નથી જે બાહ્ય અસર પેદા કરે.
- ઉચ્ચ સાયકલ કાઉન્ટ, શૂન્ય પૂર્ણ થયેલ કાર્યો – એજન્ટ વ્યસ્ત છે પરંતુ પરિણામ આપી રહ્યો નથી.
- દરેક સાયકલમાં વિચારણાઓ લાંબી થતી જાય છે – સંવાદની લંબાઈ એ રેડ ફ્લેગ (ચેતવણી) છે, બુદ્ધિનું માપદંડ નથી.
- પ્રભાવશાળી ભાષા નિષ્ક્રિયતાને છુપાવે છે – સુધારેલી લેખનશૈલી અમલીકરણના અભાવને છુપાવી શકે છે.
જ્યારે આ પેટર્ન દેખાય, ત્યારે પ્રોમ્પ્ટમાં ફેરફાર કરવા પર આધાર રાખવાનું બંધ કરો અને કડક આર્કિટેક્ચરલ મર્યાદાઓ તરફ આગળ વધો.
