HarnessDev: LLMs પોતાનું ઇન્ફ્રાસ્ટ્રક્ચર જાતે બનાવી રહ્યા છે

ByteDance અને યુનિવર્સિટીઓના એક જૂથે HarnessDev લોન્ચ કર્યું છે, જે એક એવું ફ્રેમવર્ક છે જે લાર્જ લેંગ્વેજ મોડલ્સ (LLMs) ને તેમના પોતાના "એજન્ટ ઓપરેટિંગ સિસ્ટમ્સ" લખવાની મંજૂરી આપે છે, જેને Agent Harnesses કહેવામાં આવે છે. ટીમ LLM ને એક નાનું સ્ટાર્ટર કિટ આપે છે અને બાકીનું કામ તે જાતે જ પૂર્ણ કરવા દે છે, જે દર્શાવે છે કે કેવી રીતે AI માનવીય હસ્તક્ષેપ વગર (દરેક લાઇન જાતે ટાઇપ કર્યા વગર) તેના પોતાના ટૂલ-યુઝ લૂપ્સ, વેરિફિકેશન સ્ટેપ્સ અને એરર હેન્ડલિંગ ચલાવતું કંટ્રોલ લેયર બનાવી શકે છે.

સ્વ-નિર્મિત હાર્નેસ શા માટે મહત્વનું છે

AI એજન્ટ્સ સિંગલ-પ્રોમ્પ્ટ આસિસ્ટન્ટ્સમાંથી મલ્ટી-સ્ટેપ વર્કર્સમાં વિકસિત થયા છે જે APIs કોલ કરે છે, ડેટાબેઝ ક્વેરી કરે છે અને પરિણામોને એકસાથે જોડે છે. અત્યાર સુધી, ડેવલપર્સ ઓર્કેસ્ટ્રેશન કોડ જાતે તૈયાર કરતા હતા જે મોડલને જણાવે છે કે ક્યારે સર્ચ ટૂલનો ઉપયોગ કરવો, ઇન્ટરમીડિયેટ સ્ટેટ કેવી રીતે સ્ટોર કરવું અને અંતિમ જવાબ કેવી રીતે વેરિફાય કરવો. HarnessDev આ મોડેલને બદલી નાખે છે: એક seed harness માત્ર પૂરતું સ્કેફોલ્ડિંગ પૂરું પાડે છે—જેમ કે લૂપિંગ, ટૂલ્સ પસંદ કરવા અને સ્ટેટ ટ્રેક કરવા માટેના મૂળભૂત ફંક્શન્સ—અને LLM તેને સંપૂર્ણ ફીચર ધરાવતા રનટાઇમમાં વિસ્તૃત કરે છે.

પેપરના બેન્ચમાર્ક મુજબ, મોડેલે 18 અલગ-અલગ હાર્નેસ બનાવ્યા, જે મૂળ સીડમાં 17,000 થી વધુ લાઇનનો કોડ ઉમેરે છે. દરેક હાર્નેસ કાર્યના સંપૂર્ણ જીવનચક્રનું સંચાલન કરે છે: લૂપ્સ ચલાવવી, યોગ્ય ટૂલ પસંદ કરવું, સંદર્ભ (context) જાળવવો, સ્ટેટ ટ્રેક કરવો, પરિણામો વેરિફાય કરવા અને ભૂલોમાંથી રિકવર થવું.

અભ્યાસમાં બહાર આવેલા છુપા ખર્ચાઓ

આ આંકડા પ્રભાવશાળી લાગે છે, પરંતુ લેખકો ચેતવણી આપે છે કે માત્ર અમલીકરણ (raw implementation) એટલે વ્યવહારુ ઉપયોગ નહીં.

  • બિનઉપયોગી ઘટકો – જનરેટ થયેલા કોડનો મોટો હિસ્સો વાસ્તવિક કાર્ય દરમિયાન ક્યારેય ચાલ્યો જ નહીં. LLM એ એવા ફંક્શન્સ લખ્યા જે એજન્ટ દ્વારા ક્યારેય કોલ કરવામાં આવ્યા નહોતા, જેનાથી કોઈ મૂલ્ય ઉમેરાયા વગર કોડબેઝ વધ્યો.
  • મોડલ લોક-ઇન – હાર્નેસ એવા ચોક્કસ LLM માટે ટ્યુન થયેલા હોય તેવું જણાયું જેણે તેને બનાવ્યું હતું. જ્યારે સમાન હાર્નેસ બીજા મોડલને આપવામાં આવ્યો, ત્યારે તેની કામગીરીમાં નોંધપાત્ર ઘટાડો થયો, જે સૂચવે છે કે ઓટો-જનરેટેડ કંટ્રોલ લોજિકમાં મોડલ-વિશિષ્ટ લાક્ષણિકતાઓ સમાવિષ્ટ હોય છે.
  • વેરિફિકેશનમાં ખામીઓ – એક ટેસ્ટ હાર્નેસે 99% સફળતાનો દર (100 માંથી 99 રન) નોંધાવ્યો હતો પરંતુ તે માત્ર 48% વખત જ સાચો હતો. મજબૂત વેરિફિકેશન વિના, એજન્ટ આત્મવિશ્વાસ સાથે ખોટા જવાબો આપી શકે છે.
  • ટોકન ઓવરહેડ – ટોકનનો વપરાશ—જે કમ્પ્યુટ ખર્ચનું પ્રમાણ છે—તેમાં મોટો તફાવત જોવા મળ્યો. સમાન પરિણામ મેળવવા માટે એક હાર્નેસને બીજા કરતા સાત ગણા વધુ ટોકનની જરૂર પડી, જે પ્રોડક્શન સેટિંગ્સમાં સ્કેલેબિલિટી અંગે ચિંતા ઊભી કરે છે.

આ તારણો દર્શાવે છે કે ભલે કોડ LLM દ્વારા જનરેટ થયો હોય, તેમ છતાં શિસ્તબદ્ધ ડિઝાઇનની જરૂર છે.

ડેવલપર્સે કઈ બાબતો ધ્યાનમાં રાખવી જોઈએ

  1. હાર્નેસ ડિઝાઇનને આર્કિટેક્ચર તરીકે ગણો – મોડલ "બસ કામ કરી દેશે" તેના પર આધાર રાખશો નહીં. LLM ને તે ભરવા દેતા પહેલા લૂપ કંટ્રોલ, ટૂલ સિલેક્શન, સ્ટેટ હેન્ડલિંગ અને વેરિફિકેશન માટે સ્પષ્ટ મોડ્યુલ્સ વ્યાખ્યાયિત કરો.
  2. મજબૂત વેરિફિકેશન બનાવો – એજન્ટના દાવાને ગ્રાઉન્ડ ટ્રુથ અથવા સેકન્ડરી મોડલ સાથે સરખાવતા સ્પષ્ટ ચેક્સ ઉમેરો. 99% સ્વ-અહેવાલ સફળતા દર હોવા છતાં અભ્યાસની 48% ચોકસાઈ દર્શાવે છે કે વેરિફિકેશન એ માત્ર વિચારવા જેવી બાબત નથી.
  3. ટોકન બજેટ પર ધ્યાન આપો – વધુ જટિલ હાર્નેસ ટોકનની સંખ્યામાં મોટો વધારો કરી શકે છે. છુપા ખર્ચના વિસ્ફોટને ટાળવા માટે શરૂઆતમાં જ વિવિધ હાર્નેસ વેરિઅન્ટ્સનું પ્રોફાઇલિંગ કરો.
  4. વિવિધ મોડલ્સ પર ટેસ્ટ કરો – સમાન હાર્નેસને મલ્ટીપલ LLM બેક-એન્ડ્સ સાથે ચલાવો. જો કામગીરીમાં મોટો ઘટાડો થાય છે, તો તમારે વધુ મોડલ-એગ્નોસ્ટિક ડિઝાઇન અથવા દરેક મોડલ માટે અલગ હાર્નેસની જરૂર પડી શકે છે.

નિષ્કર્ષ: HarnessDev સાબિત કરે છે કે LLMs તેમના પોતાના ઓપરેટિંગ-સિસ્ટમ જેવા કંટ્રોલ કોડ તૈયાર કરી શકે છે.