AI રાઉટિંગનું પેન્ડोरा બોક્સ

DeepMind એ “Pandora’s Router” રજૂ કર્યું છે, જે એક એવું ફ્રેમવર્ક છે જે મોડેલ-પસંદગીને ખર્ચ-જાગૃત (cost-aware) પેન્ડोरा-બોક્સ સમસ્યા તરીકે જુએ છે. માત્ર તે માહિતી માટે જ ચાર્જ કરીને જે ખરેખર પરિણામોમાં સુધારો કરે છે, આ સિસ્ટમ પરિણામોને સંપૂર્ણ સર્ચ (exhaustive searches) જેટલા જ સચોટ રાખીને ઇન્ફરન્સ ખર્ચમાં મોટો ઘટાડો કરે છે.

મોડેલ-પસંદગી મફત કેમ નથી

પ્રોડક્શન પાઇપલાઇન્સમાં ઘણીવાર એવું માનવામાં આવે છે કે મોડેલ પસંદ કરવાનું સ્ટેપ મફત છે. વાસ્તવમાં, મોડેલની યોગ્યતાનું અનુમાન લગાવવા માટે કમ્પ્યુટ, મેમરી અને ક્યારેક એક્સટર્નલ ડેટા કોલ્સનો ઉપયોગ થાય છે. ઝડપી અને અસ્પષ્ટ (noisy) અનુમાન સસ્તું હોય છે પરંતુ તે ખોટા માર્ગે દોરી શકે છે; સચોટ અનુમાનનો અર્થ સામાન્ય રીતે નાનું મોડેલ ચલાવવું અથવા વધારાનું કોન્ટેક્સ્ટ મેળવવું થાય છે, જે ખર્ચમાં વધારો કરે છે.

DeepMind નો પેપર આ દ્વિધાને નવો આકાર આપે છે. દરેક ઉમેદવાર મોડેલ એક “વેલ્યુ” (value) છુપાવે છે – એટલે કે આવતી ક્વેરી પર તેનું અપેક્ષિત પ્રદર્શન. આ ફ્રેમવર્ક કંટ્રોલરને તે વેલ્યુ જોવા માટે ફી ચૂકવવાની મંજૂરી આપે છે અને જ્યારે વધુ માહિતી મેળવવાનો ખર્ચ તેનાથી મળતા ફાયદા કરતા વધી જાય, ત્યારે ફી ચૂકવવાનું બંધ કરી દે છે.

ઉકેલના બે ભાગો

  • Pandora’s Router – એક કેન્દ્રીય એન્જિન જે દરેક રિક્વેસ્ટ માટે નક્કી કરે છે કે મોડેલની વેલ્યુના વધુ સચોટ અનુમાન માટે ફી ચૂકવવી કે નહીં. તે એક “રિઝર્વ પ્રાઇસ” (reserve price) નક્કી કરે છે: એક એવી મર્યાદા (threshold) જેનાથી નીચે વધુ સારા અનુમાનથી થતો અપેક્ષિત ફાયદો ફી કરતા ઓછો હોય. જ્યારે અપેક્ષિત સુધારો રિઝર્વ પ્રાઇસ કરતા વધી જાય, ત્યારે એન્જિન તે માહિતી ખરીદે છે; અન્યથા તે તેની પાસે રહેલા શ્રેષ્ઠ અનુમાન સાથે આગળ વધે છે.

  • Pandora’s Bidder – મોડેલ માર્કેટપ્લેસ માટે એક વિકેન્દ્રિત (decentralized) ભાગીદાર. સ્વતંત્ર પ્રદાતાઓ બિડ સબમિટ કરતા પહેલા તેમની પોતાની વેલ્યુ એસ્ટિમેટને સચોટ બનાવવા માટે કમ્પ્યુટ ખર્ચવો કે નહીં તેનો નિર્ણય લે છે. તેમની પોતાની રિઝર્વ પ્રાઇસ ખાતરી કરે છે કે ખર્ચ ત્યારે જ થાય જ્યારે સુધારેલું અનુમાન જીતવાની શક્યતા હોય.

બંને ભાગો એક જ સિદ્ધાંત પર કામ કરે છે: માહિતી પર ખર્ચ ત્યારે જ કરો જ્યારે તેનાથી મળતો અપેક્ષિત ફાયદો તેના ખર્ચ કરતા વધુ હોય.

ત્રણ ક્ષેત્રોમાં પરિણામો

લેખકોએ ત્રણ પ્રકારના વર્કલોડ પર આ અભિગમનું પરીક્ષણ કર્યું:

  1. Mathematical reasoning – વિવિધ ચોકસાઈ ધરાવતા સોલ્વર્સમાંથી પસંદગી કરવી.
  2. Retrieval-augmented generation (RAG) – વિવિધ નોલેજ-બેઝ લુકઅપ વ્યૂહરચનાઓ વચ્ચે પસંદગી કરવી.
  3. Large-scale embedding models – સિમિલારિટી સર્ચ માટે શ્રેષ્ઠ એન્કોડર પસંદ કરવું.

Pandora’s Router એ દરેક કિસ્સામાં સ્ટેટિક રાઉટિંગ નિયમો અને ગ્રીડી હ્યુરિસ્ટિક્સ (greedy heuristics) ને હરાવ્યા. સૌથી મુશ્કેલ પરિસ્થિતિઓમાં, તેણે મોટાભાગના ઇન્સ્પેક્શન ખર્ચને ટાળતા તમામ મોડેલ્સના બ્રુટ-ફોર્સ સ્કેન જેટલી જ ગુણવત્તા જાળવી રાખી. લેખકો જણાવે છે કે "મોટાભાગના ઇન્સ્પેક્શન ખર્ચ" બચાવવામાં આવ્યા છે, જેનો અર્થ છે કે કમ્પ્યુટ ખર્ચમાં મોટો ઘટાડો થયો છે.

AI એન્જિનિયરિંગ માટે આનો અર્થ શું છે

  • રાઉટિંગ ઓવરહેડને અવગણશો નહીં. કયું મોડેલ વાપરવું તે નક્કી કરવા માટે ચોક્કસ ખર્ચ થાય છે.
  • રિઝર્વ પ્રાઇસ દાખલ કરો. વધારાની માહિતી ક્યારે ફી લેવા લાયક છે તેના માટે એક સ્પષ્ટ મર્યાદા નક્કી કરો.
  • કોસ્ટ-અવેર રાઉટિંગ અપનાવો. જેમ જેમ મોડેલ કેટલોગ વધતા જાય તેમ, અપેક્ષિત ફાયદા અને ખર્ચ વચ્ચે સંતુલન જાળવતું ડિસિઝન લેયર બજેટને નિયંત્રણમાં રાખે છે.

વિરોધ પક્ષ: વધેલી જટિલતા

બિડિંગ અથવા રાઉટિંગ લેયર ઉમેરવાથી કેટલાક નુકસાન પણ થઈ શકે છે. ટીમોએ રિઝર્વ પ્રાઇસની ગણતરી કરતા લોજિકને જાળવી રાખવું પડશે, ફી સ્ટ્રક્ચર પર દેખરેખ રાખવી પડશે અને એ સુનિશ્ચિત કરવું પડશે કે વધારાનો કોડ પાથ બોટલનેક (bottleneck) ન બની જાય. માત્ર થોડા મોડેલ્સ ધરાવતા નાના ડિપ્લોયમેન્ટ્સ માટે, Pandora’s Router બચાવવા કરતા વધુ ખર્ચ કરી શકે છે. આ ફ્રેમવર્ક એવું પણ માની લે છે કે વધુ સારા અનુમાનનો ખર્ચ જાણીતો અને સ્થિર છે—એવું અનુમાન જે અસ્થિર ક્લાઉડ પ્રાઇસિંગ અથવા સ્પોટ-ઇન્સ્ટન્સ અવરોધો હેઠળ ખોટું પડી શકે છે.

મુખ્ય વાત

મોડેલ-પસંદગીને એક આર્થિક નિર્ણય તરીકે જુઓ, મફત રાઉટિંગ સ્ટેપ તરીકે નહીં. Pandora’s Router દર્શાવે છે કે શિસ્તબદ્ધ અને ખર્ચ-જાગૃત અભિગમ આઉટપુટની ગુણવત્તા સાથે બાંધછોડ કર્યા વિના બિનજરૂરી કમ્પ્યુટ ઘટાડી શકે છે, જેનાથી AI સિસ્ટમ્સ સ્કેલેબલ અને નાણાકીય રીતે ટકાઉ બને છે.