Mistral AI એ 4 ઓગસ્ટના રોજ Shieldstral રજૂ કર્યું, જે 3-બિલિયન-પેરામીટર ધરાવતું "guard" મોડેલ છે જે માત્ર એક સિંગલ ટોકનનો ઉપયોગ કરીને 20-બિલિયન-પેરામીટર ધરાવતા સમાન મોડેલ જેટલો જ મોડરેશન જવાબ આપે છે. આ લોન્ચ કોઈપણ એવા ઉત્પાદન માટે સસ્તું અને વધુ અનુકૂલનક્ષમ સેફ્ટી લેયર (safety layer) આપવાનું વચન આપે છે જેને કન્ટેન્ટ ફિલ્ટરિંગની જરૂર છે.

એક નાનું મોડેલ તેની ક્ષમતા કરતા વધુ સારું પ્રદર્શન કેવી રીતે કરી શકે છે

પરંપરાગત મોડરેશન મોડેલ્સ પોલિસીના નિયમોને તેમના વજન (weights) માં જ સમાવી લે છે. જો તમે કોઈ નિયમ બદલો છો, તો તમારે ડેટાને ફરીથી લેબલ કરવો પડે છે, આખા મોડેલને ફરીથી ટ્રેન કરવું પડે છે અને વધારાના કમ્પ્યુટ માટે ચૂકવણી કરવી પડે છે. Shieldstral આ પદ્ધતિને બદલી નાખે છે. તે મોડરેશનને એક સીધા પ્રશ્ન-જવાબના કાર્ય તરીકે જુએ છે:

  • Instruction – તમે અમલમાં મૂકવા માંગતા પોલિસી.
  • Query – તમારે જે નિર્ણયની જરૂર છે (દા.ત., “શું આ સુરક્ષિત છે?”).
  • Document – સમીક્ષા હેઠળનું લખાણ અથવા છબી.

કારણ કે પોલિસી પ્રોમ્પ્ટમાં રહેલી છે, તેથી માત્ર એક ફકરો બદલવાથી નિયમ તરત જ અપડેટ થઈ જાય છે, જેમાં મોડેલને ફરીથી ટ્રેન કરવાની જરૂર પડતી નથી. મોડેલ 0 અને 1 વચ્ચેનો પ્રોબેબિલિટી સ્કોર (probability score) પણ આપે છે, જે ટીમોને કસ્ટમ થ્રેશોલ્ડ (thresholds) સેટ કરવાની મંજૂરી આપે છે: ઊંચા સ્કોર ઓટો-બ્લોક ટ્રિગર કરે છે, મધ્યમ સ્કોર માનવ સમીક્ષક પાસે મોકલે છે, અને નીચા સ્કોર કન્ટેન્ટને પસાર થવા દે છે.

તે કેવી રીતે કામ કરે છે તે માટેની ટ્રેનિંગ ટ્રિક

Mistral એ Shieldstral ને contrastive pairs સાથે ટ્રેન કર્યું છે. મોડેલે જોયેલા દરેક કન્ટેન્ટ માટે તેણે બે સંસ્કરણો જોયા: એક "yes" જવાબ સાથે જોડાયેલું અને બીજું "no" સાથે. આનાથી મોડેલ તેના આંતરિક નિયમો પરથી અનુમાન લગાવવાને બદલે ઇન્સ્ટ્રક્શન વાંચવા માટે મજબૂર થયું. આ અભિગમે સ્ટેટિક વજન (static weights) પર આધારિત બેઝલાઇન કરતા પર્ફોર્મન્સમાં 23 પોઈન્ટનો વધારો કર્યો.

AI-safety બજેટ માટે આનો અર્થ શું છે

મોટા guard મોડેલ્સ ઘણીવાર કોઈ કોમેન્ટ નિયમનું ઉલ્લંઘન કરે છે કે નહીં તે નક્કી કરવા માટે જ સેંકડો ટોકન્સ બાળી નાખતા આખા રીઝનિંગ ચેઈન (reasoning chain) ચલાવે છે. તે ટોકન્સ સીધા જ કમ્પ્યુટ ખર્ચમાં પરિવર્તિત થાય છે, ખાસ કરીને મોટા પાયે. Shieldstral નો સિંગલ-ટોકન જવાબ તે ખર્ચમાં મોટો ઘટાડો કરે છે, જે તેને હાઈ-વોલ્યુમ ટ્રાફિક માટે આકર્ષક બનાવે છે જ્યાં લેટન્સી (latency) અને કિંમત મહત્વની હોય છે.

ટીમો માટે વ્યવહારુ સૂચનો

  • ગ્લોબલ બેન્ચમાર્ક પર આધાર રાખશો નહીં. Shieldstral ની ચોકસાઈ વિવિધ ભાષાઓમાં અલગ-અલગ હોય છે; તમે જે ચોક્કસ કન્ટેન્ટ આપવાના છો તેના પર તેનું પરીક્ષણ કરો.
  • ફુલ fine-tuning કરતા LoRA ને પસંદ કરો. Low-rank adaptation (LoRA) માત્ર પેરામીટર્સના નાના સેટને અપડેટ કરે છે, જે બેઝ મોડેલનો ખર્ચમાં ફાયદો જાળવી રાખે છે.
  • મોટા મોડેલ્સને ઊંડાણપૂર્વક વિચારવા (deep reasoning) માટે અનામત રાખો. સીધા પોલિસી ચેક માટે Shieldstral નો ઉપયોગ કરો અને એવા કાર્યો માટે મોટા મોડેલ્સ રાખો જેને ખરેખર વ્યાપક સંદર્ભની જરૂર હોય.

સંભવિત ગેરફાયદા

મોડેલની પ્રોમ્પ્ટ-ડ્રિવન પોલિસી પરની નિર્ભરતા ઇન્સ્ટ્રક્શન ટેક્સ્ટને એક નવો નિષ્ફળતાનો બિંદુ (failure point) બનાવે છે. અસ્પષ્ટ અથવા ખરાબ રીતે લખાયેલી પોલિસી અણધાર્યા સ્કોર આપી શકે છે. વધુમાં, કારણ કે મોડેલ હજુ પણ ફિક્સ્ડ 3 B-પેરામીટર બેકબોન પર ચાલે છે, તેથી એજ-કેસ રીઝનિંગ (edge-case reasoning) જેને વ્યાપક વિશ્વ જ્ઞાનની જરૂર હોય, તેના માટે હજુ પણ મોટા મોડેલની જરૂર પડી શકે છે.

નિષ્કર્ષ: Shieldstral દર્શાવે છે કે, યોગ્ય ટ્રેનિંગ રેસીપી સાથે, 3 B મોડેલ ઘણા વાસ્તવિક મોડરેશન કાર્યો માટે 20 B guard મોડેલનું સ્થાન લઈ શકે છે—તે જ જવાબ આપે છે, ખૂબ જ ઓછા ખર્ચે, અને નિયમોને તરત જ બદલવાની સુવિધા સાથે.