Mistral AI ഓഗസ്റ്റ് 4-ന് Shieldstral പുറത്തിറക്കി. ഇത് 3 ബില്യൺ പാരാമീറ്ററുകളുള്ള ഒരു "ഗാർഡ്" (guard) മോഡലാണ്. വെറും ഒരു ടോക്കൺ മാത്രം ഉപയോഗിച്ച്, 20 ബില്യൺ പാരാമീറ്ററുകളുള്ള ഒരു മോഡലിന് നൽകുന്ന അതേ മോഡറേഷൻ മറുപടി തന്നെ ഇതിനും നൽകാൻ സാധിക്കും. കണ്ടന്റ് ഫിൽട്ടറിംഗ് ആവശ്യമുള്ള ഏതൊരു ഉൽപ്പന്നത്തിനും കുറഞ്ഞ ചിലവിലും കൂടുതൽ വഴക്കമുള്ളതുമായ ഒരു സേഫ്റ്റി ലെയർ വാഗ്ദാനം ചെയ്യുന്നതാണ് ഈ ലോഞ്ച്.
ഒരു ചെറിയ മോഡലിന് എങ്ങനെ വലിയ പ്രകടനം കാഴ്ചവെക്കാൻ കഴിയും
പരമ്പരാഗത മോഡറേഷൻ മോഡലുകൾ പോളിസി നിയമങ്ങൾ അവയുടെ വെയ്റ്റുകളിൽ (weights) ഉൾപ്പെടുത്തിയിരിക്കുന്നു. ഒരു നിയമം മാറ്റണമെങ്കിൽ, ഡാറ്റ വീണ്ടും ലേബൽ ചെയ്യുകയും, മുഴുവൻ മോഡലും വീണ്ടും പരിശീലിപ്പിക്കുകയും (retrain), അധിക കമ്പ്യൂട്ടിംഗ് ചിലവ് വഹിക്കുകയും വേണം. Shieldstral ഈ രീതിയെ പാടെ മാറ്റുന്നു. ഇത് മോഡറേഷനെ ലളിതമായ ഒരു ചോദ്യം-ഉത്തര രീതിയായി കാണുന്നു:
- Instruction – നിങ്ങൾ നടപ്പിലാക്കാൻ ആഗ്രഹിക്കുന്ന പോളിസി.
- Query – നിങ്ങൾക്ക് ആവശ്യമുള്ള തീരുമാനം (ഉദാഹരണത്തിന്, “ഇത് സുരക്ഷിതമാണോ?”).
- Document – പരിശോധനയ്ക്ക് വിധേയമാകുന്ന ടെക്സ്റ്റ് അല്ലെങ്കിൽ ചിത്രം.
പോളിസി പ്രോംപ്റ്റിൽ (prompt) ഉൾപ്പെട്ടിരിക്കുന്നതിനാൽ, ഒരു പാരഗ്രാഫ് മാറ്റുന്നതിലൂടെ മോഡലിനെ വീണ്ടും പരിശീലിപ്പിക്കാതെ തന്നെ നിയമങ്ങൾ ഉടനടി പുതുക്കാൻ സാധിക്കും. കൂടാതെ, ഈ മോഡൽ 0-നും 1-നും ഇടയിലുള്ള ഒരു പ്രോബബിലിറ്റി സ്കോർ (probability score) നൽകുന്നു, ഇത് ടീമുകൾക്ക് തനതായ ത്രെഷോൾഡുകൾ (thresholds) നിശ്ചയിക്കാൻ സഹായിക്കുന്നു: ഉയർന്ന സ്കോറുകൾ ഓട്ടോ-ബ്ലോക്ക് ചെയ്യാനും, ഇടത്തരം സ്കോറുകൾ ഒരു ഹ്യൂമൻ റിവ്യൂവർക്ക് കൈമാറാനും, കുറഞ്ഞ സ്കോറുകൾ ഉള്ള കണ്ടന്റ് കടത്തിവിടാനും സാധിക്കും.
ഇതിനെ വിജയകരമാക്കുന്ന ട്രെയിനിംഗ് രീതി
Mistral, Shieldstral-നെ 'കോൺട്രാസ്റ്റിവ് പേയറുകൾ' (contrastive pairs) ഉപയോഗിച്ചാണ് പരിശീലിപ്പിച്ചത്. ഓരോ കണ്ടന്റിനും മോഡൽ രണ്ട് പതിപ്പുകൾ കണ്ടു: ഒന്ന് "yes" എന്ന ഉത്തരത്തോടും മറ്റൊന്ന് "no" എന്ന ഉത്തരത്തോടും ചേർത്താണ് നൽകിയത്. ഇത് മോഡലിനെ അതിന്റെ ഉള്ളിലുള്ള നിയമങ്ങളിൽ നിന്ന് ഊഹിക്കുന്നതിന് പകരം ഇൻസ്ട്രക്ഷൻ കൃത്യമായി വായിക്കാൻ പ്രേരിപ്പിച്ചു. സ്റ്റാറ്റിക് വെയ്റ്റുകളെ (static weights) ആശ്രയിക്കുന്ന രീതിയെ അപേക്ഷിച്ച് ഈ സമീപനം പ്രകടനത്തിൽ 23 പോയിന്റുകളുടെ വർദ്ധനവ് ഉണ്ടാക്കി.
AI സുരക്ഷാ ബജറ്റുകളെ ഇത് എങ്ങനെ ബാധിക്കുന്നു
വലിയ ഗാർഡ് മോഡലുകൾ പലപ്പോഴും ഒരു കമന്റ് നിയമം ലംഘിക്കുന്നുണ്ടോ എന്ന് തീരുമാനിക്കാൻ വേണ്ടി മാത്രം നൂറുകണക്കിന് ടോക്കണുകൾ ഉപയോഗിക്കുന്ന ഒരു റീസണിംഗ് ചെയിൻ (reasoning chain) പ്രവർത്തിപ്പിക്കാറുണ്ട്. ഈ ടോക്കണുകൾ നേരിട്ട് കമ്പ്യൂട്ടിംഗ് ചിലവുകളായി മാറുന്നു, പ്രത്യേകിച്ച് വലിയ തോതിലുള്ള ഉപയോഗത്തിൽ. Shieldstral-ന്റെ സിംഗിൾ-ടോക്കൺ മറുപടി ഈ ചിലവ് ഗണ്യമായി കുറയ്ക്കുന്നു, ഇത് ലേറ്റൻസിയും (latency) വിലയും പ്രധാനമായ ഉയർന്ന ട്രാഫിക് ഉള്ള ഇടങ്ങളിൽ ഇതിനെ ആകർഷകമാക്കുന്നു.
ടീമുകൾക്കുള്ള പ്രായോഗിക നിർദ്ദേശങ്ങൾ
- ഗ്ലോബൽ ബെഞ്ച്മാർക്കുകളെ മാത്രം ആശ്രയിക്കരുത്. Shieldstral-ന്റെ കൃത്യത ഭാഷകൾക്കനുസരിച്ച് മാറാം; നിങ്ങൾ ഉപയോഗിക്കുന്ന പ്രത്യേക കണ്ടന്റിൽ ഇത് പരീക്ഷിക്കുക.
- ഫുൾ ഫൈൻ ട്യൂണിംഗിനേക്കാൾ LoRA ഉപയോഗിക്കുക. ലോ-റാങ്ക് അഡാപ്റ്റേഷൻ (LoRA) കുറഞ്ഞ പാരാമീറ്ററുകൾ മാത്രമേ പുതുക്കുന്നുള്ളൂ, ഇത് ബേസ് മോഡലിന്റെ ചിലവ് കുറഞ്ഞ അവസ്ഥ നിലനിർത്തുന്നു.
- വലിയ മോഡലുകൾ ആഴത്തിലുള്ള റീസണിംഗിനായി മാറ്റിവെക്കുക. ലളിതമായ പോളിസി പരിശോധനകൾക്കായി Shieldstral ഉപയോഗിക്കുക, കൂടുതൽ കോൺടെക്സ്റ്റ് ആവശ്യമുള്ള ജോലികൾക്കായി വലിയ മോഡലുകൾ ഉപയോഗിക്കുക.
ഉണ്ടായേക്കാവുന്ന പോരായ്മകൾ
പ്രോംപ്റ്റ് അടിസ്ഥാനമാക്കിയുള്ള പോളിസികളെ മോഡൽ ആശ്രയിക്കുന്നത് ഇൻസ്ട്രക്ഷൻ ടെക്സ്റ്റിനെ ഒരു പുതിയ പരാജയസാധ്യതയാക്കുന്നു (failure point). അവ്യക്തമോ ശരിയായി രൂപപ്പെടുത്താത്തതോ ആയ പോളിസികൾ പ്രവചനാതീതമായ സ്കോറുകൾ നൽകിയേക്കാം. കൂടാതെ, മോഡൽ ഇപ്പോഴും ഒരു നിശ്ചിത 3 B-പാരാമീറ്റർ ബാക്ക്ബോണിലാണ് പ്രവർത്തിക്കുന്നത് എന്നതിനാൽ, വിപുലമായ ലോകവിവരങ്ങൾ ആവശ്യമുള്ള സങ്കീർണ്ണമായ സാഹചര്യങ്ങളിൽ (edge-case reasoning) ഒരു വലിയ മോഡൽ ആവശ്യമായി വന്നേക്കാം.
ചുരുക്കത്തിൽ: ശരിയായ ട്രെയിനിംഗ് രീതി ഉപയോഗിച്ചാൽ, പല യഥാർത്ഥ ലോക മോഡറേഷൻ ജോലികൾക്കും ഒരു 20 B ഗാർഡ് മോഡലിന് പകരം ഒരു 3 B മോഡൽ ഉപയോഗിക്കാമെന്ന് Shieldstral തെളിയിക്കുന്നു—അതായത് കുറഞ്ഞ ചിലവിൽ, ഒരേ മറുപടി നൽകിക്കൊണ്ട്, നിയമങ്ങൾ എപ്പോൾ വേണമെങ്കിലും മാറ്റാനുള്ള സൗകര്യത്തോടും കൂടി ഇത് സാധ്യമാക്കുന്നു.
