Mistral AI ஆகஸ்ட் 4 அன்று Shieldstral-ஐ அறிமுகப்படுத்தியது. இது 3-பில்லியன் அளவுருக்களைக் கொண்ட ஒரு "பாதுகாப்பு" (guard) மாதிரியாகும். இது 20-பில்லியன் அளவுருக்களைக் கொண்ட ஒரு மாதிரியின் அதே தணிக்கை பதிலையே (moderation answer) ஒரே ஒரு டோக்கனைப் பயன்படுத்தி வழங்குகிறது. உள்ளடக்கத் தணிக்கை (content filtering) தேவைப்படும் எந்தவொரு தயாரிப்பிற்கும், மலிவான மற்றும் அதிக மாற்றியமைக்கக்கூடிய ஒரு பாதுகாப்பு அடுக்கை வழங்குவதாக இந்த வெளியீடு உறுதியளிக்கிறது.

ஒரு சிறிய மாதிரி எவ்வாறு தனது எடையை விட அதிக வலிமையைக் காட்ட முடியும்?

பாரம்பரிய தணிக்கை மாதிரிகள் கொள்கை விதிகளை அவற்றின் எடைகளில் (weights) உட்பொதித்து வைத்திருக்கும். ஒரு விதியை மாற்றினால், நீங்கள் தரவை மீண்டும் லேபிளிட வேண்டும், முழு மாதிரியையும் மீண்டும் பயிற்றுவிக்க வேண்டும் மற்றும் கூடுதல் கணக்கீட்டுத் திறனுக்காக (compute) பணம் செலுத்த வேண்டும். Shieldstral அந்த அணுகுமுறையை மாற்றுகிறது. இது தணிக்கையை ஒரு நேரடியான கேள்வி-பதில் பணியாகக் கையாள்கிறது:

  • Instruction (அறிவுறுத்தல்) – நீங்கள் நடைமுறைப்படுத்த விரும்பும் கொள்கை.
  • Query (வினவல்) – உங்களுக்குத் தேவையான முடிவு (எ.கா., “Is this safe?”).
  • Document (ஆவணம்) – ஆய்வு செய்யப்பட வேண்டிய உரை அல்லது படம்.

கொள்கை என்பது பிராம்ப்ட்டில் (prompt) இருப்பதால், ஒரு பத்தியை மாற்றினால் விதி உடனடியாகப் புதுப்பிக்கப்படும்; இதற்கு மாதிரியை மீண்டும் பயிற்றுவிக்கத் தேவையில்லை. இந்த மாதிரி 0 மற்றும் 1 க்கு இடையில் ஒரு நிகழ்தகவு மதிப்பெண்ணையும் (probability score) வழங்குகிறது, இது குழுக்கள் தங்களுக்குத் தேவையான வரம்புகளை (custom thresholds) நிர்ணயிக்க அனுமதிக்கிறது: அதிக மதிப்பெண்கள் தானியங்கித் தடையைத் (auto-block) தூண்டுகின்றன, நடுத்தர மதிப்பெண்கள் ஒரு மனித ஆய்வாளருக்கு (human reviewer) மாற்றப்படுகின்றன, குறைந்த மதிப்பெண்கள் உள்ளடக்கத்தை அனுமதிக்கின்றன.

இது செயல்பட உதவும் பயிற்சியின் நுணுக்கம்

Mistral, Shieldstral-ஐ மாறுபட்ட இணைகளுடன் (contrastive pairs) பயிற்றுவித்தது. மாதிரி பார்த்த ஒவ்வொரு உள்ளடக்கத்திற்கும் இரண்டு பதிப்புகள் இருந்தன: ஒன்று “yes” என்ற பதிலுடன் இணைக்கப்பட்டிருந்தது, மற்றொன்று “no” என்ற பதிலுடன் இணைக்கப்பட்டிருந்தது. இது மாதிரி தனது உள்வாங்கப்பட்ட விதிகளைக் கொண்டு ஊகிப்பதற்குப் பதிலாக, அறிவுறுத்தலை வாசிக்கத் தூண்டியது. இந்த அணுகுமுறை, நிலையான எடைகளைச் சார்ந்திருந்த அடிப்படை மாதிரியை விட செயல்திறனை 23 புள்ளிகள் உயர்த்தியது.

AI-பாதுகாப்பு பட்ஜெட்டுகளுக்கு இதன் பொருள் என்ன?

பெரிய பாதுகாப்பு மாதிரிகள் பெரும்பாலும் ஒரு கருத்து விதியை மீறுகிறதா என்பதைத் தீர்மானிக்கவே நூற்றுக்கணக்கான டோக்கன்களைப் பயன்படுத்தி ஒரு முழுமையான தர்க்கச் சங்கிலியை (reasoning chain) இயக்குகின்றன. அந்த டோக்கன்கள் நேரடியாகக் கணக்கீட்டுச் செலவுகளாக (compute costs) மாறுகின்றன, குறிப்பாகப் பெரிய அளவில் பயன்படுத்தும்போது. Shieldstral-ன் ஒற்றை-டோக்கன் பதில் அந்தச் செலவை வியத்தகு முறையில் குறைக்கிறது, இது தாமதம் (latency) மற்றும் விலை முக்கியத்துவம் வாய்ந்த அதிகப்படியான போக்குவரத்து உள்ள இடங்களுக்கு மிகவும் பொருத்தமானது.

குழுக்களுக்கான நடைமுறைப் பயன்பாடுகள்

  • உலகளாவிய அளவுகோல்களை (global benchmarks) மட்டும் நம்பியிருக்க வேண்டாம். Shieldstral-ன் துல்லியம் மொழிகளுக்கு இடையே மாறுபடும்; நீங்கள் பயன்படுத்தும் குறிப்பிட்ட உள்ளடக்கத்தில் அதைச் சோதித்துப் பாருங்கள்.
  • முழுமையான ஃபைன்-டியூனிங்கிற்கு (full fine-tuning) பதிலாக LoRA-வை முன்னுரிமைப்படுத்துங்கள். Low-rank adaptation (LoRA) என்பது அளவுருக்களின் ஒரு சிறிய தொகுப்பை மட்டுமே புதுப்பிக்கும், இது அடிப்படை மாதிரியின் செலவுச் சாதகத்தைப் பாதுகாக்கிறது.
  • ஆழமான தர்க்கத்திற்குப் பெரிய மாதிரிகளைத் தள்ளி வையுங்கள். நேரடியான கொள்கை சரிபார்ப்புகளுக்கு Shieldstral-ஐப் பயன்படுத்துங்கள் மற்றும் விரிவான சூழல் தேவைப்படும் பணிகளுக்குப் பெரிய மாதிரிகளைத் தக்க வைத்துக் கொள்ளுங்கள்.

ஏற்படக்கூடிய குறைபாடுகள்

பிராம்ப்ட் மூலம் இயக்கப்படும் கொள்கைகளை இந்த மாதிரி சார்ந்திருப்பது, அறிவுறுத்தல் உரையை (instruction text) ஒரு புதிய தோல்விப் புள்ளியாக மாற்றுகிறது. தெளிவற்ற அல்லது மோசமாக வடிவமைக்கப்பட்ட கொள்கைகள் கணிக்க முடியாத மதிப்பெண்களை உருவாக்கக்கூடும். மேலும், இந்த மாதிரி இன்னும் ஒரு நிலையான 3 B-parameter கட்டமைப்பிலேயே இயங்குவதால், பரந்த உலக அறிவு தேவைப்படும் விளிம்புநிலைச் சூழல் தர்க்கங்களுக்கு (edge-case reasoning) இன்னும் ஒரு பெரிய மாதிரி தேவைப்படலாம்.

சுருக்கமாகச் சொன்னால்: சரியான பயிற்சி முறையுடன், ஒரு 3 B மாதிரி பல நிஜ உலகத் தணிக்கை பணிகளுக்கு 20 B பாதுகாப்பு மாதிரியை மாற்றீடு செய்ய முடியும் என்பதை Shieldstral காட்டுகிறது—அதே பதிலைத் தரும், மிகக் குறைந்த செலவில், மேலும் விதிகளை உடனடியாக மாற்றும் வசதியுடனும் இது செயல்படுகிறது.