Mistral AI ఆగస్టు 4న Shieldstralను ఆవిష్కరించింది. ఇది 3-బిలియన్ పారామీటర్ల కలిగిన ఒక "గార్డ్" (guard) మోడల్. ఇది కేవలం ఒకే ఒక టోకెన్‌ను ఉపయోగిస్తూనే, 20-బిలియన్ పారామీటర్ల మోడల్ ఇచ్చే విధంగానే మోడరేషన్ సమాధానాన్ని అందిస్తుంది. కంటెంట్ ఫిల్టరింగ్ అవసరమయ్యే ఏ ఉత్పత్తికైనా, ఇది తక్కువ ఖర్చుతో కూడిన మరియు మరింత అనుకూలమైన సేఫ్టీ లేయర్‌ను అందిస్తుంది.

ఒక చిన్న మోడల్ ఇంతటి శక్తివంతంగా ఎలా పనిచేయగలదు

సాంప్రదాయ మోడరేషన్ మోడల్స్ పాలసీ నియమాలను వాటి వెయిట్స్‌లో (weights) నిక్షిప్తం చేస్తాయి. ఒక నియమాన్ని మార్చాలంటే, మీరు డేటాను మళ్ళీ లేబుల్ చేయాలి, మొత్తం మోడల్‌ను మళ్ళీ ట్రైన్ చేయాలి మరియు అదనపు కంప్యూట్ ఖర్చులను భరించాలి. Shieldstral ఈ పద్ధతిని పూర్తిగా మారుస్తుంది. ఇది మోడరేషన్‌ను ఒక సరళమైన ప్రశ్న-జవాబు టాస్క్‌గా పరిగణిస్తుంది:

  • Instruction – మీరు అమలు చేయాలనుకుంటున్న పాలసీ.
  • Query – మీకు కావాల్సిన నిర్ణయం (ఉదాహరణకు, “Is this safe?”).
  • Document – సమీక్షించాల్సిన టెక్స్ట్ లేదా ఇమేజ్.

పాలసీ అనేది ప్రాంప్ట్‌లో ఉండటం వల్ల, కేవలం ఒక పేరాను మార్చడం ద్వారా మోడల్‌ను మళ్ళీ ట్రైన్ చేయాల్సిన అవసరం లేకుండానే నియమాన్ని తక్షణమే అప్‌డేట్ చేయవచ్చు. ఈ మోడల్ 0 మరియు 1 మధ్య ప్రాబబిలిటీ స్కోర్‌ను కూడా అందిస్తుంది, దీనివల్ల టీమ్‌లు తమకు నచ్చిన థ్రెషోల్డ్స్‌ను (thresholds) సెట్ చేసుకోవచ్చు: ఎక్కువ స్కోర్లు ఉంటే ఆటో-బ్లాక్ అవుతుంది, మధ్యస్థ స్కోర్లు ఉంటే హ్యూమన్ రివ్యూయర్ వద్దకు వెళ్తాయి, తక్కువ స్కోర్లు ఉంటే కంటెంట్ అనుమతించబడుతుంది.

ఇది పనిచేయడానికి కారణమైన ట్రైనింగ్ ట్రిక్

Mistral, Shieldstralను 'కాంట్రాస్టివ్ పెయిర్స్' (contrastive pairs) తో ట్రైన్ చేసింది. ప్రతి కంటెంట్ కోసం మోడల్ రెండు వెర్షన్లను చూసింది: ఒకటి "yes" సమాధానంతో, మరొకటి "no" సమాధానంతో. దీనివల్ల మోడల్ తన అంతర్గత నియమాల నుండి ఊహించకుండా, ఇన్‌స్ట్రక్షన్‌ను చదివి అర్థం చేసుకునేలా చేయబడింది. ఈ విధానం వల్ల స్టాటిక్ వెయిట్స్‌పై ఆధారపడే బేస్‌లైన్ కంటే పనితీరు 23 పాయింట్లు పెరిగింది.

AI-సేఫ్టీ బడ్జెట్‌లకు దీని అర్థం ఏమిటి

పెద్ద గార్డ్ మోడల్స్ ఒక కామెంట్ నియమాన్ని ఉల్లంఘిస్తుందో లేదో నిర్ణయించడానికి వందలాది టోకెన్లను ఖర్చు చేస్తూ పూర్తి రీజనింగ్ చైన్‌ను రన్ చేస్తాయి. ఈ టోకెన్లు నేరుగా కంప్యూట్ ఖర్చులకు దారితీస్తాయి, ముఖ్యంగా భారీ స్థాయిలో వాడినప్పుడు. Shieldstral యొక్క సింగిల్-టోకెన్ సమాధానం ఆ ఖర్చును గణనీయంగా తగ్గిస్తుంది, తద్వారా లేటెన్సీ (latency) మరియు ధర ముఖ్యం అయిన హై-వాల్యూమ్ ట్రాఫిక్‌కు ఇది ఎంతో అనుకూలంగా ఉంటుంది.

టీమ్‌ల కోసం కొన్ని ఆచరణాత్మక సూచనలు

  • గ్లోబల్ బెంచ్‌మార్క్‌లపై ఆధారపడకండి. భాషలను బట్టి Shieldstral యొక్క ఖచ్చితత్వం మారుతూ ఉంటుంది; మీరు అందించే నిర్దిష్ట కంటెంట్‌పై దీనిని పరీక్షించండి.
  • ఫుల్ ఫైన్-ట్యూనింగ్ కంటే LoRAను ఎంచుకోండి. Low-rank adaptation (LoRA) కేవలం కొన్ని పారామీటర్లను మాత్రమే అప్‌డేట్ చేస్తుంది, దీనివల్ల బేస్ మోడల్ యొక్క తక్కువ ఖర్చు ప్రయోజనం దెబ్బతినదు.
  • పెద్ద మోడళ్లను లోతైన రీజనింగ్ కోసం ఉంచండి. సాధారణ పాలసీ చెక్‌ల కోసం Shieldstralను ఉపయోగించండి మరియు విస్తృతమైన కాంటెక్స్ట్ అవసరమయ్యే పనుల కోసం పెద్ద మోడళ్లను ఉంచుకోండి.

ఉండగలిగే లోపాలు

ప్రాంప్ట్ ఆధారిత పాలసీలపై మోడల్ ఆధారపడటం వల్ల, ఇన్‌స్ట్రక్షన్ టెక్స్ట్ ఒక కొత్త ఫెయిల్యూర్ పాయింట్‌గా మారుతుంది. అస్పష్టమైన లేదా సరిగ్గా లేని పాలసీలు ఊహించని స్కోర్‌లను ఇవ్వవచ్చు. అంతేకాకుండా, ఈ మోడల్ ఇంకా 3B-పారామీటర్ల బ్యాక్‌బోన్‌పైనే నడుస్తుంది కాబట్టి, విస్తృతమైన ప్రపంచ జ్ఞానం అవసరమయ్యే ఎడ్జ్-కేస్ రీజనింగ్ (edge-case reasoning) కోసం ఇంకా పెద్ద మోడల్ అవసరం కావచ్చు.

ముగింపు: సరైన ట్రైనింగ్ పద్ధతితో, ఒక 3B మోడల్ అనేక రియల్-వరల్డ్ మోడరేషన్ పనుల కోసం 20B గార్డ్ మోడల్‌ను భర్తీ చేయగలదని Shieldstral నిరూపిస్తోంది—అదే సమాధానాన్ని, చాలా తక్కువ ఖర్చుతో మరియు నియమాలను తక్షణమే మార్చుకునే సౌలభ్యంతో అందిస్తుంది.