Mistral AI ఆగస్టు 4న Shieldstralను ఆవిష్కరించింది. ఇది 3-బిలియన్ పారామీటర్ల కలిగిన ఒక "గార్డ్" (guard) మోడల్. ఇది కేవలం ఒకే ఒక టోకెన్ను ఉపయోగిస్తూనే, 20-బిలియన్ పారామీటర్ల మోడల్ ఇచ్చే విధంగానే మోడరేషన్ సమాధానాన్ని అందిస్తుంది. కంటెంట్ ఫిల్టరింగ్ అవసరమయ్యే ఏ ఉత్పత్తికైనా, ఇది తక్కువ ఖర్చుతో కూడిన మరియు మరింత అనుకూలమైన సేఫ్టీ లేయర్ను అందిస్తుంది.
ఒక చిన్న మోడల్ ఇంతటి శక్తివంతంగా ఎలా పనిచేయగలదు
సాంప్రదాయ మోడరేషన్ మోడల్స్ పాలసీ నియమాలను వాటి వెయిట్స్లో (weights) నిక్షిప్తం చేస్తాయి. ఒక నియమాన్ని మార్చాలంటే, మీరు డేటాను మళ్ళీ లేబుల్ చేయాలి, మొత్తం మోడల్ను మళ్ళీ ట్రైన్ చేయాలి మరియు అదనపు కంప్యూట్ ఖర్చులను భరించాలి. Shieldstral ఈ పద్ధతిని పూర్తిగా మారుస్తుంది. ఇది మోడరేషన్ను ఒక సరళమైన ప్రశ్న-జవాబు టాస్క్గా పరిగణిస్తుంది:
- Instruction – మీరు అమలు చేయాలనుకుంటున్న పాలసీ.
- Query – మీకు కావాల్సిన నిర్ణయం (ఉదాహరణకు, “Is this safe?”).
- Document – సమీక్షించాల్సిన టెక్స్ట్ లేదా ఇమేజ్.
పాలసీ అనేది ప్రాంప్ట్లో ఉండటం వల్ల, కేవలం ఒక పేరాను మార్చడం ద్వారా మోడల్ను మళ్ళీ ట్రైన్ చేయాల్సిన అవసరం లేకుండానే నియమాన్ని తక్షణమే అప్డేట్ చేయవచ్చు. ఈ మోడల్ 0 మరియు 1 మధ్య ప్రాబబిలిటీ స్కోర్ను కూడా అందిస్తుంది, దీనివల్ల టీమ్లు తమకు నచ్చిన థ్రెషోల్డ్స్ను (thresholds) సెట్ చేసుకోవచ్చు: ఎక్కువ స్కోర్లు ఉంటే ఆటో-బ్లాక్ అవుతుంది, మధ్యస్థ స్కోర్లు ఉంటే హ్యూమన్ రివ్యూయర్ వద్దకు వెళ్తాయి, తక్కువ స్కోర్లు ఉంటే కంటెంట్ అనుమతించబడుతుంది.
ఇది పనిచేయడానికి కారణమైన ట్రైనింగ్ ట్రిక్
Mistral, Shieldstralను 'కాంట్రాస్టివ్ పెయిర్స్' (contrastive pairs) తో ట్రైన్ చేసింది. ప్రతి కంటెంట్ కోసం మోడల్ రెండు వెర్షన్లను చూసింది: ఒకటి "yes" సమాధానంతో, మరొకటి "no" సమాధానంతో. దీనివల్ల మోడల్ తన అంతర్గత నియమాల నుండి ఊహించకుండా, ఇన్స్ట్రక్షన్ను చదివి అర్థం చేసుకునేలా చేయబడింది. ఈ విధానం వల్ల స్టాటిక్ వెయిట్స్పై ఆధారపడే బేస్లైన్ కంటే పనితీరు 23 పాయింట్లు పెరిగింది.
AI-సేఫ్టీ బడ్జెట్లకు దీని అర్థం ఏమిటి
పెద్ద గార్డ్ మోడల్స్ ఒక కామెంట్ నియమాన్ని ఉల్లంఘిస్తుందో లేదో నిర్ణయించడానికి వందలాది టోకెన్లను ఖర్చు చేస్తూ పూర్తి రీజనింగ్ చైన్ను రన్ చేస్తాయి. ఈ టోకెన్లు నేరుగా కంప్యూట్ ఖర్చులకు దారితీస్తాయి, ముఖ్యంగా భారీ స్థాయిలో వాడినప్పుడు. Shieldstral యొక్క సింగిల్-టోకెన్ సమాధానం ఆ ఖర్చును గణనీయంగా తగ్గిస్తుంది, తద్వారా లేటెన్సీ (latency) మరియు ధర ముఖ్యం అయిన హై-వాల్యూమ్ ట్రాఫిక్కు ఇది ఎంతో అనుకూలంగా ఉంటుంది.
టీమ్ల కోసం కొన్ని ఆచరణాత్మక సూచనలు
- గ్లోబల్ బెంచ్మార్క్లపై ఆధారపడకండి. భాషలను బట్టి Shieldstral యొక్క ఖచ్చితత్వం మారుతూ ఉంటుంది; మీరు అందించే నిర్దిష్ట కంటెంట్పై దీనిని పరీక్షించండి.
- ఫుల్ ఫైన్-ట్యూనింగ్ కంటే LoRAను ఎంచుకోండి. Low-rank adaptation (LoRA) కేవలం కొన్ని పారామీటర్లను మాత్రమే అప్డేట్ చేస్తుంది, దీనివల్ల బేస్ మోడల్ యొక్క తక్కువ ఖర్చు ప్రయోజనం దెబ్బతినదు.
- పెద్ద మోడళ్లను లోతైన రీజనింగ్ కోసం ఉంచండి. సాధారణ పాలసీ చెక్ల కోసం Shieldstralను ఉపయోగించండి మరియు విస్తృతమైన కాంటెక్స్ట్ అవసరమయ్యే పనుల కోసం పెద్ద మోడళ్లను ఉంచుకోండి.
ఉండగలిగే లోపాలు
ప్రాంప్ట్ ఆధారిత పాలసీలపై మోడల్ ఆధారపడటం వల్ల, ఇన్స్ట్రక్షన్ టెక్స్ట్ ఒక కొత్త ఫెయిల్యూర్ పాయింట్గా మారుతుంది. అస్పష్టమైన లేదా సరిగ్గా లేని పాలసీలు ఊహించని స్కోర్లను ఇవ్వవచ్చు. అంతేకాకుండా, ఈ మోడల్ ఇంకా 3B-పారామీటర్ల బ్యాక్బోన్పైనే నడుస్తుంది కాబట్టి, విస్తృతమైన ప్రపంచ జ్ఞానం అవసరమయ్యే ఎడ్జ్-కేస్ రీజనింగ్ (edge-case reasoning) కోసం ఇంకా పెద్ద మోడల్ అవసరం కావచ్చు.
ముగింపు: సరైన ట్రైనింగ్ పద్ధతితో, ఒక 3B మోడల్ అనేక రియల్-వరల్డ్ మోడరేషన్ పనుల కోసం 20B గార్డ్ మోడల్ను భర్తీ చేయగలదని Shieldstral నిరూపిస్తోంది—అదే సమాధానాన్ని, చాలా తక్కువ ఖర్చుతో మరియు నియమాలను తక్షణమే మార్చుకునే సౌలభ్యంతో అందిస్తుంది.
