Mistral AI ने ४ ऑगस्ट रोजी Shieldstral लाँच केले, जे ३-बिलियन-पॅरामीटर असलेले एक "guard" मॉडेल आहे. हे मॉडेल केवळ एका सिंगल टोकनचा वापर करून २०-बिलियन-पॅरामीटर मॉडेलइतकेच अचूक मॉडरेशन उत्तर देते. हे लाँच अशा कोणत्याही उत्पादनासाठी स्वस्त आणि अधिक लवचिक सुरक्षा स्तर (safety layer) देण्याचे आश्वासन देते ज्याला कंटेंट फिल्टरिंगची गरज आहे.
एक लहान मॉडेल इतके प्रभावी का ठरू शकते
पारंपारिक मॉडरेशन मॉडेल्समध्ये पॉलिसीचे नियम त्यांच्या weights मध्ये समाविष्ट केलेले असतात. जर एखादा नियम बदलला, तर तुम्हाला डेटा पुन्हा लेबल करावा लागतो, संपूर्ण मॉडेल पुन्हा प्रशिक्षित (retrain) करावे लागते आणि अतिरिक्त कम्प्युटसाठी पैसे मोजावे लागतात. Shieldstral ही पद्धत पूर्णपणे बदलते. ते मॉडरेशनकडे एका साध्या प्रश्न-उत्तराच्या कार्याप्रमाणे पाहते:
- Instruction (सूचना) – तुम्हाला लागू करायची असलेली पॉलिसी.
- Query (प्रश्न) – तुम्हाला हवा असलेला निर्णय (उदा. "हे सुरक्षित आहे का?").
- Document (दस्तऐवज) – ज्या मजकुराची किंवा प्रतिमेची तपासणी करायची आहे तो.
पॉलिसी 'प्रॉम्प्ट'मध्ये (prompt) असल्याने, केवळ एक परिच्छेद बदलून नियम त्वरित अपडेट करता येतो, त्यासाठी मॉडेल पुन्हा प्रशिक्षित करण्याची गरज नसते. हे मॉडेल ० आणि १ दरम्यानचा 'प्रोबॅबिलिटी स्कोअर' (probability score) देखील देते, ज्यामुळे टीम्स स्वतःचे कस्टम थ्रेशोल्ड (thresholds) सेट करू शकतात: उच्च स्कोअरमुळे ऑटो-ब्लॉक प्रक्रिया सुरू होते, मध्यम स्कोअर असल्यास मानवी पुनरावलोकनकर्त्याकडे (human reviewer) पाठवले जाते आणि कमी स्कोअर असल्यास कंटेंटला परवानगी दिली जाते.
हे यशस्वी ठरवणारी ट्रेनिंगची युक्ती
Mistral ने Shieldstral ला 'कॉन्ट्रास्टिव्ह पेअर्स' (contrastive pairs) वापरून प्रशिक्षित केले. प्रत्येक कंटेंटसाठी मॉडेलने दोन आवृत्त्या पाहिल्या: एक "हो" उत्तरासोबत आणि दुसरी "नाही" उत्तरासोबत. यामुळे मॉडेलला स्वतःच्या अंतर्गत नियमांवरून अंदाज लावण्याऐवजी सूचना वाचण्यास भाग पाडले गेले. या पद्धतीमुळे स्टॅटिक वेट्सवर (static weights) अवलंबून असलेल्या बेसलाइनच्या तुलनेत कामगिरीमध्ये २३ अंकांची वाढ झाली.
AI-सुरक्षेच्या बजेटसाठी याचा अर्थ काय?
मोठे 'guard' मॉडेल्स अनेकदा एखादी कमेंट नियमांचे उल्लंघन करते की नाही हे ठरवण्यासाठी शेकडो टोकन्स खर्च करणारी एक पूर्ण 'रीझनिंग चेन' (reasoning chain) चालवतात. हे टोकन्स थेट कम्प्युट खर्चात रूपांतरित होतात, विशेषतः मोठ्या प्रमाणावर वापर करताना. Shieldstral चे सिंगल-टोकन उत्तर हा खर्च लक्षणीयरीत्या कमी करते, ज्यामुळे लेटन्सी (latency) आणि किंमत महत्त्वाच्या असलेल्या हाय-व्हॉल्यूम ट्रॅफिकसाठी ते अत्यंत फायदेशीर ठरते.
टीम्ससाठी व्यावहारिक महत्त्वाच्या गोष्टी
- ग्लोबल बेंचमार्कवर अवलंबून राहू नका. Shieldstral ची अचूकता विविध भाषांमध्ये वेगवेगळी असू शकते; तुम्ही वापरणार असलेल्या विशिष्ट कंटेंटवर त्याची चाचणी घ्या.
- फुल फाईन-ट्यूनिंगपेक्षा LoRA ला प्राधान्य द्या. लो-रँक अडॅप्टेशन (LoRA) केवळ पॅरामीटर्सचा एक छोटा संच अपडेट करते, ज्यामुळे बेस मॉडेलचा खर्च कमी राहतो.
- मोठ्या मॉडेल्सचा वापर सखोल विचारप्रक्रियेसाठी (deep reasoning) राखून ठेवा. साध्या पॉलिसी तपासणीसाठी Shieldstral वापरा आणि ज्या कामांसाठी खरोखर विस्तृत संदर्भाची (context) गरज आहे, त्यासाठी मोठी मॉडेल्स वापरा.
संभाव्य तोटे
मॉडेलचा प्रॉम्प्ट-आधारित पॉलिसींवर असलेला अवलंब यामुळे 'इन्स्ट्रक्शन टेक्स्ट' हा एक नवीन त्रुटीचा बिंदू (failure point) बनू शकतो. संदिग्ध किंवा चुकीच्या पद्धतीने लिहिलेल्या पॉलिसीमुळे अनपेक्षित स्कोअर मिळू शकतात. शिवाय, मॉडेल अजूनही ३-बिलियन-पॅरामीटरच्या फिक्स्ड बॅकबोनवर चालत असल्याने, व्यापक जागतिक ज्ञानाचा फायदा घेणाऱ्या 'एज-केस' (edge-case) तर्कणासाठी अजूनही मोठ्या मॉडेलची गरज भासू शकते.
थोडक्यात सांगायचे तर: Shieldstral हे दर्शवते की, योग्य ट्रेनिंग रेसिपीसह, ३-बिलियन मॉडेल अनेक वास्तविक जगातील मॉडरेशन कामांसाठी २०-बिलियन 'guard' मॉडेलची जागा घेऊ शकते—त्याच प्रकारचे उत्तर, अत्यंत कमी खर्चात आणि नियम त्वरित बदलण्याच्या लवचिकतेसह देते.
