Mistral AI نے 4 اگست کو Shieldstral متعارف کرایا، جو کہ ایک 3-بلین پیرامیٹر والا "گارڈ" ماڈل ہے جو صرف ایک سنگل ٹوکن استعمال کرتے ہوئے 20-بلین پیرامیٹر والے ہم پلہ ماڈل کے برابر ہی اعتدال پسندی (moderation) کا جواب دیتا ہے۔ یہ لانچ کسی بھی ایسے پروڈکٹ کے لیے ایک سستا اور زیادہ لچکدار سیفٹی لیئر فراہم کرنے کا وعدہ کرتا ہے جسے مواد کی فلٹرنگ (content filtering) کی ضرورت ہو۔

ایک چھوٹا ماڈل اپنی صلاحیت سے بڑھ کر نتائج کیوں دے سکتا ہے

روایتی اعتدال پسندی کے ماڈلز پالیسی کے قواعد کو اپنے ویٹس (weights) میں شامل کر لیتے ہیں۔ اگر کوئی قاعدہ تبدیل کرنا ہو، تو آپ کو ڈیٹا کو دوبارہ لیبل کرنا پڑتا ہے، پورے ماڈل کو دوبارہ ٹرین کرنا پڑتا ہے، اور اضافی کمپیوٹ کے لیے ادائیگی کرنی پڑتی ہے۔ Shieldstral اس تصور کو بدل دیتا ہے۔ یہ اعتدال پسندی کو ایک سادہ سوال و جواب کے کام کے طور پر لیتا ہے:

  • Instruction – وہ پالیسی جسے آپ نافذ کرنا چاہتے ہیں۔
  • Query – وہ فیصلہ جس کی آپ کو ضرورت ہے (مثلاً، "کیا یہ محفوظ ہے؟")۔
  • Document – وہ متن یا تصویر جس کا جائزہ لیا جا رہا ہے۔

چونکہ پالیسی پرامپٹ (prompt) میں موجود ہوتی ہے، اس لیے صرف ایک پیراگراف تبدیل کرنے سے قاعدہ فوری طور پر اپ ڈیٹ ہو جاتا ہے، اور ماڈل کو دوبارہ ٹرین کرنے کی ضرورت نہیں پڑتی۔ ماڈل 0 اور 1 کے درمیان ایک پروبیبلٹی اسکور (probability score) بھی فراہم کرتا ہے، جس سے ٹیموں کو اپنی مرضی کی حد (thresholds) مقرر کرنے کی سہولت ملتی ہے: زیادہ اسکور خودکار بلاکنگ (auto-block) کو متحرک کرتا ہے، درمیانے اسکور انسانی جائزہ لینے والے (human reviewer) کو بھیجے جاتے ہیں، اور کم اسکور مواد کو گزرنے کی اجازت دیتے ہیں۔

وہ ٹریننگ ٹرک جو اسے کامیاب بناتا ہے

Mistral نے Shieldstral کو کنٹراسٹو پیئرز (contrastive pairs) کے ساتھ ٹرین کیا ہے۔ ہر مواد کے ٹکڑے کے لیے ماڈل نے دو ورژن دیکھے: ایک "ہاں" کے جواب کے ساتھ جوڑا گیا اور دوسرا "نہیں" کے ساتھ۔ اس نے ماڈل کو اپنے اندرونی قواعد سے اندازہ لگانے کے بجائے ہدایت (instruction) پڑھنے پر مجبور کیا۔ اس طریقہ کار نے اسٹیٹک ویٹس (static weights) پر انحصار کرنے والے بنیادی ماڈل کے مقابلے میں کارکردگی میں 23 پوائنٹس کا اضافہ کیا۔

AI سیفٹی بجٹ کے لیے اس کے کیا معنی ہیں

بڑے گارڈ ماڈلز اکثر ایک مکمل ریزننگ چین (reasoning chain) چلاتے ہیں جو صرف یہ فیصلہ کرنے کے لیے کہ آیا کوئی کمنٹ قاعدے کی خلاف ورزی کرتا ہے، سینکڑوں ٹوکنز خرچ کر دیتے ہیں۔ وہ ٹوکنز براہ راست کمپیوٹ لاگت میں تبدیل ہو جاتے ہیں، خاص طور پر بڑے پیمانے پر۔ Shieldstral کا سنگل ٹوکن جواب اس خرچ کو نمایاں طور پر کم کر دیتا ہے، جو اسے زیادہ ٹریفک والے کاموں کے لیے پرکشش بناتا ہے جہاں لیٹنسی (latency) اور قیمت اہمیت رکھتے ہیں۔

ٹیموں کے لیے عملی مشورے

  • عالمی بینچ مارکس پر بھروسہ نہ کریں۔ Shieldstral کی درستگی مختلف زبانوں میں مختلف ہوتی ہے؛ اسے اس مخصوص مواد پر آزمائیں جس کا آپ استعمال کریں گے۔
  • فل فائن ٹیوننگ کے بجائے LoRA کو ترجیح دیں۔ Low-rank adaptation (LoRA) صرف پیرامیٹرز کے ایک چھوٹے سیٹ کو اپ ڈیٹ کرتا ہے، جس سے بیس ماڈل کا لاگت کا فائدہ برقرار رہتا ہے۔
  • گہرے استدلال کے لیے بڑے ماڈلز محفوظ رکھیں۔ سادہ پالیسی چیک کے لیے Shieldstral کا استعمال کریں اور بڑے ماڈلز کو ان کاموں کے لیے رکھیں جنہیں واقعی وسیع سیاق و سباق (context) کی ضرورت ہو۔

ممکنہ نقصانات

پرامپٹ پر مبنی پالیسیوں پر ماڈل کا انحصار ہدایت کے متن کو ناکامی کا ایک نیا نقطہ بنا دیتا ہے۔ مبہم یا ناقص طور پر لکھی گئی پالیسیاں غیر متوقع اسکور پیدا کر سکتی ہیں۔ مزید برآں، چونکہ ماڈل اب بھی ایک فکسڈ 3B-پیرامیٹر بیک بون پر چلتا ہے، اس لیے پیچیدہ صورتحال (edge-case) کی منطق جس کے لیے وسیع عالمی معلومات کی ضرورت ہو، اس کے لیے اب بھی ایک بڑے ماڈل کی ضرورت پڑ سکتی ہے۔

خلاصہ: Shieldstral یہ ظاہر کرتا ہے کہ صحیح ٹریننگ کے ساتھ، ایک 3B ماڈل بہت سے حقیقی دنیا کے اعتدال پسندی کے کاموں کے لیے 20B گارڈ ماڈل کی جگہ لے سکتا ہے—جو کہ بہت کم قیمت پر وہی جواب فراہم کرتا ہے اور قواعد کو فوری طور پر تبدیل کرنے کی لچک بھی دیتا ہے۔