Mistral AI در تاریخ ۴ اوت از Shieldstral رونمایی کرد؛ یک مدل «نگهبان» ۳ میلیارد پارامتری که با استفاده از تنها یک توکن، همان پاسخ نظارتی را ارائه می‌دهد که یک همتای ۲۰ میلیارد پارامتری تولید می‌کند. این عرضه نویدبخش یک لایه ایمنی ارزان‌تر و منعطف‌تر برای هر محصولی است که به فیلترینگ محتوا نیاز دارد.

چرا یک مدل کوچک می‌تواند فراتر از توان خود عمل کند

مدل‌های نظارتی سنتی، قوانین سیاست‌گذاری را در وزن‌های خود می‌گنجانند. اگر قانونی را تغییر دهید، باید داده‌ها را دوباره برچسب‌گذاری کنید، کل مدل را بازآموزی کنید و هزینه محاسبات اضافی بپردازید. Shieldstral این پارادایم را تغییر می‌دهد. این مدل، نظارت را به عنوان یک وظیفه پرسش و پاسخ ساده در نظر می‌گیرد:

  • دستورالعمل (Instruction) – سیاستی که می‌خواهید اجرا شود.
  • پرسش (Query) – تصمیمی که نیاز دارید (مثلاً: «آیا این ایمن است؟»).
  • سند (Document) – متن یا تصویری که تحت بررسی است.

از آنجایی که سیاست‌گذاری در پرامپت قرار دارد، با تعویض یک پاراگراف، قانون بلافاصله به‌روزرسانی می‌شود و نیازی به بازآموزی مدل نیست. این مدل همچنین یک امتیاز احتمال بین ۰ و ۱ برمی‌گرداند که به تیم‌ها اجازه می‌دهد آستانه‌های سفارشی تعیین کنند: امتیازهای بالا باعث مسدودسازی خودکار می‌شوند، امتیازهای متوسط محتوا را به یک بازبین انسانی ارجاع می‌دهند و امتیازهای پایین اجازه عبور محتوا را می‌دهند.

ترفند آموزشی که باعث موفقیت آن می‌شود

Mistral مدل Shieldstral را با استفاده از جفت‌های متضاد (contrastive pairs) آموزش داده است. برای هر قطعه محتوا، مدل دو نسخه را مشاهده کرد: یکی همراه با پاسخ «بله» و دیگری همراه با پاسخ «خیر». این کار مدل را مجبور کرد تا به جای حدس زدن بر اساس قوانین درونی‌شده‌اش، دستورالعمل را بخواند. این رویکرد، عملکرد را نسبت به خط پایه‌ای که بر وزن‌های ایستا متکی بود، ۲۳ امتیاز بهبود بخشید.

این موضوع چه معنایی برای بودجه‌های ایمنی هوش مصنوعی دارد

مدل‌های نگهبان بزرگ اغلب یک زنجیره استدلال کامل را اجرا می‌کنند که تنها برای تصمیم‌گیری در مورد اینکه آیا یک نظر قوانین را نقض می‌کند یا خیر، صدها توکن مصرف می‌کند. این توکن‌ها مستقیماً به هزینه‌های محاسباتی تبدیل می‌شوند، به‌ویژه در مقیاس بالا. پاسخ تک‌توکنی Shieldstral این هزینه را به شدت کاهش می‌دهد و آن را برای ترافیک‌های با حجم بالا که در آن‌ها تأخیر و قیمت اهمیت دارد، جذاب می‌کند.

نکات کاربردی برای تیم‌ها

  • به بنچمارک‌های جهانی تکیه نکنید. دقت Shieldstral در زبان‌های مختلف متفاوت است؛ آن را روی محتوای خاصی که ارائه خواهید داد، آزمایش کنید.
  • LoRA را به بازتنظیم (fine-tuning) کامل ترجیح دهید. روش انطباق رتبه پایین (LoRA) تنها مجموعه کوچکی از پارامترها را به‌روزرسانی می‌کند و مزیت هزینه مدل پایه را حفظ می‌کند.
  • مدل‌های بزرگ را برای استدلال عمیق رزرو کنید. از Shieldstral برای بررسی‌های ساده سیاست‌گذاری استفاده کنید و مدل‌های بزرگ‌تر را برای وظایفی نگه دارید که واقعاً به بافت (context) گسترده نیاز دارند.

نقاط ضعف احتمالی

اتکای مدل به سیاست‌های مبتنی بر پرامپت، متن دستورالعمل را به یک نقطه شکست جدید تبدیل می‌کند. سیاست‌های مبهم یا بد نگارش‌شده می‌توانند امتیازهای غیرقابل پیش‌بینی تولید کنند. علاوه بر این، از آنجایی که مدل همچنان بر روی یک ستون فقرات ثابت ۳ میلیارد پارامتری اجرا می‌شود، استدلال در موارد خاص (edge-case) که از دانش جهانی گسترده‌تر بهره می‌برد، ممکن است همچنان به یک مدل بزرگ‌تر نیاز داشته باشد.

خلاصه کلام: Shieldstral نشان می‌دهد که با یک دستورالعمل آموزشی درست، یک مدل ۳ میلیارد پارامتری می‌تواند جایگزین یک مدل نگهبان ۲۰ میلیارد پارامتری برای بسیاری از وظایف نظارتی در دنیای واقعی شود؛ و همان پاسخ را با کسری از هزینه و با قابلیت تغییر قوانین در لحظه ارائه دهد.