Mistral AI در تاریخ ۴ اوت از Shieldstral رونمایی کرد؛ یک مدل «نگهبان» ۳ میلیارد پارامتری که با استفاده از تنها یک توکن، همان پاسخ نظارتی را ارائه میدهد که یک همتای ۲۰ میلیارد پارامتری تولید میکند. این عرضه نویدبخش یک لایه ایمنی ارزانتر و منعطفتر برای هر محصولی است که به فیلترینگ محتوا نیاز دارد.
چرا یک مدل کوچک میتواند فراتر از توان خود عمل کند
مدلهای نظارتی سنتی، قوانین سیاستگذاری را در وزنهای خود میگنجانند. اگر قانونی را تغییر دهید، باید دادهها را دوباره برچسبگذاری کنید، کل مدل را بازآموزی کنید و هزینه محاسبات اضافی بپردازید. Shieldstral این پارادایم را تغییر میدهد. این مدل، نظارت را به عنوان یک وظیفه پرسش و پاسخ ساده در نظر میگیرد:
- دستورالعمل (Instruction) – سیاستی که میخواهید اجرا شود.
- پرسش (Query) – تصمیمی که نیاز دارید (مثلاً: «آیا این ایمن است؟»).
- سند (Document) – متن یا تصویری که تحت بررسی است.
از آنجایی که سیاستگذاری در پرامپت قرار دارد، با تعویض یک پاراگراف، قانون بلافاصله بهروزرسانی میشود و نیازی به بازآموزی مدل نیست. این مدل همچنین یک امتیاز احتمال بین ۰ و ۱ برمیگرداند که به تیمها اجازه میدهد آستانههای سفارشی تعیین کنند: امتیازهای بالا باعث مسدودسازی خودکار میشوند، امتیازهای متوسط محتوا را به یک بازبین انسانی ارجاع میدهند و امتیازهای پایین اجازه عبور محتوا را میدهند.
ترفند آموزشی که باعث موفقیت آن میشود
Mistral مدل Shieldstral را با استفاده از جفتهای متضاد (contrastive pairs) آموزش داده است. برای هر قطعه محتوا، مدل دو نسخه را مشاهده کرد: یکی همراه با پاسخ «بله» و دیگری همراه با پاسخ «خیر». این کار مدل را مجبور کرد تا به جای حدس زدن بر اساس قوانین درونیشدهاش، دستورالعمل را بخواند. این رویکرد، عملکرد را نسبت به خط پایهای که بر وزنهای ایستا متکی بود، ۲۳ امتیاز بهبود بخشید.
این موضوع چه معنایی برای بودجههای ایمنی هوش مصنوعی دارد
مدلهای نگهبان بزرگ اغلب یک زنجیره استدلال کامل را اجرا میکنند که تنها برای تصمیمگیری در مورد اینکه آیا یک نظر قوانین را نقض میکند یا خیر، صدها توکن مصرف میکند. این توکنها مستقیماً به هزینههای محاسباتی تبدیل میشوند، بهویژه در مقیاس بالا. پاسخ تکتوکنی Shieldstral این هزینه را به شدت کاهش میدهد و آن را برای ترافیکهای با حجم بالا که در آنها تأخیر و قیمت اهمیت دارد، جذاب میکند.
نکات کاربردی برای تیمها
- به بنچمارکهای جهانی تکیه نکنید. دقت Shieldstral در زبانهای مختلف متفاوت است؛ آن را روی محتوای خاصی که ارائه خواهید داد، آزمایش کنید.
- LoRA را به بازتنظیم (fine-tuning) کامل ترجیح دهید. روش انطباق رتبه پایین (LoRA) تنها مجموعه کوچکی از پارامترها را بهروزرسانی میکند و مزیت هزینه مدل پایه را حفظ میکند.
- مدلهای بزرگ را برای استدلال عمیق رزرو کنید. از Shieldstral برای بررسیهای ساده سیاستگذاری استفاده کنید و مدلهای بزرگتر را برای وظایفی نگه دارید که واقعاً به بافت (context) گسترده نیاز دارند.
نقاط ضعف احتمالی
اتکای مدل به سیاستهای مبتنی بر پرامپت، متن دستورالعمل را به یک نقطه شکست جدید تبدیل میکند. سیاستهای مبهم یا بد نگارششده میتوانند امتیازهای غیرقابل پیشبینی تولید کنند. علاوه بر این، از آنجایی که مدل همچنان بر روی یک ستون فقرات ثابت ۳ میلیارد پارامتری اجرا میشود، استدلال در موارد خاص (edge-case) که از دانش جهانی گستردهتر بهره میبرد، ممکن است همچنان به یک مدل بزرگتر نیاز داشته باشد.
خلاصه کلام: Shieldstral نشان میدهد که با یک دستورالعمل آموزشی درست، یک مدل ۳ میلیارد پارامتری میتواند جایگزین یک مدل نگهبان ۲۰ میلیارد پارامتری برای بسیاری از وظایف نظارتی در دنیای واقعی شود؛ و همان پاسخ را با کسری از هزینه و با قابلیت تغییر قوانین در لحظه ارائه دهد.
