Anthropic بهروزرسانی مهمی را در مدل Fable 5 خود اعمال کرده است که باعث کاهش چشمگیر تعداد پرسوجوهای بیولوژیکی بیخطری شده است که توسط لایههای ایمنی آن مسدود میشدند. این تنظیم استراتژیک با هدف بازگرداندن کارایی برای تحقیقات علمی مشروع و در عین حال حفظ حفاظهای سختگیرانه در برابر تهدیدات بیولوژیکی پرخطر انجام شده است.
کاهش اصطکاک برای تحقیقات علمی
در اقدامی که در پاسخ به انتقادات جامعه علمی صورت گرفته است، Anthropic با موفقیت نرخ مثبت کاذب (false positives) در فیلترهای ایمنی بیولوژی مدل Fable 5 را تقریباً ۸۵ درصد کاهش داده است. پیش از این، طبقهبندیکننده ایمنی مدل بیش از حد تهاجمی عمل میکرد و مکرراً پرسوجوهای علمی مشروع را مسدود کرده و کاربران را به مدل کمتوانتر Opus 5 هدایت میکرد.
این بهروزرسانی به پژوهشگران و متخصصان پزشکی اجازه میدهد تا از تمام تواناییهای استدلالی Fable 5 برای طیف گستردهای از وظایف بیخطر بهره ببرند. اکنون کاربران میتوانند عملیات پیچیدهای مانند تفسیر نتایج آزمایشگاهی، تحلیل علائم بالینی و پاسخ به سوالات پیچیده پزشکی را بدون برخورد با «دیوار ایمنی» که پیش از این مانع بهرهوری میشد، انجام دهند.
حفظ حفاظها در برابر ریسکهای استفاده دوگانه
علیرغم کاهش محدودیتهای عمومی بیولوژی، Anthropic همچنان بر تحقیقات «استفاده دوگانه» (dual-use) — اطلاعاتی که میتواند برای آسیب رساندن بازسازی شود — پافشاری میکند. این شرکت محدودیتهای مربوط به موضوعات بسیار حساس از جمله ویروسشناسی، سمشناسی و طراحی مولکولی پیشرفته را لغو نکرده است.
استدلال Anthropic بر پایه ماهیت منحصربهفرد تهدیدات بیولوژیکی استوار است. برخلاف یک حمله سایبری که میتوان آن را از طریق وصلهها (patches) و خاموش کردن سیستم مهار کرد، یک عامل بیولوژیکی رها شده را پس از شروع انتشار، تقریباً غیرممکن است که بتوان «خاموش» کرد. این شرکت به چندین نگرانی حیاتی اشاره کرد که باعث این احتیاط شده است، از جمله:
- تحلیلهای آژانسهای اطلاعاتی ایالات متحده در مورد ریسکهای بیولوژیکی.
- تحقیقاتی که نشان میدهد هوش مصنوعی میتواند برای طراحی ویروسهای کاملاً مصنوعی استفاده شود.
- تلاشهای مستند کاربران برای درخواست دستورالعملهای سلاح بیولوژیکی از مدلهای زبانی بزرگ (LLM) موجود.
ایجاد تعادل میان ایمنی و دسترسی تخصصی
چالش آزمایشگاههای هوش مصنوعی، مدیریت تنش میان پیشرفت علمیِ باز و جلوگیری از سوءاستفادههای فاجعهبار است. Anthropic تلاش میکند این مسئله را از طریق توسعه برنامههای دسترسی تخصصی حل کند. این برنامهها به گونهای طراحی شدهاند که به پژوهشگران تأییدشده اجازه میدهند به ویژگیهای محدود شده — مانند موارد مربوط به ویروسشناسی یا مدلسازی مولکولی — در یک محیط کنترلشده و بازرسیشده دسترسی داشته باشند.
Anthropic با تمایز قائل شدن بین پرسوجوهای پزشکی بیخطر و تحقیقات خطرناک با استفاده دوگانه، در تلاش است تا الگویی برای نحوه برخورد مدلهای پیشرو (frontier models) با «مرزهای بیولوژیکی» ایجاد کند و اطمینان حاصل کند که ابزارهای پزشکی مدرن بهطور ناخواسته به ابزارهای تروریسم بیولوژیکی تبدیل نشوند.
نکات کلیدی
- کاهش ۸۵ درصدی مثبت کاذب: Anthropic به طور قابل توجهی مانع پرسوجوهای مشروع بیولوژی را کاهش داده و کاربران را از مدل پایینترشده Opus 5 دور کرده است.
- حفاظهای سختگیرانه در حوزههای پرخطر: محدودیتهای شدید برای ویروسشناسی، سمشناسی و طراحی مولکولی جهت جلوگیری از ساخت سلاحهای بیولوژیکی پابرجا مانده است.
- دسترسی کنترلشده برای پژوهشگران: Anthropic در حال ساخت برنامههای دسترسی خاصی است تا قابلیتهای محدود شده مورد نیاز دانشمندان تأییدشده را برای تحقیقات مشروع فراهم کند.
Anthropic مسدودسازیهای مثبت کاذب در پرسوجوهای بیولوژی بیخطر در مدل Fable 5 خود را حدود ۸۵ درصد کاهش داده است و دسترسی به تمام تواناییهای استدلالی مدل را برای پژوهشگران بازگردانده است. این تغییر، حفاظهای سختگیرانه در مورد موضوعات بیولوژیکی با استفاده دوگانه را حفظ میکند و مانع از ارائه دستورالعملهایی توسط مدل میشود که میتواند امکان ساخت سلاحهای بیولوژیکی را فراهم کند.
چرا این بهروزرسانی اهمیت دارد
لایه ایمنی Fable 5 در ابتدا به گونهای تنظیم شده بود که با احتیاط بیش از حد عمل کند و طیف گستردهای از سوالات علمی مشروع را به عنوان پرخطر علامتگذاری کند. کاربرانی که درخواست تفسیر روتین نتایج آزمایشگاهی یا تحلیل علائم بالینی داشتند، بهطور معمول به مدل کمتوانتر Opus 5 هدایت میشدند. این مسدودسازی بیش از حد، انتقاداتی را از سوی جامعه علمی برانگیخت؛ جامعهای که استدلال میکرد این اصطکاک مانع تحقیقات واقعی شده و تصمیمگیریهای پزشکی را کند میکند. Anthropic با کاهش نرخ مثبت کاذب به میزان تقریباً چهار پنجم، قصد دارد تواناییهای استدلالی پیشرفته این مدل را به دستان پزشکان، زیستشناسان و سایر متخصصانی که در وظایف روزمره به آن نیاز دارند، بازگرداند.
نحوه تغییر فیلترها
این بهبود از یک طبقهبندیکننده بازتنظیمشده نشأت میگیرد که بین پرسوجوهای معمول زیستپزشکی و مواردی که به تحقیقات «با کاربرد دوگانه» مربوط میشوند — اطلاعاتی که میتواند برای آسیب رساندن مورد استفاده مجدد قرار گیرد — تمایز قائل میشود. طبقهبندیکننده جدید همچنان درخواستهای مربوط به ویروسشناسی، سمشناسی و طراحی مولکولی پیشرفته را متوقف میکند، اما اجازه میدهد سوالات مربوط به تشخیصهای استاندارد، تریاژ علائم و تفسیر دادهها عبور کنند.
مهندسان Anthropic خاطرنشان کردند که تهدیدهای بیولوژیکی با تهدیدهای سایبری متفاوت هستند: زمانی که یک پاتوژن رها شود، نمیتوان آن را وصله کرد یا خاموش کرد. این واقعیت باعث شد تصمیم گرفته شود که در حوزههای پرخطر خط قرمز سختگیرانهای حفظ شود، در حالی که محدودیتها در مورد پرسوجوهای پزشکی معمول کاهش یابد.
آنچه همچنان ممنوع است
این مدل همچنان درخواستهایی را که میتواند تسهیلکننده ساخت عوامل آسیبزا باشد، رد میکند. بهطور مشخص، هر دستور (prompt) که به دنبال موارد زیر باشد:
- پروتکلهای دقیق ویروسشناسی که میتواند به سنتز ویروس کمک کند،
- مسیرهای سمشناسی برای مواد شیمیایی قابل تبدیل به سلاح، یا
- دستورالعملهای مهندسی مولکولی گامبهگام.
Anthropic برای احتیاط خود به سه منبع استناد کرد: تحلیلهای آژانسهای اطلاعاتی ایالات متحده که خطرات بیولوژیکی را برجسته میکنند، تحقیقاتی که نشان میدهد AI میتواند ویروسهای کاملاً مصنوعی طراحی کند، و تلاشهای مستند کاربران برای دریافت دستورالعملهای سلاح بیولوژیکی از مدلهای زبانی موجود.
برنامه دسترسی برای دانشمندان تأییدشده
برای ایجاد تعادل بین تحقیقات باز و امنیت، Anthropic در حال راهاندازی یک برنامه دسترسی تخصصی است. پژوهشگران تأییدشده میتوانند برای دسترسی به یک محیط کنترلشده درخواست دهند که در آن قابلیتهای محدود شده تحت نظارت (audit) باز میشوند. این برنامه طراحی شده است تا به دانشمندان مجاز اجازه دهد موضوعات پرخطر — مانند پلتفرمهای جدید واکسن یا مدلسازی پاتوژن — را بدون قرار دادن عموم مردم در معرض راهنماییهای خطرناک، بررسی کنند.
جمعبندی
Anthropic با کاهش ۸۵ درصدی مسدودسازیهای مثبت کاذب و در عین حال حفظ ممنوعیتهای سختگیرانه برای کاربردهای دوگانه، قصد دارد قدرت توانمندترین مدل خود را در اختیار پژوهشگران قرار دهد، بدون اینکه راه را برای طراحی سلاحهای بیولوژیکی باز کند. موفقیت این استراتژی ایمنیِ کالیبرهشده میتواند الگویی برای نحوه برخورد مدلهای پیشرو AI با سایر حوزههای علمی حساس باشد.
