Anthropic به‌روزرسانی مهمی را در مدل Fable 5 خود اعمال کرده است که باعث کاهش چشمگیر تعداد پرس‌وجوهای بیولوژیکی بی‌خطری شده است که توسط لایه‌های ایمنی آن مسدود می‌شدند. این تنظیم استراتژیک با هدف بازگرداندن کارایی برای تحقیقات علمی مشروع و در عین حال حفظ حفاظ‌های سخت‌گیرانه در برابر تهدیدات بیولوژیکی پرخطر انجام شده است.

کاهش اصطکاک برای تحقیقات علمی

در اقدامی که در پاسخ به انتقادات جامعه علمی صورت گرفته است، Anthropic با موفقیت نرخ مثبت کاذب (false positives) در فیلترهای ایمنی بیولوژی مدل Fable 5 را تقریباً ۸۵ درصد کاهش داده است. پیش از این، طبقه‌بندی‌کننده ایمنی مدل بیش از حد تهاجمی عمل می‌کرد و مکرراً پرس‌وجوهای علمی مشروع را مسدود کرده و کاربران را به مدل کم‌توان‌تر Opus 5 هدایت می‌کرد.

این به‌روزرسانی به پژوهشگران و متخصصان پزشکی اجازه می‌دهد تا از تمام توانایی‌های استدلالی Fable 5 برای طیف گسترده‌ای از وظایف بی‌خطر بهره ببرند. اکنون کاربران می‌توانند عملیات پیچیده‌ای مانند تفسیر نتایج آزمایشگاهی، تحلیل علائم بالینی و پاسخ به سوالات پیچیده پزشکی را بدون برخورد با «دیوار ایمنی» که پیش از این مانع بهره‌وری می‌شد، انجام دهند.

حفظ حفاظ‌ها در برابر ریسک‌های استفاده دوگانه

علی‌رغم کاهش محدودیت‌های عمومی بیولوژی، Anthropic همچنان بر تحقیقات «استفاده دوگانه» (dual-use) — اطلاعاتی که می‌تواند برای آسیب رساندن بازسازی شود — پافشاری می‌کند. این شرکت محدودیت‌های مربوط به موضوعات بسیار حساس از جمله ویروس‌شناسی، سم‌شناسی و طراحی مولکولی پیشرفته را لغو نکرده است.

استدلال Anthropic بر پایه ماهیت منحصر‌به‌فرد تهدیدات بیولوژیکی استوار است. برخلاف یک حمله سایبری که می‌توان آن را از طریق وصله‌ها (patches) و خاموش کردن سیستم مهار کرد، یک عامل بیولوژیکی رها شده را پس از شروع انتشار، تقریباً غیرممکن است که بتوان «خاموش» کرد. این شرکت به چندین نگرانی حیاتی اشاره کرد که باعث این احتیاط شده است، از جمله:

  • تحلیل‌های آژانس‌های اطلاعاتی ایالات متحده در مورد ریسک‌های بیولوژیکی.
  • تحقیقاتی که نشان می‌دهد هوش مصنوعی می‌تواند برای طراحی ویروس‌های کاملاً مصنوعی استفاده شود.
  • تلاش‌های مستند کاربران برای درخواست دستورالعمل‌های سلاح بیولوژیکی از مدل‌های زبانی بزرگ (LLM) موجود.

ایجاد تعادل میان ایمنی و دسترسی تخصصی

چالش آزمایشگاه‌های هوش مصنوعی، مدیریت تنش میان پیشرفت علمیِ باز و جلوگیری از سوءاستفاده‌های فاجعه‌بار است. Anthropic تلاش می‌کند این مسئله را از طریق توسعه برنامه‌های دسترسی تخصصی حل کند. این برنامه‌ها به گونه‌ای طراحی شده‌اند که به پژوهشگران تأییدشده اجازه می‌دهند به ویژگی‌های محدود شده — مانند موارد مربوط به ویروس‌شناسی یا مدل‌سازی مولکولی — در یک محیط کنترل‌شده و بازرسی‌شده دسترسی داشته باشند.

Anthropic با تمایز قائل شدن بین پرس‌وجوهای پزشکی بی‌خطر و تحقیقات خطرناک با استفاده دوگانه، در تلاش است تا الگویی برای نحوه برخورد مدل‌های پیشرو (frontier models) با «مرزهای بیولوژیکی» ایجاد کند و اطمینان حاصل کند که ابزارهای پزشکی مدرن به‌طور ناخواسته به ابزارهای تروریسم بیولوژیکی تبدیل نشوند.

نکات کلیدی

  • کاهش ۸۵ درصدی مثبت کاذب: Anthropic به طور قابل توجهی مانع پرس‌وجوهای مشروع بیولوژی را کاهش داده و کاربران را از مدل پایین‌ترشده Opus 5 دور کرده است.
  • حفاظ‌های سخت‌گیرانه در حوزه‌های پرخطر: محدودیت‌های شدید برای ویروس‌شناسی، سم‌شناسی و طراحی مولکولی جهت جلوگیری از ساخت سلاح‌های بیولوژیکی پابرجا مانده است.
  • دسترسی کنترل‌شده برای پژوهشگران: Anthropic در حال ساخت برنامه‌های دسترسی خاصی است تا قابلیت‌های محدود شده مورد نیاز دانشمندان تأییدشده را برای تحقیقات مشروع فراهم کند.

Anthropic مسدودسازی‌های مثبت کاذب در پرس‌وجوهای بیولوژی بی‌خطر در مدل Fable 5 خود را حدود ۸۵ درصد کاهش داده است و دسترسی به تمام توانایی‌های استدلالی مدل را برای پژوهشگران بازگردانده است. این تغییر، حفاظ‌های سخت‌گیرانه در مورد موضوعات بیولوژیکی با استفاده دوگانه را حفظ می‌کند و مانع از ارائه دستورالعمل‌هایی توسط مدل می‌شود که می‌تواند امکان ساخت سلاح‌های بیولوژیکی را فراهم کند.

چرا این به‌روزرسانی اهمیت دارد

لایه ایمنی Fable 5 در ابتدا به گونه‌ای تنظیم شده بود که با احتیاط بیش از حد عمل کند و طیف گسترده‌ای از سوالات علمی مشروع را به عنوان پرخطر علامت‌گذاری کند. کاربرانی که درخواست تفسیر روتین نتایج آزمایشگاهی یا تحلیل علائم بالینی داشتند، به‌طور معمول به مدل کم‌توان‌تر Opus 5 هدایت می‌شدند. این مسدودسازی بیش از حد، انتقاداتی را از سوی جامعه علمی برانگیخت؛ جامعه‌ای که استدلال می‌کرد این اصطکاک مانع تحقیقات واقعی شده و تصمیم‌گیری‌های پزشکی را کند می‌کند. Anthropic با کاهش نرخ مثبت کاذب به میزان تقریباً چهار پنجم، قصد دارد توانایی‌های استدلالی پیشرفته این مدل را به دستان پزشکان، زیست‌شناسان و سایر متخصصانی که در وظایف روزمره به آن نیاز دارند، بازگرداند.

نحوه تغییر فیلترها

این بهبود از یک طبقه‌بندی‌کننده بازتنظیم‌شده نشأت می‌گیرد که بین پرس‌وجوهای معمول زیست‌پزشکی و مواردی که به تحقیقات «با کاربرد دوگانه» مربوط می‌شوند — اطلاعاتی که می‌تواند برای آسیب رساندن مورد استفاده مجدد قرار گیرد — تمایز قائل می‌شود. طبقه‌بندی‌کننده جدید همچنان درخواست‌های مربوط به ویروس‌شناسی، سم‌شناسی و طراحی مولکولی پیشرفته را متوقف می‌کند، اما اجازه می‌دهد سوالات مربوط به تشخیص‌های استاندارد، تریاژ علائم و تفسیر داده‌ها عبور کنند.

مهندسان Anthropic خاطرنشان کردند که تهدیدهای بیولوژیکی با تهدیدهای سایبری متفاوت هستند: زمانی که یک پاتوژن رها شود، نمی‌توان آن را وصله کرد یا خاموش کرد. این واقعیت باعث شد تصمیم گرفته شود که در حوزه‌های پرخطر خط قرمز سخت‌گیرانه‌ای حفظ شود، در حالی که محدودیت‌ها در مورد پرس‌وجوهای پزشکی معمول کاهش یابد.

آنچه همچنان ممنوع است

این مدل همچنان درخواست‌هایی را که می‌تواند تسهیل‌کننده ساخت عوامل آسیب‌زا باشد، رد می‌کند. به‌طور مشخص، هر دستور (prompt) که به دنبال موارد زیر باشد:

  • پروتکل‌های دقیق ویروس‌شناسی که می‌تواند به سنتز ویروس کمک کند،
  • مسیرهای سم‌شناسی برای مواد شیمیایی قابل تبدیل به سلاح، یا
  • دستورالعمل‌های مهندسی مولکولی گام‌به‌گام.

Anthropic برای احتیاط خود به سه منبع استناد کرد: تحلیل‌های آژانس‌های اطلاعاتی ایالات متحده که خطرات بیولوژیکی را برجسته می‌کنند، تحقیقاتی که نشان می‌دهد AI می‌تواند ویروس‌های کاملاً مصنوعی طراحی کند، و تلاش‌های مستند کاربران برای دریافت دستورالعمل‌های سلاح بیولوژیکی از مدل‌های زبانی موجود.

برنامه دسترسی برای دانشمندان تأییدشده

برای ایجاد تعادل بین تحقیقات باز و امنیت، Anthropic در حال راه‌اندازی یک برنامه دسترسی تخصصی است. پژوهشگران تأییدشده می‌توانند برای دسترسی به یک محیط کنترل‌شده درخواست دهند که در آن قابلیت‌های محدود شده تحت نظارت (audit) باز می‌شوند. این برنامه طراحی شده است تا به دانشمندان مجاز اجازه دهد موضوعات پرخطر — مانند پلتفرم‌های جدید واکسن یا مدل‌سازی پاتوژن — را بدون قرار دادن عموم مردم در معرض راهنمایی‌های خطرناک، بررسی کنند.

جمع‌بندی

Anthropic با کاهش ۸۵ درصدی مسدودسازی‌های مثبت کاذب و در عین حال حفظ ممنوعیت‌های سخت‌گیرانه برای کاربردهای دوگانه، قصد دارد قدرت توانمندترین مدل خود را در اختیار پژوهشگران قرار دهد، بدون اینکه راه را برای طراحی سلاح‌های بیولوژیکی باز کند. موفقیت این استراتژی ایمنیِ کالیبره‌شده می‌تواند الگویی برای نحوه برخورد مدل‌های پیشرو AI با سایر حوزه‌های علمی حساس باشد.