Anthropic telah melaksanakan kemas kini penting kepada model Fable 5 miliknya, yang mengurangkan secara drastik jumlah pertanyaan biologi tidak berbahaya yang disekat oleh lapisan keselamatannya. Pelarasan strategik ini bertujuan untuk memulihkan kegunaan bagi penyelidikan saintifik yang sah sambil mengekalkan langkah keselamatan yang ketat terhadap ancaman biologi berisiko tinggi.
Mengurangkan Geseran untuk Penyelidikan Saintifik
Dalam satu langkah yang didorong oleh kritikan daripada komuniti saintifik, Anthropic telah berjaya mengurangkan positif palsu dalam penapis keselamatan biologi untuk Fable 5 sebanyak kira-kira 85 peratus. Sebelum ini, pengelasan keselamatan model tersebut adalah terlalu agresif, sering menyekat pertanyaan saintifik yang sah dan mengalihkan pengguna kepada model Opus 5 yang kurang berkemampuan.
Kemas kini ini membolehkan penyelidik dan profesional perubatan memanfaatkan sepenuhnya keupayaan penaakulan Fable 5 untuk pelbagai tugas tidak berbahaya. Pengguna kini boleh melakukan operasi kompleks seperti mentafsir keputusan makmal, menganalisis gejala klinikal, dan menjawab soalan perubatan yang canggih tanpa terlanggar "tembok keselamatan" yang sebelum ini menghalang produktiviti.
Mengekalkan Kawalan terhadap Risiko Kegunaan Dual (Dual-Use)
Walaupun terdapat kelonggaran dalam sekatan biologi umum, Anthropic tetap tegas terhadap penyelidikan "kegunaan dual" (dual-use)—maklumat yang boleh disalahgunakan untuk tujuan berbahaya. Syarikat tersebut tidak melonggarkan sekatan terhadap topik yang sangat sensitif termasuk virologi, toksikologi, dan reka bentuk molekul lanjutan.
Penaakulan Anthropic berasaskan sifat unik ancaman biologi. Tidak seperti serangan siber, yang boleh dikurangkan melalui tampalan (patches) dan penutupan sistem, ejen biologi yang telah dilepaskan hampir mustahil untuk "dihentikan" sebaik sahaja ia mula tersebar. Syarikat itu memetik beberapa kebimbangan berisiko tinggi yang mendorong langkah berhati-hati ini, termasuk:
- Analisis daripada agensi perisikan AS mengenai risiko biologi.
- Penyelidikan yang menunjukkan bahawa AI boleh digunakan untuk mereka bentuk virus sintetik sepenuhnya.
- Percubaan yang didokumentasikan oleh pengguna untuk meminta arahan senjata biologi daripada LLM sedia ada.
Mengimbangi Keselamatan dengan Akses Khusus
Cabaran bagi makmal AI adalah untuk mengemudi ketegangan antara kemajuan saintifik yang terbuka dan pencegahan penyalahgunaan yang membawa bencana. Anthropic sedang cuba menyelesaikan perkara ini dengan membangunkan program akses khusus. Program-program ini direka untuk membolehkan penyelidik yang disahkan mengakses ciri-ciri terhad—seperti yang melibatkan virologi atau pemodelan molekul—dalam persekitaran yang terkawal dan diaudit.
Dengan membezakan antara pertanyaan perubatan yang tidak berbahaya dan penyelidikan kegunaan dual yang berbahaya, Anthropic sedang cuba menetapkan duluan (precedent) tentang bagaimana model perintis (frontier models) mengendalikan "sempadan biologi," bagi memastikan peralatan perubatan moden tidak secara tidak sengaja menjadi alat bioterrorisme.
Ringkasan Utama
- Pengurangan 85% Positif Palsu: Anthropic telah menurunkan halangan secara ketara bagi pertanyaan biologi yang sah, mengalihkan pengguna daripada Opus 5 yang telah diturunkan tahapnya.
- Kawalan Tegas pada Domain Berisiko Tinggi: Sekatan ketat kekal dilaksanakan untuk virologi, toksikologi, dan reka bentuk molekul bagi menghalang penciptaan senjata biologi.
- Akses Terkawal untuk Penyelidik: Anthropic sedang membina program akses khusus untuk menyediakan saintis yang telah disaring dengan keupayaan terhad yang mereka perlukan untuk penyelidikan yang sah.
Anthropic telah mengurangkan sekatan positif palsu pada pertanyaan biologi tidak berbahaya dalam model Fable 5 miliknya sebanyak kira-kira 85 peratus, memulihkan akses kepada keupayaan penaakulan penuh model tersebut untuk penyelidik. Perubahan ini mengekalkan langkah keselamatan yang ketat terhadap topik biologi kegunaan dual, memastikan model tersebut tetap dilarang daripada memberikan arahan yang boleh membolehkan penghasilan senjata biologi.
Mengapa kemas kini ini penting
Lapisan keselamatan Fable 5 pada asalnya dilaraskan untuk lebih berhati-hati, dengan menandakan pelbagai soalan saintifik yang sah sebagai berisiko tinggi. Pengguna yang meminta tafsiran keputusan makmal rutin atau analisis gejala klinikal secara rutin dialihkan ke model Opus 5 yang kurang berkemampuan. Sekatan berlebihan ini mencetuskan kritikan daripada komuniti saintifik, yang berhujah bahawa geseran tersebut menghalang penyelidikan tulen dan melambatkan pembuatan keputusan perubatan. Dengan mengurangkan kadar positif palsu sebanyak kira-kira empat perlima, Anthropic bertujuan untuk mengembalikan penaakulan maju model tersebut kepada doktor, ahli biologi, dan profesional lain yang memerlukannya untuk tugas harian.
Bagaimana penapis telah diubah
The improvement stems from a retuned classifier that distinguishes between ordinary biomedical queries and those that touch on “dual-use” research—information that could be repurposed for harm. The new classifier still intercepts requests involving virology, toxicology, and advanced molecular design, but it lets through questions about standard diagnostics, symptom triage, and data interpretation.
Anthropic’s engineers noted that biological threats differ from cyber threats: once a pathogen is released, it cannot be patched or shut down. That reality drove the decision to keep a hard line on high-risk domains while loosening the net around routine medical inquiries.
What remains off-limits
The model continues to refuse requests that could facilitate the creation of harmful agents. Specifically, any prompt seeking:
- detailed virology protocols that could aid virus synthesis,
- toxicology pathways for weaponizable chemicals, or
- step-by-step molecular engineering instructions.
Anthropic cited three sources for its caution: analyses from U.S. intelligence agencies highlighting biological risk, research showing AI can design fully synthetic viruses, and documented attempts by users to solicit bioweapon instructions from existing language models.
Access program for vetted scientists
To balance open research with security, Anthropic is rolling out a specialized access program. Verified researchers can apply for a controlled environment where the restricted capabilities are unlocked under audit. The program is designed to let legitimate scientists explore high-risk topics—such as novel vaccine platforms or pathogen modeling—without exposing the broader public to dangerous guidance.
Takeaway
By cutting 85 % of false-positive blocks while keeping strict dual-use bans, Anthropic aims to give researchers the power of its most capable model without opening the door to bioweapon design. The success of this calibrated safety strategy could set a template for how frontier AI models handle other high-stakes scientific fields.
