Anthropic telah menerapkan pembaruan signifikan pada model Fable 5 miliknya, yang secara drastis mengurangi jumlah kueri biologi jinak yang diblokir oleh lapisan keamanannya. Penyesuaian strategis ini bertujuan untuk memulihkan kegunaan bagi penelitian ilmiah yang sah sambil tetap mempertahankan perlindungan ketat terhadap ancaman biologi berisiko tinggi.
Mengurangi Hambatan bagi Penelitian Ilmiah
Dalam sebuah langkah yang dipicu oleh kritik dari komunitas ilmiah, Anthropic telah berhasil memangkas positif palsu pada filter keamanan biologi untuk Fable 5 sekitar 85 persen. Sebelumnya, pengklasifikasi keamanan model tersebut terlalu agresif, sering kali memblokir pertanyaan ilmiah yang sah dan mengalihkan pengguna ke model Opus 5 yang kurang mumpuni.
Pembaruan ini memungkinkan para peneliti dan profesional medis untuk memanfaatkan kemampuan penalaran penuh dari Fable 5 untuk berbagai tugas jinak. Pengguna kini dapat melakukan operasi kompleks seperti menafsirkan hasil laboratorium, menganalisis gejala klinis, dan menjawab pertanyaan medis yang canggih tanpa membentur "tembok keamanan" yang sebelumnya menghambat produktivitas.
Mempertahankan Batasan pada Risiko Penggunaan Ganda
Meskipun ada pelonggaran pembatasan biologi secara umum, Anthropic tetap mempertahankan sikap tegas terhadap penelitian "penggunaan ganda" (dual-use)—yaitu informasi yang dapat disalahgunakan untuk tujuan berbahaya. Perusahaan tidak mencabut pembatasan pada topik-topik yang sangat sensitif termasuk virologi, toksikologi, dan desain molekuler tingkat lanjut.
Penalaran Anthropic didasarkan pada sifat unik dari ancaman biologi. Berbeda dengan serangan siber, yang dapat dimitigasi melalui patch dan penonaktifan sistem, agen biologi yang telah dilepaskan hampir mustahil untuk "dimatikan" setelah mulai menyebar. Perusahaan menyebutkan beberapa kekhawatiran berisiko tinggi yang mendorong kehati-hatian ini, termasuk:
- Analisis dari badan intelijen AS mengenai risiko biologi.
- Penelitian yang menunjukkan bahwa AI dapat digunakan untuk merancang virus sintetis sepenuhnya.
- Upaya terdokumentasi oleh pengguna untuk meminta instruksi senjata biologi dari LLM yang ada.
Menyeimbangkan Keamanan dengan Akses Khusus
Tantangan bagi laboratorium AI adalah menavigasi ketegangan antara kemajuan ilmiah yang terbuka dan pencegahan penyalahgunaan yang katastrofik. Anthropic mencoba mengatasi hal ini dengan mengembangkan program akses khusus. Program-program ini dirancang untuk memungkinkan peneliti terverifikasi mengakses fitur-fitur terbatas—seperti yang melibatkan virologi atau pemodelan molekuler—dalam lingkungan yang terkendali dan diaudit.
Dengan membedakan antara pertanyaan medis yang jinak dan penelitian penggunaan ganda yang berbahaya, Anthropic mencoba menetapkan preseden tentang bagaimana model frontier menangani "garis depan biologi," memastikan bahwa alat-alat kedokteran modern tidak secara tidak sengaja menjadi alat terorisme biologi.
Poin-Poin Penting
- Pengurangan 85% pada Positif Palsu: Anthropic telah menurunkan hambatan secara signifikan untuk kueri biologi yang sah, menjauhkan pengguna dari Opus 5 yang diturunkan kemampuannya.
- Batasan Ketat pada Domain Berisiko Tinggi: Pembatasan ketat tetap diberlakukan untuk virologi, toksikologi, dan desain molekuler guna mencegah pembuatan senjata biologi.
- Akses Terkontrol bagi Peneliti: Anthropic sedang membangun program akses khusus untuk menyediakan kemampuan terbatas yang dibutuhkan oleh para ilmuwan yang telah diverifikasi untuk penelitian yang sah.
Anthropic telah memangkas blokir positif palsu pada kueri biologi yang jinak di model Fable 5 miliknya sekitar 85 persen, memulihkan akses ke kemampuan penalaran penuh model tersebut bagi para peneliti. Perubahan ini tetap mempertahankan perlindungan ketat pada topik biologi penggunaan ganda, menjaga agar model tetap dilarang memberikan instruksi yang dapat memungkinkan pembuatan senjata biologi.
Mengapa pembaruan ini penting
Lapisan keamanan Fable 5 awalnya dikalibrasi untuk lebih mengutamakan kehati-hatian, menandai banyak pertanyaan ilmiah yang sah sebagai risiko tinggi. Pengguna yang menanyakan interpretasi hasil lab rutin atau analisis gejala klinis secara rutin dialihkan ke model Opus 5 yang kurang mumpuni. Pemblokiran yang berlebihan ini memicu kritik dari komunitas ilmiah, yang berpendapat bahwa hambatan tersebut menghambat penelitian yang sesungguhnya dan memperlambat pengambilan keputusan medis. Dengan memangkas tingkat positif palsu sekitar empat perlima, Anthropic bertujuan untuk mengembalikan penalaran canggih model tersebut ke tangan para dokter, ahli biologi, dan profesional lainnya yang membutuhkannya untuk tugas sehari-hari.
Bagaimana filter diubah
Peningkatan ini berasal dari klasifikasi yang disetel ulang yang membedakan antara kueri biomedis biasa dan kueri yang bersinggungan dengan penelitian “dual-use”—informasi yang dapat disalahgunakan untuk tujuan berbahaya. Klasifikasi baru ini tetap mencegat permintaan yang melibatkan virologi, toksikologi, dan desain molekuler tingkat lanjut, tetapi mengizinkan pertanyaan tentang diagnostik standar, triase gejala, dan interpretasi data.
Insinyur Anthropic mencatat bahwa ancaman biologis berbeda dari ancaman siber: begitu patogen dilepaskan, ia tidak dapat ditambal atau dimatikan. Realitas tersebut mendorong keputusan untuk tetap bersikap tegas pada domain berisiko tinggi sambil melonggarkan batasan pada pertanyaan medis rutin.
Apa yang tetap dilarang
Model ini terus menolak permintaan yang dapat memfasilitasi pembuatan agen berbahaya. Secara khusus, setiap perintah yang mencari:
- protokol virologi terperinci yang dapat membantu sintesis virus,
- jalur toksikologi untuk bahan kimia yang dapat dijadikan senjata, atau
- instruksi rekayasa molekuler langkah demi langkah.
Anthropic mengutip tiga sumber untuk kehati-hatiannya: analisis dari badan intelijen AS yang menyoroti risiko biologis, penelitian yang menunjukkan bahwa AI dapat merancang virus sintetis sepenuhnya, dan upaya terdokumentasi oleh pengguna untuk meminta instruksi senjata biologis dari model bahasa yang ada.
Program akses untuk ilmuwan terverifikasi
Untuk menyeimbangkan penelitian terbuka dengan keamanan, Anthropic meluncurkan program akses khusus. Peneliti yang terverifikasi dapat mengajukan permohonan untuk lingkungan terkendali di mana kemampuan yang dibatasi dapat dibuka di bawah pengawasan audit. Program ini dirancang agar ilmuwan yang sah dapat mengeksplorasi topik berisiko tinggi—seperti platform vaksin baru atau pemodelan patogen—tanpa mengekspos masyarakat luas terhadap panduan yang berbahaya.
Kesimpulan
Dengan memangkas 85% pemblokiran positif palsu sambil tetap mempertahankan larangan ketat terhadap penggunaan ganda (dual-use), Anthropic bertujuan untuk memberikan kekuatan modelnya yang paling mumpuni kepada para peneliti tanpa membuka pintu bagi desain senjata biologis. Keberhasilan strategi keamanan yang terkalibrasi ini dapat menjadi templat tentang bagaimana model AI mutakhir menangani bidang ilmiah berisiko tinggi lainnya.
