Kampanye pengikat protein otonom Claude mencatat tingkat keberhasilan (hit rate) sebesar 27%, mengalahkan tingkat 10-15% yang biasanya dicapai oleh laboratorium yang dijalankan manusia, dan melampaui upaya manusia yang dilakukan secara paralel pada target yang sama. Hasil ini menunjukkan bahwa prompt yang masif dan disusun dengan baik dapat mengubah model bahasa menjadi alur kerja bioteknologi virtual, namun hal ini juga menyoroti betapa rapuhnya pendekatan tersebut ketika metrik kepercayaan model meleset.

Eksperimen dalam angka

Anthropic memberikan protokol desain protein skala penuh dan anggaran GPU yang tetap kepada model Claude miliknya, lalu membiarkannya menjalankan kampanye ujung-ke-ujung (end-to-end) pada 16 target protein. Satu target dihentikan setelah kegagalan di sisi laboratorium, menyisakan 15 kampanye yang layak. Dari kampanye tersebut, Claude menghasilkan 1.320 urutan kandidat; pengujian laboratorium mengonfirmasi 354 sebagai pengikat sejati (true binders), menghasilkan tingkat keberhasilan sebesar 26,8%.

Sebagai perbandingan, sebagian besar proyek pengikat yang dipimpin manusia melaporkan tingkat keberhasilan antara 10% hingga 15%. Dalam perbandingan langsung (head-to-head) pada target RBX1, peserta manusia mencapai tingkat keberhasilan 3,7% sementara desain Claude mencapai 31,1%. Model tersebut juga terbukti mampu melakukan pemeringkatan mandiri: satu desain yang ditandai Claude sebagai yang terbaik berhasil 49% dari waktu, dan sepuluh desain teratas berhasil 39% dari waktu.

Di mana sistem ini gagal

Angka-angka tersebut menyembunyikan dua titik buta yang mencolok. Claude gagal total pada target MBP dan berkinerja buruk pada target TNFα, namun skor kepercayaan internalnya tetap tinggi untuk pengujian tersebut. Dengan kata lain, model tersebut merasa yakin bahwa ia berhasil, sementara hasil pembacaan lab basah (wet-lab) menunjukkan hal yang berbeda. Sinyal yang salah kalibrasi tersebut menyingkap sebuah risiko: alur kerja (pipeline) otonom yang memercayai metriknya sendiri dapat membuang-buang sumber daya pada eksperimen yang buntu.

Prompt engineering sebagai buku catatan lab baru

Aspek yang paling mencolok dari studi ini bukanlah biologinya, melainkan prompt yang menggerakkannya. Seorang ilmuwan senior biasanya menghabiskan waktu berminggu-minggu untuk memutuskan wilayah protein mana yang akan dieksplorasi, alat komputasi mana yang akan digunakan, dan bagaimana mengalokasikan waktu komputasi. Anthropic memadatkan keahlian tersebut ke dalam sebuah prompt sepanjang 16.000 kata—kira-kira sepanjang sebuah novel pendek. Sekitar dua pertiga dari teks tersebut menangani masalah operasional: pengaturan waktu, pemantauan anggaran, dan pengorkestrasian sub-agen yang memanggil perangkat lunak eksternal.

Claude memanggil mesin desain sumber terbuka (open-source) seperti RFdiffusion (generator struktur berbasis difusi) dan ProteinMPNN (jaringan desain urutan). Model bahasa tersebut bertindak sebagai penjadwal (scheduler), menyalurkan hasil antara di antara alat-alat ini, menyesuaikan parameter, dan memutuskan kapan harus menghentikan siklus desain. Efeknya, prompt tersebut menjadi manajer laboratorium virtual, membebaskan ilmuwan manusia dari rincian koordinasi alur kerja.

Apa sebenarnya pengikat tersebut

Semua 354 temuan yang terkonfirmasi adalah molekul yang menempel secara fisik pada protein target mereka. Makalah tersebut melaporkan uji pengikatan (binding assays) tetapi tidak memberikan data fungsional—tidak ada bukti bahwa pengikat mana pun memodulasi aktivitas, menstabilkan konformasi, atau menunjukkan potensi terapeutik. Demikian pula, validasi struktural (misalnya, kristalografi sinar-X atau cryo-EM) tidak ada, sehingga mode pengikatan yang tepat tetap bersifat spekulatif. Oleh karena itu, kampanye ini mendemonstrasikan bukti konsep (proof-of-concept) untuk penemuan pengikat yang cepat, bukan alur kerja yang menghasilkan kandidat obat.

Taruhan bagi penelitian bioteknologi dan AI

Jika model berbasis prompt dapat mereproduksi atau melampaui tingkat keberhasilan manusia secara andal, perusahaan bioteknologi dapat memangkas biaya dan waktu penemuan tahap awal. Namun, skor kepercayaan yang salah kalibrasi pada MBP dan TNFα mengilustrasikan bahwa sistem yang sepenuhnya tanpa pengawasan (hands-off) belum siap untuk produksi. Perusahaan masih akan membutuhkan pengawasan manusia untuk menginterpretasikan metrik kepercayaan dan memvalidasi relevansi fungsional.

Dari perspektif AI, karya ini mengaburkan batas antara "alat" dan "agen". Claude bukanlah algoritma desain protein baru; ia adalah model bahasa serbaguna yang dapat mengorkestrasi alat khusus yang sudah ada ketika diberikan instruksi yang cukup mendetail. Eksperimen ini menunjukkan masa depan di mana AI bertindak sebagai perekat yang menyatukan ekosistem perangkat lunak ilmiah sumber terbuka yang modular, alih-alih menggantikan komponen tunggal apa pun.

Argumen Penyeimbang: biaya tersembunyi dari kompleksitas prompt

Meskipun studi ini mengunggulkan prompt 16.000 kata sebagai keberhasilan penangkapan pengetahuan, ukuran prompt tersebut justru menimbulkan kekhawatiran praktis. Menyusun dokumen seperti itu memerlukan keahlian domain yang mendalam, keakraban dengan alat-alat yang mendasarinya, dan kemampuan untuk mengantisipasi kasus ekstrem (edge cases). Dengan kata lain, keahlian tersebut tidak hilang—ia hanya berpindah dari ilmuwan laboratorium ke prompt engineer.

Moreover, the reliance on a fixed GPU budget introduces a hard constraint on exploration depth. Human teams can reallocate resources dynamically based on interim results, whereas Claude’s campaign adhered to a pre-set budget, potentially limiting the breadth of sequence space sampled.

What to watch next

Anthropic’s paper leaves several open questions. Future work will need to address confidence calibration so that the model’s self-assessment aligns with experimental outcomes. Integrating functional assays—such as enzymatic inhibition or cellular activity—into the autonomous loop would move the technology closer to drug discovery rather than just binder identification. Finally, benchmarking the approach across a broader set of targets and under varying budget conditions will reveal whether the observed hit rate is reproducible or an outlier.

The takeaway is clear: detailed prompt orchestration can turn a language model into a virtual biotech lab, delivering binder hit rates that outstrip human averages. Yet the approach still hinges on expert prompt authorship and suffers from confidence misfires that could derail costly experiments. As the community refines these pipelines, the balance between AI autonomy and human oversight will determine whether such systems become routine tools or remain experimental curiosities.