Kempen pengikat protein autonomi Claude mencatatkan kadar kejayaan sebanyak 27%, mengatasi kadar tipikal 10-15% yang dicapai oleh makmal yang dikendalikan manusia, serta memintas usaha manusia yang selari pada sasaran yang sama. Keputusan ini menunjukkan bahawa satu arahan (prompt) yang besar dan dirangka dengan baik boleh mengubah model bahasa menjadi aliran kerja bioteknologi maya, namun ia juga menonjolkan betapa rapuhnya pendekatan tersebut apabila metrik keyakinan model tersasar.
Eksperimen dalam angka
Anthropic memberikan model Claude miliknya protokol reka bentuk protein berskala penuh dan bajet GPU yang tetap, kemudian membiarkannya menjalankan kempen hujung-ke-hujung merentasi 16 sasaran protein. Satu sasaran telah digugurkan selepas kegagalan di pihak makmal, meninggalkan 15 kempen yang boleh dilaksanakan. Daripada kempen tersebut, Claude menjana 1,320 jujukan calon; ujian makmal mengesahkan 354 daripadanya sebagai pengikat sebenar, menghasilkan kadar kejayaan 26.8%.
Sebagai perbandingan, kebanyakan projek pengikat yang diterajui manusia melaporkan kadar kejayaan antara 10% hingga 15%. Dalam perbandingan secara langsung pada sasaran RBX1, peserta manusia mencapai kadar kejayaan 3.7% manakala reka bentuk Claude mencapai 31.1%. Model tersebut juga terbukti mampu menyusun kedudukan sendiri: satu reka bentuk tunggal yang ditandakan oleh Claude sebagai yang terbaik berjaya sebanyak 49% daripada masa, dan sepuluh reka bentuk teratas berjaya sebanyak 39% daripada masa.
Di mana sistem ini gagal
Angka-angka tersebut menyembunyikan dua titik buta yang ketara. Claude gagal sepenuhnya pada sasaran MBP dan menunjukkan prestasi buruk pada sasaran TNFα, namun skor keyakinan dalamannya kekal tinggi untuk larian tersebut. Dalam erti kata lain, model itu yakin bahawa ia sedang berjaya, sedangkan bacaan makmal basah (wet-lab) menunjukkan cerita yang berbeza. Isyarat yang tidak ditentukur dengan betul ini mendedahkan satu risiko: saluran paip (pipeline) autonomi yang mempercayai metriknya sendiri boleh membazirkan sumber pada eksperimen yang menemui jalan buntu.
Kejuruteraan arahan (Prompt engineering) sebagai buku nota makmal baharu
Aspek yang paling menonjol dalam kajian ini bukanlah biologi, tetapi arahan yang menggerakkannya. Seorang saintis kanan biasanya menghabiskan masa berminggu-minggu untuk memutuskan kawasan protein mana yang perlu diterokai, alat pengkomputeran mana yang perlu digunakan, dan bagaimana untuk memperuntukkan masa pengkomputeran. Anthropic memampatkan kepakaran tersebut ke dalam satu arahan sepanjang 16,000 patah perkataan—kira-kira sepanjang sebuah novel pendek. Kira-kira dua pertiga daripada teks tersebut berkaitan dengan kebimbangan operasi: pemasaan, pemantauan bajet, dan penyelarasan sub-ejen yang memanggil perisian luaran.
Claude memanggil enjin reka bentuk sumber terbuka seperti RFdiffusion (penjana struktur berasaskan difusi) dan ProteinMPNN (rangkaian reka bentuk jujukan). Model bahasa tersebut bertindak sebagai penjadual, menyalurkan keputusan perantara antara alat-alat ini, melaraskan parameter, dan memutuskan bila untuk menghentikan kitaran reka bentuk. Kesannya, arahan tersebut menjadi pengurus makmal maya, membebaskan saintis manusia daripada perincian penyelarasan aliran kerja.
Apakah sebenarnya pengikat tersebut
Kesemua 354 kejayaan yang disahkan adalah molekul yang melekat secara fizikal pada protein sasaran mereka. Kertas kajian tersebut melaporkan ujian pengikatan tetapi tidak menyediakan data fungsian—tiada bukti bahawa mana-mana pengikat mengawal selia aktiviti, menstabilkan konformasi, atau menunjukkan potensi terapeutik. Begitu juga, pengesahan struktur (contohnya, kristalografi sinar-X atau cryo-EM) tidak disertakan, jadi mod pengikatan yang tepat kekal spekulatif. Oleh itu, kempen ini menunjukkan bukti konsep untuk penemuan pengikat yang pantas, bukannya saluran paip yang menghasilkan calon ubat.
Pertaruhan bagi penyelidikan bioteknologi dan AI
Jika model berasaskan arahan ini dapat menghasilkan semula atau mengatasi kadar kejayaan manusia secara konsisten, firma bioteknologi boleh mengurangkan kos dan masa penemuan peringkat awal secara drastik. Walau bagaimanapun, skor keyakinan yang tidak ditentukur pada MBP dan TNFα menunjukkan bahawa sistem yang sepenuhnya tanpa pengawasan manusia belum bersedia untuk pengeluaran. Syarikat masih memerlukan pengawasan manusia untuk mentafsir metrik keyakinan dan mengesahkan kaitan fungsian.
Dari perspektif AI, kerja ini mengaburkan garis pemisah antara "alat" dan "ejen." Claude bukanlah algoritma reka bentuk protein yang baharu; ia adalah model bahasa tujuan umum yang boleh menyelaraskan alat khusus yang sedia ada apabila diberikan set arahan yang cukup terperinci. Eksperimen ini mencadangkan masa depan di mana AI bertindak sebagai pelekat yang menyatukan ekosistem modular perisian saintifik sumber terbuka, dan bukannya menggantikan mana-mana komponen tunggal.
Pandangan berbeza: kos tersembunyi dalam kerumitan arahan
Walaupun kajian ini menonjolkan arahan 16,000 patah perkataan sebagai kejayaan dalam pemerolehan pengetahuan, saiz arahan tersebut menimbulkan kebimbangan praktikal. Merangka dokumen sedemikian memerlukan kepakaran domain yang mendalam, kebiasaan dengan alat yang digunakan, dan keupayaan untuk menjangka kes-kes ekstrem (edge cases). Dalam erti kata lain, kepakaran tersebut tidak hilang—ia telah berpindah daripada saintis makmal kepada jurutera arahan (prompt engineers).
Tambahan pula, pergantungan kepada bajet GPU yang tetap memperkenalkan kekangan tegar terhadap kedalaman penerokaan. Pasukan manusia boleh mengagihkan semula sumber secara dinamik berdasarkan keputusan interim, manakala kempen Claude mematuhi bajet yang telah ditetapkan, yang berpotensi mengehadkan keluasan ruang jujukan yang disampel.
Apa yang perlu diperhatikan seterusnya
Kertas kerja Anthropic meninggalkan beberapa persoalan terbuka. Kerja masa hadapan perlu menangani kalibrasi keyakinan supaya penilaian kendiri model selaras dengan hasil eksperimen. Mengintegrasikan asai fungsian—seperti penghambatan enzimatik atau aktiviti selular—ke dalam gelung autonomi akan membawa teknologi ini lebih dekat kepada penemuan ubat berbanding sekadar pengenalpastian pengikat. Akhir sekali, penandaarasan pendekatan ini merentasi set sasaran yang lebih luas dan di bawah keadaan bajet yang berbeza akan mendedahkan sama ada kadar kejayaan yang diperhatikan boleh diulang atau merupakan satu pencilan.
Kesimpulannya adalah jelas: orkestrasi prom yang terperinci boleh mengubah model bahasa menjadi makmal bioteknologi maya, memberikan kadar kejayaan pengikat yang mengatasi purata manusia. Namun, pendekatan ini masih bergantung kepada kepakaran penulisan prom dan mengalami ralat keyakinan yang boleh menggagalkan eksperimen yang menelan kos tinggi. Apabila komuniti memperhalusi saluran kerja ini, keseimbangan antara autonomi AI dan pengawasan manusia akan menentukan sama ada sistem sedemikian menjadi alat rutin atau kekal sebagai keunikan eksperimen semata-mata.
