Claude’un otonom protein bağlayıcı kampanyası %27'lik bir başarı oranı kaydederek, insan tarafından yönetilen laboratuvarların %10-15 arasındaki tipik oranlarını geride bıraktı ve aynı hedef üzerinde yürütülen paralel bir insan çabasını aşarak öne geçti. Sonuç, devasa ve iyi kurgulanmış bir istemin (prompt), bir dil modelini sanal bir biyoteknoloji iş akışına dönüştürebileceğini gösterirken; aynı zamanda modelin güven metrikleri sapma gösterdiğinde bu yaklaşımın ne kadar kırılgan kalabildiğini de vurguluyor.
Rakamlarla deney
Anthropic, Claude modeline tam ölçekli bir protein tasarım protokolü ve sabit bir GPU bütçesi verdi, ardından modelin 16 protein hedefi üzerinde uçtan uca bir kampanya yürütmesine izin verdi. Laboratuvar tarafındaki bir başarısızlık nedeniyle bir hedef elendi ve geriye 15 uygulanabilir kampanya kaldı. Claude bu kampanyalardan 1.320 aday dizi üretti; laboratuvar testleri bunlardan 354'ünün gerçek bağlayıcı olduğunu doğrulayarak %26,8'lik bir başarı oranı sağladı.
Karşılaştırma yapmak gerekirse, insan liderliğindeki çoğu bağlayıcı projesi %10 ile %15 arasında başarı oranları bildirmektedir. RBX1 hedefi üzerinde yapılan doğrudan bir karşılaştırmada, insan katılımcılar %3,7'lik bir başarı oranı elde ederken, Claude'un tasarımları %31,1'lik bir orana ulaştı. Model ayrıca kendi kendini sıralama yeteneğini de kanıtladı: Claude'un en iyi olarak işaretlediği tek tasarım %49 oranında başarılı olurken, en iyi on tasarım %39 oranında başarılı oldu.
Sistemin yetersiz kaldığı noktalar
Rakamlar iki bariz kör noktayı gizliyor. Claude, MBP hedefinde tamamen başarısız oldu ve TNFα hedefinde düşük performans gösterdi; ancak bu denemeler için dahili güven puanları yüksek kalmaya devam etti. Başka bir deyişle, ıslak laboratuvar çıktıları farklı bir hikaye anlatırken, model başarılı olduğuna ikna olmuş durumdaydı. Bu yanlış kalibre edilmiş sinyaller bir riski ortaya koyuyor: Kendi metriklerine güvenen otonom bir süreç, kaynakları çıkmaz sokak olan deneylerde boşa harcayabilir.
Yeni laboratuvar defteri olarak istem mühendisliği
Çalışmanın en çarpıcı yönü biyoloji değil, onu yönlendiren istemdir. Kıdemli bir bilim insanı genellikle hangi protein bölgelerinin keşfedileceğine, hangi hesaplamalı araçların çağrılacağına ve hesaplama süresinin nasıl tahsis edileceğine karar vermek için haftalarını harcar. Anthropic bu uzmanlığı, yaklaşık bir kısa roman uzunluğunda olan 16.000 kelimelik bir isteme sığdırdı. Metnin yaklaşık üçte ikisi operasyonel konularla ilgiliydi: zamanlama, bütçe izleme ve harici yazılımları çağıran alt ajanların koordinasyonu.
Claude; RFdiffusion (difüzyon tabanlı bir yapı oluşturucu) ve ProteinMPNN (bir dizi tasarım ağı) gibi açık kaynaklı tasarım motorlarını çağırdı. Dil modeli bir zamanlayıcı (scheduler) gibi hareket ederek, bu araçlar arasında ara sonuçları aktardı, parametreleri ayarladı ve bir tasarım döngüsünün ne zaman duracağına karar verdi. Sonuç olarak istem, insan bilim insanlarını iş akışı koordinasyonunun ayrıntılarından kurtaran sanal bir laboratuvar yöneticisine dönüştü.
Bağlayıcılar gerçekte nedir?
Onaylanan 354 isabetin tamamı, hedef proteinlerine fiziksel olarak bağlanan moleküllerdir. Makale bağlanma testlerini (binding assays) rapor ediyor ancak fonksiyonel veriler sunmuyor; yani herhangi bir bağlayıcının aktiviteyi modüle ettiğine, bir konformasyonu stabilize ettiğine veya terapötik bir potansiyel sergilediğine dair bir kanıt bulunmuyor. Benzer şekilde, yapısal doğrulama (örneğin X-ışını kristalografisi veya cryo-EM) mevcut olmadığından, kesin bağlanma modu spekülatif kalmaktadır. Bu nedenle kampanya, ilaç adayları sunan bir süreçten ziyade, hızlı bağlayıcı keşfi için bir kavram kanıtı (proof-of-concept) sunmaktadır.
Biyoteknoloji ve yapay zeka araştırmaları için önem
Eğer istem odaklı model, insan başarı oranlarını güvenilir bir şekilde yeniden üretebilir veya aşabilirse, biyoteknoloji firmaları erken aşama keşif maliyetlerini ve süresini ciddi oranda düşürebilir. Ancak, MBP ve TNFα üzerindeki yanlış kalibre edilmiş güven puanları, tamamen müdahalesiz bir sistemin henüz üretim aşamasına hazır olmadığını göstermektedir. Şirketlerin, güven metriklerini yorumlamak ve fonksiyonel geçerliliği doğrulamak için hala insan denetimine ihtiyacı olacaktır.
Yapay zeka perspektifinden bakıldığında, bu çalışma "araç" ile "ajan" arasındaki çizgiyi bulanıklaştırıyor. Claude yeni bir protein tasarım algoritması değildir; yeterince ayrıntılı bir talimat seti verildiğinde mevcut uzmanlaşmış araçları koordine edebilen genel amaçlı bir dil modelidir. Deney, yapay zekanın tek bir bileşenin yerini almaktan ziyade, açık kaynaklı bilimsel yazılımlardan oluşan modüler bir ekosistemi birbirine bağlayan bir yapıştırıcı olarak hareket ettiği bir geleceğe işaret ediyor.
Karşı görüş: İstem karmaşıklığının gizli maliyeti
Çalışma, 16.000 kelimelik bir istemi bilgi yakalamanın bir zaferi olarak övse de, bu istemin boyutu başlı başına pratik endişeler doğuruyor. Böyle bir belge hazırlamak; derin alan uzmanlığı, temel araçlara aşinalık ve uç durumları öngörebilme yeteneği gerektirir. Başka bir deyişle, uzmanlık yok olmamış; laboratuvar bilim insanlarından istem mühendislerine (prompt engineers) göç etmiştir.
Dahası, sabit bir GPU bütçesine olan bağımlılık, keşif derinliği üzerinde katı bir kısıtlama getiriyor. İnsan ekipleri, ara sonuçlara dayanarak kaynakları dinamik olarak yeniden tahsis edebilirken, Claude'un kampanyası önceden belirlenmiş bir bütçeye sadık kalarak örneklenen dizi uzayının genişliğini potansiyel olarak sınırladı.
Sırada nelere dikkat edilmeli
Anthropic'in makalesi birkaç açık soru bırakıyor. Gelecekteki çalışmalar, modelin öz değerlendirmesinin deneysel sonuçlarla uyumlu olması için güven kalibrasyonunu ele almak zorunda kalacaktır. Fonksiyonel testlerin (enzimatik inhibisyon veya hücresel aktivite gibi) otonom döngüye entegre edilmesi, teknolojiyi sadece bağlayıcı (binder) tanımlamanın ötesine taşıyarak ilaç keşfine yaklaştıracaktır. Son olarak, yaklaşımın daha geniş bir hedef kümesi üzerinde ve değişen bütçe koşulları altında kıyaslanması, gözlemlenen başarı oranının (hit rate) tekrarlanabilir mi yoksa bir aykırı değer mi olduğunu ortaya çıkaracaktır.
Buradan çıkarılacak ders açık: ayrıntılı prompt orkestrasyonu, bir dil modelini sanal bir biyoteknoloji laboratuvarına dönüştürerek insan ortalamalarını aşan bağlayıcı başarı oranları sunabilir. Ancak yaklaşım hala uzman prompt yazarlığına dayanıyor ve maliyetli deneyleri rayından çıkarabilecek güven hatalarından (confidence misfires) muzdarip. Topluluk bu iş akışlarını (pipelines) geliştirdikçe, yapay zeka otonomisi ile insan denetimi arasındaki denge, bu tür sistemlerin rutin araçlar mı olacağını yoksa deneysel merak unsurları olarak mı kalacağını belirleyecektir.
