Claude’s autonome eiwitbinder-campagne behaalde een hitrate van 27%, waarmee het de typische 10-15% van door mensen geleide laboratoria verslaat en een parallel menselijk traject voor hetzelfde doelwit voorbijstreeft. Het resultaat laat zien dat een enorme, zorgvuldig geformuleerde prompt een taalmodel kan veranderen in een virtuele biotech-workflow, maar het benadrukt ook hoe kwetsbaar die aanpak nog is wanneer de betrouwbaarheidsmetrieken van het model ontsporen.
Het experiment in cijfers
Anthropic gaf zijn Claude-model een volledig eiwitontwerp-protocol en een vast GPU-budget, en liet het vervolgens een end-to-end campagne uitvoeren over 16 eiwitdoelwitten. Eén doelwit werd geschrapt na een mislukking in het lab, waardoor er 15 levensvatbare campagnes overbleven. Hiervan genereerde Claude 1.320 kandidaatsequenties; laboratoriumtests bevestigden 354 als echte binders, wat een succespercentage van 26,8% opleverde.
Ter vergelijking: de meeste door mensen geleide binder-projecten rapporteren hitrates tussen de 10% en 15%. In een directe vergelijking op het RBX1-doelwit behaalden menselijke deelnemers een hitrate van 3,7%, terwijl de ontwerpen van Claude 31,1% haalden. Het model bleek ook in staat tot zelf-rangschikking: het enkele ontwerp dat Claude als het beste aanwees, slaagde in 49% van de gevallen, en de top tien ontwerpen slaagden in 39% van de gevallen.
Waar het systeem tekortschoot
De cijfers verhullen twee duidelijke blinde vlekken. Claude faalde volledig op het MBP-doelwit en presteerde slecht op het TNFα-doelwit, terwijl de interne betrouwbaarheidsscores voor die runs hoog bleven. Met andere woorden: het model was ervan overtuigd dat het succesvol was, terwijl de resultaten uit het wet-lab een ander verhaal vertelden. Die misgekalibreerde signalen leggen een risico bloot: een autonome pijplijn die op zijn eigen metrieken vertrouwt, zou middelen kunnen verspillen aan doodlopende experimenten.
Prompt engineering als het nieuwe laboratoriumlogboek
Het meest opvallende aspect van de studie is niet de biologie, maar de prompt die het aanstuurde. Een senior wetenschapper besteedt doorgaans weken aan het beslissen welke eiwitregio's verkend moeten worden, welke computationele tools moeten worden aangeroepen en hoe de rekentijd moet worden toegewezen. Anthropic comprimeerde die expertise in een prompt van 16.000 woorden — ongeveer de lengte van een kort romanwerk. Ongeveer twee derde van de tekst ging over operationele zaken: timing, budgetbewaking en het orkestreren van sub-agenten die externe software aanriepen.
Claude riep open-source design-engines aan zoals RFdiffusion (een op diffusie gebaseerde structuurgenerator) en ProteinMPNN (een sequentie-ontwerpnetwerk). Het taalmodel fungeerde als een scheduler, waarbij tussenresultaten tussen deze tools werden doorgegeven, parameters werden aangepast en werd beslist wanneer een ontwerpcylcus moest worden gestopt. In feite werd de prompt een virtuele laboratoriummanager, waardoor menselijke wetenschappers worden ontlast van de details van workflow-coördinatie.
Wat de binders feitelijk zijn
Alle 354 bevestigde hits zijn moleculen die fysiek hechten aan hun doelwit-eiwitten. Het artikel rapporteert binding assays, maar biedt geen functionele gegevens — geen bewijs dat een binder activiteit moduleert, een conformatie stabiliseert of therapeutisch potentieel verto
Bovendien introduceert de afhankelijkheid van een vast GPU-budget een harde beperking op de verkenkingsdiepte. Menselijke teams kunnen middelen dynamisch herverdelen op basis van tussentijdse resultaten, terwijl de campagne van Claude zich hield aan een vooraf ingesteld budget, wat de breedte van de gesamplede sequentieruimte potentieel heeft beperkt.
Wat volgt hierna
Het paper van Anthropic laat verschillende open vragen achter. Toekomstig onderzoek zal zich moeten richten op de kalibratie van het vertrouwen, zodat de zelfevaluatie van het model overeenkomt met de experimentele resultaten. Het integreren van functionele assays — zoals enzymatische inhibitie of cellulaire activiteit — in de autonome lus zou de technologie dichter bij medicijnontwikkeling brengen in plaats van alleen bij de identificatie van binders. Tot slot zal het benchmarken van de aanpak bij een breder scala aan targets en onder verschillende budgetcondities onthullen of de geobserveerde hitrate reproduceerbaar is of een uitschieter.
De belangrijkste les is duidelijk: gedetailleerde prompt-orchestratie kan een taalmodel transformeren tot een virtueel biotech-lab, met binder-hitrates die de menselijke gemiddelden overtreffen. Toch blijft de aanpak afhankelijk van deskundig schrijven van prompts en kampt het met onjuiste betrouwbaarheidsschattingen die kostbare experimenten kunnen ontsporen. Naarmate de community deze pipelines verfijnt, zal de balans tussen AI-autonomie en menselijk toezicht bepalen of dergelijke systemen routinetools worden of experimentele curiositeiten blijven.
