Claudes autonome Protein-Binder-Kampagne verzeichnete eine Trefferquote von 27 %, womit sie die für von Menschen geführte Labore typischen 10–15 % übertraf und eine parallele menschliche Bemühung am selben Target übertraf. Das Ergebnis zeigt, dass ein massiver, präzise ausgearbeiteter Prompt ein Sprachmodell in einen virtuellen Biotech-Workflow verwandeln kann, verdeutlicht aber auch, wie fragil dieser Ansatz bleibt, wenn die Konfidenzmetriken des Modells fehlerhaft sind.

Das Experiment in Zahlen

Anthropic stellte seinem Claude-Modell ein umfassendes Protein-Design-Protokoll und ein festes GPU-Budget zur Verfügung und ließ es dann eine End-to-End-Kampagne über 16 Proteintargets durchführen. Ein Target wurde nach einem Fehler auf Laborseite verworfen, sodass 15 lebensfähige Kampagnen übrig blieben. Aus diesen generierte Claude 1.320 Kandidatensequenzen; Labortests bestätigten 354 als echte Binder, was eine Erfolgsquote von 26,8 % ergab.

Zum Vergleich: Die meisten von Menschen geleiteten Binder-Projekte berichten von Trefferquoten zwischen 10 % und 15 %. In einem direkten Vergleich am RBX1-Target erreichten menschliche Teilnehmer eine Trefferquote von 3,7 %, während Claudes Designs 31,1 % erreichten. Das Modell erwies sich zudem als fähig zur Selbstbewertung: Das einzige Design, das Claude als sein bestes markierte, war in 49 % der Fälle erfolgreich, und die zehn besten Designs waren in 39 % der Fälle erfolgreich.

Wo das System versagte

Die Zahlen verbergen zwei eklatante blinde Flecken. Claude scheiterte am MBP-Target vollständig und schnitt beim TNFα-Target schlecht ab, obwohl die internen Konfidenzwerte für diese Durchläufe hoch blieben. Mit anderen Worten: Das Modell war davon überzeugt, erfolgreich zu sein, während die Ergebnisse aus dem Wet-Lab eine andere Sprache sprachen. Diese falsch kalibrierten Signale offenbaren ein Risiko: Eine autonome Pipeline, die ihren eigenen Metriken vertraut, könnte Ressourcen für Sackgassen-Experimente verschwenden.

Prompt Engineering als das neue Laborbuch

Der auffälligste Aspekt der Studie ist nicht die Biologie, sondern der Prompt, der sie vorangetrieben hat. Ein leitender Wissenschaftler verbringt normalerweise Wochen damit, zu entscheiden, welche Proteinregionen untersucht werden sollen, welche computergestützten Werkzeuge eingesetzt werden und wie die Rechenzeit aufgeteilt wird. Anthropic komprimierte dieses Fachwissen in einen 16.000 Wörter umfassenden Prompt – etwa die Länge eines Kurzromans. Etwa zwei Drittel des Textes befassten sich mit operativen Belangen: Timing, Budgetüberwachung und der Orchestrierung von Sub-Agenten, die externe Software aufriefen.

Claude rief Open-Source-Design-Engines wie RFdiffusion (ein diffusionsbasierter Strukturgenerator) und ProteinMPNN (ein Sequenzdesign-Netzwerk) auf. Das Sprachmodell fungierte als Scheduler, der Zwischenergebnisse zwischen diesen Werkzeugen austauschte, Parameter anpasste und entschied, wann ein Designzyklus beendet wurde. Faktisch wurde der Prompt zu einem virtuellen Labormanager, der menschliche Wissenschaftler von den Details der Workflow-Koordination entlastete.

Was die Binder tatsächlich sind

Alle 354 bestätigten Treffer sind Moleküle, die sich physisch an ihre Zielproteine binden. Die Arbeit berichtet über Bindungsassays, liefert jedoch keine funktionalen Daten – es gibt keinen Beweis dafür, dass irgendein Binder die Aktivität moduliert, eine Konformation stabilisiert oder therapeutisches Potenzial aufweist. Ebenso fehlt die strukturelle Validierung (z. B. Röntgenkristallographie oder Kryo-EM), sodass der genaue Bindungsmodus spekulativ bleibt. Die Kampagne demonstriert daher einen Proof-of-Concept für die schnelle Entdeckung von Bindern, aber keine Pipeline, die Wirkstoffkandidaten liefert.

Bedeutung für die Biotech- und KI-Forschung

Wenn das promptgesteuerte Modell die Trefferquoten von Menschen zuverlässig reproduzieren oder übertreffen kann, könnten Biotech-Unternehmen die Kosten und den Zeitaufwand in der frühen Entdeckungsphase drastisch senken. Die falsch kalibrierten Konfidenzwerte bei MBP und TNFα illustrieren jedoch, dass ein vollautomatisches System noch nicht bereit für den produktiven Einsatz ist. Unternehmen würden weiterhin menschliche Aufsicht benötigen, um Konfidenzmetriken zu interpretieren und die funktionale Relevanz zu validieren.

Aus einer KI-Perspektive verwischt die Arbeit die Grenze zwischen „Werkzeug“ und „Agent“. Claude ist kein neuer Protein-Design-Algorithmus; es ist ein universelles Sprachmodell, das in der Lage ist, bestehende spezialisierte Werkzeuge zu orchestrieren, wenn es ein ausreichend detailliertes Anweisungssatz erhält. Das Experiment deutet auf eine Zukunft hin, in der KI als der Klebstoff fungiert, der ein modulares Ökosystem aus wissenschaftlicher Open-Source-Software zusammenhält, anstatt eine einzelne Komponente zu ersetzen.

Gegenargument: Die versteckten Kosten der Prompt-Komplexität

Während die Studie einen 16.000 Wörter umfassenden Prompt als Triumph der Wissenserfassung feiert, wirft gerade die Größe dieses Prompts praktische Bedenken auf. Die Erstellung eines solchen Dokuments erfordert tiefgreifendes Fachwissen, Vertrautheit mit den zugrunde liegenden Werkzeugen und die Fähigkeit, Grenzfälle vorherzusehen. Mit anderen Worten: Das Fachwissen ist nicht verschwunden – es ist von den Laborwissenschaftlern zu den Prompt Engineers gewandert.

Darüber hinaus führt die Abhängigkeit von einem festen GPU-Budget zu einer harten Einschränkung der Explorationstiefe. Menschliche Teams können Ressourcen basierend auf Zwischenergebnissen dynamisch neu zuteilen, während Claudes Kampagne an ein vordefiniertes Budget gebunden war, was potenziell die Breite des untersuchten Sequenzraums einschränkte.

Was als Nächstes zu beachten ist

Das Paper von Anthropic lässt mehrere Fragen offen. Zukünftige Arbeiten müssen die Konfidenz-Kalibrierung adressieren, damit die Selbsteinschätzung des Modells mit den experimentellen Ergebnissen übereinstimmt. Die Integration funktioneller Assays – wie etwa enzymatische Hemmung oder zelluläre Aktivität – in den autonomen Loop würde die Technologie näher an die Wirkstoffforschung als lediglich an die Binder-Identifizierung bringen. Schließlich wird das Benchmarking des Ansatzes über eine breitere Palette von Targets und unter variierenden Budgetbedingungen zeigen, ob die beobachtete Trefferquote reproduzierbar oder ein Ausreißer ist.

Das Fazit ist eindeutig: Eine detaillierte Prompt-Orchestrierung kann ein Sprachmodell in ein virtuelles Biotech-Labor verwandeln und Binder-Trefferquoten liefern, die den menschlichen Durchschnitt übertreffen. Dennoch hängt der Ansatz weiterhin von der Expertise bei der Prompt-Erstellung ab und leidet unter Fehleinschätzungen der Konfidenz, die kostspielige Experimente aus dem Kurs bringen könnten. Während die Community diese Pipelines verfeinert, wird das Gleichgewicht zwischen KI-Autonomie und menschlicher Aufsicht darüber entscheiden, ob solche Systeme zu Routine-Werkzeugen werden oder experimentelle Kuriositäten bleiben.