Автономная кампания Claude по поиску белков-биндеров показала 27%-ный показатель успеха, превзойдя типичные 10–15%, характерные для лабораторий с человеческим участием, и обогнав параллельные усилия людей на ту же мишень. Результат показывает, что массивный, грамотно составленный промпт может превратить языковую модель в виртуальный биотехнологический рабочий процесс, но также подчеркивает, насколько уязвимым остается такой подход, когда метрики уверенности модели дают сбой.
Эксперимент в цифрах
Компания Anthropic предоставила своей модели Claude полномасштабный протокол дизайна белков и фиксированный бюджет GPU, а затем позволила ей провести сквозную кампанию по 16 белковым мишеням. Одна мишень была исключена из-за неудачи на стороне лаборатории, в итоге осталось 15 жизнеспособных кампаний. В ходе этих кампаний Claude сгенерировала 1320 последовательностей-кандидатов; лабораторные тесты подтвердили, что 354 из них являются истинными биндерами, что обеспечило показатель успеха 26,8%.
Для сравнения, большинство проектов по поиску биндеров под руководством человека сообщают о доле попаданий в диапазоне от 10% до 15%. В прямом сравнении на мишени RBX1 участники-люди достигли показателя успеха 3,7%, в то время как разработки Claude достигли 31,1%. Модель также продемонстрировала способность к саморанжированию: единственный дизайн, который Claude пометила как лучший, оказался успешным в 49% случаев, а десять лучших дизайнов — в 39% случаев.
Где система потерпела неудачу
За этими цифрами скрываются две вопиющие слепые зоны. Claude полностью потерпела неудачу на мишени MBP и показала плохие результаты на мишени TNFα, однако внутренние показатели уверенности модели при этих запусках оставались высокими. Иными словами, модель была убеждена в своем успехе, в то время как результаты лабораторных исследований говорили об обратном. Эти неверно откалиброванные сигналы обнажают риск: автономный конвейер, который доверяет собственным метрикам, может тратить ресурсы на бесперспективные эксперименты.
Промпт-инжиниринг как новый лабораторный журнал
Самым поразительным аспектом исследования является не биология, а промпт, который ею управлял. Ведущий ученый обычно тратит недели на решение вопросов о том, какие области белка исследовать, какие вычислительные инструменты задействовать и как распределить вычислительное время. Anthropic сжала этот опыт в промпт объемом 16 000 слов — примерно длину короткого романа. Около двух третей текста касалось операционных вопросов: тайминга, мониторинга бюджета и оркестрации субагентов, вызывающих внешнее программное обеспечение.
Claude вызывала инструменты проектирования с открытым исходным кодом, такие как RFdiffusion (генератор структур на основе диффузии) и ProteinMPNN (сеть для дизайна последовательностей). Языковая модель выступала в роли планировщика, передавая промежуточные результаты между этими инструментами, корректируя параметры и решая, когда остановить цикл проектирования. По сути, промпт стал виртуальным менеджером лаборатории, освободив ученых от рутинной координации рабочих процессов.
Что представляют собой эти биндеры на самом деле
Все 354 подтвержденных попадания — это молекулы, которые физически прикрепляются к своим целевым белкам. В статье сообщается о результатах анализов на связывание, но не приводятся функциональные данные — нет доказательств того, что какой-либо биндер модулирует активность, стабилизирует конформацию или обладает терапевтическим потенциалом. Аналогично, структурная валидация (например, рентгеновская кристаллография или криоэлектронная микроскопия) отсутствует, поэтому точный механизм связывания остается гипотетическим. Таким образом, кампания демонстрирует доказательство концепции быстрого обнаружения биндеров, а не конвейер по созданию потенциальных лекарственных препаратов.
Ставки для биотехнологий и исследований в области ИИ
Если модель, управляемая промптом, сможет надежно воспроизводить или превосходить показатели успеха человека, биотехнологические фирмы смогут резко сократить затраты и время на ранних стадиях поиска. Однако неверно откалиброванные показатели уверенности на MBP и TNFα иллюстрируют, что полностью автономная система еще не готова к промышленной эксплуатации. Компаниям по-прежнему потребуется человеческий контроль для интерпретации метрик уверенности и подтверждения функциональной значимости.
С точки зрения ИИ, эта работа стирает грань между «инструментом» и «агентом». Claude не является новым алгоритмом проектирования белков; это универсальная языковая модель, которая может управлять существующими специализированными инструментами при наличии достаточно подробного набора инструкций. Эксперимент предполагает будущее, в котором ИИ будет выступать в роли «клея», связывающего воедино модульную экосистему научного ПО с открытым исходным кодом, а не заменять какой-то отдельный компонент.
Контраргумент: скрытая цена сложности промптов
Хотя в исследовании промпт объемом 16 000 слов преподносится как триумф фиксации знаний, сам его размер вызывает практические опасения. Создание такого документа требует глубокой предметной экспертизы, знакомства с базовыми инструментами и умения предвидеть граничные случаи. Иными словами, экспертиза никуда не исчезла — она просто переместилась от лабораторных ученых к промпт-инженерам.
Более того, зависимость от фиксированного бюджета GPU накладывает жесткое ограничение на глубину исследования. Человеческие команды могут динамически перераспределять ресурсы на основе промежуточных результатов, в то время как кампания Claude придерживалась заранее установленного бюджета, что потенциально ограничило широту охвата исследуемого пространства последовательностей.
На что обратить внимание в дальнейшем
В статье Anthropic остается несколько открытых вопросов. Будущие исследования должны будут решить проблему калибровки уверенности, чтобы самооценка модели соответствовала результатам экспериментов. Интеграция функциональных анализов — таких как ингибирование ферментов или клеточная активность — в автономный цикл приблизит технологию к разработке лекарств, а не просто к идентификации биндеров. Наконец, бенчмаркинг данного подхода на более широком наборе мишеней и при различных бюджетных условиях покажет, является ли наблюдаемая доля попаданий (hit rate) воспроизводимой или это случайная аномалия.
Вывод очевиден: детальная оркестрация промптов может превратить языковую модель в виртуальную биотехнологическую лабораторию, обеспечивая долю попаданий биндеров, превышающую средние показатели человека. Тем не менее, этот подход по-прежнему зависит от экспертного составления промптов и страдает от ошибок в оценке уверенности, которые могут сорвать дорогостоящие эксперименты. По мере того как сообщество будет совершенствовать эти пайплайны, баланс между автономией ИИ и человеческим контролем определит, станут ли такие системы рутинными инструментами или останутся экспериментальными диковинками.
