Chiến dịch tìm kiếm chất liên kết protein tự động của Claude đạt tỷ lệ thành công (hit rate) 27%, vượt qua mức 10-15% thông thường ở các phòng thí nghiệm do con người vận hành và vượt xa nỗ lực song song của con người trên cùng một mục tiêu. Kết quả này cho thấy một câu lệnh (prompt) khổng lồ và được soạn thảo kỹ lưỡng có thể biến một mô hình ngôn ngữ thành một quy trình làm việc công nghệ sinh học ảo, nhưng nó cũng nhấn mạnh sự mong manh của phương pháp này khi các chỉ số tin cậy của mô hình bị sai lệch.

Các con số từ thực nghiệm

Anthropic đã cung cấp cho mô hình Claude của mình một quy trình thiết kế protein toàn diện và một ngân sách GPU cố định, sau đó để nó thực hiện một chiến dịch xuyên suốt trên 16 mục tiêu protein. Một mục tiêu đã bị loại bỏ sau thất bại tại phòng thí nghiệm, để lại 15 chiến dịch khả thi. Từ đó, Claude đã tạo ra 1.320 trình tự ứng viên; thử nghiệm tại phòng thí nghiệm đã xác nhận 354 trình tự là chất liên kết thực sự, mang lại tỷ lệ thành công 26,8%.

Để so sánh, hầu hết các dự án tìm kiếm chất liên kết do con người dẫn dắt đều báo cáo tỷ lệ thành công từ 10% đến 15%. Trong một cuộc đối đầu trực tiếp trên mục tiêu RBX1, những người tham gia là con người đạt tỷ lệ thành công 3,7%, trong khi các thiết kế của Claude đạt 31,1%. Mô hình cũng chứng minh khả năng tự xếp hạng: thiết kế duy nhất mà Claude đánh dấu là tốt nhất đã thành công 49% số lần, và mười thiết kế hàng đầu thành công 39% số lần.

Những điểm hạn chế của hệ thống

Những con số này che giấu hai điểm mù rõ rệt. Claude đã thất bại hoàn toàn với mục tiêu MBP và hoạt động kém trên mục tiêu TNFα, mặc dù điểm tin cậy nội bộ của nó vẫn ở mức cao trong các lần chạy đó. Nói cách khác, mô hình tin chắc rằng nó đang thành công trong khi các kết quả đo đạc tại phòng thí nghiệm thực nghiệm (wet-lab) lại cho thấy một câu chuyện khác. Những tín hiệu bị sai lệch này bộc lộ một rủi ro: một quy trình tự động quá tin tưởng vào các chỉ số của chính mình có thể lãng phí tài nguyên vào các thí nghiệm không có kết quả.

Kỹ thuật câu lệnh như một cuốn sổ tay phòng thí nghiệm mới

Khía cạnh ấn tượng nhất của nghiên cứu không phải là sinh học mà là câu lệnh đã điều khiển nó. Một nhà khoa học cấp cao thường mất nhiều tuần để quyết định vùng protein nào cần khám phá, công cụ tính toán nào cần sử dụng và cách phân bổ thời gian tính toán. Anthropic đã nén chuyên môn đó vào một câu lệnh dài 16.000 từ—tương đương độ dài của một cuốn tiểu thuyết ngắn. Khoảng hai phần ba văn bản giải quyết các vấn đề vận hành: thời gian, giám sát ngân sách và điều phối các tác nhân phụ (sub-agents) để gọi các phần mềm bên ngoài.

Claude đã gọi các công cụ thiết kế mã nguồn mở như RFdiffusion (một trình tạo cấu trúc dựa trên khuếch tán) và ProteinMPNN (một mạng lưới thiết kế trình tự). Mô hình ngôn ngữ đóng vai trò như một bộ lập lịch (scheduler), truyền các kết quả trung gian giữa các công cụ này, điều chỉnh các tham số và quyết định khi nào nên dừng một chu kỳ thiết kế. Trên thực tế, câu lệnh đã trở thành một quản lý phòng thí nghiệm ảo, giải phóng các nhà khoa học khỏi những chi tiết vụn vặt trong việc điều phối quy trình làm việc.

Bản chất thực sự của các chất liên kết

Tất cả 354 kết quả thành công được xác nhận đều là các phân tử gắn kết vật lý với các protein mục tiêu của chúng. Bài báo báo cáo các xét nghiệm liên kết nhưng không cung cấp dữ liệu chức năng—không có bằng chứng cho thấy bất kỳ chất liên kết nào điều chỉnh hoạt tính, ổn định cấu hình hoặc thể hiện tiềm năng điều trị. Tương tự, việc xác thực cấu trúc (ví dụ: tinh thể học tia X hoặc cryo-EM) cũng không có, vì vậy chế độ liên kết chính xác vẫn chỉ là suy đoán. Do đó, chiến dịch này chứng minh một khái niệm thực tế (proof-of-concept) cho việc khám phá nhanh các chất liên kết, chứ không phải là một quy trình cung cấp các ứng viên thuốc.

Tầm quan trọng đối với nghiên cứu công nghệ sinh học và AI

Nếu mô hình điều khiển bằng câu lệnh có thể tái lập hoặc vượt qua tỷ lệ thành công của con người một cách đáng tin cậy, các công ty công nghệ sinh học có thể cắt giảm đáng kể chi phí và thời gian khám phá ở giai đoạn đầu. Tuy nhiên, các điểm tin cậy bị sai lệch trên MBP và TNFα cho thấy một hệ thống hoàn toàn tự động vẫn chưa sẵn sàng để đưa vào sản xuất. Các công ty vẫn sẽ cần sự giám sát của con người để giải thích các chỉ số tin cậy và xác thực mức độ liên quan về mặt chức năng.

Từ góc độ AI, công trình này làm mờ đi ranh giới giữa "công cụ" và "tác nhân" (agent). Claude không phải là một thuật toán thiết kế protein mới; nó là một mô hình ngôn ngữ đa năng có thể điều phối các công cụ chuyên dụng hiện có khi được cung cấp một bộ hướng dẫn đủ chi tiết. Thí nghiệm gợi mở về một tương lai nơi AI đóng vai trò là chất keo gắn kết một hệ sinh thái mô-đun gồm các phần mềm khoa học mã nguồn mở, thay vì thay thế bất kỳ thành phần đơn lẻ nào.

Quan điểm đối lập: chi phí ẩn của sự phức tạp trong câu lệnh

Mặc dù nghiên cứu ca ngợi câu lệnh 16.000 từ là một thành tựu trong việc nắm bắt tri thức, nhưng chính kích thước của câu lệnh đó lại đặt ra những lo ngại về mặt thực tế. Việc soạn thảo một tài liệu như vậy đòi hỏi chuyên môn sâu về lĩnh vực, sự am hiểu về các công cụ nền tảng và khả năng dự đoán các trường hợp biên (edge cases). Nói cách khác, chuyên môn không hề biến mất—nó chỉ chuyển dịch từ các nhà khoa học thực nghiệm sang các kỹ sư câu lệnh (prompt engineers).

Hơn nữa, việc phụ thuộc vào một ngân sách GPU cố định tạo ra một rào cản cứng đối với độ sâu thăm dò. Các nhóm con người có thể tái phân bổ nguồn lực một cách linh hoạt dựa trên các kết quả trung gian, trong khi chiến dịch của Claude tuân thủ một ngân sách đã được thiết lập sẵn, điều này có khả năng làm hạn chế phạm vi không gian trình tự được lấy mẫu.

Những điều cần theo dõi tiếp theo

Bài báo của Anthropic để lại một số câu hỏi còn bỏ ngỏ. Các nghiên cứu trong tương lai sẽ cần giải quyết vấn đề hiệu chuẩn độ tin cậy để việc tự đánh giá của mô hình khớp với các kết quả thực nghiệm. Việc tích hợp các xét nghiệm chức năng — chẳng hạn như ức chế enzyme hoặc hoạt tính tế bào — vào vòng lặp tự trị sẽ đưa công nghệ này tiến gần hơn đến việc khám phá thuốc thay vì chỉ dừng lại ở việc xác định chất liên kết. Cuối cùng, việc đánh giá chuẩn phương pháp này trên một tập hợp các mục tiêu rộng hơn và dưới các điều kiện ngân sách khác nhau sẽ cho thấy liệu tỷ lệ tìm thấy quan sát được là có thể tái lập hay chỉ là một trường hợp ngoại lệ.

Bài học rút ra rất rõ ràng: việc điều phối prompt chi tiết có thể biến một mô hình ngôn ngữ thành một phòng thí nghiệm công nghệ sinh học ảo, mang lại tỷ lệ tìm thấy chất liên kết vượt xa mức trung bình của con người. Tuy nhiên, phương pháp này vẫn phụ thuộc vào khả năng soạn thảo prompt của chuyên gia và gặp phải các lỗi đánh giá sai độ tin cậy có thể làm chệch hướng các thí nghiệm tốn kém. Khi cộng đồng hoàn thiện các quy trình này, sự cân bằng giữa tính tự trị của AI và sự giám sát của con người sẽ quyết định liệu các hệ thống như vậy sẽ trở thành công cụ thông dụng hay chỉ dừng lại ở những sự tò mò mang tính thử nghiệm.