GSK đã ký kết một thỏa thuận hợp tác nghiên cứu với công ty công nghệ sinh học Relation Therapeutics trị giá lên tới 110 triệu USD. Sự hợp tác này sẽ tạo ra các bộ dữ liệu khổng lồ, độ phân giải cao nhằm theo dõi cách các tế bào người phản ứng với những thay đổi di truyền và các phương pháp điều trị bằng thuốc. Nó giải quyết nút thắt về dữ liệu vốn đã làm chậm quá trình khám phá thuốc bằng AI và có thể rút ngắn nhiều năm trên lộ trình từ phân tử đến thuốc điều trị.

Vấn đề dữ liệu đang kìm hãm AI

Trong hầu hết thập kỷ qua, AI trong ngành dược phẩm thường được đánh giá dựa trên quy mô mô hình thay vì tính phù hợp của dữ liệu đầu vào. Các mô hình ngôn ngữ lớn được huấn luyện trên văn bản internet rất giỏi trong việc khớp các mẫu (pattern matching), nhưng chúng lại gặp khó khăn khi được yêu cầu dự đoán cách một hợp chất tác động lan tỏa qua một tế bào sống. Mảnh ghép còn thiếu chính là dữ liệu “wet lab”—các phép đo từ những thí nghiệm thực tế nhằm ghi lại chuỗi các hiệu ứng sinh học sau khi một gen được bật hoặc tắt, hoặc khi một loại thuốc được áp dụng.

Relation Therapeutics sẽ lấp đầy khoảng trống đó. Theo thỏa thuận, công ty sẽ tạo ra dữ liệu quy mô lớn đo lường tỉ mỉ cách các tế bào người phản ứng với hai biến số: những thay đổi di truyền và sự can thiệp bằng thuốc. Bằng cách cung cấp cho các hệ thống AI cái nhìn chi tiết này về hành vi tế bào, sự hợp tác này nhằm mục tiêu đưa các mô hình từ những dự đoán liên kết thô sơ sang các mô phỏng toàn bộ các con đường sinh học (pathways).

Từ những dự đoán "hộp đen" đến sự chính xác ở cấp độ tế bào

Các quy trình AI truyền thống thường chỉ đưa ra một con số duy nhất: khả năng một phân tử sẽ liên kết với một protein mục tiêu. Sau đó, các nhà nghiên cứu phải dành nhiều tháng hoặc nhiều năm để kiểm tra xem sự liên kết đó có chuyển hóa thành hiệu quả điều trị hay không. Cách tiếp cận mới thay thế ước tính điểm đơn lẻ bằng một bản đồ đa chiều về các kết quả hạ nguồn (downstream outcomes). Khi một mô hình AI biết rằng việc loại bỏ gen X sẽ kích hoạt con đường Y, và một loại thuốc tiềm năng làm giảm con đường đó, nó có thể suy luận ra hiệu quả sớm hơn nhiều.

Thành quả thu được là sự cắt giảm các thí nghiệm thử-sai (trial-and-error) tốn kém. Nếu một mô hình có thể dự báo một cách đáng tin cậy rằng một hợp chất sẽ kích hoạt phản ứng tế bào mong muốn, thì sẽ cần ít hợp chất hơn để tổng hợp, sàng lọc và loại bỏ. Điều này giúp giảm chi phí R&D và rút ngắn thời gian—những lợi thế ảnh hưởng trực tiếp đến thời hạn độc quyền thị trường của thuốc và lợi nhuận của các công ty dược phẩm.

"Dữ liệu đúng" trở thành hào phòng thủ

Sự hợp tác này làm nổi bật sự chuyển dịch từ “big data” sang “right data”. Các mô hình đa dụng phát triển dựa trên khối lượng khổng lồ, nhưng việc khám phá thuốc đòi hỏi dữ liệu có tính đặc thù cao và khó thu thập. Việc tạo ra các hồ sơ phản ứng tế bào đáng tin cậy đòi hỏi các thiết bị tinh vi, nhân sự lành nghề và các quy trình kiểm soát chất lượng nghiêm ngặt—những khoản đầu tư mà chỉ các đơn vị có nguồn vốn dồi dào mới có thể chi trả.

Những công ty sở hữu quy trình liên kết mã di truyền với các kết quả tế bào có thể đo lường được sẽ nắm giữ các tài sản trí tuệ giá trị nhất. Tính độc quyền của các bộ dữ liệu như vậy tạo ra một rào cản phòng thủ khó sao chép hơn cả một kiến trúc mạng thần kinh mới. Đối với những người sáng lập công ty công nghệ sinh học, thông điệp rất rõ ràng: xây dựng một bộ máy dữ liệu có thể mang tính chiến lược hơn là chạy theo những đột phá thuật toán tiếp theo.

Quan điểm ngược lại: chỉ riêng dữ liệu sẽ không giải quyết được mọi thứ

Các nhà phê bình lưu ý rằng ngay cả dữ liệu hoàn hảo cũng có thể làm sai lệch các mô hình AI. Các tế bào khác nhau giữa các loại mô, trạng thái bệnh lý và nhân khẩu học của bệnh nhân; một bộ dữ liệu được thu thập trong một bối cảnh nhất định có thể không có tính tổng quát hóa. Chi phí để tạo ra và quản lý các bộ dữ liệu khổng lồ, chất lượng cao có thể lớn hơn cả chi phí huấn luyện các mô hình, đặt ra những câu hỏi về khả năng mở rộng cho các công ty nhỏ hơn.

Các cơ quan quản lý cũng đóng vai trò quan trọng. AI dự đoán tuyên bố có thể mô phỏng sinh học con người cuối cùng phải được xác thực dựa trên các kết quả lâm sàng, điều này tạo thêm một lớp kiểm duyệt. Nếu ngành công nghiệp dựa quá nhiều vào các dự đoán in-silico mà không có các thử nghiệm thực tế đầy đủ, họ có thể đối mặt với những bước lùi khi các ứng viên đầy triển vọng thất bại trong các thử nghiệm lâm sàng.

Những điều cần theo dõi tiếp theo

Vài tháng tới sẽ cho thấy liệu nỗ lực của GSK-Relation có thể cung cấp dữ liệu hữu dụng ở quy mô như đã hứa hay không. Các chỉ số chính bao gồm:

  • Việc công bố các bộ dữ liệu chuẩn (benchmark datasets) mà các nhà nghiên cứu khác có thể tiếp cận (ngay cả dưới các điều khoản hạn chế)
  • Các mô hình AI giai đoạn đầu chứng minh được khả năng vượt trội so với các phương pháp sàng lọc truyền thống trên một tập kiểm tra độc lập (held-out test set)
  • Các khoản đầu tư tiếp nối từ các ông lớn dược phẩm khác, báo hiệu sự tin tưởng rằng phương pháp tiếp cận dữ liệu này có thể nhân rộng được

Nếu sự hợp tác mang lại những cải thiện hữu hình về tỷ lệ tìm thấy hợp chất tiềm năng (hit-rate) hoặc chu kỳ thời gian, nó có thể kích hoạt một làn sóng các thỏa thuận tương tự, định hình lại cách ngành công nghiệp phân bổ ngân sách R&D. Ngược lại, nếu dữ liệu tỏ ra quá nhiễu hoặc quá tốn kém để tích hợp, các công ty có thể quay lại các phương pháp tiếp cận hỗn hợp, kết hợp AI với phương pháp sàng lọc hiệu suất cao (high-throughput screening) truyền thống.

Điểm mấu chốt

Khoản đầu tư 110 triệu USD của GSK vào dữ liệu tế bào độ trung thực cao báo hiệu một bước chuyển mình mang tính quyết định: trong lĩnh vực khám phá thuốc bằng AI, lợi thế then chốt sẽ ngày càng nằm ở chất lượng và tính độc quyền của các tín hiệu sinh học dùng để huấn luyện các mô hình, chứ không phải là quy mô thuần túy của chính các thuật toán.