Các nhà nghiên cứu đã chỉ ra rằng các mô hình transformer ngữ cảnh dài có khả năng mở rộng tuyến tính có thể huấn luyện các mô hình ngôn ngữ mặt nạ (masked language models) trên các chuỗi protein mà không gặp phải tình trạng bùng nổ bộ nhớ vốn thường làm tê liệt các mô hình transformer tiêu chuẩn. Bằng cách chuyển đổi chi phí bộ nhớ từ bậc hai sang tuyến tính, phương pháp này cho phép các nhà khoa học làm việc với các protein dài hơn nhiều so với khả năng trước đây, một bước tiến có thể đẩy nhanh quá trình tìm kiếm thuốc và nghiên cứu công nghệ sinh học.
Tại sao các mô hình Transformer tiêu chuẩn lại gặp bế tắc
Các cơ sở dữ liệu protein chứa các chuỗi thường kéo dài tới hàng nghìn axit amin. Các mô hình transformer truyền thống tính toán cơ chế chú ý (attention) giữa mọi cặp vị trí, một quá trình tăng theo bình phương độ dài của chuỗi. Khi chuỗi càng dài, mức sử dụng bộ nhớ càng tăng vọt, buộc những người thực hành phải cắt ngắn protein hoặc chia chúng thành các mảnh nhỏ. Việc mất đi ngữ cảnh sẽ cản trở khả năng của mô hình trong việc học các mô-típ cấu trúc trải dài trên các phần lớn của một chuỗi.
Bước đột phá về quy mô tuyến tính
Cách tiếp cận mới thay thế cơ chế tự chú ý đầy đủ (full self-attention) bằng một thiết kế mà bộ nhớ chỉ tăng tuyến tính theo độ dài chuỗi. Trong thực tế, mô hình có thể xử lý toàn bộ một protein trong một lần chạy, bảo tồn các tương tác tầm xa vốn đóng vai trò quan trọng đối với quá trình gấp cuộn và chức năng của chúng. Vì thuật toán cần ít tài nguyên bộ nhớ hơn nhiều, việc huấn luyện trên các tập hợp dữ liệu protein lớn trở nên rẻ hơn và nhanh hơn, mở ra cánh cửa cho các mục tiêu mô hình ngôn ngữ mặt nạ (MLM) phong phú hơn, giúp che mặt nạ và dự đoán các axit amin trên toàn bộ chuỗi.
Ý nghĩa đối với ngành sinh học
Các biểu diễn protein dài hơn và không bị ngắt quãng giúp cải thiện khả năng nắm bắt của mô hình về cấu trúc ba chiều, các vị trí hoạt động và các mô hình tiến hóa. Các nhà nghiên cứu giờ đây có thể huấn luyện trước (pre-train) trên các bộ sưu tập chuỗi khổng lồ chưa qua sàng lọc và tinh chỉnh (fine-tune) cho các tác vụ cụ thể như dự đoán hiệu ứng đột biến hoặc thiết kế kháng thể. Việc giảm tải tính toán cũng hạ thấp rào cản cho các phòng thí nghiệm nhỏ hơn trong việc chạy các mô hình tiên tiến nhất (state-of-the-art) trên các phần cứng khiêm tốn.
Những lưu ý và câu hỏi còn bỏ ngỏ
Cơ chế chú ý quy mô tuyến tính thường dựa vào các phương pháp xấp xỉ—như cửa sổ trượt (sliding windows), phân tách hạng thấp (low-rank factorizations) hoặc các mô hình thưa (sparse patterns)—những phương pháp này có thể bỏ lỡ các tương tác tinh vi giữa các gốc axit amin (residues) ở xa nhau. Các thí nghiệm ban đầu cho thấy có một sự đánh đổi khiêm tốn giữa việc tiết kiệm bộ nhớ và độ chính xác dự đoán, đặc biệt là trong các tác vụ đòi hỏi sự liên kết tầm xa chính xác. Kiến trúc mới cũng làm tăng độ phức tạp khi triển khai, điều này có thể làm chậm quá trình áp dụng cho đến khi các thư viện mạnh mẽ xuất hiện.
Những điều cần theo dõi tiếp theo
Cộng đồng sẽ chờ đợi các kết quả đánh giá chuẩn (benchmark) để so sánh hiệu suất protein-MLM của transformer quy mô tuyến tính với các mô hình truyền thống trên các bộ dữ liệu tiêu chuẩn. Việc tích hợp vào các quy trình tin sinh học hiện có và các bản phát hành mã nguồn mở sẽ quyết định tốc độ lan rộng của kỹ thuật này. Nếu khoảng cách về độ chính xác được thu hẹp, phương pháp này có thể trở thành lựa chọn mặc định cho việc mô hình hóa ngôn ngữ protein quy mô lớn, tái định hình cách sinh học tính toán giải quyết vấn đề gấp cuộn protein.
Điểm mấu chốt: Bằng cách cắt giảm nhu cầu bộ nhớ từ bậc hai xuống tuyến tính, các mô hình transformer ngữ cảnh dài giúp việc mô hình hóa ngôn ngữ mặt nạ cho các chuỗi protein đầy đủ trở nên khả thi, hứa hẹn mang lại những hiểu biết sinh học sâu sắc hơn trong khi vẫn kiểm soát được chi phí tính toán.
