Vượt xa Transformers: Những startup đang định nghĩa lại kỷ nguyên tiếp theo của LLM
Kỷ nguyên của transformer đang đối mặt với một nút thắt cổ chai cơ bản khi nhu cầu tính toán của các mô hình ngôn ngữ lớn (LLM) chạm đến điểm giới hạn. Mặc dù bài báo "Attention Is All You Need" năm 2017 đã đặt nền móng cho sự bùng nổ AI hiện nay, một thế hệ startup mới đang chạy đua để thay thế hoặc tái tạo lại kiến trúc cốt lõi nhằm đạt được hiệu quả thực sự.
Nút thắt Transformer: Tại sao Dense Attention đang thất bại
Trong gần một thập kỷ, transformer đã là động cơ của ngành công nghiệp AI, được vận hành bởi một cơ chế được gọi là "dense attention" (chú ý dày đặc). Quá trình này so sánh mọi token trong một khối văn bản với mọi token khác thông qua các phép nhân quy mô lớn. Mặc dù cực kỳ chính xác trong việc nắm bắt ý nghĩa ngữ nghĩa, nhưng độ phức tạp toán học của nó lại tăng trưởng không hiệu quả.
Ví dụ, một tài liệu 10.000 từ có thể yêu cầu transformer thực hiện khoảng 50 triệu phép nhân. Sự tăng trưởng theo hàm bậc hai này trong tính toán dẫn đến hai thách thức khổng lồ: tiêu thụ năng lượng tăng vọt và cửa sổ ngữ cảnh (context window) bị hạn chế. Với thông tin cho rằng OpenAI dự kiến sẽ chi 50 tỷ USD cho tính toán trong năm nay và nhu cầu điện năng của các trung tâm dữ liệu dự kiến sẽ tăng gấp đôi vào năm 2030, ngành công nghiệp này đang vấp phải rào cản về cả chi phí lẫn vật lý.
Tư duy lại về Attention: Sự trỗi dậy của các cơ chế Sparse
Để giải quyết cuộc khủng hoảng hiệu suất, một số startup đang cố gắng chuyển dịch từ dense attention sang "sparse attention" (chú ý thưa thớt). Thay vì tính toán mọi cặp từ có thể có, sparse attention chỉ tập trung vào các kết nối liên quan nhất, giúp giảm đáng kể tải trọng tính toán.
Startup Subquadratic có trụ sở tại Miami là đơn vị dẫn đầu trong lĩnh vực này với mô hình SubQ. Không giống như các cơ chế sparse trước đây vốn gặp khó khăn trong việc duy trì độ chính xác, Subquadratic khẳng định công nghệ của mình có thể cạnh tranh với các LLM phổ biến trong các tác vụ chuyên biệt như lập trình và tìm kiếm. Cách tiếp cận của họ bao gồm một hệ thống động giúp xác định những từ nào thực sự quan trọng đối với một đoạn văn bản nhất định ngay tức thì (on the fly), thay vì lãng phí chu kỳ tính toán vào các token không liên quan.
Power Retention: Hướng tới các bản tóm tắt cuốn chiếu
Một cách tiếp cận khác là loại bỏ hoàn toàn cơ chế attention. Manifest AI, có trụ sở tại San Francisco, đang tiên phong trong một kỹ thuật gọi là "power retention". Trong khi các mô hình sparse attention như SubQ vẫn cố gắng duy trì một bức tranh khái quát về toàn bộ cửa sổ ngữ cảnh, thì power retention hoạt động bằng cách cung cấp cho mô hình một bản tóm tắt cuốn chiếu (rolling summary) về bộ nhớ của nó.
Khi thông tin mới đi vào cửa sổ ngữ cảnh, mô hình sẽ xác định và loại bỏ các dữ liệu ít liên quan hơn, đảm bảo tải trọng tính toán luôn ở mức có thể kiểm soát được bất kể kích thước đầu vào. Manifest AI đã chứng minh tính khả thi của cách tiếp cận này bằng cách:
- Chuyển đổi mô hình mã nguồn mở StarCoder thành PowerCoder bằng cách sử dụng power retention.
- Phát hành Brumby, một mô hình mà họ khẳng định có thể cạnh tranh với các mô hình mã nguồn mở Qwen phổ biến của Alibaba.
Khả năng chuyển đổi các mô hình transformer hiện có thành các mô hình power retention với việc tái huấn luyện tối thiểu cho thấy quá trình chuyển đổi sang "LLMs+" — thế hệ mô hình tiếp theo — có thể diễn ra nhanh hơn nhiều so với dự kiến.
Các điểm chính cần lưu ý
- Giới hạn của Transformer: Sự tăng trưởng theo hàm bậc hai của dense attention khiến các LLM hiện tại cực kỳ tốn kém để vận hành và khó mở rộng cho các tập dữ liệu khổng lồ hoặc các tác vụ suy luận dài.
- Sparse so với Retention: Các startup đang tấn công vấn đề từ hai phía: Subquadratic đang tối ưu hóa attention thông qua các phép tính thưa thớt (SubQ), trong khi Manifest AI đang thay thế nó bằng các bản tóm tắt cuốn chiếu (Power Retention).
- Yêu cầu cấp thiết về kinh tế: Khi chi phí tính toán AI lên tới hàng chục tỷ đô la, người chiến thắng trong kỷ nguyên AI tiếp theo có khả năng sẽ là bên giải quyết được bài toán hiệu suất thay vì chỉ tập trung vào quy mô thô.
