Apple được cho là đang trong các cuộc thảo luận sơ bộ với PrismML, một startup được hỗ trợ bởi Khosla Ventures, để tích hợp công nghệ nén mô hình tiên tiến vào hệ sinh thái của mình. Bước đi này nhằm đưa trí tuệ nhân tạo tinh vi trực tiếp lên iPhone, thu hẹp khoảng cách giữa những hạn chế về phần cứng di động và yêu cầu tính toán khổng lồ của các Mô hình Ngôn ngữ Lớn (LLMs) hiện đại.
Giải quyết rào cản AI trên thiết bị
Khi Apple triển khai iOS 18 và một Siri được thiết kế lại, công ty phải đối mặt với một trở ngại kỹ thuật đáng kể: các mô hình AI hiệu suất cao thường yêu cầu lượng bộ nhớ và sức mạnh xử lý khổng lồ vượt quá khả năng của điện thoại thông minh tiêu chuẩn. Bằng cách tích hợp công nghệ của PrismML, Apple tìm cách chuyển việc xử lý từ đám mây sang chính thiết bị.
Sự chuyển dịch này đóng vai trò quan trọng trong định vị chiến lược của Apple. AI trên thiết bị giúp giảm độ trễ, hạ thấp chi phí điện toán đám mây đắt đỏ và củng cố cam kết cốt lõi về quyền riêng tư của Apple bằng cách đảm bảo dữ liệu nhạy cảm của người dùng luôn nằm trên thiết bị cầm tay. Hơn nữa, nó cho phép các tính năng AI quan trọng hoạt động ngay cả khi không có kết nối internet.
Cách PrismML thu nhỏ các mô hình AI khổng lồ
PrismML, có nguồn gốc từ nghiên cứu tại Viện Công nghệ California, sử dụng một phương pháp tinh vi để đơn giản hóa cách lưu trữ các giá trị nội bộ của mô hình. Trong khi các phương pháp truyền thống có thể giảm các con số từ 16 bit xuống 4 bit, PrismML tiến xa hơn một bước, giảm mỗi con số xuống chỉ còn một hoặc ba giá trị có thể có.
Hiệu quả đạt được là rất đáng kể. PrismML gần đây đã chứng minh điều này bằng cách nén mô hình mã nguồn mở Qwen của Alibaba từ mức khổng lồ 54 GB xuống còn dưới 4 GB. Việc nén này cho phép toàn bộ 27 tỷ tham số của mô hình hoạt động trên iPhone 15 hoặc các dòng mới hơn. Theo CEO Babak Hassibi, các mô hình nén này mang lại một số lợi thế về hiệu suất:
- Hiệu quả bộ nhớ: Sử dụng ít bộ nhớ hơn tới 15 lần.
- Tốc độ: Chạy nhanh hơn từ sáu đến tám lần.
- Tiêu thụ điện năng: Tiêu thụ ít năng lượng hơn tới sáu lần.
Mặc dù Hassibi lưu ý rằng hiệu suất có giảm nhẹ—đặc biệt là về khả năng truy xuất dữ kiện—nhưng các mô hình vẫn duy trì trình độ cao trong khả năng lập luận và lập trình.
Tác động đến thị trường bán dẫn và phần cứng
Việc một gã khổng lồ như Apple có khả năng áp dụng công nghệ nén như vậy có thể thay đổi cục diện cho các nhà sản xuất phần cứng. Hiện tại, các nhà phân tích như Morgan Stanley dự báo rằng chi phí bộ nhớ của Apple có thể tăng mạnh vào năm tài chính 2027 để hỗ trợ AI, điều này có thể dẫn đến giá iPhone cao hơn.
Tuy nhiên, nếu công nghệ của PrismML trở thành một tiêu chuẩn, nhu cầu về các mô-đun bộ nhớ khổng lồ trong điện thoại thông minh có thể được giảm bớt, ngay cả khi nhu cầu về xử lý cục bộ hiệu quả và tốc độ cao tăng lên. Khi PrismML tiến tới việc nén các mô hình lớn khác như Gemma của Google, mục tiêu vẫn rất rõ ràng: đưa trí tuệ cấp cao trở nên cục bộ, nhanh chóng và dễ tiếp cận trên các thiết bị phần cứng tiêu dùng.
Các điểm chính cần lưu ý
- Nén khổng lồ: PrismML có thể thu nhỏ một mô hình AI 54 GB xuống dưới 4 GB, giúp nó khả thi trên các điện thoại thông minh cao cấp như iPhone 15.
- Cải thiện hiệu suất: Công nghệ này hứa hẹn sử dụng ít bộ nhớ hơn tới 15 lần và tiêu thụ ít năng lượng hơn 6 lần, điều này rất quan trọng để duy trì thời lượng pin trong khi thực hiện các tác vụ AI.
- Quyền riêng tư và Tốc độ: Việc chuyển AI từ đám mây sang thiết bị sẽ giảm độ trễ và tăng cường quyền riêng tư của người dùng, một nền tảng trong triết lý sản phẩm của Apple.
Rủi ro và các câu hỏi còn bỏ ngỏ
Kết quả của PrismML rất hứa hẹn nhưng vẫn đang ở giai đoạn đầu.
Điều cần theo dõi tiếp theo
- Xác nhận chính thức: Apple vẫn chưa công bố quan hệ đối tác, vì vậy bất kỳ thông cáo báo chí hoặc ghi chú beta iOS 18 nào về các LLM trên thiết bị sẽ là một tín hiệu quan trọng.
Điểm mấu chốt: Khả năng nén của PrismML có thể cho phép iPhone chạy các mô hình ngôn ngữ thực sự lớn mà không làm bùng nổ bộ nhớ hay cạn kiệt pin, mang lại trải nghiệm AI nhanh hơn và riêng tư hơn.
