Một nghiên cứu mới trên arXiv của Sawan Dasari, dựa trên 4.000 thí nghiệm, cho thấy một lịch trình tái huấn luyện định kỳ có thể dự đoán được sẽ vượt trội hơn các quy trình phát hiện trôi dạt (drift-detection) phức tạp đối với hầu hết các khối lượng công việc học máy — trừ khi mô hình có thể học tăng dần (incremental learning).
Tại sao vấn đề tái huấn luyện lại quan trọng vào lúc này
Một khi mô hình được triển khai, dữ liệu thực tế hiếm khi đứng yên. Sở thích của khách hàng thay đổi, các thủ đoạn gian lận biến đổi và các chỉ số cảm biến bị trôi dạt. Hiện tượng trôi dạt khái niệm (concept drift) này có thể làm xói mòn hiệu suất dự báo một cách nhanh chóng, biến một hệ thống đang tạo ra doanh thu thành một gánh nặng. Các công ty thường phản ứng theo một trong ba cách: tái huấn luyện theo một thời gian biểu cố định, kích hoạt tái huấn luyện khi vượt quá ngưỡng lỗi, hoặc chạy một thuật toán phát hiện trôi dạt để đánh dấu các sự thay đổi dữ liệu. Mỗi phương pháp đều tiêu tốn tài nguyên tính toán, nỗ lực kỹ thuật và ngân sách độ trễ, tuy nhiên ngành công nghiệp vẫn chưa có sự thống nhất về việc phương pháp nào thực sự hiệu quả.
Nghiên cứu đã so sánh những gì
Nghiên cứu đã đánh giá bốn chính sách trên một tập hợp rộng lớn các bộ dữ liệu tổng hợp và thực tế:
- Không tái huấn luyện – mô hình chạy mãi mãi trên dữ liệu huấn luyện ban đầu.
- Tái huấn luyện định kỳ – các mô hình được làm mới theo một lịch trình cố định (hàng ngày, hàng tuần, v.v.).
- Kích hoạt theo ngưỡng lỗi – việc tái huấn luyện chỉ bắt đầu khi một chỉ số hiệu suất vượt quá giới hạn đã thiết lập sẵn.
- Phát hiện trôi dạt (Drift-detection) – một thuật toán giám sát dữ liệu đầu vào để tìm các sự thay đổi về mặt thống kê và bắt đầu tái huấn luyện khi phát hiện thấy sự trôi dạt.
Nhóm nghiên cứu đã thử nghiệm từng chính sách trên các mô hình có hỗ trợ học tăng dần (chúng có thể cập nhật liên tục với dữ liệu mới) hoặc không hỗ trợ (chúng yêu cầu một lượt tái huấn luyện toàn bộ).
Kiến trúc quan trọng hơn chính sách
Khi một mô hình hỗ trợ học tăng dần, nghiên cứu cho thấy chính sách tái huấn luyện hầu như không quan trọng — mô hình liên tục tích hợp dữ liệu mới và duy trì độ chính xác. Ngược lại, đối với các mô hình huấn luyện tĩnh, việc lựa chọn chính sách đã làm thay đổi độ chính xác từ 15 đến 55 điểm phần trăm trong suốt các thí nghiệm. Nói cách khác, khả năng học tức thời của mô hình đóng vai trò quyết định; lịch trình chỉ trở nên quan trọng khi khả năng đó không tồn tại.
Đơn giản hơn sẽ thắng thông minh hơn đối với các mô hình tĩnh
Đối với các mô hình không thể học tăng dần, lịch trình định kỳ liên tục vượt trội hơn cả phương pháp ngưỡng lỗi và phát hiện trôi dạt, cho dù sự trôi dạt là đột ngột (thay đổi mạnh về phân phối) hay dần dần (tiến hóa chậm). Các quy trình "thông minh" đòi hỏi thêm cơ sở hạ tầng giám sát và tinh chỉnh, và chúng hiếm khi phát hiện ra sự trôi dạt đủ sớm để bù đắp cho độ trễ mà chúng gây ra. Tính có thể dự đoán được hóa ra là lợi thế quyết định: các nhóm có thể phân bổ nguồn lực trước và tránh được sự chậm trễ kiểu "chờ xem sao" vốn có trong các hệ thống phản ứng.
Ngân sách tính toán và độ trễ là không thể tách rời
Tái huấn luyện không hề miễn phí. Các thí nghiệm đã đo lường tác động của thời gian tái huấn luyện đối với tổng ngân sách tính toán. Khi độ trễ và ngân sách được mô hình hóa một cách độc lập, các nhóm cuối cùng chỉ có được khoảng một nửa khả năng tái huấn luyện dự kiến — chi phí ẩn của các đợt huấn luyện kéo dài đã xâm chiếm các tài nguyên được dành riêng cho việc suy luận (inference). Bài học rút ra rất rõ ràng: hãy đánh giá bất kỳ chiến lược tái huấn luyện nào cùng với chi phí thời gian và tính toán của nó, chứ không phải chỉ xem nó như một sự gia tăng độ chính xác riêng lẻ.
Cách các phát hiện này áp dụng vào các trường hợp sử dụng thực tế
- Phát hiện gian lận – Các mô hình gian lận thay đổi nhanh chóng, nhưng nghiên cứu gợi ý rằng một nhịp độ định kỳ kỷ luật (ví dụ: hàng đêm) sẽ đáng tin cậy hơn việc xây dựng một quy trình phát hiện trôi dạt tùy chỉnh vốn có thể bị tụt hậu so với các cuộc tấn công.
- Cá nhân hóa – Ở đây, ưu tiên là kiến trúc mô hình. Hãy triển khai một thuật toán học tăng dần (cập nhật gradient trực tuyến, phân tách dòng dữ liệu, v.v.). Khi mô hình có thể nạp các tương tác mới một cách liên tục, cuộc tranh luận về lịch trình sẽ biến mất.
- Dự báo – Các dự báo chuỗi thời gian thường yêu cầu các mô hình nặng (ví dụ: deep LSTMs) không thể cập nhật tăng dần. Trong những trường hợp như vậy, việc lập kế hoạch ngân sách phải bao gồm toàn bộ cửa sổ huấn luyện; nếu không, hệ thống sẽ bị tụt hậu so với dữ liệu mà nó hướng tới để dự báo.
Kết luận
Nếu mô hình của bạn có thể học tăng dần, hãy đầu tư vào khả năng đó và để dữ liệu tuôn chảy. Nếu không, hãy từ bỏ các quy trình phát hiện trôi dạt phức tạp và áp dụng một thời gian biểu tái huấn luyện đều đặn, có thể dự đoán được, đồng thời tính toán trước các chi phí tính toán và độ trễ. Cách tiếp cận đơn giản nhất, được chứng minh bởi hàng ngàn thí nghiệm, mang lại độ chính xác cao nhất mà không tốn kém chi phí ẩn của các giải pháp được thiết kế quá mức (over-engineered).
