Các dự án AI trong doanh nghiệp thường có một kịch bản chung. Một nhóm xây dựng một bản mẫu. Bản demo trông rất ấn tượng. Thế rồi, ba tháng sau, hệ thống bắt đầu rệu rã. Các câu trả lời dần lệch lạc. Chi phí leo thang. Một nhân viên tuân thủ hỏi câu trả lời cụ thể đó đến từ đâu, và không ai trong phòng có thể trả lời được.

Sự sụp đổ này hiếm khi bắt đầu từ mã nguồn kém chất lượng. Nó bắt đầu từ một lựa chọn kiến trúc duy nhất vốn bị xem như một cuộc thi bình chọn: Retrieval-Augmented Generation so với fine-tuning.

RAG và fine-tuning không phải là hai phiên bản của cùng một sản phẩm. Chúng là những công cụ khác biệt về mặt bản chất. Một cái kiểm soát những gì mô hình có thể thấy. Cái còn lại kiểm soát cách mô hình hành xử. Việc chọn sai phương pháp cho công việc sẽ không lộ ra ở bản prototype. Nó sẽ lộ ra sau đó, khi doanh nghiệp đang vận hành dựa trên nó.

Cái bẫy Demo

Áp lực phải ra mắt một tính năng AI tạo sinh là rất lớn. Các nhóm thường chọn một phương pháp chỉ vì họ thấy nó trong một bài hướng dẫn viết rất hay hoặc vì một bản thuyết trình của nhà cung cấp khiến nó trông có vẻ dễ dàng. Đó là một cách tồi tệ để đưa ra các quyết định về hạ tầng.

Một mô hình đã được fine-tuned có thể trông như có phép màu trong một bản demo được kiểm soát. Nó nói bằng giọng văn của công ty bạn và nhận diện được tên sản phẩm của bạn. Một pipeline RAG cũng có thể trông như có phép màu. Nó trả lời các câu hỏi về một tài liệu mà nó chưa từng được huấn luyện. Nhưng bản demo đã che giấu thực tế vận hành. Nếu dữ liệu giá cả của bạn thay đổi hàng tuần mà bạn lại fine-tune dựa trên số liệu của quý trước, mô hình sẽ tự tin trích dẫn các con số lỗi thời. Nếu đội ngũ hỗ trợ của bạn cần mọi câu trả lời đều phải truy xuất được nguồn gốc từ một tệp PDF chính sách cụ thể, thì một mô hình fine-tuned sẽ không cung cấp cho bạn các chú thích. Nó chỉ đưa ra văn bản thuần túy.

Ý nghĩa thực sự của RAG

RAG là viết tắt của Retrieval-Augmented Generation, nhưng cái tên này khiến nó nghe có vẻ phức tạp hơn thực tế. Về cốt lõi, RAG trả lời một câu hỏi: mô hình cần tra cứu điều gì ngay lúc này?

Hãy tưởng tượng một nhân viên chăm sóc khách hàng được phép tìm kiếm trong wiki của công ty trước khi trả lời một yêu cầu hỗ trợ. RAG làm chính xác điều đó, nhưng một cách tự động. Khi người dùng đặt câu hỏi, hệ thống sẽ tìm kiếm trong cơ sở dữ liệu vector hoặc kho lưu trữ tài liệu để lấy ra các đoạn văn bản liên quan. Sau đó, nó chuyển các đoạn văn bản đó cho mô hình ngôn ngữ dưới dạng ngữ cảnh, cùng với câu hỏi gốc. Mô hình sẽ tạo ra câu trả lời dựa trên các bằng chứng đã truy xuất được.

Cách tiếp cận này phát huy thế mạnh khi kho kiến thức của bạn nằm ngoài mô hình. Tài liệu sản phẩm, hồ sơ pháp lý, nghiên cứu y khoa và bảng tính hàng tồn kho đều thay đổi liên tục. RAG giúp mô hình luôn cập nhật mà không cần phải huấn luyện lại bất kỳ trọng số nào. Nó cũng tạo ra một dấu vết kiểm toán tự nhiên. Vì bạn biết chính xác những tài liệu nào đã được truy xuất, bạn có thể chỉ cho kiểm toán viên hoặc cơ quan quản lý thấy chính xác câu trả lời đến từ đâu.

Ý nghĩa thực sự của Fine-Tuning

Fine-tuning trả lời một câu hỏi khác: mô hình nên hành xử như thế nào?

Thay vì cung cấp cho mô hình tài liệu đọc bên ngoài, bạn dạy nó thông qua các ví dụ. Bạn thu thập hàng trăm hoặc hàng nghìn ví dụ về các đầu ra mà bạn mong muốn, và tiếp tục huấn luyện mô hình nền tảng trên dữ liệu đó. Quá trình này thực sự điều chỉnh các tham số nội bộ của mô hình. Nó thay đổi các trọng số.

Kết quả là một mô hình đã nội hóa được các khuôn mẫu.