Một nhà phát triển đã lấy một mô hình ngôn ngữ 350 triệu tham số, tinh chỉnh nó và triển khai thành một trợ lý AI hoạt động đầy đủ ngay trong bất kỳ trình duyệt web hiện đại nào—không cần gọi máy chủ, không cần khóa API, không tốn phí đám mây.

Dự án đi kèm với các trọng số của mô hình cùng một trang web tĩnh, cho phép tác nhân (agent) chọn công cụ, liên kết các đối số, giải quyết các tham chiếu như “cái thứ hai”, và từ chối trả lời khi thiếu thông tin—tất cả trong khi dữ liệu của bạn vẫn nằm trên thiết bị của chính bạn.

Cách xây dựng tác nhân chạy trên trình duyệt

Điểm khởi đầu là dòng LFM2.5 của LiquidAI, cụ thể là các biến thể 230M và 350M tham số.

Thay vì nhồi nhét danh mục sản phẩm hoặc bảng giá vào mô hình, người huấn luyện đã dạy nó các mẫu tương tác. Tác nhân không bao giờ biết một mã SKU cụ thể; nó học cách:

  • Chọn công cụ phù hợp cho một yêu cầu nhất định.
  • Liên kết các đối số và định danh chính xác với công cụ đó.
  • Giải thích các tham chiếu mơ hồ (“một tá,” “cái thứ hai”).
  • Truy xuất văn bản bên ngoài và sử dụng nó để trả lời câu hỏi.
  • Từ chối khi thiếu thông tin cần thiết.
  • Giữ cuộc hội thoại đúng chủ đề.

Bộ công cụ được cố định một cách có chủ đích: list_items, get_item, search_knowledge, add_to_cart, remove_from_cart, clear_cart, checkout, và navigate. Việc cố định danh sách này giúp ngăn mô hình ghi nhớ các ID công cụ và giữ cho dữ liệu tinh chỉnh ở mức nhỏ.

Ba lựa chọn kỹ thuật giúp hệ thống luôn nhẹ nhàng:

  1. Danh sách công cụ cố định – Mô hình nhìn thấy một danh sách các hành động cố định, vì vậy nó không cần một vốn từ vựng lớn về tên các công cụ.
  2. RAG như một công cụ – Tạo phản hồi tăng cường truy xuất (RAG) hoạt động như bất kỳ hàm nào khác. Tác nhân gọi search_knowledge để lấy văn bản, sau đó chèn trực tiếp văn bản đó vào câu trả lời của mình, tránh việc phải sử dụng một quy trình truy xuất riêng biệt vốn sẽ làm tăng độ trễ và tiêu tốn bộ nhớ.
  3. Giải mã ràng buộc bằng ngữ pháp – Trong quá trình tạo văn bản, bộ giải mã tuân theo một ngữ pháp đơn giản để ép đầu ra vào một cấu trúc gọi công cụ (tool-call) hợp lệ. Sự ràng buộc này loại bỏ các token lãng phí và giảm thiểu các lệnh sai định dạng.

Quá trình huấn luyện sử dụng phương pháp chưng cất dữ liệu tổng hợp (synthetic data distillation). Tác giả đã xác định 18 công thức tương tác, mỗi công thức mô tả một cuộc trao đổi điển hình giữa người dùng và trợ lý. Một mô hình “giáo viên” lớn hơn đã tạo ra phần ngôn ngữ tự nhiên, trong khi một kịch bản xác định (deterministic script) tạo ra định dạng gọi công cụ chính xác. Quá trình tinh chỉnh đã tiêu thụ khoảng 30 triệu token và vừa vặn trên một GPU duy nhất với 16 GB bộ nhớ.

Tại sao việc chạy trên thiết bị lại quan trọng

  • Quyền riêng tư – Tất cả các câu lệnh của người dùng đều nằm trong bộ nhớ của trình duyệt. Không có dữ liệu đo lường nào rời khỏi thiết bị, điều này rất quan trọng đối với các truy vấn nhạy cảm.
  • Khả năng ngoại tuyến – Vì mô hình được lưu trong bộ nhớ đệm cục bộ, trợ lý có thể hoạt động mà không cần kết nối internet, mở ra các khả năng cho công việc thực địa hoặc khi đi du lịch.
  • Chi phí – Việc cung cấp các tệp mô hình tĩnh giúp loại bỏ các máy chủ suy luận chạy bằng GPU định kỳ hoặc phí API theo mỗi lần gọi.
  • Khả năng tiếp cận – Việc điều hướng các giao diện web phức tạp bằng giọng nói trở nên khả thi trên các thiết bị cấu hình thấp, mở rộng phạm vi tiếp cận của các ứng dụng web tới những người dùng phụ thuộc vào công nghệ hỗ trợ.

Những lợi thế này chuyển đổi cuộc thảo luận từ “Liệu một mô hình khổng lồ có thể trả lời câu hỏi này không?” sang “Một mô hình có thể nhỏ đến mức nào mà vẫn mang lại sự hỗ trợ hữu ích?”

Các hạn chế tiềm ẩn

Một mô hình có kích thước này không thể ghi nhớ các sự kiện mang tính bách khoa toàn thư. Khi người dùng hỏi về giá của một sản phẩm cụ thể hoặc một tiêu đề tin tức gần đây, trợ lý sẽ truy xuất thông tin thông qua search_knowledge hoặc lịch sự từ chối. Thiết kế đó bảo vệ quyền riêng tư nhưng cũng gắn liền hệ thống với chất lượng và độ mới của nguồn kiến thức bên ngoài.

Những điều cần theo dõi tiếp theo

Bản demo công khai nằm tại một URL GitHub Pages đơn giản, và mã nguồn cũng được cung cấp công khai.

Bài học rút ra: Bằng cách dạy một LLM có kích thước khiêm tốn tuân thủ một ngữ pháp công cụ nghiêm ngặt và coi việc truy xuất chỉ như một hàm khác, các nhà phát triển có thể triển khai một trợ lý AI hữu ích chạy hoàn toàn trong trình duyệt—mang lại quyền riêng tư, khả năng sử dụng ngoại tuyến và không tốn chi phí đám mây mà không làm mất đi các khả năng hội thoại cốt lõi.