Chạy một LLM Agent ngay trên trình duyệt của bạn

Hầu hết các trợ lý AI đều nằm trong các trung tâm dữ liệu. Chúng cần mã API, máy chủ và tính phí theo từng yêu cầu.

Tôi đã xây dựng một thứ khác biệt.

Tôi đã tinh chỉnh (fine-tuned) các mô hình LiquidAI LFM2.5 (230M và 350M) để chạy hoàn toàn trên trình duyệt của bạn—không cần máy chủ, không tốn chi phí đám mây.

Mục tiêu là tạo ra một mô hình đủ nhỏ để có thể đi kèm với một trang web.

Mô hình này không lưu trữ các sự thật về các sản phẩm cụ thể; nó học các quy luật. Chỉ với một mô hình nhỏ bé, bạn có thể vận hành một quán cà phê, một cửa hàng tạp hóa hoặc bất kỳ cửa hàng nào khác mà không cần huấn luyện lại.

Những gì mô hình có thể làm

  • Chọn đúng công cụ cho một tác vụ
  • Kết nối các đối số và ID sản phẩm một cách chính xác
  • Hiểu các tham chiếu như “cái thứ hai” hoặc “một tá”
  • Sử dụng văn bản được truy xuất để trả lời câu hỏi
  • Từ chối khi thiếu thông tin
  • Điều hướng cuộc hội thoại quay lại chủ đề chính khi bị lạc đề

Cách tôi xây dựng nó

  • Cố định một bộ tám công cụ (search, add_to_cart, checkout, v.v.)
  • Coi RAG như một công cụ thay vì một quy trình (pipeline) riêng biệt
  • Áp dụng kỹ thuật grammar-constrained decoding để đảm bảo độ chính xác
  • Tạo một bộ dữ liệu tổng hợp từ 18 kịch bản tương tác
  • Tinh chỉnh trên 30 triệu token bằng một GPU 16GB duy nhất

Trọng tâm huấn luyện Tôi huấn luyện mô hình dựa trên hành vi, chứ không phải danh sách chặn (blocklists). Thay vì cấm các từ ngữ, tôi dạy nó cách điều hướng cuộc hội thoại một cách lịch sự.

Tại sao điều này lại quan trọng

  • Quyền riêng tư: dữ liệu của bạn không bao giờ rời khỏi thiết bị
  • Sử dụng ngoại tuyến: nó hoạt động mà không cần kết nối internet
  • Chi phí: không tốn phí suy luận (inference)
  • Khả năng tiếp cận: giúp các giao diện người dùng (UI) phức tạp có thể điều hướng bằng giọng nói

Mô hình này nhỏ, nhưng nó hữu ích. Đừng hỏi liệu các mô hình khổng lồ có thể thực hiện các tác vụ hay không. Hãy hỏi xem một mô hình có thể nhỏ đến mức nào mà vẫn duy trì được sự hữu ích trên một thiết bị.

Demo: https://lajosbencz.github.io/frontend-agent/ Code: https://github.com/lajosbencz/frontend-agent/ Source: https://dev.to/lajosbencz/running-an-llm-agent-entirely-in-your-browser-5foe


Lajos Bencz đã tinh chỉnh một mô hình ngôn ngữ 350 triệu tham số để chạy hoàn toàn trên trình duyệt web, biến một trang web tĩnh thành một trợ lý mua sắm tự trị mà không cần mã API, không cần máy chủ và không tốn chi phí suy luận dựa trên đám mây. Kết quả là một AI ưu tiên quyền riêng tư, có khả năng hoạt động ngoại tuyến, có thể quản lý một quán cà phê, một cửa hàng tạp hóa hoặc bất kỳ danh mục tương tự nào mà không cần phải huấn luyện lại cho từng lĩnh vực.

Tại sao nên chạy LLM trong trình duyệt

Hầu hết các trợ lý AI đều nằm trong các trung tâm dữ liệu. Mỗi truy vấn đều phải truyền qua internet, gửi đến một API và phát sinh phí theo từng yêu cầu. Thiết lập đó làm rò rỉ dữ liệu người dùng, yêu cầu mạng và làm tăng hóa đơn nhanh chóng. Việc chuyển mô hình sang phía máy khách (client) sẽ loại bỏ những vấn đề này. Dữ liệu ở lại trên máy cục bộ, trợ lý vẫn hoạt động khi mất mạng, và chi phí suy luận giảm xuống bằng không.

Cách mô hình được xây dựng

  • Lựa chọn mô hình – Bắt đầu với LiquidAI LFM2.5, các biến thể 230M và 350M. Kích thước của chúng cho phép một trang web thông thường có thể tải xuống được.
  • Bộ công cụ – Mã hóa cứng tám tiện ích (search, add_to_cart, checkout, v.v.) vào agent. Mô hình học cách gọi công cụ nào và cách truyền các đối số như ID sản phẩm.
  • RAG như một công cụ – Coi Retrieval-Augmented Generation (RAG) chỉ như một công cụ có thể gọi được khác, giúp đơn giản hóa kiến trúc.
  • Grammar-constrained decoding – Giới hạn bộ giải mã (decoder) trong cú pháp gọi công cụ hợp lệ, giúp giảm thiểu các đầu ra sai định dạng.
  • Dữ liệu tổng hợp – Chuyển đổi 18 kịch bản tương tác (ví dụ: “thêm hai tá bánh donut”) thành bộ dữ liệu 30 triệu token

Những gì cần theo dõi tiếp theo

Mã nguồn (https://github.com/lajosbencz/frontend-agent) là mã nguồn mở, mời gọi cộng đồng thêm các công cụ, mở rộng các công thức tổng hợp hoặc thử nghiệm các phương pháp tiếp cận lai.

Điểm mấu chốt: Việc tinh chỉnh một LLM có kích thước vừa phải thành một tác nhân (agent) độc lập giúp việc nhúng AI có chức năng và bảo vệ quyền riêng tư trực tiếp vào một trang web trở nên khả thi—không cần máy chủ, không tốn phí và không có dữ liệu nào rời khỏi thiết bị của người dùng.