Từ "agent" đang dần mất đi ý nghĩa của nó. Chỉ cần quét qua bất kỳ thông báo sản phẩm nào hiện nay, mọi tính năng AI đều tự nhận mình là một agent. Một widget thân thiện giúp soạn thảo email? Agent. Một bot hỗ trợ đọc cơ sở tri thức của bạn? Agent. Một đoạn script gọi API và trả về JSON? Cũng là một agent. Đây không chỉ là sự tiếp thị cẩu thả. Đó là một thiết kế nguy hiểm. Khi bạn gọi mọi thứ là agent, bạn sẽ ngừng hiểu rõ mình thực sự đang xây dựng cái gì. Bạn vội vàng tìm đến các kiến trúc phức tạp trước khi xác định được công việc cần làm. Kết quả là mã nguồn thiếu ổn định, chi phí token tăng vọt mất kiểm soát và các hệ thống hoạt động theo những cách mà bạn không thể giải thích hay tái lập được.
Chatbot chỉ chờ đợi, chúng không hành động
Chatbot nằm ở tầng đơn giản nhất. Chúng mang tính phản ứng. Người dùng nhập một câu hỏi, mô hình tạo ra câu trả lời, và cuộc hội thoại kết thúc tại đó trừ khi có một câu lệnh khác từ con người. Những hệ thống này không tự quyết định việc kiểm tra lịch trình của bạn, cập nhật bản ghi cơ sở dữ liệu, hay tạm dừng để yêu cầu làm rõ. Hãy xem xét widget trợ giúp được nhúng trên trang giá của một SaaS. Nó trả lời các câu hỏi về chu kỳ thanh toán và giới hạn tính năng. Nó không hoàn tiền cho khách hàng, không nâng cấp gói dịch vụ, hay gắn cờ một tài khoản khả nghi. Nó không có công cụ, không có trạng thái duy trì nào ngoài cửa sổ chat, và không có mục tiêu nào khác ngoài việc tạo ra một câu văn phù hợp. Đó là một chatbot. Nó phản hồi; nó không hành động.
Trợ lý hỗ trợ trong phạm vi một cửa sổ
Trợ lý (Assistants) tăng thêm sự tinh vi mà không làm tăng khả năng tự chủ (agency). Chúng sử dụng system prompt để hóa thân vào một nhân vật. Chúng duy trì ngữ cảnh qua các cuộc hội thoại dài hơn. Chúng có thể tóm tắt một tài liệu bạn đã tải lên hoặc viết lại đoạn văn của bạn theo một tông giọng khác. Một trợ lý viết lách giúp kiểm tra ngữ pháp và gợi ý cách diễn đạt rõ ràng hơn là rất hữu ích. Nó nhớ rằng bạn thích cách đánh vần kiểu Anh. Nhưng nó không thực hiện hành động thay mặt bạn. Nó không tự quyết định gửi email cho biên tập viên của bạn, lên lịch thời hạn, hay tự ý tìm kiếm trên web. Nó hỗ trợ bên trong cửa sổ mà bạn cung cấp. Nó không lái xe; nó chỉ gợi ý một lộ trình tốt hơn trong khi bạn vẫn giữ tay trên vô lăng.
Workflow tuân theo bản đồ bạn đã vẽ
Workflow (quy trình công việc) nằm ở vùng trung gian, nơi mà hầu hết các hệ thống AI thực tế đang vận hành. Tại đây, bạn xác định lộ trình. Bạn xây dựng một chuỗi các bước: trích xuất ngày hóa đơn, tra cứu ID nhà cung cấp, so sánh số tiền với đơn đặt hàng, cập nhật bảng tính kế toán, gửi thông báo cho bộ phận tài chính nếu các con số không khớp. Mô hình có thể đọc hóa đơn hoặc phân loại sự sai lệch, nhưng nó tuân theo đồ thị (graph) của bạn. Bạn biết chính xác điều gì sẽ xảy ra vì bạn là người vẽ ra bản đồ.
Workflow dễ kiểm thử hơn. Bạn có thể unit-test từng bước một cách độc lập. Bạn có thể ghi lại đầu vào và đầu ra tại mỗi nút (node). Khi có lỗi xảy ra, bạn biết chính xác nhánh nào bị lỗi mà không cần phải sàng lọc qua một chuỗi suy nghĩ mờ mịt. Khả năng quan sát (observability) rất trực quan vì hệ thống không gây bất ngờ cho bạn bằng những hướng đi chệch hướng. Nếu quy trình kinh doanh của bạn có các quy tắc rõ ràng và các ngoại lệ đã biết, một workflow thường sẽ là lựa chọn chiến thắng. Bạn có được tốc độ, sự tin cậy và chi phí thấp hơn mà không cần phải giả vờ rằng máy móc có ý chí.
Tác nhân tự chọn lộ trình
Tác nhân (Agents) thì khác. Chúng mang tính động. Bạn đưa cho chúng một mục tiêu, và chúng tự tìm cách để đạt được mục tiêu đó. Một tác nhân nhận một nhiệm vụ, phân tích những gì cần phải xảy ra, lựa chọn công cụ, thực thi, quan sát kết quả, và sau đó quyết định bước tiếp theo là gì. Vòng lặp đó—suy luận, hành động, quan sát, rồi lại suy luận—chính là điều phân biệt một tác nhân với tất cả các danh mục khác.
Hãy xem xét một hệ thống xử lý các yêu cầu hoàn tiền. Một workflow có thể kiểm tra ba điều kiện và phê duyệt hoặc từ chối dựa trên các quy tắc cố định. Một tác nhân, khi được giao mục tiêu "xử lý khoản hoàn tiền này một cách công bằng đồng thời kiểm tra gian lận", có thể truy vấn lịch sử mua hàng của khách hàng, kiểm tra chính sách đổi trả cho danh mục sản phẩm đó, tra cứu hoạt động tài khoản gần đây, tạo một phiếu hỗ trợ (support ticket) để xem xét thủ công nếu mô hình trông có vẻ bất thường, và sau đó soạn một email giải thích quyết định của mình. Nó đã tự chọn công cụ nào để sử dụng và sử dụng theo thứ tự nào dựa trên các chi tiết cụ thể của trường hợp đó.
Tác nhân là một hệ thống, không chỉ là một mô hình
Một tác nhân không phải là một mô hình chạy trong cửa sổ chat. Nó là một hệ thống hoàn chỉnh. Nó kết hợp:
- Mô hình (Models) để suy luận và tạo ngôn ngữ
- Chỉ dẫn (Instructions) để giới hạn không gian hoạt động của nó
- Công cụ (Tools) với các lược đồ (schemas) nghiêm ngặt để tương tác với thế giới bên ngoài
- Ngữ cảnh (Context) về nhiệm vụ và môi trường hiện tại
- Trạng thái (State) để nó ghi nhớ mình đang ở đâu trong một quy trình nhiều bước
- Kiểm chứng (Validations) để kiểm tra đầu vào trước khi đưa vào công cụ và đầu ra trước khi gửi đến người dùng
- Giới hạn (Limits) về ngân sách, số bước hoặc phạm vi để ngăn chặn các hành vi mất kiểm soát
- Khả năng quan sát (Observability) để bạn có thể tái dựng lý do tại sao nó chọn con đường A thay vì con đường B
Nếu hệ thống của bạn thiếu hầu hết những yếu tố này, bạn không có một agent. Bạn chỉ có một mô hình với các lệnh gọi API bổ sung.
Tự trị mà không có Kiểm soát chỉ là Rủi ro
Nếu agent của bạn có thể truy vấn cơ sở dữ liệu production, tạo bản ghi trong CRM, hoặc gửi tin nhắn cho người dùng, nó cũng có thể làm hỏng dữ liệu, tạo các mục trùng lặp, hoặc spam khách hàng. Một kiến trúc agent tốt luôn giả định rằng sẽ có lỗi xảy ra. Nó yêu cầu quyền trước khi thực hiện các hành động mang tính hủy hoại. Nó chạy các bước kiểm chứng trước khi xác nhận kết quả. Nó hiển thị quá trình suy luận để con người có thể can thiệp khi chi phí hoặc rủi ro tăng cao.
Nếu bạn bỏ qua các giới hạn này chỉ vì bản demo trông có vẻ thú vị, bạn sẽ phải dành cả cuối tuần để gỡ lỗi tại sao agent lại tạo ra bốn trăm phiếu hỗ trợ (support tickets) chỉ trong một đêm hoặc hoàn tiền cho một đơn hàng mà lẽ ra nó không được phép chạm vào. Sự khó đoán mà bạn lo sợ trong các hệ thống "hộp đen" (black-box) sẽ trở thành hiện thực ngay khoảnh khắc bạn giao cho AI cả một mục tiêu lẫn một bộ công cụ không được giám sát.
Hãy bắt đầu với Vấn đề, không phải Công nghệ
Đừng bắt đầu với agent. Hãy bắt đầu với nỗi đau (vấn đề cần giải quyết). Đôi khi giải pháp chỉ là một prompt tốt hơn. Đôi khi đó là một hàm xác định (deterministic function) trong backend hiện có của bạn. Đôi khi đó là một quy trình (workflow) với một bước AI và năm lệnh gọi API truyền thống.
Chỉ nên sử dụng agent khi nhiệm vụ thực sự đòi hỏi:
- Nhiều bước phụ thuộc lẫn nhau
- Khả năng ra quyết định linh hoạt giữa các bước đó
- Tương tác với các công cụ bên ngoài
- Suy luận dựa trên các kết quả trung gian mà bạn không thể lập bản đồ đầy đủ trước thời gian thực
Nếu lộ trình đã được xác định, hãy xây dựng một workflow. Nếu tương tác đơn giản, hãy xây dựng một chatbot hoặc một trợ lý. Đừng thêm tính năng "agent" chỉ vì từ đó nghe có vẻ hiện đại.
Xây dựng sự Trưởng thành, không phải sự Phức tạp
Khi một agent thực sự là lựa chọn phù hợp, hãy xây dựng nó theo từng lớp. Bắt đầu với một công cụ duy nhất và một quyết định được mã hóa cứng (hardcoded). Thêm các bài kiểm tra (tests) để xác minh rằng công cụ được gọi với các tham số chính xác. Thêm nhật ký (logging) để bạn có thể xem toàn bộ vết (trace). Thêm quản lý trạng thái (state management) để hệ thống biết nó đã dừng lại ở đâu. Thêm các bước kiểm chứng tại mọi ranh giới. Thêm các bảng điều khiển quan sát (observability dashboards) để đội ngũ của bạn có thể theo dõi hành vi trong thời gian thực. Cuối cùng, hãy thêm tính tự trị một cách cẩn thận—quyền tự do lựa chọn giữa các phương án. Đừng làm ngược lại. Sự tự trị được xây dựng trên nền tảng của sự hỗn loạn sẽ tạo ra những tai nạn tốn kém.
Bài học cốt lõi
Ngôn từ định hình hệ thống. Hãy dành thuật ngữ "agent" cho những kiến trúc xứng đáng với nó: hướng mục tiêu, biết sử dụng công cụ và có khả năng thích ứng linh hoạt, nhưng được bao bọc trong các giới hạn nghiêm ngặt và sự giám sát của con người. Mọi thứ khác chỉ là chatbot, trợ lý hoặc workflow. Hãy xây dựng thứ đơn giản nhất có thể giải quyết được vấn đề. Nhật ký production, đội ngũ tài chính và chính bản thân bạn trong tương lai sẽ cảm ơn bạn.
Nguồn: https://dev.to/leandrolayerle/no-todo-chatbot-es-un-agente-de-ia-3oec
Tham gia cộng đồng học tập GyaanSetu: https://t.me/GyaanSetuAi
