Trong hai năm qua, kỹ thuật AI đã tuân theo một kịch bản đơn giản. Cung cấp cho một agent một prompt, một vài công cụ và một lớp bộ nhớ. Quan sát nó lên lịch họp, tóm tắt hợp đồng hoặc gỡ lỗi một đoạn mã. Toàn bộ mục tiêu là làm cho một agent đơn lẻ có thể hữu ích khi hoạt động độc lập.

Mục tiêu đó đã thay đổi.

Chúng ta hiện đang chứng kiến ngành công nghiệp chuyển dịch từ các agent đơn lẻ sang các đội ngũ agent (agent teams). Một bot phân loại dịch vụ khách hàng nhận diện một yêu cầu hoàn tiền và chuyển vụ việc đó cho một agent thanh toán. Một agent nghiên cứu đang thu thập dữ liệu web gặp phải một khoảng trống chuyên biệt và ủy thác nhiệm vụ cho một chuyên gia đang nắm giữ một cơ sở dữ liệu độc quyền. Một agent logistics đang lập kế hoạch vận chuyển cần báo giá cước phí theo thời gian thực, vì vậy nó yêu cầu một agent định giá cung cấp một con số.

Điều này nghe có vẻ đơn giản trên lý thuyết. Nhưng trong thực tế, nó rất mong manh.

Thách thức mới chính là khả năng tương tác (interoperability). Các đội ngũ xây dựng agent trên các framework khác nhau. Các nhà cung cấp khác nhau cung cấp các agent với các giao diện khác nhau. Khi một công ty cần làm việc với một công ty khác, khoảng cách này càng nới rộng. Chúng ta hiện có một bối cảnh đầy rẫy những nhân sự có năng lực nhưng lại thiếu một ngôn ngữ chung. Một agent không thể tra cứu một agent khác trong danh bạ. Nó không thể đọc mô tả về những gì đồng nghiệp của nó làm. Và nó không thể bàn giao một công việc nhạy cảm mà không gặp rủi ro rò rỉ dữ liệu, mất ngữ cảnh hoặc thực thi trùng lặp.

Đây chính xác là vấn đề mà A2A được xây dựng để giải quyết. Nó cung cấp cho các agent một giao thức chung để khám phá, ủy thác và cộng tác an toàn.

Từ các Agent đơn lẻ đến các Ốc đảo Agent (Agent Silos)

Làn sóng đầu tiên của các framework agent coi ranh giới của hệ thống cũng chính là ranh giới của agent. Bạn xây dựng một vòng lặp suy luận, cung cấp cho nó một bộ công cụ, và hy vọng nó có thể tự tư duy để hoàn thành một quy trình làm việc. Điều đó hoạt động đủ tốt khi agent chỉ nằm trong một codebase, một tài khoản đám mây hoặc một nền tảng của nhà cung cấp.

Các doanh nghiệp thực tế không hoạt động trong các hệ thống nguyên khối (monoliths). Một yêu cầu hoàn tiền có thể bắt đầu trong một CRM, chuyển sang một dịch vụ thanh toán nội bộ được viết bằng Python, và kết thúc bằng một bước kiểm tra gian lận được lưu trữ bởi bên thứ ba. Khi bạn mô hình hóa mỗi dịch vụ đó như một agent, bạn sẽ nhanh chóng nhận ra rằng các agent được xây dựng trên các stack khác nhau không thể hiểu nhau một cách tự nhiên. Các agent doanh nghiệp được xây dựng trên các framework độc quyền không công bố khả năng của chúng ra thế giới bên ngoài.

Nếu không có một tiêu chuẩn, mọi sự tích hợp đều trở thành một dự án tùy chỉnh. Các kỹ sư phải viết các đoạn mã kết nối (glue code) rời rạc. Ngữ cảnh bị mất đi trong quá trình chuyển đổi. Các chính sách bảo mật trở nên thiếu nhất quán, vì mỗi lần bàn giao đều được thực hiện theo cách riêng biệt.

Agent Cards: Một Bản sơ yếu lý lịch công khai

A2A giới thiệu Agent Cards như một cách để các agent thông báo họ là ai và họ có thể làm gì.

Hãy coi một Agent Card như một bản sơ yếu lý lịch mà máy có thể đọc được. Một agent sẽ công bố một thẻ mô tả lĩnh vực chuyên môn, các đầu vào bắt buộc, các đầu ra mong đợi và bất kỳ ràng buộc nào đối với công việc mà nó chấp nhận. Một agent thanh toán có thể tuyên bố rằng nó xử lý các yêu cầu hoàn tiền dưới một số tiền nhất định khi được cung cấp ID đơn hàng và mã lý do, và nó sẽ trả về số xác nhận hoặc một lỗi. Một chuyên gia dữ liệu có thể tuyên bố rằng nó chấp nhận các tệp có cấu trúc lên đến một kích thước cụ thể và trả về dữ liệu chuỗi thời gian đã được làm sạch trong một khoảng thời gian có thể dự đoán được.

Trước khi ủy thác công việc, agent yêu cầu sẽ đọc thẻ đó. Nó hiểu liệu agent mục tiêu có đủ khả năng thực hiện công việc hay không. Nó biết định dạng mà payload cần là gì. Nó biết liệu nên mong đợi một phản hồi đồng bộ hay một tác vụ bất đồng bộ sẽ hoàn thành sau đó.

Điều này loại bỏ việc phải đoán mò. Thay vì lập trình cứng các tích hợp với mọi đối tác tiềm năng, một agent có thể duyệt qua các khả năng hiện có và chọn đúng đồng đội một cách linh hoạt.

Tasks: Công việc có cấu trúc, không chỉ là các lời gọi API

Các agent không cần phải trò chuyện như con người. Chúng cần bàn giao công việc một cách gọn gàng. A2A mô hình hóa sự trao đổi này dưới dạng một Task.

Một Task không chỉ là