Khi một tác nhân AI tuyên bố đã hoàn thành nhiệm vụ, sự hoài nghi là phản ứng tỉnh táo duy nhất. Một dòng nhật ký ghi “Task completed at 14:32” chỉ là một chuỗi văn bản. Tác nhân đó có thể đã bị treo máy một cách âm thầm, gửi một biểu mẫu trống, lặp lại các kết quả tìm kiếm rỗng, hoặc ảo giác ra cả một quy trình làm việc. Nếu kiến trúc của bạn bao gồm nhiều tác nhân chạy trên các máy, vùng đám mây hoặc địa chỉ IP khác nhau, vấn đề sẽ trở nên trầm trọng rất nhanh. Tác nhân B không có lý do gì để tin tưởng báo cáo của Tác nhân A trừ khi Tác nhân A có thể chứng minh được quá trình làm việc của mình.

Mọi hệ thống xác minh đáng tin cậy đều được xây dựng trên ba lớp. Bằng chứng là hiện vật thô—ảnh chụp màn hình, phản hồi API, bản trích xuất HTML. Chứng thực là một tuyên bố đã được ký hoặc bằng mã hóa nhằm gắn kết bằng chứng đó với một tác nhân cụ thể và một ID nhiệm vụ cụ thể. Xác minh là quá trình xác nhận rằng bằng chứng đó thực sự đáp ứng mục tiêu ban đầu, chứ không chỉ đơn thuần là tệp đó có tồn tại. Bằng chứng mà không có chứng thực có thể bị dùng lại (replay) từ công việc này sang công việc khác. Chứng thực mà không có xác minh chỉ cho bạn biết dữ liệu là thật, chứ không cho biết liệu nó có trả lời đúng câu hỏi bạn đã đặt ra hay không.

Bằng chứng trực quan: Ảnh chụp màn hình và OCR

Khi một tác nhân điều khiển trình duyệt hoặc tương tác với giao diện đồ họa, bằng chứng đơn giản nhất là một hình ảnh. Tác nhân sẽ chụp ảnh màn hình toàn trang sau khi hành động hoàn tất, chạy OCR để trích xuất văn bản hiển thị, và gửi cả hình ảnh lẫn các chuỗi văn bản đã trích xuất dưới dạng bằng chứng.

Mô hình này phù hợp với các bài đăng trên mạng xã hội, việc gửi biểu mẫu hoặc các luồng thanh toán. Hãy tưởng tượng một tác nhân được giao nhiệm vụ đăng bản cập nhật hàng tuần lên trang LinkedIn của công ty. Ảnh chụp màn hình sẽ hiển thị bài đăng trực tiếp với dấu thời gian được render từ máy chủ và ID bài đăng được nhúng trong URL. OCR có thể xác nhận tiêu đề và nội dung văn bản chính xác xuất hiện trên trang cùng với các dấu mốc đặc thù của nền tảng đó.

Rủi ro là rất rõ ràng: ảnh chụp màn hình có thể bị làm giả. Một tác nhân bị xâm nhập có thể hiển thị một trang web giả mạo cục bộ, chụp ảnh màn hình nó và tuyên bố thành công. Để nâng cao tiêu chuẩn, hãy yêu cầu các dấu mốc văn bản động khó dự đoán. Một ID xác nhận do nền tảng cấp, một dấu thời gian từ máy chủ, hoặc một mã nonce duy nhất mà ứng dụng xác minh đính kèm vào hướng dẫn công việc đều có thể đóng vai trò là các điểm neo. Nếu đầu ra OCR không chứa ID xác nhận dự kiến gắn liền với chính nhiệm vụ đó, bằng chứng sẽ bị coi là thất bại.

Tuy nhiên, ảnh chụp màn hình khá nặng. Chúng tiêu tốn băng thông và dung lượng lưu trữ, đồng thời sẽ bị lỗi khi các nền tảng thiết kế lại bố cục. Hãy sử dụng chúng khi giao diện người dùng (UI) là bề mặt duy nhất có sẵn, nhưng hãy coi chúng là mức cơ bản, không phải là một pháo đài bất khả xâm phạm.

Biên lai API có chữ ký

Khi tác nhân làm việc thông qua một API backend, hãy bỏ qua hình ảnh. Hãy yêu cầu một biên lai có chữ ký.

Sau một bài đăng tự động hoặc một đợt quét dữ liệu, nền tảng thường trả về một payload có cấu trúc. Tệp JSON đó chứa một ID, dấu thời gian, các trường trạng thái và đôi khi là các header giới hạn tốc độ (rate-limit). Tác nhân sẽ ký toàn bộ payload này bằng một khóa riêng (private key), đưa ID nhiệm vụ vào bên trong khối dữ liệu (blob) đã ký, và gửi gói dữ liệu đó đi. Trình xác minh sẽ kiểm tra chữ ký bằng khóa công khai (public key) của tác nhân và kiểm tra biên lai để xác nhận hành động đã thành công.

Điểm yếu ở đây là việc quản lý khóa (key custody). Nếu tác nhân giữ khóa riêng của chính nó trên cùng một máy mà nó đang chạy, một cuộc tấn công prompt injection, sự bùng phát mã độc hoặc thoát khỏi container (container escape) có thể trích xuất khóa và làm giả biên lai cho các nhiệm vụ chưa từng xảy ra. Đừng nhúng các khóa có thời hạn dài vào môi trường của tác nhân. Thay vào đó, hãy sử dụng một hệ thống quản lý khóa (KMS) để cấp các thông tin xác thực có thời hạn ngắn và phạm vi hẹp cho từng nhiệm vụ. Hãy xoay vòng khóa cho mỗi nhiệm vụ. Nếu tác nhân phải yêu cầu một khóa ký từ một vùng an toàn (secure enclave) hoặc KMS trong cửa sổ thời gian năm phút, phạm vi ảnh hưởng (blast radius) của một vụ xâm nhập sẽ được giữ ở mức nhỏ.

Mô hình này hoạt động tốt nhất cho tự động hóa không giao diện (headless) với khối lượng lớn: đồng bộ hóa báo cáo chi tiêu quảng cáo, đăng bài qua các API mạng xã hội, hoặc quét các endpoint trả về JSON có cấu trúc. Nó nhẹ hơn ảnh chụp màn hình và dễ dàng xác minh bằng lập trình hơn nhiều.

Chuỗi bằng chứng cho công việc liên tục

Một số nhiệm vụ không thể gói gọn trong một