AWS và Anthropic đã triển khai Claude Apps Gateway tự lưu trữ (self-hosted) trên Amazon Web Services, trong khi Google Cloud bổ sung một tiện ích mở rộng VS Code Workbench giúp kết nối trực tiếp trình soạn thảo với các Jupyter notebooks của mình. Một bài kiểm tra chuẩn (benchmark) riêng biệt từ Stripe cho thấy rằng, bất chấp những tiến bộ này, các tác nhân AI (AI agents) vẫn còn gặp khó khăn trong việc xác thực mã nguồn mà chúng tạo ra.
Tại sao các cơ chế kiểm soát mới lại quan trọng
Các doanh nghiệp đã bắt đầu tích hợp các mô hình ngôn ngữ lớn (LLM) như Claude vào các công cụ nội bộ hiện đang đối mặt với một vấn đề quen thuộc: giữ an toàn cho quyền truy cập, chi phí và dữ liệu trong khi mở rộng quy mô sử dụng. Claude Apps Gateway đặt lớp điều khiển (control plane) bên trong tài khoản AWS của khách hàng, cung cấp cho các đội ngũ IT một điểm duy nhất để quản lý danh tính, nhật ký kiểm tra (audit logs) và chi tiêu. Giờ đây, các nhà phát triển có thể khởi chạy các phiên làm việc Code hoặc Desktop được hỗ trợ bởi Claude mà không làm lộ dữ liệu cho dịch vụ bên ngoài.
VS Code Workbench của Google giải quyết một điểm gây trở ngại khác. Các nhà khoa học dữ liệu và kỹ sư thường phải chuyển đổi qua lại giữa một IDE cục bộ và các notebook trên đám mây, việc sao chép mã nguồn qua lại gây mất thời gian. Tiện ích mở rộng mới cho phép nhà phát triển mở kernel của một notebook trên Google Cloud, chỉnh sửa các tệp cục bộ và theo dõi các thay đổi được đồng bộ hóa theo thời gian thực. Việc thực thi và gỡ lỗi từ xa diễn ra ngay trên giao diện VS Code quen thuộc, loại bỏ bước "nhảy công cụ" (tool-hopping) vốn làm chậm quá trình thử nghiệm.
Bài kiểm tra chuẩn giúp duy trì cái nhìn khách quan
Bài kiểm tra AI Agent Benchmark gần đây của Stripe đã thử nghiệm khả năng xử lý tích hợp phần mềm của các tác nhân hiện nay. Các tác nhân viết mã tích hợp khá tốt nhưng lại vấp ngã ở khâu xác thực, thường bỏ lỡ các trường hợp biên (edge cases) và các bước kiểm tra lỗi. Kết quả rất rõ ràng: các tác nhân hoạt động mạnh mẽ trong giai đoạn tạo mã (generation) nhưng lại gặp khó khăn trong quá trình xác thực (validation).
Ai thắng, ai thua
- Các doanh nghiệp có được khả năng quản trị chặt chẽ hơn đối với việc triển khai Claude, giúp giảm thiểu rủi ro lộ lọt dữ liệu.
- Các nhà phát triển trên Google Cloud có thể làm việc mà không cần chuyển đổi giữa các công cụ, chạy các tính toán nặng trên máy chủ đám mây từ một trình soạn thảo duy nhất.
Mặt khác, các tổ chức áp dụng những công cụ này mà không cập nhật các chính sách nội bộ vẫn có thể đối mặt với những lỗ hổng trong việc xác thực, như bài kiểm tra của Stripe đã chứng minh. Các công cụ này giúp đơn giản hóa việc truy cập nhưng không loại bỏ được nhu cầu giám sát của con người.
Điều cần theo dõi tiếp theo
Bài học tức thời cho các đội ngũ đang thử nghiệm AI rất đơn giản: hãy sử dụng các cơ chế kiểm soát mới để thắt chặt bảo mật và tối ưu hóa quy trình làm việc, nhưng vẫn cần con người tham gia vào quy trình (human in the loop) để xác minh. Cho đến khi các tác nhân có thể tự tin phát hiện lỗi của chính mình, vai trò người kiểm duyệt của nhà phát triển vẫn là không thể thay thế.
