Tại Hội nghị thượng đỉnh Bogotá, AWS đã giới thiệu Bedrock AgentCore, Fault Injection Service, Zonal Shift và một bộ hướng dẫn bảo mật hậu lượng tử.
Tại sao AI agent hiện là một thành phần xây dựng cốt lõi
Amazon Quick Desktop, được trình diễn tại sự kiện, chạy cục bộ, thu thập dữ liệu (crawl) môi trường làm việc chuyên nghiệp của người dùng và xây dựng một đồ thị tri thức (knowledge graph) gồm các tài liệu, danh bạ và quy trình làm việc liên quan. Giao diện người dùng đó minh họa cho nỗ lực của AWS trong việc biến các agent thành điểm tích hợp mặc định cho các khối lượng công việc đám mây (cloud workloads).
Bedrock AgentCore là nền tảng mà AWS đang định vị để kiểm soát hệ sinh thái agent đang ngày càng phát triển. Nó đóng gói ba chức năng dưới khái niệm “Harness”:
- Orchestration (Điều phối) – xác định cách nhiều agent giao tiếp với nhau và với các dịch vụ hạ nguồn (downstream services).
- Observability (Khả năng quan sát) – thu thập các chỉ số (metrics), nhật ký (logs) và vết (traces) để người vận hành có thể biết agent nào xử lý từng yêu cầu.
- Control limits (Giới hạn kiểm soát) – thiết lập hạn mức và các rào chắn an toàn để ngăn chặn việc thực thi quá mức hoặc rò rỉ dữ liệu.
Các nhà phát triển sử dụng dịch vụ này để khởi tạo các agent chuyên dụng mà không cần phải xây dựng các thành phần nền tảng (plumbing) từ đầu. Bằng cách cung cấp một API tiêu chuẩn cho ba chức năng này, AWS muốn việc phát triển agent trở thành một mô hình có thể lặp lại thay vì chỉ là một thử nghiệm ngách.
Khả năng phục hồi vượt xa việc "duy trì hoạt động"
Các cam kết về tính sẵn sàng cao (high-availability) đã chuyển dịch từ tỷ lệ thời gian hoạt động (uptime) đơn thuần sang các ngân sách lỗi (error budgets) có thể đo lường được, dựa trên khả năng quan sát thời gian thực. Tại hội nghị, Yuno—một nhà cung cấp SaaS khu vực—đã cho thấy cách họ duy trì mức SLA 99,95% bằng cách kết hợp triển khai canary (canary deployments) với kỹ thuật hỗn loạn (chaos engineering).
Hai công cụ mới đã thu hút sự chú ý:
- Fault Injection Service – cho phép các nhóm đưa độ trễ, lỗi hoặc lỗi nút (node failures) vào môi trường thực tế để xác minh logic giám sát và khắc phục trước khi xảy ra sự cố thực sự.
- Zonal Shift – một thành phần định tuyến lưu lượng cơ bản giúp chuyển các yêu cầu đến từ các Availability Zone đang gặp sự cố sang các vùng (zones) khỏe mạnh mà không cần thay đổi mã nguồn ứng dụng.
AWS đã trình bày danh sách kiểm tra giảm thiểu rủi ro theo từng thành phần:
- Amazon Aurora – kích hoạt chuyển vùng dự phòng (regional failover) với Aurora Global Database.
- Amazon MSK – sử dụng MSK Replicator để giữ các topic offset đồng bộ giữa các cụm (clusters).
- Load balancers và EKS – áp dụng Zonal Shift trên Application Load Balancers và trên các cụm Amazon Elastic Kubernetes Service.
Đối với các quá trình di chuyển (migrations) không thể chấp nhận thời gian ngừng hoạt động (downtime), hội nghị đã thúc đẩy quy trình làm việc Blue/Green: khởi tạo một cụm song song, điều hướng 1% lưu lượng qua các bản phát hành được quản lý bởi ArgoCD, và chỉ chuyển toàn bộ tải sau khi đã xác thực. Cách tiếp cận này dựa trên chính dữ liệu quan sát dùng để tính toán ngân sách lỗi.
Chuẩn bị cho các cuộc tấn công cấp độ lượng tử
AWS nhắc nhở những người tham dự rằng máy tính lượng tử, dù vẫn đang trong giai đoạn thử nghiệm, cuối cùng sẽ phá vỡ các thuật toán khóa công khai được sử dụng rộng rãi như RSA và ECC. Amazon Braket hiện cung cấp quyền truy cập vào các bộ xử lý lượng tử thực và các trình mô phỏng độ trung thực cao, mang lại cho các đội ngũ bảo mật một môi trường thử nghiệm (sandbox) để kiểm tra các nguyên ngữ mã hóa (cryptographic primitives).
Nhánh bảo mật đã thúc giục các tổ chức bắt đầu lộ trình di chuyển sang mã hóa hậu lượng tử (post-quantum cryptography - PQC) ngay từ bây giờ:
- Kiểm kê (Inventory) mọi tài sản mã hóa – chứng chỉ TLS, khóa VPN, các mô-đun mã hóa dữ liệu tĩnh (data-at-rest).
- Áp dụng các kiểm soát hỗn hợp (hybrid controls) – chạy song song một thuật toán cổ điển với một thuật toán PQC tiềm năng cho đến khi thuật toán sau chứng minh được độ an toàn.
- Lập kế hoạch cho tăng tốc phần cứng – theo dõi các chip PQC mới nổi có thể được tích hợp thông qua AWS Nitro hoặc các thực thể (instances) FPGA tùy chỉnh.
Các hướng dẫn này dừng lại ở mức khuyến nghị chứ chưa bắt buộc bất kỳ thuật toán cụ thể nào.
Thực thi vành đai bảo mật khai báo trong thực tế
Bảo mật đám mây truyền thống thường tập trung vào danh tính (ai có thể đăng nhập) và mạng (các mạng con nào có thể giao tiếp). AWS đã sử dụng việc triển khai Control Tower của Bancolombia làm mẫu cho mô hình “vành đai” (perimeter) bốn lớp:
- Vành đai danh tính (Identity perimeter) – các Chính sách Kiểm soát Dịch vụ (Service Control Policies - SCPs) nhằm hạn chế các hành động mà các vai trò IAM có thể thực hiện trong toàn tổ chức.
- Vành đai tài nguyên (Resource perimeter) – các Chính sách Kiểm soát Tài nguyên (Resource Control Policies - RCPs) giúp gắn thẻ và bảo vệ các dịch vụ cụ thể, chẳng hạn như giới hạn việc tạo S3 bucket trong các vùng đã được phê duyệt.
- Vành đai mạng (Network perimeter) – các VPC Endpoints và VPC Lattice mới hơn giúp giữ lưu lượng truy cập trên trục xương sống (backbone) của AWS và tránh internet công cộng.
- Thực thi chính sách khai báo (Declarative policy enforcement) – các CloudFormation Hooks và hàm Lambda tự động khắc phục sự sai lệch (drift), ví dụ như áp dụng lại các cài đặt mã hóa khi một bucket được tạo mà không có mã hóa phía máy chủ (server-side encryption).
Ý tưởng là mã hóa mọi quyết định bảo mật để sự sai lệch được phát hiện và khắc phục mà không cần phải xử lý các phiếu yêu cầu (ticket) thủ công.
AI thực tế ở quy mô lớn: ADRES Colombia
Một ví dụ minh họa cụ thể về mô hình tác nhân (agent paradigm) đến từ ADRES, một đơn vị xử lý yêu cầu bồi thường bảo hiểm y tế của Colombia. Hệ thống của họ kết hợp Amazon Nova (một dịch vụ suy luận được quản lý) với SageMaker, được điều phối thông qua kiến trúc đa tác nhân (multi-agent architecture):
- Các tác nhân chuyên biệt (Specialized agents) phân tích hóa đơn, trích xuất các mã lâm sàng và kiểm tra chéo tính hợp lệ của quyền lợi một cách song song.
- Các lớp Trí tuệ nhân tạo có thể giải thích (Explainable AI - XAI) đính kèm siêu dữ liệu về nguồn gốc (provenance metadata) để các kiểm toán viên có thể truy vết một quyết định về tài liệu gốc.
- Các bước Con người tham gia vào quy trình (Human-in-the-loop - HITL) sẽ tạm dừng quy trình làm việc tự động để kiểm toán viên y tế đưa ra phê duyệt cuối cùng trước khi lệnh thanh toán được thực hiện.
Quan điểm đối lập: sự phức tạp và chi phí
Tất cả các thành phần cơ bản (primitives) mới đều hứa hẹn khả năng tự động hóa, nhưng chúng cũng nâng cao yêu cầu về chuyên môn vận hành. Việc triển khai Fault Injection Service và Zonal Shift đòi hỏi một đường ống CI/CD trưởng thành và hệ thống đo lường từ xa (telemetry) đáng tin cậy; nếu không, các lưới an toàn sẽ trở thành nguồn gây nhiễu. Việc duy trì các ngăn xếp PQC lai (hybrid PQC stacks) làm tăng chi phí mã hóa (cryptographic overhead), điều này có thể ảnh hưởng đến các khối lượng công việc nhạy cảm với độ trễ (latency-sensitive workloads). Các công ty nhỏ hơn có thể thấy khoản đầu tư ban đầu là quá lớn cho đến khi các công cụ này trở nên hoàn thiện và giá cả ổn định.
