在波哥大峰会上,AWS 展示了 Bedrock AgentCore、Fault Injection Service、Zonal Shift 以及一套后量子安全指南。

为什么 AI Agent 现在是核心构建模块

会上演示的 Amazon Quick Desktop 可以在本地运行,抓取用户的专业环境,并构建包含相关文档、联系人和工作流的知识图谱。该前端展示了 AWS 正致力于将 Agent 打造为云工作负载的默认集成点。

Bedrock AgentCore 是 AWS 用来驾驭日益增长的 Agent 生态系统的平台。它在“Harness”(控制/束缚)概念下整合了三个功能:

  • Orchestration(编排) – 定义多个 Agent 之间以及 Agent 与下游服务之间的通信方式。
  • Observability(可观测性) – 收集指标、日志和追踪数据,以便运维人员查看哪个 Agent 处理了每个请求。
  • Control limits(控制限制) – 设置配额和安全防护,防止程序失控运行或数据泄露。

开发人员可以使用该服务快速启动专门的 Agent,而无需从零开始构建底层架构。通过为这三个功能提供标准 API,AWS 希望 Agent 开发能够成为一种可重复的模式,而非小众的实验。

韧性不再仅仅是“维持运行”

高可用性的承诺已从简单的运行时间百分比,转向由实时可观测性支持的可衡量错误预算。在峰会上,区域 SaaS 提供商 Yuno 展示了如何通过结合金丝雀部署(canary deployments)与混沌工程(chaos engineering)来维持 99.95% 的 SLA。

两款新工具成为了关注的焦点:

  • Fault Injection Service – 让团队能够在生产环境中注入延迟、错误或节点故障,以便在真实故障发生前验证监控和修复逻辑。
  • Zonal Shift – 一种流量路由原语,可以在不改动应用程序代码的情况下,将入站请求从故障可用区(Availability Zone)转移到健康的可用区。

AWS 详细介绍了逐组件的缓解检查清单:

  • Amazon Aurora – 使用 Aurora Global Database 实现区域级故障转移。
  • Amazon MSK – 使用 MSK Replicator 保持跨集群的主题偏移量(topic offsets)同步。
  • Load balancers and EKS – 在 Application Load Balancers 和 Amazon Elastic Kubernetes Service 集群上应用 Zonal Shift。

对于无法容忍停机的迁移,峰会推广了一种蓝绿(Blue/Green)工作流:启动一个并行集群,通过 ArgoCD 管理的发布版本引导 1% 的流量,并在验证通过后才进行全量切换。这种方法依赖于用于计算错误预算的同类可观测性数据。

为量子级攻击做好准备

AWS 提醒与会者,量子计算机虽然仍处于实验阶段,但最终将破解广泛使用的公钥算法,如 RSA 和 ECC。Amazon Braket 现在提供对真实量子处理器和高保真模拟器的访问,为安全团队提供了一个测试密码原语(cryptographic primitives)的沙箱。

安全分论坛敦促各机构现在就开始制定 后量子密码学 (PQC) 迁移路线图:

  1. 盘点所有加密资产——TLS 证书、VPN 密钥、静态数据加密模块。
  2. 应用混合控制——将经典算法与候选 PQC 算法并行运行,直到后者证明是安全的。
  3. 规划硬件加速——关注新兴的 PQC 芯片,这些芯片可以通过 AWS Nitro 或自定义 FPGA 实例进行集成。

该指南并未强制要求使用任何特定算法。

声明式安全边界的实践

传统的云安全侧重于身份(谁可以登录)和网络(哪些子网可以通信)。AWS 以 Bancolombia 的 Control Tower 部署为例,展示了一个四层“边界”模型:

  • 身份边界 – 通过 Service Control Policies (SCPs) 限制 IAM 角色在整个组织中可以调用的操作。
  • 资源边界 – 通过 Resource Control Policies (RCPs) 对特定服务进行标记和保护,例如将 S3 存储桶的创建限制在批准的区域内。
  • 网络边界 – 通过 VPC Endpoints 和较新的 VPC Lattice 将流量保持在 AWS 骨干网内,避免经过公共互联网。
  • 声明式策略执行 – 通过 CloudFormation Hooks 和 Lambda 函数自动修复配置漂移(drift),例如在创建未启用服务器端加密的存储桶时,自动重新应用加密设置。

其核心思想是将每个安全决策代码化,从而在无需人工处理工单的情况下发现并纠正配置漂移。

大规模真实场景 AI:ADRES Colombia

智能体范式的一个具体实例来自 ADRES,这是一家哥伦比亚的医疗理赔处理机构。他们的技术栈将 Amazon Nova(一种托管推理服务)与 SageMaker 相结合,并通过多智能体架构进行编排:

  • 专业化智能体并行解析发票、提取临床代码并交叉检查资格。
  • 可解释人工智能 (XAI) 层附加溯源元数据,以便审计人员可以将决策追溯到原始文档。
  • 人机回环 (HITL) 步骤会暂停自动化工作流,由医疗审计员在发放付款前进行最终审批。

反方观点:复杂性与成本

所有这些新的原语都承诺了自动化,但同时也提高了对运维专业知识的要求。部署 Fault Injection Service 和 Zonal Shift 需要成熟的 CI/CD 流水线和可靠的遥测数据;否则,这些安全网反而会变成噪音来源。维护混合 PQC 栈会增加加密开销,这可能会影响延迟敏感型的工作负载。在工具成熟且价格稳定之前,小型企业可能会发现前期的投入成本过高。