AWS 和 Anthropic 在 Amazon Web Services 上推出了自托管的 Claude Apps Gateway,而 Google Cloud 则新增了一个 VS Code Workbench 扩展,将编辑器直接与 Jupyter notebooks 连接起来。Stripe 的一项独立基准测试显示,尽管取得了这些进展,AI agent 在验证其生成的代码时仍然会遇到困难。
为何这些新控制措施至关重要
开始将 Claude 等大语言模型 (LLM) 嵌入内部工具的企业现在面临着一个熟悉的问题:在扩大使用规模的同时,如何确保访问安全、控制成本并保护数据。Claude Apps Gateway 将控制平面置于客户的 AWS 账户内,为 IT 团队提供了管理身份、审计日志和支出的统一入口。开发者现在可以启动由 Claude 驱动的 Code 或 Desktop 会话,而无需将数据暴露给外部服务。
Google 的 VS Code Workbench 解决了另一个摩擦点。数据科学家和工程师经常需要在本地 IDE 和云端 notebook 之间来回切换,反复复制粘贴代码。新的扩展程序允许开发者在 Google Cloud 上打开 notebook 的内核,在本地编辑文件,并实时查看同步的更改。远程执行和调试直接在熟悉的 VS Code UI 中完成,消除了减慢实验进度的“工具切换”步骤。
让讨论回归现实的基准测试
Stripe 最近的 AI Agent Benchmark 测试了当前 agent 处理软件集成的能力。Agent 能够很好地编写集成代码,但在验证方面表现不佳,经常遗漏边缘情况和错误检查。结果很明确:agent 在生成阶段表现强劲,但在验证阶段却力不从心。
谁是赢家,谁是输家
- 企业 对 Claude 部署获得了更严密的治理,降低了风险暴露。
- Google Cloud 上的开发者 无需在工具之间切换即可工作,直接通过单个编辑器在云端机器上运行重型计算。
另一方面,正如 Stripe 的基准测试所表明的那样,如果组织在采用这些工具时没有更新内部政策,可能仍会面临验证方面的漏洞。这些工具简化了访问,但并未消除对人工监督的需求。
下一步值得关注的方向
对于正在尝试 AI 的团队来说,眼下的教训很简单:利用新的控制措施来加强安全性并简化工作流程,但必须保留人工参与进行验证。在 agent 能够可靠地发现自身错误之前,开发者作为审核者的角色依然不可或缺。
