Vercel AI SDK 7 将工具权限严格限制在其声明的密钥中
该 SDK 现在要求每个工具都必须提供一个基于 Zod 的上下文模式,并且在运行时,Vercel 会验证是否仅传递了声明过的字段,若出现任何多余或缺失的键,将中止执行。
AI、机器学习与 LLM 洞察。
该 SDK 现在要求每个工具都必须提供一个基于 Zod 的上下文模式,并且在运行时,Vercel 会验证是否仅传递了声明过的字段,若出现任何多余或缺失的键,将中止执行。
运行自有 LLM 与使用 API 的真实成本对比。开源权重是免费的,但运行它们并不免费。许多人认为自托管开源模型可以省钱,这其实是一个误区。你必须关注……
通过将模型的输出视为可编辑文本,Deep Interaction 使开发者能够精准定位错误的推理步骤并进行重写,随后反馈精简后的提示词。在 STEM 基准测试中,这一方法使纠错率提升了 25%,同时将 Token 使用量降低了 40%。
我让一个 AI 代理运行了一周的云运维工作。我给了一个 AI 代理七天时间来管理我的云运维。这是一个真实环境,而非演示环境。我给了它我监控系统的只读权限……
新推出的 amazon-opensearch-service skill 加快了策略排序和实例规格配置的速度,但在被要求在 Serverless NextGen 上配置向量搜索时,它会默认使用传统的 FAISS 设置,从而导致部署失败。
这两项发布将开源权重模型从边缘项目推向了主流 AI 领域,使企业能够选择在 Apache 2.0 协议下本地部署运行超大规模模型,同时在编程任务上仍能媲美闭源模型的性能。
该框架定义了五种漂移类别——UI、API、数据、权限和策略——并结合轻量级契约映射与预检扫描,在自主代理运行前识别不匹配项,从而避免静默失败和高昂的返工成本。
通过 Model Context Protocol (MCP) 连接器,Claude 生成的代码现在可以直接从聊天界面调用数据库、云服务或 Slack,从而省去了复制粘贴的步骤,让开发者能够立即使用真实数据进行测试。
由于缺少一个验证步骤,导致智能体跳过了其“执行”阶段,从而花了一整天时间撰写了 1,858 条内部反思,却从未调用过任何实际工具。这暴露了一个可能导致任何工具驱动型助手瘫痪的“自我循环陷阱”。
Moonshot 的宣传重点在于其 2.8 万亿参数的模型和低廉的单 token 费率,但该模型的混合专家 (MoE) 设计和过于冗长的特性导致输出量高达 1.3 亿个 token——是竞争对手的两倍多——从而推高了实际支出。
新的场景意识基准测试迫使模型回答诸如“你是人工智能吗?”之类的元问题,并在对话发生变化时调整回答,这揭示出许多高分 LLM 仍声称自己是人类或掩盖其局限性。
AI 代理看到了正常的 JavaScript 结果和截图,但 Chrome 的隐藏标签页节流机制停止了 requestAnimationFrame 回调,导致 Canvas 未能完成绘制。通过在可见标签页中运行测试或添加像素非空检查,可以解决这种误报问题。
该更新引入了两个环境变量限制——分别针对子代理生成和网络搜索调用——在每个会话中的默认上限均为 200;同时,针对长时间的 MCP 调用,还增加了 2 分钟自动转后台规则,为团队提供了遏制成本失控的具体手段。
Noma Labs 展示了攻击者如何通过在公开仓库中发布精心构造的 issue,触发一个拥有私有仓库读取权限的 CI 关联 AI 代理,从而让机器人将这些文件直接转储回 issue 中——而整个过程无需窃取凭据,也无需利用 GitHub 本身的漏洞。
在实际部署中,用户的每一次发言、工具 Schema、API 响应以及检索到的文档都会在 Prompt 中不断累积。这种隐藏的膨胀会导致处理时间和成本呈二次方增长,使原本流畅的演示变成昂贵的延迟噩梦。
由 Visa、Mastercard、Stripe 和 Google 支持的 Linux 基金会新成立的 X402 基金会,定义了 AI 智能体支付的消息格式,但并未包含任何一致性测试套件、安全规范或认证流程,导致其权限声明未经测试。
通过对 312 通真实通话的分析,团队将原有的 700 毫秒静音规则替换为一种轻量级状态机。该状态机通过监测静音时长、语法完整性和反馈信号,使通话截断率从 18% 降至 3%,并消除了无效静音。
该基准测试基于 163 个已标记的事件构建,其功能已超越单纯的诊断,旨在测试 AI 助手是否能够识别不确定性并主动选择回避,从而在 LLM 置信度不断提高的背景下,凸显出了一个关键的安全漏洞。
通过重新利用在无关图像数据集上训练的模型,LIGO 的新系统不仅能以近乎完美的精度对已知的故障类别进行分类,还能对新型异常进行聚类,从而让科学家能够专注于天体物理学研究,而非耗费精力进行手动数据清洗。
在一个晚上里,该智能体交付了一个 MCP 客户端、一个 Azure AI 智能体和一个 M365 Copilot 智能体,但在 30 条人工消息中,有 12 条用于将其引导回正轨,这暴露了违反工作流和上下文检索方面的 Bug,需要通过重写提示词来解决。
Google 的 Gemini Notebook 现在支持索引 PDF、文档及其他文件,以实现即时的 AI 查询;与此同时,Anthropic 的 Claude 可以从 1Password 获取凭据并登录各项服务;此外,一项联合规范旨在让智能体无需编写自定义代码即可发现并调用 API。
AWS Continuum 的 AI 智能体持续监控版本控制仓库,提供修复建议,甚至可以直接在开发者的 IDE 或 CI 流水线中应用补丁,从而大幅缩短供应链攻击的窗口期。
这一转变迫使谷歌从布局到测试重新设计整个芯片堆栈,同时也让英特尔的良率能力面临严峻考验。成功有望实现 AI 芯片供应链的多样化;而任何差错都可能导致出货延迟,并让台积电重新夺回主导地位。
这些模块化组件在工厂制造并作为完整单元运输,可在数周内完成连接。同时,Lancium 的软件充当虚拟电池,通过平滑需求并利用过剩的可再生能源或天然气发电量,确保当地 ERCOT 电网的稳定运行。