Google 开源的 AQuA 在 2026 年 10 月 8 日由 Google 开发者博客发布,全名 Ambient Quality Agent,专门解决一个上线后才暴露的问题:智能体接口全绿、延迟达标、工具没报错,回答却悄悄做错了事。AQuA 以可拼装的开源组件形式放出,跑在用户自己的 Google Cloud 项目里,定时巡检生产会话,把失败按机制聚类、验证,再定位到部署时的代码快照,相当于给智能体配了一个专职做第一轮排查的质量工程师。
它盯的不是宕机,而是静默做错
Google 在博客里举的例子很典型:旅行智能体在没问选座子智能体确认的情况下,直接把 3A 写成已确认座位;或者用户的档案写明吃素,推荐环节却端出一家牛排馆。这类错误不会触发任何基础设施告警,因为每一层单看都运行正常,出错的是模型漏掉约束、编排路由错了子智能体、工具契约没写清取值,或者指令里压根缺了一条规则。人工逐条读生产对话在量起来之后不现实,AQuA 就是来替人做这轮初筛的。
五段流水线:抽样、评审、聚类、验证、跟踪
每次运行,AQuA 先从 Cloud Trace、Cloud Logging 或 BigQuery 里随机抽最多 1000 个近期会话,用一份九项清单逐个评审,失败的会话写成一条实际与预期的对照记录;再把失败机制相同的记录聚成候选问题簇;然后由另一个模型拿最多三份完整对话复核,证据撑不住的簇直接丢弃;存活下来的问题写入 BigQuery,按新出现、重复出现登记,14 天没再见到就自动标记为已解决。它不在请求链路上,也不回写智能体本身,团队可以用一份用大白话写的 goal.md 告诉它本业务里什么才算做错。在 Google 给出的旅行智能体演示里,32 个会话产生 42 条问题记录,聚成 9 簇,复核刷掉了 3 簇误报,剩下 6 个确认问题中,最突出的是绕过座位可用性检查,在 15 个会话里重复出现。
定位到行号,但不替你改代码
确认问题值得查时,AQuA 会把失败对话和部署时冻结的源码快照对照,给出问题出在哪个文件的哪几行,并提出修改建议;如果故障来自上游依赖或交接环节,它只标注归属,不硬凑代码补丁。它明确不自动改代码、不自动提 PR,修复仍由人或编程智能体在分支上完成,再用失败会话回放验证。已经把智能体放进生产环境的团队,可以把 AQuA 当作评测闭环的外环:离线评测管上线前,在线指标管趋势,AQuA 管的是把真实失败变成带证据、可定位的工单。