AI导航

Google 开源 AQuA:智能体上线后自己巡检并定位失败根因

AI资讯
2 min read
0 次阅读

Google 开源的 AQuA 在 2026 年 10 月 8 日由 Google 开发者博客发布,全名 Ambient Quality Agent,专门解决一个上线后才暴露的问题:智能体接口全绿、延迟达标、工具没报错,回答却悄悄做错了事。AQuA 以可拼装的开源组件形式放出,跑在用户自己的 Google Cloud 项目里,定时巡检生产会话,把失败按机制聚类、验证,再定位到部署时的代码快照,相当于给智能体配了一个专职做第一轮排查的质量工程师。

它盯的不是宕机,而是静默做错

Google 在博客里举的例子很典型:旅行智能体在没问选座子智能体确认的情况下,直接把 3A 写成已确认座位;或者用户的档案写明吃素,推荐环节却端出一家牛排馆。这类错误不会触发任何基础设施告警,因为每一层单看都运行正常,出错的是模型漏掉约束、编排路由错了子智能体、工具契约没写清取值,或者指令里压根缺了一条规则。人工逐条读生产对话在量起来之后不现实,AQuA 就是来替人做这轮初筛的。

五段流水线:抽样、评审、聚类、验证、跟踪

每次运行,AQuA 先从 Cloud Trace、Cloud Logging 或 BigQuery 里随机抽最多 1000 个近期会话,用一份九项清单逐个评审,失败的会话写成一条实际与预期的对照记录;再把失败机制相同的记录聚成候选问题簇;然后由另一个模型拿最多三份完整对话复核,证据撑不住的簇直接丢弃;存活下来的问题写入 BigQuery,按新出现、重复出现登记,14 天没再见到就自动标记为已解决。它不在请求链路上,也不回写智能体本身,团队可以用一份用大白话写的 goal.md 告诉它本业务里什么才算做错。在 Google 给出的旅行智能体演示里,32 个会话产生 42 条问题记录,聚成 9 簇,复核刷掉了 3 簇误报,剩下 6 个确认问题中,最突出的是绕过座位可用性检查,在 15 个会话里重复出现。

定位到行号,但不替你改代码

确认问题值得查时,AQuA 会把失败对话和部署时冻结的源码快照对照,给出问题出在哪个文件的哪几行,并提出修改建议;如果故障来自上游依赖或交接环节,它只标注归属,不硬凑代码补丁。它明确不自动改代码、不自动提 PR,修复仍由人或编程智能体在分支上完成,再用失败会话回放验证。已经把智能体放进生产环境的团队,可以把 AQuA 当作评测闭环的外环:离线评测管上线前,在线指标管趋势,AQuA 管的是把真实失败变成带证据、可定位的工单。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。