全部文章标签

智能体评测

智能体评测专题讨论 AI Agent 上线之后的质量评估:轨迹审查、失败聚类、根因诊断与回归验证,帮团队判断智能体到底有没有把活干对。

专题介绍

模型考试分数高,不等于智能体在生产环境里靠得住。这里关注上线后的评测方法:怎样抽样审查真实会话、按失败机制聚类、把问题定位到模型、编排、工具还是指令,并用回归验证确认修复没有引入新问题,适合正在运营 Agent 的团队。

Google 开源 AQuA:智能体上线后自己巡检并定位失败根因

Google 开源 AQuA:智能体上线后自己巡检并定位失败根因

AI资讯
AI导航 0 次阅读
Langfuse发布v3.156.0:AI应用观测与评估能力继续强化

Langfuse发布v3.156.0:AI应用观测与评估能力继续强化

AI资讯
AI导航 28 次阅读