工具介绍
核心功能
LangWatch 为 LLM 和 Agent 应用提供追踪、评测与测试工具。接入 SDK 或 OpenTelemetry 后,团队可以查看模型调用、工具步骤、RAG 检索、token、成本、延迟和错误。评测模块支持自定义数据集、RAGAS、安全检查、LLM-as-a-judge 和自有指标。
开发者可在本地或 CI 中运行离线实验,也能用 Monitor 持续评分生产流量。Agent 场景测试用于模拟多轮对话、工具调用和异常路径;平台既有托管版本,也支持自托管。
适合场景
研发团队可在升级模型前比较回答质量,在每次代码合并时运行回归评测,并在生产中发现幻觉、延迟或成本变化。产品和领域专家也能通过界面参与定义评分标准和审阅失败样本。
对多步骤 Agent,最好分别追踪检索、规划、工具和最终回答,而不是只给整段会话一个总分,这样更容易定位退化来源。
使用边界
评测结果取决于测试集和标准。如果样本过少、问题过于理想化或裁判模型偏向某种表达,高分未必代表真实用户满意。团队应保留人工标注集,并定期加入线上失败案例。
追踪数据可能包含提示词、文档片段和个人信息,需要设置脱敏、采样、权限和保留时间。自动 Guardrail 也要测量误拦截,不能只追求更严格的通过阈值。
常见问题
LangWatch 只做日志监控吗?
不是,它还包含离线实验、在线评测、Agent 场景测试、提示词和安全检查。
可以在 CI 中阻止质量下降的版本合并吗?
可以把评测加入 CI 并设置门槛,但门槛应来自稳定、具有代表性的数据集。
LangWatch 支持自托管吗?
官方提供开源与自托管选项,实际部署仍需配置数据库、权限和监控。