LangWatch

AI编程

LangWatch 是开源 LLM 工程平台,提供 OpenTelemetry 追踪、离线与在线评测、Agent 场景测试、提示词管理和生产质量监控。

工具介绍

核心功能

LangWatch 为 LLM 和 Agent 应用提供追踪、评测与测试工具。接入 SDK 或 OpenTelemetry 后,团队可以查看模型调用、工具步骤、RAG 检索、token、成本、延迟和错误。评测模块支持自定义数据集、RAGAS、安全检查、LLM-as-a-judge 和自有指标。

开发者可在本地或 CI 中运行离线实验,也能用 Monitor 持续评分生产流量。Agent 场景测试用于模拟多轮对话、工具调用和异常路径;平台既有托管版本,也支持自托管。

适合场景

研发团队可在升级模型前比较回答质量,在每次代码合并时运行回归评测,并在生产中发现幻觉、延迟或成本变化。产品和领域专家也能通过界面参与定义评分标准和审阅失败样本。

对多步骤 Agent,最好分别追踪检索、规划、工具和最终回答,而不是只给整段会话一个总分,这样更容易定位退化来源。

使用边界

评测结果取决于测试集和标准。如果样本过少、问题过于理想化或裁判模型偏向某种表达,高分未必代表真实用户满意。团队应保留人工标注集,并定期加入线上失败案例。

追踪数据可能包含提示词、文档片段和个人信息,需要设置脱敏、采样、权限和保留时间。自动 Guardrail 也要测量误拦截,不能只追求更严格的通过阈值。

常见问题

LangWatch 只做日志监控吗?

不是,它还包含离线实验、在线评测、Agent 场景测试、提示词和安全检查。

可以在 CI 中阻止质量下降的版本合并吗?

可以把评测加入 CI 并设置门槛,但门槛应来自稳定、具有代表性的数据集。

LangWatch 支持自托管吗?

官方提供开源与自托管选项,实际部署仍需配置数据库、权限和监控。