- 文档
- 教程
- 知识库
【免费下载链接】developer-roadmap
Interactive roadmaps, guides and other educational content to help developers grow in their careers.
导读
本指南围绕 developer-roadmap 的 AI Agents 学习路线图 中 LangSmith 这一核心观测与评估主题展开,系统讲解如何利用 LangSmith 对 LLM 应用与 Agent 的每一次运行进行逐步追踪(Tracing)、在开发阶段构建评估数据集并运行自动化测试,以及在生产环境中通过仪表盘监控成本与延迟。读完本文,你将掌握 LangSmith 从"调试"到"测试"再到"监控"的完整使用路径,并理解它与 LangChain、LangGraph 的搭配方式以及脱离框架独立使用的方法。
LangSmith 是什么:面向 Agent 的可观测性与评估平台
在 AI Agents 学习路线图中,LangSmith 被定位为"调试、测试、监控 LLM 应用(包括 Agent)"的专门平台。其核心价值在于三个互补的能力面:
- 调试(Debugging):通过追踪(Tracing)记录一次运行的每一个步骤,包括输入、输出与中间推理过程;
- 测试(Testing):支持构建评估数据集,并针对数据集运行自动化测试,以衡量质量随时间的变化;
- 监控(Monitoring):在生产环境通过仪表盘跟踪成本与延迟等运行指标。
LangSmith 由 LangChain 团队构建,与 LangChain 和 LangGraph 应用搭配最为常见,但它可以脱离这些框架独立使用,即不依赖 LangChain 的代码同样可以被追踪与评估。
路线图中另一份 LangSmith 主题文档对此做了更直观的补充:LangSmith 是一个"Web 工具",它记录 Agent 对语言模型的每一次调用、所使用的输入以及得到的回答,帮助开发者"看清并修复 AI Agent 正在做什么"。因此,它的本质是把 Agent 内部不可见的推理过程转化为可检索、可回放、可量化的记录。
逐步追踪(Tracing):看清 Agent 每一步在做什么
追踪记录什么
LangSmith 的核心机制是 Tracing,即对一次 run(运行)的每个步骤进行记录。结合路线图中 结构化日志与追踪 主题的定义可以更好地理解这一点:
- 结构化日志:以一致的、机器可读的格式记录 Agent 的执行过程,比如调用了哪个工具、使用了什么参数、每一步耗时多久;
- 追踪(Tracing):把这些零散的日志条目串联成一次完整运行的全貌。
对于多步骤 Agent(多智能体、工具调用、反思循环等)来说,这种"全貌"视图是调试复杂行为的关键。LangSmith 在这一层面提供的具体能力包括:
| 能力 | 说明 |
|---|---|
| 记录每次 LLM 调用 | 记录 Agent 对模型的每一次请求、输入与返回结果 |
| 记录输入/输出/中间推理 | 在每个步骤层面保存输入、输出以及中间的推理过程 |
| 逐步回放 | 可以对任意一个步骤进行回放(replay),还原当时的状态 |
| 标记与检索 | 为运行打上标签(tag),便于快速搜索定位 |
为什么 Agent 尤其依赖追踪
Agent 与普通单轮 LLM 调用不同:它包含工具调用、循环、条件分支与多步推理,任何一个环节出错都会导致最终结果错误。追踪的价值就在于把"哪一步出了问题"变成可定位的事实,而不是靠猜测。LangSmith 正是为此设计的:每一步的输入、输出与中间推理都被记录下来,开发者可以沿着轨迹逐层排查。
调试:回放步骤、对比提示词、定位错误
回放任意步骤
LangSmith 允许开发者回放(replay)任意一个步骤,这在排查 Agent 行为时非常实用。当一次运行结果异常时,可以:
- 打开该次运行的追踪视图;
- 定位到异常步骤,查看其输入与输出;
- 回放该步骤,验证相同输入是否稳定复现问题。
对比不同提示词版本
由于每次运行都会记录完整的输入输出,开发者可以在相同输入下运行不同版本的提示词,并通过追踪结果直接对比它们的行为差异。这实际上是"用真实运行记录做实验",比离线猜测提示词效果更加可靠。
度量与检索
LangSmith 还能测量并展示成本(cost)、速度(speed)与错误率(error rate),并为运行打上标签(tag)以便快速检索。当需要排查"某类请求"的共性问题时,通过标签筛选即可精准定位到相关运行记录。
评估:构建数据集,自动化测试质量随时间的变化
评估数据集与自动化测试
LangSmith 的第二个核心能力是评估(Evaluation)。它支持:
- 存储测试集(test sets):把一批输入-期望输出对保存下来,作为回归测试的基准;
- 运行快速检查(quick checks):在数据集上自动运行评估,判断新代码是否让 Agent 变差;
- 衡量质量随时间的变化:通过多次运行评估结果,观察质量指标在版本迭代中的走势。
结合路线图中 要跟踪的指标 主题可知,评估时可以选择正确性类指标(准确率、精确率、召回率、F1)、排序类指标(如 mean average precision、ROC-AUC)、体验类指标(响应时间、延迟、失败率)以及安全类指标(有毒或偏见输出的计数)等。LangSmith 为这些评估提供数据集管理与自动化执行的载体,使得"每次改动后跑一遍测试集"成为可落地的工程实践。
在追踪记录上直接运行评估
LangSmith 还支持直接在已记录的追踪(traces)上运行评估(run evals directly on logged traces)。这意味着不必额外构造评估样本,而是可以直接复用生产环境或开发环境中真实发生的运行记录作为评估输入,让评估更贴近真实使用场景。
人工评估的配合
对于数字指标难以覆盖的维度(如隐藏偏见、措辞是否清晰、行为是否让用户感到合理),可以结合路线图中 人在回路评估 主题的做法,引入真实用户、领域专家或众包人员对 Agent 输出进行人工评判,再结合自动评估结果共同驱动迭代。
生产监控:成本、延迟与错误率的仪表盘
LangSmith 面向生产环境的监控能力包括:
- 成本追踪:跟踪每次运行、每个模型调用的 token 消耗与费用;
- 延迟追踪:监控每一步与整条链路的响应时间;
- 错误率追踪:统计失败运行的比率,及时发现异常;
- 仪表盘可视化:通过图表(charts)集中展示上述指标,让团队对生产状态一目了然。
这些指标与路线图中"响应时间、延迟、失败率"等运行监控指标一一对应。对于已上线的 Agent,持续监控成本与延迟不仅是质量保障,也是成本治理的必要手段——Agent 的多步循环会显著放大单次调用的成本,LangSmith 的成本追踪正好用于识别"哪类任务最烧钱"。
与 LangChain、LangGraph 的搭配及独立使用
生态定位
LangSmith 由 LangChain 团队构建,与两个框架天然配合:
- LangChain:作为构建 LLM 应用的框架,提供连接数据源、串联调用、构建 Agent 的抽象(见路线图中 LangChain 主题);
- LangGraph:用于构建有状态、图结构的 Agent 工作流,通过 state(状态)与 edge(边)组织 Agent 的推理过程(见路线图中 LangGraph 主题)。
LangSmith 会自动捕获 LangChain 运行的追踪信息(automatically captures traces of LangChain runs),这是其"开箱即用"的体验来源。对于 LangGraph 构建的复杂图式 Agent,每一步节点执行同样会被记录,便于在图上排查状态流转问题。
框架无关:独立使用
LangSmith 并非绑定 LangChain 生态的封闭产品——它可以脱离框架独立使用,也适用于非 LangChain 代码(works with non-LangChain code)。这意味着:
- 使用其他框架或自研编排逻辑的 Agent 也可以接入 LangSmith 的追踪与评估能力;
- 开发者可以只引入 LangSmith 相关客户端,对自己的代码进行插桩,获得相同的调试、测试与监控体验。
这种框架无关性使其成为 AI Agents 技术栈中通用的"观测层"组件,而非某个框架的附属品。
在 AI Agents 学习路线中的定位
在 roadmaps/ai-agents 目录的学习路线中,LangSmith 与 LangChain、LangGraph 共同构成"构建-编排-观测"的完整链条:
- 用 LangChain 组装 LLM 能力;
- 用 LangGraph 编排有状态的多步 Agent 流程;
- 用 LangSmith 观测、调试、评估与监控整个系统。
与之相邻的观测类主题(如 结构化日志与追踪、要跟踪的指标)从概念层面解释了"为什么需要追踪"与"应该追踪什么",而 LangSmith 则是这些概念的具体落地工具。此外,ai-engineer 路线图 中的 LangSmith 主题还补充了"在已记录追踪上直接运行评估"与"自动捕获 LangChain 运行追踪"两个能力点,可作为交叉参考。
小结
LangSmith 的价值可以概括为一句话:让 AI Agent 的行为可观察、可验证、可度量。它通过逐步追踪解决调试问题,通过评估数据集与自动化测试解决质量问题,通过成本/延迟/错误率仪表盘解决生产监控问题;与 LangChain、LangGraph 搭配时开箱即用,脱离它们也能独立工作。在 AI Agents 的开发流程中,尽早引入这样的可观测性与评估体系,是保证 Agent 从原型走向可靠生产的关键一步。
延伸阅读(仓库内相关文档):
- LangSmith(本主题文档)
- LangSmith 补充介绍
- LangChain 主题
- LangGraph 主题
- 结构化日志与追踪
- 要跟踪的指标
- 人在回路评估
- ai-engineer 路线图中的 LangSmith 主题
- 文档
- 教程
- 知识库
【免费下载链接】developer-roadmap
Interactive roadmaps, guides and other educational content to help developers grow in their careers.
相关推荐
ModelEngine/app-platform:模型监控与评估全链路实践指南
ModelEngine/app platform:模型监控与评估全链路实践指南 引言:为什么模型监控与评估如此重要? 在大模型应用开发中,模型性能的稳定性和可靠
人工智能大模型AI 应用低代码后端前端流程编排RAGNuclide工作集加密工具:AES与GPG加密方案对比
Nuclide工作集加密工具:AES与GPG加密方案对比 在现代开发环境中,代码安全已成为团队协作的关键环节。Nuclide作为基于Atom构建的开源IDE(集
文档教程知识库如何实现Astron Agent全链路可观测性:企业级监控与运维实践指南
如何实现Astron Agent全链路可观测性:企业级监控与运维实践指南 Astron Agent作为下一代超级智能体构建平台,其企业级监控与可观测性能力是保障
人工智能AI AgentAgent 编排RPA后端前端企业应用
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考