当前位置: 首页 > news >正文

LangSmith:LLM 应用调试与评估平台

1. 为什么需要 LangSmith?

随着 LLM 应用逐渐从 Demo 阶段进入生产环境,开发者会遇到越来越多的问题:

例如:

  • 为什么模型回答错误?
  • 是 Prompt 设计的问题吗?
  • 是知识库检索到了错误内容?
  • 是模型本身能力不足?
  • Agent 是否调用了错误的工具?
  • 为什么 Token 消耗突然增加?
  • 哪一个步骤导致了请求变慢?

传统应用通常可以通过日志、链路追踪等方式定位问题,但是 LLM 应用存在大量动态行为:

  • Prompt 会影响模型输出
  • 检索内容会影响最终答案
  • Agent 会根据上下文选择不同工具
  • 同一个输入可能产生不同结果

因此,LLM 应用需要一种新的可观测能力:

LLM Observability(大模型可观测性)

它能够帮助开发者了解一次请求完整的执行过程,并分析:

  • 输入是什么
  • 模型为什么这样回答
  • 中间步骤发生了什么
  • 消耗了多少 Token
  • 哪一步产生了问题

2. LangSmith 是什么?

LangChain 官方推出了 LangSmith,一个专门面向 LLM 应用的开发与生产管理平台。

LangSmith 主要用于:

  • Tracing(链路追踪)
  • Debugging(调试)
  • Evaluation(评估)
  • Monitoring(生产监控)

简单来说:

LangSmith 就像 LLM 应用领域的 APM 平台,可以帮助开发者观察、调试和优化 Agent 应用。

3. LangSmith 核心能力

3.1 Trace 链路追踪

这是 LangSmith 最核心功能。

一次 Agent 请求:

用户请求 | Agent | +-- 思考 | +-- 查询数据库 | +-- 调用API | +-- 返回答案

LangSmith 会记录完整执行链。如果最终回答错误,可以通过 Trace 快速定位:开发者可以看到:

  • 模型输入
  • 模型输出
  • Prompt是什么
  • Token 消耗 多少
  • 延迟 时间
  • 中间的步骤
  • Tool调用结果如何

开始体验

在官网注册账号并登陆:https://smith.langchain.com/

创建一个API Key

保存 API Key,后续项目中需要使用。

测试代码

创建 Python 项目,并安装依赖:

pip install -U langchain # langchain和openai整合包 pip install -U langchain-openai # langchain和deepseek的整合包 pip install -U langchain-deepseek # 读取.env 文件,并将其加载到系统的环境变量(os.environ)中。 pip install -U python-dotenv

项目根目录创建.env文件:

# deepseek的apikey DEEPSEEK_API_KEY=sk-xxxxxxxxx DEEPSEEK_BASE_URL=https://api.deepseek.com #langchain-core已经依赖了langsmith #是否启用TRACING LANGSMITH_TRACING=true #langsmith的地址 LANGSMITH_ENDPOINT=https://api.smith.langchain.com LANGSMITH_API_KEY=xxxxx #自己取一个项目名字 LANGSMITH_PROJECT=langsmith-demo

测试代码如下

importosfromdotenvimportload_dotenvfromlangchain.chat_modelsimportinit_chat_model# 将.env文件中的变量加载为环境变量load_dotenv(override=True)DEEPSEEK_API_KEY=os.getenv("DEEPSEEK_API_KEY")DEEPSEEK_BASE_URL=os.getenv("DEEPSEEK_BASE_URL")# 初始化聊天模型model=init_chat_model(model="deepseek-v4-flash",model_provider="deepseek",api_key=DEEPSEEK_API_KEY,base_url=DEEPSEEK_BASE_URL)# 调用一次模型print(model.invoke("你好"))

查看Tracing链接追踪

点击Tracing

查看链路详情

3.2 Monitoring:生产监控

Tracing 主要用于查看单次请求。而 Monitoring 更关注线上整体运行情况。可以用来查看运行报表,此处提供了大量指标的报表用于分析查看

3.3. Evaluation:为什么需要评估?

LLM 最大问题:同一个输入:可能产生不同输出。

如果全都需要人工进行测试,那就成本比较高了,所以我们需要自动评估。

LangSmith Evaluation 基本模型如下:

1. Dataset | | 2.Target Application | | 3.Evaluator | | 4. Score

使用测试数据运行 Agent,再通过 Evaluator 对结果进行评分。

有这几个核心概念需要理解:

3.4. Dataset 数据集

评估首先需要测试数据。我们先简单准备一下

例如客服 Agent:

问题标准答案
退款多久到账3-5天
如何修改地址联系客服

新增数据集

按照要求导入CSV或者JSONL文件

测试代码

importosfromdotenvimportload_dotenvfromlangchain.chat_modelsimportinit_chat_modelfromlangsmithimportClient# 将.env文件中的变量加载为环境变量load_dotenv(override=True)DEEPSEEK_API_KEY=os.getenv("DEEPSEEK_API_KEY")DEEPSEEK_BASE_URL=os.getenv("DEEPSEEK_BASE_URL")# 1. 初始化聊天模型model=init_chat_model(model="deepseek-v4-flash",model_provider="deepseek",api_key=DEEPSEEK_API_KEY,base_url=DEEPSEEK_BASE_URL)# 2. 定义了一个高级agentdefmy_agent(user_input):result=model.invoke(user_input)returnresult.content# 3.用来测试my_agentdeftarget(inputs):print(inputs)returnmy_agent(inputs["inputs_1"])# 4. 用于评估的模型judge_model=init_chat_model(model="deepseek-v4-flash",model_provider="deepseek",api_key=DEEPSEEK_API_KEY,base_url=DEEPSEEK_BASE_URL)# 5. 定义一个评估器defcorrectness_evaluator(run,example):""" run: 被测试Agent的输出 example: Dataset中的标准答案 """question=example.inputs["inputs_1"]expected=example.outputs["outputs_1"]actual=run.outputs["output"]prompt=f""" 你是一个专业评测员。 判断AI回答是否正确。 问题:{question}标准答案:{expected}AI回答:{actual}请输出0-1之间的分数。 只返回数字。 """result=judge_model.invoke(prompt)score=float(result.content)return{"key":"correctness","score":score}# 进行测试client=Client()experiment_results=client.evaluate(target,data="客服话术",evaluators=[correctness_evaluator])foriteminexperiment_results._results:evaluation_results=item["evaluation_results"]["results"]forresultinevaluation_results:print(f"评估项:{result.key}, 分数:{result.score}")

执行成功后多了一个evaluators

可以查看模型评估结果

3.5 Evaluators

除了通过代码定义 Evaluator 外,LangSmith 还支持在后台创建评估器。

这种方式适用于:

下面我们创建一个后台 Evaluator。

进入 LangSmith 控制台,选择Evaluators,新增一个评估器。

简单配置一下evaluator

完成配置后,一个评估器就创建完成。

接下来运行一次模型调用:

print(model.invoke("你好"))

LangSmith 会自动捕获此次调用,并使用配置好的 Evaluator 进行评分。

最终可以在 Evaluation 页面查看评估结果。

4.关于LangSmith的费用

https://smith.langchain.com/o/b2f09aa3-1cce-4790-b756-cf34729b3822/settings/payments

当然LangSmith不是完全免费的。根据官网的的 Plans and pricing(套餐价格),主要分为Developer Free(免费版)Plus(团队版)Enterprise(企业版)

其收费标准整理如下:

项目Developer Free 免费版Plus 团队版Enterprise 企业版
价格免费$39 / seat / month(每用户/月)定制报价
适合个人开发者团队开发、Agent 部署企业级应用
Trace 数量每月最多5,000 traces,超过后按量付费每月最多10,000 traces,超过后按量付费定制
Seat(成员)1 个可增加无限成员无限
Agent 数量1 个无限定制
Workspace1 个最多 3 个无限
LCU(计算额度)5 LCU/月,之后按量付费25 LCU/月,之后按量付费定制
社区支持Community ForumEmail + Community ForumSLA 支持
登录方式Google、GitHub、DiscordGoogle、GitHub、Discord自定义 SSO
Deployment不支持支持(Small Serverless Deployment)定制
Sandbox5 LCU/月,1 LSU/月,之后付费同左定制
Engine需要升级支持定制
Insights需要升级需要升级无限
RBAC 权限控制不支持不支持支持
Team Training不支持不支持支持

5.总结

通过本文可以看到,LangSmith 主要解决了 LLM 应用开发中的三个问题:

Tracing(链路追踪)

帮助开发者查看一次请求完整的执行过程,包括 Prompt、模型输出、Token 消耗、Tool 调用以及每一步的耗时。

Evaluation(效果评估)

通过 Dataset 和 Evaluator,对 Agent 的输出进行自动化评估,帮助我们判断 Prompt 优化、模型更换或者流程调整后,效果是否真正提升。

Monitoring(生产监控)

帮助开发者观察线上 LLM 应用运行情况,包括请求量、延迟、错误以及资源消耗。

简单来说:

LangSmith 就像传统应用中的 APM 平台,只不过它面向的是 LLM 应用。

http://www.jsqmd.com/news/1250827/

相关文章:

  • Google秘密芯片Frozen v2最早2028年部署,能否助力Gemini追赶?
  • 机械故障诊断中的四维几何融合技术解析
  • 价格、功能、操作、体验:报名签到查座等会务平台怎么选?看完这篇不纠结
  • 2026 襄阳 CMA 甲醛检测口碑名单:襄阳凌昔甲醛检测中心等 5 家纯检测机构深度测评 - CMA甲醛检测
  • Django毕设项目: 基于 Django社区核酸信息采集与防疫数据分析系统 社区疫情政策推送与居民反馈服务系统(源码+文档,讲解、调试运行,定制等)
  • 2026年Monel400合金厂家怎么选?从产能、质检到口碑的深度测评 - 品牌深度评测
  • 从测试工程师到测试经理,中间到底差了哪些能力?
  • 2026 北京 CMA 甲醛检测口碑名单:北京安华科创甲醛检测中心等 5 家纯检测机构深度测评 - CMA甲醛检测
  • 【头部MCN内部培训资料】:AI数字人直播SOP标准流程,含话术库、灯光布景、推流参数全公开
  • 深入了解MIMO
  • 2026年无锡健康管理公司全景解析:细胞存储与抗衰服务对比
  • 2026/7/23
  • 2026 孝感 CMA 甲醛检测口碑名单:孝感凌昔甲醛检测中心等 5 家纯检测机构深度测评 - CMA甲醛检测
  • 彻底搞懂OpenSSH!SSH原理+免密登录+安全加固+故障排查
  • 2026年7月20日-7月26日(gis视频教程第一季+ue独立游戏)
  • 导购返利 APP 防订单丢失方案:Java 异步任务与日志回溯架构设计
  • Day 10-11 GDB 调试器:让程序“开口说话“,告诉你它到底哪里疼
  • 2026 呼和浩特 CMA 甲醛检测口碑名单:呼和浩特博达甲醛检测中心等 5 家纯检测机构深度测评 - CMA甲醛检测
  • 13 Windsurf vs Cursor vs Copilot:2026年AI IDE横评
  • Qoder 进阶上手:5 个实用技巧让你效率翻倍
  • 告别交期长与材质不稳!国内Inconel 718全形态材料靠谱厂商推荐 - 品牌深度评测
  • 2026免费去水印在线工具有哪些?实测好用的整理 - 免费软件工具方法教程
  • 含金量高IT行业证书有哪些
  • 2026 青岛 CMA 甲醛检测口碑名单:青岛博达甲醛检测中心等 5 家纯检测机构深度测评 - CMA甲醛检测
  • 2026 徐州 CMA 甲醛检测口碑名单:徐州凌昔甲醛检测中心等 5 家纯检测机构深度测评 - CMA甲醛检测
  • 在半导体及电力电子器件(如 IGBT、SiC/GaN 功率模块、MOSFET 等)的可靠性测试中,无功老化测试机主要用来验证器件在承受高电压、大电流以及高频开关等电应力下的长期稳定性
  • Hermes 配置微信
  • 长春朝阳区播音主持艺考培训怎么选?
  • 2026年还有人不知道?去水印工具免费版哪个好用与去水印下载神器2026排行榜 - 免费软件工具方法教程
  • 2026 盐城 CMA 甲醛检测口碑名单:盐城凌昔甲醛检测中心等 5 家纯检测机构深度测评 - CMA甲醛检测