当前位置: 首页 > news >正文

使用 LangFuse 追踪 LLM 调用链路与成本

使用 LangFuse 追踪 LLM 调用链路与成本

一、问题背景:你的 LLM 应用正在「裸奔」

2026 年,几乎所有应用都在接入大模型。Chat 机器人、代码助手、RAG 问答、Agent 工作流——LLM 已经从实验项目变成了生产系统的核心组件。然而一个尴尬的现实是:绝大多数团队对自己线上 LLM 调用的情况一无所知

笔者最近接手了一个基于 LangChain 搭建的企业知识库问答系统,上线三个月后 PM 来问:「咱们每个月到底花了多少 Token?用户问的问题都靠谱吗?有没有被 Prompt Injection 攻击过?」面对三连问,团队只能面面相觑——日志散落在各个微服务的 stdout 里,token 用量全凭 OpenAI 后台账单倒推,至于每条链路的实际表现,完全是个黑盒。

这不是个例。LLM 应用的可观测性面临着与微服务时代完全不同的挑战:

  • 不确定性:同一个 Prompt 两次调用可能得到不同结果,如何判断是模型波动还是系统退化?
  • 嵌套调用:Agent 内部可能触发多次 LLM 调用(思考→工具选择→执行→总结),故障定位极难
  • 成本黑洞:GPT-4 一次复杂 Agent 调用可能消耗 $0.5,没有细粒度追踪根本不知道钱花在哪
  • Prompt 版本管理混乱:改了某个 system prompt 之后性能是变好了还是变差了?没有基线对比

经过调研,我选择了LangFuse作为团队的 LLM 可观测性平台。这篇文章将分享从选型、接入到生产落地的完整经验。

二、为什么是 LangFuse?

LLM 可观测性赛道目前有几个主要选手:

方案优势劣势
LangSmithLangChain 原生集成,功能全面闭源收费,免费版用量限制严格
Weights & Biases实验追踪能力强LLM 场景不够专精,配置复杂
Phoenix (Arize)开源,OpenTelemetry 原生部署运维成本高,文档相对薄弱
LangFuse开源自部署,LangChain/LlamaIndex 深度集成,UI 直观社区相对较新(2023 年成立)

LangFuse 打动我们的几个点:

  1. 真正的开源:MIT 协议,可以 Docker 一键自部署,数据不出企业内网
  2. 框架无关:原生支持 LangChain、LlamaIndex、OpenAI SDK,也可以通过装饰器或 context manager 自定义接入
  3. 三大核心能力合一:Tracing(调用链追踪)+ Prompt Management(Prompt 版本管理)+ Evaluation(评估),不需要同时维护三套系统
  4. 成本追踪:细粒度到单次调用的 token 消耗和金额统计,支持 OpenAI / Anthropic / Google 等多厂商

三、快速接入:5 分钟跑通第一条 Trace

3.1 部署 LangFuse

如果只是验证,直接用官方 Cloud 版(cloud.langfuse.com)注册即可,有免费额度。生产环境建议自部署:

# 克隆仓库gitclone https://github.com/langfuse/langfuse.gitcdlangfuse# 启动(依赖 Docker Compose)cp.env.dev.example .envdockercompose up-d

启动后访问http://localhost:3000,注册账号,在 Settings → API Keys 创建密钥。

3.2 Python SDK 接入

pipinstalllangfuse

设置环境变量:

exportLANGFUSE_SECRET_KEY="sk-lf-..."exportLANGFUSE_PUBLIC_KEY="pk-lf-..."exportLANGFUSE_HOST="http://localhost:3000"# 自部署时指定

最简接入——直接装饰你的函数:

fromlangfuseimportLangfusefromlangfuse.decoratorsimportobserve langfuse=Langfuse()@observe()defask_llm(question:str)->str:# 你的 LLM 调用逻辑response=openai.chat.completions.create(model="gpt-4",messages=[{"role":"user","content":question}])returnresponse.choices[0].message.content# 调用answer=ask_llm("什么是 Transformer?")langfuse.flush()# 确保数据发送完毕

运行后刷新 LangFuse UI,第一条 Trace 已经出现在面板上了。这个@observe()装饰器会自动捕获函数名、入参、返回值、耗时,形成一个 Span。

3.3 与 LangChain 深度集成

如果你的项目用 LangChain,接入更简单——LangFuse 提供了 Callback Handler,一行代码搞定:

fromlangfuse.callbackimportCallbackHandler# 创建 callbacklangfuse_handler=CallbackHandler()# 传给 LangChainfromlangchain_openaiimportChatOpenAIfromlangchain_core.promptsimportChatPromptTemplate llm=ChatOpenAI(model="gpt-4")prompt=ChatPromptTemplate.from_template("将以下内容翻译成英文:{text}")chain=prompt|llm result=chain.invoke({"text":"今天天气真好"},config={"callbacks":[langfuse_handler]})

LangFuse Callback 会自动拆解 LangChain 的执行流程:RunnableSequence → ChatPromptTemplate → ChatOpenAI,每一步的耗时、token 用量都会被精准记录。这在排查「是 Prompt 构造慢了还是模型推理慢了」时价值巨大。

四、核心能力深入

4.1 Tracing:不止于「看调用」

Tracing 是 LangFuse 的基石,但它做得比简单的「记录输入输出」深得多。

自定义 Span 层级:对于复杂的 Agent 工作流,建议手动定义 Span 结构,而不是依赖自动追踪:

fromlangfuse.decoratorsimportlangfuse_context,observe@observe()defagent_workflow(user_query:
http://www.jsqmd.com/news/1254339/

相关文章:

  • JAVA练习339- 搜索旋转排序数组
  • USB-MODEVM协议解析与脚本编写:驱动TLV320AIC音频编解码器
  • 深度解析TI ADS8353/7853 SAR ADC评估套件:从硬件设计到性能测试实战
  • 晋城黄金回收实测:6家正规门店大盘点,附避坑指南 - 观金堂黄金回收
  • MSP430FR2311 LaunchPad开发套件:超低功耗MCU入门与实战指南
  • Mamba与YOLO结合的目标检测优化实践
  • 制造业短AI矩阵哪家好?一篇读懂定义、价值与选型路径 - 全域品牌推荐
  • 基于YOLOv8的植物病害智能检测系统设计与优化
  • TI ADS8353/7853 ADC评估套件(EVM-PDK)硬件配置与软件测试全解析
  • 衡水黄金回收实测:6家正规门店推荐与避坑全攻略 - 观金堂黄金回收
  • 【毕业设计】 基于 Django 的警务事务数字化管理系统警务人员信息与执勤记录管理系统实现(源码+文档+远程调试,全bao定制等)
  • Yahoo技术面试全解析:算法与系统设计实战指南
  • AI论文降重实战:三大模型指令优化与跨系统破解
  • 不规则时序因果发现:从PCMCI+原理到工业数据实战
  • YOLOv26在农业大棚结构检测中的优化与应用
  • 科技先知凯文·凯利预言AI终局:未来五年聚焦三大赛道,人机共生时代将至!
  • AI如何提升计算机教材编写效率与质量
  • 晋中黄金回收实测:6家正规门店清单与避坑指南 - 观金堂黄金回收
  • 淮南黄金回收实测:6家正规门店推荐与避坑指南 - 观金堂黄金回收
  • AIGC与大模型:AI新手的核心技术指南
  • YOLOv11船舶识别系统:技术实现与工程优化
  • Java 读取配置文件路径与中文乱码问题全解析
  • AI原生组织到底是什么?别被概念绕晕了
  • TI bq25898充电管理芯片I2C编程与实战调试指南
  • ADC模拟输入滤波与多设备I2C连接实战指南
  • 特斯拉Q2财报:营收创新高但利润下滑,58亿砸向AI基建与芯片求未来增长
  • 企业推广获客哪家好?全域营销获客选购指南 - 全域品牌推荐
  • 【免费】基于Spark实时电商用户行为分析与预测 系统(Python版本+pyspark+可视化大屏+Kafka+FastAPI+Vue3) 锋哥原创出品,必属精品
  • AI Agent如何重塑企业工作流:实在Agent的实践与突破
  • 智能家居AI助手的场景化理解与多模态交互实践