Langfuse - 开源大模型提示词工程管理与全链路追踪评估平台

厂商: langfuse

Langfuse 是业界使用最广泛的开源 LLM 工程平台,提供强大的 Prompt 版本化管理、复杂智能体调用链追踪(Tracing)、成本分析与自动化评分评估体系。

访问仓库

官网预览
Langfuse - 开源大模型提示词工程管理与全链路追踪评估平台

技术规格与项目参数

GitHub 仓库langfuse/langfuse
Star 关注度★ 33.9k
Fork 衍生数3.7k forks
主要开发语言TypeScript
开源协议NOASSERTION
所属技术领域TOOLING
analyticsautogenevaluationlangchainlarge-language-modelsllama-indexllmllm-evaluationllm-observabilityllmopsmonitoringobservabilityopen-sourceopenaiplaygroundprompt-engineeringprompt-managementself-hostedycombinator
4.9综合评分
功能
5.0
文档
4.9
活跃度
5.0
易用
4.9

快速启动与部署指引

$ bash git clone https://github.com/langfuse/langfuse.git cd langfuse docker compose up -d

评测正文

Langfuse(langfuse/langfuse)是由 Marc Klingen 与 Clemens Rawert 发起的开源大模型工程(LLM Engineering)与可观测性平台。在现代企业级 AI 应用与智能体系统开发中,提示词(Prompt)的版本迭代、复杂调用链(Nested Traces)的性能监控以及生成质量的持续评估是保证系统可靠性的三大核心支柱。Langfuse 提供了完全开源且支持本地私有化部署的一站式解决方案,直接对标并超越了闭源的同类产品。

在技术架构与提示词管理(Prompt Management)方面,Langfuse 提供了中心化的 Prompt 管理控制台。开发者可以在 Web 界面中直观地编写、调试和版本化管理各种复杂的提示词模板,并支持通过 Client SDK 动态拉取指定版本的 Prompt,实现了提示词的‘热更新(Hot Reload)’与 A/B 测试,彻底将 Prompt 迭代与业务后端代码解耦。

在智能体追踪(Agent Tracing)与评估评估层面,Langfuse 支持 OpenTelemetry 标准,提供了针对 LangChain、LlamaIndex、LiteLLM、OpenAI 及自定义 Agent 循环的即插即用集成。它能够将一个复杂的 Agent 任务展开为清晰的树状调用追踪图(包含每一步的 Prompt 输入、模型回复、工具调用参数、耗时及精确的 Token 成本计算),并支持结合用户反馈(Scores)与后台自动化评测打分,构建从开发到生产的完整质量闭环。

项目来源

Langfuse 的诞生源于企业在大模型应用研发过程中面临的‘提示词混乱与黑盒监控’痛点。当一个团队有多个开发者、数十个功能模块依赖大模型时,提示词往往零散地硬编码在各个服务代码中,无法追踪‘是谁在何时修改了哪段 Prompt’,更无法在模型表现不佳时快速回滚。同时,由于缺乏细粒度的调用链追踪,复杂的 RAG 检索与 Agent 工具调用一旦报错,排查难度极大。

Langfuse 团队将现代软件工程的 CMS 理念与 APM 分布式追踪技术深度结合,打造了一个兼顾开发者体验与企业合规要求的平台。它不仅让非技术人员(如产品经理、Prompt 工程师)也能在 Web 界面协同优化提示词,更让系统工程师能够通过毫秒级精度的调用树追踪每一个 Token 的去向与成本。

在架构标准上,Langfuse 全面拥抱 OpenTelemetry,将大模型的生成(Generations)、跨步追踪(Spans)与事件(Events)抽象为通用的遥测语义,避免了企业被单一监控厂商绑定的风险。

应用场景

在企业级 Prompt 管理与热更新场景中,产品团队在 Langfuse 控制台调整客服机器人的 System Prompt 并发布为 production 标签,后端微服务无需重新打包部署即可秒级生效新 Prompt。

在复杂的智能体工作流调试中,通过 Langfuse 的 Traces 界面展开 Agent 的多步执行图,直观查看第 4 步工具调用的入参是否符合预期、为何触发了重试以及哪一步消耗了最多的 Token。

在大模型成本核算与配额管理中,按项目、用户 ID 或 API Key 维度统计每天的 Token 消耗与成本开销,精准定位高开销的低效 Prompt。

在自动化质量评估与回归测试中,配置后台 LLM-as-a-Judge 评估器,自动对生产环境采样的数据计算‘忠实度’与‘幻觉率’得分,当质量异常时自动告警。

快速上手

通过 Docker Compose 一键在本地启动完整的 Langfuse 私有化服务:

bash
git clone https://github.com/langfuse/langfuse.git
cd langfuse
docker compose up -d

安装 Python SDK:

bash
pip install langfuse openai

在 Python 中动态拉取云端管理的 Prompt 并记录完整调用链:

python
import os
from langfuse import Langfuse
from langfuse.openai import OpenAI

# 1. 初始化客户端(自动读取环境变量中的 LANGFUSE 凭证)
langfuse = Langfuse()
client = OpenAI()

# 2. 从 Langfuse 动态拉取当前标记为 production 的 Prompt 模板
prompt = langfuse.get_prompt("customer_support_system_prompt")
compiled_system_prompt = prompt.compile(company_name="星航 AI")

# 3. 发起调用,Langfuse 自动拦截并记录输入、输出与 Token 成本
response = client.chat.completions.create(
    model="gpt-4o-mini",
    name="customer_inquiry_agent",
    messages=[
        {"role": "system", "content": compiled_system_prompt},
        {"role": "user", "content": "你们的平台支持哪些开源智能体工具?"}
    ],
    langfuse_prompt=prompt  # 将本次调用与 Prompt 版本强绑定
)

print("回答:", response.choices[0].message.content)

在 Web 浏览器中打开 http://localhost:3000 即可实时查看刚刚触发的调用链路追踪、Token 费率统计与 Prompt 版本映射关系。

实用性评估

在架构设计与自托管便利性上,Langfuse 基于 Next.js 与 PostgreSQL 构建,架构干净清晰,仅需单机 Docker 即可轻松支撑每天数百万次调用追踪。其提供的客户端 SDK(Python / TypeScript)均支持异步批量上报,对应用程序本身的延迟影响几乎为零。

在安全合规性方面,由于完全开源且支持 100% 局域网私有化部署,企业无需担心敏感的商业提示词与客户私密对话数据泄露给第三方云厂商,完全满足金融、医疗与政企对数据主权的严苛要求。

在可扩展性与生态集成上,Langfuse 提供了完备的 REST API 与 Python/TypeScript 客户端,支持将追踪数据定时导出到 Snowflake、BigQuery 或 ClickHouse 进行进一步的企业数仓深度挖掘。

实际应用案例

Langfuse 在 GitHub 已获得近 34,000 Star,成为全球采用率最高的大模型可观测与 Prompt 管理平台之一,被全球数以万计的开发者和包括众多纳斯达克上市公司在内的企业所广泛使用。

在一家知名海外跨境金融科技企业的生产实践中,团队使用 Langfuse 管理着 300 多个金融风控 Prompt 模板,并实时追踪着每天上千万次风控 Agent 工具调用,排障效率提升了 80% 以上。

随着 OpenTelemetry 语义约定的演进,Langfuse 持续引领 GenAI 可观测性标准,已成为现代 LLMOps 基础设施栈中不可或缺的核心枢纽。

核心技术优势

  • 完全开源且支持私有化部署,提供中心化 Prompt 版本管理、热更新与 A/B 测试
  • 强大的智能体分布式调用追踪(Tracing),清晰展现多层嵌套的思考与工具调用树
  • 细粒度的 Token 成本与延迟监控,支持全球数十家模型厂商的精确费率核算
  • 支持 OpenTelemetry 标准,与 LangChain、LlamaIndex、LiteLLM 无缝即插即用

考量与局限

  • 生产环境落地需合理规划 GPU 显存与计算并发资源。

常见问题与技术问答 (FAQ)

Langfuse - 开源大模型提示词工程管理与全链路追踪评估平台 是什么?主要解决什么问题?

Langfuse - 开源大模型提示词工程管理与全链路追踪评估平台 是基于 TypeScript 开发的知名开源 AI 项目(采用 NOASSERTION 开源协议)。Langfuse 是业界使用最广泛的开源 LLM 工程平台,提供强大的 Prompt 版本化管理、复杂智能体调用链追踪(Tracing)、成本分析与自动化评分评估体系。。Langfuse 的诞生源于企业在大模型应用研发过程中面临的‘提示词混乱与黑盒监控’痛点。当一个团队有多个开发者、数十个功能模块依赖大模型时,提示词往往零散地硬编码在各个服务代码中,无法追踪‘是谁在何时修改了哪段 Prompt’,更无法在模型表现不佳时快速回滚。同时,由于缺乏细粒度的调用链追踪,复杂的 RAG 检索与 Agent 工具调用一旦报错,排查难度极大。 Langfuse 团队将现代软件工程的 CMS 理念与 APM 分布式追踪技术深度结合,打造了一个兼顾开发者体验与企业合规要求的平台。它不仅让非技术人员(如产品经理、Prompt 工程师)也能在 Web 界面协同优化提示词,更让系统工程师能够通过毫秒级精度的调用树追踪每一个 Token 的去向与成本。 在架构标准上,Langfuse 全面拥抱 OpenTelemetry,将大模型的生成(Generations)、跨步追踪(Spans)与事件(Events)抽象为通用的遥测语义,避免了企业被单一监控厂商绑定的风险。

如何快速安装与本地部署 Langfuse - 开源大模型提示词工程管理与全链路追踪评估平台?

通过 Docker Compose 一键在本地启动完整的 Langfuse 私有化服务:

bash
git clone https://github.com/langfuse/langfuse.git
cd langfuse
docker compose up -d

安装 Python SDK:

bash
pip install langfuse openai

在 Python 中动态拉取云端管理的 Prompt 并记录完整调用链:

python
import os
from langfuse import Langfuse
from langfuse.openai import OpenAI

# 1. 初始化客户端(自动读取环境变量中的 LANGFUSE 凭证)
langfuse = Langfuse()
client = OpenAI()

# 2. 从 Langfuse 动态拉取当前标记为 production 的 Prompt 模板
prompt = langfuse.get_prompt("customer_support_system_prompt")
compiled_system_prompt = prompt.compile(company_name="星航 AI")

# 3. 发起调用,Langfuse 自动拦截并记录输入、输出与 Token 成本
response = client.chat.completions.create(
    model="gpt-4o-mini",
    name="customer_inquiry_agent",
    messages=[
        {"role": "system", "content": compiled_system_prompt},
        {"role": "user", "content": "你们的平台支持哪些开源智能体工具?"}
    ],
    langfuse_prompt=prompt  # 将本次调用与 Prompt 版本强绑定
)

print("回答:", response.choices[0].message.content)

在 Web 浏览器中打开 http://localhost:3000 即可实时查看刚刚触发的调用链路追踪、Token 费率统计与 Prompt 版本映射关系。

Langfuse - 开源大模型提示词工程管理与全链路追踪评估平台 的核心优势与适用场景有哪些?

Langfuse - 开源大模型提示词工程管理与全链路追踪评估平台 适合用于 企业级 Prompt 中心化版本管理、复杂多智能体调用链排障追踪、大模型应用生产成本审计、自动化 RAG 与生成质量闭环评估。其综合评分为 4.9/5 分,具备开箱即用、社区活跃、架构设计轻量等优势,能够无缝集成到现有的 AI 工作流中。

使用 Langfuse - 开源大模型提示词工程管理与全链路追踪评估平台 时有哪些技术考量与局限性?

在架构设计与自托管便利性上,Langfuse 基于 Next.js 与 PostgreSQL 构建,架构干净清晰,仅需单机 Docker 即可轻松支撑每天数百万次调用追踪。其提供的客户端 SDK(Python / TypeScript)均支持异步批量上报,对应用程序本身的延迟影响几乎为零。 在安全合规性方面,由于完全开源且支持 100% 局域网私有化部署,企业无需担心敏感的商业提示词与客户私密对话数据泄露给第三方云厂商,完全满足金融、医疗与政企对数据主权的严苛要求。 在可扩展性与生态集成上,Langfuse 提供了完备的 REST API 与 Python/TypeScript 客户端,支持将追踪数据定时导出到 Snowflake、BigQuery 或 ClickHouse 进行进一步的企业数仓深度挖掘。