全部文章

2026 年 LLM API 可观测性工具对比:Langfuse、Helicone、Portkey、Arize Phoenix,以及如何通过网关追踪 API 调用

2026 年 LLM 可观测性工具实用对比——Langfuse、Helicone、Portkey、Arize Phoenix、LangSmith、LangWatch——涵盖追踪、成本监控、评估、自托管、定价,以及 API 网关在可观测性体系中的角色。

· updated 2026-07-28· TheRouter

需要开源自托管、框架无关的追踪?选 Langfuse。要最快上手——只改一行 URL——并自带成本面板和缓存?选 Helicone。要路由、降级和可观测在同一个控制面?选 Portkey。要把评估放在第一位、用 Notebook 驱动工作流?选 Arize Phoenix。技术栈是 LangChain,需要标注队列和 Agent 调试?选 LangSmith。 我们从实际生产视角出发,围绕追踪深度、评估成熟度、成本追踪、自托管、告警和定价可预测性六个维度比较了六款工具。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completionsmessagesmodel, 并返回 OpenAI 形式的流式响应。

数据来源:Langfuse GitHub,2026-07-28 检索;Helicone GitHub,2026-07-28 检索;Portkey Pricing,2026-07-28 检索;Arize Phoenix GitHub,2026-07-28 检索;LangSmith — LangChain,2026-07-28 检索;Confident AI — 11 LLM Observability Tools 2026,2026-07-28 检索;Firecrawl — Best LLM Observability Tools 2026,2026-07-28 检索。

TL;DR——工具速览

工具类型开源自托管集成方式免费额度付费起步最适合
Langfuse一体化追踪 + 评估MIT支持(Postgres + ClickHouse)SDK / OpenTelemetry25K spans/月~$29/月需要完全控制、自托管、多框架追踪的团队
Helicone代理网关 + 可观测Apache-2.0支持改 URL/加 Header个人无限制$79/月(Pro)最快上手、成本面板、缓存、多模型日志
PortkeyAI 网关 + 可观测MIT(Gateway 2.0)支持网关配置100K 日志/月$49/月路由 + 降级 + 可观测统一控制面
Arize Phoenix追踪 + 评估ELv2支持OpenTelemetry / SDK自托管无限制Arize Cloud $50/月起以评估为核心、Notebook 工作流、RAG 调试
LangSmith可观测 + 评估企业版 K8sLangChain 环境变量5K traces/月$39/seat/月LangChain 原生技术栈、标注队列、Agent 调试
LangWatch多 Agent 可观测Apache-2.0支持SDK / OpenTelemetry有免费额度~€29/seat/月合规行业、多 Agent 追踪、内容护栏

这张表回答了大多数团队首先会问的问题:"能自托管吗?50 万请求/月要花多少钱?"

LLM 可观测性到底是什么

传统 APM(Datadog、New Relic)追踪延迟、错误率和基础设施健康状态。LLM 可观测性在此基础上增加了三层 APM 无法覆盖的维度:

  1. 追踪级别可见性——多步 Agent 链中的每一次 LLM 调用、工具调用、检索步骤和中间推理过程,而不仅仅是 HTTP 请求/响应。
  2. 成本归因——Token 数量、缓存命中、按模型定价、按用户或功能的开支明细。LLM API 的费用按 Token 计费,增长速度远快于传统按实例计费的计算资源。
  3. 输出质量评分——忠实性、相关性、幻觉检测、安全性检查。上游返回 200 OK 并不代表回答是正确的。

如果你的技术栈只记录了请求和响应,那你拥有的是"监控"。"可观测性"始于你能还原某个输出为什么被生成,以及它是否合格。

Langfuse——开源全能选手

Langfuse 是该领域的开源标杆,GitHub 28,000+ Star,MIT 协议。覆盖追踪、Prompt 版本管理、评估(LLM-as-judge、用户反馈、自定义指标)和内建 Playground——全部可自托管在 Postgres + ClickHouse 上。

优势:

  • 框架无关。Python 和 JavaScript 原生 SDK,加上 LangChain、LlamaIndex 等 50+ 框架连接器。支持 OpenTelemetry,可接入已有可观测体系。
  • 自托管文档完善、社区活跃。Cloud 版和自托管版功能一致,无锁定。
  • Prompt 管理带版本控制和 A/B 对比。
  • 多轮对话追踪,支持按轮次成本归因。

注意事项:

  • UI 能用,但不如部分商业产品精致。
  • 评估功能在快速迭代中,但深度不及 Arize Phoenix 或 Confident AI 等专用评估工具。
  • Cloud 免费版限 25K spans/月——开发够用,生产偏紧。

定价: 免费版(25K spans/月、无限团队成员、60 天留存)。Pro ~$39/月(100K spans)。自托管免费无限制。

何时选 Langfuse: 需要一个平台覆盖追踪 + 评估 + Prompt 管理,看重自托管和开源,且团队使用多种框架。

Helicone——最快上手,网关原生

Helicone 走代理路线:把 base URL 改一下(或加一个 Header),所有 LLM 请求自动流经 Helicone 网关。无需 SDK 集成,除了 URL 之外不用改代码。这使它成为该品类中上手最快的工具。

优势:

  • 一行代码集成。把 api.openai.com 换成 oai.helicone.ai,即刻获得请求日志、成本、延迟和 Token 用量。
  • 维护着最大的开源 API 定价数据库(300+ 模型),成本追踪准确。
  • 内建缓存和限速,无需应用层改动即可降低 API 开支。
  • 支持 Prompt 实验和版本管理。

注意事项:

  • 可观测深度在请求级别,而非 Span 级别。如果需要 Agent 执行步骤的 Trace 树,Helicone 能看到 LLM 调用,但看不到调用之间的应用逻辑。
  • 评估能力弱于 Langfuse 或 Arize Phoenix——Helicone 对请求打分,但不提供深层忠实性/幻觉指标。
  • 代理架构意味着所有流量经过 Helicone(或你的自托管实例)。对数据驻留有严格要求的团队应选自托管。

定价: 个人免费无限制(不可用于企业)。Pro $79/月。Team $799/月。可通过 Docker 自托管。

何时选 Helicone: 需要零代码改动的成本追踪和请求日志,缓存很重要,且不需要深度 Agent 追踪或评估。

Portkey——网关 + 可观测一体化

Portkey 以 AI 网关起家(路由、降级、负载均衡、护栏),随后扩展到可观测领域。2026 年 Portkey 开源了其网关(MIT,"Gateway 2.0"),路由、治理、可观测和成本控制均可自托管。

优势:

  • 路由和可观测在同一控制面。降级触发时,你能看到为什么触发以及哪个上游服务了请求的完整 Trace。
  • 配置驱动架构。降级链、负载均衡和护栏用配置定义,而非代码——可审计、可版本管理。
  • 250+ 模型集成,网关开销 20–40ms。
  • 内建语义缓存、RBAC 和预算控制。

注意事项:

  • 可观测在服务商级别和请求级别,而非输出质量级别。Portkey 告诉你哪个模型回答了、花了多少钱,但不评估回答是否忠实或相关。
  • 免费版日志留存有限。100K 日志/月对生产负载而言会很快用满。
  • 网关架构是路由的优势,但在请求路径中增加了一个依赖。

定价: 免费(10K 日志/月)。Developer $49/月(100K 日志、30 天留存、额外 100K $9)。Enterprise 自定义。

何时选 Portkey: 核心需求是路由 + 降级 + 可观测统一在一个工具中,输出质量评估可以放在下游。

Arize Phoenix——评估优先,Notebook 原生

Arize Phoenix 是 Arize AI 推出的开源(ELv2 许可)可观测与评估工具。它围绕 Notebook 工作流设计:Prompt 实验、LLM-as-judge 评估、数据集管理和追踪全在 Python 环境中完成。

优势:

  • 零功能门槛。追踪、评估、实验功能在开源版全部可用。
  • OpenTelemetry 原生。Trace 使用标准 OTEL Span,可接入现有可观测基础设施。
  • 内建忠实性、相关性、毒性、幻觉和 RAG 检索质量评估器——开箱即用。
  • 数据集管理和实验跟踪,可对评估集和 Prompt 做版本管理。

注意事项:

  • Notebook 优先的理念意味着 UI 是次要的。需要生产级仪表盘和团队协作告警的团队可能觉得自托管 UI 比较基础。
  • ELv2 许可允许自托管,但限制将 Phoenix 作为托管服务对外提供。内部使用不受影响。
  • Arize 托管云 $50/月起。

定价: Phoenix 自托管免费。Arize Cloud $50/月起。

何时选 Arize Phoenix: 评估深度是核心需求,你在 Notebook 中工作,需要 OTEL 原生追踪且不想被供应商锁定。

LangSmith——LangChain 技术栈首选

LangSmith 与 LangChain 和 LangGraph 集成最深。设一个环境变量,追踪就自动生效——Chain、Agent、工具调用和检索步骤无需改代码即被捕获。

优势:

  • 标注队列(Annotation Queue)将被标记的 Trace(如 LLM Judge 判定为低置信度的)路由给人工审核者。审核者提交结构化反馈并回流到评估数据集。这是当前最好的人机协同实现之一。
  • 对话聚类从生产流量中发现常见用户意图。
  • Agent 专用指标:工具使用频率、错误率、步骤级延迟。
  • LLM-as-judge 评估器自动对历史运行打分。

注意事项:

  • 脱离 LangChain 生态后,集成深度显著下降。框架无关追踪可行但需要更多手动配置。
  • 非开源。企业版可在 Kubernetes 上自托管,但非社区驱动项目。
  • 免费版限 5K traces/月——本文对比中最严格的免费额度。

定价: 免费(5K traces/月)。Plus $39/seat/月(含 10K traces)。企业版可自托管。

何时选 LangSmith: 应用基于 LangChain/LangGraph 构建,需要标注队列和 Agent 调试,且希望最小化集成工作量。

LangWatch——合规与多 Agent 场景

LangWatch 面向合规行业和多 Agent 架构。结合追踪、在线评估、护栏和生产到仿真的闭环——追踪生产流量,然后在模拟场景中回放以测试行为变更。

优势:

  • 多 Agent Span 树,步骤级细节。
  • 在线评估:对生产流量实时运行评分函数。
  • 护栏(内容过滤、PII 检测)内建于追踪管道。
  • 可自托管(Apache-2.0),满足数据驻留要求。

注意事项:

  • 基础设施 APM 不在范围内——LangWatch 关注 LLM 应用行为,而非运行它的服务器。
  • 社区规模小于 Langfuse 或 LangSmith。
  • 定价以欧元计,免费额度后 ~€29/seat/月起。

何时选 LangWatch: 在合规环境中运行,需要将护栏集成到可观测管道,或运行多 Agent 系统。

决策矩阵:选对工具

优先级最佳选择备选
自托管一切,开源Langfuse(MIT)Arize Phoenix(ELv2)
最快上手,零代码改动HeliconePortkey
路由 + 降级 + 可观测PortkeyHelicone
评估深度(忠实性、幻觉)Arize PhoenixLangfuse
LangChain/LangGraph 技术栈LangSmithLangfuse
合规行业、护栏LangWatchPortkey
成本追踪准确性HeliconePortkey
Agent 调试(多步 Trace)LangfuseLangSmith
Notebook 优先工作流Arize Phoenix

多数生产环境最终会组合两个工具:一个负责追踪/日志(Langfuse、Helicone 或 Portkey),一个负责评估(Arize Phoenix 或自建管道)。这些工具并非互斥——OpenTelemetry 兼容性意味着一个工具的 Trace 可以喂给另一个。

API 网关在可观测体系中的角色

如果你通过网关路由 LLM 请求——无论是 PortkeyLiteLLM 还是 TheRouter——网关本身就是天然的埋点位置。

位于应用和上游 Provider 之间的路由网关可以输出:

  • 请求/响应日志,附带 Provider 归因(哪个模型、哪个 Provider、延迟、Token 数量)。
  • 降级 Trace,显示请求何时以及为何被路由到备选 Provider。
  • 成本核算,按 Provider、按模型、按 API Key 聚合。

TheRouter 通过配置的 Provider 路由 OpenAI 兼容请求,并在已上线的产品路径中支持 Provider/模型路由和降级。它在已实现的功能范围内提供统一的计费/核算界面。这些日志可以成为成本可观测的基础,而无需在请求路径中额外添加代理。

重要区分:网关处理的是运维可观测性(哪个 Provider、花了多少钱、是否触发降级)。输出质量可观测性(回答是否忠实、相关、安全)需要 Langfuse、Arize Phoenix 或你自己的评估管道来补充。两者互为补充。

对于已经使用网关的团队,添加 Langfuse 或 Arize Phoenix 来做质量评估,就能构建一套完整的可观测体系:

应用 → 网关(路由 + 成本日志) → Provider
              ↓
        追踪工具(Langfuse / Phoenix)
              ↓
        评估管道(质量评分)

这种架构避免了代理层重复:网关负责路由和成本追踪,追踪工具负责 Span 树和评估。

规模化定价对比

50 万 LLM 请求/月的可观测成本是多少?

工具50 万请求/月估算备注
Langfuse(自托管)仅基础设施(~$50–150/月)你的 Postgres + ClickHouse
Langfuse(Cloud)~$200–250/月Pro + 超额 $5/100K spans
Helicone(Pro)$79/月 + 超额Pro 覆盖中等流量
Portkey~$85–130/月$49 基础 + $9/100K 日志超额
Arize Phoenix(自托管)仅基础设施免费,无功能门槛
Arize(Cloud)$50/月起按量计费
LangSmith~$39–100+/seat/月取决于 Seat 数和 Trace 量
LangWatch~€29+/seat/月超出免费额度后按量计费

大流量场景下自托管 Langfuse 或 Arize Phoenix 最划算。偏好托管服务的团队可以选择 Portkey 和 Helicone 的按请求定价模式。

该追踪什么:可观测性清单

无论选哪个工具,以下指标是 LLM API 生产可观测的核心:

  1. 按模型按 Provider 的延迟——包括流式场景的首 Token 时间(TTFT)。网关路由决策依赖此数据。
  2. Token 用量和成本——输入 Token、输出 Token、缓存 Token、每请求成本。按功能、用户或团队拆分。
  3. 按类型的错误率——区分 429(限速)、500(Provider 错误)和 400(请求错误)。三者的应对方式不同:重试、降级或修改 Prompt。
  4. 降级频率——如果网关将 20% 的流量重新路由,说明上游有问题。将降级率作为健康信号追踪。
  5. 输出质量评分——忠实性、相关性、幻觉率。即使是抽样评估管道(对 5–10% 的生产流量打分)也能及早发现质量漂移。
  6. 缓存命中率——如果使用 Prompt 缓存(OpenAI、Anthropic、DashScope)或网关级缓存(Helicone、Portkey),追踪节省的金额。
  7. 评估分数漂移——按 Prompt 版本、模型或用例分段的质量分数趋势。一次 Prompt 变更可能提升了整体质量但让某个细分场景退化——这是回归。

FAQ

Q:如果网关已经记录了请求日志,还需要单独的可观测工具吗? 网关日志覆盖运维可观测:哪个 Provider、花了多少钱、是否触发降级。它们不覆盖输出质量。生产应用两者都需要。

Q:可以同时使用多个可观测工具吗? 可以。OpenTelemetry 兼容性意味着 Langfuse 的 Trace 可以喂给 Arize Phoenix 做评估,Helicone 的请求日志可以用单独的管道添加质量评分。多数生产环境会组合一个日志/追踪层和一个评估层。

Q:小团队刚起步选哪个? Langfuse(自托管或 Cloud 免费版)以最低门槛提供最全面的功能。如果要零代码上手且成本追踪是首要需求,从 Helicone 开始。

Q:Datadog 或 New Relic 能做 LLM 可观测吗? 两者都已添加 LLM 可观测功能。如果你已经在付费使用 Datadog 或 New Relic,它们的 LLM Tab 会在现有基础设施监控旁边增加 Token 和延迟追踪。对于更深层的 LLM 专用功能(评估、Prompt 管理、多轮追踪),专用工具更强。

Q:自托管值得吗? 大流量(50 万+请求/月)场景下自托管 Langfuse 或 Arize Phoenix 显著降低成本并获得完全的数据控制。10 万请求/月以下,托管 Cloud 通常比自建基础设施更简单、更便宜。


相关文章:2026 年统一 LLM API 和 AI 网关对比 · 2026 年 LLM API 成本优化和路由策略 · 2026 年 AI API 速率限制对比

内部链接:OpenAI provider · Anthropic provider · DashScope provider · SiliconFlow provider · OpenAI 兼容 API 概览

客服支持