2026 年 LLM API 可观测性工具对比:Langfuse、Helicone、Portkey、Arize Phoenix,以及如何通过网关追踪 API 调用
2026 年 LLM 可观测性工具实用对比——Langfuse、Helicone、Portkey、Arize Phoenix、LangSmith、LangWatch——涵盖追踪、成本监控、评估、自托管、定价,以及 API 网关在可观测性体系中的角色。
需要开源自托管、框架无关的追踪?选 Langfuse。要最快上手——只改一行 URL——并自带成本面板和缓存?选 Helicone。要路由、降级和可观测在同一个控制面?选 Portkey。要把评估放在第一位、用 Notebook 驱动工作流?选 Arize Phoenix。技术栈是 LangChain,需要标注队列和 Agent 调试?选 LangSmith。 我们从实际生产视角出发,围绕追踪深度、评估成熟度、成本追踪、自托管、告警和定价可预测性六个维度比较了六款工具。
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
数据来源:Langfuse GitHub,2026-07-28 检索;Helicone GitHub,2026-07-28 检索;Portkey Pricing,2026-07-28 检索;Arize Phoenix GitHub,2026-07-28 检索;LangSmith — LangChain,2026-07-28 检索;Confident AI — 11 LLM Observability Tools 2026,2026-07-28 检索;Firecrawl — Best LLM Observability Tools 2026,2026-07-28 检索。
TL;DR——工具速览
| 工具 | 类型 | 开源 | 自托管 | 集成方式 | 免费额度 | 付费起步 | 最适合 |
|---|---|---|---|---|---|---|---|
| Langfuse | 一体化追踪 + 评估 | MIT | 支持(Postgres + ClickHouse) | SDK / OpenTelemetry | 25K spans/月 | ~$29/月 | 需要完全控制、自托管、多框架追踪的团队 |
| Helicone | 代理网关 + 可观测 | Apache-2.0 | 支持 | 改 URL/加 Header | 个人无限制 | $79/月(Pro) | 最快上手、成本面板、缓存、多模型日志 |
| Portkey | AI 网关 + 可观测 | MIT(Gateway 2.0) | 支持 | 网关配置 | 100K 日志/月 | $49/月 | 路由 + 降级 + 可观测统一控制面 |
| Arize Phoenix | 追踪 + 评估 | ELv2 | 支持 | OpenTelemetry / SDK | 自托管无限制 | Arize Cloud $50/月起 | 以评估为核心、Notebook 工作流、RAG 调试 |
| LangSmith | 可观测 + 评估 | 否 | 企业版 K8s | LangChain 环境变量 | 5K traces/月 | $39/seat/月 | LangChain 原生技术栈、标注队列、Agent 调试 |
| LangWatch | 多 Agent 可观测 | Apache-2.0 | 支持 | SDK / OpenTelemetry | 有免费额度 | ~€29/seat/月 | 合规行业、多 Agent 追踪、内容护栏 |
这张表回答了大多数团队首先会问的问题:"能自托管吗?50 万请求/月要花多少钱?"
LLM 可观测性到底是什么
传统 APM(Datadog、New Relic)追踪延迟、错误率和基础设施健康状态。LLM 可观测性在此基础上增加了三层 APM 无法覆盖的维度:
- 追踪级别可见性——多步 Agent 链中的每一次 LLM 调用、工具调用、检索步骤和中间推理过程,而不仅仅是 HTTP 请求/响应。
- 成本归因——Token 数量、缓存命中、按模型定价、按用户或功能的开支明细。LLM API 的费用按 Token 计费,增长速度远快于传统按实例计费的计算资源。
- 输出质量评分——忠实性、相关性、幻觉检测、安全性检查。上游返回 200 OK 并不代表回答是正确的。
如果你的技术栈只记录了请求和响应,那你拥有的是"监控"。"可观测性"始于你能还原某个输出为什么被生成,以及它是否合格。
Langfuse——开源全能选手
Langfuse 是该领域的开源标杆,GitHub 28,000+ Star,MIT 协议。覆盖追踪、Prompt 版本管理、评估(LLM-as-judge、用户反馈、自定义指标)和内建 Playground——全部可自托管在 Postgres + ClickHouse 上。
优势:
- 框架无关。Python 和 JavaScript 原生 SDK,加上 LangChain、LlamaIndex 等 50+ 框架连接器。支持 OpenTelemetry,可接入已有可观测体系。
- 自托管文档完善、社区活跃。Cloud 版和自托管版功能一致,无锁定。
- Prompt 管理带版本控制和 A/B 对比。
- 多轮对话追踪,支持按轮次成本归因。
注意事项:
- UI 能用,但不如部分商业产品精致。
- 评估功能在快速迭代中,但深度不及 Arize Phoenix 或 Confident AI 等专用评估工具。
- Cloud 免费版限 25K spans/月——开发够用,生产偏紧。
定价: 免费版(25K spans/月、无限团队成员、60 天留存)。Pro ~$39/月(100K spans)。自托管免费无限制。
何时选 Langfuse: 需要一个平台覆盖追踪 + 评估 + Prompt 管理,看重自托管和开源,且团队使用多种框架。
Helicone——最快上手,网关原生
Helicone 走代理路线:把 base URL 改一下(或加一个 Header),所有 LLM 请求自动流经 Helicone 网关。无需 SDK 集成,除了 URL 之外不用改代码。这使它成为该品类中上手最快的工具。
优势:
- 一行代码集成。把
api.openai.com换成oai.helicone.ai,即刻获得请求日志、成本、延迟和 Token 用量。 - 维护着最大的开源 API 定价数据库(300+ 模型),成本追踪准确。
- 内建缓存和限速,无需应用层改动即可降低 API 开支。
- 支持 Prompt 实验和版本管理。
注意事项:
- 可观测深度在请求级别,而非 Span 级别。如果需要 Agent 执行步骤的 Trace 树,Helicone 能看到 LLM 调用,但看不到调用之间的应用逻辑。
- 评估能力弱于 Langfuse 或 Arize Phoenix——Helicone 对请求打分,但不提供深层忠实性/幻觉指标。
- 代理架构意味着所有流量经过 Helicone(或你的自托管实例)。对数据驻留有严格要求的团队应选自托管。
定价: 个人免费无限制(不可用于企业)。Pro $79/月。Team $799/月。可通过 Docker 自托管。
何时选 Helicone: 需要零代码改动的成本追踪和请求日志,缓存很重要,且不需要深度 Agent 追踪或评估。
Portkey——网关 + 可观测一体化
Portkey 以 AI 网关起家(路由、降级、负载均衡、护栏),随后扩展到可观测领域。2026 年 Portkey 开源了其网关(MIT,"Gateway 2.0"),路由、治理、可观测和成本控制均可自托管。
优势:
- 路由和可观测在同一控制面。降级触发时,你能看到为什么触发以及哪个上游服务了请求的完整 Trace。
- 配置驱动架构。降级链、负载均衡和护栏用配置定义,而非代码——可审计、可版本管理。
- 250+ 模型集成,网关开销 20–40ms。
- 内建语义缓存、RBAC 和预算控制。
注意事项:
- 可观测在服务商级别和请求级别,而非输出质量级别。Portkey 告诉你哪个模型回答了、花了多少钱,但不评估回答是否忠实或相关。
- 免费版日志留存有限。100K 日志/月对生产负载而言会很快用满。
- 网关架构是路由的优势,但在请求路径中增加了一个依赖。
定价: 免费(10K 日志/月)。Developer $49/月(100K 日志、30 天留存、额外 100K $9)。Enterprise 自定义。
何时选 Portkey: 核心需求是路由 + 降级 + 可观测统一在一个工具中,输出质量评估可以放在下游。
Arize Phoenix——评估优先,Notebook 原生
Arize Phoenix 是 Arize AI 推出的开源(ELv2 许可)可观测与评估工具。它围绕 Notebook 工作流设计:Prompt 实验、LLM-as-judge 评估、数据集管理和追踪全在 Python 环境中完成。
优势:
- 零功能门槛。追踪、评估、实验功能在开源版全部可用。
- OpenTelemetry 原生。Trace 使用标准 OTEL Span,可接入现有可观测基础设施。
- 内建忠实性、相关性、毒性、幻觉和 RAG 检索质量评估器——开箱即用。
- 数据集管理和实验跟踪,可对评估集和 Prompt 做版本管理。
注意事项:
- Notebook 优先的理念意味着 UI 是次要的。需要生产级仪表盘和团队协作告警的团队可能觉得自托管 UI 比较基础。
- ELv2 许可允许自托管,但限制将 Phoenix 作为托管服务对外提供。内部使用不受影响。
- Arize 托管云 $50/月起。
定价: Phoenix 自托管免费。Arize Cloud $50/月起。
何时选 Arize Phoenix: 评估深度是核心需求,你在 Notebook 中工作,需要 OTEL 原生追踪且不想被供应商锁定。
LangSmith——LangChain 技术栈首选
LangSmith 与 LangChain 和 LangGraph 集成最深。设一个环境变量,追踪就自动生效——Chain、Agent、工具调用和检索步骤无需改代码即被捕获。
优势:
- 标注队列(Annotation Queue)将被标记的 Trace(如 LLM Judge 判定为低置信度的)路由给人工审核者。审核者提交结构化反馈并回流到评估数据集。这是当前最好的人机协同实现之一。
- 对话聚类从生产流量中发现常见用户意图。
- Agent 专用指标:工具使用频率、错误率、步骤级延迟。
- LLM-as-judge 评估器自动对历史运行打分。
注意事项:
- 脱离 LangChain 生态后,集成深度显著下降。框架无关追踪可行但需要更多手动配置。
- 非开源。企业版可在 Kubernetes 上自托管,但非社区驱动项目。
- 免费版限 5K traces/月——本文对比中最严格的免费额度。
定价: 免费(5K traces/月)。Plus $39/seat/月(含 10K traces)。企业版可自托管。
何时选 LangSmith: 应用基于 LangChain/LangGraph 构建,需要标注队列和 Agent 调试,且希望最小化集成工作量。
LangWatch——合规与多 Agent 场景
LangWatch 面向合规行业和多 Agent 架构。结合追踪、在线评估、护栏和生产到仿真的闭环——追踪生产流量,然后在模拟场景中回放以测试行为变更。
优势:
- 多 Agent Span 树,步骤级细节。
- 在线评估:对生产流量实时运行评分函数。
- 护栏(内容过滤、PII 检测)内建于追踪管道。
- 可自托管(Apache-2.0),满足数据驻留要求。
注意事项:
- 基础设施 APM 不在范围内——LangWatch 关注 LLM 应用行为,而非运行它的服务器。
- 社区规模小于 Langfuse 或 LangSmith。
- 定价以欧元计,免费额度后 ~€29/seat/月起。
何时选 LangWatch: 在合规环境中运行,需要将护栏集成到可观测管道,或运行多 Agent 系统。
决策矩阵:选对工具
| 优先级 | 最佳选择 | 备选 |
|---|---|---|
| 自托管一切,开源 | Langfuse(MIT) | Arize Phoenix(ELv2) |
| 最快上手,零代码改动 | Helicone | Portkey |
| 路由 + 降级 + 可观测 | Portkey | Helicone |
| 评估深度(忠实性、幻觉) | Arize Phoenix | Langfuse |
| LangChain/LangGraph 技术栈 | LangSmith | Langfuse |
| 合规行业、护栏 | LangWatch | Portkey |
| 成本追踪准确性 | Helicone | Portkey |
| Agent 调试(多步 Trace) | Langfuse | LangSmith |
| Notebook 优先工作流 | Arize Phoenix | — |
多数生产环境最终会组合两个工具:一个负责追踪/日志(Langfuse、Helicone 或 Portkey),一个负责评估(Arize Phoenix 或自建管道)。这些工具并非互斥——OpenTelemetry 兼容性意味着一个工具的 Trace 可以喂给另一个。
API 网关在可观测体系中的角色
如果你通过网关路由 LLM 请求——无论是 Portkey、LiteLLM 还是 TheRouter——网关本身就是天然的埋点位置。
位于应用和上游 Provider 之间的路由网关可以输出:
- 请求/响应日志,附带 Provider 归因(哪个模型、哪个 Provider、延迟、Token 数量)。
- 降级 Trace,显示请求何时以及为何被路由到备选 Provider。
- 成本核算,按 Provider、按模型、按 API Key 聚合。
TheRouter 通过配置的 Provider 路由 OpenAI 兼容请求,并在已上线的产品路径中支持 Provider/模型路由和降级。它在已实现的功能范围内提供统一的计费/核算界面。这些日志可以成为成本可观测的基础,而无需在请求路径中额外添加代理。
重要区分:网关处理的是运维可观测性(哪个 Provider、花了多少钱、是否触发降级)。输出质量可观测性(回答是否忠实、相关、安全)需要 Langfuse、Arize Phoenix 或你自己的评估管道来补充。两者互为补充。
对于已经使用网关的团队,添加 Langfuse 或 Arize Phoenix 来做质量评估,就能构建一套完整的可观测体系:
应用 → 网关(路由 + 成本日志) → Provider
↓
追踪工具(Langfuse / Phoenix)
↓
评估管道(质量评分)
这种架构避免了代理层重复:网关负责路由和成本追踪,追踪工具负责 Span 树和评估。
规模化定价对比
50 万 LLM 请求/月的可观测成本是多少?
| 工具 | 50 万请求/月估算 | 备注 |
|---|---|---|
| Langfuse(自托管) | 仅基础设施(~$50–150/月) | 你的 Postgres + ClickHouse |
| Langfuse(Cloud) | ~$200–250/月 | Pro + 超额 $5/100K spans |
| Helicone(Pro) | $79/月 + 超额 | Pro 覆盖中等流量 |
| Portkey | ~$85–130/月 | $49 基础 + $9/100K 日志超额 |
| Arize Phoenix(自托管) | 仅基础设施 | 免费,无功能门槛 |
| Arize(Cloud) | $50/月起 | 按量计费 |
| LangSmith | ~$39–100+/seat/月 | 取决于 Seat 数和 Trace 量 |
| LangWatch | ~€29+/seat/月 | 超出免费额度后按量计费 |
大流量场景下自托管 Langfuse 或 Arize Phoenix 最划算。偏好托管服务的团队可以选择 Portkey 和 Helicone 的按请求定价模式。
该追踪什么:可观测性清单
无论选哪个工具,以下指标是 LLM API 生产可观测的核心:
- 按模型按 Provider 的延迟——包括流式场景的首 Token 时间(TTFT)。网关路由决策依赖此数据。
- Token 用量和成本——输入 Token、输出 Token、缓存 Token、每请求成本。按功能、用户或团队拆分。
- 按类型的错误率——区分 429(限速)、500(Provider 错误)和 400(请求错误)。三者的应对方式不同:重试、降级或修改 Prompt。
- 降级频率——如果网关将 20% 的流量重新路由,说明上游有问题。将降级率作为健康信号追踪。
- 输出质量评分——忠实性、相关性、幻觉率。即使是抽样评估管道(对 5–10% 的生产流量打分)也能及早发现质量漂移。
- 缓存命中率——如果使用 Prompt 缓存(OpenAI、Anthropic、DashScope)或网关级缓存(Helicone、Portkey),追踪节省的金额。
- 评估分数漂移——按 Prompt 版本、模型或用例分段的质量分数趋势。一次 Prompt 变更可能提升了整体质量但让某个细分场景退化——这是回归。
FAQ
Q:如果网关已经记录了请求日志,还需要单独的可观测工具吗? 网关日志覆盖运维可观测:哪个 Provider、花了多少钱、是否触发降级。它们不覆盖输出质量。生产应用两者都需要。
Q:可以同时使用多个可观测工具吗? 可以。OpenTelemetry 兼容性意味着 Langfuse 的 Trace 可以喂给 Arize Phoenix 做评估,Helicone 的请求日志可以用单独的管道添加质量评分。多数生产环境会组合一个日志/追踪层和一个评估层。
Q:小团队刚起步选哪个? Langfuse(自托管或 Cloud 免费版)以最低门槛提供最全面的功能。如果要零代码上手且成本追踪是首要需求,从 Helicone 开始。
Q:Datadog 或 New Relic 能做 LLM 可观测吗? 两者都已添加 LLM 可观测功能。如果你已经在付费使用 Datadog 或 New Relic,它们的 LLM Tab 会在现有基础设施监控旁边增加 Token 和延迟追踪。对于更深层的 LLM 专用功能(评估、Prompt 管理、多轮追踪),专用工具更强。
Q:自托管值得吗? 大流量(50 万+请求/月)场景下自托管 Langfuse 或 Arize Phoenix 显著降低成本并获得完全的数据控制。10 万请求/月以下,托管 Cloud 通常比自建基础设施更简单、更便宜。
相关文章:2026 年统一 LLM API 和 AI 网关对比 · 2026 年 LLM API 成本优化和路由策略 · 2026 年 AI API 速率限制对比
内部链接:OpenAI provider · Anthropic provider · DashScope provider · SiliconFlow provider · OpenAI 兼容 API 概览