Все статьи

Сравнение инструментов наблюдаемости LLM API в 2026 году: Langfuse, Helicone, Portkey, Arize Phoenix и роль API-шлюза

Практическое сравнение инструментов наблюдаемости LLM в 2026 году — Langfuse, Helicone, Portkey, Arize Phoenix, LangSmith и LangWatch — трассировка, отслеживание затрат, оценка качества, self-hosting, ценообразование и место API-шлюза в стеке наблюдаемости.

· updated 2026-07-28· TheRouter

Нужна open-source трассировка с self-hosting и без привязки к фреймворку — выбирайте Langfuse. Нужен самый быстрый старт — одна строчка URL — с панелью затрат и кешированием — Helicone. Нужны routing, fallback и наблюдаемость в одной панели управления — Portkey. Оценка качества на первом месте, notebook-ориентированный рабочий процесс — Arize Phoenix. Стек на LangChain, нужны очереди аннотирования и отладка агентов — LangSmith. Мы сравнили шесть инструментов по шести параметрам, которые реально важны в продакшене: глубина трассировки, зрелость оценки, учёт затрат, self-hosting, алертинг и предсказуемость ценообразования.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Источники: Langfuse GitHub, обращение 2026-07-28; Helicone GitHub, обращение 2026-07-28; Portkey Pricing, обращение 2026-07-28; Arize Phoenix GitHub, обращение 2026-07-28; LangSmith — LangChain, обращение 2026-07-28; Confident AI — 11 LLM Observability Tools 2026, обращение 2026-07-28; Firecrawl — Best LLM Observability Tools 2026, обращение 2026-07-28.

TL;DR — обзор инструментов

ИнструментТипOpen sourceSelf-hostИнтеграцияБесплатный планПлатный отЛучше всего для
LangfuseКомплексная трассировка + оценкаMITДа (Postgres + ClickHouse)SDK / OpenTelemetry25K spans/мес~$29/месПолный контроль, self-hosting, разнообразие фреймворков
HeliconeПрокси-шлюз + наблюдаемостьApache-2.0ДаЗамена URL/добавление headerБезлимит (personal)$79/мес (Pro)Максимально быстрый старт, панель затрат, кеширование
PortkeyAI-шлюз + наблюдаемостьMIT (Gateway 2.0)ДаКонфиг шлюза100K логов/мес$49/месRouting + fallback + наблюдаемость в одной панели
Arize PhoenixТрассировка + оценкаELv2ДаOpenTelemetry / SDKБезлимит (self-host)Arize Cloud от $50/месОценка на первом месте, notebook-процесс, отладка RAG
LangSmithНаблюдаемость + оценкаНетEnterprise K8sПеременная окружения LangChain5K traces/мес$39/seat/месLangChain-стеки, очереди аннотирования, отладка агентов
LangWatchМульти-агентная наблюдаемостьApache-2.0ДаSDK / OpenTelemetryЕсть бесплатный план~€29/seat/месРегулируемые отрасли, мульти-агентная трассировка, guardrails

Таблица отвечает на первый вопрос большинства команд: «Можно ли развернуть у себя, и сколько это будет стоить при 500K запросах в месяц?»

Что на самом деле означает наблюдаемость LLM

Традиционный APM (Datadog, New Relic) отслеживает задержки, ошибки и состояние инфраструктуры. Наблюдаемость LLM добавляет три уровня, которые APM не покрывает:

  1. Видимость на уровне трассировки — каждый вызов LLM, вызов инструмента, шаг retrieval и промежуточное рассуждение в многошаговой цепочке агента, а не только HTTP-запрос/ответ.
  2. Атрибуция затрат — количество токенов, попадания в кеш, цены по моделям, разбивка расходов по пользователям или функциям. Затраты на LLM API растут быстрее традиционных вычислений, потому что биллинг идёт за токен, а не за инстанс.
  3. Оценка качества выходных данных — точность, релевантность, обнаружение галлюцинаций, проверки безопасности. HTTP 200 OK от провайдера ничего не говорит о том, был ли ответ корректным.

Если ваш стек только логирует запросы и ответы — у вас мониторинг. Наблюдаемость начинается, когда вы можете восстановить, почему конкретный выход был сгенерирован и был ли он качественным.

Langfuse — open-source универсал

Langfuse — лидер open-source сегмента с 28 000+ звёзд на GitHub и лицензией MIT. Покрывает трассировку, управление prompt-версиями, оценку (LLM-as-judge, обратная связь от пользователей, пользовательские метрики) и встроенный playground — всё с возможностью self-hosting на Postgres + ClickHouse.

Преимущества:

  • Не привязан к фреймворку. Нативные SDK для Python и JavaScript, коннекторы для LangChain, LlamaIndex и 50+ фреймворков. Поддержка OpenTelemetry позволяет направить трассы в существующий стек.
  • Self-hosting хорошо документирован и активно поддерживается. Функции cloud-версии и self-hosted идентичны.
  • Управление промптами с контролем версий и A/B-сравнением.
  • Трассировка многотерновых диалогов с атрибуцией затрат на каждый ход.

На что обратить внимание:

  • UI работает, но уступает в полировке некоторым коммерческим альтернативам.
  • Функции оценки быстро развиваются, но уступают в глубине специализированным инструментам (Arize Phoenix, Confident AI).
  • Бесплатный cloud-план ограничен 25K spans/мес — хватает для разработки, маловато для продакшена.

Цены: Бесплатно (25K spans/мес, безлимит по участникам, 60-дневное хранение). Pro от ~$39/мес за 100K spans. Self-hosted бесплатно и без ограничений.

Когда выбирать Langfuse: Нужна одна платформа для трассировки + оценки + управления промптами, важны self-hosting и open source, команда использует несколько фреймворков.

Helicone — быстрейший старт, шлюз-нативный

Helicone работает через прокси: замените base URL (или добавьте header) — и все LLM-запросы пойдут через шлюз Helicone. Никакой интеграции SDK, никаких изменений кода кроме URL. Это самый быстрый способ начать собирать данные.

Преимущества:

  • Одна строчка. Замените api.openai.com на oai.helicone.ai — и сразу получите логи запросов, затраты, задержки и расход токенов.
  • Крупнейшая open-source база цен на API (300+ моделей). Учёт затрат точен благодаря актуальным ценам.
  • Встроенное кеширование и rate limiting снижают расходы на API без изменений в приложении.
  • Эксперименты с промптами и версионирование через панель управления.

На что обратить внимание:

  • Глубина наблюдаемости — на уровне запросов, не span-уровне. Если нужны деревья трассировки агента, Helicone покажет вызовы LLM, но не логику приложения между ними.
  • Оценка слабее, чем у Langfuse или Arize Phoenix — Helicone оценивает запросы, но не предоставляет глубоких метрик точности/галлюцинаций.
  • Прокси-архитектура означает, что весь трафик идёт через Helicone (или ваш self-hosted инстанс). Команды со строгими требованиями к размещению данных должны использовать self-hosting.

Цены: Бесплатно для личного использования (не для корпоративного). Pro $79/мес. Team $799/мес. Self-hosting через Docker.

Когда выбирать Helicone: Нужен учёт затрат и логирование запросов без изменений кода, кеширование важно, глубокая трассировка агентов и оценка не требуются.

Portkey — шлюз + наблюдаемость в одном

Portkey начинался как AI-шлюз (routing, fallback, load balancing, guardrails) и расширился до наблюдаемости. В 2026 году Portkey открыл исходный код шлюза (MIT, «Gateway 2.0»), и теперь routing, governance, наблюдаемость и контроль затрат можно развернуть у себя.

Преимущества:

  • Routing и наблюдаемость в одной панели управления. При срабатывании fallback видно полную трассировку — почему сработал и какой провайдер обслужил запрос.
  • Архитектура на основе конфигурации. Цепочки fallback, load balancing и guardrails описываются в конфиге, а не в коде — можно аудировать и версионировать.
  • 250+ моделей, накладные расходы шлюза 20–40 мс.
  • Встроенное семантическое кеширование, RBAC и контроль бюджетов.

На что обратить внимание:

  • Наблюдаемость на уровне провайдеров и запросов, не на уровне качества выходных данных. Portkey покажет, какая модель ответила и сколько это стоило, но не оценит, был ли ответ точным или релевантным.
  • Хранение логов на бесплатном плане ограничено. При 100K логов/мес продакшен-нагрузки быстро упрутся в потолок.
  • Шлюзовая архитектура — сильная сторона для routing, но дополнительная зависимость в пути запроса.

Цены: Бесплатно (10K логов/мес). Developer $49/мес (100K логов, 30-дневное хранение, $9 за дополнительные 100K). Enterprise — индивидуально.

Когда выбирать Portkey: Основная потребность — routing + fallback + наблюдаемость в одном инструменте, а оценка качества может быть ниже по потоку.

Arize Phoenix — оценка прежде всего, notebook-нативный

Arize Phoenix — open-source (лицензия ELv2) инструмент наблюдаемости и оценки от Arize AI. Построен вокруг notebook-процесса: эксперименты с промптами, LLM-as-judge оценка, управление датасетами и трассировка — всё в Python-среде.

Преимущества:

  • Нулевой feature gate. Трассировка, оценка, эксперименты — всё доступно в open-source версии.
  • OpenTelemetry-нативный. Трассы используют стандартные OTEL span-ы и интегрируются с существующей инфраструктурой наблюдаемости.
  • Встроенные evaluators для точности, релевантности, токсичности, галлюцинаций и качества retrieval в RAG — работают из коробки.
  • Управление датасетами и отслеживание экспериментов позволяют версионировать наборы данных для оценки вместе с промптами.

На что обратить внимание:

  • Notebook-first означает, что UI — вторичен. Команды, которым нужна продакшен-панель с алертами и совместной работой, могут найти self-hosted UI базовым.
  • ELv2 разрешает self-hosting, но ограничивает предоставление Phoenix как управляемого сервиса. Для внутреннего использования ограничений нет.
  • Управляемый cloud Arize от $50/мес.

Цены: Phoenix self-hosted бесплатно. Arize Cloud от $50/мес.

Когда выбирать Arize Phoenix: Глубина оценки — основное требование, вы работаете в notebook, нужна OTEL-нативная трассировка без привязки к вендору.

LangSmith — лучший выбор для LangChain-стеков

LangSmith обеспечивает самую глубокую интеграцию с LangChain и LangGraph. Одна переменная окружения — и трассировка работает автоматически: chains, agents, вызовы инструментов и retriever-шаги захватываются без изменений кода.

Преимущества:

  • Очереди аннотирования направляют помеченные трассы (например, с низким confidence по оценке LLM-judge) на ручную проверку. Рецензенты отправляют структурированную обратную связь, которая возвращается в датасеты оценки. Одна из лучших реализаций human-in-the-loop.
  • Кластеризация диалогов выявляет типичные пользовательские интенты из продакшен-трафика.
  • Метрики для агентов: популярность инструментов, частота ошибок, задержка на уровне шагов.
  • LLM-as-judge evaluators для автоматической оценки исторических запусков.

На что обратить внимание:

  • За пределами экосистемы LangChain глубина интеграции заметно падает. Framework-agnostic трассировка возможна, но требует больше ручной работы.
  • Не open source. Enterprise self-hosting доступен на Kubernetes, но это не community-проект.
  • Бесплатный план ограничен 5K traces/мес — самый строгий в этом сравнении.

Цены: Бесплатно (5K traces/мес). Plus $39/seat/мес (включая 10K traces). Enterprise self-hosting доступен.

Когда выбирать LangSmith: Приложение построено на LangChain/LangGraph, нужны очереди аннотирования и отладка агентов с минимальной настройкой.

LangWatch — регулируемые отрасли и мульти-агентные системы

LangWatch ориентирован на регулируемые отрасли и мульти-агентные архитектуры. Объединяет трассировку, онлайн-оценку, guardrails и петлю «продакшен → симуляция».

Преимущества:

  • Мульти-агентные span-деревья с деталями на уровне шагов.
  • Онлайн-оценка запускает scoring-функции на продакшен-трафике в реальном времени.
  • Guardrails (фильтрация контента, обнаружение PII) встроены в pipeline трассировки.
  • Self-hosting (Apache-2.0) для требований к размещению данных.

На что обратить внимание:

  • APM инфраструктуры вне зоны ответственности — LangWatch фокусируется на поведении LLM-приложения, не серверов.
  • Сообщество меньше, чем у Langfuse или LangSmith.
  • Цены в евро; от ~€29/seat/мес после бесплатного плана.

Когда выбирать LangWatch: Работаете в регулируемой среде, нужны guardrails, интегрированные в pipeline наблюдаемости, или эксплуатируете мульти-агентные системы.

Матрица принятия решений

ПриоритетЛучший выборАльтернатива
Self-hosting, open sourceLangfuse (MIT)Arize Phoenix (ELv2)
Быстрейший старт, без изменений кодаHeliconePortkey
Routing + fallback + наблюдаемостьPortkeyHelicone
Глубина оценки (точность, галлюцинации)Arize PhoenixLangfuse
Стек LangChain/LangGraphLangSmithLangfuse
Регулируемые отрасли, guardrailsLangWatchPortkey
Точность учёта затратHeliconePortkey
Отладка агентов (многошаговые трассы)LangfuseLangSmith
Notebook-firstArize Phoenix

Большинство продакшен-стеков в итоге комбинируют два инструмента: один для трассировки/логирования (Langfuse, Helicone или Portkey) и один для оценки (Arize Phoenix или собственный pipeline). Инструменты не взаимоисключающие — совместимость с OpenTelemetry позволяет направлять трассы из одного инструмента в другой.

Место API-шлюза в стеке наблюдаемости

Если вы направляете LLM-запросы через шлюз — будь то Portkey, LiteLLM или TheRouter — шлюз является естественной точкой инструментирования.

Routing-шлюз между приложением и upstream-провайдерами может выдавать:

  • Логи запросов/ответов с атрибуцией провайдера (какая модель, какой провайдер, задержка, количество токенов).
  • Трассы fallback — когда и почему запрос был перенаправлен на резервного провайдера.
  • Учёт затрат, агрегированный по провайдеру, модели и API-ключу.

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров и поддерживает routing/fallback моделей и провайдеров в рамках работающих продуктовых путей. Он предоставляет единый биллинг и учётные интерфейсы там, где это реализовано. Эти логи становятся основой наблюдаемости затрат без отдельного прокси в пути запроса.

Важное различие: шлюз обеспечивает операционную наблюдаемость (какой провайдер, какие затраты, сработал ли fallback). Наблюдаемость качества выходных данных (был ли ответ точным, релевантным, безопасным) требует отдельного инструмента — Langfuse, Arize Phoenix или собственного pipeline оценки. Они дополняют друг друга.

Для команд, уже использующих шлюз, добавление Langfuse или Arize Phoenix для оценки качества создаёт полный стек наблюдаемости:

Приложение → Шлюз (routing + логи затрат) → Провайдер
                    ↓
             Инструмент трассировки (Langfuse / Phoenix)
                    ↓
             Pipeline оценки (scoring качества)

Такая архитектура избегает дублирования прокси-уровня: шлюз занимается routing и учётом затрат, инструмент трассировки — деревьями span и оценкой.

Сравнение стоимости при масштабировании

Сколько стоит наблюдаемость при 500K LLM-запросах в месяц?

ИнструментОценка при 500K запросов/месПримечания
Langfuse (self-host)Только инфраструктура (~$50–150/мес)Ваш Postgres + ClickHouse
Langfuse (cloud)~$200–250/месPro + превышение $5/100K spans
Helicone (Pro)$79/мес + превышениеPro покрывает средний объём
Portkey~$85–130/мес$49 база + $9/100K логов
Arize Phoenix (self-host)Только инфраструктураБесплатно, без ограничений
Arize (cloud)От $50/месПо объёму
LangSmith~$39–100+/seat/месЗависит от числа seat и объёма
LangWatch~€29+/seat/месПо объёму после бесплатного плана

Self-hosting Langfuse или Arize Phoenix — самый экономичный вариант при высоких нагрузках. Для команд, предпочитающих управляемые сервисы, Portkey и Helicone предлагают предсказуемую цену за запрос.

Что отслеживать: чек-лист наблюдаемости

Вне зависимости от выбранного инструмента, эти метрики ключевые для LLM API наблюдаемости в продакшене:

  1. Задержка по модели и провайдеру — включая time-to-first-token для стриминга. Решения о routing на уровне шлюза зависят от этих данных.
  2. Расход токенов и затраты — входные, выходные и кешированные токены, стоимость запроса. Разбивка по фичам, пользователям, командам.
  3. Частота ошибок по типам — различать 429 (rate limit), 500 (ошибка провайдера) и 400 (плохой запрос). У каждого свой ответ: retry, fallback или исправление промпта.
  4. Частота fallback — если шлюз перенаправляет 20% трафика, upstream-проблема. Отслеживайте fallback rate как сигнал здоровья.
  5. Оценки качества выходных данных — точность, релевантность, уровень галлюцинаций. Даже выборочный pipeline оценки (scoring 5–10% продакшен-трафика) выявляет дрейф рано.
  6. Процент попаданий в кеш — если используете prompt caching (OpenAI, Anthropic, DashScope) или кеширование на уровне шлюза (Helicone, Portkey), отслеживайте экономию.
  7. Дрейф оценок — оценки качества во времени с сегментацией по версии промпта, модели или use case. Изменение промпта, которое улучшает среднее качество, но ухудшает один сегмент, — это регрессия.

FAQ

В: Нужен ли отдельный инструмент наблюдаемости, если шлюз уже логирует запросы? Логи шлюза покрывают операционную наблюдаемость: какой провайдер, какие затраты, сработал ли fallback. Они не покрывают качество выходных данных. Для продакшен-приложений нужны оба.

В: Можно ли использовать несколько инструментов одновременно? Да. Совместимость с OpenTelemetry позволяет направлять трассы из Langfuse в Arize Phoenix для оценки, а логи запросов Helicone дополнять оценками качества из отдельного pipeline. Большинство продакшен-стеков комбинируют слой логирования/трассировки и слой оценки.

В: Что лучше для маленькой команды на старте? Langfuse (self-hosted или бесплатный cloud) даёт максимально широкий набор функций с минимальным порогом входа. Если нужен старт без кода и учёт затрат на первом месте — начните с Helicone.

В: Подходят ли Datadog или New Relic для LLM-наблюдаемости? Оба добавили функции LLM-наблюдаемости. Если вы уже платите за Datadog или New Relic, их LLM-вкладки добавляют учёт токенов и задержек рядом с существующим мониторингом инфраструктуры. Для более глубоких LLM-специфичных функций (оценка, управление промптами, мультитерновая трассировка) специализированный инструмент мощнее.

В: Стоит ли self-hosting? При больших объёмах (500K+ запросов/мес) self-hosting Langfuse или Arize Phoenix существенно экономит и даёт полный контроль над данными. При менее 100K запросов/мес управляемые cloud-планы обычно проще и дешевле, чем собственная инфраструктура.


Связанные материалы: Сравнение unified LLM API и AI-шлюзов 2026 · Стратегии оптимизации затрат и routing LLM API 2026 · Сравнение rate limit-ов AI API 2026

Внутренние ссылки: OpenAI provider · Anthropic provider · DashScope provider · SiliconFlow provider · Обзор OpenAI-совместимых API

Поддержка