Сравнение инструментов наблюдаемости LLM API в 2026 году: Langfuse, Helicone, Portkey, Arize Phoenix и роль API-шлюза
Практическое сравнение инструментов наблюдаемости LLM в 2026 году — Langfuse, Helicone, Portkey, Arize Phoenix, LangSmith и LangWatch — трассировка, отслеживание затрат, оценка качества, self-hosting, ценообразование и место API-шлюза в стеке наблюдаемости.
Нужна open-source трассировка с self-hosting и без привязки к фреймворку — выбирайте Langfuse. Нужен самый быстрый старт — одна строчка URL — с панелью затрат и кешированием — Helicone. Нужны routing, fallback и наблюдаемость в одной панели управления — Portkey. Оценка качества на первом месте, notebook-ориентированный рабочий процесс — Arize Phoenix. Стек на LangChain, нужны очереди аннотирования и отладка агентов — LangSmith. Мы сравнили шесть инструментов по шести параметрам, которые реально важны в продакшене: глубина трассировки, зрелость оценки, учёт затрат, self-hosting, алертинг и предсказуемость ценообразования.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Источники: Langfuse GitHub, обращение 2026-07-28; Helicone GitHub, обращение 2026-07-28; Portkey Pricing, обращение 2026-07-28; Arize Phoenix GitHub, обращение 2026-07-28; LangSmith — LangChain, обращение 2026-07-28; Confident AI — 11 LLM Observability Tools 2026, обращение 2026-07-28; Firecrawl — Best LLM Observability Tools 2026, обращение 2026-07-28.
TL;DR — обзор инструментов
| Инструмент | Тип | Open source | Self-host | Интеграция | Бесплатный план | Платный от | Лучше всего для |
|---|---|---|---|---|---|---|---|
| Langfuse | Комплексная трассировка + оценка | MIT | Да (Postgres + ClickHouse) | SDK / OpenTelemetry | 25K spans/мес | ~$29/мес | Полный контроль, self-hosting, разнообразие фреймворков |
| Helicone | Прокси-шлюз + наблюдаемость | Apache-2.0 | Да | Замена URL/добавление header | Безлимит (personal) | $79/мес (Pro) | Максимально быстрый старт, панель затрат, кеширование |
| Portkey | AI-шлюз + наблюдаемость | MIT (Gateway 2.0) | Да | Конфиг шлюза | 100K логов/мес | $49/мес | Routing + fallback + наблюдаемость в одной панели |
| Arize Phoenix | Трассировка + оценка | ELv2 | Да | OpenTelemetry / SDK | Безлимит (self-host) | Arize Cloud от $50/мес | Оценка на первом месте, notebook-процесс, отладка RAG |
| LangSmith | Наблюдаемость + оценка | Нет | Enterprise K8s | Переменная окружения LangChain | 5K traces/мес | $39/seat/мес | LangChain-стеки, очереди аннотирования, отладка агентов |
| LangWatch | Мульти-агентная наблюдаемость | Apache-2.0 | Да | SDK / OpenTelemetry | Есть бесплатный план | ~€29/seat/мес | Регулируемые отрасли, мульти-агентная трассировка, guardrails |
Таблица отвечает на первый вопрос большинства команд: «Можно ли развернуть у себя, и сколько это будет стоить при 500K запросах в месяц?»
Что на самом деле означает наблюдаемость LLM
Традиционный APM (Datadog, New Relic) отслеживает задержки, ошибки и состояние инфраструктуры. Наблюдаемость LLM добавляет три уровня, которые APM не покрывает:
- Видимость на уровне трассировки — каждый вызов LLM, вызов инструмента, шаг retrieval и промежуточное рассуждение в многошаговой цепочке агента, а не только HTTP-запрос/ответ.
- Атрибуция затрат — количество токенов, попадания в кеш, цены по моделям, разбивка расходов по пользователям или функциям. Затраты на LLM API растут быстрее традиционных вычислений, потому что биллинг идёт за токен, а не за инстанс.
- Оценка качества выходных данных — точность, релевантность, обнаружение галлюцинаций, проверки безопасности. HTTP 200 OK от провайдера ничего не говорит о том, был ли ответ корректным.
Если ваш стек только логирует запросы и ответы — у вас мониторинг. Наблюдаемость начинается, когда вы можете восстановить, почему конкретный выход был сгенерирован и был ли он качественным.
Langfuse — open-source универсал
Langfuse — лидер open-source сегмента с 28 000+ звёзд на GitHub и лицензией MIT. Покрывает трассировку, управление prompt-версиями, оценку (LLM-as-judge, обратная связь от пользователей, пользовательские метрики) и встроенный playground — всё с возможностью self-hosting на Postgres + ClickHouse.
Преимущества:
- Не привязан к фреймворку. Нативные SDK для Python и JavaScript, коннекторы для LangChain, LlamaIndex и 50+ фреймворков. Поддержка OpenTelemetry позволяет направить трассы в существующий стек.
- Self-hosting хорошо документирован и активно поддерживается. Функции cloud-версии и self-hosted идентичны.
- Управление промптами с контролем версий и A/B-сравнением.
- Трассировка многотерновых диалогов с атрибуцией затрат на каждый ход.
На что обратить внимание:
- UI работает, но уступает в полировке некоторым коммерческим альтернативам.
- Функции оценки быстро развиваются, но уступают в глубине специализированным инструментам (Arize Phoenix, Confident AI).
- Бесплатный cloud-план ограничен 25K spans/мес — хватает для разработки, маловато для продакшена.
Цены: Бесплатно (25K spans/мес, безлимит по участникам, 60-дневное хранение). Pro от ~$39/мес за 100K spans. Self-hosted бесплатно и без ограничений.
Когда выбирать Langfuse: Нужна одна платформа для трассировки + оценки + управления промптами, важны self-hosting и open source, команда использует несколько фреймворков.
Helicone — быстрейший старт, шлюз-нативный
Helicone работает через прокси: замените base URL (или добавьте header) — и все LLM-запросы пойдут через шлюз Helicone. Никакой интеграции SDK, никаких изменений кода кроме URL. Это самый быстрый способ начать собирать данные.
Преимущества:
- Одна строчка. Замените
api.openai.comнаoai.helicone.ai— и сразу получите логи запросов, затраты, задержки и расход токенов. - Крупнейшая open-source база цен на API (300+ моделей). Учёт затрат точен благодаря актуальным ценам.
- Встроенное кеширование и rate limiting снижают расходы на API без изменений в приложении.
- Эксперименты с промптами и версионирование через панель управления.
На что обратить внимание:
- Глубина наблюдаемости — на уровне запросов, не span-уровне. Если нужны деревья трассировки агента, Helicone покажет вызовы LLM, но не логику приложения между ними.
- Оценка слабее, чем у Langfuse или Arize Phoenix — Helicone оценивает запросы, но не предоставляет глубоких метрик точности/галлюцинаций.
- Прокси-архитектура означает, что весь трафик идёт через Helicone (или ваш self-hosted инстанс). Команды со строгими требованиями к размещению данных должны использовать self-hosting.
Цены: Бесплатно для личного использования (не для корпоративного). Pro $79/мес. Team $799/мес. Self-hosting через Docker.
Когда выбирать Helicone: Нужен учёт затрат и логирование запросов без изменений кода, кеширование важно, глубокая трассировка агентов и оценка не требуются.
Portkey — шлюз + наблюдаемость в одном
Portkey начинался как AI-шлюз (routing, fallback, load balancing, guardrails) и расширился до наблюдаемости. В 2026 году Portkey открыл исходный код шлюза (MIT, «Gateway 2.0»), и теперь routing, governance, наблюдаемость и контроль затрат можно развернуть у себя.
Преимущества:
- Routing и наблюдаемость в одной панели управления. При срабатывании fallback видно полную трассировку — почему сработал и какой провайдер обслужил запрос.
- Архитектура на основе конфигурации. Цепочки fallback, load balancing и guardrails описываются в конфиге, а не в коде — можно аудировать и версионировать.
- 250+ моделей, накладные расходы шлюза 20–40 мс.
- Встроенное семантическое кеширование, RBAC и контроль бюджетов.
На что обратить внимание:
- Наблюдаемость на уровне провайдеров и запросов, не на уровне качества выходных данных. Portkey покажет, какая модель ответила и сколько это стоило, но не оценит, был ли ответ точным или релевантным.
- Хранение логов на бесплатном плане ограничено. При 100K логов/мес продакшен-нагрузки быстро упрутся в потолок.
- Шлюзовая архитектура — сильная сторона для routing, но дополнительная зависимость в пути запроса.
Цены: Бесплатно (10K логов/мес). Developer $49/мес (100K логов, 30-дневное хранение, $9 за дополнительные 100K). Enterprise — индивидуально.
Когда выбирать Portkey: Основная потребность — routing + fallback + наблюдаемость в одном инструменте, а оценка качества может быть ниже по потоку.
Arize Phoenix — оценка прежде всего, notebook-нативный
Arize Phoenix — open-source (лицензия ELv2) инструмент наблюдаемости и оценки от Arize AI. Построен вокруг notebook-процесса: эксперименты с промптами, LLM-as-judge оценка, управление датасетами и трассировка — всё в Python-среде.
Преимущества:
- Нулевой feature gate. Трассировка, оценка, эксперименты — всё доступно в open-source версии.
- OpenTelemetry-нативный. Трассы используют стандартные OTEL span-ы и интегрируются с существующей инфраструктурой наблюдаемости.
- Встроенные evaluators для точности, релевантности, токсичности, галлюцинаций и качества retrieval в RAG — работают из коробки.
- Управление датасетами и отслеживание экспериментов позволяют версионировать наборы данных для оценки вместе с промптами.
На что обратить внимание:
- Notebook-first означает, что UI — вторичен. Команды, которым нужна продакшен-панель с алертами и совместной работой, могут найти self-hosted UI базовым.
- ELv2 разрешает self-hosting, но ограничивает предоставление Phoenix как управляемого сервиса. Для внутреннего использования ограничений нет.
- Управляемый cloud Arize от $50/мес.
Цены: Phoenix self-hosted бесплатно. Arize Cloud от $50/мес.
Когда выбирать Arize Phoenix: Глубина оценки — основное требование, вы работаете в notebook, нужна OTEL-нативная трассировка без привязки к вендору.
LangSmith — лучший выбор для LangChain-стеков
LangSmith обеспечивает самую глубокую интеграцию с LangChain и LangGraph. Одна переменная окружения — и трассировка работает автоматически: chains, agents, вызовы инструментов и retriever-шаги захватываются без изменений кода.
Преимущества:
- Очереди аннотирования направляют помеченные трассы (например, с низким confidence по оценке LLM-judge) на ручную проверку. Рецензенты отправляют структурированную обратную связь, которая возвращается в датасеты оценки. Одна из лучших реализаций human-in-the-loop.
- Кластеризация диалогов выявляет типичные пользовательские интенты из продакшен-трафика.
- Метрики для агентов: популярность инструментов, частота ошибок, задержка на уровне шагов.
- LLM-as-judge evaluators для автоматической оценки исторических запусков.
На что обратить внимание:
- За пределами экосистемы LangChain глубина интеграции заметно падает. Framework-agnostic трассировка возможна, но требует больше ручной работы.
- Не open source. Enterprise self-hosting доступен на Kubernetes, но это не community-проект.
- Бесплатный план ограничен 5K traces/мес — самый строгий в этом сравнении.
Цены: Бесплатно (5K traces/мес). Plus $39/seat/мес (включая 10K traces). Enterprise self-hosting доступен.
Когда выбирать LangSmith: Приложение построено на LangChain/LangGraph, нужны очереди аннотирования и отладка агентов с минимальной настройкой.
LangWatch — регулируемые отрасли и мульти-агентные системы
LangWatch ориентирован на регулируемые отрасли и мульти-агентные архитектуры. Объединяет трассировку, онлайн-оценку, guardrails и петлю «продакшен → симуляция».
Преимущества:
- Мульти-агентные span-деревья с деталями на уровне шагов.
- Онлайн-оценка запускает scoring-функции на продакшен-трафике в реальном времени.
- Guardrails (фильтрация контента, обнаружение PII) встроены в pipeline трассировки.
- Self-hosting (Apache-2.0) для требований к размещению данных.
На что обратить внимание:
- APM инфраструктуры вне зоны ответственности — LangWatch фокусируется на поведении LLM-приложения, не серверов.
- Сообщество меньше, чем у Langfuse или LangSmith.
- Цены в евро; от ~€29/seat/мес после бесплатного плана.
Когда выбирать LangWatch: Работаете в регулируемой среде, нужны guardrails, интегрированные в pipeline наблюдаемости, или эксплуатируете мульти-агентные системы.
Матрица принятия решений
| Приоритет | Лучший выбор | Альтернатива |
|---|---|---|
| Self-hosting, open source | Langfuse (MIT) | Arize Phoenix (ELv2) |
| Быстрейший старт, без изменений кода | Helicone | Portkey |
| Routing + fallback + наблюдаемость | Portkey | Helicone |
| Глубина оценки (точность, галлюцинации) | Arize Phoenix | Langfuse |
| Стек LangChain/LangGraph | LangSmith | Langfuse |
| Регулируемые отрасли, guardrails | LangWatch | Portkey |
| Точность учёта затрат | Helicone | Portkey |
| Отладка агентов (многошаговые трассы) | Langfuse | LangSmith |
| Notebook-first | Arize Phoenix | — |
Большинство продакшен-стеков в итоге комбинируют два инструмента: один для трассировки/логирования (Langfuse, Helicone или Portkey) и один для оценки (Arize Phoenix или собственный pipeline). Инструменты не взаимоисключающие — совместимость с OpenTelemetry позволяет направлять трассы из одного инструмента в другой.
Место API-шлюза в стеке наблюдаемости
Если вы направляете LLM-запросы через шлюз — будь то Portkey, LiteLLM или TheRouter — шлюз является естественной точкой инструментирования.
Routing-шлюз между приложением и upstream-провайдерами может выдавать:
- Логи запросов/ответов с атрибуцией провайдера (какая модель, какой провайдер, задержка, количество токенов).
- Трассы fallback — когда и почему запрос был перенаправлен на резервного провайдера.
- Учёт затрат, агрегированный по провайдеру, модели и API-ключу.
TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров и поддерживает routing/fallback моделей и провайдеров в рамках работающих продуктовых путей. Он предоставляет единый биллинг и учётные интерфейсы там, где это реализовано. Эти логи становятся основой наблюдаемости затрат без отдельного прокси в пути запроса.
Важное различие: шлюз обеспечивает операционную наблюдаемость (какой провайдер, какие затраты, сработал ли fallback). Наблюдаемость качества выходных данных (был ли ответ точным, релевантным, безопасным) требует отдельного инструмента — Langfuse, Arize Phoenix или собственного pipeline оценки. Они дополняют друг друга.
Для команд, уже использующих шлюз, добавление Langfuse или Arize Phoenix для оценки качества создаёт полный стек наблюдаемости:
Приложение → Шлюз (routing + логи затрат) → Провайдер
↓
Инструмент трассировки (Langfuse / Phoenix)
↓
Pipeline оценки (scoring качества)
Такая архитектура избегает дублирования прокси-уровня: шлюз занимается routing и учётом затрат, инструмент трассировки — деревьями span и оценкой.
Сравнение стоимости при масштабировании
Сколько стоит наблюдаемость при 500K LLM-запросах в месяц?
| Инструмент | Оценка при 500K запросов/мес | Примечания |
|---|---|---|
| Langfuse (self-host) | Только инфраструктура (~$50–150/мес) | Ваш Postgres + ClickHouse |
| Langfuse (cloud) | ~$200–250/мес | Pro + превышение $5/100K spans |
| Helicone (Pro) | $79/мес + превышение | Pro покрывает средний объём |
| Portkey | ~$85–130/мес | $49 база + $9/100K логов |
| Arize Phoenix (self-host) | Только инфраструктура | Бесплатно, без ограничений |
| Arize (cloud) | От $50/мес | По объёму |
| LangSmith | ~$39–100+/seat/мес | Зависит от числа seat и объёма |
| LangWatch | ~€29+/seat/мес | По объёму после бесплатного плана |
Self-hosting Langfuse или Arize Phoenix — самый экономичный вариант при высоких нагрузках. Для команд, предпочитающих управляемые сервисы, Portkey и Helicone предлагают предсказуемую цену за запрос.
Что отслеживать: чек-лист наблюдаемости
Вне зависимости от выбранного инструмента, эти метрики ключевые для LLM API наблюдаемости в продакшене:
- Задержка по модели и провайдеру — включая time-to-first-token для стриминга. Решения о routing на уровне шлюза зависят от этих данных.
- Расход токенов и затраты — входные, выходные и кешированные токены, стоимость запроса. Разбивка по фичам, пользователям, командам.
- Частота ошибок по типам — различать 429 (rate limit), 500 (ошибка провайдера) и 400 (плохой запрос). У каждого свой ответ: retry, fallback или исправление промпта.
- Частота fallback — если шлюз перенаправляет 20% трафика, upstream-проблема. Отслеживайте fallback rate как сигнал здоровья.
- Оценки качества выходных данных — точность, релевантность, уровень галлюцинаций. Даже выборочный pipeline оценки (scoring 5–10% продакшен-трафика) выявляет дрейф рано.
- Процент попаданий в кеш — если используете prompt caching (OpenAI, Anthropic, DashScope) или кеширование на уровне шлюза (Helicone, Portkey), отслеживайте экономию.
- Дрейф оценок — оценки качества во времени с сегментацией по версии промпта, модели или use case. Изменение промпта, которое улучшает среднее качество, но ухудшает один сегмент, — это регрессия.
FAQ
В: Нужен ли отдельный инструмент наблюдаемости, если шлюз уже логирует запросы? Логи шлюза покрывают операционную наблюдаемость: какой провайдер, какие затраты, сработал ли fallback. Они не покрывают качество выходных данных. Для продакшен-приложений нужны оба.
В: Можно ли использовать несколько инструментов одновременно? Да. Совместимость с OpenTelemetry позволяет направлять трассы из Langfuse в Arize Phoenix для оценки, а логи запросов Helicone дополнять оценками качества из отдельного pipeline. Большинство продакшен-стеков комбинируют слой логирования/трассировки и слой оценки.
В: Что лучше для маленькой команды на старте? Langfuse (self-hosted или бесплатный cloud) даёт максимально широкий набор функций с минимальным порогом входа. Если нужен старт без кода и учёт затрат на первом месте — начните с Helicone.
В: Подходят ли Datadog или New Relic для LLM-наблюдаемости? Оба добавили функции LLM-наблюдаемости. Если вы уже платите за Datadog или New Relic, их LLM-вкладки добавляют учёт токенов и задержек рядом с существующим мониторингом инфраструктуры. Для более глубоких LLM-специфичных функций (оценка, управление промптами, мультитерновая трассировка) специализированный инструмент мощнее.
В: Стоит ли self-hosting? При больших объёмах (500K+ запросов/мес) self-hosting Langfuse или Arize Phoenix существенно экономит и даёт полный контроль над данными. При менее 100K запросов/мес управляемые cloud-планы обычно проще и дешевле, чем собственная инфраструктура.
Связанные материалы: Сравнение unified LLM API и AI-шлюзов 2026 · Стратегии оптимизации затрат и routing LLM API 2026 · Сравнение rate limit-ов AI API 2026
Внутренние ссылки: OpenAI provider · Anthropic provider · DashScope provider · SiliconFlow provider · Обзор OpenAI-совместимых API