70% инженерных команд запускают multi-model AI в продакшне — что данные Datadog 2026 говорят о routing

Отчёт Datadog «State of AI Engineering 2026» фиксирует: более 70% организаций используют три и более AI-модели в продакшне. Данные тысячи реальных клиентов раскрывают, что делает multi-model AI routing production-ready — и где команды до сих пор действуют вслепую.

TheRouter Newsroomисточник Datadog
Абстрактная схема распределённой маршрутизации AI-моделей между несколькими провайдерами

Три года назад большинство инженерных команд выбирали одного AI-провайдера и оставались с ним. Сегодня стандартом стал портфельный подход. Отчёт Datadog «State of AI Engineering 2026» — основанный на телеметрии LLM-вызовов более чем тысячи production-клиентов — подтверждает то, что операторы давно ощущают: multi-model AI routing в продакшне больше не передовая практика. Это базовый уровень.

Вопрос в том, успевает ли ваша инфраструктура за этим темпом.

Что произошло

Datadog проанализировал телеметрию LLM-вызовов своей клиентской базы, получив одну из наиболее достоверных картин того, как AI реально работает в продакшне. Ключевые цифры впечатляют:

  • Более 70% организаций используют три и более модели в продакшне; доля тех, кто работает с шестью и более моделями, почти удвоилась за год.
  • Доля OpenAI упала с 75% до 63% — не из-за абсолютного снижения (количество клиентов Datadog, использующих OpenAI, более чем удвоилось), а потому что Google Gemini и Anthropic Claude выросли на 20 и 23 процентных пункта соответственно.
  • Claude Sonnet 4.6 достиг 17% adoption в первый же месяц после релиза — свидетельство того, как быстро команды осваивают новые модели при наличии правильной routing-инфраструктуры.
  • GPT-4o, официально убранный из интерфейса ChatGPT, по-прежнему занимает 22% в API-трейсах за март 2026 года — наглядный пример того, как продакшн-системы сопротивляются принудительному deprecation.
  • Ротация моделей ускоряется. Команды быстро добавляют новые релизы, но медленно выводят старые, создавая перекрывающиеся портфели моделей — каждая со своим профилем качества, latency и стоимости.

Почему это важно для AI-инженерных команд

Данные Datadog выявляют структурный разрыв: команды принимают multi-model стратегии быстрее, чем успевают строить governance-инфраструктуру для их управления.

Каждая дополнительная модель в production-флоте порождает накапливающуюся операционную нагрузку:

  • Burden оценки. Одни и те же промпты, tool-вызовы или agent-воркфлоу дают разные результаты на разных моделях. Команды должны поддерживать оценочные системы для каждой запущенной модели — не только для той, которой больше доверяют.
  • Давление deprecation. По мере ускорения release-цикла провайдеров старые версии моделей уходят быстрее. То, что GPT-4o занимает 22% API-трейсов после удаления из UI — предвестник волн смены моделей, с которыми команды будут сталкиваться снова и снова.
  • Разрозненность стоимости. Разные провайдеры по-разному тарифицируют токены, кешируют и выставляют счета за async-задачи. Без единого учёта multi-model AI routing в продакшне превращается в кошмар при сверке расходов.
  • Фрагментация compliance. Enterprise-команды, одновременно работающие с OpenAI, Google и Anthropic, имеют дело с разными условиями, требованиями к data residency и форматами audit-логов. Без gateway-слоя консолидация этих данных становится исключительно ручной работой.

Отчёт также фиксирует тревожный паттерн отказов: adoption agent-фреймворков почти удвоился год к году (с 9% до 18%), однако фреймворки ускоряют разработку, а не операционную часть. Команды быстрее выходят в продакшн, но операционная сложность множится с каждым добавленным провайдером и каждой зафиксированной версией фреймворка.

Router/operator-угол: ключевые выводы

Отчёт Datadog прямо называет gateway routing структурным решением: «команды всё больше нуждаются в модульном routing-механизме (например, gateway-сервисе) для управления LLM-запросами, вместо прямых вызовов API провайдеров по всему окружению».

Для операторов, строящих или оценивающих свой gateway-слой, production-данные указывают на три конкретных решения:

1. Роутить по стадии воркфлоу, а не по предпочтениям команды. Лидирующие команды в исследовании Datadog рассматривают инференс как конвейер: лёгкие модели для извлечения и тегирования, frontier-модели для синтеза. Такой многоуровневый routing-паттерн требует gateway, способного анализировать намерение запроса и направлять его соответственно — а не статического алиаса провайдера.

2. Относиться к deprecation модели как к операционному событию первого класса. 22% доля GPT-4o в API-трейсах после его удаления из UI — это предупреждение. Команды без routing-политик, учитывающих deprecation, получат жёсткие отказы вместо graceful fallback, когда провайдер наконец принудительно отключит модель. У каждой модели в вашем флоте должен быть план вывода, закодированный в routing-политике — до того, как провайдер сделает это срочным.

3. Сделать оценку непрерывной, а не разовой. Отчёт фиксирует, что организации «быстро добавляют новые модели, но медленно выводят старые» — это означает, что регрессии качества накапливаются незаметно. Routing без online evaluation — это гадание в масштабе. Порог для добавления новой модели в продакшн должен включать непрерывные quality-пробы, а не один бенчмарк-скриншот.

Что стоит проверить и попробовать пользователям TheRouter

Если вы направляете запросы от нескольких провайдеров через routing-слой TheRouter, данные Datadog дают вам ориентир: более 70% production-организаций уже работают в multi-model режиме. Но те, кто реально сокращает операционный разрыв, инвестируют в:

  • Явные routing-политики — вместо хаотичного выбора модели каждой командой.
  • Единый учёт провайдеров — чтобы стоимость, latency и failure rate были видны по всему флоту моделей, а не разбросаны по отдельным dashboard провайдеров.
  • Fallback-цепочки — способные корректно обрабатывать throttling провайдера и deprecation моделей задолго до того, как провайдер вынудит к этому.

Сверьтесь с документацией TheRouter, чтобы убедиться, что у каждого провайдера в вашем флоте определён fallback и что учёт стоимости охватывает кросс-провайдерные расходы в едином ledger. Затем сопоставьте ваши самые старые зафиксированные версии моделей с временными рамками deprecation провайдеров — до следующего раунда вывода моделей.

Отчёт Datadog — полезный ориентир. Multi-model AI routing в продакшне стал нормой. Конкурентное преимущество — в том, управляете ли вы им осознанно, или просто выживаете в условиях его стихийного роста.

Диаграмма улучшений надёжности Claude Code 2.1.274 для операторов gateway: стабильность MCP-соединений и восстановление транскриптов

Claude Code 2.1.274: масштабное исправление MCP, конфигурация Postgres в gateway и самовосстановление транскриптов

Claude Code 2.1.274 устраняет шесть причин тихих сбоев MCP в production, добавляет store.connect_timeout_seconds и CLAUDE_CODE_GATEWAY_DRAIN_TIMEOUT_MS в Claude apps gateway, а также переводит повреждённые транскрипты на режим самовосстановления вместо бесконечного цикла.

источник Anthropic
Изменения Claude Code 2.1.273: hint-заголовки gateway и смена классификатора auto-режима, представленные как панель наблюдаемости прокси с сигналами классификации запросов

Claude Code 2.1.273: пять новых hint-заголовков для gateway и смена классификатора на Bedrock, Vertex и Foundry

Claude Code 2.1.273 добавляет opt-in hint-заголовки, передающие LLM-прокси класс запроса, тип агента и состояние компакции. Одновременно на Bedrock, Vertex AI и Foundry по умолчанию включается локальный классификатор auto-режима — откатить можно только это изменение.

источник Anthropic
Диаграмма маршрутизации с двумя активными API-эндпоинтами deepseek-v4-pro и deepseek-flash с разными лимитами конкурентности и ценовыми уровнями

DeepSeek V4 Pro пережил собственный дедлайн: что разворот означает для вашей политики маршрутизации

DeepSeek объявил 10 сентября, что V4 Pro будет отключён сегодня в 04:00 UTC. Вместо этого они отыграли назад под давлением пользователей, сохранив V4 Pro на прежних ценах. Разбираем актуальные параметры двух моделей и решения для routing-операторов.

источник DeepSeek
Помощь и контакты