70% инженерных команд запускают multi-model AI в продакшне — что данные Datadog 2026 говорят о routing
Отчёт Datadog «State of AI Engineering 2026» фиксирует: более 70% организаций используют три и более AI-модели в продакшне. Данные тысячи реальных клиентов раскрывают, что делает multi-model AI routing production-ready — и где команды до сих пор действуют вслепую.

Три года назад большинство инженерных команд выбирали одного AI-провайдера и оставались с ним. Сегодня стандартом стал портфельный подход. Отчёт Datadog «State of AI Engineering 2026» — основанный на телеметрии LLM-вызовов более чем тысячи production-клиентов — подтверждает то, что операторы давно ощущают: multi-model AI routing в продакшне больше не передовая практика. Это базовый уровень.
Вопрос в том, успевает ли ваша инфраструктура за этим темпом.
Что произошло
Datadog проанализировал телеметрию LLM-вызовов своей клиентской базы, получив одну из наиболее достоверных картин того, как AI реально работает в продакшне. Ключевые цифры впечатляют:
- Более 70% организаций используют три и более модели в продакшне; доля тех, кто работает с шестью и более моделями, почти удвоилась за год.
- Доля OpenAI упала с 75% до 63% — не из-за абсолютного снижения (количество клиентов Datadog, использующих OpenAI, более чем удвоилось), а потому что Google Gemini и Anthropic Claude выросли на 20 и 23 процентных пункта соответственно.
- Claude Sonnet 4.6 достиг 17% adoption в первый же месяц после релиза — свидетельство того, как быстро команды осваивают новые модели при наличии правильной routing-инфраструктуры.
- GPT-4o, официально убранный из интерфейса ChatGPT, по-прежнему занимает 22% в API-трейсах за март 2026 года — наглядный пример того, как продакшн-системы сопротивляются принудительному deprecation.
- Ротация моделей ускоряется. Команды быстро добавляют новые релизы, но медленно выводят старые, создавая перекрывающиеся портфели моделей — каждая со своим профилем качества, latency и стоимости.
Почему это важно для AI-инженерных команд
Данные Datadog выявляют структурный разрыв: команды принимают multi-model стратегии быстрее, чем успевают строить governance-инфраструктуру для их управления.
Каждая дополнительная модель в production-флоте порождает накапливающуюся операционную нагрузку:
- Burden оценки. Одни и те же промпты, tool-вызовы или agent-воркфлоу дают разные результаты на разных моделях. Команды должны поддерживать оценочные системы для каждой запущенной модели — не только для той, которой больше доверяют.
- Давление deprecation. По мере ускорения release-цикла провайдеров старые версии моделей уходят быстрее. То, что GPT-4o занимает 22% API-трейсов после удаления из UI — предвестник волн смены моделей, с которыми команды будут сталкиваться снова и снова.
- Разрозненность стоимости. Разные провайдеры по-разному тарифицируют токены, кешируют и выставляют счета за async-задачи. Без единого учёта multi-model AI routing в продакшне превращается в кошмар при сверке расходов.
- Фрагментация compliance. Enterprise-команды, одновременно работающие с OpenAI, Google и Anthropic, имеют дело с разными условиями, требованиями к data residency и форматами audit-логов. Без gateway-слоя консолидация этих данных становится исключительно ручной работой.
Отчёт также фиксирует тревожный паттерн отказов: adoption agent-фреймворков почти удвоился год к году (с 9% до 18%), однако фреймворки ускоряют разработку, а не операционную часть. Команды быстрее выходят в продакшн, но операционная сложность множится с каждым добавленным провайдером и каждой зафиксированной версией фреймворка.
Router/operator-угол: ключевые выводы
Отчёт Datadog прямо называет gateway routing структурным решением: «команды всё больше нуждаются в модульном routing-механизме (например, gateway-сервисе) для управления LLM-запросами, вместо прямых вызовов API провайдеров по всему окружению».
Для операторов, строящих или оценивающих свой gateway-слой, production-данные указывают на три конкретных решения:
1. Роутить по стадии воркфлоу, а не по предпочтениям команды. Лидирующие команды в исследовании Datadog рассматривают инференс как конвейер: лёгкие модели для извлечения и тегирования, frontier-модели для синтеза. Такой многоуровневый routing-паттерн требует gateway, способного анализировать намерение запроса и направлять его соответственно — а не статического алиаса провайдера.
2. Относиться к deprecation модели как к операционному событию первого класса. 22% доля GPT-4o в API-трейсах после его удаления из UI — это предупреждение. Команды без routing-политик, учитывающих deprecation, получат жёсткие отказы вместо graceful fallback, когда провайдер наконец принудительно отключит модель. У каждой модели в вашем флоте должен быть план вывода, закодированный в routing-политике — до того, как провайдер сделает это срочным.
3. Сделать оценку непрерывной, а не разовой. Отчёт фиксирует, что организации «быстро добавляют новые модели, но медленно выводят старые» — это означает, что регрессии качества накапливаются незаметно. Routing без online evaluation — это гадание в масштабе. Порог для добавления новой модели в продакшн должен включать непрерывные quality-пробы, а не один бенчмарк-скриншот.
Что стоит проверить и попробовать пользователям TheRouter
Если вы направляете запросы от нескольких провайдеров через routing-слой TheRouter, данные Datadog дают вам ориентир: более 70% production-организаций уже работают в multi-model режиме. Но те, кто реально сокращает операционный разрыв, инвестируют в:
- Явные routing-политики — вместо хаотичного выбора модели каждой командой.
- Единый учёт провайдеров — чтобы стоимость, latency и failure rate были видны по всему флоту моделей, а не разбросаны по отдельным dashboard провайдеров.
- Fallback-цепочки — способные корректно обрабатывать throttling провайдера и deprecation моделей задолго до того, как провайдер вынудит к этому.
Сверьтесь с документацией TheRouter, чтобы убедиться, что у каждого провайдера в вашем флоте определён fallback и что учёт стоимости охватывает кросс-провайдерные расходы в едином ledger. Затем сопоставьте ваши самые старые зафиксированные версии моделей с временными рамками deprecation провайдеров — до следующего раунда вывода моделей.
Отчёт Datadog — полезный ориентир. Multi-model AI routing в продакшне стал нормой. Конкурентное преимущество — в том, управляете ли вы им осознанно, или просто выживаете в условиях его стихийного роста.
Похожие материалы
Новости AI-роутинга и провайдеров →
Claude Code 2.1.274: масштабное исправление MCP, конфигурация Postgres в gateway и самовосстановление транскриптов
Claude Code 2.1.274 устраняет шесть причин тихих сбоев MCP в production, добавляет store.connect_timeout_seconds и CLAUDE_CODE_GATEWAY_DRAIN_TIMEOUT_MS в Claude apps gateway, а также переводит повреждённые транскрипты на режим самовосстановления вместо бесконечного цикла.

Claude Code 2.1.273: пять новых hint-заголовков для gateway и смена классификатора на Bedrock, Vertex и Foundry
Claude Code 2.1.273 добавляет opt-in hint-заголовки, передающие LLM-прокси класс запроса, тип агента и состояние компакции. Одновременно на Bedrock, Vertex AI и Foundry по умолчанию включается локальный классификатор auto-режима — откатить можно только это изменение.

DeepSeek V4 Pro пережил собственный дедлайн: что разворот означает для вашей политики маршрутизации
DeepSeek объявил 10 сентября, что V4 Pro будет отключён сегодня в 04:00 UTC. Вместо этого они отыграли назад под давлением пользователей, сохранив V4 Pro на прежних ценах. Разбираем актуальные параметры двух моделей и решения для routing-операторов.