Теги

Новости по тегу "provider-ops"

RSS-лента
Чёткая редакционная визуализация диаграммы маршрутизации моделей с qwen3.8-max в качестве узла верхнего уровня, абстрактные линии на матовом тёмном фоне

Qwen3.8-Max — теперь топовая модель DashScope: что смена флагмана меняет в вашей routing-политике

qwen3.8-max появился на DashScope: 2.4T параметров, 1M контекст и режим размышлений — а qwen3.7-max переведён в legacy. Что меняется для команд, маршрутизирующих трафик на флагманский уровень Qwen.

источник Alibaba Cloud
Абстрактная редакционная схема: три пути маршрутизации генерации изображений — скорость, баланс, качество — сходятся в единой точке AI gateway

Nano Banana 2 Lite — новый дефолтный эндпоинт Gemini для изображений: фреймворк принятия решений по маршрутизации

Nano Banana 2 Lite (gemini-3.1-flash-lite-image) вышел 30 июня по $0,034/тыс. изображений при задержке 4 секунды. Если вы ещё маршрутизируете на gemini-2.5-flash-image — вы на устаревшей модели. Трёхуровневый routing-фреймворк для operator teams.

источник Google DeepMind
Редакционная схема с точками принятия решений при миграции роутинга с NVIDIA NIM Kimi K2.6 на прямой API Kimi K2.7 Code и self-hosted варианты

Kimi K2.6 отключён на NVIDIA NIM сегодня: три пути миграции, которые оператор должен оценить немедленно

NVIDIA NIM закрыла хостинговый endpoint Kimi K2.6 7 июля 2026 года. Если ваша конфигурация роутинга всё ещё указывает на NIM API для Kimi K2.6, запросы сейчас возвращают ошибки. Вот три конкретных пути миграции, которые каждый оператор должен оценить до конца дня.

источник NVIDIA NIM / Moonshot AI
Редакционная диаграмма с тремя routing-маршрутами для Tencent Hy3 — быстрый, медленный и гибридный режимы рассуждений — с картой компромиссов по стоимости и задержке в сдержанной цветовой гамме

Tencent Hy3 на TokenHub: что три режима рассуждений 295B MoE-модели означают для вашей политики API-роутинга

Tencent запустил Hy3 6 июля: API доступен на TokenHub, внедрение идёт на AI-gateway-платформах. Tencent Hy3 API routing operator: три режима рассуждений, 256K контекст и входная цена ниже $0.15 за млн токенов.

источник Tencent
Абстрактная редакционная иллюстрация разветвлённых рабочих потоков, символизирующих архитектуру маршрутизации coding agent

Запуск ZCode: официальный coding agent от Z.ai вводит новую архитектуру endpoint, которую команды маршрутизации обязаны переосмыслить

Z.ai официально запустила ZCode 2 июля — бесплатную среду agentic-разработки на базе GLM-5.2. Для команд маршрутизации запуск вводит отдельный coding endpoint, двойные каналы Anthropic/OpenAI, BYOK через сторонние каналы и промо 1.5x квоты, действующее до 31 июля.

источник Z.ai / ZCode
Редакционная иллюстрация: глобальное восстановление routing — сетевые маршруты сходятся в одном стабильном узле, приглушённая сине-серая палитра

Экспортные ограничения на Fable 5 сняты — глобальный routing восстановлен, 7 июля кредитный переход

С 1 июля экспортные ограничения США на Fable 5 сняты, глобальный доступ через API возобновлён, повторное включение AWS и Azure Foundry в процессе — но 7 июля наступает переход на billing через usage credits. Операционный чеклист для команд.

источник Anthropic
Редакционная иллюстрация глобуса с разделёнными региональными и глобальными маршрутами передачи данных и индикаторами стоимости

Ценообразование Gemini для не-глобальных эндпоинтов вступает в силу 1 июля: 10% региональная надбавка, которую каждая команда должна учесть в роутинге

С 1 июля 2026 года Gemini 3 и последующие модели получают 10% надбавку для не-глобальных (региональных) эндпоинтов. Командам, направляющим трафик в eu-west1, asia-northeast1 и аналогичные регионы, необходимо немедленно пересмотреть модели расходов.

источник Google Cloud
Схема маршрутизации по именам хостов, разделяющей трафик между изолированными каталогами моделей внутри единого AI-шлюза

Envoy AI Gateway v0.7.0: Маршрутизация по имени хоста для мультиарендной среды и что это значит для операторов AI-инфраструктуры

Envoy AI Gateway v0.7.0 вводит изоляцию каталога моделей по имени хоста, трансляцию протоколов Anthropic → Bedrock и квота-ориентированное ограничение трафика — важный ориентир для развития production-инфраструктуры AI-маршрутизации.

источник Envoy AI Gateway
Абстрактная диаграмма маршрутизации с многоязычными потоками текста, сходящимися через центральный gateway-узел

Qwen-MT Turbo: специализированный translation API от Alibaba и параметры extra_body, которые стандартные прокси могут терять

Новый qwen-mt-turbo от Alibaba Cloud приходит через OpenAI-совместимые endpoint, но его translation-контроли живут внутри extra_body — паттерн, который ломается на любом middleware, отрезающем нестандартные поля. Что нужно держать в голове routing-командам.

источник Qwen Blog
Абстрактная тёмная визуализация нейронной сети с расходящимися потоками данных, сходящимися к центральному вычислительному ядру, символизирующая работу автономного AI-агента

Qwen3.7-Max benchmarks: Terminal Bench 69.7, SWE-Pro лидерство и T-Head ZW-M890 PPU — 35 часов автономного запуска

Qwen3.7-Max benchmarks: Terminal Bench 2.0 → 69.7 (лидер), GPQA Diamond → 92.4, SWE-Pro и SWE-Multilingual лучшие оценки, KernelBench GPU 1.98×. T-Head ZW-M890 PPU — 35 часов непрерывной автономной работы агента. Routing-импликации для команд.

источник Alibaba Cloud
Помощь и контакты