Tencent Hy3 на TokenHub: что три режима рассуждений 295B MoE-модели означают для вашей политики API-роутинга

Tencent запустил Hy3 6 июля: API доступен на TokenHub, внедрение идёт на AI-gateway-платформах. Tencent Hy3 API routing operator: три режима рассуждений, 256K контекст и входная цена ниже $0.15 за млн токенов.

Опубликовано источник Tencent

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Редакционная диаграмма с тремя routing-маршрутами для Tencent Hy3 — быстрый, медленный и гибридный режимы рассуждений — с картой компромиссов по стоимости и задержке в сдержанной цветовой гамме
Машинный перевод с английского оригинала — читать оригинал

6 июля 2026 года Tencent официально выпустил Hy3 — production-версию на смену Hy3 preview — с API, доступным на Tencent Cloud TokenHub, и подтверждённым поэтапным развёртыванием на широком наборе глобальных AI-gateway и coding-agent платформ. Для routing-команд решение по Tencent Hy3 API routing operator больше не теоретическое: есть реальный endpoint, реальное ценообразование и трёхрежимная архитектура рассуждений, требующая осознанного распределения по lane в вашей routing-политике.

Что произошло

Hy3 — это Mixture-of-Experts (MoE) модель с 295 миллиардами общих параметров и 21 миллиардом активированных, что помещает её в тот же класс эффективности, что и другие sparse-activation модели: вычислительные расходы возникают только на активированную часть, а не на весь объём параметров. Поддерживается контекстное окно 256K (262 144 токена) и три режима рассуждений: быстрый путь для низколатентных взаимодействий, медленный путь для сложных рассуждений и гибридный режим, сочетающий оба.

Официальный релиз привносит несколько улучшений относительно апрельского Hy3 preview: усиленное обучение с подкреплением, более высокое качество и разнообразие данных, а также повышенная стабильность в условиях высокой нагрузки. После запуска preview среднесуточное потребление токенов выросло в двадцать раз, а число пользователей WorkBuddy, выбравших Hy3 preview, — в шесть раз: это production-нагрузка, а не только benchmark-трафик.

API доступен на Tencent Cloud TokenHub. Модель одновременно опубликована с открытым исходным кодом под лицензией Apache 2.0 на Hugging Face и ModelScope под именем tencent/Hy3. Глобальные AI-gateway платформы — Hermes, Kilo, Cline, OpenCode, Cherry Studio — поэтапно интегрируют Hy3. Self-hosted развёртывание поддерживается через vLLM и SGLang с OpenAI-совместимым API.

Почему это важно для AI engineering-команд

Hy3 закрывает пробел, актуальный для routing-команд: гибридная модель с переменной глубиной рассуждений на уровне запроса, а не привязка к единому вычислительному уровню. Большинство production routing-решений предполагают компромисс между быстрым дешёвым инференсом (высокочастотные взаимодействия) и медленным дорогим (сложные задачи). Hy3 делает этот компромисс явным параметром API, а не вынуждает поддерживать два отдельных route.

Ценообразование делает операторские расчёты интересными. Tencent снизил входную цену для официального Hy3 относительно preview. Preview стоил около 1,2 юаня за миллион токенов для запросов до 16K; Caixing сообщает, что официальный релиз снижает стоимость ввода до 1 юаня за миллион токенов (около $0,14/MTok по текущему курсу). Это ниже порога входных цен большинства западных frontier-моделей и сопоставимо с китайскими аналогами вроде DeepSeek-V4-Flash на TokenHub (тоже 1 юань/MTok вход). Выходная цена для коротких запросов на TokenHub — 4 юаня за миллион токенов.

С точки зрения agent-нагрузок Tencent верифицировал Hy3 preview в реальных условиях: надёжная поддержка agent-workflow до 495 шагов в собственных продуктах компании — включая обработку документов, анализ данных, поиск по базам знаний и оркестрацию MCP-инструментов. Time To First Token снизился на 54% по сравнению с предыдущим поколением Hy2, сквозное время ответа — на 47%, success rate превысил 99,99% на production-нагрузках. Это production-измерения, а не только benchmark-заявления.

Угол зрения Tencent Hy3 API routing operator

Три режима рассуждений — три routing-lane

Гибридная архитектура быстрого и медленного мышления Hy3 означает, что маршрутизацию можно выстраивать на уровне режима, а не только модели. Конкретно:

  • Быстрый режим: lane с низкой задержкой для высокочастотного чата, автодополнения или RAG-запросов, где Time To First Token важнее глубины рассуждений. Используйте совместно с правилами latency-budget routing.
  • Медленный (расширенный) режим рассуждений: высокоточный lane для сложных многошаговых задач, генерации кода, финансового моделирования или долгосрочного планирования. Рассматривайте как premium compute-уровень — маршрутизируйте избирательно и учитывайте увеличенное TTFR при настройке timeout.
  • Гибридный режим: режим работы по умолчанию, в котором модель динамически выбирает глубину рассуждений. Используйте, когда классификация входящих запросов затруднена или нагрузка смешанная.

Если ваш AI-gateway поддерживает per-request-переопределение параметров, можно маршрутизировать один и тот же model ID tencent/hy3 по всем трём lane, управляя вычислительными расходами через параметр режима рассуждений, не создавая три отдельных провайдерских записи.

Варианты endpoint

Сегодня доступны три пути доступа к Hy3:

  1. Tencent Cloud TokenHub (https://api.hunyuan.cloud.tencent.com/v1) — канонический vendor endpoint. Поддерживает OpenAI-совместимый Chat Completions; конкретную строку model уточняйте в консоли TokenHub (имя open-weight checkpoint и платформенное API-имя могут различаться). Требует учётную запись Tencent Cloud и API-ключ TokenHub. Оптимально для команд, уже работающих в экосистеме Tencent Cloud.

  2. Сторонние inference-платформы (Novita AI и другие по мере развёртывания) — используйте model: "tencent/hy3" через OpenAI-совместимые endpoint. Novita AI уже предоставляет tencent/hy3. Эти платформы берут на себя управление мощностями, избавляя от необходимости регистрироваться на TokenHub, но добавляют зависимость от провайдера и потенциально иные условия SLA.

  3. Self-hosted через vLLM / SGLang — скачайте tencent/Hy3 с Hugging Face и запустите через любой OpenAI-совместимый runtime. Обеспечивает гарантии data-locality и устраняет зависимость от внешнего провайдера, но требует GPU-мощностей для модели на 295B параметров (21B активных, однако хранение полных весов по-прежнему ресурсоёмко).

Чеклист routing-политики для команд, оценивающих Hy3

  • Проведите аудит текущей границы стоимость–качество: при входной цене около $0,14/MTok Hy3 дешевле большинства frontier-моделей и при этом заявляет производительность, сопоставимую с моделями в 2–5 раз крупнее. Если ваша routing-политика сейчас направляет все сложные задачи на западные frontier-модели по $3–15/MTok, Hy3 — кандидат для дополнительного cost-reduction lane.
  • Подтвердите model ID до отправки production-трафика: open-weight checkpoint называется tencent/Hy3 (Hugging Face / сторонние платформы), но TokenHub и другие платформы могут использовать иные строки. Несоответствие между тем, что отправляет ваша routing-конфигурация, и тем, что принимает endpoint, вызывает молчаливые ошибки модели, а не 4xx-отказы.
  • Задайте timeout с учётом режима рассуждений: медленные запросы имеют принципиально бо́льшее TTFR, чем быстрые. Универсальный 30-секундный timeout шлюза может прерывать корректные slow-mode ответы. Разделяйте timeout-бюджеты по lane.
  • Оцените совместимость MCP tool call: Hy3 preview прошёл валидацию MCP-оркестрации в production-workflow внутри собственных продуктов Tencent. Для команд, маршрутизирующих Hy3 в agent-pipeline с MCP-серверами, проведите тесты совместимости tool call прежде, чем ставить его на основной lane.
  • Следите за расхождением цен на разных платформах: TokenHub и сторонние платформы будут формировать собственное ценообразование со временем. Если вы маршрутизируете Hy3 через сторонний AI-gateway с надбавкой за вызов, ценовой пол в $0,14/MTok может не применяться.

256K-контекст: практический routing-сигнал

Контекстное окно в 256K (262 144 токена) актуально для document-heavy нагрузок. Команды, маршрутизирующие суммаризацию длинных документов, RAG по большим корпусам или многоходовые сессии кодирования с крупными кодовыми базами, могут настроить Hy3 как fallback или co-primary для запросов, превышающих 128K токенов. Большинство frontier-моделей ограничивают практический контекст 128K или берут значительную надбавку за расширенный контекст; 256K у Hy3 доступен по базовой токенной цене.

Что стоит отслеживать и попробовать пользователям TheRouter

Запуск Hy3 вводит новый уровень в линейку китайских моделей: MoE-модель с гибридными рассуждениями, верифицированная при реальной production-нагрузке, с ценообразованием, конкурентным как для китайского, так и для глобального рынка frontier. Если ваша routing-политика сейчас включает DeepSeek-V4-Flash для cost-efficiency и западную frontier-модель для качества, Hy3 — кандидат в слот «качество при оптимальной стоимости» — особенно для задач кодирования, работы с длинными документами и agent-оркестрации, где критичны 256K-контекст и многошаговая валидация.

Следите за сроками появления Hy3 на AI-gateway платформах, через которые вы сейчас маршрутизируете. Как только Hy3 появится на вашем предпочтительном multi-provider backend, запуск A/B routing-теста на 5–10% подходящего трафика — это самый быстрый способ проверить, соответствует ли профиль задержки и качества Hy3 вашему production SLA. Сравните Hy3 с другими доступными провайдерами в каталоге моделей TheRouter перед выбором routing-маршрута.

Для команд, ещё не маршрутизирующих ни одного китайского провайдера: лицензия Apache 2.0 и публично доступные веса Hy3 на Hugging Face устраняют корпоративные IP-опасения, которые исторически блокировали принятие китайских моделей в ряде compliance-сред. Self-hosted путь теперь является реальной опцией для организаций с достаточными GPU-мощностями.

Соблюдайте дисциплину именования model ID: фиксируйте tencent/Hy3 (открытые веса / сторонние платформы) или строку, назначенную консолью TokenHub, и не смешивайте их в одной записи routing-конфигурации. Если вы настраиваете новый provider lane, руководство по быстрому старту TheRouter покажет, как добавить endpoint нового провайдера и проверить routing-поведение.

Абстрактная архитектурная диаграмма на тёмном техническом фоне: график стоимости кэшированных токенов и регулятор уровня effort

Снижение цены на cache reads в Fable 5.1 и параметр effort: что пересчитать операторам gateway

Cache reads на claude-fable-5-1 упали до $0.25/MTok — в 4 раза дешевле стандартной ставки 0.1× на других моделях Claude. output_config.effort даёт операторам рычаг управления глубиной thinking на уровне запроса. Что это меняет в billing, routing и логике upgrade.

источник Anthropic
Чёткая редакционная визуализация диаграммы маршрутизации моделей с qwen3.8-max в качестве узла верхнего уровня, абстрактные линии на матовом тёмном фоне

Qwen3.8-Max — теперь топовая модель DashScope: что смена флагмана меняет в вашей routing-политике

qwen3.8-max появился на DashScope: 2.4T параметров, 1M контекст и режим размышлений — а qwen3.7-max переведён в legacy. Что меняется для команд, маршрутизирующих трафик на флагманский уровень Qwen.

источник Alibaba Cloud
Помощь и контакты