腾讯 Hy3 正式登陆 TokenHub:295B MoE 模型的三种推理模式如何重塑 API 路由策略
腾讯于 7 月 6 日正式发布 Hy3,API 已在 TokenHub 上线,并向全球多个 AI 网关平台逐步推出。Tencent Hy3 API 路由决策涉及三种推理模式,输入价格低于每百万 token 0.15 美元。
归档条目:由 AI 根据所引信源辅助生成,发布时未经逐篇审阅。责任编辑:Joe Werner。

2026 年 7 月 6 日,腾讯正式发布 Hy3——Hy3 preview 的生产级后继版本——API 现已在腾讯云 TokenHub 上线,并确认将向全球众多 AI 网关和编程 Agent 平台逐步推出。对于路由团队而言,Tencent Hy3 API 路由 operator 决策已不再是纸上谈兵:有了真实的 endpoint、明确的定价,以及一套需要在路由策略中进行精细通道分配的三模式推理架构。
发生了什么
Hy3 是一个混合专家(MoE)模型,总参数量 2950 亿,激活参数 210 亿——与其他稀疏激活模型属于同一效率级别:计算成本只发生在激活部分,而非全量参数。支持 256K context window(262,144 tokens),并开放三种推理模式:快速路径(低延迟交互)、慢速思考路径(复杂推理)以及兼顾两者的混合模式。
相比 4 月发布的 Hy3 preview,正式版带来了多项改进:强化了强化学习训练、提升了数据质量与多样性,并改善了大规模部署稳定性。自 preview 发布以来,日均 token 消耗增长了 20 倍,选择 Hy3 preview 的 WorkBuddy 用户增长了 6 倍,印证了真实的生产负载,而不仅仅是 benchmark 流量。
API 现已在腾讯云 TokenHub 上线。模型同时以 Apache 2.0 协议开源,HuggingFace 和 ModelScope 上的 checkpoint 名称为 tencent/Hy3。Hermes、Kilo、Cline、OpenCode、Cherry Studio 等全球第三方 AI 网关平台正在逐步接入 Hy3。自托管部署支持通过 vLLM 和 SGLang 以 OpenAI 兼容 API 形式运行。
为什么 AI 工程团队需要关注
Hy3 填补了路由团队一直面临的一个空缺:一个能按请求动态调整推理深度的混合思考模型,而不是被锁定在单一计算层级。大多数生产路由决策都需要在快速廉价推理(高频交互)和慢速高质推理(复杂任务)之间权衡。Hy3 将这一权衡作为一等公民 API 参数暴露出来,而不是强迫你维护两条独立的模型路由。
定价让 operator 的账算得更有意思。相比 preview 阶段,Hy3 正式版进一步降低了输入价格。preview 对 16K 以下请求的定价约为每百万 token 1.2 元;财新报道正式版将输入成本降至每百万 token 1 元(按当前汇率约 0.14 美元/MTok)。这使 Hy3 的输入成本低于多数西方前沿模型,与 TokenHub 上的 DeepSeek-V4-Flash(同为 1 元/MTok 输入)同价位竞争。短 context 请求的输出价格为每百万 token 4 元。
从 Agent 工作负载角度看,腾讯已在自家产品中用 Hy3 preview 验证了真实的 Agent 场景:可靠地驱动多达 495 步的 Agent 工作流,覆盖文档处理、数据分析、知识检索和 MCP 工具链编排。与上一代 Hy2 相比,首 token 时间(TTFT)降低 54%,端到端响应时间降低 47%,成功率超过 99.99%。这些是生产实测信号,而不仅仅是 benchmark 数字。
Tencent Hy3 API 路由 operator 角度
三种推理模式,三条路由通道
Hy3 的快慢混合思考架构意味着你可以在模式层面进行路由,而不仅仅是模型层面。具体而言:
- 快速模式:面向低延迟场景的通道,适用于高频对话、自动补全或检索增强生成查询,首 token 时间比推理深度更重要。配合延迟预算路由规则使用。
- 慢速(扩展推理)模式:面向高精度场景的通道,适用于复杂多步任务、代码生成、金融建模或长程规划。将其视为高级计算层——选择性路由,并在 timeout 设置中为更长的首响应时间留出空间。
- 混合模式:默认运行点,模型动态选择推理深度。当你无法对请求类型进行明确分类,或工作负载混合时使用。
如果你的 AI 网关支持逐请求参数覆盖,可以在所有三条通道中路由同一个 tencent/hy3 模型 ID,通过推理模式参数控制计算成本,而不必在提供商配置中维护三个独立条目。
提供商 endpoint 选项
目前 Hy3 有三条访问路径:
-
腾讯云 TokenHub(
https://api.hunyuan.cloud.tencent.com/v1)——官方厂商 endpoint。支持 OpenAI 兼容的 Chat Completions,model参数建议在 TokenHub 控制台中确认具体字符串(open-weight checkpoint 名称与平台 API 名称可能不同)。需要腾讯云账号及 TokenHub API key。适合已在腾讯云生态的团队。 -
第三方推理平台(Novita AI 等,随发布进度增加)——使用
model: "tencent/hy3"对接 OpenAI 兼容 endpoint。Novita AI 已将tencent/hy3列为可用。这类平台负责容量管理,免去 TokenHub 账号注册,但会带来提供商依赖和可能不同的 SLA 条款。 -
vLLM / SGLang 自托管——从 HuggingFace 的
tencent/Hy3下载并以任意 OpenAI 兼容运行时提供服务。可获得数据本地化保障、消除外部提供商依赖,但需要为 295B 参数模型(21B 激活,但全量权重托管仍需大量资源)准备足够的 GPU 算力。
评估 Hy3 团队的路由策略清单
- 审计当前成本-质量边界:在输入约 0.14 美元/MTok 的情况下,Hy3 的定价低于多数前沿模型输入价格,同时声称具备规模 2–5 倍的大型模型的同等性能。如果你的路由策略目前将所有复杂任务发送给每 MTok 3–15 美元的西方前沿模型,Hy3 是一个潜在的成本降低副通道候选。
- 生产流量路由前确认模型 ID:开源权重 checkpoint 为
tencent/Hy3(HuggingFace / 第三方平台),但 TokenHub 和第三方平台可能使用不同字符串。路由配置中的字符串与 endpoint 接受的字符串不一致会导致静默模型错误,而不是 4xx 失败。 - 设置感知推理模式的 timeout 默认值:慢速思考请求的首响应时间(TTFR)明显长于快速模式请求。统一的 30 秒网关 timeout 可能会中断有效的慢速模式响应。按通道分离 timeout 预算。
- 评估 MCP 工具调用兼容性:Hy3 preview 在腾讯自家产品的生产工作流中验证了 MCP 编排能力。如果你将 Hy3 路由到使用 MCP server 的 Agent 管道中,在将其放入主 Agent 模型通道前,请先运行工具调用兼容性测试。
- 关注多平台定价差异:TokenHub 直连和第三方平台会随时间形成各自定价。如果你通过有每次调用附加价格的第三方 AI 网关路由 Hy3,0.14 美元/MTok 的底价可能不再适用。
256K context:可操作的路由信号
256K context window(262,144 tokens)对文档密集型工作负载具有实际意义。路由长文档摘要、大型语料库的检索增强,或大型代码库中的多轮编程会话的团队,可以将 Hy3 配置为超过 128K tokens 请求的 fallback 或协同主路由。多数前沿模型将实用 context 上限设在 128K 或对扩展 context 收取显著溢价;Hy3 的 256K 以基础 token 价格提供。
TheRouter 用户应当关注或尝试什么
Hy3 的发布在中国国内模型阵容中引入了一个新层级:经过真实生产规模验证的 MoE 混合推理模型,定价在中国国内前沿模型和全球前沿模型两侧都具有竞争力。如果你的路由策略目前包含 DeepSeek-V4-Flash(成本效率任务)和西方前沿模型(高质量任务),Hy3 是质量-成本优先位的候选——尤其在编程、长文档和 Agent 编排工作负载上,256K context 和多步骤验证能力更为突出。
关注你当前路由所用 AI 网关平台的 Hy3 上线时间。当 Hy3 出现在你首选的多提供商后端时,以 5–10% 的合适流量运行 A/B 路由测试,是验证 Hy3 延迟和质量表现是否符合生产 SLA 的最快方式。在 TheRouter 模型目录 中可以比较 Hy3 与其他可用提供商和成本层级的差异。
对于尚未路由任何国内中文提供商的团队:Hy3 的 Apache 2.0 协议和 HuggingFace 开源权重,消除了部分合规环境中历来阻碍中文模型采用的企业 IP 顾虑。对于拥有足够 GPU 算力的组织,自托管路径现已是一个可信的选项。
保持模型 ID 命名规范:锁定到 tencent/Hy3(开源权重/第三方平台)或 TokenHub 控制台中分配的字符串,且不要在同一路由配置条目中混用两者。如果你正在配置新的提供商 lane,TheRouter 快速入门指南 提供了添加新提供商 endpoint 并验证路由行为的全流程指引。
相关阅读
AI 路由新闻与供应商动态 →
Fable 5.1 的缓存读取降价和 effort 参数,每个 gateway 运营者都得重新算一遍账
claude-fable-5-1 的 prompt cache 读取费用降至 $0.25/MTok,是其他 Claude 模型 0.1× 标准费率的四分之一。output_config.effort 参数让运营者在每次请求时调节思考深度与 token 消耗。本文拆解这两项变化对计费、路由和升级决策的实际影响。

qwen3.8-max DashScope 路由策略要先看端点、推理和地域
qwen3.8-max DashScope 路由策略现在要先处理地域端点、Responses API 推理预算,以及网关是否保留 reasoning_content。

Qwen3.8-Max 成为 DashScope 顶级模型:旗舰升级对你的路由策略意味着什么
阿里巴巴的 qwen3.8-max 登陆 DashScope,拥有 2.4T 参数、1M 上下文和思考模式——同时 qwen3.7-max 降入旧版。以下是路由 Qwen 旗舰层级的团队需要了解的变化。