Qwen3.8-Max 成为 DashScope 顶级模型:旗舰升级对你的路由策略意味着什么

阿里巴巴的 qwen3.8-max 登陆 DashScope,拥有 2.4T 参数、1M 上下文和思考模式——同时 qwen3.7-max 降入旧版。以下是路由 Qwen 旗舰层级的团队需要了解的变化。

TheRouter Newsroom来源 Alibaba Cloud
展示 qwen3.8-max 作为顶级节点的模型路由图的简洁编辑风格可视化,深色哑光背景上绘有抽象干净的线条

2026 年 8 月 3 日,阿里巴巴正式发布 qwen3.8-max——总参数量 2.4 万亿,通过稀疏 MoE 激活 950 亿参数,上下文窗口达 100 万 token。发布 48 小时内,DashScope 官方文本生成文档已将 qwen3.7-max 移至旧版分区,并以 qwen3.8-max 替代其作为唯一推荐的高能力模型。对于路由到 Qwen 旗舰层级的团队来说,两件事立即发生了变化:需要调用的模型 ID,以及可以依赖的能力基线。

DashScope 上的具体变化

DashScope 模型目录现在在主推荐表中显示 qwen3.8-max,并开启了四项功能标志:思考模式(enable_thinking 参数)、Function Calling、内置工具(网络搜索、代码解释器),以及结构化输出。qwen3.7-max 系列——包括快照 qwen3.7-max-preview、qwen3.7-max-2026-06-08、qwen3.7-max-2026-05-20、qwen3.7-max-2026-05-17——仍可调用,但页面明确标注为"旧版模型"。官方未记录任何自动别名转发机制。

qwen3.8-max 的上下文窗口为 100 万 token,与 qwen3.7-max 的 1M 上下文保持一致。Responses API 通过 reasoning.effort 控制思考深度;Chat Completions API 使用 enable_thinking 布尔值。这些参数从 Qwen3.7 系列延续下来,无需更改。目前 qwen3.8-max 尚未出现带日期后缀的快照版本,这意味着该模型 ID 目前未版本化——这种模式通常预示着在数天或数周内将出现带日期的快照(如 qwen3.8-max-2026-08-03)。

DashScope 目前在四个区域提供该模型:北京(cn-beijing)、新加坡(ap-southeast-1)、美东(us-east-1)和法兰克福(eu-central-1)。发布时未公布各区域间的延迟 SLA 差异。

对 AI 工程团队的影响

qwen3.7-max 降级是你的迁移触发信号。 与附带明确下线日期的正式弃用事件不同,DashScope 静默标记为旧版的模式意味着 qwen3.7-max 仍可调用,但将停止获得功能更新、容量优先级和新快照版本。固定特定快照(如 qwen3.7-max-2026-06-08)的团队不受别名漂移影响,但路由到未版本化 qwen3.7-max 字符串的团队最终可能面临变化。在操作上,最稳妥的做法是计划迁移到 qwen3.8-max。

DashScope 上的模型 ID 与旧版 Qwen 别名不同。 旧版 qwen-max 别名(DashScope 上仍可用)仅支持 32k 上下文,且早于整个 Qwen3 系列。尚未明确迁移到版本化 qwen3.x-max 模型 ID 的团队,实际上路由到的是一个本质上不同的能力层级。qwen3.8-max 是当前的顶级层 ID——不是 qwen-max,不是上下文仅 256k 的旧版 qwen3-max。

思考模式参数可直接沿用。 如果你的路由层当前为 Qwen3.7-Max 设置了 enable_thinking: true,对 qwen3.8-max 发送的请求同样有效。通过 Responses API 的 reasoning.effort 路径(low、medium、high)也同样延续。无需参数迁移。

MoE 架构改变了延迟计算方式。 在 2.4T 总参数中激活 950 亿参数,qwen3.8-max 每 token 激活的计算量大致相当于密集型约 950 亿参数模型。对于构建延迟敏感路由策略的团队来说,这比朴素的 2.4T 密集参数数量预期要好得多。尽管如此,1M 上下文请求的首 token 延迟与短上下文请求不同——在 AI gateway 的超时配置中需要考虑这一点。

路由器/运营商视角

没有自动别名更新意味着需要显式迁移。 与部分指向新版本的浮动别名提供商(如 gpt-4o 指向新版本)不同,qwen3.7-max → qwen3.8-max 的过渡需要手动修改路由配置。没有宣布任何重定向机制。检查每个指向 qwen3.7-max 或其快照的路由中的 model 字段,并更新为 qwen3.8-max。

多提供商比较背景。 DashScope 官方文档将 qwen3.8-max 定位为能力层级上等同于 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro 的模型。对于运行基于质量的多提供商路由并进行模型选择的团队,qwen3.8-max 应进入高能力通道——在你的 fallback 链中,它与 Claude Opus 4.7 或 GPT-5.5 处于同一层级。

尚无快照版本固定——将 qwen3.8-max 视为浮动版本。 在带日期的快照出现之前(如 qwen3.8-max-2026-08-03),模型 ID qwen3.8-max 未版本化,可能被静默更新。对于需要可重现性的生产工作负载,关注首个快照版本,一旦出现即在路由配置中固定到该版本。Qwen 团队近期的规律表明(Qwen3.7-Max 发布数天内就有首个快照 qwen3.7-max-2026-05-17),命名快照即将到来。

开源权重下周发布——自托管 fallback 路径。 阿里巴巴宣布将在 API 发布后一周内开源 qwen3.8-max 的模型权重。对于拥有自托管推理基础设施(vLLM、SGLang 等)的团队,这开辟了将溢出或延迟敏感流量路由到具有相同模型的本地端点的路径。这改变了 fallback 架构:不再是 DashScope → 另一个云提供商,而是可以路由到 DashScope → 自托管 qwen3.8-max 权重。

定价层级。 发布时,qwen3.8-max 定位为高端层级。DashScope 的 Token Plan 订阅(8 月 4 日宣布)涵盖跨模态访问,但旗舰层级的按 token 定价与之前的 qwen3.7-max 顶级定价保持一致。发布时未宣布任何促销定价或积分优惠。

需要关注或尝试的事项

  • 更新路由配置:在模型路由表中将 qwen3.7-max 替换为 qwen3.8-max。通过测试调用确认 enable_thinking 和 reasoning.effort 参数按预期工作。
  • 关注快照版本:订阅 DashScope 变更日志或阿里云模型服务百炼发布说明,以获取首个 qwen3.8-max-YYYY-MM-DD 快照的通知。一旦出现,立即固定到该版本以确保可重现性。
  • 验证区域可用性:如果你出于 APAC 延迟原因路由到特定 DashScope 区域(如新加坡),在从 qwen3.7-max 切换前,确认 qwen3.8-max 在该区域可用且延迟符合预期。
  • 审计旧版 Qwen 别名:如果你的路由配置中仍有路由使用 qwen-max(旧版 32k 别名)或 qwen3-max(256k,旧版),请制定明确的迁移计划。qwen3.8-max 是当前的顶级模型。
  • 关注开源权重:一旦发布,评估自托管 qwen3.8-max 是否适合作为多提供商路由架构中的 fallback 通道。

本文涉及的模型

帮助与联系