全部文章

Qwen3.8-Max API 完全指南:DashScope 2.4T 旗舰模型,原生视觉理解

Qwen3.8-Max 实战指南 — 阿里巴巴 2.4 万亿参数 MoE 旗舰模型。涵盖 API 接入、定价、思考模式、视觉输入、性能基准测试,以及如何通过 OpenAI 兼容网关路由。

· TheRouter

Qwen3.8-Max 是阿里巴巴于 2026 年 8 月 3 日发布的新一代旗舰模型,采用 2.4 万亿参数的稀疏混合专家(MoE)架构,支持文本、图像和视频输入,输出文本。它拥有 100 万 token 上下文窗口、原生思考模式,并提供 OpenAI 兼容 API — 只需修改两行代码即可在任何 OpenAI SDK 客户端中接入。

我们撰写本指南,是因为 Qwen3.8-Max 在编码、智能体和多模态基准测试中相比 Qwen3.7 系列有显著提升。如果你正在评估国内大模型 API 或寻找高性价比的前沿模型,Qwen3.8-Max 值得测试。

Qwen3.8-Max 概览

规格
参数量2.4 万亿(稀疏 MoE)
模态文本 + 图像 + 视频 → 文本
上下文窗口1,000,000 tokens
最大输入991,232 tokens(思考模式下 983,040)
最大输出131,072 tokens
最大推理预算262,144 tokens
速率限制2M TPM, 15K RPM
思考模式支持(思考 + 非思考)
上下文缓存支持(隐式 + 显式)
Batch 调用支持(5 折)
函数调用支持
结构化输出支持
API 兼容性OpenAI 兼容、Anthropic 兼容、DashScope 原生
模型 IDqwen3.8-max

来源: 阿里云百炼模型定价Qwen3.8-Max 博客MarkTechPost 报道。检索于 2026-08-03。

3 分钟快速入门

第一步:获取 DashScope API 密钥

阿里云百炼控制台注册账号,在侧边栏的 API Keys 页面生成新密钥。国际用户可通过 Alibaba Cloud International 注册并访问 Model Studio。

第二步:安装 OpenAI SDK

pip install openai

第三步:发送第一个请求

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completionsmessagesmodel, 并返回 OpenAI 形式的流式响应。

from openai import OpenAI

client = OpenAI(
    api_key="sk-your-dashscope-api-key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "user", "content": "用两段话解释 MoE 和密集 Transformer 架构的区别。"}
    ],
)

print(response.choices[0].message.content)

就这么简单。DashScope 端点兼容 OpenAI 协议,任何支持 OpenAI chat completions 协议的工具 — Cursor、Claude Code 自定义端点、LiteLLM 或你自己的 SDK 封装 — 都可以直接使用。

来源: 阿里云 OpenAI 兼容文档。检索于 2026-08-03。

思考模式(深度推理)

Qwen3.8-Max 同时支持思考和非思考模式。在思考模式下,模型会先生成内部思维链,再输出最终答案,类似 OpenAI 的 o 系列或 Claude 的 extended thinking。

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "user", "content": "证明根号 2 是无理数。"}
    ],
    extra_body={"enable_thinking": True},
    stream=True,
)

for chunk in response:
    delta = chunk.choices[0].delta
    # 思考内容在 delta.reasoning_content 中
    # 最终答案在 delta.content 中
    if hasattr(delta, "reasoning_content") and delta.reasoning_content:
        print(f"[思考] {delta.reasoning_content}", end="")
    if delta.content:
        print(delta.content, end="")

关键细节:

  • 思考模式使用独立的推理预算,上限为 262,144 tokens
  • 思维链 token 和答案 token 均计入输出计费
  • 启用思考时,最大输入降低至 983,040 tokens(非思考模式为 991,232)
  • 可通过 thinking_budget 参数控制推理长度

来源: DashScope 文本生成文档。检索于 2026-08-03。

视觉和视频输入

Qwen3.8-Max 原生接受图像和视频帧输入。不同于 Qwen3.7-Max(纯文本),你无需切换到单独的模型即可处理多模态任务。

图像输入

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "描述这张架构图中的内容。"},
                {"type": "image_url", "image_url": {"url": "https://example.com/arch-diagram.png"}},
            ],
        }
    ],
)

视频输入

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "总结这段视频中发生了什么。"},
                {"type": "video_url", "video_url": {"url": "https://example.com/demo.mp4"}},
            ],
        }
    ],
)

这是相比 Qwen3.7 系列的重要升级。在 Qwen3.7 中,你需要 Qwen3.7-Plus 处理视觉任务,Qwen3.7-Max 处理推理任务。Qwen3.8-Max 将两者统一在同一个模型 ID 中。

定价对比

模型输入(每百万 token)输出(每百万 token)上下文窗口
Qwen3.8-Max¥12(~$1.65)¥36(~$4.95)1M
Qwen3.7-Max¥12(限时 5 折:¥6)¥36(限时 5 折:¥18)1M
Qwen3.7-Plus¥2(限时 8 折:¥1.60)¥8(限时 8 折:¥6.40)1M
Qwen3-Max¥2.50–¥7(阶梯计费)¥10–¥28(阶梯计费)256K
Claude Opus 4.8$15$75200K

以上价格为中国大陆(华北 2 北京)区域。国际区域(新加坡、美国弗吉尼亚、法兰克福、东京)价格不同。Qwen3.7-Max 目前享受限时 5 折优惠;Qwen3.8-Max 以标准价格发布,尚未公布入门优惠。

国际平台定价:$2.00/百万输入 token$6.00/百万输出 token。隐式缓存读取 $0.25/百万,显式缓存创建 $2.50/百万,显式缓存读取 $0.17/百万。

来源: 阿里云百炼模型定价QwenCloud 模型页面。检索于 2026-08-03。

性能对比:Qwen3.8-Max vs Qwen3.7-Max

以下基准测试数据来自阿里巴巴官方发布公告。截至撰写时,尚无独立第三方评估。

基准测试Qwen3.8-MaxQwen3.7-Max差值
Terminal-Bench 2.186.6
SWE-bench Pro67.7
FrontierSWE73.540.7+32.8
DeepSWE 1.156.621.6+35.0
JobBench53.431.3+22.1
PaperBench93.0
GPQA Diamond92.692.4+0.2
IFBench82.8
OSWorld-Verified86.1
OmniDocBench 1.592.1

注意事项:

  • 所有基准测试数据均为厂商自报。截至撰写时,尚无独立评测发布。
  • 官方博客中的多模态基准对比对象是 Qwen3.7-Plus(而非 Qwen3.7-Max),这使代际差距看起来更大。
  • 激活参数量尚未公布 — 仅公布了总参数量(2.4 万亿)。

来源: Qwen3.8-Max 博客MarkTechPost 报道。检索于 2026-08-03。

模型 ID 与版本管理

DashScope 目前列出 Qwen3.8-Max 的一个模型 ID:

  • qwen3.8-max — 指向最新稳定版本的滚动别名

与 Qwen3.7 系列(拥有 qwen3.7-max-2026-05-20qwen3.7-max-2026-06-08 等日期快照)不同,Qwen3.8-Max 尚未发布日期快照。这意味着滚动别名是目前唯一选择。如果版本固定对你的生产环境很重要,请关注 DashScope 的新模型发布页面获取快照公告。

关于跨提供商的模型版本管理最佳实践,请参阅我们的 LLM API 模型版本与别名指南

常见错误与解决方案

错误原因解决方案
InvalidParameter: model not found模型 ID 错误或区域不对使用 qwen3.8-max(注意大小写)。确认 API 密钥所属区域已部署该模型(北京、新加坡、美国弗吉尼亚、法兰克福、东京)。
429 Too Many Requests超过速率限制DashScope 允许 2M TPM 和 15K RPM。使用指数退避重试。参阅我们的错误处理参考
context_length_exceeded输入超过 991K tokens(思考模式下 983K)截断或摘要输入。考虑对重复前缀使用上下文缓存。
流式输出中不显示思考 token未启用思考模式传入 extra_body={"enable_thinking": True}。推理内容在 delta.reasoning_content 中返回,而非 delta.content
视觉请求返回纯文本错误图片 URL 不可访问确保图片 URL 公开可访问。DashScope 在服务端获取图片。也支持 Base64 编码。

来源: DashScope 错误码。检索于 2026-08-03。

生产环境清单

在将 Qwen3.8-Max 部署到生产环境前,请确认:

  • API 密钥轮换 — 将密钥存储在密钥管理器中,而非代码中。参阅我们的 API 密钥管理指南
  • 版本固定策略 — 决定是跟踪滚动 qwen3.8-max 别名还是等待日期快照。滚动别名可能在无通知的情况下改变行为。
  • 回退链 — 设置到 Qwen3.7-Max 或其他提供商的回退。参阅我们的回退路由指南
  • 成本监控 — 按模型跟踪 token 用量。思考模式每次请求可生成高达 262K 推理 token,全部计入输出计费。
  • 速率限制余量 — 2M TPM 和 15K RPM 较为宽裕,但批处理任务可能触及上限。按照我们的超时和重试指南实现退避重试。
  • 上下文缓存 — 对于前缀稳定的任务(系统提示、few-shot 示例),启用隐式或显式上下文缓存,可降低最多 90% 的输入成本。
  • 单独测试多模态 — 如果你从纯文本模型(Qwen3.7-Max)迁移,请验证 prompt 模板不会意外发送新模型会以不同方式解释的 image_url 内容。

TheRouter 集成

TheRouter 通过配置的 provider 路由 OpenAI 兼容请求,包括 DashScope。如果你的部署使用 TheRouter 进行 provider 路由和回退,可以将 Qwen3.8-Max 添加为 DashScope provider 上的模型目标:

  1. 将 DashScope 配置为 provider,填入 API 密钥和 https://dashscope.aliyuncs.com/compatible-mode/v1 base URL
  2. 添加 qwen3.8-max 作为指向 DashScope provider 的模型条目
  3. 可选设置回退链:qwen3.8-max → qwen3.7-max → qwen3.7-plus

由于 DashScope 和 TheRouter 都使用 OpenAI 协议,你的应用代码无需修改 — 只需更改路由配置。设置详情请参阅我们的阿里云百炼 API 指南OpenAI 兼容 API 提供商

注意: 截至撰写时,Qwen3.8-Max 尚未加入 TheRouter 的 models-data.ts。请查看 DashScope provider 页面获取最新支持模型列表。

相关资源

客服支持