Qwen3.8 开源版(2.4T-A95B)vs Qwen3.8-Max:开源权重对 API 路由的影响
阿里巴巴于 2026 年 8 月 12 日发布了开源权重版本 Qwen3.8-2.4T-A95B,与闭源的 Qwen3.8-Max 共享同一套 2.4 万亿参数 MoE 架构。本文对比两个版本的能力差异、定价,以及如何通过 OpenAI 兼容网关在它们之间做路由。
2026 年 8 月 3 日,阿里巴巴以闭源 API 的形式上线了 Qwen3.8-Max。九天后的 8 月 12 日,团队在 Hugging Face 和 ModelScope 上放出了开源权重版本 Qwen3.8-2.4T-A95B。两个模型共享同一套 2.4 万亿参数的稀疏混合专家(MoE)架构,每次前向传播激活 950 亿参数。
它们并不是同一个产品。开源版只支持纯文本输入,闭源 Max 保留了原生的图像和视频理解能力、结构化输出、内置工具,以及阿里巴巴自有的对齐训练。价格差距同样显著,第三方推理服务商部署开源权重版的价格只有 DashScope Max 的零头。
下面从架构差异、定价、适用场景和路由配置四个方面做一个对比。
架构:同一套骨架,不同的能力层
Qwen3.8-2.4T-A95B 和 Qwen3.8-Max 都是 2.4T 参数的 MoE 模型,每个 token 激活 95B 参数,上下文窗口都是 1M token,都支持思考模式(扩展推理链)。
开源版是纯文本生成模型,不包含视觉编码器,无法处理图像或视频输入。闭源 Max 保留了完整的多模态输入能力。
闭源 Max 还依赖阿里巴巴的服务端基础设施提供一系列附加功能,包括函数调用、结构化输出(JSON 模式)、批处理、前缀补全,以及 Responses API 上的五个内置工具(code_interpreter、web_search、web_extractor、t2i_search、i2i_search)。开源版本身不提供这些功能,但 vLLM 等推理框架可以在上层实现函数调用和 JSON 模式。
| 特性 | Qwen3.8-2.4T-A95B(开源) | Qwen3.8-Max(闭源) |
|---|---|---|
| 总参数量 | 2.4T | 2.4T |
| 激活参数量 | 95B | 95B |
| 上下文窗口 | 1M tokens | 1M tokens |
| 输入模态 | 纯文本 | 文本、图像、视频 |
| 思考模式 | 支持 | 支持 |
| 函数调用 | 取决于推理框架 | 原生支持 |
| 结构化输出 | 取决于推理框架 | 原生支持(JSON 模式) |
| 批处理 API | 不支持 | 支持 |
| 内置工具 | 无 | Responses API 上 5 个工具 |
| 许可证 | Apache 2.0 | 闭源(仅 API 访问) |
| 权重可下载 | 是(HuggingFace、ModelScope) | 否 |
来源 Qwen 博客、ModelScope 模型卡片、MarktechPost。检索时间 2026-08-20。
定价:差距非常大
DashScope(华北2 北京区域)上的 Qwen3.8-Max 定价为每百万输入 token 12 元人民币,每百万输出 token 36 元人民币,折合大约 $2.00 和 $6.00。缓存命中的输入降至 $0.25/M。全 1M 上下文窗口统一定价,没有阶梯。
开源权重版 Qwen3.8-2.4T-A95B 通过第三方推理服务商提供,价格低得多。SiliconFlow 标价 $0.14/M 输入 token,比 Max 的 DashScope 价格低了 93%。OpenRouter 也托管了这个开源版本。
一个容易被忽略的细节是,DashScope 本身也上线了 qwen3.8-2.4t-a95b 这个模型 ID,但定价与 Max 完全相同,都是 12/36 元。想要拿到成本优势,必须走第三方服务商。
| 服务商 | 模型 | 输入(/M tokens) | 输出(/M tokens) |
|---|---|---|---|
| DashScope | qwen3.8-max | $2.00 | $6.00 |
| DashScope | qwen3.8-2.4t-a95b | $2.00 | $6.00 |
| SiliconFlow | Qwen3.8-2.4T-A95B | $0.14 | 浮动 |
| OpenRouter | qwen/qwen3.8-2.4t-a95b | 浮动 | 浮动 |
来源 DashScope 定价页、SiliconFlow 公告。检索时间 2026-08-20。
跨供应商比较 API 价格时,统一到美元每百万 token口径,并区分输入与输出。多数供应商的输出 token 价是输入的 2–5 倍,所以"补全长度大" 的负载与"检索为主"的负载在同样的标称单价下成本会差很多。
- 统一货币(USD)——发表日按汇率折算并标注。
- 区分输入/输出——永远不要给单一"混合价"。
- 每行引到供应商自己的价格页 + 抓取日期。
- 注明长上下文阶梯价——长上下文常常单独跳一档。
什么场景该用哪个
选择取决于两个核心问题,工作流是否涉及图像或视频,以及是否需要闭源平台的原生工具链。
选 Qwen3.8-Max 的场景
- 工作流包含图像或视频输入,比如文档 OCR、截图分析、视频内容索引
- 需要原生函数调用、结构化输出或批处理,不想在推理框架层额外实现
- 需要内置工具(code_interpreter、web_search),不想自己管理
- DashScope 的上下文缓存($0.25/M)配合大量 prompt 复用,让 Max 的实际成本足够有竞争力
选 Qwen3.8-2.4T-A95B(开源权重)的场景
- 工作流是纯文本,比如编程 agent、研究综述、文档生成
- 追求最低的单 token 成本,可以通过 SiliconFlow 调用或自托管
- 需要数据不出本地基础设施(合规要求、隔离网络)
- 需要对模型做领域微调
在两者之间做路由的场景
- 大部分流量是纯文本(走 SiliconFlow 省钱),少量请求包含图像(走 DashScope Max)
- 需要一条降级链路,先尝试便宜的开源端点,挂了再回退到 Max
OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。
路由配置
两个模型都遵循 OpenAI Chat Completions 协议。如果你在用 OpenAI 兼容网关,路由切换只需要改模型 ID 和 base URL。
# 纯文本请求 → 路由到 SiliconFlow(开源权重,更便宜)
from openai import OpenAI
client = OpenAI(
base_url="https://api.siliconflow.cn/v1",
api_key="YOUR_SILICONFLOW_KEY",
)
response = client.chat.completions.create(
model="Qwen/Qwen3.8-2.4T-A95B",
messages=[{"role": "user", "content": "把这段函数重构成 async/await 写法。"}],
)
# 视觉请求 → 路由到 DashScope(闭源 Max,多模态)
client = OpenAI(
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
api_key="YOUR_DASHSCOPE_KEY",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "描述这张截图里的内容。"},
{"type": "image_url", "image_url": {"url": "https://example.com/screenshot.png"}},
],
}],
)
OpenAI 兼容路由层可以检查请求内容的类型,纯文本发往更便宜的开源端点,多模态请求发往 DashScope Max。
基准测试:开源版和闭源版差多少
阿里巴巴发布了 Qwen3.8-Max 的完整基准测试表,但没有单独发布开源权重版的评测分数。ModelScope 上的模型卡片确认了相同的架构(2.4T 总参数、95B 激活),但不含评估成绩。
第三方评测机构 BenchLM 给 Qwen3.8-Max 打了 79.9/100 分,在 221 个模型中排名第六。关键分数包括 Terminal-Bench 2.1 得分 86.6(低于 GPT-5.6 Sol 的 88.8,高于 Claude Opus 4.8 的 84.6),GPQA Diamond 92.6,PaperBench 93.0。
对于开源版,合理的预期是在纯文本基准测试上与 Max 接近,因为架构和参数规模完全相同。差距会出现在需要视觉输入的评测上,因为开源版无法处理图像。
截至 2026 年 8 月 20 日,专门针对 Qwen3.8-2.4T-A95B 的独立基准测试仍在陆续出炉中。
来源 BenchLM、Qwen 博客、MarktechPost。检索时间 2026-08-20。
自托管的现实考量
开源版本采用 Apache 2.0 许可证,可以从 Hugging Face 或 ModelScope 下载后部署在自有基础设施上。
实际挑战在于规模。2.4T 总参数的模型,即便 MoE 的稀疏性只激活 95B 参数,对显存的需求也很大。一台配备 8 张 H100(每张 80GB,共 640GB)的单机,在 vLLM 等框架的内存开销下未必能放得下。生产环境的自托管,多节点部署是更现实的路线。
如果团队希望在本地推理但投入不了多节点集群,Qwen3.8-27B 密集模型(8 月 19 日发布,同样 Apache 2.0)可以在单张 80GB GPU 上运行,提供 Qwen3.8 代的能力,只是规模小得多。
对大多数团队来说,务实的自托管路径是把 2.4T 开源版交给 SiliconFlow 的托管推理来跑,把 27B 密集版部署在本地应对延迟敏感或隔离网络的场景。
总结
| 维度 | 开源权重(2.4T-A95B) | 闭源(Max) |
|---|---|---|
| 最低文本价格 | 约 $0.14/M 输入(SiliconFlow) | $2.00/M 输入(DashScope) |
| 视觉支持 | 无 | 有 |
| 工具链 | 取决于推理框架 | 原生支持 |
| 可自托管 | 是(Apache 2.0) | 否 |
| 路由定位 | 纯文本高吞吐场景的默认选择 | 多模态和依赖原生工具链的场景 |
开源权重让 Qwen3.8 从单一厂商的 API 变成了多服务商可供的通用模型。纯文本工作负载通过 SiliconFlow 调用 $0.14/M,对比 DashScope 的 $2.00/M,同一套架构上省了 93% 的成本。涉及图像或视频的任何任务,Qwen3.8 家族里目前只有闭源 Max 能做。
在两者之间配好路由,是大多数团队的务实解法。
本文引用来源
- Qwen3.8-Max 发布公告 - Qwen 博客(检索时间 2026-08-20)
- DashScope 模型定价 - 阿里云(检索时间 2026-08-20)
- Qwen3.8-2.4T-A95B 模型卡片 - ModelScope(检索时间 2026-08-20)
- SiliconFlow 定价公告 - X/Twitter(检索时间 2026-08-20)
- Qwen3.8-Max 基准测试 - BenchLM(检索时间 2026-08-20)
- MarktechPost Qwen3.8-Max 报道(检索时间 2026-08-20)
- Qwen API 定价分析 - Spheron(检索时间 2026-08-20)
- SiliconFlow 定价页(检索时间 2026-08-20)