Qwen3 发布 32B 稠密开源权重模型,支持混合思考模式
阿里 Qwen3 发布包含 Qwen3-32B、另外五个稠密模型和两个 MoE 模型,重点强调混合 thinking/non-thinking、工具调用与多语言覆盖。
Qwen3 dense 32B model. Excellent reasoning and coding at moderate size with thinking mode support.
Qwen3 32B 是阿里 Qwen 的 32.8B 参数稠密开源权重推理模型。它位于较小的 Qwen3 稠密模型与更大的 Qwen3 MoE 旗舰之间:仍适合可控部署,同时足以承担严肃的编程、数学、多语言对话与工具调用智能体负载。
TheRouter 通过 qwen/qwen3-32b 提供 OpenAI 兼容 Chat Completions,支持 131K 上下文路由、工具调用、JSON mode 与 reasoning 参数。当你需要一个可在快速非思考回答和更深思考模式之间切换的通用 Qwen 模型、但不想上更大旗舰模型时,选它。
| 类型 | 费率 |
|---|---|
| 输入 | $0.1728 每百万 Tokens |
| 输出 | $0.6912 每百万 Tokens |
| 架构 | 稠密因果语言模型(每个 token 激活全部 32.8B 参数)huggingface.co ↗ | 已核实 |
| 参数规模 | 32.8B 总参数(31.2B 非嵌入参数)huggingface.co ↗ | 已核实 |
| 层数 | 64 个 Transformer 层huggingface.co ↗ | 已核实 |
| 注意力头(GQA) | 64 个 Query 头 / 8 个 KV 头(GQA)huggingface.co ↗ | 已核实 |
| 原生上下文窗口 | 32,768 tokens(原生);YaRN 位置插值扩展至 131,072 tokenshuggingface.co ↗ | 已核实 |
| 思考模式 | 混合模式:单一检查点同时支持思考(<think> 块中的链式推理)和非思考模式;通过 enable_thinking 标志或 /think / /no_think token 切换huggingface.co ↗ | 已核实 |
| 语言支持 | 119 种语言和方言(印欧语系、汉藏语系、亚非语系、南岛语系、达罗毗荼语系、突厥语系、壮侗语系、乌拉尔语系等)qwenlm.github.io ↗ | 已核实 |
| 许可证 | Apache 2.0huggingface.co ↗ | 已核实 |
| 预训练数据 | 约 36 万亿 tokens,覆盖 119 种语言(约为 Qwen2.5 的 18T 的 2 倍);包含网页、PDF 提取及合成数学/代码数据qwenlm.github.io ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
AIME 2024 思考模式;来自 Qwen3 官方博客中 Qwen3-32B 评测表。 | 85.7%% | qwenlm.github.io ↗ | |
MATH-500 思考模式;来自 Qwen3 官方博客评测表。 | 95.5%% | qwenlm.github.io ↗ | |
LiveCodeBench 思考模式;来自 Qwen3 官方博客评测表。 | 65.9%% | qwenlm.github.io ↗ | |
BFCL (Berkeley Function-Calling Leaderboard) 工具调用基准;非思考模式;来自 Qwen3 官方博客。 | 70.8%% | qwenlm.github.io ↗ | |
MMLU-Pro 非思考模式;来自 Qwen3 官方博客评测表。 | 74.9%% | qwenlm.github.io ↗ | |
C-Eval 中文综合评测;来自 Qwen3 官方博客。 | 91.8%% | qwenlm.github.io ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "qwen/qwen3-32b",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'标准 OpenAI 兼容 Chat Completions。省略 reasoning 参数使用非思考(快速)模式;设置 reasoning: {} 或预算以启用思考模式。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen/qwen3-32b",
"messages": [
{"role": "user", "content": "Explain the tradeoffs between dense and MoE architectures for inference."}
],
"temperature": 0.7,
"max_tokens": 2048
}'阿里 Qwen3 发布包含 Qwen3-32B、另外五个稠密模型和两个 MoE 模型,重点强调混合 thinking/non-thinking、工具调用与多语言覆盖。
把它作为均衡的通用推理模型使用:编程辅助、数学分析、多语言支持、JSON/工具流程,以及 32B 稠密模型已经够用、上更大旗舰会浪费毛利的中等风险智能体。
支持。Qwen3 发布时就包含 thinking 与 non-thinking 混合模式。在 TheRouter 上,通过 OpenAI 兼容端点调用 qwen/qwen3-32b,需要更深推理行为时传入 reasoning 参数。
官方模型卡列出原生 32,768 tokens,并可通过 YaRN 扩展到 131,072 tokens。TheRouter 目录将 qwen/qwen3-32b 的路由上下文长度标为 131K tokens。
Qwen 将 Qwen3-32B 描述为 Apache 2.0 许可下发布的开源权重稠密模型。许可证代表源码/权重层面的权限;生产 API 使用仍取决于你选择的 provider route 与 TheRouter 计费路径。
当任务混合代码、通用推理、数学、多语言产品上下文或工具调用时,用 qwen/qwen3-32b。当工作负载主要是代码生成、补全、测试和更低延迟的编程吞吐时,用 qwen/qwen3-coder-30b。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 架构 | huggingface.co ↗ | 2026-06-08 | 已核实 |
| 参数规模 | huggingface.co ↗ | 2026-06-08 | 已核实 |
| 层数 | huggingface.co ↗ | 2026-06-08 | 已核实 |
| 注意力头(GQA) | huggingface.co ↗ | 2026-06-08 | 已核实 |
| 原生上下文窗口 | huggingface.co ↗ | 2026-06-08 | 已核实 |
| 思考模式 | huggingface.co ↗ | 2026-06-08 | 已核实 |
| 语言支持 | qwenlm.github.io ↗ | 2026-06-08 | 已核实 |
| 许可证 | huggingface.co ↗ | 2026-06-08 | 已核实 |
| 预训练数据 | qwenlm.github.io ↗ | 2026-06-08 | 已核实 |
| AIME 2024 | qwenlm.github.io ↗ | 2026-06-08 | 已核实 |
| MATH-500 | qwenlm.github.io ↗ | 2026-06-08 | 已核实 |
| LiveCodeBench | qwenlm.github.io ↗ | 2026-06-08 | 已核实 |
| BFCL (Berkeley Function-Calling Leaderboard) | qwenlm.github.io ↗ | 2026-06-08 | 已核实 |
| MMLU-Pro | qwenlm.github.io ↗ | 2026-06-08 | 已核实 |
| C-Eval | qwenlm.github.io ↗ | 2026-06-08 | 已核实 |
| Qwen3 发布 32B 稠密开源权重模型,支持混合思考模式 | Qwen3 announcement ↗ | 2026-06-08 | 已核实 |