返回模型列表

Qwen3 32B

qwenqwen/qwen3-32b

Qwen3 dense 32B model. Excellent reasoning and coding at moderate size with thinking mode support.

Qwen3 32B 是阿里 Qwen 的 32.8B 参数稠密开源权重推理模型。它位于较小的 Qwen3 稠密模型与更大的 Qwen3 MoE 旗舰之间:仍适合可控部署,同时足以承担严肃的编程、数学、多语言对话与工具调用智能体负载。

TheRouter 通过 qwen/qwen3-32b 提供 OpenAI 兼容 Chat Completions,支持 131K 上下文路由、工具调用、JSON mode 与 reasoning 参数。当你需要一个可在快速非思考回答和更深思考模式之间切换的通用 Qwen 模型、但不想上更大旗舰模型时,选它。

适合使用
  • • 需要工具调用、JSON 响应,并希望比 8B/14B 小模型更强的成本可控推理与编程智能体
  • • 看重 Qwen3 100+ 语言覆盖的多语言产品支持、翻译与分析
  • • 更看重 131K 路由上下文、而不是前沿模型质量的长上下文总结与文档流程
不适合使用
  • • 最高风险的自主代码库修改——当失败成本占主导时,路由到 qwen/qwen3-coder-480b 或前沿代码模型
  • • 视觉或多模态输入——改用 qwen/qwen3-vl-plus 或其他视觉模型
  • • 极低延迟补全——当 p95 延迟是瓶颈时,使用 qwen/qwen3-coder-30b 或更小的非推理模型
上下文长度
131K
最大输出
33K
输入价格每百万 tokens
$0.1728每百万 Tokens
输出价格每百万 tokens
$0.6912每百万 Tokens

模态能力

文本→文本

价格明细

类型费率
输入$0.1728 每百万 Tokens
输出$0.6912 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatreasoningstop

模型规格

架构稠密因果语言模型(每个 token 激活全部 32.8B 参数)huggingface.co ↗已核实
参数规模32.8B 总参数(31.2B 非嵌入参数)huggingface.co ↗已核实
层数64 个 Transformer 层huggingface.co ↗已核实
注意力头(GQA)64 个 Query 头 / 8 个 KV 头(GQA)huggingface.co ↗已核实
原生上下文窗口32,768 tokens(原生);YaRN 位置插值扩展至 131,072 tokenshuggingface.co ↗已核实
思考模式混合模式:单一检查点同时支持思考(<think> 块中的链式推理)和非思考模式;通过 enable_thinking 标志或 /think / /no_think token 切换huggingface.co ↗已核实
语言支持119 种语言和方言(印欧语系、汉藏语系、亚非语系、南岛语系、达罗毗荼语系、突厥语系、壮侗语系、乌拉尔语系等)qwenlm.github.io ↗已核实
许可证Apache 2.0huggingface.co ↗已核实
预训练数据约 36 万亿 tokens,覆盖 119 种语言(约为 Qwen2.5 的 18T 的 2 倍);包含网页、PDF 提取及合成数学/代码数据qwenlm.github.io ↗已核实

基准成绩

BenchmarkDistributionScoreSource
AIME 2024
思考模式;来自 Qwen3 官方博客中 Qwen3-32B 评测表。
85.7%%qwenlm.github.io ↗
MATH-500
思考模式;来自 Qwen3 官方博客评测表。
95.5%%qwenlm.github.io ↗
LiveCodeBench
思考模式;来自 Qwen3 官方博客评测表。
65.9%%qwenlm.github.io ↗
BFCL (Berkeley Function-Calling Leaderboard)
工具调用基准;非思考模式;来自 Qwen3 官方博客。
70.8%%qwenlm.github.io ↗
MMLU-Pro
非思考模式;来自 Qwen3 官方博客评测表。
74.9%%qwenlm.github.io ↗
C-Eval
中文综合评测;来自 Qwen3 官方博客。
91.8%%qwenlm.github.io ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "qwen/qwen3-32b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

Chat 调用

标准 OpenAI 兼容 Chat Completions。省略 reasoning 参数使用非思考(快速)模式;设置 reasoning: {} 或预算以启用思考模式。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/qwen3-32b",
    "messages": [
      {"role": "user", "content": "Explain the tradeoffs between dense and MoE architectures for inference."}
    ],
    "temperature": 0.7,
    "max_tokens": 2048
  }'

qwen 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-04-29

Qwen3 发布 32B 稠密开源权重模型,支持混合思考模式

阿里 Qwen3 发布包含 Qwen3-32B、另外五个稠密模型和两个 MoE 模型,重点强调混合 thinking/non-thinking、工具调用与多语言覆盖。

TheRouter 编辑重写Qwen3 announcement ↗

常见问题

qwen/qwen3-32b 在 TheRouter 上最适合什么?

把它作为均衡的通用推理模型使用:编程辅助、数学分析、多语言支持、JSON/工具流程,以及 32B 稠密模型已经够用、上更大旗舰会浪费毛利的中等风险智能体。

Qwen3 32B 支持 thinking mode 吗?

支持。Qwen3 发布时就包含 thinking 与 non-thinking 混合模式。在 TheRouter 上,通过 OpenAI 兼容端点调用 qwen/qwen3-32b,需要更深推理行为时传入 reasoning 参数。

Qwen3 32B 的上下文窗口多长?

官方模型卡列出原生 32,768 tokens,并可通过 YaRN 扩展到 131,072 tokens。TheRouter 目录将 qwen/qwen3-32b 的路由上下文长度标为 131K tokens。

Qwen3 32B 是开源的吗?

Qwen 将 Qwen3-32B 描述为 Apache 2.0 许可下发布的开源权重稠密模型。许可证代表源码/权重层面的权限;生产 API 使用仍取决于你选择的 provider route 与 TheRouter 计费路径。

编程应该用 qwen/qwen3-32b 还是 qwen/qwen3-coder-30b?

当任务混合代码、通用推理、数学、多语言产品上下文或工具调用时,用 qwen/qwen3-32b。当工作负载主要是代码生成、补全、测试和更低延迟的编程吞吐时,用 qwen/qwen3-coder-30b。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
架构huggingface.co ↗2026-06-08已核实
参数规模huggingface.co ↗2026-06-08已核实
层数huggingface.co ↗2026-06-08已核实
注意力头(GQA)huggingface.co ↗2026-06-08已核实
原生上下文窗口huggingface.co ↗2026-06-08已核实
思考模式huggingface.co ↗2026-06-08已核实
语言支持qwenlm.github.io ↗2026-06-08已核实
许可证huggingface.co ↗2026-06-08已核实
预训练数据qwenlm.github.io ↗2026-06-08已核实
AIME 2024qwenlm.github.io ↗2026-06-08已核实
MATH-500qwenlm.github.io ↗2026-06-08已核实
LiveCodeBenchqwenlm.github.io ↗2026-06-08已核实
BFCL (Berkeley Function-Calling Leaderboard)qwenlm.github.io ↗2026-06-08已核实
MMLU-Proqwenlm.github.io ↗2026-06-08已核实
C-Evalqwenlm.github.io ↗2026-06-08已核实
Qwen3 发布 32B 稠密开源权重模型,支持混合思考模式Qwen3 announcement ↗2026-06-08已核实
帮助与联系