Qwen3 技术报告发布于 arXiv(2505.09388)
Qwen 团队发布了完整技术报告,涵盖 Qwen3 系列的预训练方法(36T token,3 阶段)、混合思考架构、后训练流程,以及全面基准测试结果,显示 Qwen3-235B-A22B 在思考模式下达到 AIME'24 85.7、AIME'25 81.5、LiveCodeBench v5 70.7 和 BFCL v3 70.8。
Alibaba's flagship Qwen3 model (235B total, 22B active, 128 experts, 8 active per token MoE). Dual thinking/non-thinking mode, strong reasoning, tools, and 100+ language support.
Qwen3-235B-A22B 是阿里 Qwen 于 2025 年 4 月 28 日发布的 Qwen3 系列开源旗舰模型。它采用混合专家(MoE)架构,总参数量 2350 亿,每次前向推理激活 220 亿——在约 22B 稠密模型的推理成本下提供前沿大模型的推理深度。架构包含 94 层 Transformer、128 个专家(每次激活 8 个)、GQA 注意力(64Q/4KV),并在约 36 万亿 token 上进行了预训练,涵盖 119 种语言和方言。一项关键架构创新是统一混合思考系统:单一模型通过 enable_thinking 标志或 /think / /no_think 用户轮次前缀,在思考模式(逐步推理链)和非思考模式(直接低延迟响应)之间无缝切换。
对 TheRouter 用户而言,当质量上限最为重要时,Qwen3-235B 是首选:前沿级数学和编程推理、复杂 agentic 工作流,以及涵盖 119 种语言的多语言任务。它在关键基准上与 DeepSeek-R1、o1 和 Gemini-2.5-Pro 持平或超越——尤其在 AIME'24 上达到 85.7,AIME'25 上达到 81.5,LiveCodeBench v5 上达到 70.7。由于每次推理步骤仅激活 220 亿参数,在此质量水平下,其成本效率远高于同等规模的稠密模型。非思考模式提供类 Qwen2.5-Instruct 的速度和简洁性;思考模式为难题增加深度推理,无需独立模型。
| 类型 | 费率 |
|---|---|
| 输入 | $0.756 每百万 Tokens |
| 输出 | $3.02 每百万 Tokens |
| 发布日期 | 2025-04-28qwenlm.github.io ↗ | 已核实 |
| 架构 | 混合专家(MoE);总参数 2350 亿,每 token 激活 220 亿;94 层;128 专家 / 8 激活;GQA(64Q / 4KV 头)huggingface.co ↗ | 已核实 |
| 原生上下文长度 | 原生 32,768 token;通过 YaRN 可扩展至 131,072 tokenhuggingface.co ↗ | 已核实 |
| 思考模式 | 混合:思考模式(思维链,enable_thinking=True)和非思考模式(enable_thinking=False);可通过 /think 和 /no_think 前缀逐轮切换huggingface.co ↗ | 已核实 |
| 预训练数据 | 约 36 万亿 token;119 种语言和方言;包含来自 Qwen2.5-Math 和 Qwen2.5-Coder 的合成数学/代码数据qwenlm.github.io ↗ | 已核实 |
| 多语言支持 | 119 种语言和方言qwenlm.github.io ↗ | 已核实 |
| 许可 | Apache 2.0qwenlm.github.io ↗ | 已核实 |
| 训练数据截止 | 基础版本未公开披露;-2507 变体的知识截止日期为 2025 年 7 月www.mindstudio.ai ↗ | 待核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
AIME 2024 思考模式 | 85.7% | arxiv.org ↗ | |
AIME 2025 思考模式 | 81.5% | arxiv.org ↗ | |
LiveCodeBench v5 思考模式 | 70.7% | arxiv.org ↗ | |
CodeForces 思考模式 | 2056rating | arxiv.org ↗ | |
BFCL v3 | 70.8% | arxiv.org ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "qwen/qwen3-235b",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen/qwen3-235b",
"messages": [
{"role": "user", "content": "/no_think Summarise the key changes in this diff: ..."}
]
}'Qwen 团队发布了完整技术报告,涵盖 Qwen3 系列的预训练方法(36T token,3 阶段)、混合思考架构、后训练流程,以及全面基准测试结果,显示 Qwen3-235B-A22B 在思考模式下达到 AIME'24 85.7、AIME'25 81.5、LiveCodeBench v5 70.7 和 BFCL v3 70.8。
阿里 Qwen 以 Apache 2.0 协议在 Hugging Face、ModelScope 和 Kaggle 上发布了 Qwen3-235B-A22B 和完整的 Qwen3 系列,使最大的开源混合思考 MoE 模型公开可用。此次发布包含预训练基础版和后训练指令版,以及从 0.6B 到 32B 的六个稠密模型和较小的 Qwen3-30B-A3B MoE。
思考模式(/think 前缀或 enable_thinking=True)使模型在最终答案前在 <think>...</think> 标签内生成完整的思维链推理轨迹。这在困难数学、编程和多步推理上显著提升准确率,代价是更高的 token 数量、延迟和成本。非思考模式(/no_think 前缀)产生直接简洁的答案——更快更便宜,适合对话、创意和简单任务类型。可以在同一对话中逐轮切换模式。
在思考模式下,Qwen3-235B-A22B 在数学和编程基准上达到与 DeepSeek-R1 和 o1 相当或更好的成绩(AIME'24 85.7,AIME'25 81.5,LiveCodeBench v5 70.7)。Qwen 团队将其定位为与 Grok-3 和 Gemini-2.5-Pro 直接可比。相对于闭源模型的关键优势是 Apache 2.0 开源权重访问和混合思考切换,允许同一模型在无需独立部署的情况下处理快速非推理查询。
可以。将客户端 base URL 设置为 https://api.therouter.ai/v1,配置 TheRouter API key,并将 model 设置为 qwen/qwen3-235b。支持流式传输和工具调用。要激活思考模式,在用户消息前加上 /think;要获得直接响应,使用 /no_think。不带前缀发送纯文本的客户端将使用模型默认模式——请查阅 TheRouter 文档了解当前默认设置。
Qwen3-235B 是一个混合专家模型:其前馈层包含 128 个专家子网络,在推理过程中通过学习的路由机制为每个 token 只选择 8 个。其余 120 个专家对该 token 处于休眠状态。这意味着每个 token 的计算成本相当于约 220 亿参数的稠密模型,而模型的总容量——分布在所有 128 个专家中——达到 2350 亿参数。结果是以远低于假设的 2350 亿稠密模型的推理成本获得前沿推理质量。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | qwenlm.github.io ↗ | 2026-06-09 | 已核实 |
| 架构 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| 原生上下文长度 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| 思考模式 | huggingface.co ↗ | 2026-06-09 | 已核实 |
| 预训练数据 | qwenlm.github.io ↗ | 2026-06-09 | 已核实 |
| 多语言支持 | qwenlm.github.io ↗ | 2026-06-09 | 已核实 |
| 许可 | qwenlm.github.io ↗ | 2026-06-09 | 已核实 |
| 训练数据截止 | www.mindstudio.ai ↗ | 2026-06-09 | 待核实 |
| AIME 2024 | arxiv.org ↗ | 2026-06-09 | 已核实 |
| AIME 2025 | arxiv.org ↗ | 2026-06-09 | 已核实 |
| LiveCodeBench v5 | arxiv.org ↗ | 2026-06-09 | 已核实 |
| CodeForces | arxiv.org ↗ | 2026-06-09 | 已核实 |
| BFCL v3 | arxiv.org ↗ | 2026-06-09 | 已核实 |
| Qwen3 技术报告发布于 arXiv(2505.09388) | arxiv.org ↗ | 2026-06-09 | 已核实 |
| Qwen3-235B-A22B 以 Apache 2.0 协议开源发布 | qwenlm.github.io ↗ | 2026-06-09 | 已核实 |
| TheRouter 上 qwen/qwen3-235b 思考模式和非思考模式有何区别? | huggingface.co ↗ | 2026-06-09 | 待核实 |
| Qwen3-235B 与 DeepSeek-R1 和 o1 相比如何? | arxiv.org ↗ | 2026-06-09 | 待核实 |
| 可以从 Cursor、Cline 或 OpenAI 兼容 SDK 使用 Qwen3-235B 吗? | huggingface.co ↗ | 2026-06-09 | 待核实 |
| Qwen3-235B 总参数量 2350 亿,为何每次只激活 220 亿? | huggingface.co ↗ | 2026-06-09 | 待核实 |