返回模型列表

Qwen3 235B

qwenqwen/qwen3-235b

Alibaba's flagship Qwen3 model (235B total, 22B active, 128 experts, 8 active per token MoE). Dual thinking/non-thinking mode, strong reasoning, tools, and 100+ language support.

Qwen3-235B-A22B 是阿里 Qwen 于 2025 年 4 月 28 日发布的 Qwen3 系列开源旗舰模型。它采用混合专家(MoE)架构,总参数量 2350 亿,每次前向推理激活 220 亿——在约 22B 稠密模型的推理成本下提供前沿大模型的推理深度。架构包含 94 层 Transformer、128 个专家(每次激活 8 个)、GQA 注意力(64Q/4KV),并在约 36 万亿 token 上进行了预训练,涵盖 119 种语言和方言。一项关键架构创新是统一混合思考系统:单一模型通过 enable_thinking 标志或 /think / /no_think 用户轮次前缀,在思考模式(逐步推理链)和非思考模式(直接低延迟响应)之间无缝切换。

对 TheRouter 用户而言,当质量上限最为重要时,Qwen3-235B 是首选:前沿级数学和编程推理、复杂 agentic 工作流,以及涵盖 119 种语言的多语言任务。它在关键基准上与 DeepSeek-R1、o1 和 Gemini-2.5-Pro 持平或超越——尤其在 AIME'24 上达到 85.7,AIME'25 上达到 81.5,LiveCodeBench v5 上达到 70.7。由于每次推理步骤仅激活 220 亿参数,在此质量水平下,其成本效率远高于同等规模的稠密模型。非思考模式提供类 Qwen2.5-Instruct 的速度和简洁性;思考模式为难题增加深度推理,无需独立模型。

适合使用
  • • 前沿数学与竞赛推理——思考模式下 AIME'24 达 85.7,AIME'25 达 81.5;是奥林匹克级数学、形式化证明和定量推理管道的首选模型
  • • 复杂编程和软件工程——思考模式下 LiveCodeBench v5 达 70.7,CodeForces 达 2056;适用于算法设计、代码审查、重构和多文件 agentic 编程任务
  • • 带工具调用的 agentic 工作流——BFCL v3 达 70.8;模型针对多步工具调用和 MCP 兼容 agent 链进行了优化,在思考和非思考两种模式下均适用
  • • 大规模多语言任务——原生支持 119 种语言和方言;在多语言指令遵循、翻译和跨语言推理方面表现出色,无需切换模型
  • • 创意写作、角色扮演和多轮对话——非思考模式提供类 Qwen2.5 的对话质量;思考模式为长篇创意任务提供更丰富的叙事规划
不适合使用
  • • 低延迟、高吞吐量文本任务——MoE 路由和大参数量会增加每 token 延迟,相比较小的稠密模型;当速度比峰值质量更重要时,优先选择 qwen/qwen3-32b 或 qwen/qwen3-30b-a3b
  • • 视觉或音频输入——Qwen3-235B 是纯文本模型;图像或视频理解请使用 qwen/qwen3-vl-32b 或 qwen/qwen3-vl-235b
  • • 成本敏感的批量作业——以前沿质量层级定价,大规模批量工作负载在质量要求允许的情况下,更适合使用 qwen/qwen3-30b-a3b(3B 激活,价格更低)
上下文长度
131K
最大输出
33K
输入价格每百万 tokens
$0.756每百万 Tokens
输出价格每百万 tokens
$3.02每百万 Tokens

模态能力

文本→文本

价格明细

类型费率
输入$0.756 每百万 Tokens
输出$3.02 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatreasoningstop

模型规格

发布日期2025-04-28qwenlm.github.io ↗已核实
架构混合专家(MoE);总参数 2350 亿,每 token 激活 220 亿;94 层;128 专家 / 8 激活;GQA(64Q / 4KV 头)huggingface.co ↗已核实
原生上下文长度原生 32,768 token;通过 YaRN 可扩展至 131,072 tokenhuggingface.co ↗已核实
思考模式混合:思考模式(思维链,enable_thinking=True)和非思考模式(enable_thinking=False);可通过 /think 和 /no_think 前缀逐轮切换huggingface.co ↗已核实
预训练数据约 36 万亿 token;119 种语言和方言;包含来自 Qwen2.5-Math 和 Qwen2.5-Coder 的合成数学/代码数据qwenlm.github.io ↗已核实
多语言支持119 种语言和方言qwenlm.github.io ↗已核实
许可Apache 2.0qwenlm.github.io ↗已核实
训练数据截止基础版本未公开披露;-2507 变体的知识截止日期为 2025 年 7 月www.mindstudio.ai ↗待核实

基准成绩

BenchmarkDistributionScoreSource
AIME 2024
思考模式
85.7%arxiv.org ↗
AIME 2025
思考模式
81.5%arxiv.org ↗
LiveCodeBench v5
思考模式
70.7%arxiv.org ↗
CodeForces
思考模式
2056ratingarxiv.org ↗
BFCL v3
70.8%arxiv.org ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "qwen/qwen3-235b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

非思考模式(快速直接)

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/qwen3-235b",
    "messages": [
      {"role": "user", "content": "/no_think Summarise the key changes in this diff: ..."}
    ]
  }'

qwen 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-05-14

Qwen3 技术报告发布于 arXiv(2505.09388)

Qwen 团队发布了完整技术报告,涵盖 Qwen3 系列的预训练方法(36T token,3 阶段)、混合思考架构、后训练流程,以及全面基准测试结果,显示 Qwen3-235B-A22B 在思考模式下达到 AIME'24 85.7、AIME'25 81.5、LiveCodeBench v5 70.7 和 BFCL v3 70.8。

TheRouter 编辑重写arxiv.org ↗
2025-04-28

Qwen3-235B-A22B 以 Apache 2.0 协议开源发布

阿里 Qwen 以 Apache 2.0 协议在 Hugging Face、ModelScope 和 Kaggle 上发布了 Qwen3-235B-A22B 和完整的 Qwen3 系列,使最大的开源混合思考 MoE 模型公开可用。此次发布包含预训练基础版和后训练指令版,以及从 0.6B 到 32B 的六个稠密模型和较小的 Qwen3-30B-A3B MoE。

TheRouter 编辑重写qwenlm.github.io ↗

常见问题

TheRouter 上 qwen/qwen3-235b 思考模式和非思考模式有何区别?

思考模式(/think 前缀或 enable_thinking=True)使模型在最终答案前在 <think>...</think> 标签内生成完整的思维链推理轨迹。这在困难数学、编程和多步推理上显著提升准确率,代价是更高的 token 数量、延迟和成本。非思考模式(/no_think 前缀)产生直接简洁的答案——更快更便宜,适合对话、创意和简单任务类型。可以在同一对话中逐轮切换模式。

Qwen3-235B 与 DeepSeek-R1 和 o1 相比如何?

在思考模式下,Qwen3-235B-A22B 在数学和编程基准上达到与 DeepSeek-R1 和 o1 相当或更好的成绩(AIME'24 85.7,AIME'25 81.5,LiveCodeBench v5 70.7)。Qwen 团队将其定位为与 Grok-3 和 Gemini-2.5-Pro 直接可比。相对于闭源模型的关键优势是 Apache 2.0 开源权重访问和混合思考切换,允许同一模型在无需独立部署的情况下处理快速非推理查询。

TheRouter 编辑重写arxiv.org ↗
可以从 Cursor、Cline 或 OpenAI 兼容 SDK 使用 Qwen3-235B 吗?

可以。将客户端 base URL 设置为 https://api.therouter.ai/v1,配置 TheRouter API key,并将 model 设置为 qwen/qwen3-235b。支持流式传输和工具调用。要激活思考模式,在用户消息前加上 /think;要获得直接响应,使用 /no_think。不带前缀发送纯文本的客户端将使用模型默认模式——请查阅 TheRouter 文档了解当前默认设置。

Qwen3-235B 总参数量 2350 亿,为何每次只激活 220 亿?

Qwen3-235B 是一个混合专家模型:其前馈层包含 128 个专家子网络,在推理过程中通过学习的路由机制为每个 token 只选择 8 个。其余 120 个专家对该 token 处于休眠状态。这意味着每个 token 的计算成本相当于约 220 亿参数的稠密模型,而模型的总容量——分布在所有 128 个专家中——达到 2350 亿参数。结果是以远低于假设的 2350 亿稠密模型的推理成本获得前沿推理质量。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期qwenlm.github.io ↗2026-06-09已核实
架构huggingface.co ↗2026-06-09已核实
原生上下文长度huggingface.co ↗2026-06-09已核实
思考模式huggingface.co ↗2026-06-09已核实
预训练数据qwenlm.github.io ↗2026-06-09已核实
多语言支持qwenlm.github.io ↗2026-06-09已核实
许可qwenlm.github.io ↗2026-06-09已核实
训练数据截止www.mindstudio.ai ↗2026-06-09待核实
AIME 2024arxiv.org ↗2026-06-09已核实
AIME 2025arxiv.org ↗2026-06-09已核实
LiveCodeBench v5arxiv.org ↗2026-06-09已核实
CodeForcesarxiv.org ↗2026-06-09已核实
BFCL v3arxiv.org ↗2026-06-09已核实
Qwen3 技术报告发布于 arXiv(2505.09388)arxiv.org ↗2026-06-09已核实
Qwen3-235B-A22B 以 Apache 2.0 协议开源发布qwenlm.github.io ↗2026-06-09已核实
TheRouter 上 qwen/qwen3-235b 思考模式和非思考模式有何区别?huggingface.co ↗2026-06-09待核实
Qwen3-235B 与 DeepSeek-R1 和 o1 相比如何?arxiv.org ↗2026-06-09待核实
可以从 Cursor、Cline 或 OpenAI 兼容 SDK 使用 Qwen3-235B 吗?huggingface.co ↗2026-06-09待核实
Qwen3-235B 总参数量 2350 亿,为何每次只激活 220 亿?huggingface.co ↗2026-06-09待核实
帮助与联系