DeepSeek-R1 登上 Nature 封面——首个通过严格同行评议的主流 LLM
R1 技术报告成为 Nature(Vol. 645, Issue 8081)封面文章。这是首个开源前沿推理模型通过顶级学术期刊独立同行评议,验证了 RL 方法与透明度主张。
DeepSeek R1 (671B total, 37B active MoE) is a reasoning model that uses chain-of-thought with <think> tags to solve complex problems. Excels at math, coding, and scientific reasoning tasks with transparent step-by-step thinking.
DeepSeek-R1 是 DeepSeek 于 2025 年 1 月 20 日发布的第一代推理模型,基于 DeepSeek-V3-Base 采用大规模强化学习(RL)训练,参数规模 671B 总 / 37B 激活。R1-Zero 首次实现「零 SFT、纯 RL」训练,让模型自主涌现思维链;R1 在此基础上加入拒绝采样、第二阶段 RL 以及 SFT 对齐人类偏好,兼顾推理能力与可读性。
对 TheRouter 路由层用户,R1 是开源推理模型的标杆。它在数学、编程与复杂推理基准上与 OpenAI-o1 持平,且完全开源(MIT 许可)。模型原生输出 <think>…</think> 思维链,推理过程透明可追溯。2025 年 5 月 28 日的 R1-0528 更新新增 JSON 输出、function calling、降低幻觉并提升前端能力。DeepSeek 同时开源了 6 个蒸馏小模型(1.5B–70B),继承 R1 的推理模式。
2025 年 9 月 18 日,R1 登上 Nature(Vol. 645, Issue 8081)封面,成为首个通过顶级学术期刊严格同行评议的主流大模型。论文详述了「纯 RL、无需人工标注轨迹」即可涌现推理能力的机制,挑战了前沿 AI 训练成本与透明度的传统认知。
| 类型 | 费率 |
|---|---|
| 输入 | $1.46 每百万 Tokens |
| 输出 | $5.83 每百万 Tokens |
| 发布日期 | 2025-01-20(R1);2025-05-28(R1-0528 更新)api-docs.deepseek.com ↗ | 已核实 |
| 架构 | 671B 总 / 37B 激活 MoE;基于 DeepSeek-V3-Base 先用 GRPO RL 训练 R1-Zero,再经多阶段 SFT+RL 得到 R1;原生支持 <think> 思维链github.com ↗ | 已核实 |
| 上下文长度 | 128K tokensgithub.com ↗ | 已核实 |
| 许可——权重与代码 | MITgithub.com ↗ | 已核实 |
| Nature 发表 | 2025 年 9 月 18 日 Nature(Vol. 645, Issue 8081)封面文章——首个通过 Nature 严格同行评议的主流 LLMwww.nature.com ↗ | 已核实 |
| 蒸馏模型 | 六款开源蒸馏模型(Qwen2.5 与 Llama3.1/3.3 基座):1.5B、7B、8B、14B、32B、70B——R1-Distill-Qwen-32B 在多项基准上超过 o1-minigithub.com ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
MMLU (Pass@1) | 90.8% | github.com ↗ | |
MATH-500 (Pass@1) | 97.3% | github.com ↗ | |
AIME 2024 (Pass@1) | 79.8% | github.com ↗ | |
GPQA Diamond (Pass@1) | 71.5% | github.com ↗ | |
LiveCodeBench (Pass@1-CoT) | 65.9% | github.com ↗ | |
Codeforces (Percentile) | 96.3% | github.com ↗ | |
ArenaHard (GPT-4-1106) | 92.3% | github.com ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "deepseek/deepseek-r1",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'DeepSeek-R1 同时返回最终答案与完整的 <think> 思维链。可用于调试、审计或向用户展示中间推理步骤。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek/deepseek-r1",
"messages": [{"role":"user","content":"Solve: 2x+3=17"}]
}'R1 技术报告成为 Nature(Vol. 645, Issue 8081)封面文章。这是首个开源前沿推理模型通过顶级学术期刊独立同行评议,验证了 RL 方法与透明度主张。
DeepSeek 发布更新 checkpoint,新增结构化输出与工具调用能力,同时提升前端连贯性并降低幻觉率。API 保持兼容,现有客户端可继续使用。
DeepSeek 同时开源 R1-Zero(纯 RL、无 SFT)与 R1(多阶段人类对齐),以及六款蒸馏小模型。证明仅靠大规模 RL 即可达到 o1 级推理,无需人工标注轨迹。
通过 TheRouter 调用时,assistant 消息可能包含 reasoning_content 字段(取决于 provider),或完整 <think>…</think> 块嵌入在 content 中。请按需解析供下游使用。
R1 在 128K 上下文与显式思维链足够时仍是优秀推理模型。新项目若需要 100 万上下文、原生工具调用或更高吞吐,请优先评估 DeepSeek-V4。
可以。MIT 许可明确允许将 API 输出用于蒸馏与 fine-tuning。DeepSeek 也开源了完整 R1 思维链数据以支持社区研究。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | api-docs.deepseek.com ↗ | 2026-05-25 | 已核实 |
| 架构 | github.com ↗ | 2026-05-25 | 已核实 |
| 上下文长度 | github.com ↗ | 2026-05-25 | 已核实 |
| 许可——权重与代码 | github.com ↗ | 2026-05-25 | 已核实 |
| Nature 发表 | www.nature.com ↗ | 2026-05-25 | 已核实 |
| 蒸馏模型 | github.com ↗ | 2026-05-25 | 已核实 |
| MMLU (Pass@1) | github.com ↗ | 2026-05-25 | 已核实 |
| MATH-500 (Pass@1) | github.com ↗ | 2026-05-25 | 已核实 |
| AIME 2024 (Pass@1) | github.com ↗ | 2026-05-25 | 已核实 |
| GPQA Diamond (Pass@1) | github.com ↗ | 2026-05-25 | 已核实 |
| LiveCodeBench (Pass@1-CoT) | github.com ↗ | 2026-05-25 | 已核实 |
| Codeforces (Percentile) | github.com ↗ | 2026-05-25 | 已核实 |
| ArenaHard (GPT-4-1106) | github.com ↗ | 2026-05-25 | 已核实 |
| DeepSeek-R1 登上 Nature 封面——首个通过严格同行评议的主流 LLM | nature.com ↗ | 2026-05-25 | 已核实 |
| R1-0528 更新:支持 JSON 输出、function calling、降低幻觉 | api-docs.deepseek.com ↗ | 2026-05-25 | 已核实 |
| DeepSeek-R1 与 R1-Zero 发布——纯 RL 推理模型开源 | api-docs.deepseek.com ↗ | 2026-05-25 | 已核实 |
| 如何获取思维链(<think> 块)? | api-docs.deepseek.com ↗ | 2026-05-25 | 待核实 |
| V4 上线后,R1 还是推荐模型吗? | api-docs.deepseek.com ↗ | 2026-05-25 | 待核实 |
| 可以用 R1 输出进行 fine-tune 吗? | github.com ↗ | 2026-05-25 | 待核实 |