月之暗面发布 Kimi K2 Thinking——支持 200+ 连续工具调用的开源推理模型
月之暗面发布了 Kimi K2 Thinking,这是首个将思维链与实时工具调用原生融合的开源推理模型。训练成本 $460 万,在 HLE(带工具)上取得 44.9%,在 BrowseComp 上取得 60.2%——在 agent 网页搜索基准上超越 GPT-5。INT4 QAT 模型(~600 GB)以 Modified MIT License 发布。
Moonshot AI's deep reasoning model (1T total, 32B active MoE). Specialist for 200-300 step stable tool orchestration, long-horizon planning, and complex coding. Text-only.
Kimi K2 Thinking 由月之暗面(Moonshot AI)于 2025 年 11 月 6 日发布,是开源 Kimi K2 模型家族的推理/思考变体。它保留相同的 1 万亿参数、320 亿激活的混合专家(MoE)架构(384 个专家,每 token 选择 8 个),但新增了原生思维链推理与实时工具调用的融合能力。后训练采用量化感知训练(QAT),目标 INT4 精度,将模型体积从约 1 TB 缩小至约 600 GB,同时保持基准测试竞争力。
K2 Thinking 的核心差异化能力在于其在单次推理链中维持 200–300 次连续工具调用的同时保持状态一致——大多数模型在 30–50 次调用后就会急剧退化。它在 BrowseComp(60.2%)和 HLE with tools(44.9%)等 agent 基准测试中领先,两项均超越 GPT-5。对于 TheRouter 路由层用户,它与 moonshot/kimi-k2.6 共同构成高端推理+agent 层级,提供开源路径用于长周期自主研究、多步代码生成和复杂信息检索流水线。
| 类型 | 费率 |
|---|---|
| 输入 | $0.648 每百万 Tokens |
| 输出 | $2.70 每百万 Tokens |
| 发布日期 | 2025-11-06kimi-k2.org ↗ | 已核实 |
| 架构 | 1T 总参数 / 32B 激活 MoE;384 个专家,每 token 选择 8 个;61 层;MLA 注意力;SwiGLU 激活;INT4 QAT 后训练huggingface.co ↗ | 已核实 |
| 训练成本 | $460 万(据 CNBC 报道,未独立验证)cnbc.com ↗ | 待核实 |
| 磁盘占用(INT4) | ~600 GB(Hugging Face);非思考 K2 约 1.03 TBhuggingface.co ↗ | 已核实 |
| 许可 | Modified MIT License——代码与权重huggingface.co ↗ | 已核实 |
| 支持的推理引擎 | vLLM、SGLang、KTransformers、NVIDIA NIM、mlx-lm(Apple Silicon)huggingface.co ↗ | 已核实 |
| 训练数据截止 | 未公开披露 | 未知 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
Humanity's Last Exam (w/ tools) 带工具 HLE;强力模式(8 条并行轨迹)可达 51.0–51.3%。对比:GPT-5 = 41.7%,DeepSeek-R1 = 20.3% | 44.9%% | lambda.ai ↗ | |
BrowseComp 自主网页浏览与跨来源信息综合。对比:GPT-5 = 54.9%,Claude = 24.1%,DeepSeek = 40.1% | 60.2%% | lambda.ai ↗ | |
SWE-bench Verified 软件工程——真实 GitHub issue。对比:GPT-5 = 74.9%,Claude = 77.2%,DeepSeek = 67.8%。CAISI NIST 评估:56.2% | 71.3%% | lambda.ai ↗ | |
AIME 2025 (w/ Python) AIME 2025 数学竞赛(使用 Python 执行工具)。CAISI NIST OTIS-AIME 2025(无工具):84.3% | 99.1%% | www.reddit.com ↗ | |
GPQA-Diamond 研究生级别问答(物理、化学、生物)。CAISI NIST 独立评估数据 | 83.8%% | nist.gov ↗ | |
MMLU-Pro 大规模多任务语言理解(专业级)。CAISI NIST 独立评估数据 | 89.3%% | nist.gov ↗ | |
CVE-Bench 网络安全漏洞利用。CAISI NIST 独立评估数据 | 50.5%% | nist.gov ↗ | |
SMT 2025 斯坦福数学竞赛 2025。CAISI NIST 评估数据。对比:GPT-5 = 91.8%,DeepSeek-R1-0528 = 87.6% | 93.1%% | nist.gov ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "moonshot/kimi-k2-thinking",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'K2 Thinking 的标准 Chat 调用。模型会在内部生成思考链再输出最终答案。支持流式输出推理 token。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshot/kimi-k2-thinking",
"messages": [
{"role": "system", "content": "You are a helpful AI assistant."},
{"role": "user", "content": "Design a distributed caching strategy for a global e-commerce platform."}
],
"max_tokens": 8192,
"temperature": 0.7
}'月之暗面发布了 Kimi K2 Thinking,这是首个将思维链与实时工具调用原生融合的开源推理模型。训练成本 $460 万,在 HLE(带工具)上取得 44.9%,在 BrowseComp 上取得 60.2%——在 agent 网页搜索基准上超越 GPT-5。INT4 QAT 模型(~600 GB)以 Modified MIT License 发布。
美国 NIST 的 AI 标准与创新中心独立评估了 K2 Thinking,认定其为发布时中国开发的最强开源模型,但在网络和软件工程方面仍落后于美国顶级模型。报告确认 K2 Thinking 在 SWE-bench(56.2%)、GPQA(83.8%)和 SMT 2025(93.1%)上领先中国模型。
Apple MLX 团队成员 Awni Hannun 展示了在两台 M3 Ultra Mac Studio(各 512 GB)上通过 mlx-lm 管道并行运行 K2 Thinking,达到约 15 tok/s。模型的 QAT INT4 格式以原生精度运行无质量损失,使 1T 参数推理模型在高端 Apple Silicon 集群上的本地部署成为现实。
Kimi K2 Instruct 是一个简单的指令遵循(反射级)模型,优化快速响应,没有显式推理链。K2 Thinking 在生成答案前增加了完整的思维链推理阶段,并将推理与工具调用原生融合——它可以在推理过程中调用工具,无需等待推理完成。这使得 K2 Thinking 在复杂的多步任务上显著更强,但也更慢、每条查询成本更高。简单问答场景,K2 Instruct 是更高效的选择。
全精度(FP8)需要约 1.3 TB+ 显存——大约 12–16× H100 GPU。INT4 QAT 版本(~600 GB)需要约 1.1 TB+ 显存——推荐最低 8× H200。Apple Silicon 上,已演示在 2× M3 Ultra(各 512 GB)上通过 mlx-lm 运行,约 15 tok/s。消费级 GPU(单张 4090、5090)无法运行完整模型。但该模型可通过 TheRouter 和月之暗面官方平台以 API 形式使用,无需任何硬件要求。
K2 Thinking 在几乎所有基准测试上均超越 DeepSeek-R1。根据月之暗面的对比表:HLE 带工具:44.9% 对比 20.3%;BrowseComp:60.2% 对比 40.1%;SWE-bench Verified:71.3% 对比 67.8%。NIST CAISI 的独立评估确认 K2 Thinking 在 CVE-Bench(50.5 对比 36.0)、GPQA(83.8 对比 81.3)和 SMT 2025(93.1 对比 87.6)上领先 DeepSeek-R1-0528。K2 Thinking 的关键优势在于推理与原生工具调用的融合——DeepSeek-R1 需要单独的工具编排循环。
月之暗面以 Modified MIT License 发布了 K2 Thinking,允许大多数目的的使用、修改和分发,但包含一项限制:不得用于改进竞争性大型语言模型。权重、代码和训练方法均已公开在 Hugging Face 上。该许可未经 OSI 批准为开源,但被广泛视为'开放权重',允许商业使用。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | kimi-k2.org ↗ | 2026-05-28 | 已核实 |
| 架构 | huggingface.co ↗ | 2026-05-28 | 已核实 |
| 训练成本 | cnbc.com ↗ | 2026-05-28 | 待核实 |
| 磁盘占用(INT4) | huggingface.co ↗ | 2026-05-28 | 已核实 |
| 许可 | huggingface.co ↗ | 2026-05-28 | 已核实 |
| 支持的推理引擎 | huggingface.co ↗ | 2026-05-28 | 已核实 |
| 训练数据截止 | — | — | 未知 |
| Humanity's Last Exam (w/ tools) | lambda.ai ↗ | 2026-05-28 | 已核实 |
| BrowseComp | lambda.ai ↗ | 2026-05-28 | 已核实 |
| SWE-bench Verified | lambda.ai ↗ | 2026-05-28 | 已核实 |
| AIME 2025 (w/ Python) | www.reddit.com ↗ | 2026-05-28 | 待核实 |
| GPQA-Diamond | nist.gov ↗ | 2026-05-28 | 已核实 |
| MMLU-Pro | nist.gov ↗ | 2026-05-28 | 已核实 |
| CVE-Bench | nist.gov ↗ | 2026-05-28 | 已核实 |
| SMT 2025 | nist.gov ↗ | 2026-05-28 | 已核实 |
| 月之暗面发布 Kimi K2 Thinking——支持 200+ 连续工具调用的开源推理模型 | kimi-k2.org ↗ | 2026-05-28 | 已核实 |
| NIST CAISI 评估 Kimi K2 Thinking——发布时最强的中国开发开源模型 | nist.gov ↗ | 2026-05-28 | 已核实 |
| Kimi K2 Thinking 在 2× M3 Ultra 上通过 mlx-lm 以 15 tok/s 运行 | simonwillison.net ↗ | 2026-05-28 | 已核实 |
| Kimi K2(Instruct)和 Kimi K2 Thinking 有什么区别? | kimi-k2.org ↗ | 2026-05-28 | 待核实 |
| 我能在普通消费级硬件上运行 Kimi K2 Thinking 吗? | lambda.ai ↗ | 2026-05-28 | 待核实 |
| K2 Thinking 与 DeepSeek-R1 相比如何? | lambda.ai ↗ | 2026-05-28 | 待核实 |
| K2 Thinking 是完全开源的么? | huggingface.co ↗ | 2026-05-28 | 待核实 |