返回模型列表

Kimi K2 Thinking

moonshotmoonshot/kimi-k2-thinking

Moonshot AI's deep reasoning model (1T total, 32B active MoE). Specialist for 200-300 step stable tool orchestration, long-horizon planning, and complex coding. Text-only.

Kimi K2 Thinking 由月之暗面(Moonshot AI)于 2025 年 11 月 6 日发布,是开源 Kimi K2 模型家族的推理/思考变体。它保留相同的 1 万亿参数、320 亿激活的混合专家(MoE)架构(384 个专家,每 token 选择 8 个),但新增了原生思维链推理与实时工具调用的融合能力。后训练采用量化感知训练(QAT),目标 INT4 精度,将模型体积从约 1 TB 缩小至约 600 GB,同时保持基准测试竞争力。

K2 Thinking 的核心差异化能力在于其在单次推理链中维持 200–300 次连续工具调用的同时保持状态一致——大多数模型在 30–50 次调用后就会急剧退化。它在 BrowseComp(60.2%)和 HLE with tools(44.9%)等 agent 基准测试中领先,两项均超越 GPT-5。对于 TheRouter 路由层用户,它与 moonshot/kimi-k2.6 共同构成高端推理+agent 层级,提供开源路径用于长周期自主研究、多步代码生成和复杂信息检索流水线。

适合使用
  • • 长周期自主研究:在 100+ 次工具调用中持续浏览、搜索、交叉引用和综合信息,不丢失连贯性
  • • 具备自我修正的 agent 编程:通过集成工具调用实现多步代码生成、缺陷复现、日志分析、假设测试和迭代调试
  • • 复杂问题的深度推理:数学证明、多步逻辑演绎、需要跨来源综合的学术研究
  • • 自托管推理流水线:开放权重(Modified MIT License)允许在特定领域轨迹上微调,并部署在自己的 GPU 基础设施上
不适合使用
  • • 视觉或多模态输入——K2 Thinking 为纯文本;图像/视频路由至 moonshot/kimi-k2.5 或 moonshot/kimi-k2.6,它们原生支持多模态输入
  • • 延迟敏感的实时对话——延伸思考链会增加明显延迟;保持使用 moonshot/kimi-k2(非思考模式)或 moonshot/kimi-k2.6-instruct 以获得更快的响应
  • • 简单问答场景,深度推理开销纯属浪费——使用标准非思考模式 K2 或 K2.6 以获得更高性价比
上下文长度
256K
最大输出
64K
输入价格每百万 tokens
$0.648每百万 Tokens
输出价格每百万 tokens
$2.70每百万 Tokens

模态能力

文本→文本

价格明细

类型费率
输入$0.648 每百万 Tokens
输出$2.70 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatreasoningstop

模型规格

发布日期2025-11-06kimi-k2.org ↗已核实
架构1T 总参数 / 32B 激活 MoE;384 个专家,每 token 选择 8 个;61 层;MLA 注意力;SwiGLU 激活;INT4 QAT 后训练huggingface.co ↗已核实
训练成本$460 万(据 CNBC 报道,未独立验证)cnbc.com ↗待核实
磁盘占用(INT4)~600 GB(Hugging Face);非思考 K2 约 1.03 TBhuggingface.co ↗已核实
许可Modified MIT License——代码与权重huggingface.co ↗已核实
支持的推理引擎vLLM、SGLang、KTransformers、NVIDIA NIM、mlx-lm(Apple Silicon)huggingface.co ↗已核实
训练数据截止未公开披露未知

基准成绩

BenchmarkDistributionScoreSource
Humanity's Last Exam (w/ tools)
带工具 HLE;强力模式(8 条并行轨迹)可达 51.0–51.3%。对比:GPT-5 = 41.7%,DeepSeek-R1 = 20.3%
44.9%%lambda.ai ↗
BrowseComp
自主网页浏览与跨来源信息综合。对比:GPT-5 = 54.9%,Claude = 24.1%,DeepSeek = 40.1%
60.2%%lambda.ai ↗
SWE-bench Verified
软件工程——真实 GitHub issue。对比:GPT-5 = 74.9%,Claude = 77.2%,DeepSeek = 67.8%。CAISI NIST 评估:56.2%
71.3%%lambda.ai ↗
AIME 2025 (w/ Python)
AIME 2025 数学竞赛(使用 Python 执行工具)。CAISI NIST OTIS-AIME 2025(无工具):84.3%
99.1%%www.reddit.com ↗
GPQA-Diamond
研究生级别问答(物理、化学、生物)。CAISI NIST 独立评估数据
83.8%%nist.gov ↗
MMLU-Pro
大规模多任务语言理解(专业级)。CAISI NIST 独立评估数据
89.3%%nist.gov ↗
CVE-Bench
网络安全漏洞利用。CAISI NIST 独立评估数据
50.5%%nist.gov ↗
SMT 2025
斯坦福数学竞赛 2025。CAISI NIST 评估数据。对比:GPT-5 = 91.8%,DeepSeek-R1-0528 = 87.6%
93.1%%nist.gov ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "moonshot/kimi-k2-thinking",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

Chat 调用

K2 Thinking 的标准 Chat 调用。模型会在内部生成思考链再输出最终答案。支持流式输出推理 token。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshot/kimi-k2-thinking",
    "messages": [
      {"role": "system", "content": "You are a helpful AI assistant."},
      {"role": "user", "content": "Design a distributed caching strategy for a global e-commerce platform."}
    ],
    "max_tokens": 8192,
    "temperature": 0.7
  }'

moonshot 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-11-06

月之暗面发布 Kimi K2 Thinking——支持 200+ 连续工具调用的开源推理模型

月之暗面发布了 Kimi K2 Thinking,这是首个将思维链与实时工具调用原生融合的开源推理模型。训练成本 $460 万,在 HLE(带工具)上取得 44.9%,在 BrowseComp 上取得 60.2%——在 agent 网页搜索基准上超越 GPT-5。INT4 QAT 模型(~600 GB)以 Modified MIT License 发布。

TheRouter 编辑重写kimi-k2.org ↗
2025-12-09

NIST CAISI 评估 Kimi K2 Thinking——发布时最强的中国开发开源模型

美国 NIST 的 AI 标准与创新中心独立评估了 K2 Thinking,认定其为发布时中国开发的最强开源模型,但在网络和软件工程方面仍落后于美国顶级模型。报告确认 K2 Thinking 在 SWE-bench(56.2%)、GPQA(83.8%)和 SMT 2025(93.1%)上领先中国模型。

TheRouter 编辑重写nist.gov ↗
2025-11-08

Kimi K2 Thinking 在 2× M3 Ultra 上通过 mlx-lm 以 15 tok/s 运行

Apple MLX 团队成员 Awni Hannun 展示了在两台 M3 Ultra Mac Studio(各 512 GB)上通过 mlx-lm 管道并行运行 K2 Thinking,达到约 15 tok/s。模型的 QAT INT4 格式以原生精度运行无质量损失,使 1T 参数推理模型在高端 Apple Silicon 集群上的本地部署成为现实。

TheRouter 编辑重写simonwillison.net ↗

常见问题

Kimi K2(Instruct)和 Kimi K2 Thinking 有什么区别?

Kimi K2 Instruct 是一个简单的指令遵循(反射级)模型,优化快速响应,没有显式推理链。K2 Thinking 在生成答案前增加了完整的思维链推理阶段,并将推理与工具调用原生融合——它可以在推理过程中调用工具,无需等待推理完成。这使得 K2 Thinking 在复杂的多步任务上显著更强,但也更慢、每条查询成本更高。简单问答场景,K2 Instruct 是更高效的选择。

我能在普通消费级硬件上运行 Kimi K2 Thinking 吗?

全精度(FP8)需要约 1.3 TB+ 显存——大约 12–16× H100 GPU。INT4 QAT 版本(~600 GB)需要约 1.1 TB+ 显存——推荐最低 8× H200。Apple Silicon 上,已演示在 2× M3 Ultra(各 512 GB)上通过 mlx-lm 运行,约 15 tok/s。消费级 GPU(单张 4090、5090)无法运行完整模型。但该模型可通过 TheRouter 和月之暗面官方平台以 API 形式使用,无需任何硬件要求。

K2 Thinking 与 DeepSeek-R1 相比如何?

K2 Thinking 在几乎所有基准测试上均超越 DeepSeek-R1。根据月之暗面的对比表:HLE 带工具:44.9% 对比 20.3%;BrowseComp:60.2% 对比 40.1%;SWE-bench Verified:71.3% 对比 67.8%。NIST CAISI 的独立评估确认 K2 Thinking 在 CVE-Bench(50.5 对比 36.0)、GPQA(83.8 对比 81.3)和 SMT 2025(93.1 对比 87.6)上领先 DeepSeek-R1-0528。K2 Thinking 的关键优势在于推理与原生工具调用的融合——DeepSeek-R1 需要单独的工具编排循环。

K2 Thinking 是完全开源的么?

月之暗面以 Modified MIT License 发布了 K2 Thinking,允许大多数目的的使用、修改和分发,但包含一项限制:不得用于改进竞争性大型语言模型。权重、代码和训练方法均已公开在 Hugging Face 上。该许可未经 OSI 批准为开源,但被广泛视为'开放权重',允许商业使用。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期kimi-k2.org ↗2026-05-28已核实
架构huggingface.co ↗2026-05-28已核实
训练成本cnbc.com ↗2026-05-28待核实
磁盘占用(INT4)huggingface.co ↗2026-05-28已核实
许可huggingface.co ↗2026-05-28已核实
支持的推理引擎huggingface.co ↗2026-05-28已核实
训练数据截止——未知
Humanity's Last Exam (w/ tools)lambda.ai ↗2026-05-28已核实
BrowseComplambda.ai ↗2026-05-28已核实
SWE-bench Verifiedlambda.ai ↗2026-05-28已核实
AIME 2025 (w/ Python)www.reddit.com ↗2026-05-28待核实
GPQA-Diamondnist.gov ↗2026-05-28已核实
MMLU-Pronist.gov ↗2026-05-28已核实
CVE-Benchnist.gov ↗2026-05-28已核实
SMT 2025nist.gov ↗2026-05-28已核实
月之暗面发布 Kimi K2 Thinking——支持 200+ 连续工具调用的开源推理模型kimi-k2.org ↗2026-05-28已核实
NIST CAISI 评估 Kimi K2 Thinking——发布时最强的中国开发开源模型nist.gov ↗2026-05-28已核实
Kimi K2 Thinking 在 2× M3 Ultra 上通过 mlx-lm 以 15 tok/s 运行simonwillison.net ↗2026-05-28已核实
Kimi K2(Instruct)和 Kimi K2 Thinking 有什么区别?kimi-k2.org ↗2026-05-28待核实
我能在普通消费级硬件上运行 Kimi K2 Thinking 吗?lambda.ai ↗2026-05-28待核实
K2 Thinking 与 DeepSeek-R1 相比如何?lambda.ai ↗2026-05-28待核实
K2 Thinking 是完全开源的么?huggingface.co ↗2026-05-28待核实
帮助与联系