TrakTokenBeta
中文市场

月之暗面 Moonshot / Kimi API 选型指南 2026:Kimi K3 发布后怎么选

Kimi K3 于 7 月 16 日上线 API、7 月 26 日放出权重,输出价是 K2.6 的 3.8 倍, 智能指数高出 14.6 分。这篇把 K3 和还在服役的 K2 系列放在一张表里, 价格与指标来自每日自动更新的实时数据。

一、Kimi K3:变了什么

Moonshot 是月之暗面的大模型开放平台,Kimi 是其核心模型产品线。 从 K2 到 K2.7 的一年多时间里,Kimi 的主线模型一直待在每百万 token 一美元以内的价位。 K3 打破了这个惯例。

K3 输入 / 输出
$3.000 / $15.000
每百万 tokens
智能指数
59.7K2.6 45.1
Artificial Analysis
输出速度
37.3tok/s
首 token 2.6
  • 参数规模2.78T 总参数的 MoE 架构,官方口径为每 token 激活 104B、 896 个专家中激活 16 个。作为对比,K2 全系是 1T 总参 / 32B 激活。
  • 上下文与模态:100 万 token 上下文, 全长度统一计价,没有长上下文加价;原生支持图像输入。
  • 能力:智能指数 59.7、 编码指数 76.2,两项都是 Moonshot 全系最高, 编码指数已经进入 GPT-5.6 Sol、Claude Opus 5 所在的区间。
  • 速度要留意:K3 的输出速度37.3 tok/s、首 token 延迟2.6 秒,比 K2.6(0 tok/s、0 秒)都要慢。 交互式场景上 K3 之前,先确认用户能接受这个首字延迟。

官方定价以 定价文档 为准,本文价格为多源采集的实时 USD 口径。Moonshot 文档给出 K3 的缓存读取价为 $0.30 / 1M, 相当于输入价的十分之一;本站数据源当前还没有提供 K3 的缓存价, 所以下文成本表里 K3 的缓存部分按原价计,属于偏保守的估法。

二、权重放出来了,许可证要看清楚

K3 在 7 月 16 日先上线 API,7 月 26 日放出完整权重,托管在 Hugging Face。MXFP4 量化后的权重文件约 1.56 TB,本站按 6672 GB 显存估算部署门槛—— 这个量级已经超出单机范围,自建要按多节点集群规划。

许可证有一个需要合规同事看一眼的条款:K3 用的是 Moonshot 自定的 kimi-k3 许可,对外提供推理服务且相关年收入超过 2000 万美元时,需要另行取得授权。 K2 系列用的是 Modified MIT,没有这条限制。自己内部用、或者做到这个体量之前, 两者在实践中没有区别;打算拿 K3 直接对外卖 API 的团队要提前算一下这条线。

想比较其他开源权重模型的部署门槛,见 开源模型专区,那里按显存需求和硬件成本做了分档。

三、Kimi 模型总览

当前在售 / 可用的 11 个 Kimi 模型,按推荐关注度排序。 价格单位为每百万 tokens(USD),点击模型名可查看完整详情。

模型输入/1M输出/1M缓存读取智能指数CodingMathArena Elo开源
Kimi K3 (max)$3.000$15.000$0.30059.776.2--
Kimi K3 (low)$3.000$15.000$0.30048.372.0--
Kimi K2.7 Code$0.950$4.000$0.19043.060.8--
Kimi K2.6$0.950$4.000$0.16045.161.8-1461
Kimi K2.6 (Non-reasoning)$0.950$4.000$0.16035.4--1461
Kimi K2.5 (Reasoning)$0.600$3.000$0.10036.046.8-1451
Kimi K2.5 (Non-reasoning)$0.600$3.000$0.10030.1---
Kimi K2 Thinking$0.600$2.500-33.5-94.71451
Kimi K2 0905$0.600$2.500-24.0-57.31418
Kimi K2$0.570$2.300-19.7-57.01461
Kimi Linear 48B A3B InstructFreeFree-8.4-36.3-

价格分成了三档:K2.5 一代输入 $0.6 / 输出 $3,K2.6 与 K2.7 Code 是输入 $0.95 / 输出 $4, K3 跳到输入 $3 / 输出 $15。K2 系列的缓存读取价低至输入价的 1/6,对多轮 Agent 场景友好。

四、怎么选:按场景决策

K3 出现后,Moonshot 产品线的选型逻辑从「选哪个版本」变成了「这个任务值不值 3 倍的价钱」。 先看任务,再看价位。

场景一:最难的那部分任务

Kimi K3。 智能指数 59.7、编码指数 76.2, 长程 Agent、跨仓库重构、复杂推理这类一次做对能省下大量返工的任务值得上 K3。 日常高频调用继续走 K2.6 或 K2.7 Code,两者价差接近 4 倍,全量切过去账单会很难看。

场景二:代码生成 / 编程助手

Kimi K2.7 Code。 编码指数 60.8, 专为 Agent 编码与代码补全调优,定价与通用旗舰 K2.6 持平。 需要更强的架构理解时再把单个任务交给 K3。

场景三:通用高能力任务

Kimi K2.6。 智能指数 45.1、编码指数 61.8, 在 $1 以内的价位段属于第一梯队;对延迟敏感、不需要深度思考的任务可以用 K2.6 Non-reasoning 省下推理 token。

场景四:深度推理 / 数学

Kimi K2 Thinking K2.5 (Reasoning)。 K2 Thinking 的 Math 指数高达 94.7,且输出价仅 $2.5,是数学 / 链式推理任务的性价比之选; 需要更强综合能力时再上 K2.5 Reasoning。

场景五:长文档处理 / RAG

文档量大、单价敏感的选 K2.6; 需要一次吃进整个代码库或整本资料的选 K3, 100 万 token 上下文全长度统一计价,长文档不会踩到分段加价。 Kimi 在 PDF / 网页等复杂格式解析上长期领先,这是这条产品线的看家本领。

场景六:本地部署 / 开源探索

K2 与 K3 都放出了权重,但门槛差了一个数量级:K2 系列 1T 总参 / 32B 激活, 本站估算约 2400 GB 显存;K3 是 2.78T 总参, 估算 6672 GB。单机能碰的只有 K2 系列, 轻量试验可以从免费的 Kimi Linear 48B 入手。对比其他开源选项见 开源模型专区

五、成本示例:Agent 编码日均 2000 万 tokens

以「Agent 编码」场景、「中度开发」用量(日均 2000 万 tokens)估算: input 占 85%、缓存命中率 70%, 与 日均 Token 消耗口径 一致。

模型输入/1M输出/1M缓存读取日成本月度估算
Kimi K3 (max)$3.000$15.000$0.300$63.87$1916
Kimi K2.7 Code$0.950$4.000$0.190$19.11$573
Kimi K2.6$0.950$4.000$0.160$18.75$562
Kimi K2.5 (Reasoning)$0.600$3.000$0.100$13.25$398
Kimi K2 Thinking$0.600$2.500-$17.70$531

缓存读取价为「-」的模型,表中把缓存部分按原价计。K3 按官方文档的 $0.30 缓存价重算, 同样条件下月度估算会降到 $1900 上下——对高缓存命中的 Agent 场景,这一项决定了账单的量级, 评估时务必用真实的缓存命中率去算。换成你的真实用量,在 成本计算器 里调整日均 tokens、场景比例与缓存命中率,还能同时对比多个模型。

六、和 GPT / Claude / DeepSeek 怎么比

K3 定价 $3 / $15 之后,Kimi 的旗舰第一次和 GPT-5.6 Terra、Claude Opus 5 站在同一个价位段里, 比较的对手也跟着换了一批。以下入口已预选好模型组合:

同期 OpenAI 把 GPT-5.6 Luna 降价 80% 追上 DeepSeek,整个价位格局在两个月内被重排了一次,见 这半年大模型降价的完整时间线。想看国内市场全局,读 国内大模型 API 价格全对比 2026

下一步:看 Moonshot 全部模型与定价,用 成本计算器 估算你的 Kimi API 月成本,或在 模型对比 里和 GPT / Claude / DeepSeek 做横评。

本文数据通过自动化管道从 Artificial Analysis、LMSYS Arena、OpenRouter 等源持续采集, 价格与评测指标每日自动更新;K3 的参数规模、上下文长度与许可证条款来自 Moonshot 官方文档与 Hugging Face 模型卡。如发现数据有误,欢迎通过页面右下角的「反馈」入口告诉我们。