这半年大模型降价的完整时间线:真正影响账单的是缓存命中价
7 月 30 日 OpenAI 把 GPT-5.6 Luna 降价 80%,这是这半年降价链条上的最新一环, 前面两次是 DeepSeek 在 4 月和 5 月做的。把这半年的降价放在一起看, 真正改变账单的是缓存命中价这一列: 它在头部厂商之间已经拉开了一百倍的差距,多数人做选型时却根本没看它。
一、时间线:谁先降的
| 日期 | 厂商 | 动作 |
|---|---|---|
| 2026-04-26 | DeepSeek | 全系 API 输入缓存命中价降到首发价的 1/10 |
| 2026-05-31 | DeepSeek | V4 Pro 的 2.5 折优惠转为长期价,$1.74 / $3.48 → $0.435 / $0.87 |
| 2026-06-30 | DeepSeek | 宣布峰谷定价,高峰时段翻倍;截至 7 月底尚未启用 |
| 2026-07-09 | OpenAI | GPT-5.6 系列发布,Luna 定价 $1 / $6 |
| 2026-07-26 | Moonshot | Kimi K3 放出权重,定价 $3 / $15 |
| 2026-07-30 | OpenAI | Luna $1 / $6 → $0.20 / $1.20(-80%),Terra -20%,Sol 不动 |
| 2026-07-31 | DeepSeek | V4 Flash 0731 发布,价格不动,智能指数 40.3 → 49.9 |
顺序很重要。DeepSeek 在 4 月和 5 月已经把价格线拉到很低的位置, OpenAI 7 月 30 日是追上来,把 Luna 的输入价压到 $0.20, 第一次低于 DeepSeek V4 Pro 的 $0.435。
DeepSeek 第二天的回应是发新版本、不动价格:V4 Flash 0731 沿用 $0.14 / $0.28 的老价格, 智能指数从 40.3 抬到 49.9、编码指数从 56.2 抬到 69.1。 同样的钱买到更强的模型,对用户来说效果和降价一样。
二、缓存命中价才是账单的大头
Agent 场景每一轮都要把之前的上下文重新发一遍,这部分内容命中缓存后按缓存价计费。 我们的默认口径是缓存命中率 70%,也就是说输入 token 里有七成走的是缓存价。 所以缓存价这一列,比输入价更能决定你的账单。
DeepSeek 4 月降的正是这一列,把缓存命中价降到首发价的 1/10。 降完之后各家的差距是这样的——「缓存便宜倍数」指输入价是缓存价的多少倍,越大越省:
| 模型 | 输入/1M | 缓存价/1M | 缓存便宜倍数 | 月账单 |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | $0.140 | $0.003 | 50 倍 | $48 |
| DeepSeek V4 Pro (Reasoning, Max Effort) | $0.435 | $0.004 | 121 倍 | $146 |
| MiniMax-M3 | $0.300 | $0.060 | 5 倍 | $175 |
| GPT-5.6 Luna (max) | $0.200 | 无数据 | — | $210 |
| Kimi K2.6 | $0.950 | $0.160 | 6 倍 | $562 |
| GLM-5.2 (max) | $1.400 | $0.260 | 5 倍 | $703 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | $2.000 | $0.300 | 7 倍 | $1313 |
| GPT-5.6 Terra (max) | $2.000 | 无数据 | — | $2100 |
| Kimi K3 (max) | $3.000 | 无数据 | — | $2880 |
月账单按「Agent 编码」场景、日均 2000 万 tokens 估算 (input 占 85%、缓存命中率 70%)。 缓存价「无数据」的三行,缓存部分按原价计,实际账单会比这里低。
差距在于:多数厂商的缓存价是输入价的 1/5 到 1/10, DeepSeek V4 Pro 是 121 倍。 同样把缓存命中率从 0 提到 70%,DeepSeek 的账单能降一半, 其他家只能降三成左右。 具体到 V4 Pro:不用缓存 $300, 70% 命中 $146。
这也解释了 DeepSeek 为什么在 OpenAI 降价后不跟——它已经在最影响 Agent 账单的那一项上, 把差距拉到了别人短期内跟不上的位置。
三、市场一天就换了阵营
我们的支出指数每天按 OpenRouter 的真实用量重算权重,能看到调价之后用量往哪儿挪。 Luna 降价后的第一个完整交易日,它的用量份额从 1.6% 涨到 7.3%, 直接进了全市场前四。改一行模型名就能切换,没有迁移周期,这个速度是正常的。
份额此消彼长看得更清楚:中国厂商的 token 份额 7 月 26 日到过 78.6% 的高点, Luna 降价后的五天里退回 66.2%。一次调价拿走十二个百分点。
全市场每百万 token 的加权价格,同期从 2.36 美元降到 1.59 美元。完整走势见 支出指数页。 顺带一提,同期放出权重的 Kimi K3 定价 $3 / $15,比 Luna 贵一个数量级—— 用「开源所以便宜」做选型在它这里会判断错,细节见 Kimi 选型指南。
四、你现在该做什么
先看缓存这一列再选型。如果你在做 Agent、多轮对话、或者任何反复重发上下文的应用, 比价时把缓存命中价和你的实际命中率一起算进去。只看输入输出价会选错。
把线上主力模型的账单重算一遍。两个月内价位段被重排了一次,三个月前做的选型结论现在大概率已经不是最优解。 举个例子:同样条件下 Luna 月账单 $210、 智能指数 51.2, Kimi K2.6 月账单 $562、 智能指数 44.2—— 更便宜的那个同时也更强。
做预算别只盯单价。单价在跌,但 token 用量在涨,总账单未必跟着跌。我们在上一轮回落的归因分析里验证过:单价跌 15%,总支出反而涨了近五成。要盯的是「单位任务成本 × 任务量」。
五、口径说明
- 月账单按本站的日均 Token 消耗口径估算,方法见这篇。 表格假设各模型完成同样的工作消耗同样多的 token,实际上能力更强的模型往往用更少的轮次做完, 真要比需要在自己的任务集上跑一遍。
- GPT-5.6 全系与 Kimi K3 在本站数据源里还没有缓存读取价,表中这几行的缓存部分按原价计, 属于偏保守的估法。OpenAI 上一代 GPT-5.5 的缓存价是输入价的 1/10, Moonshot 文档给出 K3 的缓存价为 $0.30。
- 份额数据来自 OpenRouter 的公开排行,反映该平台生态,不含厂商直连的企业服务; 计算脚本是仓库里的
scripts/analysis-july-price-war.py,可以拉下来重跑复核。单日份额含噪音,Luna 是否稳住 7% 以上要再看一两周。 - DeepSeek 的峰谷定价已在 6 月底宣布(高峰时段翻倍),截至 7 月底尚未启用; 启用后按时段计费,本文与本站的单一价格口径都无法反映,届时会单独说明。
价格变动时间与幅度参考:IT之家、量子位、CNBC、VentureBeat、Artificial Analysis。 价格与能力指标以本站每日自动更新的数据为准,份额为估算值。本文不构成投资建议。
如发现数据或口径有误,欢迎通过页面右下角的「反馈」入口告诉我们。