一图胜千言,快速定位前沿大模型性价比
左上角为最优性价比区,智能指数够高价格够低。虚线为同价位最高智能指数,相同开销的更好选择。
图每天跟着价格和评测更新。下文数字取自 2026-09-02,用的是编码指数,对不上时以图为准。
前沿线:同价位最高智能指数
绿色虚线上的每个点,在同价位或更低价位里没有比它更强的模型。按价格从低到高排列:
| 输出价格 | 模型 | 编码指数 |
|---|---|---|
| $0.10 | Granite 4.1 8BIBM | 9.5 |
| $0.12 | Granite 4.2 3BIBM | 17.5 |
| $0.14 | HyperNova 60B 2605Multiverse Computing | 23.2 |
| $0.20 | Qwen3.5 9B (Reasoning)阿里巴巴 | 28.7 |
| $0.22 | Ling 3.0 Flash蚂蚁集团 | 50.6 |
| $0.28 | MiMo-V2.5小米 | 56.8 |
| $0.30 | Agnes 2.5 Pro BetaSapiens AI | 62.3 |
| $0.47 | Qwen3.8-Flash-Next阿里巴巴 | 73.1 |
| $3.75 | Gemini 3.7 Flash (high)谷歌 | 76.1 |
| $6.00 | Grok 4.6 (high)xAI | 76.8 |
| $20.00 | GPT-5.6 Sol (xhigh)OpenAI | 78.3 |
| $50.00 | Claude Fable 5.1 (Max Effort)Anthropic | 81.6 |
前沿线在 $0.47 出现拐点。$0.10 到 $0.47,价格涨 4.7 倍,编码指数从 9.5 升到 73.1; $0.47 到 $50,价格涨 106 倍,编码指数只从 73.1 升到 81.6。 绝大部分能力在半美元以内就能买到,后面那 8.5 分的代价是一百倍的价格。
这 8.5 分是否值得,取决于任务复杂度。单文件改动通常不需要; 跨十几个文件的自动重构,这 8 分可能决定能否跑通。
同价不同档:思考强度的差距
横坐标定的是预算,纵坐标定结果。$1.20 那一竖列上有十个点, 最高的 GPT-5.6 Luna (max) 编码指数 71.4,最低的 Qwen3 Next 80B A3B 只有 17.4。 同样的价格,选错模型差距可达四倍。
其中六个点是同一个模型 GPT-5.6 Luna 的六档思考强度,单价都是 $1.20:
单价不变,把思考强度从 non-reasoning 调到 max,编码指数多 32 分。 换模型之前,先确认当前模型的 effort 参数是否已经开到最高。 Claude Opus 5($25)和 GPT-5.6 Terra($12)在图上也呈现同样的形态,各自五到六档摞成一条竖线。
需要注意,思考强度调高后模型自身生成的推理 token 会增加,同一任务的总 output 会上涨, 这部分在横轴上看不出来。调整 effort 前建议实测一次单任务的实际 token 消耗。
最优性价比区
绿框标出「最优性价比区」,两条边分别是全站中位数:价格低于 $2.5、编码指数高于 55.9。 框内目前有 19 个模型。
19 个中 12 个来自中国厂商:阿里的 Qwen3.8-Flash-Next 和 Qwen3.7 Plus、智谱 GLM-5.3-Flash、 DeepSeek V4 的四个档位、小米的两个 MiMo-V2.5、腾讯 Hy3、MiniMax-M3、快手 KAT Coder Pro V2。 剩下七个中,OpenAI 的 GPT-5.6 Luna 占了三档。
点的大小代表近 7 天在 OpenRouter 上的调用量名次——前 3 名最大,依次是前 8、前 20、前 50, 50 名开外和没有用量记录的回到最小档。图上最大的几个点集中在 $0.5 到 $4 这一段, 和性价比区基本重合。
7 天窗口的选择:3 天会受周内效应影响,编程类模型工作日调用量明显高于周末; 30 天又太钝,新模型爬了两周名次还压在后面。 GLM-5.3-Flash 在 30 天窗口排第 7,7 天窗口已经是第 2。
标签显示也和调用量相关。只有在 OpenRouter 上有调用记录的模型和站在前沿线上的模型才显示名字, 预览版和内测版不参与候选。
按任务复杂度选模型
- Qwen3.8-Flash-Next$0.47编码 73.1
- GLM-5.3-Flash$0.50编码 71.5
- GPT-5.6 Luna (max)$1.20编码 71.4
- DeepSeek V4 Flash (Max Effort)$1.32编码 69.1
- GPT-5.6 Terra (max)$12编码 76.7
- Claude Opus 5 (Max Effort)$25编码 78.0
- Claude Fable 5.1 (Max Effort)$50编码 81.6
复杂任务那一档买的是最后那 8 分。比较合理的用法是让便宜模型先跑,跑不过再升级, 不需要全量走贵的。
图上也能看到反例:GPT-5.5 Instant (June 2026) 挂在 $30 的位置,编码指数 39.4, 落在图的右下方。上一代旗舰没跟着降价,在散点图上一目了然。
口径说明
| 维度 | 说明 |
|---|---|
| 输出价格 | 官方按量单价,不含缓存命中价、Batch 折扣和包月套餐。Agent 场景的账单主要由缓存命中价决定,横轴上看不出来。 |
| 智能指数 / 编码指数 | 来自 Artificial Analysis 的公开评测,通用综合口径。具体业务场景还需要用自己的数据验证。 |
| 点的大小 | 按近 7 天 token 总量排名,覆盖经过 OpenRouter 的流量。 适合判断「这个模型有没有人在用」,不适合当市场份额读。 |
| 模型范围 | 只显示近 18 个月内在售的型号,已下线的不显示。完整历史请到模型库查看。 |
前沿线只看横轴(价格)和纵轴(当前选中的能力指标),没有更便宜又更强的就算前沿。 切换到智能指数,前沿线上会是另一批模型。 三项加权均值(性价比得分)只用在标签排序上,不影响前沿线位置。
开源模型部署
开源模型页的部署图读法相同, 横轴换成智能指数、纵轴换成 Q4 量化后的显存需求(对数轴), 右下角最优:能力更强、显存更省。图上是近 18 个月的 285 个开源模型。
选择显卡后,图上会画一条显存线,跑不动的淡出,前沿线在跑得动的模型中重新计算。 换一张卡前沿会跟着变,因为候选集变了。
一张 24GB 的 4090 或 5090,能跑到智能指数 52(Qwen3.8 27B,Q4 下 17GB)。 显存加到 96GB,可用模型从 149 个涨到 192 个,但最强的还是它。 要再上一档需要 108GB(Qwen3.8-Flash-Next,180B,智能指数 55.8)。 17GB 到 108GB 这一段加显存换不来能力提升,加卡前在图上确认一下自己的位置。
两张图都支持「保存图片」,导出的 PNG 带数据来源和当前筛选状态。
延伸阅读:我们重做了模型对比页 · 真正影响账单的是缓存命中价 · 选大模型 API 前要算清的 7 笔账
图上标错了模型或口径有问题,欢迎通过页面右下角「反馈」入口告诉我们。