选择 2-6 个模型,按真实任务查看关键指标、按量 API 成本,以及结论仍未覆盖的数据边界。
直接打开 /compare 时,页面预置这 6 个模型:Claude Opus 5 (Adaptive Reasoning, Max Effort)、Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)、GPT-5.6 Sol (max)、Kimi K3 (max)、Qwen3.8 Max、DeepSeek V4 Flash 0731 (Reasoning, Max Effort)。这一组同时放入能力上限、同档替代、均衡型和性价比代表,打开就能看到有意义的取舍。
默认场景是Agent 编码:日均 2000 万 Token、input 占 85%、缓存命中 70%, 金额按官方 API 单价折算成美元月费。
Agent 编码能力领先
Claude Opus 5 (Adaptive Reasoning, Max Effort)
编码指数 78.0
这组参数下月成本约 $3194/月
按量 API 成本最低
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
$191/月
按日均 2000 万 Token、input 85% 计算,已计入 70% 缓存命中率
取舍结论
Claude Opus 5 (Adaptive Reasoning, Max Effort) 更符合“Agent 编码能力领先”,但按量 API 月成本比 DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 高 $3002/月。
还要确认:长程自主性、工具调用成功率和中途停跑率尚无统一数据,编码指数不能完全代替真实 Agent 实测。
| 模型 | 编码指数 | 智能指数 | 上下文 | 月成本 |
|---|---|---|---|---|
| Claude Opus 5 (Adaptive Reasoning, Max Effort) Anthropic | 78.0 | 63.1 | 1M | $3194/月 |
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) Anthropic | 76.5 | 62.1 | 1M | $6387/月 |
| GPT-5.6 Sol (max) OpenAI | 77.4 | 60.9 | 1M | $3644/月 |
| Kimi K3 (max) 月之暗面 | 76.2 | 59.7 | — | $1916/月 |
| Qwen3.8 Max 阿里云 | 71.8 | 58.1 | 1M | $935/月 |
| DeepSeek V4 Flash 0731 (Reasoning, Max Effort) DeepSeek | 69.1 | 51.8 | 1M | $191/月 |