我们重做了模型对比页:从参数表到能给结论的选型工具
旧版对比页把模型的价格、能力和规格排在一起,信息很多,但最后一步仍然留给了用户:所以我的任务到底该选谁?这次更新从这个问题重新设计。现在你先选择真实任务,页面再告诉你哪个候选在对应指标上领先、 按当前用量每月要花多少钱,以及这个结论回答不了什么。
一、为什么不再从参数表开始
大多数模型对比页的默认做法,是把价格、上下文窗口、跑分和参数规模铺成一张大表。 但不同任务关心的指标完全不同:做 Agent 编程的人先看代码能力和上下文,处理长文档的人先问装不装得下, 做在线客服的人还要考虑 SLA、并发和地区延迟。把所有数字同时摆出来,并不会自动得到选型结论。
旧版还有一张雷达图,把绝对分、Elo 和全库相对名次放在同一个圆里。图形很直观,口径却并不相同; 缺失数据一旦画成 0,看起来还会像模型真的得了零分。这次我们直接移除了它。
先给一整张参数表
用户自己判断看哪列、怎么算成本、缺失值是否可信。
先问你要解决什么问题
页面只用对应的可验证指标给结论,再展开完整参数。
二、先选问题,再选模型
新版首屏先提供五类常见选型问题。切换任务不只是改一行标题:它会同步改变 input / output 比例、 缓存命中率,以及第一张结论卡所依据的主指标。
| 真实任务 | 页面回答 | 主动说明的边界 |
|---|---|---|
| Agent 编程 | 编码指数领先者 | 长程自主性与工具调用仍需项目实测 |
| 代码问答 / 补全 | 编码能力参考 | 补全延迟与交互体验暂不参与排名 |
| 在线客服 | 只计算按量 API 成本 | 没有可靠 SLA 与客服质量数据时不强行推荐 |
| 长文档 / RAG | 上下文容量最大 | 装得下不等于召回更准、幻觉更少 |
| 中文写作 / 报告 | 通用人类偏好领先者 | Arena 不是中文写作专项测评 |
这里刻意没有再造一个不透明的“综合推荐分”。同一个模型不应该因为页面换了场景标签, 就在没有新证据的情况下被包装成另一个答案。每张结论卡都写明指标名称、具体数值和数据边界, 你可以判断它是否适合自己的业务。
三、能力结论和真实月账单放在一起
选模型很少是单纯追求最高分。新版把两个最常见、也最容易混在一起的问题拆成两张卡: 一张回答当前任务的主指标谁领先, 另一张回答按量 API 月成本谁最低。
回答“更适合这个问题的是谁”
展示对应跑分或容量、当前场景月成本,以及最重要的数据边界。
回答“按我的用量谁更省”
按日均 Token、input 比例、缓存命中率和币种现场重算。
两张卡下面还会生成一句直接的取舍:能力领先者每月比最低成本候选多花多少, 或者某个模型是否同时拿下两个结论。这样你看到的不只是两个名字,而是升级能力要付出的具体代价。
四、一次比较可以保存、复现和分享
我们也重做了从“想到几个候选”到“把结论带走”的完整流程:
- 最多同时比较 6 个模型,默认篮子同时覆盖能力旗舰、强力替代与性价比代表
- 每个槽位都能原位替换,不必先删除一个模型再回到选择器添加
- 日均 Token、input 比例、缓存命中率与币种可以直接调整
- 模型和场景参数会写入 URL,刷新不丢失,也能复制完整结果或分享链接
- 从结论卡直接查看模型详情或前往厂商,减少在多个页面之间来回切换
分享链接不是一张过期截图。接收方打开后,会恢复同一组模型、同一个任务和同一套用量参数, 再用站内最新价格重新计算。团队讨论模型选型时,终于可以围绕同一份输入条件说话。
五、可信比“什么都能回答”更重要
这次改版里最重要的变化,可能是页面开始主动承认不知道。没有评测数据的模型不会再拿默认能力分参与胜负; 没有官方价格不会被当成免费;缺失指标不会以 0 分画进图里。只有同口径、可追溯的数据,才会进入结论。
因为真实客服要看中文话术、事实错误、工具调用、并发、429、SLA 和地区延迟。 这些数据目前没有统一、可信的采集口径,所以页面只计算成本,并明确提示需要业务实测。 一个克制的“数据不足”,比用通用跑分猜出一个冠军更有用。
这也是新版的设计原则:结论可以少,但每一个都应该能解释、能复算、能指出边界。
六、现在就用你的候选模型试一次
打开新版对比页后,先选任务,再把默认篮子替换成你正在考虑的模型。 如果账单和你的实际情况差得很远,展开场景参数调整日均 Token、input 比例和缓存命中率; 拿到结论后复制分享链接,就能把完整前提一起交给同事。
延伸阅读:AI 编程成本为什么要按日均 Token 计算 · 2026 LLM API 定价指南
如发现数据或口径有误,欢迎通过页面右下角的「反馈」入口告诉我们。