选大模型 API 前要算清的 7 笔账
大模型 API 的定价页通常只给你两个数字:输入价和输出价,单位是每百万 Token。 这两个数字拿来直接比,会漏掉很多东西。这篇文章把比价过程拆成 7 步,每步对应一笔你需要关注的费用或一个判断动作, 从最基本的概念讲到最终下单前的核对。
大模型 API 比价是什么
大模型 API 比价,就是把不同厂商、不同模型的调用费用放在同一个口径下横向比较,找出在你自己的使用方式下总花费最低的方案。 各家厂商的定价页格式各不相同,有的按输入输出分开报价,有的合在一起,有的有缓存折扣有的没有,直接比单价看不出真实成本。 比价要做的就是把这些差异拉齐,算成同一个维度下可比的数字。
一、输入价和输出价是两笔钱
你发给模型的内容(提示词、上下文、检索到的文档)按输入价收费,模型回复的内容按输出价收费。 两个价格独立计费,大多数模型的输出价比输入价贵 2-5 倍。下面是几个主流模型的当前报价,可以看到差距:
| 模型 | 输入价 / 百万 Token | 输出价 / 百万 Token | 输出 ÷ 输入 |
|---|---|---|---|
| GPT-5.6 Luna (max) | $0.200 | $1.200 | 6.0x |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | $5.000 | $25.000 | 5.0x |
| DeepSeek V4 Flash 0420 (Reasoning, High Effort) | $0.130 | $0.280 | 2.2x |
| Gemini 3.8 Flash (high) | $0.750 | $3.750 | 5.0x |
| Qwen3.8-Flash-Next | $0.150 | $0.470 | 3.1x |
同一个厂商的不同型号之间,输入价和输出价的倍数关系也不一样。只看其中一个数字,容易挑错模型。
另外留意计价单位:有的厂商按每千 Token 报价,有的按每百万 Token,有的按每十万字符。 单位没对齐就比数字,几乎一定看错。上面这张表和 TrakToken 价格表统一用的是每百万 Token(美元),不需要你自己换算。
二、哪笔是大头,取决于你的用法
不同任务的输入输出比例差异很大。Agent 编码类任务每轮都要把整个上下文重新发给模型,输入占日均 Token 消耗的 85% 以上; 写文章或生成报告的任务正好反过来,输出才是大头。知道自己属于哪一类,才知道该优先比哪个价格。
| 使用场景 | 输入占比 | 输出占比 | 说明 |
|---|---|---|---|
| Agent 编码 | 85% | 15% | Claude Code / Cursor Agent 等多轮循环,反复重读上下文,input 占绝对大头,缓存命中率高 |
| 代码问答 / 补全 | 75% | 25% | 单轮代码解释、补全、调试建议 |
| 在线客服 | 60% | 40% | 大量简短对话,系统提示词可缓存 |
| 长文档 / RAG | 90% | 10% | 长文档输入、摘要输出,文档各不相同,缓存收益低 |
| 中文写作 / 报告 | 35% | 65% | 短指令输入、长文输出,成本大头在 output |
拿 Agent 编码举例:日均 2000 万 Token 的消耗,其中 1700 万是输入、300 万是输出。这时候两个模型即使输出价一样,输入价差 1 美元,月费就差 51 美元。
中文用户还要留意一点:同样一段内容,中文文本消耗的 Token 数通常比英文多 1.5-2 倍。 也就是说,同样长度的提示词或文档,中文场景的实际 Token 用量比英文参考值更高,算月费时要按自己的实际 Token 数来,不能直接套英文场景的估算。
三、缓存命中价,重复内容多的场景差异很大
很多厂商对「之前发过的内容再发一次」给一个更低的价格,叫缓存命中价(cache hit price)。 Agent 编码、多轮对话、RAG 这类任务每轮都带着系统提示词和之前的上下文,重复率很高,缓存命中价直接决定账单。 下面几个模型的缓存命中价和原始输入价差距可以到十几倍:
| 模型 | 输入价 | 缓存命中价 | 折扣 |
|---|---|---|---|
| GLM 5.3 Flash | $0.150 | $0.026 | 6x |
| Qwen3.8-Flash-Next | $0.150 | $0.016 | 9x |
| GPT-5.6 Luna (max) | $0.200 | $0.020 | 10x |
| GPT-5.6 Luna (xhigh) | $0.200 | $0.020 | 10x |
| Hy3-preview (Reasoning) | $0.063 | $0.021 | 3x |
判断标准:你的请求里有多少内容是每次都重复发送的。系统提示词 2000 Token、检索上下文 5000 Token、每轮都带,这 7000 Token 就走缓存价。 Agent 编码场景下缓存命中率大约 70%,实际的输入均价比标价低很多。
四、Batch 折扣和工具调用附加费
除了输入、输出、缓存这三项,有些厂商还有两类额外定价。 一类是 Batch(批量异步)折扣:如果你的任务不要求实时返回结果——比如批量翻译、离线评测——可以走 Batch 接口,通常有 50% 的折扣。 另一类是工具调用附加费:联网搜索、代码执行、文件解析这些能力,有的厂商按次收费,有的包含在 Token 价格里,有的根本没有。
这两类费用按次或按量单独计算,评估总成本时要把它们和 Token 费用加在一起。 如果你的任务大量用到联网搜索或代码执行,这笔附加费可能比 Token 费本身更高。
还有一项容易漏算的是长上下文跳价。部分厂商在上下文超过一定长度(比如 128K 或 200K Token)后,输入价会自动上浮。 做 RAG、长文档分析、或者 Agent 跑长程任务时,上下文很容易超过这个阈值。 具体的阈值和加价幅度各家不同,评估长文档或长程 Agent 任务成本时要把这部分上浮计入。
五、一张价格表怎么看
前四步讲的是你要关注哪些数字。接下来要做的是打开一张横向对比表,把候选模型缩小到 3-5 个。 TrakToken 的价格表每日自动更新,按每百万 Token 列出输入价、输出价和缓存命中价,覆盖全球与国内厂商。
表里有一列「性价比」评分,把价格和模型能力(智能指数、编码能力、Arena Elo)放在一起算, 帮你在同价位里找能力最强的,或者在同能力档里找最便宜的。 不确定自己需要什么档次的模型时,先按性价比排序,从高往低看。
这套评分对开发和 Agent 类任务比较准,因为编码能力和推理能力在这些场景下就是核心指标。 但如果你做的是客服、翻译、内容生成这类直接面向用户的任务,语言流畅度、中文表达质量、指令跟随能力这些维度更重要,编码跑分高低和你的场景关系不大。 这时候建议用模型对比看具体任务维度的表现,或者拿自己业务里的真实样本跑一轮测试再做判断。
表头支持按厂商筛选、按能力标签(工具调用、视觉、推理)筛选、按价格区间(经济 / 主力 / 前沿)筛选。 筛完之后通常就剩十几个候选,可以进入下一步:拿自己的用量算月费。
六、按自己的用量算一次月费
单价比完了,最终要回到一个具体的数字:这个模型我每月花多少钱。 TrakToken 的成本计算器可以填入你的日均 Token 消耗量和输入输出比例,直接算出各模型的月费,缓存价一并计入。
下面是一个实际的算例:日均消耗 20 万 Token, Agent 编码场景(输入占 85%,缓存命中率 70%), 人民币月费对比:
| 模型 | 月费(¥) | 缓存价生效 |
|---|---|---|
| DeepSeek V4 Flash 0420 (Reasoning, High Effort) | ¥397 | 是 |
| Qwen3.8-Flash-Next | ¥511 | 是 |
| GPT-5.6 Luna (max) | ¥1,049 | 是 |
| Gemini 3.8 Flash (high) | ¥3,449 | 是 |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) | ¥22,993 | 是 |
同样的用量,最贵和最便宜的月费可以差出几倍。上面这组数据里,最便宜的 DeepSeek V4 Flash 0420 (Reasoning, High Effort) 月费 ¥397,最贵的 Claude Opus 5 (Adaptive Reasoning, Max Effort) 月费 ¥22,993。场景不同、用量不同,排名会变。建议用自己的实际数字算一次。
七、选完模型,直接拿 API Key 跑起来
走完前六步,你已经有了一份按自己用量排好序的候选清单。 每个模型详情页都标注了厂商官网链接,点过去注册拿 Key、接入代码就能跑。 TrakToken 的价格每日自动采集更新,后续换模型或调整用量时随时回来重新算。
大模型 API 的定价变化很快,上个月最贵的模型这个月可能大幅降价。TTSI 支出指数按全市场实际用量加权,每天更新一个「大家平均每百万 Token 花多少钱」的数字,可以帮你判断当前是不是换模型的窗口。