GPT-6 Sol、Luna 与 Claude Opus 5.5:价格、能力和旧模型怎么换
给 Agent 换模型,最关心的往往是旧模型能不能直接替换,换完会省多少钱,结果会不会变差。北京时间 9 月 23 日,OpenAI 发布 GPT-6 Sol 和 Luna,Anthropic 发布 Claude Opus 5.5。三款模型的答案并不一样。
发布清单
先把规格摆在一起。价格为标准 API 每百万 token 的美元报价,输入和输出分开计费。
| 模型 | 定位 | 上下文 | 最大输出 | 输入 / 输出 |
|---|---|---|---|---|
| GPT-6 Sol | 复杂编码、Agent | 105 万 | 128K | $2 / $10 |
| GPT-6 Luna | 高频、低成本任务 | 105 万 | 128K | $0.10 / $0.50 |
| Claude Opus 5.5 | 长任务、知识工作 | 100 万 | 128K | $4 / $20 |
一个容易漏掉的账单细节:GPT-6 Sol 和 Luna 的输入超过 272K token 后,整次请求的输入及缓存单价翻倍,输出单价变为 1.5 倍。100 万上下文是容量,不代表全程按表中的短上下文价格计费。Claude Opus 5.5 没有这条阶梯价格。规格与计费见 Sol 文档、 Luna 文档和 Opus 5.5 文档。
能力看点
Opus 5.5 提升的是任务上限。Anthropic 公布的 Terminal-Bench 4.0 成绩为 66.4%,Opus 5 是 52.3%;FrontierCode 为 54.4%,Opus 5 是 48.0%。早期测试者还用它在一天内完成了 68 万行代码迁移。这些案例来自厂商与合作方,适合看能力方向,不能当成每次都能复现的交付时间。 Anthropic 发布资料
OpenAI 的重点是把 GPT-6 的能力放进便宜的档位。官方称 Sol 在一组由用户报错对话构成的事实评测里,错误数约为 GPT-5.6 Sol 的一半。Sol max 在 DeepSWE v1.1 得到 68.8%,Luna max 为 66.6%。这是指定评测和 effort 下的成绩,不能据此推断所有写作与研究任务都提升。 OpenAI 发布资料
第三方 Artificial Analysis 的首日测试把三款模型放在同一套综合评测中。Opus 5.5 max 得 58 分,Sol max 得 48 分,Luna max 得 37 分。对应的平均每项任务成本分别约为 $5.98、$1.06 和 $0.07。Opus 5.5 默认的 medium 档得 51 分,任务成本约 $1.34,已经超过 Sol max 的 48 分。这里的 Opus 成绩启用了默认安全回退。 同口径对比
Sol 和 Luna 也有退步。Artificial Analysis 看到 Sol 的编码 Agent 指数比前代高 2 分,Luna 低 2 分;两者在知识工作评测 GDPval-AA 上都下降。人工检查显示,较短的交付物更容易漏掉任务要求。Sol 在幻觉测试中答错更少,同时选择不回答的次数也更多。 独立评测说明
价格看点
Opus 5.5 的输入和输出单价比 Opus 5 低 20%,缓存读取价从 $0.50 降到 $0.20。Anthropic 称,在默认设置和典型负载下,少用 token 加上降价,整项任务成本约低 40%,输出速度快 30% 以上。缓存占比高的 Agent 可以重点看这项变化。 价格与速度来源
GPT-6 Sol 从 GPT-5.6 Sol 的 $4/$20 降到 $2/$10。Luna 从 $0.20/$1.20 降到 $0.10/$0.50。Artificial Analysis 测到两款 GPT-6 模型的每项任务费用大幅下降,但输出 token 没有减少。它们更像一轮价格升级,能力则要分任务看。 OpenAI 价格表
旧款怎么换
正在用 Opus 4.6、4.7、4.8 或 5:建议优先试 Opus 5.5。Opus 4.6 已列为旧模型,价格仍为 $5/$25;5.5 更便宜,公开评测也已超过 Opus 5。普通 Claude 使用可以直接换。API 接入要检查 Thinking、强制工具调用、预填充和 Computer Use 的兼容变化。尤其是 5.5 不能关闭 Thinking,默认 effort 也从 Opus 5 的 high 改为 medium。迁移清单
正在用 Fable 5.1:常规编码和知识工作值得试着换成 Opus 5.5。Fable 5.1 是 $10/$50,5.5 是 $4/$20。Artificial Analysis 上,5.5 的综合最高分也超过 Fable 5.1。已有长任务提示词和受限制领域的工作流,先保留 Fable 作为回退,检查实际输出后再切。
正在用 GPT-5.6 Sol:可以先把 GPT-6 Sol 接入编码 Agent 与事实问答,单价减半。报告、演示文稿和需要覆盖很多细项的分析,抽几份旧任务重跑。第三方评测里的遗漏问题会直接影响这类交付物。
正在用 GPT-5.6 Luna:分类、提取、格式转换等批量任务适合试换,费用明显更低。代码修改和完整文档任务先抽样核对,第三方编码 Agent 成绩略低于旧版。
同价对手
GPT-6 Sol 与 Claude Sonnet 5 都是 $2/$10。Artificial Analysis 在各自最高 effort 下给出 48 分和 38 分。Sol 对需要更多推理和编码能力、又卡在这个预算档位的用户有吸引力。这个对比没有算迁移提示词、工具链与已有评测的成本。 同价位评测
Luna 附近还有国产模型。DeepSeek V4.1 Flash 在非高峰时段是 $0.15/$0.60,高峰时段为 $0.30/$1.20。Artificial Analysis 给它的综合成绩是 39 分,Luna max 为 37 分;Luna 的平均任务成本则低得多。高吞吐量场景可以把两者放进同一批任务实测。 DeepSeek 价格、 独立成绩
Opus 5.5 的输入输出单价,恰好与此前促销期的 GPT-5.6 Sol 相同。新出的 GPT-6 Sol 把 OpenAI 这一档再降了一半。Opus 5.5 的竞争位置因此更清楚:难任务要更高成功率,可以从 medium 开始;任务可拆、可复核、调用量大,Sol 的账单更有优势。Opus 5.5 max 的单项任务成本反而可能高于标价更贵的 GPT-6 Astra,推理档位会改变最终账单。 任务成本与成绩
我的选择
长时间的代码迁移、审计和研究,我会先用 Opus 5.5 medium。任务真的卡住,再升到 high 或 max。
日常 Coding Agent 和可反复验证的工作,先试 GPT-6 Sol。批量子任务和固定格式处理交给 Luna,同时留一小部分样本人工复核。
如果已经在用旧模型,先用自己的十几项真实任务做一次对照。记录最终交付能否用、返工次数和整项任务费用。只看每百万 token 报价,很容易选错。