北京时间 9 月 23 日,Anthropic 发布 Claude Opus 5.5,一个多小时后 OpenAI 发布 GPT-6 Sol 和 Luna。每次新模型出来,大家想知道的无非两件事:它强在哪,我手上的模型要不要换。
三款均降价。Opus 5.5 据称能力强化的同时,属于Opus4.6风格的写作能力回归。意思就是说人话了。Sol 和 Luna 主要是便宜了一半,能力和上一代基本持平,写代码略有进步,写报告据网友称有退步。
如果你之前还在用 Opus 4.6 和 GPT 5.6 sol,那么建议升级,直接用最新,更强更便宜。不过思维强度不用保持high,从medium开始比较好。
下面逐一介绍。依次介绍能力和价格的变化,以及部分推特网友反馈。
发布清单
| 模型 | 定位 | 上一代价格 | 新价格 | 变化 |
|---|---|---|---|---|
| Claude Opus 5.5 | 长任务、知识工作 | $5 / $25(Opus 5) | $4 / $20 | 降 20% |
| GPT-6 Sol | 复杂编码、Agent | $4 / $20(GPT-5.6 Sol) | $2 / $10 | 降 50% |
| GPT-6 Luna | 高频、低成本任务 | $0.20 / $1.20(GPT-5.6 Luna) | $0.10 / $0.50 | 输入降 50%,输出降 58% |
价格为每百万 token 的输入 / 输出单价。三款都是百万级上下文,最大输出 128K。
Sol 和 Luna 有个小字:单次请求输入超过 272K token 后,整次请求按更高单价计费。Opus 5.5 没有这条阶梯价。
能力变化
| 模型 | 对比上一代 | 强项 | 短板 |
|---|---|---|---|
| Opus 5.5 | 明显提升 | 编码 Agent、长任务、综合排名第一 | max 档容易想太多,跑不出结果 |
| GPT-6 Sol | 综合持平,编码小幅提升 | 幻觉明显减少,同分数下更便宜 | 报告类交付变短,容易漏要求 |
| GPT-6 Luna | 综合持平,编码略退 | 幻觉减少,单任务成本极低 | 知识工作退步,改代码不如旧版 |
Opus 5.5 这次是能力和价格一起动。Anthropic 那边的说法是,它有 Fable 5.1 的智力,价格比 Opus 5 还低。第三方测下来也确实如此,默认的 medium 档就已经超过 Sol 的最高档。
Sol 和 Luna 更像一轮价格升级。OpenAI 官方说幻觉更少、写作也更好。第三方测到的幻觉下降是真的,但 Sol 主要是靠更多地选择不回答。写作这边反而测到退步:人工检查了几百份输出,报告和文档类交付更短,更容易漏掉任务要求。
价格变化
Sol 和 Luna 单价砍半,Opus 5.5 单价降 20%,缓存读取降 60%。按每项任务的实际花费算,Sol 和 Luna 比上一代省一半左右;Anthropic 称 Opus 5.5 因为更省 token,整项任务成本能低约 40%。
单价之外,还要看跑完一项任务花多少钱。Artificial Analysis 的综合测评里,Opus 5.5 max 平均每项任务约 $6,medium 约 $1.3;Sol max 约 $1;Luna max 只要 $0.07。Opus 5.5 medium 和 Sol max 花费差不多,但分数更高。
跑 Agent 的话,Opus 5.5 的缓存降价对账单影响更大。因为长期vibe coding的朋友都知道,长对话里九成九的输入都走缓存价。
社区用户看法
Simon Willison 已经把 GPT-6 Sol 和 Opus 5.5 设成 Codex 和 Claude Code 的默认模型。在鹈鹕问题上,他发现 Opus 5.5 max 表现较差,过度思考,最后啥也没做出来。
The Decoder 对OpenAI 新模型的评价是「价格砍半,性能几乎没动」。他们还指出 OpenAI 这次挑了评测,常规会放的知识工作和终端编码评测都没放。
OpenAI 开发者社区有人拿三个编码小任务跑了一遍,Sol 和 Luna 全部通过,GPT-5.6 Luna 有一项重跑两次都失败。发帖人认为赢面主要还是来自降价。
推特上,Anthropic 的 Thariq Shihipar 说 Opus 5.5 是照着用户反馈改的,沟通更清楚,也更省 token。OpenAI 的 Thibault Sottiaux 则强调 Sol 和 Luna 在写作上也有提升,这一点和第三方的测评结论对不上,建议自己跑跑看。
思考档位
Simon 用 Opus 5.5 max 画图失败,就是档位拉太高。档位越高,模型花越多 token 想,也越慢、越贵。这次 Opus 5.5 和 GPT-6 的默认都是 medium,不一定要往上加。
从 Opus 5 升上来,别把原来的 high 带过来。Anthropic 自己的测试里,5.5 的 medium 已经追平甚至超过 Opus 5 的 high,同一档位下 5.5 往往还想得更久。GPT-5.6 本来就是 medium,换 Sol 或 Luna 可以先保持,干得不好再往上调。
max 建议在下位模型解决不了的问题时再开。
旧模型怎么换
Opus 4.6 到 Opus 5:换 Opus 5.5,更便宜也更强。走 API 的话 Thinking 关不掉。
Fable 5.1:日常编码和知识工作可以换 Opus 5.5,价格不到一半,综合分还略高。
GPT-5.6 Sol:直接换 GPT-6 Sol,价格减半,写代码更稳。要是主要用来写报告、做 PPT,需要留意输出质量。
GPT-5.6 Terra:换 GPT-6 Sol,两者价格一样,Terra 没什么理由再留。
GPT-5.6 Luna:分类、抽取、格式转换直接换。改代码的任务先抽几份看看,新版这块略弱。
国产同价位
Sol 这一档,国产对手是 GLM-5.3 和 Kimi K3,同价位的 Claude Sonnet 5 也放进来比一下。
| 模型 | 标价(输入 / 输出) | 综合分 | 单任务成本 |
|---|---|---|---|
| GPT-6 Sol max | $2 / $10 | 48 | $1.06 |
| GLM-5.3 max | ¥8 / ¥28 | 45 | $2.01 |
| Kimi K3 max | ¥20 / ¥100 | 44 | $2.00 |
| Claude Sonnet 5 max | $2 / $10 | 38 | $5.09 |
只看分数和单任务成本,Sol 在这一档领先。国产模型的优势在别处:人民币结算、国内直连,GLM-5.3 和 Kimi K3 还开放权重,可以私有部署。
Luna 这一档,国产 Flash 模型分数反而更高,Luna 赢在便宜。这也是某种意义上的对标了。
| 模型 | 标价(输入 / 输出) | 综合分 | 单任务成本 |
|---|---|---|---|
| GLM-5.3-Flash | 约 ¥0.5 / ¥1.8 | 42 | $0.25 |
| DeepSeek V4.1 Flash | $0.15 / $0.60(闲时) | 39 | $0.27 |
| GPT-6 Luna max | $0.10 / $0.50 | 37 | $0.07 |
怎么选
写报告、做 PPT、要覆盖很多细项的分析:Opus 5.5,先用 medium。Sol 和 Luna 这块退步了。
日常写代码、跑 Coding Agent:GPT-6 Sol,从 medium 开始。
批量分类、抽取、格式转换:GPT-6 Luna,用 low 起步。需要人民币结算或国内直连,换 DeepSeek V4.1 Flash 或 GLM-5.3-Flash。
不想花钱:ChatGPT 桌面端的免费 Luna。
参考资料
- Anthropic:Claude Opus 5.5 发布、模型文档、迁移清单
- OpenAI:GPT-6 Sol 和 Luna 发布、Sol 文档、Luna 文档
- OpenAI:推理强度说明、模型与强度选型、GPT-6 迁移指南
- Anthropic:Effort 档位与建议、Opus 5.5 提示词指南
- 社区讨论:Sol high 与 xhigh、Luna 6 与 5.6 high 的用户对比
- Artificial Analysis:Sol 和 Luna 独立评测、模型排行榜、Opus 5.5 vs Sol
- Simon Willison:Opus 5.5、Sol、Luna 和新一轮价格战
- The Decoder:GPT-6 Sol 和 Luna 价格砍半,性能几乎没动
- OpenAI 开发者社区发布帖
- DeepSeek API 价格
- 国产编程模型价格汇总(博客园,9 月 3 日标价)