一句话答案
本周二(2026 年 9 月 22 日),OpenAI 把 GPT-6 Sol 与 Luna 的 API 价格砍半,Anthropic 在几个小时内发布了运行成本低 40% 的 Claude Opus 5.5——前沿级智能的价钱几乎一夜对折,而从这天起决定你技术选型的指标是「每完成一件任务的成本」,不是谁坐在排行榜第一。
这种星期会安静地改变地基。我先看了一期把当天发布全讲一遍的 AI 新闻视频(链接放在文末),然后回到一手来源——OpenAI 与 Anthropic 自己的发布页——把每个头条数字逐行核对了一遍。
问题:为什么「用最强模型就对了」不再成立
2026 年大半年的时间里,建议都很简单:挑你能负担的最聪明的模型。现在有两件事把它推翻了:
- 最强的那个每周都在换。 GPT-6 Astra、Claude Fable 5.1、Mythos 5.1、Opus 5、Grok 4.7 轮着坐庄,比你的习惯更新得还快。
- Agent 类工作会把每一分钱放大。 单次对话花多少就是多少;但一个会规划、调工具、读文件、反思再改的 agent,可能把同一段 10 万 tokens 的上下文重放十几次。你的账不是那段提示词,而是提示词乘以步数。
两家的动作都印证了这一点:这周的两个发布,都不是「更聪明」,而是「每完成一件活儿更便宜」。
实际发布了什么
1. GPT-6 Sol 与 GPT-6 Luna(OpenAI)
GPT-6 Astra 本月初刚作为旗舰发布。Sol 与 Luna 把那一代的训练方法搬到了价格曲线的下半段:
- GPT-6 Sol: 每百万 tokens 输入 2 美元、输出 10 美元(原为 4 / 20 美元),双向便宜 50%。
- GPT-6 Luna: 输入 0.10 美元、输出 0.50 美元(原为 0.20 / 1.20 美元),相比 Claude Sonnet 5 的 2 / 10 美元相当于打了 95% 的折。
OpenAI 对媒体确认这是永久定价,不是限时促销。注意 Sol 落在哪里:正好压在 Claude Sonnet 5 的价格上,是 Opus 5.5 的一半。
性能叙述这次用的是「每任务成本」,不是跑分排名:
- AutomationBench(覆盖 47 个工具的业务流程测试)上,GPT-6 Sol 在 xhigh 档得 33.2%,每件任务 0.27 美元,以 1/11 的成本击败在 max 档的 Claude Opus 5。
- Agents' Last Exam 上 Sol 最高档得 56.4%,高于 Claude Opus 5 的最佳成绩,每任务成本低 60%。
- DeepSWE v1.1(真实代码库工程任务)上 Sol max 得 68.8%,只比 Claude Fable 5 的最佳成绩 69.9% 低 1.1 个百分点,而每任务成本低约 80%。Luna max 得 66.6%,每任务比 Opus 5 便宜 93%。
- OSWorld 2.0 offline(电脑操作)上 Sol xhigh 以 60.5% 追平 Opus 5 medium 的 60.3%,成本低约 80%。
有两个细节比图表更实用。第一,OpenAI 同时改进了 GPT-6 的 prompt 缓存:缓存命中的输入 tokens 打一折,而且中途调整推理档位或开关工具都不再让缓存失效。第二,上线是分批的:付费方案的 ChatGPT Work 与 Codex 当天可用,免费与 Go 用户可在桌面端用 Luna,API 里已可用 gpt-6-sol 与 gpt-6-luna——但还没进 Chat。
2. Claude Opus 5.5(Anthropic)
同一天,Anthropic 发布了新 Claude 5.5 家族的第一个模型:
- 每百万 tokens 输入 4 美元、输出 20 美元。 缓存读取从 0.50 降到 0.20 美元,比 Opus 5 便宜 60%。
- Anthropic 称在默认档位上,它比 Opus 5 在典型工作量上便宜 40%:不只是单价更低,而是完成同一件事用的 tokens 更少。输出速度比 Opus 5 快 30% 以上。
- 跑分:Terminal-Bench 4.0 得 66.4%(Fable 5.1 为 55.8%、GPT-6 Astra 为 57.9%),FrontierCode v1.1 Main 得 54.4%,GDPval-AA v2.1 得 1846 Elo——后者覆盖 44 个职业的真实工作。
- 在 FrontierCode 默认档位上,它击败 GPT-6 Astra 的最高分,而每任务成本只要对手的约 20%;在 CursorBench 上比 GPT-5.6 Sol 高 11 分,成本约为其三分之一。
- Anthropic 同时确认 Claude Sonnet 5.5 与 Haiku 5.5 会在未来几周内跟进,并提高了订阅制的用量上限,还把一次「重置额度」做成可以存起来、想用再用的形式。
3. 同一周的另外三个信号
- 阿里在云栖大会预告了 Qwen 4 家族:Qwen 4 Max、Plus、Flash,以及一个 Qwen 4 27B——最后这个最值得注意,因为 27B 正是你可以在本地跑起来的规格。模型仍在训练中。
- 腾讯 Hy Image 3.5 preview 上线,国际 API 约 每张图 0.024 美元(国内 2K 为 0.15 元),参考图和失败生成不计费——图像生成也在走同一条成本曲线。
- 命名的角力。 9 月 22 日特朗普在联合国讲话时,指示美国政府文件以后用「super intelligence(超级智能,SI)」而不是「artificial intelligence」,理由是「人工」这个词让人以为技术是假的。这是语言层面的事,但如果你在这个行业写作或销售,词汇表将会跟着动。
真正该算的账:不是每 token 价格,而是每任务成本
单价最容易比较,也最容易误导。拿一个真实的 agent 活儿举例:一次长代码审阅,上下文 20 万 tokens(其中 18 万命中缓存),输出 1.5 万 tokens。
- GPT-6 Sol: 这活儿约 0.23 美元。
- Claude Opus 5.5: 约 0.42 美元,约为 Sol 的 1.8 倍,能力剖面相近。
- GPT-6 Astra(假设同样一折的缓存折扣):约 1.13 美元,是 Sol 的 5 倍。
- GPT-6 Luna(便宜层):约 0.01 美元。
一个月跑 100 件这样的任务,范围是从 1 美元到 113 美元——做的是同一批能合并的活儿。决定你要不要自动化一段流程的,是这道差距,而不是跑分上那两分。
如果你是一个人公司,这改变什么
你不需要一堆模型,你需要三条路由规则:
- 便宜层做量。 Luna 级价位(0.10 / 0.50)用来抽取、分类、摘要、打标签、写初稿,以及任何你反正会看一遍的东西。每件一分钱,比你决定「要不要跑」所花的时间还便宜。
- 中档层做日常交付。 Sol、Sonnet 5、Opus 5.5 用来做真正要出货的活:功能代码、代码审阅、文档起草、研究整料。你大部分工时应该落在这里,因为每任务是几分钱而不是几美元。
- 旗舰层做一次性难题。 Astra 与 Fable 5.1 仍然赢在「答错很贵」的地方:架构决策、深度调试、长迁移,以及任何你难以验收的东西。为了那 5% 的任务付 5 倍价钱,是划算的。
两个习惯让分层真正省钱。第一,让提示词对缓存友好:前缀稳定,一折的缓存输入价在 agent 循环里就是真金白银;两家最近都允许你在不破坏缓存的前提下切换推理档位或工具。第二,追踪「每完成一件任务的成本」,而不是每 token 价格:把每件活儿的实际花费记下来,让日志替你选模型——因为那个「便宜但要多重试一次」的模型,其实并不便宜。
战略上的读法很简单:前沿模型现在不再是卖智能,而是卖经济性。如果你的竞争对手这个月还没给自己的流程重新定价,你现在就多了一套他们没有的成本结构。
重点整理
- OpenAI 的 GPT-6 Sol(2 / 10 美元)与 Luna(0.10 / 0.50 美元)比 GPT-5.6 一代便宜 50%,且被确认为永久定价。
- Anthropic 的 Claude Opus 5.5 是 4 / 20 美元,缓存读取便宜 60%,典型工作量运行成本比 Opus 5 低 40%;Sonnet 5.5 与 Haiku 5.5 几周内到。
- 「每完成一件任务的成本」= 单价 × 实际消耗 tokens × 调用次数,这是两家现在竞争的指标,也是你该追踪的指标。
- 同一周还有:Qwen 4(含 27B 本地模型)、约两分钱一张的 Hy Image 3.5,以及美国政府把 AI 改称「超级智能」。
- 对独立经营者来说,赢法不是选一个冠军,而是三层路由 + 让提示词可缓存 + 记录每件完成任务的成本。
想补背景,可以看OpenAI GPT-5.6 发布时那套三档定价意味着什么,以及按厂商逐一对比的2026 年 LLM API 价格深度分析。
本文依据的当日新闻汇总视频:GPT-6 Sol 与 Luna、Opus 5.5、Qwen 4、Hy Image 3.5 全解析。一手来源:OpenAI:Introducing GPT-6 Sol and Luna 与 Anthropic:Introducing Claude Opus 5.5。




