核心事件速览
OpenAI 于 2026 年 9 月 23 日正式发布 GPT-6 系列新成员——GPT-6 Sol 与 GPT-6 Luna。两款模型基于与 GPT-6 Astra 相同的训练方法打造,旨在将 Astra 的先进性能以更低延迟与成本提供。
关键硬信息如下:
- 发布时间:2026 年 9 月 23 日
- 新模型名称:GPT-6 Sol、GPT-6 Luna
- API 价格变化:较 GPT-5.6 促销价下降 50%
- 开放时间:即日起上线
- 可用渠道:ChatGPT Work、Codex(Plus 及以上用户可用);免费用户与 Go 用户可在桌面端使用 Luna;Chat 通道暂未开放
- 模型 ID:API 中以
gpt-6-sol与gpt-6-luna提供 - 是否开放权重:文中未提及开源或权重开放信息
性能表现:多维度对齐 Astra 级能力
GPT-6 Sol 与 Luna 并非降级简化版,而是在多项专业场景中达到接近甚至超越前代旗舰的水平。
**自动化业务流程测试(AutomationBench)**中,GPT-6 Sol 在 xhigh 强度下性能优于 Claude Opus 5,成本仅为后者的 9%;GPT-6 Luna 在 high 强度下较前代提升 5.4%,单任务成本降低 58%。
**智能体能力(Last Exam)**方面,GPT-6 Sol 在 max effort 下得分 56.4%,超过 Claude Opus 5 的历史最高分,同时成本降低 60%。
令人意外的数据出现在计算机操作能力:尽管 OpenAI 明确指出 GPT-6 Astra 仍是其最强计算机操作模型,GPT-6 Luna 在 OSWorld 2.0 offline 测试中以 max effort 测得60.5% 分数——与 Claude Opus 5 的 medium effort(60.3%)接近,而成本仅为后者的约十分之一;GPT-6 Sol 在 xhigh effort 下得 60.5%,也逼近 Opus 5 medium effort 水平。同等性能下成本差距达到 80%~90%,构成本次发布最大反差:以中端模型实现旗舰级操作能力。
编程与可靠性升级
两款模型均针对 AI Coding Agent 工作负载优化,答案更简洁、技术表达更清晰,减少冗余术语与低价值细节。
编程测试表现:
- FrontierCode 1.1 Main:GPT-6 Sol 显著优于 GPT-5.6 Sol,以更低代价达到 Claude Fable 5.1 xhigh 水平
- DeepSWE v1.1:GPT-6 Sol 在 max effort 下得 68.8%,距 Fable 5 最高分(69.9%)仅差 1.1 个百分点,单任务成本低约 80%;GPT-6 Luna 单任务成本较 Opus 5 与 Fable 5 分别低约 93% 和 96%
事实可靠性方面,GPT-6 Sol 在真实对话评估中错误率约为前代一半,接近 Astra 级可靠性;Luna 事实准确性同步提升。
OpenAI 还强化了提示缓存机制,默认提供更高缓存命中率,使智能体能更高效复用上下文,降低重复推理成本。
价格与版本对比
下表汇总关键 API 价格与性能对比信息(仅限原文所述数据):
| 场景 | 模型 | 性能对比 | 成本对比 |
|---|---|---|---|
| API 价格基线 | GPT-6 Sol/Luna | — | 较 GPT-5.6 促销价 -50% |
| AutomationBench xhigh | GPT-6 Sol vs Opus 5 | 优于 Opus 5 | Opus 5 的 9% |
| Last Exam max effort | GPT-6 Sol vs Opus 5 | 高于 Opus 5 历史最高分 | Opus 5 的 40%(-60%) |
| OSWorld 2.0 Luna max effort | 接近 Opus 5 medium effort | 60.5% vs 60.3% | Opus 5 的 约 10% |
| DeepSWE v1.1 Sol max effort | 68.8% vs Fable 5 最高 69.9% | -1.1 个百分点 | Fable 5 的 约 20%(-80%) |
| DeepSWE v1.1 Luna max effort | 接近 Opus 5/Fable 5 medium effort | 中端表现 | Opus 5 的 7%(-93%);Fable 5 的 4%(-96%) |
落地建议
- 推荐立即使用:对成本敏感、但对智能体任务(尤其是编程、跨应用流程自动化)有稳定性能需求的开发者与企业,GPT-6 Sol 与 Luna 是高性价比选择;特别是 Luna 作为免费用户可用入口,适合作为轻量代理的训练与测试模型。
- 建议继续观望或使用 Astra:若任务极度依赖计算机操作稳定性(如复杂 UI 交互、多软件协同控制),GPT-6 Astra 仍是官方唯一强推荐模型;追求“无妥协体验”的专业场景仍应选 Astra。
写在最后
GPT-6 Sol 与 Luna 的发布标志大模型市场正从单一旗舰策略转向分层供给:以价格杠杆释放性能冗余,让中等强度智能体任务规模化落地成为可能。当成本下降一个数量级而性能仅轻微降级,行业应用的临界点正在到来。




