OpenAI发布GPT-6 Sol与Luna,性能超越旗舰模型
2026-09-23 04:49 loading...
周二,OpenAI正式发布两款新生成式AI模型——GPT-6 Sol与GPT-6 Luna,旨在应对Anthropic最新推出的Claude Opus 5.5带来的市场竞争压力。
模型定位与竞品对标
GPT-6 Sol和Luna被设定为低于旗舰模型GPT-6 Astra的轻量级选项。Astra仍被视为处理复杂任务的首选,而这两款新模型则聚焦于日常办公场景,提供更快响应速度与更低使用成本。
其产品层级对应关系如下:
Astra 对应 Fable
Sol 对应 Opus
Terra 对应 Sonnet
Luna 对应 Haiku(升级版)
价格调整与成本优势
为提升市场吸引力,OpenAI将两款模型的API每令牌费用下调50%。其中,“令牌”是文本处理的基本单位,通常接近一个单词,企业按百万计费以管理大规模应用支出。
具体定价如下:
GPT-6 Sol:输入价每百万令牌2美元,输出价10美元(原为4美元和20美元)。
GPT-6 Luna:输入价每百万0.10美元,输出价0.50美元(原为0.20美元和1.20美元)。
整体来看,在同等性能层级下,OpenAI提供的解决方案具备更强的价格竞争力。
性能测试表现对比
在Zapier开发的AutomationBench测试中,评估AI代理在涵盖销售、营销、财务、人力等47个工具中完成完整工作流的能力,以通过率作为核心指标:
GPT-6 Sol在最高推理设置下得分为33.2%,每项任务成本0.27美元;而Claude Opus 5在顶级配置下得分26.9%,但每任务成本高出逾11倍。同时,该测试显示,GPT-6 Sol也略微领先于更昂贵的Claude Fable 5.1。
另一项名为“Agents' Last Exam”的长期任务评估测试中,衡量AI在55个子行业中的持续执行能力:
GPT-6 Sol在最高努力模式下取得56.4%完成率,不仅超过Claude Opus 5的最佳成绩,且任务成本低60%。
推理能力与自动化表现
OpenAI引入“推理努力”调节机制,允许用户根据需求增加模型自我校验的时间与计算资源,从而提升准确性,但相应提高运行开销。
在模拟真实计算机操作的OSWorld 2.0测试中,GPT-6 Sol得分为60.5%,几乎持平于Claude Opus 5的中等努力模式(60.3%),但成本降低约80%。该测试关注长期自动化任务的准确完成度,并支持部分得分。
上线进度与可用范围
GPT-6 Sol与Luna目前已在ChatGPT Work及Plus、Pro、Business、Enterprise和Edu订阅用户的Codex服务中上线。Luna亦通过桌面端向免费用户和Go会员开放。
目前尚未接入普通版ChatGPT应用。OpenAI表示,为确保系统稳定,将分阶段逐步推进模型部署。
相关阅读
-
OpenAI发布GPT-6 Sol与Luna,对标Anthropic强化性价比竞争矿业头条 2026-09-23 04:41