出品 | 网易智能 作者 | 小小 编辑 | 王凤枝 一夜之间, OpenAI 和 Anthropic 连发三款模型。 北京时间9月23日凌晨,Anthropic先发布Claude Opus 5.5,称典型工作负载的运行成本较上一代下降约40%。几个小时后,OpenAI推出GPT-6 Sol和GPT-6 Luna,API输入、输出单价较GPT-5.6当时的促销价降低50%或更多。 两家公司都把 “ 更便宜 ” 放在发布核心,竞争点也从谁更强,扩展到谁能以更低成本完成工作。 Anthropic拿旗舰降价,OpenAI则为GPT-6补上两档更便宜的模型。 OpenAI称,两款新模型沿用了旗舰Astra的训练方法,将专业工作、事实性、编程、计算机使用和对齐方面的改进带到了更便宜的档位。 不过,两家公司公布的降价百分比并不是同一套口径。 模型如果输出更长、反复调用工具,或者几次失败后才完成工作,最终账单也可能增加。 哪款模型更划算,还得把这笔账拆开来看。 发布当天,OpenAI CEO山姆·奥特曼(Sam Altman)把降价解释为扩大AI使用规模的一步。他表示,希望AI被更广泛地使用,推动一场新的文艺复兴。 便宜多少 开始按任务算 先看最直观的API价目表。Sol每百万Token输入2美元、输出10美元,与Anthropic Claude Sonnet 5相同。Luna的输入、输出价格则分别为0.10美元和0.50美元。 OpenAI 表示,两款模型的新价格都是长期定价,不是限时折扣。 Anthropic同一天公布的Opus 5.5,输入价从5美元降至4美元,输出价从25美元降至20美元,缓存读取价则从0.50美元降至0.20美元。Anthropic还称,Opus 5.5的输出速度较上一代提高30%以上,因此将典型工作负载成本降幅估算为40%。 这个 40% 与 OpenAI 的 50% 以上不能直接比大小。 前者是单价、速度和Token消耗共同影响的典型工作负载成本,后者首先是API单价变化。 Anthropic列举的早期测试中,有用户称曾在不到一天内让Opus 5.5完成68万行代码的迁移。这是公司引用的个案,但它与Opus 5.5的定价放在一起,已经能看出厂商开始怎样卖模型:不只说智能有多高,还要说一份工作多快、多贵。 科技分析师@kimmonismus在当天的复盘中也将能力和成本放在一起看。他提到,Luna在DeepSWE上的表现接近Fable 5中等推理强度,但OpenAI估算的单任务成本低96%。 近日,xAI发布Grok 4.7,小米也推出MiMo-V2.6系列。一周之内,从闭源旗舰到开放权重模型,主要厂商的新品接连上线,价格与能力被同时摆到了比较表里。 Box CEO亚伦·莱维(Aaron Levie)认为,AI任务成本下降,会扩大能够部署智能体的场景;成本越低,企业和开发者越愿意尝试,新增需求反过来又会推高AI使用量。 Sol 更便宜 提升却不是每项都有 价格算清以后,还要看Sol究竟能接下哪些工作。它位于Astra之下,官方公布的多项结果显示,部分高端模型的能力已经被带到更低的价格档。 在 OpenAI 公布的 AutomationBench 对照中, Sol 在 xhigh 推理强度下得分 33.2% ,比低推理强度的 Astra 高 2.9 个百分点,单任务成本则只有后者的约四分之一。 与最高推理强度的Claude Opus 5相比,Sol得分更高,单任务成本约为其十一分之一。 软件工程测试DeepSWE v1.1中,Sol在max推理强度下得分68.8%,与Claude Fable 5在xhigh档位的69.9%相差1.1个百分点,OpenAI估算其单任务成本低约80%。 OpenAI在OSWorld 2.0离线集中列出的,是不同推理档位下的结果:Sol在xhigh档位得分60.5%,Claude Opus 5在medium档位得分60.3%;按OpenAI估算,前者的单任务成本低约80%。 事实性的变化更复杂。OpenAI的内部测试显示,Sol的事实错误率大约只有上一代的一半。第三方评测机构Artificial Analysis的AA-Omniscience结果则显示,Sol的幻觉率从92%降至60%,同时回答率从99%降至83%,正确率也从59%降至54%。 它更少给出错误答案,但也更频繁地选择不回答。 Artificial Analysis给Sol的编程智能体指数打57分,比上一代高2分,Terminal-Bench 4.0和SWE-Atlas-QnA等项目有所提高。按该机构估算,Sol每项任务约2.99美元,较上一代下降约一半。 知识工作则没有展现出同样的趋势。 Sol 在 GDPval-AA v2