打开APP

GPT-5.6一夜爆砍80%,1元屠杀最贵Claude!

OpenAI的GPT-5.6降价,Luna每百万Token输入0.2美元输出1.2美元,能力未缩水,反超Anthropic的Fable 5,7月Codex等活跃用户超千万。

一觉醒来,OpenAI给GPT-5.6 Luna来了一记「脚踝斩」。

价格直接砍掉了80%——

每百万Token,输入0.2美元,输出1.2美元。

价格低成这样,能力却没跟着缩水。

在专业评测Agents’ Last Exam中,Luna不仅反超了Anthropic最贵的Fable 5。

而且执行单个任务的成本,只有对方的越1%。

更魔幻的还在后面。

这轮降本的背后,是GPT-5.6 Sol亲自下场,重写并优化了运行自己的生产内核。

然后再加上其他优化,端到端服务成本就这么水灵灵地降了20%。

是的,AI开始给自己打工了。

01、三档模型,一夜大洗牌

GPT-5.6分三档:Sol是旗舰,Terra是日常平衡,Luna是最快最 便宜那个。这次屠刀砍的是后两位。

新旧一比更直观。

Luna的输入从$1干到了$0.20,输出从$6干到了$1.20,一口气削掉八成;

Terra的输入从$2.50降到$2,输出从$15降到$12,降了两成。

Sol则维持$5和$30不变。

对开发者来说,最直接的感受是,大批量调Luna,成本几乎可以忽略不计了。

一个跑几十万次模型调用的Agent工作流,过去光token费就是一笔大开销,现在Luna把它压到不用算的程度。

而且,订阅用户也没被落下。

Codex和ChatGPT Work的月费和额度没变,但用Luna和Terra干活时消耗的积分更少了,能干的活更多了。

不仅如此,Sol这边加了个Fast mode,替代原来的Priority Processing。

最高2.5倍速度,价格翻倍,智能水平一点没变。

在Codex里对应/fast指令,之前标priority的请求自动切换。对延迟敏感的场景,这就是个用钱买速度的开关。

借着这波操作,App里那个「替我审核」(auto-approve)功能也改成了用Luna来提前拦截主agent的高风险动作,直接把成本降了约10倍。

降本的活,Sol自己干了

能砍这么狠,是因为Sol通过Codex接进了OpenAI的生产推理栈,自己动手,把跑它自己的那套系统优化了一遍。

Codex负责人Tibo把这套打法概括成两步。

首先训出一个足够强的模型,然后再用这个模型去把一切变得更好,包括但不限于运行它自己的基础设施、推理栈和内核。

具体到这次,GPT-5.6总共针对四个问题进行了优化。

1. 负载均衡。

OpenAI的请求会按地域、容量、加速器类型分发,集群内再按负载、上下文长度、缓存可用性进行分配。

解法:Sol分析了生产流量,揪出工程师之前没注意到的负载不均,测试了新的路由策略。

2. GPU内核。

模型的前向传播靠内核执行数学运算,但内存搬运、同步、数据布局不合理会让GPU闲置。

解法:Sol找到了能预计算、能跳过、能并行的工作,用Triton和Gluon这两种OpenAI维护的GPU编程语言,自主重写并优化了生产内核。这些改动加上更广泛的内核优化,把端到端服务成本压低了20%。

3. 推测解码。

这套技术让一个更小的draft模型先猜几个token,主模型并行验证,猜对了一次就能多输出几个token。

解法:Sol针对draft模型设计并跑了数百次架构实验,改尺寸、改结构、改特性,还自己启动并盯着训练流程,遇到硬件故障和训练不稳定主动介入。token生成效率因此提升超过15%。

4. KV缓存和配置调优。

batching、sharding、KV管理的最 优配置高度依赖负载,由于配置空间太大,基本全靠工程师的经验来做。

解法:Sol分析生产负载,生成并评估候选配置,把过去调不动的东西调到极 致。

不过,Sol写的内核不能直接上线。OpenAI会用开源工具FpSan(浮点数消毒器),把结构、数据流一项项查过去,确认没问题才放行。

看看内部数据,就能知道这个循环转得有多快。

GPT-5.6内测阶段,每位活跃研究员的日均token输出,是GPT-5.5时代峰值的两倍以上。

过去半年,内部代码推理研究算力占比涨了100倍,内部智能体token用量涨了约22倍。

省下的算力,直接变成了降价的底气。

20美分,反超Anthropic最贵的那个

毫不夸张地说,如今的GPT-5.6系列已经正式站到了价格/性能效率的帕累托曲线上。

在横跨55个领域、评估长周期专业工作流的评测Agents' Last Exam上,Luna的得分直接反超了Anthropic的旗舰Fable 5。并且,单任务成本只要1%,而速度却高达9倍。

第三方评测机构The Agent Report的拆解同样显示,GPT-5.6三档在Agents' Last Exam上均高于Fable 5。

此外,在DeepSWE上,Luna每美元能换约24个基准分,而Fable 5只有约3.2,效率差出5到7.5倍。

02、收入加速,Codex杀回来了

综合来看,让GPT-5.6刚发布三周就降价的压力,主要来自两个方面:

开源模型的价格碾压:中国模型的token成本整体比美国同行便宜最高9倍

Anthropic在企业市场的猛攻:Claude Code今年初在编程工具市场领 先,5月公布年化收入超过470亿美元。

但比降价先到的,是收入。

在7月29日的内部会上,CFO Sarah Friar表示——

Codex和ChatGPT Work加起来,活跃用户已经过了1000万,两周翻了近一倍。 

基于此,OpenAI单7月一个月的年化经常性收入,直接超过了整个第二季度。

而且,这里面有一部分增长,还是从Anthropic那边抢来的。原因正是在于,Claude Code的账单太高,用户纷纷开始找替代方案了。

不过,虽然价格战能拉升使用量,但也会压利润率。

在EMARKETER分析师Jacob Bourne看来,「疯狂刷token的时代结束了」,企业开始要清晰的投资回报率。

但OpenAI不怕降价,因为帮它把效率推上去的,是它自己的模型。

最后,真正决定格局的,是谁能在同样一张卡上榨出更多的智能。

【本文由投资界合作伙伴微信公众号:新智元授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

AI数据总览

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】