奥特曼跟达里奥打起来了?老马提前两天已出牌!Token标价失效:巨头前沿模型集体转向任务级竞争

三家实验室48小时内四款新模型落地,大模型竞争正从性能登顶转向推理经济学。token单价正在失效,任务总价、缓存成本与超长请求加价,成为新的胜负手。

图片

xAIGrok4.7在9月21日上线,紧接着AnthropicClaude Opus5.5OpenAIGPT-6 Sol、GPT-6 Luna相继登场。

四款模型,三家实验室,表面看是各说各话的密集发布,把三份公告放在一起读,会发现它们其实在回答同一个问题,有限的算力,怎样花才算花得值


降价五成,省出来的不是让利,是推理效率

OpenAI给出的数字最直接。

Sol的API定价为每百万输入token2美元、输出10美元,Luna打到0.1美元和0.5美元,且明确为永久定价,不是限时促销。

Orange AI on X: "GPT 6 全系列更新,Sol 和Luna 价格下降50%,并且学会了说人话,而Terra 消失了。 GPT 6  Sol 和Luna 使用了与Astra 类似的训练方法,能力更强,对齐更好,价格更低。 在

比标价更值得注意的细节是缓存命中的读取仅为普通输入价格的10%,官方称在GitHub Copilot的大规模负载里,需要全新计算的prompt token已经减少过半。

Anthropic的口径相似。

Opus5.5基础定价较Opus5下调20%,缓存读取价格下降60%,官方测算典型工作负载整体成本降低约40%,输出速度提升超过30%。

huangserva on X: "Opus 5.5 单价比Opus5.0 降了20%,除了这个之外,说点不知道的(建议收藏)  我把官方说明从头看了一遍,除了省钱,它还有三个优点,另外有三个地方要在用之前先知道。 优点有三个: 1️⃣ 写代码和审代码提升最大

xAI的选择是另一种意义上的降价。

Grok4.7维持每百万输入2美元、输出6美元的标价,与一个月前发布的4.6完全相同,这已经是该系列连续第三代价格不动。

耳朵on X: "AA Index 说Grok4.7 仅次于GPT 和Claude,但是看到很多推友测试的结果都说它甚至不如Grok 4.6,  我测试了鹈鹕骑自行车和星舰

但标价都有超长尾巴,OpenAI规定单次输入超过27.2万token,整个请求改按输入2倍、输出1.5倍计费,xAI则规定提示词达到20万token后整个请求按2倍计费。拿着百万上下文标价的开发者,真实账单往往从超长请求才开始。

还有一个常被忽略的变量。

OpenAI的定价页保留了Batch与Flex通道,异步请求可以再打五折,而Grok4.7干脆不支持Batch接口。

隐性低价通道是否存在,本身就是策略差异。更要看到,缓存并非无成本,写入缓存前缀要按1.25倍输入价收费,第二次复用才开始回本,而缓存本体占用显存,复用率越高,对集群显存的压力越大。降价不是凭空发生的,它是拿显存资源和调度复杂度换出来的

图片








token单价正在失去意义,任务总价取而代之

Grok4.7提供了一个教科书式的样本。

第三方机构Artificial Analysis的实测显示,它在xhigh档位下智能指数从4.6的44分升到46分每任务成本却从1.86美元涨到3.74美元,评测中生成的token从9400万涨到2.4亿,输出速度从每秒60.4个token降到38.8个。

图片

单任务平均输出量从3.6万token膨胀到8.1万。单价一分没涨,把一件事做完的总价和等待时间都翻了一倍。

需要说明的是这轮膨胀集中在xhigh超高评测档位,日常默认的high档输出量明显收敛。

这正是本轮所有新品共同的主线。

拉高推理强度,同时带来三件事,能力提升、token输出暴涨、时延成倍拉长,选型要做的是能力、总消耗、时延的三维权衡,而不是盯着最高档的分数。

OpenAI官方口径称GPT-6 Sol在AutomationBench的xhigh强度下表现优于Claude Opus5单任务成本仅为后者的9%。为了让档位调节不至于击穿缓存,OpenAI还改了缓存机制,对话中途切换推理强度或开关工具,不再导致缓存前缀作废。

当然,AutomationBench这类基准全是标准化测试集,与真实业务场景之间仍有落差,官方测出的单任务成本9%,落到真实负载里会浮动。

对采购者来说,该问的问题已经变了,不再是每百万token多少钱,而是把一项具体工作从头做完,要花多少钱、等多久。计价单位从token迁移到任务,这是比任何单点降价都深刻的行业变化

图片

数据的新边疆,藏在物理世界里

Grok4.7训练中一个被低估的细节是xAI引入了SpaceX的工程数据作为补充训练语料,包括卫星遥测、制造记录和工程故障日志。

故障日志尤其值得玩味,它本质是大规模的负样本,记录的是系统在真实环境里怎样失效。

当公开互联网文本趋于见顶,差异化的来源正在从算法转向数据的所有权,从比拼网页爬虫的规模,转向比拼企业级私有日志、设备遥测和仿真数据的获取权限。

只是这类护城河有边界。

私有工程数据样本总量有限,很难复现通用大模型的训练规模,它撑起的是特定领域的局部优势,而不是全面的通用能力。

能力分化的极端程度也超出直觉,Grok4.7在Harvey法律Agent基准上拿到19.6%,约为Claude Fable5.1的3倍、GPT-5.6 Sol的7倍多。

但同在专业领域,它的HealthBench Professional临床推理得分56.7%,又低于Fable5.1的62.1%

没有全能选手,只有错位竞争,选型逻辑从选最强的模型,变成选最对口的模型

图片

自报数字与独立复测之间,裂缝在扩大

发布越密集,数字越需要拆开看。

Grok4.7官方公布的Terminal-Bench4.0成绩为38.0%,独立复测得到的数字是26%。分数差异官方没有给出明确解释,推测来自评测采用的推理档位、提示词配置不同。

Announcing GPT-6 Sol and GPT-6 Luna in the API, Codex and ChatGPT -  Announcements - OpenAI Developer Community

更大的问题是厂商榜单几乎全部用最高档位跑分,而绝大多数业务只会用medium或high档,不标注推理强度的公开分数,参考价值正在缩水

OpenAI发布当日的对比表,引用的对象仍是Opus5,因为Opus5.5同日发布,没有出现在任何一张官方图表里。优先使用已有公开基准版本做横向对照,是发布会上的常见做法,但读者需要知道图表的边界在哪里。

独立评测机构的分量在上升,也不必把它当成绝对标准。

Artificial Analysis的智能指数榜上,Opus5.5以58分位列第一,Fable5.1与GPT-6 Astra均为53分。这个排序与各家厂商自己的宣传口径都不完全重合,恰好说明第三方坐标系的价值。

同时Agent类基准本身波动很大,调用参数、版本迭代、限流策略都会带来分数漂移,第三方复测适合用来做交叉校验,而不是标准答案。往后看模型榜单,出处分量不低于分数本身。

图片

安全从后台测试,走到了发布会的聚光灯下

Opus5.5在Anthropic的自动化行为审计中拿到该公司迄今所有模型里的最高得分,并在发布前接受了METR与Frontier Design两家外部机构的评估。

此前Amodei公开呼吁前沿AI应当把控迭代节奏,而Opus5.5正是该表态之后Anthropic推出的新一代前沿模型。呼吁与发布并行不悖,本身构成了一种张力,也构成了一种信号。

xAI同样把安全当成了主打参数。

Grok4.7换上全新安全栈,在HackerBench v0.3上仅放行3.3%的高风险双用途提示,同时尽量不误伤合法的安全研究。

两点保留意见同样值得写下。

安全基准和性能基准一样存在过拟合风险,模型可能针对测试集优化对齐,面对真实世界里新型的越狱手法,防护效果会打折扣。

更强的护栏也必然带来更高的合法请求误拒率,安全不是单向越高越好,而是一种需要明说取舍的产品参数

图片

两个还悬着的问题

供给侧的价格战已经打完,需求侧能否接住,还没有答案。

企业客户是否愿意为Agent工作流持续消耗以亿计的token,市场真实的付费意愿能不能承接现在的低价供给,需要接下来几个季度的调用量数据来验证。

一个可参考的信号是GPT-6 Astra发布后曾因需求激增一度暂停新的Pro订阅注册,而Sol与Luna的任务之一,就是把高频需求疏导到成本更低的模型上,在扩大规模的同时减轻基础设施压力。

第二个问题是产品线分层能否跑通。

OpenAI明确Astra仍是定位最高的旗舰,Sol与Luna往下沉,Anthropic则预告Sonnet5.5与Haiku5.5将在数周内跟进。

旗舰树立技术形象,中低价档位负责走量的结构已经清晰,但如果中低端撑不起足够的调用量,整个商业闭环就会承压。产品线内部互相替代的速度,可能比我们想象的更快。

图片

尾声

下一轮大模型竞争,看点不在参数表和发布会口号上,而在几件可以验证的事情里,每任务成本、缓存复用率、自报数字与独立评测的一致程度,以及各家对超长请求、批量通道的不同计费规则。对使用者和观察者来说,盯住这几件事,比追逐任何单次发布都更接近这个行业真实的进展

- END -


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信