Token经济刚落地, 行动经济就开始了?GPT-6之后,GPU又不够快了!

GPT-6的本质不是分数跃升,而是AI从按字计费的语言模型,变成按任务计价、依附环境运行的操作系统。计价、算力、能力三个锚点同时迁移,旧世界的成本公式全部失效。

图片

这会儿,我估计跑分截图已经刷满你的信息流。

ARC-AGI-3从上一代的7.8直接干到99.9,ExploitBench满分,FrontierMath 97.6。先说明一点,这些数字全部来自官方受控基准测试,是能力上限的演示,不等于所有通用场景的实测表现,第三方测评里它同样存在反输竞品的项目。

分数看看就好,真正值得盯着的是价目表

API每百万输入token10 美元,输出50 美元。对照前代旗舰GPT-5.6 Sol的现行促销价4和20,输入输出都涨到2.5 倍;对照8月调价前的标价5和30,则是输入2倍、输出约1.7倍。而且那个促销价本身是限时政策,随时会收回,不是常态锚点。

官方的解释只有一句话,按词元计价这件事已经过时了

这句话的杀伤力,比所有跑分加起来都大。


为什么token会过时?

聊天时代一个token就是一次计算,token和算力几乎画等号,按字收费天经地义。

Agent时代不是。

Astra展示的核心已经是Computer Use,是操作电脑、跑代码、调工具、连环境。

一个token发出去,背后可能触发搜索、浏览器、Python、数据库和一连串工具调用,一条执行链上几十个动作。字还是那么多字,计算早就不是那个计算了。

token 计量得了语言,计量不了行动

所以OpenAI在赌一件事,换掉账本。

按任务收费,完成一次财报分析多少钱,完成一次代码上线多少钱,做完一个视频多少钱,收费对象从Token滑向Result。

图片

这里必须泼一盆冷水,按结果收费的落地门槛极高,什么叫完成、怎么验收、怎么核定报价,全行业都没有统一标准,连Stripe这样的支付基础设施服务商都把按成果收费列为实现复杂度最高的一档。

眼下token计价仍是绝对主流,按任务收费是趋势宣言,不是既成事实。

而且OpenAI并不孤单。

Anthropic 的Fable和Mythos标价完全相同,都是10和50,但访问权限按安全等级切开,Mythos只向可信访问计划开放,这是按权限分层准入,同一模型,两种笼子。

更下游的应用层,Intercom的客服AI Fin按成功解决的工单收费,每单0.99美元,Salesforce的Agentforce按对话收费,失败了不算钱。

从字到行动再到结果,三条收费曲线已经同时在跑。


GPU

这件事传到算力产业那一头,会掀起更安静的地震。

过去整个AI产业的算力账都围绕训练算,训练一次,推理万次,硬件卷的是训练效率。

Agent时代这笔账反过来,一个Agent连续工作几小时,一天可能推理几万步,真正吃掉算力的是永不停歇的推理

服务器设计、HBM容量、缓存、互联、电源散热,全部开始围绕推理的数据流重新设计。

而推理的天花板早就不是算术单元,是数据搬运,是HBM带宽,是GPU之间搬来搬去的开销,业内存储系统即计算机的思想正在从口号变成设计原则。

顺着推一步,就会撞见一个中文圈几乎没人提的新指标。

既然瓶颈是推理时长而不是单次生成速度,衡量一块GPU的标准就彻底变了。以前是每秒多少token,以后是在线时长,是每块卡一天能同时养活多少个Agent

这个指标一旦成立,会同时改写芯片厂商的产品定义、云厂商的售卖逻辑和整个推理经济的商业模式。目前它还停留在推演阶段,但方向几乎确定。


SYSTEM

能力这一侧同样在换坐标轴。

过去十年Scaling Law只有三根轴,更多数据、更多参数、更多算力。

Astra这一代开始,越来越多能力来自Agent、工具调用、强化学习、记忆和环境,能力不再只从训练里长出来,开始从系统里长出来。

图片

模型能力越来越离不开浏览器、文件系统、代码环境和工具链,模型加环境才是完整的战斗力。

一个越来越不像App、越来越像操作系统的东西正在成形,未来所有能力都要跑在它上面。GPT-6宣告结束的,不是GPT时代,而是只靠预训练就能一直进步的时代。

还有一个更冷的角度藏在安全动作里。

图片

Astra是OpenAI首个触达内部关键级网络安全阈值的模型,在较少人工干预下发现了两个此前未知的零日漏洞。

最强的那部分网络安全能力不全面开放,只通过Daybreak计划定向释放,OpenAI同时拿出10亿美元补贴关键基础设施的防守方,企业版相关开关默认关闭。

系统开始主动规定哪些计算必须发生、哪些计算绝不能发生,计算机科学的新命题正在显形,不是算得快,而是算得对

这道闸门背后是一对同步上升的矛盾。

能力越强,推理链越长,工具调用越多,中间过程越难看懂,而监管对高风险AI的可解释性要求只会越来越细,头部厂商的新一代模型已经开始给输出加水印以配合透明度合规。

与此同时,护栏、权限控制、审核机制本身也在消耗算力、拖慢速度,能力越强的模型,安全开销占比越高。

Astra还是OpenAI第一款由前代模型深度参与训练的旗舰,AI训练AI的循环已经转起来,看懂它却变得更难。能力上去,可解释性下来,这两件事是同一次升级的两面。

对产业链下游,换尺子意味着两拨人要改作业方式。Agent 开发商的成本结构从 token 消耗变成任务成功率加时间成本,研发重点从提示词工程转向工作流编排。云厂商则从卖算力、卖 token,转向卖任务承载量和 Agent 并发数,产品形态从通用实例转向长时推理集群。


跑分会过时,计量单位不会。GPT-6留下的最长远的东西,可能不是又一个接近满分的基准,而是几把同时换掉的尺子。计价从字换成行动,算力从速度换成长度和密度,智能从模型本身换成模型加环境。而且账本换起来远比想象中慢,新旧尺子会并行很久。当行业集体换尺子的时刻到来,手里只有旧尺子的人,是来不及反应的那批。

- END -

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信