Ox Alpha这头牛来请客,100万亿token随便吃,这顿饭钱谁在付?

匿名模型牛来请客,每天100万亿token免费管够。全网都在猜它是谁,我们算了另一笔账,这顿饭钱谁在付,免费的真正价格是什么,token又为什么开始像电一样卖。

 

 OpenRouter的模型货架上,悄悄多了一个新条目。

没有公司名,没有参数表,没有发布通稿,价格栏里只写着两个零。简介只有一句话,面向编码与长周期智能体任务的前沿模型,上下文窗口104.8万token,能吃文本、图片和视频,预览期免费一周

图片

它叫Ox Alpha。Ox是牛,中文社区直接赐名,牛来

就是这么一个来路不明的模型,做成的事每一件单拎出来都够开一场发布会。上架第一天,调用量登顶OpenRouter,顺手刷新平台单日模型用量纪录,跑掉近2万亿token。要知道,这个平台官方披露的整体日处理量不过在10万亿token量级,一个匿名新面孔,第一天就吃掉了接近两成。在编程工具OpenCode的榜单上,它把DeepSeek坐了56天的榜首位置接了过来。OpenRouter公开页面数据显示,仅Hermes Agent、Claude Code等前五大应用对它的累计调用就已超过4万亿token。Stripe的CEO Patrick Collison亲自上手试完,留下一句非常令人印象深刻。

现在,全网讨论都聚焦在同一个问题上,这牛到底是谁家的

指纹派已经拿出了亲子鉴定报告。分词器比对、视频编码器特征、报错码、服务器堆栈,五重证据层层叠加,独立研究者Ben Davis给出的概率判断是99%,指向智谱GLM-5.x系列。反对派也有一份名单,谷歌DeepMind几名研究员发帖暗示它像新版Gemini,另有分析认为分词器特征指向微软尚未发布的MAI-2。爆料人Mia只留下一句,我已经确认它是谁了,但现在不能说,反正不是你们想的那样。

图片

猜谜确实上头。但身份只是这头牛的A面,我更想翻它的B面,那笔没人细算的账。一个连名字都不肯署的厂商,为什么敢把每天100万亿token的算力摆上桌,请全世界白吃一周

100万亿token一天,到底是什么饭量

 
图片

OpenCode在官方公告里写得很直白,Ox Alpha背后的提供方,每天拥有100万亿token的服务容量。注意这个表述,这是公告宣称的设计供给上限,不是实际跑出来的日均负载。就像餐厅宣称后厨能出一万份菜,和真的卖出去一万份,是两回事。

这个数字躺在新闻里只是一串零,换成参照系才有实感。

彭博报道的测算,它大约是Visa公司整整一个月AI token使用量的100倍,当然这只是个量级参照,不是精确统计。社区里也有人按硬件反推,以每块GPU每秒80个token的推理速度估算,撑起这个吞吐大约需要58万块GPU同时在线,模型架构和任务类型不同,这个数字会大幅浮动,看个量级就好。

还可以直接换算成钱。

拿公开市场上同级别旗舰模型的定价当标尺,GLM-5.3的API公开定价是每百万输入token 2.5元、输出10元。就算保守到全部按输入价折算,100万亿token一天对应的名义标价也在2.5亿元上下。

名义标价不等于真实成本,自家算力的实际支出远低于公开售价,但用来丈量这场请客的排面足够了,一天请掉的账面价值,抵得上头部厂商办几十场发布会。

而真正耐人寻味的对比在这里。全网爆量之下,OpenRouter公开渠道跑掉的近2万亿token,只占到宣称容量的五十分之一

这不是挤牙膏式的免费,是直接把粮仓大门敞开。供给冗余做到这个程度,本身就是一种表态,它要展示的不是模型有多聪明,而是推理产能有多管够。

消化这些token的,已经不是人,是程序

 

一个容易被忽略的细节藏在调用结构里。给牛来贡献最多流量的,不是聊天框前的普通用户,而是Hermes Agent、Claude Code这类编程智能体工具。

这背后是token经济的一次需求换代。

聊天时代,一个人和模型聊一下午,消耗几千到几万个token。智能体时代,模型要自己规划、调用工具、读写代码、反复纠错,一个复杂任务跑下来,几十万token只是起步。

独立测试里有个数据很能说明同样一批软件工程任务,Ox Alpha平均每个任务走了117个智能体步骤,GPT-5.6 Sol只用了61步。步骤越多,思考的链条越长,烧掉的token也就越多。

换句话说,token需求的计价单位正在从人次变成任务,需求的公式变成了任务数量乘以每个任务的思考深度,而后者还在随着模型能力一起膨胀。

这就解释了厂商为什么偏偏挑这个时候秀供给。当单个用户的需求天花板被智能体彻底掀开,谁能稳定、便宜、不限量地供货,谁就握住了下一轮竞争的入场券。训练算力决定你有没有资格上桌,推理算力决定你能请多少人吃饭。

另一边的token,开始按峰谷计价

 

把视线从牛来身上挪开半米,行业另一端还有一件没什么人讨论的事。

DeepSeek的API价格表悄悄改成了峰谷制,空闲时段价格打到高峰时段的一半,V4-Pro在高峰时段的涨幅最高达1100%。规则还在继续细化,现在的版本里,周末全天不再区分峰谷,统一按低谷价计费。

图片

峰谷价这个词,我们以前只在电费单上见过,现在它出现在了大模型的价格表里。

两件事摆在一起看,画面就很有意思。

一边是牛来免费畅吃不限量,另一边是DeepSeek像供电公司一样给token划分高峰低谷。手法相反,指向相同,都在回答同一个问题,如何把推理产能卖得更聪明。

峰谷价差的出现,说明供给存在刚性约束、需求有潮汐波动,需要价格杠杆来调节负载。

超大规模免费供给的出现,说明推理产能已经脱离实验品阶段,有了规模化生产的底气。

沿着这个方向推演,长协价、容量预留甚至算力期货这类更成熟的交易形态,出现的概率并不低,市场里也可能长出专门的token中间商。当然,这一步目前还停留在推演层面,但电和通信,当年走的都是同一条路。

免费的账单,记在谁的头上

 

天下没有免费的午餐吗,倒也不必这么阴谋论,但这顿饭的价格标签值得翻出来看看。

厂商得到的,是任何内部测试都造不出来的东西。

前五大应用已经贡献超4万亿token调用,跑的全是真实生产环境里的代码仓库、智能体任务和多模态输入。传统软件公司做灰度测试,得花钱请人、搭环境、求反馈。

AI时代反过来了,全球开发者自带干粮排队上岗,测完还顺手在社区把口碑刷了。这批真实负载数据的价值,未必低于烧掉的算力。

平台得到的是实打实的估值故事。

支付巨头Stripe已经官宣达成协议收购OpenRouter,官方没有披露金额,媒体披露的报价从70亿到80亿美元不等,交易还有待交割,而这家平台数月前融资时的估值只有13亿美元

更值得玩味的是Stripe CEO在官宣声明里的表态,token正在成为AI商业的核心货币,谁能帮企业把token花得更聪明,谁就握住了AI时代的基础设施入口。牛来带来的天量流量,恰好是给这笔收购送上门的成交喜报。卖水的生意,再一次被证明比淘金稳。

但用户付出的东西往往最容易被忽略。

OpenCode的官方公告宣称零数据留存,OpenRouter的模型页却白纸黑字写着,提示词和回复会被提供方留存,只是不用于训练。

两个官方渠道,两种说法,至少有一个没把话说全。留存但不训练,和请求结束即删除,是两回事。所以薅羊毛的正确姿势是,个人项目、开源代码、脑洞实验尽管招呼,公司的核心代码先捏在手里,等它摘了面具再谈信任。

瓜好吃,瓜皮得吐

 

牛来的瓜好吃,但有几处瓜皮比较硬,建议吐掉再吃。

跑分的成色要打个折。

全网疯传的80%,来自Ben Davis用DeepSWE跑的10道题自测,样本小到方差极大。样本扩大到113题之后,DeepSWE官方人员给出的评测结果是63分上下,整体表现接近Claude Opus 4.8,稳稳站在第一梯队,但和碾压两个字还隔着几个身位。第三方社区榜单Kingbench上它拿到87.5%,压它一头的恰好是GLM-5.3的91.25%,不过这类社区榜单本来就不在公认主流基准之列,参考一下就好。

指纹的可信度也要打个折。

五重证据链全部来自社区研究者的技术推断,99%是概率判断,不是官方结论。链条里最漂亮的要数那个控制变量实验,同一份GLM-5.2权重托管在别家平台,报错格式就完全不一样,说明指纹锁定的是运营方,而不只是模型权重。但指纹终究不是官宣,Pony Alpha揭晓之前,社区同样众说纷纭。厂商认领之前,一切置信度都只是概率

还有一层更少人提的风险。

匿名意味着责任主体模糊,如果模型生成了侵权内容或者带漏洞的商用代码,用户找不到明确的责任方,平台和模型提供方之间的权责边界至今没有规则。热度退潮之后,这个问题迟早要被摆上台面。

这个剧本,已经演了五遍

 

如果这只是孤例,它顶多算一条猎奇新闻。但翻开OpenRouter的隐身模型档案,你会发现这已经是一套成熟的流水线。

Pony Alpha从匿名到官宣只用了五天,真身是智谱GLM-5,上架第一天调用400亿token,认领之后智谱股价两天涨了60%Hunter Alpha揭晓为小米MiMo-V2-ProElephant Alpha花落蚂蚁Owl Alpha确认是美团LongCat-2.0

平均一两个月就有一款新马甲上桌,节奏稳得像排播表。

再往前追,这套打法的祖师爷其实是OpenAI,当年一个名叫gpt2-chatbot的匿名模型空降竞技场,后来被证实是GPT-4o的预览版。

这套剧本能跑通,靠的不只是传播心理学,背后还有实打实的产业逻辑。

实验室预设的测试负载永远覆盖不了真实世界的混合场景,全量开放的免费流量就是最好的压力测试,能压出人工测试找不到的工程漏洞。匿名意味着进可攻退可守,表现好就认领流量,表现不好悄悄下线,几乎没有公关成本。

免费放量还能顺带摸清真实需求的天花板,观察什么场景的用户愿意为什么样的能力掏钱,给后续正式定价提供数据依据。营销、工程、商业三件事,一场匿名公测全办了。

图片

上一次的马甲是马,这一次是牛,中文社区笑称牛马终于配齐。而打工人一边自嘲牛马,一边薅着牛的算力干活,这大概是AI圈颇有行为艺术感的一幕。

热闹散场之后,牌桌会剩下谁

 

把目光再放远一点,这类事件正在悄悄改写行业格局。

头部厂商可以拿海量算力做免费获客,中小模型厂商既烧不起这个算力,也拿不出同等规模的稳定供给,筹码不够的玩家会被一点点挤出牌桌。

聚合平台的话语权也在上升。

当匿名发布成为标配玩法,厂商会越来越依赖OpenRouter这类平台的曝光和分发能力,入口的定价权和规则制定权会持续向平台集中。Stripe愿意为这层入口掏出几十亿美元,买的其实就是这个东西。

再往上游看,当推理产能成为核心竞争力,数据中心、先进封装、能源供给这些基础设施环节的战略权重还会继续抬升。

模型圈的每一次狂欢,最后买单的和赚钱的,往往都藏在产业链更深处

 

故事还没有完,两件事值得盯着。

免费窗口关窗在即,价格牌翻开,是骡子是马,哦不,是牛,看留存用户说话。

按官方预告,智谱GLM-5.3权重即将开源。模型卡一出,参数、架构、分词器全摆上台面,牛来的身份是真是假,开箱即知。

如果证实是它,这场匿名请客就是性价比罕见的一场发布会。如果不是它,那更好玩了,说明牌桌上还坐着一个所有人都没猜到的玩家。

无论哪种结果,有一件事已经发生。模型发布这门生意,从PPT时代正式进入了盲盒时代,而算力,成了请客吃饭的那张饭卡。

牛来没来,马上见分晓。反正这一阵,打工人的token自由,是它给的。 

- END -

2026全球闪存峰会

随着生成式AI进入规模化落地阶段,大模型训练与推理对存储性能、容量、架构的需求持续攀升,存储正从被动的数据容器,升级为驱动AI产业发展的核心底座。


在此背景下,以“存力跃迁,AI破局”为核心主题的2026全球闪存峰会(Flash Memory World 2026),将于2026年8月26日在中国武汉正式举办。本届峰会由 DOIT 传媒、华中科技大学计算机科学与技术学院、华中科技大学集成电路学院联合主办,汇聚全球存储产业链力量,全面呈现闪存技术前沿突破与 AI 时代的产业新图景。



报名通道:https://app.ehub.net/register/nga5ph




扫描下方二维码 关注我们

我们以算力为线,持续跟进算力基础设施的报道,输出洞察,伴随算力行业实现算力自由。敬请关注!


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信