“兔来”!Space Bunny登顶双榜!到底是MiniMax还是OpenAI的马甲?思考预算、请求缓存与失效的指纹,一次匿名公测的技术解剖

匿名模型Space Bunny发布了,全网都在猜是哪家底座。强制推理不可关、网关缓存命中率95%、行为指纹加速失效,匿名公测正在改写模型验收。

Space Bunny Alpha: 1M Context, Benchmarks & SVG Art

一只没有署名的模型,正在考验行业识别模型的方法论。

Space Bunny Alpha上线数日,调用量同时登顶OpenRouter与OpenCode的单日榜,按平台统计口径,前者峰值时段处理token约3.3 万亿,后者约9 万亿。提供方披露的信息只有一组规格,100万token上下文,文本图像视频三种输入,输出上限524288token,推理强度五档可调,公测窗口内开放调用,开发者身份至今无人认领。

社区很快分裂成两派,一派醉心于身份考古,从分词器指纹到系统提示词重建,从Kimi猜到MiniMax再猜到OpenAI,另一派则围绕一只兔子长出来的基础设施打转。

更值得记录的是后者。一个自称独立实地指南的第三方观察站在公测期内成形,持续公布基准复测方法、速度仪表盘快照、身份探针日志,甚至用固定提示词维护了一座SVG画廊作为行为样本库,全部脚本与原始记录可公开复现。传统评测基准是静态的,一年更新几轮,而这套围绕匿名模型自发形成的审计流程是动态的、连续的、由真实负载驱动的。

模型第一次成为可以被公共市场持续解剖的对象,这是比任何单项分数都重要的结构性变化。

图片

 

先校准三个口径

 

展开解剖之前需要先做术语澄清,否则所有数字都会被误读。

第一,平台公布的处理token总量包含网关缓存的读取量,不等于模型实际生成的输出token,榜单数字反映的是平台侧流转规模而非模型产能。

第二,部分账号实测中除一个多模态任务外全部在95%以上的缓存命中率,发生在API网关层,指的是完全重复的请求被直接返回,无需触发推理,而模型内部单会话上下文的KV cache复用是另一层机制,两者经常被混为一谈。

第三,本文引用的基准与速度数字均出自观察站自测口径,属于第三方复测记录,而非提供方发布参数。

这三条边界守住,后面的分析才有地基。

校准之后,那个95%才显出真正的分量。当下主流负载早已不是单轮问答,而是agent任务流,一个任务拆成数十轮调用,系统提示词、工具定义、历史轮次被反复重发,新信息只占每轮请求的零头。网关层把重复请求拦截在推理之前,意味着这类负载里的大部分调用根本不占用算力。

复用率这个过去藏在工程监控后台的指标,第一次随着一只匿名模型进入公共讨论。算力竞争的下半场,比的可能不是谁的卡多,而是谁家的请求被重复利用了几次。

思考预算的显性化

 

第一条解剖线索来自输出上限。

又快又能打!匿名模型玉兔模型杀上双榜第一,Coding实测全记录– 量子位

524288token的completion天花板下,推理token与回答token共用同一条预算线,推理强度从low到max五档可调,默认档存在口径分歧,列表快照显示medium,观察站的运行记录为max。

该预算是completion侧输出上限,不包含100万token输入上下文的配额。

上一代推理模型的思考长度是黑箱,黑箱的直接后果是延迟与表现都不可预测。把思考预算做成可调参数并写入目录,等于把内部解码策略提升为一等服务接口,调用方第一次可以在任务派发前估算长任务会不会顶到天花板。

这个设计选择说明优化目标是agent场景的可预期性,而非单次问答的观感。

推理通道与交付通道的解耦

 

社区最大的争议点是它想得太多,简单问题也要完整推演。

观察站的基准复测记录了硬币的另一面,同样任务下可见输出只有Qwen3.8 Flash的约三分之一,减少67%。

两个观察同时成立,指向同一结构,推理通道的冗长与交付通道的收敛被分开管理。

模型在内部分析中充分展开,在对用户交付时高度节俭,这种分裂本身就是训练目标包含输出纪律的直接证据。

还要补一笔容易被忽略的算力事实,思考块可以不回传给调用方,但计算完整发生,配额照常消耗,返回文本的长度并不等于算力消耗的规模,对大规模agent集群的容量规划是实质性变量。

容量声明与检索密度

 

标称100万上下文的模型近两年并不稀缺,稀缺的是超长输入中段的保持力。

观察站做了一次大海捞针式测试,约20 万token的超长输入中藏入三个代码,模型一次性按正确顺序全部找回,无一遗漏。

站点主动声明上下文窗口与输出上限属于容量声明,不等于检索质量的实测分数。

这句免责声明是全文最诚实的一笔。

长上下文赛道眼下的错位在于,窗口扩容跑在验证前面,标称数字节节攀升,20万乃至50万处的召回密度却缺少公开测试。

谁先拿出中段密度的系统实测,谁才有资格谈百万窗口。

强制推理的产品语义

 

推理不可关闭这一设计同样值得单独分析。

站点确认思考为强制开启,隐藏推理文本只是不展示,计算照常发生,五档强度构成调用方在延迟与表现之间的显式权衡轴。产品语义很清晰,思考不是可拆卸配件,而是能力本体。

这与上一代把推理藏在开关后面的做法形成对照,内部机制被摆上货架做成可调参数,工程成熟度反而比单次首token延迟更能说明问题。

工程底色与已知短板

 

匿名模型的工程底子是最容易露馅的一环,而这组数字并不难看。

观察站引用的仪表盘快照显示,三天窗口内推理可用性94.98%,中位写速87token每秒,中位响应延迟1.07秒,约百分之五的请求未获得推理响应。

另有第三方记录称上线初期曾短暂下架,提供方处理后恢复,若属实,说明瞬时洪峰确实打穿了平台侧容量。

需要同时写明的是公测调用伴随速率限制,高频请求会被平台限速,榜单级的调用规模并不意味着无约束吞吐。

图片

社区体感与快照方向一致,与MiniMax M3相比,它在20万上下文场景的速度优势最明显,长文本首token的等待缩短感知最强。

社区复测反馈指出它在复杂数理场景仍存在少量幻觉,思维链能够迅速定位核心问题、用词精准,但随后容易跑偏。

长文档场景也呈现一体两面,植入代码精确找回,不等于对整篇文档的开放理解同样可靠。只记录高光数字的解剖报告,本身就是不合格的解剖。

提供方未披露架构细节,强制推理下维持中位延迟的实现路径无从验证。参照业界的成熟做法,候选机制无外乎两类,稀疏激活压低常态显存占用,推测解码以草稿模型预生成、主干批量校验的方式绕开显存带宽瓶颈。哪一条成立,要等权重或技术报告才能确认。

行为指纹的半衰期

 

身份线索的相互冲突是这场公测里最有分析价值的部分。

24个token计数探针指向MiniMax兼容的分词器,MiniMax官方代码仓库中确实出现过下一代模型的测试痕迹,参数描述包含100万上下文与low到max的推理档位。

越狱重建得到的系统提示词却是另一种血统,通道结构接近OpenAI的Harmony格式,并带有GPT 5式的动态预算变量。

最新的SVG生成对比进一步削弱了M3.1 Flash精确匹配的假设,面部与材质细节的完成度并不吻合。

背景信息里,MiniMax公开的M3系为总参数量4280亿、激活230亿的原生多模态稀疏模型,百万窗口本就在其路线图内。

解剖尚未收尾,线索本身开始移动。

图片

9月27日,MiniMax在其编程产品MiniMax Code内上线了M3.1-Flash-Preview。已确认的规格与Space Bunny逐项重合,100万token上下文,文本图像视频输入,推理强度五档可调,默认档为max,思考强制开启,请求关闭推理会直接收到接口报错。

官方渠道至今未确认两者的关系,分词器探针、代码仓库痕迹与这份迟到数天的产品规格,已经把身份考古的天平明显压向一侧。剩下的矛盾集中在两处,越狱重建的系统提示词仍呈OpenAI风格,SVG生成质量与Flash预览版并不吻合。

一个合理的解释是匿名版与预览版同属一代底座的不同配置,effort档位与提示词层的差异足以让行为指纹漂移,这反而给指纹失效的论断补上了机制层面的注脚。如果这一解释成立,下一代匿名模型连血统都将不再是单数。

三条线索指向两个方向,这不是测量误差,而是方法论失效的信号。行为指纹的半衰期已经缩短到以月计,该结论仅针对推理、对齐后模型的行为,词表与分词器属于训练底层属性,受蒸馏影响更小。

上一位匿名选手Ox Alpha还曾被社区逐步锁定正身,事后被确认对应智谱GLM-5.3-Flash,这一次各路分析至今没有收敛。

蒸馏、合成数据与通用对齐管线的普及,正在抹平模型之间的行为差异,靠输出风格、口癖与报错格式认人的方法已经失效。分词器探针仍然有效,是因为词表切分是训练早期焊死的决策,后期蒸馏洗不掉,这几乎是仅剩的可靠考古层。

更有前瞻性的判断是下一代匿名模型未必是某一家完整底座的马甲,底座组合、蒸馏混合加外部提示封装,会让单点指纹逐个失效,身份考古将让位于成分分析。

发布范式的迁移

 

把视野拉到产业层,这次公测与Ox Alpha构成了一个清晰的序列。

匿名上线,社区盲测,真实负载涌入,风头过后或揭晓或沉默。

对发布方而言,这是零品牌负债的极限验收,开发者会毫无顾忌地把最脏的代码库、最刁钻的用法、最极端的长上下文塞进来,这类真实负载是任何内部测试集都造不出来的。

主流实验室仍以品牌发布为主,匿名公测则提供了一种替代路径,剥离品牌预期,让能力接受纯粹负载检验。发布正在从一场仪式变成一段被外包的验收期,聚合平台在其中的角色只是路由,负载、缓存与限流全部发生在提供方后端。

M3.1-Flash-Preview的发布方式是这一范式的第二个样本,而且发生在自家产品内部。模型静静出现在订阅产品的选择器里,默认拉满推理档位,用真实开发负载完成首轮验收。匿名公测与产品内静默上线,路径不同,逻辑相同,品牌仪式后置,负载检验前置。

 

真正的命题在最后。发布方拿到了压测数据,社区拿到了解剖素材,平台拿到了流量,而行业的方法论库存没有同步更新。当匿名成为常态,识别模型的速度取决于可复用分析框架的沉淀深度,而非考据热情。静态基准一年更新几轮,持续审计每天都在运行,评测权的迁移已经发生。下一次匿名信号出现时,看懂它所需要的东西,正是这一次公测期间被验证、被公开、被复现的那一整套流程。

- END -


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信