
一只没有署名的模型,正在考验行业识别模型的方法论。 Space Bunny Alpha上线数日,调用量同时登顶OpenRouter与OpenCode的单日榜,按平台统计口径,前者峰值时段处理token约3.3 万亿,后者约9 万亿。提供方披露的信息只有一组规格,100万token上下文,文本图像视频三种输入,输出上限524288token,推理强度五档可调,公测窗口内开放调用,开发者身份至今无人认领。 社区很快分裂成两派,一派醉心于身份考古,从分词器指纹到系统提示词重建,从Kimi猜到MiniMax再猜到OpenAI,另一派则围绕一只兔子长出来的基础设施打转。 更值得记录的是后者。一个自称独立实地指南的第三方观察站在公测期内成形,持续公布基准复测方法、速度仪表盘快照、身份探针日志,甚至用固定提示词维护了一座SVG画廊作为行为样本库,全部脚本与原始记录可公开复现。传统评测基准是静态的,一年更新几轮,而这套围绕匿名模型自发形成的审计流程是动态的、连续的、由真实负载驱动的。 模型第一次成为可以被公共市场持续解剖的对象,这是比任何单项分数都重要的结构性变化。 先校准三个口径 展开解剖之前需要先做术语澄清,否则所有数字都会被误读。 第一,平台公布的处理token总量包含网关缓存的读取量,不等于模型实际生成的输出token,榜单数字反映的是平台侧流转规模而非模型产能。 第二,部分账号实测中除一个多模态任务外全部在95%以上的缓存命中率,发生在API网关层,指的是完全重复的请求被直接返回,无需触发推理,而模型内部单会话上下文的KV cache复用是另一层机制,两者经常被混为一谈。 第三,本文引用的基准与速度数字均出自观察站自测口径,属于第三方复测记录,而非提供方发布参数。 这三条边界守住,后面的分析才有地基。 校准之后,那个95%才显出真正的分量。当下主流负载早已不是单轮问答,而是agent任务流,一个任务拆成数十轮调用,系统提示词、工具定义、历史轮次被反复重发,新信息只占每轮请求的零头。网关层把重复请求拦截在推理之前,意味着这类负载里的大部分调用根本不占用算力。 复用率这个过去藏在工程监控后台的指标,第一次随着一只匿名模型进入公共讨论。算力竞争的下半场,比的可能不是谁的卡多,而是谁家的请求被重复利用了几次。 思考预算的显性化 第一条解剖线索来自输出上限。 524288token的completion天花板下,推理token与回答token共用同一条预算线,推理强度从low到max五档可调,默认档存在口径分歧,列表快照显示medium,观察站的运行记录为max。 该预算是completion侧输出上限,不包含100万token输入上下文的配额。 上一代推理模型的思考长度是黑箱,黑箱的直接后果是延迟与表现都不可预测。把思考预算做成可调参数并写入目录,等于把内部解码策略提升为一等服务接口,调用方第一次可以在任务派发前估算长任务会不会顶到天花板。 这个设计选择说明优化目标是agent场景的可预期性,而非单次问答的观感。 推理通道与交付通道的解耦 社区最大的争议点是它想得太多,简单问题也要完整推演。 观察站的基准复测记录了硬币的另一面,同样任务下可见输出只有Qwen3.8 Flash的约三分之一,减少67%。 两个观察同时成立,指向同一结构,推理通道的冗长与交付通道的收敛被分开管理。 模型在内部分析中充分展开,在对用户交付时高度节俭,这种分裂本身就是训练目标包含输出纪律的直接证据。 还要补一笔容易被忽略的算力事实,思考块可以不回传给调用方,但计算完整发生,配额照常消耗,返回文本的长度并不等于算力消耗的规模,对大规模agent集群的容量规划是实质性变量。 容量声明与检索密度 标称100万上下文的模型近两年并不稀缺,稀缺的是超长输入中段的保持力。 观察站做了一次大海捞针式测试,约20 万token的超长输入中藏入三个代码,模型一次性按正确顺序全部找回,无一遗漏。 站点主动声明上下文窗口与输出上限属于容量声明,不等于检索质量的实测分数。 这句免责声明是全文最诚实的一笔。 长上下文赛道眼下的错位在于,窗口扩容跑在验证前面,标称数字节节攀升,20万乃至50万处的召回密度却缺少公开测试。 谁先拿出中段密度的系统实测,谁才有资格谈百万窗口。 强制推理的产品语义 推理不可关闭这一设计同样值得单独分析。 站点确认思考为强制开启,隐藏推理文本只是不展示,计算照常发生,五档强度构成调用方在延迟与表现之间的显式权衡轴。产品语义很清晰,思考不是可拆卸配件,而是能力本体。 这与上一代把推理藏在开关后面的做法形成对照,内部机制被摆上货架做成可调参数,工程成熟度反而比单次首token延迟更能说明问题。 工程底色与已知短板 匿名模型的工程底子是最容易露馅的一环,而这组数字并不难看。 观察站引用的仪表盘快照显示,三天窗口内推理可用性94.98%,中位写速87token每秒,中位响应延迟1.07秒,约百分之五的请求未获得推理响应。 另有第三方记录称上线初期曾短暂下架,提供方处理后恢复,若属实,说明瞬时洪峰确实打穿了平台侧容量。 需要同时写明的是公测调用伴随速率限制,高频请求会被平台限速,榜单级的调用规模并不意味着无约束吞吐。 社区体感与快照方向一致,与MiniMax M3相比,它在20万上下文场景的速度优势最明显,长文本首token的等待缩短感知最强。 社区复测反馈指出它在复杂数理场景仍存在少量幻觉,思维链能够迅速定位核心问题、用词精准,但随后容易跑偏。 长文档场景也呈现一体两面,植入代码精确找回,不等于对整篇文档的开放理解同样可靠。只记录高光数字的解剖报告,本身就是不合格的解剖。 提供方未披露架构细节,强制推理下维持中位延迟的实现路径无从验证。参照业界的成熟做法,候选机制无外乎两类,稀疏激活压低常态显存占用,推测解码以草稿模型预生成、主干批量校验的方式绕开显存带宽瓶颈。哪一条成立,要等权重或技术报告才能确认。 行为指纹的半衰期 身份线索的相互冲突是这场公测里最有分析价值的部分。 24个token计数探针指向MiniMax兼容的分词器,MiniMax官方代码仓库中确实出现过下一代模型的测试痕迹,参数描述包含100万上下文与low到max的推理档位。 越狱重建得到的系统提示词却是另一种血统,通道结构接近OpenAI的Harmony格式,并带有GPT 5式的动态预算变量。 最新的SVG生成对比进一步削弱了M3.1 Flash精确匹配的假设,面部与材质细节的完成度并不吻合。 背景信息里,MiniMax公开的M3系为总参数量4280亿、激活230亿的原生多模态稀疏模型,百万窗口本就在其路线图内。 解剖尚未收尾,线索本身开始移动。 9月27日,MiniMax在其编程产品MiniMax Code内上线了M3.1-Flash-Preview。已确认的规格与Space Bunny逐项重合,100万token上下文,文本图像视频输入,推理强度五档可调,默认档为max,思考强制开启,请求关闭推理会直接收到接口报错。 官方渠道至今未确认两者的关系,分词器探针、代码仓库痕迹与这份迟到数天的产品规格,已经把身份考古的天平明显压向一侧。剩下的矛盾集中在两处,越狱重建的系统提示词仍呈OpenAI风格,SVG生成质量与Flash预览版并不吻合。 一个合理的解释是匿名版与预览版同属一代底座的不同配置,effort档位与提示词层的差异足以让行为指纹漂移,这反而给指纹失效的论断补上了机制层面的注脚。如果这一解释成立,下一代匿名模型连血统都将不再是单数。 三条线索指向两个方向,这不是测量误差,而是方法论失效的信号。行为指纹的半衰期已经缩短到以月计,该结论仅针对推理、对齐后模型的行为,词表与分词器属于训练底层属性,受蒸馏影响更小。 上一位匿名选手Ox Alpha还曾被社区逐步锁定正身,事后被确认对应智谱GLM-5.3-Flash,这一次各路分析至今没有收敛。 蒸馏、合成数据与通用对齐管线的普及,正在抹平模型之间的行为差异,靠输出风格、口癖与报错格式认人的方法已经失效。分词器探针仍然有效,是因为词表切分是训练早期焊死的决策,后期蒸馏洗不掉,这几乎是仅剩的可靠考古层。 更有前瞻性的判断是下一代匿名模型未必是某一家完整底座的马甲,底座组合、蒸馏混合加外部提示封装,会让单点指纹逐个失效,身份考古将让位于成分分析。 发布范式的迁移 把视野拉到产业层,这次公测与Ox Alpha构成了一个清晰的序列。 匿名上线,社区盲测,真实负载涌入,风头过后或揭晓或沉默。 对发布方而言,这是零品牌负债的极限验收,开发者会毫无顾忌地把最脏的代码库、最刁钻的用法、最极端的长上下文塞进来,这类真实负载是任何内部测试集都造不出来的。 主流实验室仍以品牌发布为主,匿名公测则提供了一种替代路径,剥离品牌预期,让能力接受纯粹负载检验。发布正在从一场仪式变成一段被外包的验收期,聚合平台在其中的角色只是路由,负载、缓存与限流全部发生在提供方后端。 M3.1-Flash-Preview的发布方式是这一范式的第二个样本,而且发生在自家产品内部。模型静静出现在订阅产品的选择器里,默认拉满推理档位,用真实开发负载完成首轮验收。匿名公测与产品内静默上线,路径不同,逻辑相同,品牌仪式后置,负载检验前置。 真正的命题在最后。发布方拿到了压测数据,社区拿到了解剖素材,平台拿到了流量,而行业的方法论库存没有同步更新。当匿名成为常态,识别模型的速度取决于可复用分析框架的沉淀深度,而非考据热情。静态基准一年更新几轮,持续审计每天都在运行,评测权的迁移已经发生。下一次匿名信号出现时,看懂它所需要的东西,正是这一次公测期间被验证、被公开、被复现的那一整套流程。



本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。
评论列表