Anthropic发布Fable 5.1与Mythos 5.1,两者共享完全相同的基础权重,区别仅在于安全防护层的配置强度。
Fable面向所有用户开放,Mythos 5.1则通过Project Glasswing受信访问计划,仅向经过审核的网络安全及生命科学机构提供。

几乎在同一周期,OpenAI披露下一代模型Astra的内部数学研究成果,尚未官宣产品发布计划,若未来推出将采取更严格的发布策略,初期仅向有限用户开放。Ilya Sutskever也在此节点罕见地公开发声呼吁加强网络安全。

当事情的交汇点并非模型能力的又一次线性提升,而是产品分层逻辑的根本性转变。行业竞争的核心变量正从参数规模与基准分数,转向同一套能力底座如何依据不同用户身份、应用场景与合规要求,拆分为可独立运营的产品单元。
Fable 5.1与Mythos 5.1在Terminal-Bench 4.0上的得分分别为55.8%与60.9%,差距5.1个百分点。
这一数据将安全约束从定性描述转化为可量化的性能变量。
同一颗大脑在两副不同手铐下释放出不同水平的能力,说明模型输出的上限不再完全由预训练规模决定,系统允许它执行的操作范围同样构成关键约束。
Fable 5.1的网络安全误报率较Fable 5降低60%,基础生物学与医学问题误报率降低85%。
但部分高风险查询并未被简单阻断,而是自动降级路由至Opus模型处理,包括渗透测试、漏洞利用生成及基于二进制的漏洞扫描等任务。

涉及生命科学研发的查询同样路由至Opus模型,专业人员需通过Mythos 5.1的生命科学验证计划获取访问权限。安全护栏不再是模型发布后的合规补丁,而是嵌入架构设计的动态调节器,其松紧程度直接写入产品定义。
这种设计将模型从单一能力体转变为可配置的能力平台。
底层权重不变,但系统提示、分类器阈值、工具可用性与执行权限的组合,决定了不同用户实际接触到的能力边界。
Mythos 5.1仅通过Project Glasswing向经过审核的机构开放,该项目由Anthropic与AWS、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorganChase、Linux Foundation、Microsoft、Nvidia及Palo Alto Networks共同运营,用于在广泛使用的软件中发现并修复漏洞。
同一底座两套配置,意味着厂商需要维护两套API通路、两套安全审核及机构准入流程,带来额外的运营成本。这种成本是产品分层模式的现实约束,也是其可持续性的考验。
Fable 5.1引入的反蒸馏机制,体现了安全工程从政策层面下沉至协议层面的趋势。
此前存在一种已知手法,在多轮对话中手动篡改上下文历史,同时保留模型的思维链记录,诱导模型在新的对抗性指令下重放旧的推理路径。
Fable 5.1的应对方式是为每个思维链区块附加签名。
后续请求中,系统校验两项内容:当前模型是否具备读取该区块的权限,以及生成该区块时的完整对话前缀是否与当前状态完全一致。任何篡改均导致签名校验失败,后续区块随之失效。
链式校验设计进一步强化了不可切割性。
每个区块记录前一个区块的哈希信息,形成跨轮次的连续链条。

从链条头部移除区块不会破坏后续完整性,但从中间抽离任意区块,断裂处之后的所有区块全部作废。这种结构将思维链从可随意拼接的文本片段转化为仅可追加的审计日志。
需要明确的是这一机制防御的是篡改历史上下文并保留思维链进行重放蒸馏的特定攻击路径,并非覆盖全部提示注入或越狱攻击场景。
它解决的是一类可工程化防御的协议层问题,而非安全领域的全部命题。Anthropic同时为开发者提供了协议层面的替代交互范式。
对话内系统消息替代顶层提示词编辑,带clear_at参数的轮次级系统消息替代插入删除操作,tool_addition与tool_removal区块替代工具列表的直接修改,服务端压缩替代客户端截断。
这是Fable 5.1给出的推荐安全交互范式,并非彻底禁用旧版调用方式。
核心原则是将messages数组视为仅可追加的日志流,而非可随机读写的存储块。对于直接调用Messages API的开发者,这意味着交互范式从编辑模式向追加模式的迁移建议。
Fable 5.1将缓存读取价格从每百万token 1美元降至0.25美元,降幅75%。输入与输出价格维持每百万token 10美元与50美元不变。
需要补充的是缓存写入本身仍按原有标准收费,5分钟TTL的缓存写入为每百万token 12.50美元,1小时TTL为20美元,降价仅针对读取环节。
在长上下文agent任务中,缓存读取通常占据成本主体,因为agent需要在长时间会话中反复回读代码库、系统提示与对话历史。

降价后,缓存读取在Fable 5.1上仅占基础输入价格的2.5%,而Opus 5仍维持10%的比例。典型工作负载的实际成本下降约25%,重度agentic任务最多可节省45%。
这一调整并非定价策略层面的竞争动作,而是对长上下文自主运行模式经济可行性的底层确认。
当agent能够负担得起持续数小时的上下文保持与反复读取,其从交互式工具向持续工作伙伴的转型才具备可持续的运营基础。
模型选择对于agent工作流的决策依据,正从每token列表价格转向每完成任务的总体成本,包括重试、上下文重放、工具调用及模型在到达可用结果前消耗的全部token。
OpenAI在8月初通过数学论文展示Astra的内部能力,解决了十道长期悬而未决的数学难题,每道题附带机器可验证的Lean证明证书,全部十道证明的总计算成本按GPT-5.6 Sol的API费率折算约2000美元。
但OpenAI并未公布发布日期、模型规格、API接口或定价。
Astra目前仅为内部研究阶段的模型名称,其最终产品命名、是否纳入GPT系列编号、以及对外发布计划均未确定。

OpenAI披露内部评估显示Astra可能触及关键级网络安全能力阈值,这是其Preparedness Framework下最高的风险分类,意味着模型可能在无人工干预的情况下,于多个已强化防护的真实系统中独立识别并开发各严重等级的可用零日漏洞利用程序。
作为回应,OpenAI暂停了部署导向的强化学习训练,其最大的前沿训练运行被搁置,同时正在重写安全框架本身,并计划与政府机构及独立安全研究所合作完成更严格评估。
Astra的延迟并非源于模型能力不足,而是源于控制基础设施尚未就绪。这种审慎与Anthropic的激进发布形成对照。
Anthropic选择让模型进入生产环境,但通过签名锁与Project Glasswing等受信访问计划施加动态约束。OpenAI则选择在能力释放前寻求更绝对的控制保障。
两种路径的差异,反映出行业对能力与控制之间平衡点的判断尚未收敛。
Ilya Sutskever在此节点呼吁加强网络安全,表明控制成本本身正在成为跨组织的基础设施支出项。当模型能力跨过特定阈值,限制因素不再是算力或数据规模,而是人类对模型行为的理解深度与干预能力。安全评估、红队测试、持续监控及隔离环境所需的计算资源,正在与能力开发的计算需求形成同等量级的预算科目。
这种同一底座、多套权限的产品分层,并非Anthropic的孤例。
OpenAI的GPT-5.6系列本身已采用Sol、Terra、Luna三级能力分层,不同 tier 对应不同的推理深度与功能解锁。
Google在2026年推出的Gemini Enterprise Agent Platform中,围绕Agent Identity、Agent Registry、Agent Gateway等组件构建治理层,将权限控制作为平台原生能力而非策略叠加。
国内主要大模型厂商的企业级服务同样出现了按组织身份、合规等级与场景风险配置不同能力边界的趋势。
这些动向的共同指向是agent时代的产品演化正在从单一模型向分层能力体系迁移。模型本身开始具备操作系统的特征,真正决定用户体验的,是外围的权限配置、成本结构与治理框架。
过去几年,大模型竞争的核心指标是基准排名与参数规模。最近连续几家公司的动作表明,比赛规则正在发生迁移。
真正拉开差距的不只是模型本身的聪明程度,而是同一套能力如何依据不同用户、场景与权限,拆分为一套可持续运行的产品体系。
Mythos 5.1在计算生物学领域的表现提供了具体例证,该案例为Anthropic官方演示内容,非通用生产环境实测结果。
模型通过编写自定义内核并缓存中间结果,将七个开源深度学习模型的推理速度提升最高2.5倍,输出保持完全一致。
在实际研究中,这类优化通常需要专业性能工程团队耗费数周完成,而Mythos 5.1仅用数天便实现同等效果,且仅依赖公开源代码。优化后的方案可将运行成本降低30%到60%。
关键不在于加速比本身,而在于模型开始具备系统级优化意识,从应用层使用者向基础设施层工程师的身份跃迁。
在蛋白质设计任务中,Mythos 5.1在十二个靶标上实现的命中率接近50%,而行业典型水平维持在10%到15%之间。
在天文学领域,Fable 5.1基于NASA麦哲伦号三十余年前的雷达图像训练神经网络,为金星三分之一表面生成新地形图,分辨率从10至20公里提升至2至3公里,高度精度提高25%。该地图以CC协议开源,供NASA与ESA的即将执行任务参考。
当模型能力足够强,能够自主优化底层代码、设计蛋白质、生成行星地图时,决定普通用户与专业用户之间体验差异的,不再是模型是否具备这些能力,而是系统是否允许其释放这些能力。未来讨论AI,可能不再只有一句哪个模型最强,而会变成另一句更现实的话:你拿到的是哪一把钥匙。
本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。
评论列表