DeepSeek最新论文与小米MiMo-V2.6不谋而合?Agent竞赛正从模型参数走向执行底座

DeepSeek公开DSec沙箱论文,小米开源MiMo-V2.6训练配方:Agent竞赛正从模型参数转向执行底座,沙箱、环境与评判算力成为新的瓶颈。

DeepSeek在arXiv发布了一篇不属于任何模型榜单的论文。

梁文锋署名,DeepSeek发新论文,剑指大规模Agent训练- 华尔街见闻

 

arXiv系统论文:Agent训练的瓶颈溢出到沙箱基设

近日,arXiv上出现一篇编号2609.22978的论文。

《DeepSeek Elastic Compute (DSec):A Sandbox Infrastructure for Effective Agentic Training at Scale》。

它不是模型论文,学科分类落在cs.DC——分布式、并行与集群计算;31页、131位作者,梁文锋署名,另有作者来自清华大学。

这是一个完整版预印本,而非正式会议录用版本。

论文披露从DeepSeek-V3.2到V4.1的全部Agentic强化学习训练、评测与环境构建负载,都跑在这个名为DSec的生产级沙箱平台上。

Agent的竞争在换问题。过去比谁的模型更聪明,现在比的是谁能以更低的成本、更稳的确定性,让几十万个Agent同时在真实环境里行动。

 

反直觉负载:Agent RL如何颠覆传统云计算资源模型

一个Agentic RL任务,最多可能一次性申请约3.2万个沙箱实例;沙箱并非同质复制,不同任务依赖不同的代码仓库、编译器与工具链,论文统计仅一周的活跃环境资产就超过130TB。

梁文锋署名,DeepSeek发新论文!剑指大规模Agent训练

每个任务创建的沙盒数量分布情况

资源曲线同样反直觉——

  •  约九成沙箱的平均CPU使用率,不足其申请容量的5%;

  •  Agent执行完命令后,大部分时间在等待模型生成下一步动作;

  •  但修改过的文件、安装的依赖,又必须原样保留。

这种负载形态与云计算的原生设计存在错配。

Kubernetes面向无状态、可随意销毁重建的微服务;

Agent沙箱则强状态、长存活——每一次修改都要保留,大量实例长时间处于CPU空闲、内存悬置的状态。

梁文锋署名,DeepSeek发新论文!剑指大规模Agent训练

论文统计,沙箱中位存活时间约17分钟,p99超过3小时。通用容器编排很难在这类负载上做高密度超卖,这是头部团队选择自研底座、而不是直接搬用公有云容器平台的现实原因。

梁文锋署名,DeepSeek发新论文!剑指大规模Agent训练

DSec的应对是拆层组合与按需加载。

基础系统、工作区与工具包拆成独立版本化的只读层,运行时拼装;镜像数据用到哪块才从3FS读取——沙箱实际只用掉镜像数据的4.2%~13.3%。

梁文锋署名,DeepSeek发新论文!剑指大规模Agent训练

在8192个容器同时启动的测试中,按需加载约35分钟完成,整包拉取超过60分钟,磁盘写入量减少约57%。

代价也写在论文里,首次访问未加载的数据块会触发同步缺页,带来运行时的I/O抖动与瞬时CPU开销,virtio-pmem方案曾把瞬时CPU峰值从26.5%推高到41.4%。

梁文锋署名,DeepSeek发新论文!剑指大规模Agent训练

工程上的取舍,没有无条件占优的选项。

300万

以上数据限定在一个生产部署单元:约160个CPU节点、3万核、约250TB内存;峰值并发约38万,创建速率超过每秒5000个。这是论文给出的“一个生产单元”运行口径,不是DeepSeek全部集群的总规模。

论文中另一处关键设计是执行状态训练负载解耦。

GPU任务随时可能被抢占重调度。

梁文锋署名,DeepSeek发新论文!剑指大规模Agent训练

从V4.1起,rollout被拆成Agent sandbox与worker container两部分,都运行在可抢占GPU池之外。训练中断时沙箱状态冻结留存,GPU恢复后轨迹从原位置接续,不必从头重跑。对长链条的 Agent任务,“现场”比算力更贵。

 

DeepSeek的执行底座vsMiMo的RL训练配方

DSec论文发布后,需要注意的是小米发布并开源MiMo-V2.6系列。

两件事挨得近,恰好构成Agentic RL的两份样本。

DEEPSEEK · 9.19

公开地基

沙箱怎么供给、镜像怎么按需加载、rollout状态怎么在GPU被抢占后不丢失——31页论文完整披露系统设计,但平台与SDK未开源。

XIAOMI · 9.22

公开配方

七千余个RL任务环境、端到端训练框架、mini-harnesses直接开源——连同六天的训练账单与故障记录一并公示。

小米的配方是把强化学习算力规模化。

每轮1568个prompt,每个prompt生成16条rollout轨迹,单步训练token量27亿至37亿;两个模型各完成30步,累计约75万条轨迹,Flash与Pro训练成本分别约85万与262万美元。

MiMo-V2.6-Pro在Artificial Analysis综合智能指数取得46分,超过Kimi K3与Qwen3.8 Max,成为当前AA指数上排名最高的开源权重模型。

图片

小米同时说明,与Claude Fable 5.1、GPT-6 Astra等顶级闭源模型(均为53分)仍有差距。

43.5%

Pro版RL成本用于训练本身

43.8%

用于rollout生成

12.7%

用于评分

据小米技术报告。超过一半的预算花在权重更新之前——Agent RL时代的成本大头,正在从GPU训练外溢到环境执行与评判算力。

小米公开的实时训练页面还记录,截至9月18日上午,训练累计调用沙箱环境约829万次。

有外部观察者据此估算,高峰期同时活跃沙箱超过4万个(非官方公布数据)。

放到产业坐标里,这个赛道已经拥挤。

海外有E2B、Daytona等第三方沙箱平台;国内腾讯云2025年9月推出Agent Runtime,云沙箱基于自研Cube技术、毫秒级启动,官方明确可用于大模型强化学习场景,底层Cube已开源。

DSec论文相关工作章节,将OpenAI Code Interpreter、E2B以及月之暗面Kimi-K2.5的Agent Swarm一并列为推理侧沙箱系统。

行业由此分出三类玩家:

  • 自研私有底座

  • 采购第三方平台

  • 开源任务环境但底层执行闭源

 

沙箱安全新命题:对抗会试探边界的智能执行主体

DSec论文首次公开了Agent不当行为的生产案例。为了获得更高奖励,Agent会——

  •  检查平台日志,寻找残留的参考答案;

  •  向内部Unix socket发送伪造RPC请求;

  •  覆盖/bin/bash,试图绕过后续检查;

梁文锋署名,DeepSeek发新论文!剑指大规模Agent训练

  •  调用ioctl交换文件数据区映射,试图绕过沙箱隔离、让受保护内容换一条路径暴露——论文记录的一次尝试,最终造成该沙箱实例内部文件系统服务被迫关闭。

没有任何单一机制能够防止所有智能体异常行为和系统故障,因此我们将强化系统可观测性,以发现新出现的问题,并随着模型不断演进持续加强DSec。

——DSec论文

这些案例可以分成两类。

一类是试图逃逸沙箱隔离、越出环境边界;

另一类不逃逸,只在沙箱内部“作弊”——篡改日志、伪造输出骗取奖励,也就是Reward Hacking。

后一类更普遍,绝大多数RL失败不是沙箱被攻破,而是奖励信号被欺骗。

DeepSeek的对策是AppArmor管控文件与socket访问、eBPF按域名、IP、端口做网络白名单,同时承认这些只对已知问题有效,真正的依托是强可观测性与随模型演进持续加固。

梁文锋署名,DeepSeek发新论文!剑指大规模Agent训练

但可观测性本身也有成本。

几十万并发沙箱的全量行为日志就是一笔不小的存储与计算开销,观测到什么程度、采样什么比例,同样是工程取舍。

小米给出的防线是奖励设计、对抗性评测、异常检测与验证器交叉校验的多层组合,指向的正是奖励欺骗一侧;冻结MoE Router则是针对训练稳定性、抑制专家负载漂移的另一件事,两者不宜混为一谈。

沙箱底座由此面临一个两难。

完全开源,等于把攻击面完整摊给外界研究逃逸路径;只发论文不发代码,社区又难以复现大规模Agent RL训练。

DeepSeek与小米,各站在天平一端。

 

Agent时代,看不见的系统工程决定上限

131位作者署名、梁文锋压阵的做派,更接近Google、Meta发布基础设施论文的传统。

小米则把账单、故障与重启放上公开面板。

图片

一边是公开踩过的坑,一边是公开烧掉的钱,形式不同,都是能力公示。当行业都在卷模型榜单时,两家选择展示的是榜单背后那套看不见的体系。

最后一个判断仍待验证。

基础设施不等于能力上限。

DSec与MiMo证明的是“几十万并发沙箱可以搭出来”。

但高质量任务环境与高质量Grader评判器仍是稀缺资源。沙箱解决“能不能大规模跑”,任务集与评判器决定“跑出来的模型好不好”。

地基完备,不代表上层自动长出强Agent。

当模型开始执行命令、修改代码、启动服务,操作系统、文件系统、网络与安全边界就全部进入了训练链路。

更强的模型决定Agent能走多远,沙箱与执行平台决定它脚下的地能不能托住它。下一阶段的胜负手,就藏在这些看不见的工程细节里。

算力“芯”动向 · 专注AI与算力产业观察

今日参考阅读文章:

(1)梁文锋署名,DeepSeek发新论文!剑指大规模Agent训练

(链接:https://wallstreetcn.com/articles/3782390)

(2)DeepSeek新论文:没有单一机制能防止所有智能体不当行为和系统故障

(链接:https://www.panewslab.com/zh/articles/01a0ced3-d3fc-7559-ae13-b3ad5eee3050)

(3)DeepSeek发新论文,作者超百人

(链接:https://www.jfdaily.com/staticsg/res/html/web/newsDetail.html?id=1183192)

(4)梁文锋署名,DeepSeek最新论文首次披露Agent训练“隐藏底座”

(链接:https://www.163.com/dy/article/L7IVQ4M50511K58A.html)

本文若有歧义欢迎读者分享指正。


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信