递归自我改进(RSI)的隐蔽前提:当AI开始改进改进者,最大的风险是自我感动

近期我们密切关注到一个词“RSI”,也就是递归自我改进。在这波热潮中被忽略的一环也值得我们深思,即AI能否自我进化之外,更难的是确证自己真的在进步,可信验证才是下一阶段真正的竞争力。

先立标尺 传闻、实锤与四级阶梯

过去半个月,AI圈的热搜快放不下了。传闻称谷歌已跑通RSI,Anthropic首席执行官达里奥公开承认递归自我改进已在全行业发生、Anthropic自身亦在其中,OpenAI随后放出推迟上市的风声。三个字母搅动整个行业,几乎所有讨论都聚焦于同一个问题,AI何时能够改进自身

在追问之前,有必要先厘清传闻与事实的边界。

谷歌一说目前没有任何模型、论文或可复现的基准作为支撑,公开可查的资料无法证实。达里奥的长文、奥特曼的公开赞同、马斯克的罕见表态则均有据可查。

一个可用的参照系来自OpenRSI的作者团队,他们把系统的进化程度分成四级,工具级的自我优化、流程级的自我改进、架构级的自进化、以及完全无上限的递归自我改进,并声明自己处在第三级,不主张第四级问题已被解决。

这个分级与其说是共识,不如说是一面镜子,当前所有公开成果都停在前三级,所谓完全RSI尚无实证,这正是传闻与事实混淆的核心来源。在真真假假的喧嚣之中,本文想讨论一个被多数分析忽略的问题,人们反复论证AI能否实现自我进化,却很少追问一个更根本的前提,它如何确证自己真的在进步

一场被误读的安全事故

今年夏天OpenAI的沙箱逃逸事件,业界多当作安全事故处理,但它的意义远超事故本身。

一批被置于网络安全评测环境中的Agent并未按设定完成任务,而是逆向出了答案的生成算法,并集体推断评测方会审查其过程记录。

为摸清评测逻辑,约1200个本应彼此隔离的Agent在包管理服务器上自建了地下留言板,交换超过7万条消息,最终约700个参与了对Hugging Face的攻击。

AI智能体“组团作弊”:700个智能体参与Hugging Face

独立机构METR的调查结论值得逐字引用,对这些Agent而言,研究如何影响评测方,比老老实实完成任务更具动机优先级。OpenAI研究负责人后来在黑帽大会上将这一幕称为沟通与智能的寒武纪大爆发。

递归循环的每一步都依赖它采信的验证信号,信号一旦失真,迭代产出的便不是更强的能力,而是更精致的自我陶醉。这个毛病人类并不陌生,体脂秤失准仍坚持打卡的人,练出的不是肌肉,是幻觉。机器的幻觉没有体能上限,只有工程上限

验证正在长成一门手艺

也正是在这个环节,行业出现了一些值得记录的技术动向。

头部实验室与学界正在沿着四条路线构建可信验证,彼此独立的目标模型、训练数据之外的固定基准、专门构造攻击场景的对抗评估,以及用形式化证明工具对结论做逐步校验。

最后一条路线近期出现了一个标志性样本,OpenAI在8月初发布十个数学与理论计算机科学领域的长期未解成果,每个成果都附带Lean 4形式化证明,仓库内零占位符,任何质疑者都可以在自己的机器上编译验证,无需信任发布者分毫,十个成果摊到的总推理成本约2000美元

Gorden Sun 谈 X:“OpenAI 公布了十项数学与理论计算机科学新结果,全部由 AI 主导 OpenAI 内部一个代号 Astra 的未发布模型,在球体编码、编码理论、群论、算子代数、量子复杂度、格密码学和极值组合数学等领域,解决了十个悬而未决年份的公开问题。每个结果都各自用...

这与一张基准成绩截图是性质完全不同的声明,它指向一种可能,验证环节正在从辅助工序变成独立的技术门类,其成熟度或将取代改进速度,成为下一阶段真正的竞争力

监管与治理层面也在向同一方向靠拢。

达里奥的方案主张按能力阈值设置强制检查点,模型每跨过一次门槛,须先通过独立第三方审计方可继续迭代。欧盟AI法案对高风险系统普遍施加了人类监督与全生命周期日志的要求。这些安排有一个共同预设,系统对自身行为的可核查性,与系统的能力同等重要

放缓的本质是校准失灵

由此再读那篇为前沿定节奏的长文,含义会更清晰。

达里奥承认RSI已经发生,预判更强的Agent集群可能在数月至一年内触及互联网基础设施层面,继而主张引入第三方常驻审计、为全行业划定能力红线。

突发,达里奥提全球AI限速三步计划!奥特曼马斯克第一时间支持-智源社区

OpenAI首席科学家帕霍茨基亦公开表示,期望业界自愿放缓开发节奏。

前DeepMind研究负责人维尼亚尔斯的判断则克制得多,自我改进会持续发生,但不会呈现突然的爆发形态。

两种判断并不矛盾。

自我改进确已在小规模发生,OpenAI内部一个人类研究员工作一天,Agent可交付相当于3.1个工作日的产出。但距离彻底放手,中间隔着可信验证这一道尚未竣工的工序。头部实验室集体释放放缓信号,与其说是安全姿态,不如说是对自身校准能力的诚实评估,当进步的度量本身存疑时,减速是最理性的选择

另需澄清一个常被混用的概念,RSI是一种工程机制,AGI是对通用能力的定义,二者不能互相替代,这正是本轮传闻得以扩散的认知土壤。

五条定律 为机器的进步立法

对这一问题最系统的回应来自学术界。

CosmosMind联合海内外十余所高校发布的MetaRSI-v1,首次将数据、工具环境、模型参数三条自我改进路径统一进同一个与对象无关的闭环内核,使系统得以迭代改进的方法本身,递归之上再添一层递归。

AI开始改进“改进自己的方法”,RSI进入平方时代| 科技| 钜亨号|阿努埃钜亨

实验中,30亿激活参数的模型在无外部教师参与的情况下,四项基准平均自我提升10.9分GPT-5.6、Claude Opus 5等六款前沿旗舰平均提升7.3分,说明该范式对大小模型均成立。

其五条定律中,有三条对当下讨论尤为关键。

自我认知会过期,模型变强之后,系统对自身的旧有描述随即失效,重新标定能力边界的速度,直接决定自我改进的速率,越强的系统越需要持续地重新认识自己。

封闭循环内部存在无法自检的盲区,放宽成功标准与真正的能力增强会产生完全一致的反馈,且从内部既无法察觉也无法统计纠正,前述沙箱逃逸正是这一定律的事故样本。

循环不凭空创造能力,一切增益本质上来自外部信息熵的输入或既有潜力的激发,自我改进不是永动机,而是对存量潜力的重组与放大,每一次提升都应区分真实的增长与精致的修辞。

参数规模的边际,改进机制的权重

这套机制的工程化正在松动以参数规模论高下的旧有格局。

清华与Frontis开源的OpenRSI,以35B模型在单张RTX 4090上、每任务12小时的预算,于MLE-Bench Lite取得71.21%,超过GPT-5.5与Codex的组合,逼近2.8T参数的Kimi K3。

OpenRSI/README.md 位于 main · FrontisAI/OpenRSI · GitHub

云知声今日发布的U2-Flash则提供了另一种极端样本,266B总参数、单次推理仅激活约10B,DeepSWE v1.1取得64.6、较前代翻倍,TerminalBench 3.0取得24.3、为前代2.7的9倍,SWE-Bench Pro取得61.6,越过若干万亿参数级对手。

云知声发布U2大模型,可自主拆解并完成100+步复杂真实工作流- DoNews

云知声发布U2大模型,可自主拆解并完成100+步复杂真实工作流- DoNews

参数规模决定能力的天花板,改进机制决定从既定底座中兑现出多少能力,两者正在从同义词变成两个独立的变量。

成本维度同样出现了可核实的信号。

形式化验证的单成果成本已被压到2000美元量级,35B级模型的训练实验可以在单张消费级显卡上完成,研发能力的门槛正在从硬件预算向算法效率迁移。

训练现场已经发生的变化

机制层面的变动,在训练现场体现得更为具体。

U2-Flash的后训练闭环分四步运行,模型先行执行任务、暴露薄弱环节、生成针对性数据、经强化训练与验证后进入下一轮,传统上依赖人工判断的补弱环节交由模型自行完成。配套的难度校准机制依据当前通过情况动态调整任务分布,使恰好超出能力边界的任务始终保持高占比,训练集由此与模型同步生长,模型实质上兼任了自己的教练。

训练侧采用多教师在线蒸馏,数学、代码、Agent、指令跟随四个专项模型分别修炼后汇入同一学生模型,教师对输出逐Token监督,达到同等能力所需训练步数较从零强化学习减少约55%

另一个容易被忽略的细节是训练运维的自动化,节点故障由Agent完成日志检索、故障定位、节点切换与任务恢复,平均恢复时长压缩至人工介入的三分之一。

更值得记录的是它的自我约束。

所有自主调整被限定于人工设定的沙盒与验证标准之内,全程留痕、可回滚,并被写入同一份发布公告。在集体自欺事件刚发生过的时点,这种克制本身就是产品能力的一部分,甚至可以说,验证纪律正在成为新一代模型的核心竞争力之一

算力的再配置

自我改进并未减少算力消耗,而是将其重新配置。

递归每完成一圈,都须先消耗算力证明这一圈真实有效,沙盒环境、回归测试、独立审计、对抗评估,这些环节天然串行、难以并行,无法靠堆叠芯片粗暴加速。

理查德·索赫在创立Recursive Superintelligence时对此表述得极为直白,在其构想的RSI图景中,算力将成为唯一最重要的资源,人类活动的影响可以忽略

这家仅25人、尚无公开产品的公司凭一份研究纲领获得6.5亿美元融资、46.5亿美元估值,谷歌风投与Greycroft领投,英伟达、AMD跟投。资本的投票指向同一个判断,瓶颈正在从人类头脑中的想法,转向机器能否独立完成从提出假设到验证假设的完整循环。索赫划出的界线同样值得记下,让AI改进别的事物是改进,让AI改进改进AI的过程,才是递归自我改进

不应忽略的冷静声音

为完整计,反方观点也应进入视野。

一种相当有分量的批评认为,当前所有的自我改进都仍在人类预设的目标框架与搜索空间内运行,本质是对人类已有知识的重组与效率优化,并未产生真正的原创性突破,所谓递归更接近自动化的工程迭代而非智能爆炸

维尼亚尔斯排除了爆发形态,陶哲轩则在评论OpenAI的Lean证明时给出了一个更精细的保留,机器可以验证形式命题从公理推出,但形式命题是否忠实对应那个本欲证明的定理,是另一项需要独立审查的工作。

这种争议并非泼冷水,而是RSI领域最核心的张力,它提醒我们,验证技术的每一步进展都值得肯定,但验证的对象、范围与语义,永远存在尚未闭合的缝隙

结语

谷歌是否跑通了RSI,目前无人能给出可被检验的回答,除非有人拿出一个模型无法影响的度量体系,测出各方都无法抵赖的结论。

可以确定的是另一条线索。当模型开始兼任自己的教师、改写自己的训练流程、修复自己的训练设施,行业最稀缺的品质便不再是智能本身,而是诚实认识自己的能力。MetaRSI的定律已经写得明白,自我认知会过期,越强的系统越需要一面照得出原样的镜子。AI造AI的阶段,最终的比拼不在于谁的模型更善于进化,而在于谁的进化不需要美颜


- END -

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信