过去二十个月,大模型的叙事一直卷在训练端,参数、数据、算力。智谱这两天放出的东西,价值恰恰不在模型本身,而在优化的对象变了。

9月17日,Infra Agent的工程细节公开。GLM-5.3驱动的Agent在超过10万张国产芯片组成的集群上,参与完成GLM-5.3-Flash整套推理服务的设计、调试与优化,不到两周把端到端吞吐做到初始基线的3倍,硬件利用效率与单token成本达到主流NVIDIA GPU的相当水平。这套系统此前已承接真实流量,GLM-5.3-Flash以匿名模型Ox-Alpha上线OpenRouter与OpenCode,6天token调用量超过62万亿。

9月18日,GLM-5.3-FlashX上线,基于同一基座做Infra侧推理优化,单请求速度最高200 tokens每秒,较Flash提升5倍,模型智能不变。
两个发布值得放进同一个坐标系。但先厘清一个被互联网用乱了的概念。
市场上被称为RSI的东西有三类。模型自主训练迭代下一代权重,这是狭义RSI,尚未落地。Agent辅助生产训练数据与对齐,这是部分落地。Agent优化运行模型的整套软件系统,这是本次Infra Agent做的事,已经生产落地,但它不触碰模型权重。把这个限定说在前面,是对概念的基本尊重,也是对智谱官方口径的尊重。他们交出的,是推理系统层面的最小自我改进闭环,距离完整RSI仍有明确距离。
历史谱系里,它站在第三阶
2023年DeepMind的AlphaDev用强化学习发现更快的排序算法。FlashAttention用IO感知重排注意力计算。TVM Ansor把调度交给编译器搜索。优化推理系统的力量一直在迁移,从手写kernel的专家,到编译器的搜索算法,再到模型自身的推理能力。

Infra Agent站在这个谱系的第三阶,而且是第一个在生产集群规模上站上去的。
和TVM Ansor那一代工具的本质区别值得写清楚。传统自动调优的搜索空间由人类预先固定,只能在给定算子模板里搜参数,无法越过模板看到上层系统。
Infra Agent可以穿透算子内核与调度逻辑,一直上探到Python运行时层,还能自主修改上层业务代码。这是两代工具的分水岭。
四个值得细读的技术细节
外行看3倍,内行看这四个点。
▪︎ 最贵的瓶颈不在芯片,在解释器
KV Transfer是Prefill与Decode分离架构里跨节点搬运KV缓存的环节,本应和计算并行,实际从未重叠,损耗超过20%。根因不在硬件,而在Python的全局解释器锁,节点内路径未及时释放GIL,传输被宿主语言的并发模型卡成串行。
Agent追踪Python与C++调用链定位到问题,把损耗压进1%以内。这个细节的信息量在于它诊断的层次下探到了语言运行时。以往的调优工具只报告哪里慢,这个Agent指出的是慢在解释器的锁上,解法必须绕开GIL。这是系统思维的证据,不是模式匹配。
▪︎ 一个回流开源社区的精度修复
在处理KDA上下文并行路径时,Agent发现输入按FP32传入,计算却走了Triton的TF32路径,舍入误差在长序列的状态传播环节逐层累积。它通过比较不同执行路径,精准定位到精度处理缺陷,推动Flash Linear Attention项目完成关键修复,相关代码已合并上游,PR #1180。
这个案例值得单独停留。线性注意力靠循环递推状态压低长序列成本,代价是对数值误差敏感,这类精度问题在长序列执行路径上并不罕见。
更重要的是修复的方向,改进不只服务于智谱自己的集群,而是回流到了开源项目里。自我改进的产出外溢成公共资产,这是评估这类实践时比吞吐数字更有分量的指标。
▪︎ 纸面架构优势,靠算子工程兑现
GLM-5.3-Flash是首个采用线性注意力与稀疏注意力混合架构的开源前沿模型,总参数320B、激活18B,注意力计算量较GLM-5.3降低3.01倍,KV缓存降低4.44倍,1M上下文。这些渐近优势要变成SM上真实执行的指令流,每一层都要kernel级工程兜底。

Agent对KDA Decode算子拿到1.71倍提升,做法是识别出重复执行的归一化计算并重组计算结构。优化思路来自对SGLang等开源项目代码的学习与实验验证。

换句话说,它把顶级kernel工程师不可言传的手感,变成了可检索、可回放、可复用的方法论,再从存量kernel里提炼优化骨架,回灌到目标算子。
▪︎ Agent的天花板,是人搭的反馈底座
这是最容易被忽略的一点。Agent不是直接读线上日志干活,它依赖一套人类预先构建的稠密反馈系统,正确性测试、算子微基准、Trace、运行时事件、端到端压测,全部要求低成本、可复现、可定位到具体代码路径。

Agent能力上限的很大一部分,取决于人类给它的反馈基础设施。没有这套测试与profiling底座,Agent无法判断一次优化是收益还是性能回退。所以这套系统的真实分工是,人定义目标、划定边界、审核关键修改,搭好反馈环境,Agent在边界内完成瓶颈定位、代码改写、迭代验证。优化的主体变了,验收的主体没有变。

十万张国产芯片,是这次实验真正的背景板
另一个容易被轻描淡写的维度是硬件环境。这次部署不是在成熟CUDA生态里做锦上添花的调参,国产加速器的原生算子库不完备,互联带宽与显存存在差距,大量文档缺失,Agent面对的是芯片适配与性能调优的双重任务。
顶层架构同样是人设计的。ReplaySSM用计算换显存,节点内张量并行压低显存压力,INT8、FP8、BF16混合精度缓存提高容量利用率,Encode-Prefill-Decode三阶段分离让不同推理阶段独立调度。这些基础架构由工程师预先定义,Agent做的是在既定框架内的瓶颈诊断、算子改写与参数调优。
这个限定不是贬义,反而让结论更扎实。Agent擅长迭代、改良、修复,架构范式的定义仍然依赖人。把两者的边界说清楚,比把一切归功于Agent更有价值。
FlashX,一次商业兑付,也是一份未完成的实验报告
FlashX给这组故事补上了商业化的一面,而且补得很克制。
基座智能不变,纯Infra侧优化把单请求速度推到200 tokens每秒,定价上调至Flash的2.5倍,输入2元、输出7元、缓存命中0.57元每百万token。同一底座按速度分层,瞄准的是Agent多步调用、实时编码这类对串行延迟敏感的场景。

从方法论看,FlashX就是Infra Agent那套闭环的直接兑付。5倍提速不改一个权重,全部来自系统侧,这是两天两个发布之间最硬的一条纽带。
但也正因为它全部来自系统侧,有一组问题必须继续追问。200 tokens每秒是单请求、小batch的极限指标,而商业价值要看高并发多batch下这项能力能否保留,会不会出现吞吐断崖。长上下文场景的衰减曲线、投机解码若存在其验证开销由谁承担,官方没有披露实现路径,这些留白本身构成了一份待完成的实验报告。在此之前,任何颠覆式的表述都称不上严谨。
冷思考,闭环越过权重边界之后
递归自我改进此前默认在权重层面打转,模型改进自己的训练。Infra Agent做的事,是这个闭环第一次越过权重边界,伸向调度、通信、算子与硬件拓扑。由此留下四个悬而未决的问题。
可解释性退潮。
Kernel改过之后为什么变快,可能无人能完整讲清。当优化者本身是黑盒,验证只能靠回归测试兜底。而优化迭代越快,回归测试套件的维护负担越重,未来推理团队最大的成本,也许不再是写算子,而是维护一套完备的精度与稳定性测试集。
局部最优陷阱。
Agent擅长在现有范式内逼近最优,很难跳出既定架构做顶层创新。它可以把EPD分离架构调到极致,但很难凭空发明下一代推理架构。范式跃迁依旧高度依赖人。
人的位置。
全流程无人工介入这个说法需要修正。准确地说,是优化迭代循环内不需要人逐步干预,而目标、边界、禁区、验收标准全部由人设定。工程师的职能从动手的人迁移为划边界的人,未来推理团队的核心资产,不是手艺,是验收标准。
马太效应不止一道门槛。
跑通这套闭环,需要一个强基座模型,还需要大规模集群、完整profiling工具链、海量回归测试套件、硬件适配经验。模型能力是门槛,配套基础设施是第二道门槛。自我改进会不会演变为拥有算力加工程底座的头部玩家的专属飞轮,是接下来一年最值得盯的分化线。

图灵当年设想机器能改进机器。这套系统给出的现实版本更像一句工程格言,机器开始改进机器,但定义什么叫改进的,暂时还是人。而且这一次,改进发生在机房里,不发生在数学里。
本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。
评论列表