GLM-5.3,一次价值连城的官方刷机

8月14日,GLM-5.3发布。基座没换,参数没加,纯靠后训练把跑分翻六倍,干活比对手省一半的token,还翻出潜伏40年的老漏洞。更强的智能未必需要更大的模型,这条铁律正在松动。

图片



8月14日一份技术报告挂出来,GLM-5.3上线。模型当天就进了ZCode、AutoClaw和GLM Coding Plan,下午一点全员额度重置回满。

报告第一页写着,基座模型与GLM-5.2完全一致,MoE架构下7440亿总参数、单次推理激活约400亿,一个都没动,所有提升来自后训练

结果是官方内部评测里编程体感提升50%,Terminal-Bench3.0从4.6分到28.3分。同一套硬件,刷一套新程序,性能翻六倍,这套玩法过去属于改装车圈,现在被智谱搬进了大模型。

它动摇的不是某张榜单,而是行业默认了五年的那条公式,更强的智能等于更大的模型。公式一旦失效,从算力投资到模型选型,很多账都要重算。

01

预训练的信仰松动之后,算力支出换了姿势

GLM-5.3不是孤例。

就在它发布前,DeepSeek V4 Pro正式版上线,同样底座没换,纯靠后训练把DeepSWE从12.8分拉到62.7分,涨幅接近四倍,再往前两周,V4-Flash正式版用同一套路从7.3分练到54.4分。

谷歌的Gemini 3.x Flash系列也把迭代周期压到了三周一代。

行业主线已体现出预训练的Scaling Laws边际效益在递减,万亿级基座的能力天花板很高,但原始预训练能释放的比例有限,后训练成了挖掘存量潜力性价比最高的方式。

但别误读后训练等于省钱。

强化学习的算力消耗方式和预训练完全不同,模型要在任务环境里反复试错,每一次试错都是真实推理,同时还在反向更新参数。

训练和推理的边界就此被打破,推理集群开始承担大量原本属于训练侧的消耗。预训练的算力账单是一次性的资本开支,后训练把它变成了持续性的运营开支。

对算力产业链这不是需求萎缩,而是需求结构变得更绵长,这种边训练边推理的混合负载,对数据中心的调度和利用率提出了全新要求,通用云服务的架构已经不太适配,这也是头部厂商纷纷自建算力的底层原因之一。

对智谱自己这也是一笔精明的账。

据行业测算,智谱的年化收入运行率在7月已达10亿美元,是国内第一家跨进这个量级的大模型公司,需要说明的是这是月度收入年化推演的运行率口径,尚未经财报正式确认。

订阅生意需要的是持续提升而不是每代重造,同一块基座反复回炉,等于把巨额预训练成本摊薄到一代又一代产品上。发动机复用,改装件常换,这大概是大模型公司能讲出的最健康的一个成本故事。

02

一条分界线,叫可验证

把GLM-5.3各项成绩按涨幅排开,一条清晰的线浮了出来。

图片
图片

涨得狠的,Terminal-Bench3.0从4.6到28.3,DeepSWE v1.1从46.2到66.9,全是代码和终端任务,代码能跑测试,对错机器说了算。

涨得最平缓的,Agents' Last Exam从23.8到28.5,考察开放式研究能力,答案没有标准件。

这不是巧合,这是强化学习的铁律,奖励必须可验证

机器能自动判对错的领域,模型就可以放手自我对弈,越练越强;判不了对错的领域,scaling的油门就踩不下去。

换句话说,后训练时代一个领域的进步速度,取决于它能被改造成可验证环境的程度。

顺着这条线往下看,一个被低估的变化正在发生。

预训练吃数据,高质量文本的红利正在见顶,后训练吃环境,环境却是人造的、可再生的。

谁能把更多真实工作封装成可自动判分的任务环境,谁就握住了下一代模型进步的燃料。最近一年模型公司疯抢领域专家,物理学家、安全工程师、资深程序员,本质上都是环境工程师。

数据是上一代模型的生产资料,环境才是这一代的。

03

agent时代,最贵的不是智商是话多

智谱自研的Z.ai Code Bench上,GLM-5.3高档位准确率31.4%,压过Claude Opus 4.8最高档的29.5%。

差距不大,真正的差距在另一栏,完成单个任务GLM-5.3平均输出约5万tokens,Opus 4.8约12万。同样的活,话少了一半还多。

需要先声明这是厂商私有基准,官方解释是防止数据污染,外界暂时无法独立复现。

据第三方社区固定测试KingBench 3的结果,它80题拿下73题,得分91.25%,排在Fable 5和Opus 5之前,算是补了一条旁证,不过该测试规模较小,参考价值有限,看看就好。

为什么token效率值得单独说?

agent干活的本质是连续输出,读代码、想方案、调工具、改bug、再验证,单任务烧掉几万到十几万tokens是常态,任务复杂度还在以肉眼可见的速度膨胀。

大家习惯了盯每百万tokens的单价下降,却忽略了用量那一栏在以更快的速度上涨。

总成本等于单价乘以用量,单价腰斩,用量翻两番,账单照样变厚。

所以agent时代的核心竞争力多了一条,智能密度

执行路径更短,同样的预算能跑更深的任务,同样的任务能省一半的钱。

两个师傅都能修好水管,一个三趟完工一个跑七趟,手艺相近,工时费差一倍。电动车行业花了十年从堆电池转向抠能耗,大模型正在进入同一个剧本。

04

40年的漏洞被翻出来?

GLM-5.3最意料之外的能力涌现发生在网络安全。

官方原本只想提升模型的漏洞分析水平,训练规模扩大后能力外溢,模型开始能跨阶段推理,串出完整的漏洞利用链。

成绩单要客观着念。

  • CyberGym上84.5%,压过Mythos 5的83.8%和GPT-5.6 Sol的83.6%,确实登顶;

  • ExploitBench上54.4%,距离Mythos 5的78.0%仍有明显身位差。有惊喜也有差距,这才是真实的进展。

图片

但真正值得琢磨的是另外两件事。

01
 漏洞挖掘

漏洞挖掘恰好是可验证性最强的领域之一,漏洞能不能复现,一测便知,它几乎是强化学习最完美的猎物,能力涌现在这里爆发,再次印证那条分界线。
02
 批量清算的可能性

这套能力已经在269个项目中找出2436个漏洞,其中一些在代码里潜伏了40年。过去攻击方的优势是不对称的,防守要面面俱到,攻击只需一点突破,而当AI能批量审计存量代码,不对称第一次可能倒向防御方,因为防御方手里握着全部源代码。开源生态沉积几十年的技术债,第一次有了被批量清算的可能。

智谱的处理节奏也算一种表态,先完成安全评估与加固,两周后再开源权重,尽量限制攻击面、保留防御价值。

这个节奏除了安全考量,还有一层生态卡位的味道,两周窗口期里企业级代码审计场景先跑起来,等权重真正放出时,围绕GLM的工具链已经完成适配。

结合Anthropic对Mythos 5的谨慎释放,一个趋势正在成型,最锋利的能力不再默认全量开放,能力本身开始分级、分批、分对象释放。以后评价一个模型,可能不仅要看它能做什么,还要看厂商决定让谁用它做什么。


GLM-5.3给出的答案其实很朴素,一块基座的天花板,不在于它被造得多大,而在于它被用得多狠。模型正在从出厂即定型的产品,变成持续进化的服务,用户付费的理由,也从换一代新模型,变成留在原地等它变强

两周后权重开源,这份成绩单会被社区逐项复核,是真突破还是跑分化妆术,到时候自然见分晓。在那之前,判断它值不值得用有个更简单的办法,打开Coding Plan,把手里最难的活丢给它,模型自己会说话。

- END -

2026全球闪存峰会

随着生成式AI进入规模化落地阶段,大模型训练与推理对存储性能、容量、架构的需求持续攀升,存储正从被动的数据容器,升级为驱动AI产业发展的核心底座。


在此背景下,以“存力跃迁,AI破局”为核心主题的2026全球闪存峰会(Flash Memory World 2026),将于2026年8月26日在中国武汉正式举办。本届峰会由 DOIT 传媒、华中科技大学计算机科学与技术学院、华中科技大学集成电路学院联合主办,汇聚全球存储产业链力量,全面呈现闪存技术前沿突破与 AI 时代的产业新图景。



报名通道:https://app.ehub.net/register/nga5ph




扫描下方二维码 关注我们

我们以算力为线,持续跟进算力基础设施的报道,输出洞察,伴随算力行业实现算力自由。敬请关注!

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信