华为首席科学家廖恒罕见露面!18层宝塔理论印证梁文锋路线,DeepSeek V4 Flash上线,AI参数通胀迎来拐点?

DeepSeek V4 Flash上线,130亿参数Agent反超490亿V4-Pro,验证MoE稀疏架构。而在近日,华为首席科学家廖恒提出18层宝塔理论并盛赞梁文锋,AI正告别参数通胀,迈入算力效率与系统协同的新阶段。

从算力效率到生态霸权,一场由小参数发起的大革命正在重写行业规则。


7月31日,DeepSeek没按常理出牌。全行业都在等V4-Pro正式版,结果先上线的却是V4-Flash正式版。更离谱的是这个总参数2840亿、激活参数只有130亿的轻量选手,在多项Agent基准测试上直接把自家大哥V4-Pro预览版卷了下去。

Terminal Bench 2.1得分82.7,DeepSWE从7.3一路飙到54.4,DSBench-FullStack拿下68.7。参数只有大哥的四分之一,Agent能力却更强,这剧本放在半年前没人敢写。

但比跑分更值得关注的是,华为半导体首席科学家廖恒在近日的一场深度访谈中,把梁文锋定义为提前预判瓶颈的先行者。当所有人都在无脑堆参数、坚信规模碾压一切时,梁文锋坚定选择了稀疏激活架构,聚焦短窗口高价值算力,仅在512/1K短上下文窗口内完成高精度Attention计算。Flash正式版的上线,恰好是这套逻辑的产物。

参数通胀的时代,可能真的迎来拐点。

01
小参数的大逆袭Not the Model, but the System

AI行业迷信参数规模不是一天两天。GPT-5.5Claude Opus 4.7仍在参数竞赛里狂奔,行业默认的逻辑是总参数越大、激活参数越多,模型就越聪明。DeepSeek V4-Flash正式版用一组反常识的数据撕开了这个幻觉。

130亿
激活参数
82.7
Terminal Bench 2.1
54.4
DeepSWE
68.7
DSBench-FullStack

130亿激活参数,在Terminal Bench 2.1上和GLM-5.2打平,在DeepSWE上反超GLM-5.2的46.2分,在DSBench-FullStack上拿下68.7。它的对手不是别人,是自家拥有490亿激活参数的V4-Pro预览版。这不是暴力堆料的胜利,而是算力按需调度的胜利。

Flash依靠自研DSA稀疏注意力算法,推理阶段仅激活130亿专家模块,其余参数休眠,推理FLOPs降低73%、KV Cache显存占用削减90%。MoE架构的稀疏激活设计,让Flash在推理时只调用最相关的专家网络,用更少的算力完成了更精准的任务。

图片

换句话说,Flash不是更小,而是更聪明。它证明了Agent能力不完全依赖推理深度,精准的工具调用、多轮规划和对复杂指令的执行力,有时候比暴力堆料更管用。

当然,需要客观指出的是,Flash仅在Agent自动化、代码执行、终端指令操作专项反超Pro预览版,在通用世界知识、超长深度推理、超复杂数学证明任务上,仍弱于490亿激活参数的V4-Pro。本次突破是场景化专项能力的效率胜利,并非全维度碾压。


02
18层宝塔的模型层验证The 18-Layer Pagoda Theory

华为半导体首席科学家廖恒最近提出了一个18层宝塔理论,把半导体产业链从基础理论到商业应用拆成18个层级。

他的核心判断是产业链整体性能由最短的层级短板决定,各层级间相互约束、深度联动。硬件底层改动成本极高,流片周期长达18个月;而上层软件栈可实现小时级快速迭代。最优策略是利用上层软件快速试错,反向校准底层硬件的研发方向。

图片

在大模型行业,所有人都盲从Scaling Law,疯狂堆叠参数、无脑堆算力,坚信规模就能碾压一切时,梁文锋主动放弃无脑全量参数堆叠,坚定选择稀疏激活架构,同时聚焦短窗口高价值算力。

——廖恒,华为Fellow、半导体首席科学家

廖恒认为,这不是简单的算法微调,而是贯穿软硬件的顶层战略选择。绝大多数研究者只会深耕宝塔某一层,而梁文锋是极少数能够跨层串联、打通硬件约束与模型创新的人。

廖恒还补充了一个关键逻辑:宝塔下层硬件重资产投入容错率极低,一旦方向错改造成本极高;而大模型后训练、稀疏算法优化属于上层软件轻资产迭代

V4 Flash不靠更换算力硬件、只靠算法与对齐微调实现性能跃迁,完美践行了上层软件试错、反向定义底层硬件需求的宝塔顶层思路,也解释了为什么稀疏MoE路线更适配国产算力芯片的迭代节奏。

Flash正式版的上线,恰好是这套跨层协同理论的完美注脚。它没有改动模型架构和尺寸,纯粹依靠重新后训练就实现了能力跃升。

这验证了一个关键趋势:经典预训练规模法则的价值边际递减,行业竞争重心正向后训练对齐、工具链微调、工程部署效率转移

大模型基座预训练进入平台期后,对齐微调、RLHF强化学习、长上下文窗口优化等后训练环节,对Agent落地效果的边际增益可达30%-60%。DeepSeek本次零架构改动实现跑分暴涨,直接验证了后训练投入的ROI已经超过继续扩大预训练参数规模。


03
开源流量的霸权Open Source Traffic Hegemony

Mozilla发布的2026开源AI报告里有一个数字格外刺眼。

DeepSeek V4 Flash23.58T Tokens的7月OpenRouter月度调用量,高居全球调用榜第二位,开源模型流量实现对闭源体系的整体反超。

MiMo-V2.5以31.2T登顶第一,但Flash作为单一模型能冲到第二,已经足够说明问题。

DeepSeek在这一天正式停用了deepseek-chatdeepseek-reasoner两个旧API,彻底埋葬了V3时代的产品线。当Flash正式版接棒上线,旧时代的API名称被移除,新时代的流量霸权由Flash继承。

OpenRouter的海量调用主要集中在企业Agent自动化、代码运维场景,本质是市场用真实付费投票认可了Flash低推理成本加强工具调用能力的组合优势。

同时月度23.58T海量Token消耗,也反向倒逼DeepSeek进一步优化昇腾集群批量部署效率,形成流量倒逼工程优化、工程优化反哺产品竞争力的正向循环。这属于能力匹配需求带来的真实商业化流量,并非刷量。

MIT许可证意味着任何人都可以免费下载、二次开发、商用部署。但完全开源也是一把双刃剑。

全球开发者可本地私有化部署,降低企业数据出境风险,快速构筑生态壁垒。

但竞品也可直接基于Flash权重二次微调,模型差异化壁垒更多依赖API服务稳定性、算力调度成本、垂直行业微调套件,而非模型本身权重。


04
国产算力落地最优解Lightweight Sparse Architecture

把视角拉回算力层面,Flash正式版的轻量级设计有更深层的产业意义。2840亿总参数、130亿激活参数,意味着它可以在更少的GPU上高效运行,甚至单卡就能扛起不少推理任务。

1600TPS
昇腾950 单卡解码吞吐
10ms
推理时延
8K
长文本输入

昇腾950芯片单卡部署V4 Flash,8K长文本输入下解码吞吐可达1600TPS,推理时延仅10ms,在国产NPU上跑出接近A100的稠密模型效果。

规模化集群部署可大幅削减H100等高端卡采购依赖,为摆脱高端算力依赖提供可落地的技术路线

图片

结合此前V4首发深度适配华为昇腾芯片、完成CANN底层算子改造的背景,Flash正式版可能是国产算力场景的最优解。

Flash这套MoE稀疏激活范式,不仅降低单卡部署门槛,也大幅降低智算中心集群的电力、机柜成本,对于国内大规模政企私有化部署、边缘端本地部署具备极强落地价值,这也是智谱阿里通义、腾讯混元跟进同类架构的核心商业动因。

更长远地看,Flash验证的大总参数MoE加小激活参数范式,已经被智谱阿里通义、腾讯混元跟进效仿。

未来国产大模型会形成两条路线。

一条Pro稠密大激活参数对标海外旗舰,另一条Flash轻量化激活版本适配国产算力、主打规模化商用落地。轻量化稀疏激活路线,正在为国产算力硬件提供最优落地解。

Flash极低的API定价,输入1元、输出2元每百万token,直接挤压中小API服务商、海外开源模型托管平台的利润空间,倒逼整个行业从比拼模型规模转向推理成本、工程吞吐、服务稳定性、场景微调定制能力的综合比拼。几乎在Flash正式版上线的同时,OpenAI宣布GPT-5.6 Luna降价最高80%。这不是慈善,是防御。

DeepSeek V4 Flash正式版的上线,不是一次例行更新,而是AI行业从大力出奇迹转向精打细算的标志性事件。当130亿激活参数就能在Agent任务上反超490亿,参数通胀的逻辑开始崩塌。

廖恒说,摩尔定律的经济效益自16nm后已基本失效,单位晶体管成本不再随制程推进持续下降。AI行业正在经历同样的拐点:参数规模的经济效益也在失效,后训练优化和架构效率的价值被重新发现。开源模型用23.58T Tokens的月用量证明,免费和开源不是商业的敌人,而是新商业规则的制定者。

图片

Flash正式版之后,AI行业的竞争维度正在从谁的参数更多,转向谁的算力更聪明、谁的API更便宜、谁的生态更开放、谁能在半导体18层产业链宝塔中实现软硬件跨层级协同。这场由小参数发起的大革命,或许才刚刚开始。参数通胀落幕之后,AI正式进入算力效率决定产品竞争力、落地价值决定估值天花板的精细化竞争时代。廖恒18层宝塔理论与DeepSeek V4 Flash的相互印证,本质宣告AI行业告别单一参数规模评价体系,进入硬件算力底座、稀疏架构设计、后训练精细化对齐、商业化落地全链路系统能力比拼的新阶段。

2026全球闪存峰会


随着生成式AI进入规模化落地阶段,大模型训练与推理对存储性能、容量、架构的需求持续攀升,存储正从被动的数据容器,升级为驱动AI产业发展的核心底座。


在此背景下,以“存力跃迁,AI破局”为核心主题的2026全球闪存峰会(Flash Memory World 2026),将于2026年8月26日在中国武汉正式举办。本届峰会由 DOIT 传媒、华中科技大学计算机科学与技术学院、华中科技大学集成电路学院联合主办,汇聚全球存储产业链力量,全面呈现闪存技术前沿突破与 AI 时代的产业新图景。



报名通道:https://app.ehub.net/register/nga5ph







扫描下方二维码 关注我们

我们以算力为线,持续跟进算力基础设施的报道,输出洞察,伴随算力行业实现算力自由。敬请关注!


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信