一个冷知识:你手机里的AI,九成跑在CPU上?首个面向AI时代的AI原生计算底座已发布

Arm在上海举办年度大会,发布AI原生计算底座CSS for Mobile 2,让CPU和GPU直接跑AI,端侧AI进入全单元协同时代。

图片


9月8日  |  上海  |  Arm Everywhere China年度大会

9月8日,Arm在上海举办Arm Everywhere China年度大会,正式发布第二代移动终端计算子系统CSS for Mobile 2,官方称之为首个面向AI时代的AI原生计算底座。C2 CPU集群搭载双SME2矩阵引擎,运行最新AI模型的性能相比上一代最高提升1.7倍;全新的Mali G2-Ultra NX GPU首次把专用神经网络加速器嵌进着色器核心,神经图形场景每瓦性能最高提升4倍,外部内存流量最多降低70%

参数很多,但大多数报道都漏掉了一个比参数更有意思的细节。Arm在会上分享了一组自家生态的数据,Google Play上95%的AI应用,跑在基于Arm的CPU上

过去几年手机圈的叙事高度统一,NPU的TOPS数字从个位数卷到三位数,发布会的底气几乎和NPU大小直接挂钩。行业共识也在往云端倾斜,瘦终端大云端的调子越唱越高,IDC预测今年国内新一代AI云手机出货量将达到1.47亿台,同比增长31.6%,占到整体出货量的53%

就在这个节骨眼上,Arm干了件看起来有点逆流的事。它没有继续给NPU加码,而是回头把CPU和GPU都重做了一遍。


01被抢风头的CPU,才是端侧AI的隐形主力

95%这个数字乍听反直觉,细想却顺理成章。

手机里那些最常被感知的AI功能,语音唤醒、打字预测、相册分类、实时翻译,绝大部分负载并不在独立NPU的舒适区里。

Android的应用代码跑在ART运行时之上,系统服务、框架层、第三方SDK层层嵌套,这些代码天然长在CPU上。

NPU能承接的往往只是模型里被单独标记出来、格式又恰好匹配的那部分算子,一个模型里只要有算子没被NPU支持,整条链路就得退回CPU兜底。于是宣传里NPU是主角,真正扛活的却是没有趁手工具的老黄牛。

Arm的解法不是再发明一个新单元,而是给CPU补上矩阵乘法这门课。

图片

SME2Armv9架构的矩阵指令扩展,让CPU不靠独立NPU就能直接做矩阵计算。这次C2集群一次上了两个SME2单元,矩阵能力翻倍,效果也直白,小语言模型运行速度提升70%,语音转文本延迟降低40%,记忆检索提速41%,智能体推理提升25%,端到端任务提速24%

更底层的一个设计是查找表指令

SME2能让2bit和4bit的低比特权重一直保持压缩状态,直到进入计算核心时才批量展开成INT8或FP16这类计算格式,内存访问次数随之大幅减少,省带宽和省功耗在这套指令里是同一个动作。

还有个细节容易被略过。C2-Ultra在相同性能下功耗最多降38%。手机不是插着电的服务器,每省一瓦都会直接变成续航和握持温度。端侧AI的胜负从来不只看跑分,还要看谁能不烫手地把活干完。

对开发者来说这事的含义是省心。

通过ArmKleidiAI这类开源计算库,应用不需要重写代码就能吃到SME2的加速,适合CPU的活会被自动调度过去。

支付宝OPPOvivo已经用上了SME2,这大概是大会里最务实的一条消息,说明它不是PPT特性,而是正在被塞进明年你就能买到的手机里。

顺着这个逻辑往下推,NPU的产业角色也在被悄悄改写。

它依然会承担特定高负载算子的专用加速,但通用AI负载和系统级任务会越来越多地由CPU和GPU原生承接。端侧AI的终局不是某个单元的独舞,而是CPU、GPU、NPU的异构协同。


02GPU开始学会脑补,你的下一帧可能是算出来的

CPU的升级是把老工具磨快,GPU这边的动作则是换了打法。

而且这不是Arm一家的转向,几天前高通在骁龙峰会开幕前披露了下一代Adreno GPU的技术细节,首次把专用矩阵核心嵌进GPU切片,配套的Adreno Neural Fusion同样主打AI超分和帧生成,同样已获得Unity虚幻引擎支持。

图片

两家阵营最有代表性的玩家前后脚把AI能力溶解进传统计算单元,移动端AI的竞赛已经从独立加速器的单项比拼,转入全单元协同的新阶段。

Mali G2-Ultra NX的核心变化是把神经网络加速器直接嵌进GPU的着色器核心。

图形处理和神经网络计算从此共用同一条管线、同一套缓存。

以往AI超分和图形渲染分属两个单元,中间结果要来回搬运,费电又费时,现在这笔搬运费全省了。

更有意思的是三项神经技术

神经超级采样用低分辨率画面重建高分辨率,神经帧率提升负责生成中间帧,还有把超分和降噪打包的组合方案。

翻译成人话,一部分原本要逐像素硬算出来的画面,现在开始靠AI生成。帧数警察恐怕要有新的吵架素材,你看到的流畅画面有一部分是GPU现场脑补的。

图片

争议也不是没有。

生成帧能拉高帧率数字,却不等于降低输入延迟,公开研究显示这类技术在PC平台可能带来10到30毫秒的额外延迟,对操作响应要求苛刻的竞技类手游大概率不会买账。

生态适配是另一道门槛,三类神经技术都需要游戏厂商逐款接入调优,只有仍在积极维护、基于Unity虚幻引擎开发的游戏才有机会通过更新获得支持,停止更新的老游戏基本无缘。

所以对玩家来说神经帧率提升更像一颗需要游戏和引擎配合调教的糖,甜不甜取决于厂商的调校功力,也要看游戏本身还活没活着。

整体账面数字是神经图形场景每瓦性能最高提升4倍,游戏性能提升14%,外部内存流量最多降低70%,最高支持120帧稳定运行。生态侧Arm和叠纸游戏、网易腾讯游戏、Unity中国以及虚幻引擎在推这套神经图形方案,演示用的虚幻引擎游戏实现了最高4倍的性能效率提升。


03存储涨价的年头,省内存流量就是省钱

外部内存流量降低70%这条参数平时可能排不进前三,放进当下的大背景里味道就完全不同了。

最近手机行业有个热搜体质的话题,涨价潮。存储芯片供需紧张推高了整机成本,压力一路传导到终端售价。在这种环境里,减少对外部内存的读写,等于直接减少对昂贵内存带宽的依赖。

这笔账并不玄。芯片架构里有条老经验,搬运数据的能耗远高于计算数据,而内存带宽恰恰是端侧AI最常见的瓶颈,模型再聪明,数据喂不进去也是白搭。

SME2的低比特权重压缩和神经图形的管线内消化,打的其实是同一笔账,让数据尽量少出门。当整个行业都在为存储成本头疼时,谁能在架构层面把搬运这笔账算细,谁就把成本压力挡在了芯片设计阶段,而不是转嫁到消费者的购机预算里。

所谓AI原生,或许不是把更多算力塞进手机,而是把每一次不必要的数据搬运都省掉

算力的账,说到底是一笔搬运的账。


04端云协同的共识之下,Arm押注了端侧

端侧算力值不值得堆,行业里吵了很久。

一种声音说模型越来越大,端侧那点算力追不上,不如老老实实做瘦终端,把重活交给云端。

另一种声音认为隐私、延迟、弱网环境这些硬约束决定了端侧必须有真本事。

CSS for Mobile 2Arm对这场争论的完整回答。它没有否定云端,新平台带了一层工作流编排,任务该本地执行还是该调用云端服务,由系统动态调度,CPU负责统一协调权限和进程。它也没有放弃端侧,反而把CPU和GPU都升级成了能独立承担AI负载的角色。

图片

这个思路的潜台词是端侧AI的瓶颈从来不是峰值算力不够,而是任务编排和数据搬运太粗糙。NPU算得再快,如果数据在CPU、GPU、NPU和内存之间来回奔波,体验照样卡成幻灯片。到了智能体AI时代,设备要长时间持续感知环境、自主拆解任务,对调度精细度的要求只会更高

规模也是Arm的底气。

基于Arm技术的芯片累计出货已超过3500亿颗,推任何一次底层升级都不需要说服市场接受一套新东西,只需要让庞大的既有生态顺着自己铺好的路往前走。

Arm此前给出的长期预测是到2030年,SMESME2技术将合计为超过30亿台设备新增超过100亿TOPS的计算能力,无论最终兑现几成,至少说明给CPU配矩阵引擎是被当成十年主线在推,而不是某一代产品的权宜之计。


回到开头的冷知识。95%的AI应用跑在CPU上,另一层意思是过去两年端侧AI的宣传重心和真实负载之间一直有条错位的裂缝,Arm这次做的事某种意义上就是给这条裂缝灌浆。

NPU依然重要,云端依然重要,但AI手机要真正好用,靠的恐怕不是某个单元的单项冠军,而是谁在充当调度一切的组织者。CPU干了三十年这个活,现在Arm给它配了新的趁手工具。

下次手机发布会再吹NPU算力的时候,你可以多问两句,我的应用跑在哪,数据搬了几次。这两个问题的答案,比TOPS数字更接近真实体验。

- END -

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信