AI内存瓶颈浮现,CXL如何从“扩容”走向“池化”?

当AI基础设施进入规模化部署阶段,行业关注的重点也在发生变化:除了GPU性能,内存容量和利用率同样开始成为影响系统效率的关键问题。


由CXL技术应用俱乐部发起,于2026全球闪存峰会同期举办的CXL互联生态与弹性内存池技术论坛上,Arm边缘AI事业部高级市场经理李黎明围绕AI时代的内存压力,分享了CXL从内存扩展走向分层、池化和可组合基础设施的演进路径。他指出,随着模型规模、上下文长度和并发用户数持续增长,内存容量可能在计算资源耗尽之前率先成为系统瓶颈。



这一变化背后,KV Cache是一个典型例子。大模型推理过程中,KV Cache需要保存已经计算过的上下文信息,以避免重复计算。随着上下文越来越长、并发请求越来越多,KV Cache规模可能快速增长,并进一步挤压GPU和主机内存空间。


AI内存需求,正在从“更快”走向“更合理”


过去谈内存,行业通常首先关注带宽和延迟,但对于AI工作负载而言,容量、带宽、延迟、利用率以及功耗和总体拥有成本,需要被放在一起考量。


李黎明认为,并不是所有数据都需要停留在最高性能的内存中。热数据可以留在HBM或本地DRAM,而容量需求更大的工作集,则可以根据访问频率和延迟敏感度,逐步下沉到CXL扩展内存以及更大容量的存储层。


这一思路实际上对应了CXL架构发展的重要方向。


CXL并不是简单地给服务器“加一条内存”,其价值更在于打破计算资源与内存资源之间过于紧密的绑定关系。CXL 2.0已经引入交换和内存池化能力,而CXL 3.0进一步推动资源共享、池化和可组合架构;CXL 3.1则继续增强Fabric能力、内存共享、管理以及RAS和安全能力,为更大规模的解耦式基础设施提供标准基础。


因此,从产业发展角度看,CXL更像是一条渐进式路线:先解决单机内存容量不足,再解决内存分层和资源利用率,最终走向跨主机的池化与可组合基础设施。


从“加内存”到“内存池”,CXL改变资源配置方式


在传统服务器架构中,如果CPU算力仍然充足、只是内存容量不足,企业往往需要通过增加服务器完成扩容。这种方式简单直接,却容易带来计算资源与内存资源的同步增长,也意味着部分新增算力可能无法得到充分利用。


CXL提供了另一种思路:通过Type-3内存设备扩展主机可用容量,让计算和内存能够更加独立地扩展。

进一步发展到内存池化之后,多台主机可以通过CXL Switch或Fabric连接到共享的内存资源池。需要更多内存的主机可以获得更多资源,不需要的主机则无需长期占用固定容量。CXL Consortium也将减少“闲置内存”、提升资源利用率和支持动态资源配置视为池化架构的重要价值。


这对于AI基础设施尤其重要。AI工作负载具有明显的动态性,不同模型、不同推理任务以及不同并发规模,对内存资源的需求并不恒定。相比为峰值需求永久配置资源,池化架构的价值正在于让容量能够更加灵活地跟随业务变化。


700GB KV Cache案例,容量本身就是性能问题


三星近期公布的一项测试,为这种变化提供了一个比较直观的案例。


在其针对KV Cache卸载的测试中,三星比较了512GB DRAM和1TB CXL交换机内存池。当KV Cache规模逐步增加到约700GB时,512GB DRAM已经无法容纳完整数据,系统开始出现KV Cache重计算,吞吐量最终下降到约61K TPS;而1TB CXL内存池仍能容纳约700GB的KV Cache,测试吞吐维持在约354K TPS。


需要特别注意,这个案例并不是证明“CXL内存比DRAM更快”。恰恰相反,三星的测试说明了另一个更重要的问题:当内存容量不足导致数据被淘汰并触发重计算时,容量本身就会反过来影响系统性能。


换句话说,AI时代的内存优化,不能只看单一介质的峰值性能,还需要考虑整个系统能否持续、高效地承载工作集。


CXL真正的挑战,是从协议走向系统


不过,CXL从技术标准走向大规模部署,仍然不是简单地“把设备接上去”。


对于CXL设备而言,控制器、内存控制器、系统互连、管理处理器、RAS、安全以及软件栈,都需要协同工作。尤其当系统从单主机扩展走向多主机共享时,一致性、地址映射、资源隔离和Fabric管理都会成为必须解决的问题。


这也是Arm所强调的生态价值所在。


在演讲中,李黎明介绍了Arm在CXL生态中的角色:除了Neoverse等处理器IP之外,Arm还提供CMN等系统互连IP。以CMN-S3为例,其定位是面向高可扩展系统的互连方案,并支持CXL连接设备,可用于构建包括服务器、存储和其他数据中心设备在内的复杂系统。


从产业角度来看,Arm提供的并不是一个完整的“CXL产品”,而是帮助合作伙伴搭建CXL设备和复杂SoC的基础模块。合作伙伴则可以围绕内存介质、控制器、压缩、管理、安全以及特定AI工作负载进行差异化创新。


CXL的价值,不只是“把内存做大”


从今天AI基础设施的发展趋势来看,CXL最值得关注的变化,并不是简单增加服务器的内存容量,而是推动内存资源从固定配置走向可扩展、可分层、可池化和可组合。


这背后实际上是一场基础设施资源配置方式的变化。


AI模型越来越大,长上下文和Agent应用又进一步放大了运行时数据规模。如果继续按照传统“CPU+DRAM固定绑定”的方式建设基础设施,资源利用率和扩容成本都可能成为新的问题。


因此,CXL的长期价值或许并不在于替代HBM、DRAM或者SSD,而在于把这些不同层级的资源连接起来,形成更加灵活的内存层级。


AI时代真正需要的,不一定是让所有内存都变得最快,而是让不同数据出现在最合适的位置。


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信