AI工厂和推理海啸下,存储角色的新定义

行业开始意识到,AI的算力上限不再主要由GPU来定义,高速、高密度的存储产品成为影响AI进一步提升效能的重要因素。存储的角色正在被重新定义,它不再是静态的数据仓库,而是AI生产线中直接影响系统效能的核心环节。作为企业数据存储领域的领导者,Solidigm以专为性能、效率和规模设计的大容量SSD,在这场AI转型中扮演着重要角色。

AI基础设施正在分化为两种截然不同的运营模式:传统数据中心与AI工厂。传统数据中心着重于数据存储和批量计算处理,而AI工厂则以海量、高频、实时的智能算力调度为核心,持续进行模型训练、微调和大规模推理,其最终产品是可衡量的智能输出。驱动这一分化的核心动力,是AI推理的爆发,持续涌现的流量,形成了新的数据海啸。

行业开始意识到,AI的算力上限不再主要由GPU来定义,高速、高密度的存储产品成为影响AI进一步提升效能的重要因素。存储的角色正在被重新定义,它不再是静态的数据仓库,而是AI生产线中直接影响系统效能的核心环节。作为企业数据存储领域的领导者,Solidigm以专为性能、效率和规模设计的大容量SSD,在这场AI转型中扮演着重要角色。

存储,AI生产线的核心引擎

在AI工厂的思维模型中,整个系统如同一条“工业生产线”,核心运营目标是:确保数据管道足够快,让GPU保持满载。一旦存储成为瓶颈,GPU便会因等待数据而陷入闲置,运营成本随之快速攀升。

在AI工厂中,存储是核心的生产环节。它既是为GPU持续供给数据的高性能NVMe层,也是卸载和重用KV缓存的专用存储平台;它既要支撑海量数据集的高密度数据湖,也要保障快速检查点和工件存储,以支持模型迭代的可重现性。存储承担以上多重功能,最终都是为了让各层级存储充分支撑GPU满负载运行。

随着数据集的增长,团队需要在控制功耗、机架空间和成本的前提下扩展容量和密度。这正是Solidigm产品的优势所在。Solidigm提供贯穿AI数据全生命周期的创新存储解决方案,广泛的SSD产品系列,不仅实现了对容量和性能的梯度覆盖,还根据AI工作负载对存储产品的特定需求,匹配不同的产品。尤其是Solidigm率先推出的122TB QLC SSD P5336,深受数据中心和企业客户的青睐,帮助客户有效控制系统复杂度与运营开销的增长。

存储,AI推理经济性的主要影响因素之一

与训练阶段不同,推理场景呈现出四大核心特征:高并发、长上下文、小IO高频读写、低时延刚需。这些特征叠加在一起,让行业长期面临的“内存墙”“存储墙”瓶颈愈发明显。

推理对存储提出了两个看似矛盾的要求:既要内存级的响应速度,又要内存没有的大容量。这一矛盾在键值缓存(KV Cache)上体现得最为集中。然而,现在所面临的问题是,DRAM/HBM容量有限且成本高昂,传统HDD时延无法满足Token生成的毫秒级需求。

对此,NVIDIA提出了G3.5存储层的概念,在本地SSD(G3)与传统共享存储(G4)之间,引入一个专为KV Cache优化的闪存层。它的容量足以承载多轮智能体上下文,位置又足够靠近GPU,可以频繁地将数据预分批传回,而不会造成解码停滞。这也推动了高密度、高能效SSD的大规模部署需求。在3.5层存储层上,Solidigm的观察是,云厂商原先采用“TLC SSD带动HDD的机柜方案,开始变得不太可用”,所以3.5层的提出,让高性能SSD成为解决问题的答案。无论是Solidigm超高性能的PCIe Gen5 SSD D7-PS1010/PS1030,高密度的D5-P5316,还是超大容量的122TB D5-P5336 QLC SSD,这些性能出色且密度突出的SSD均可作为KV Cache的快速溢出层,在有限的机架空间与功耗预算内最大化存储密度,让大规模并发推理成为可能。

AI的进步不再仅仅受计算能力的限制,它正日益受限于数据移动和存储的速度与效率。衡量AI系统价值的核心指标,也正从“每秒Token数”向“每瓦Token数”转变。

面对这一变化,Solidigm亚太区销售副总裁倪锦峰强调:“Solidigm将不断推动高密度存储、液冷SSD等产品和技术的创新,为用户带来更有价值的AI基础设施存储解决方案,助力开创AI新时代。而在中国,Solidigm以覆盖研发、销售、客户支持与品质管理的完整本土团队,坚持‘在中国,为中国’的战略,深度响应本土客户需求,积极践行对中国客户及生态伙伴的长期承诺。

 


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信