从训练带宽到AI基础设施:并行文件存储的范式重构与实践

AI基础设施的进化,不是从堆叠算力开始,而是从理解数据如何在训练、推理与Agent之间无缝流转开始。只有当并行文件存储能够同时承载混合I/O的高性能、千亿级元数据的水平扩展,以及与对象存储的冷热协同,它才能真正成为AI生产环境的核心底座。

在面向AI的存储系统创新与实践论坛上,百度智能云存储产线负责人段立国带来《面向AI生产负载设计的新一代并行文件架构》主题演讲。他系统梳理了PFS从HPC时代的高带宽存储,到大模型训练加速器,再到今天训推一体与Agent场景下AI基础设施的三次角色跃迁,并首次对外披露了自研PFS L3的完整技术细节。段立国表示PFS L3是围绕AI生产环境重新构建的一套存储系统。

负载之变:单一训练让位于多模态混合I/O

段立国将AI Infra的演进概括为三条主线。第一条是负载方向的演进——从单一训练负载,走向多模态与混合负载。智驾、多模态等场景带来了大小I/O的混合、随机与顺序I/O的混合,对并行文件存储的冲击极大。与此同时,多模态数据的爆发叠加存储芯片涨价,高性能NVMe介质的成本压力陡增,与低成本对象存储的高效协同变得前所未有的重要。

架构之变:训推边界消融,Checkpoint成为迭代关键路径

第二条是架构演进。模型训练从以预训练为主,逐渐演化为以后训练和强化学习为主,训推走向一体化。这带来两个深层变化:一是权重同步更加高频,每轮训练结果需快速分发至推理池;二是Checkpoint已从过去的容错手段,变成了迭代的关键路径。样本生成、评测与训练共享同一份数据,数据集在预处理、训练、微调、推理之间需要无缝流转——训练与推理的边界正在消失,存储成为闭环的关键。

业务之变:Agent火爆,PFS从离线走向在线

第三条是业务演进。Agent的火爆让PFS从承载离线训推,过渡到支持更多在线业务场景,海量文件的快速读写、多租户隔离、精细化权限控制、弹性扩缩容成为刚需。

三条主线交织,对PFS提出了新的考验:高负载混合I/O下性能不能退化;元数据要支持水平扩展至百亿、千亿甚至万亿规模;分布式存储的损耗要接近本地盘;冷热数据与对象存储高效协同;还要支持Agent场景的多租户与弹性需求。

双引擎策略:1.29副本背后的成本与性能平衡

针对这些变化,百度存储团队对PFS进行了系统化升级,推出自研PFS L3。

在存储引擎的设计上,PFS L3依托百度沧海存储的分层复用架构,采用了双引擎策略。对于大于512KB的I/O,直接落入Aries在线EC引擎,最低支持1.2副本,一次落盘无需二次compact;对于小于512KB的I/O,则先写入BlockServer三副本引擎作为持久化缓存,待攒够4MB后再后台compact为大块EC。这一设计的考量在于:EC引擎延迟高于三副本,且小I/O做EC切分会进一步碎片化、加剧后端压力。双引擎协同下,系统整体副本数从三副本降至1.29副本,同时保持250MB/TB的性能密度。

MetaDB:让数据库理解文件语义

元数据管理是另一块核心。PFS L3基于百度自研的MetaDB构建,这套从2019年开始研发的系统已支撑三篇顶会论文:EuroSys 2023上关于CFS文件存储的跨分布式事务优化、SOSP 2025上关于对象存储分层Namespace的scale up与scale out设计,以及已收到NSDI 2027录用通知、旨在让底层数据库理解inode与目录树语义的工作。通过让MetaDB原生理解文件语义,高并发同目录创建场景可获得10.7倍提升。整套系统支持单文件系统千亿规模,4KB IOPS达到2.1W/TB的I/O密度。

40GB/s吞吐与低延迟通路

客户端与网络的设计同样围绕AI负载重新调整。RapidFC客户端采用内核多通道、三级缓存与零拷贝技术,将原生FUSE的串行I/O升级为并行I/O,同时内置本机内存、本机NVMe与池化NVMe三级缓存,尽量将流量收敛至GPU本地。在特定场景下,还提供用户态库让训练与推理框架直接访问后端存储,绕过内核态转换。三种技术叠加,单客户端吞吐可达40GB/s。

网络侧,前端因GPU部署可能跨pod甚至跨AZ,采用用户态TCP替代大规模RDMA,减少内核态与用户态切换,IOPS实测提升40%以上;后端存储节点交互更可控,则大规模采用深度调优的RDMA。前后端均启用Jumbo帧技术,将MTU从1500提升至9000,单连接负载效率提升20%。

数据流动与Agent:从离线训推到在线基础设施

数据流动上,PFS L3支持高性能PFS与低成本对象存储BOS之间的双向流动——数据可导出备份至BOS,BOS数据可预取至PFS训练,PFS冷数据可自动沉降至BOS按需加载。数据流动引擎最大配置达100GB/s,核心目标是以少量热数据保留在PFS、大量冷数据留存BOS的方式,实现性能与成本的高效平衡。

产品功能上,依托MetaDB强大的元数据管理能力,PFS L3可轻松实现千万级Agent空间的快速创建与销毁,满足Agent场景对海量文件读写、多租户隔离与弹性扩缩容的需求。

最佳实践:统一存储底座的生产验证

在百度内部生产环境中,PFS L3已展现出显著价值。原有模式下,模型权重与配置存于AFS,训练前需人工拷贝至GPU机器再同步到所有节点,流程冗长且本地盘故障会损害GPU在线率。采用PFS L3后,代码、数据与Checkpoint统一存放于共享存储,所有训练与推理节点共享同一目录,彻底解决了多机一致性问题。强化学习训练可直接基于PFS进行,周均节省3万卡时;在2000卡以上集群规模下,在线率从98%提升至98.5%。

在演讲最后,段立国总结道,随着AI的持续发展,存储一定能够成为驱动数据、算力和应用协同的核心力量。

这或许正是AI基础设施最本质的演进方向——当训练与推理的边界消融,当Agent从离线工具变成在线生产力,并行文件存储必须从带宽管道进化为数据中枢。引擎决定成本效率,元数据决定规模边界,网络与客户端决定访问体验;三者合一,才能让每一份数据在AI生产的全生命周期中无缝流转。

(根据演讲速记内容整理)

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信