过去几年,AI行业最受关注的绝对是模型。模型参数有多大、训练用了多少GPU、性能跑分又刷新了什么纪录,吃瓜群众最受关注。但在2026年,当AI真正走向企业生产环境时,一些人关注的问题开始发生变化。
企业用AI,不仅需要一个好模型,还需要考虑模型运行在公有云还是私有环境,GPU如何调度,训练和推理如何高效管理,数据如何高效传输,KV Cache放在哪里,不同AI芯片如何兼容,以及未来大量Agent产生的任务要如何运行。
换句话说,企业AI落地这件事,正逐渐变成一场包含多个层面技术的系统性挑战。这一变化,也让过去相对独立的几个技术开源社区走到了一起。
9月7日至9日,KubeCon + CloudNativeCon + OpenInfra Summit和PyTorch Conference China在上海举行。CNCF、OpenInfra和PyTorch三大基金会首次联合举办大会,把云原生、基础设施和AI开发者社区放到了同一个大会中。
这不只是大会的融合,更是三个开源技术栈的融合。从OpenInfra的硬件管理能力,到Kubernetes的编排调度能力,再到PyTorch的模型训练和推理功能,三个技术栈之间的协同,有助于帮助企业更充分地利用底层基础设施。
在大会期间的一场媒体交流活动中,来自三大基金会的负责人一起回答了三个问题:为什么三大开源社区现在必须走到一起?AI进入生产环境之后,企业到底会遇到哪些新的基础设施难题?开源又能解决什么问题?

为什么三大基金会必须走到一起?
OpenInfra基金会总经理Thierry Carrez直言:“没有基础设施,就没有AI。每一个模型、每一项推理服务、每一个AI Agent,都需要基础设施才能运行。"无论模型、推理服务还是AI Agent,最终都必须运行在真实的计算、网络和存储资源之上。
过去,不同开源社区解决的问题明显不同。OpenStack等OpenInfra项目主要解决底层基础设施资源管理;Kubernetes和CNCF生态解决应用编排、调度和云原生平台问题;PyTorch、vLLM等则越来越接近模型训练和推理。

但AI进入生产环境以后,这些层之间的界限正在变得模糊。一个大规模AI推理请求,可能同时涉及GPU调度、CPU、内存、高速网络、KV Cache、存储、vLLM以及Kubernetes。任何一个环节掉链子,都可能让昂贵的GPU原地空转。
CNCF CTO Chris Aniszczyk在交流中直言,一个项目无法解决所有问题,一个基金会同样无法解决所有问题。因此,不同基金会需要把各自的专业能力结合起来。事实上,这可不是只是嘴上说说,这种融合已经开始发生在具体项目中了。

例如,CNCF刚刚宣布Karmada正式毕业。它原本解决的是多个Kubernetes集群、云和区域之间的应用编排问题,但最新版本已经开始强化分布式AI训练、多集群GPU/CPU调度等能力。

另一个典型项目是llm-d,它把Kubernetes云原生能力与vLLM等推理技术结合起来,希望解决大规模分布式LLM推理的问题。这意味着,云计算、云原生、AI框架三类技术边界正在消失。
OpenInfra基金会首席运营官,PyTorch 基金会执行董事Mark Collier认为,AI正在从模型时代进入系统时代。虽然模型依然重要,但真正决定企业AI效率的,越来越在于模型下面整个系统能否协同工作。
AI进入生产环境,企业真正难在哪里?
当被问到未来两三年企业最棘手的AI基础设施问题时,几位专家的回答主要集中在两个方向。
第一个是异构硬件越来越普遍。
传统企业应用所面对的服务器相对简单,大体就是CPU、内存、存储和网络就够了。AI显然改变了这个情况,现在不仅有GPU和各种专用AI加速器,同时还要配备HBM、DRAM,高速SSD以及越来越复杂的高速网络。
更重要的是,一个AI任务也不一定会从头到尾运行在同一种硬件上。例如KV Cache可以放在内存,也可以卸载到高速存储。推理中的Prefill和Decode具有不同的计算和内存访问特征,也开始出现分离部署和调度(也就是常说的PD分离)。
实际AI工作负载是一条完整流水线,所以,AI基础设施不能只盯着GPU,而应该把CPU、GPU、内存、存储和网络看成一个完整系统。未来AI基础设施最大的挑战是怎么让这些关键组件一起高效工作才行。
如何看一套AI基础设施是否高效呢?从现实来看,GPU利用率正在成为重要指标之一。GPU价格昂贵,如果大量GPU长期等待数据、等待调度或者等待其他任务完成,GPU浪费的现象就越明显。
招商银行通过Kubernetes以及Kueue、KEDA、HAMi、Fluid等开源项目建立统一控制平台,用1万张异构加速卡做训练、微调和在线推理。根据CNCF公布的数据,其纳入平台管理的加速计算资源达到99%,平均利用率从35%提高到60%以上,每百万Token推理成本下降超过60%。
第二个变化来自Agent智能体带来的挑战。
过去的数据中心工作负载,大量请求最终由人产生。人点击一个网页、输入一个关键词或者提交一个任务,服务器进行响应,这些行为总体上比较容易预测。
Agent却完全不同。一个Agent接受一个任务之后,可能自己拆解任务、调用多个工具、访问数据库,同时启动多个子任务,再根据结果继续发起新的请求。
Linux 基金会云与基础设施执行董事,CNCF与OpenInfra 基金会执行董事Jonathan Bryce傅兰石表示,Agent会主动制造大量并行任务,对基础设施产生远高于传统人机交互模式的资源需求。
这意味着未来数据中心面对的不只是模型越来越大,还有机器开始自己制造工作负载所带来的新挑战。过去为人类访问模式设计的缓存、调度、容量规划和资源隔离机制,都可能需要重新设计。
硬件可以越来越多,但软件不能越来越零碎
AI基础设施还有一个越来越现实的问题,那就是硬件正在迅速多样化。刚才说的是GPU加剧了异构的趋势,这里说的碎片化指的是有多种AI芯片,中国市场尤其如此,大量AI芯片公司正在进入数据中心。
OpenInfra 基金会首席运营官(COO),PyTorch基金会执行董事Mark Collier认为,硬件可以越来越多,但软件不能跟着越来越碎。如果每出现一种新的AI芯片,就重新适配模型、推理框架、调度系统和开发工具,那么整个AI基础设施会变成大量互不兼容的孤岛。
因此,PyTorch基金会提出的目标就是,让任何模型,都应该能够运行在不同芯片、不同云和不同基础设施之上。这也是开源在AI时代越来越重要的原因。
OpenInfra解决底层基础设施的开放管理,Kubernetes提供相对统一的资源编排层,PyTorch连接模型与不同计算硬件,vLLM等项目则进一步建立开放的推理软件层。如果进展顺利,那硬件厂商重复造轮子的局面也有因此得到改变。
今天做AI芯片,已经不是完成芯片设计、流片,再提供一个驱动程序就结束了。它还需要考虑PyTorch能不能跑、主流模型能不能方便部署、vLLM能不能支持、Kubernetes能不能调度,以及企业现有的AI软件栈能不能直接使用。因此,开源软件实际上正在成为连接不同AI硬件的一层公共基础设施。
三大基金会负责人在交流中多次提到,中国企业对开放模型和开源AI技术的采用非常积极。越来越多中国企业正在把开源作为AI系统的优先项,而不是完全依赖封闭的AI服务。与此同时,中国也拥有大量AI芯片、服务器和数据中心基础设施厂商。
这两个趋势最终可能汇合到一起。下面是越来越多样化的AI硬件,上面是越来越丰富的开放模型,中间则需要一个开放、标准的软件栈把它们连接起来,这或许也是CNCF、OpenInfra和PyTorch今天必须走到一起的根本原因。
结束语
在AI技术加速落地的背景下,GPU当然重要,模型也必须重要,但真正决定企业AI能否规模化落地时,还要考虑整个计算、网络、存储、云原生、推理框架和模型软件栈能不能高效协同。
本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。
评论列表