AICC 2026人工智能计算大会 | Token本位:算力产业的计量革命与Agent基建拐点

当Agent成为算力需求的主体,Token取代卡时成为计价单位。从AICC2026看中国算力产业的计量革命与系统突围。

图片

从计算力规模到Agent基础设施

评价一场行业会议的价值在于它能否充当产业认知变迁的坐标。

人工智能计算大会办至第七届,其与IDC浪潮信息联合发布的中国人工智能计算力发展评估报告,构成了观察中国智能算力演进少有的连续性数据序列。2022年版报告曾预测2026年中国智能算力规模约1271.4 EFLOPS,2025年版报告将这一预测上调至1460.3 EFLOPS,并确认2024年实际规模达725.3 EFLOPS,同比增长74.1%,市场规模190亿美元,同比增长86.9%预测值连年上调,实际增速反复超预期,这本身就是需求持续超调的直接证据。

本届大会的成果发布环节呈现了两项标志性成果

其一是《2026中国人工智能计算力发展评估报告》,由IDC浪潮信息联合发布,被明确为业内首份Agent基础设施算力研究报告,IDC副总裁周震刚在主论坛对报告核心框架做了专场解读。

其二是可靠AI测评体系,定位于填补国内AI第三方评测的空白。

图片

从发布现场的总览框架看,该体系以应用、数据、模型、基础软硬件四层呈现概念结构,对应的测评对象则细分为应用、数据、模型、框架与系统软件、整机与互联、芯片六个层级,其深层意义将在本文第四部分讨论。

前者的坐标意义在于评估对象的切换,从人工智能计算力转向Agent基础设施,意味着产业对算力需求的性质做出了新的界定,需求主体不再是大模型训练与单轮推理,而是持续在线、自主执行任务的智能体。本文以本届大会已释放的信息为样本,从需求结构、供给响应、制度规则三个层面展开分析。


Token计价的产业逻辑与落地瓶颈

Agent对计算体系的冲击,首先不是量级问题,而是负载结构问题。

从规模看,IDC的DAA研究显示,全球活跃Agent数量预计从2026年的约7940万个增至2030年的22.16亿个

从结构看,周震刚在主论坛演讲中给出的分解框架更具分析价值。

图片
图片

Token消耗等于任务执行次数、单任务Token消耗与多智能体协同放大系数三者的乘积,而三项因子同步处于增长通道。任务执行次数预计从2026年的2800亿次增至2030年的415万亿次,多智能体协作又使上下文在任务链路上反复传递,进一步放大单任务消耗。需求增长因此呈乘数效应而非线性叠加。

需要说明的是这一公式是演讲现场给出的分析框架,报告印刷版是否采用同一表述,尚待全文公布后核对。外部研究指向同一结论,Gartner测算单个Agent工作流的Token消耗是标准聊天机器人的5至30倍,高盛预测2030年全球Token消耗量较2026年增长24倍

负载性质层面,演讲中关于过去与Agent Infra的六维对比可归结为一个判断。AI负载正从阶段性、脉冲式的训练负载,转变为长期稳定、实时响应、支持高并发的生产型负载。算力的价值实现方式相应从资源供给转向智能能力服务,计量的最小单位从卡时变为Token。本届大会首次设置Token工厂专题论坛,正是这一经济逻辑在议程层面的直接映射。

图片

但Token经济学要真正成立,仍有三个现实前提未被满足。

1、计量口径


Token并非标准统一的计量单位,不同模型使用截然不同的分词器,同一段中文文本拆分出的Token数量差异可达20%至30%,这意味着同一段业务输入在不同平台会产生不同账单,行业亟待建立统一的计量标尺。

2、成本结构


Agent长会话场景下,相当比例的开销不在新Token生成,而在KV缓存的存储与搬运,缓存命中折扣计费因此出现,阿里云百炼对命中缓存的输入Token按标准单价的一至两成计费,DeepSeek亦有类似机制,只看输出Token单价已无法完整衡量Agent的真实运行成本,缓存命中率成为另一项核心观测指标。

3、架构扰动


MoE模型下专家路由的负载不均衡,使集群实际吞吐与理论算力之间存在动态偏差,相同Token账单背后的真实算力成本并不均一。

计价模式层面同样需要避免简化。

算力按Token计价并不会淘汰卡时租赁,私有化与自建集群场景仍以卡时、机柜租赁为主,Token计价更多集中于公有云、推理服务平台与Agent服务,两套计价体系将长期并行,企业需要同时维护两套成本核算。

与此同时,Token单价持续下行与用量指数级增长并存,总成本增速低于用量增速,这是Agent商业化的基础,但Agent任务循环的不可预知性也使企业很难做出固定预算规划,成本可预测性成为新的痛点。

图片


从峰值算力竞赛到有效算力博弈

需求结构的转变,恰好与供给侧的物理约束叠加。

主论坛的议题设置构成了一条完整的响应链条。

吴华强讲存算一体,马恺声讲Chiplet与3D集成,林咏华讲异构芯片软件协同,张晓雨讲推理引擎优化,刘军讲系统架构。

五个议题指向同一判断,单点性能的边际收益递减,效率增量须从芯片、互连、存储、系统、算子的全栈协同中获取。

这一判断有充分的技术依据。

2.8T参数的开源模型Kimi K3为例,其权重文件约1.56TB,单次前向计算的显存带宽需求以TB计,大规模专家路由引发的卡间通信使互连带宽成为首要瓶颈,未经系统级优化的集群实际吞吐与理论峰值之间存在数量级差距。

与此同时,存算分离架构下数据搬运的功耗与时延开销,对长链路、高频调用的Agent负载尤为敏感,存储墙与功耗墙在Agent时代被进一步放大。

浪潮信息在本届大会上的动作,可以作为观察供给侧响应的完整样本。

根据官方信息可了解到,大会期间浪潮信息将展示元脑AI Work一体机、开放超节点、企业智能体管理平台元脑企智EPAI、原生液冷智算系统等创新产品与解决方案。

2025年9月的上一届大会上,元脑SD200超节点将DeepSeek R1的Token生成速度压缩至8.9毫秒,创下当时国内大模型最快纪录,元脑HC1000超扩展服务器则将每百万Token成本首次压至1元以下。

2026年7月,其又发布CPU原生液冷整机柜服务器,单柜集成384颗CPU、支持4万以上Agent并发运行,并将元脑SD200在Kimi K2.6万亿参数模型上的单Token生成时间进一步缩短至4.77毫秒

需要向读者说明的是上述数据均为厂商公布的单机基准测试结果,大规模集群的线上业务中通常会出现性能衰减,不宜直接等同于生产环境表现。

即便如此,这家国内头部AI服务器厂商的产品度量衡已从峰值算力彻底切换为Token速度与Token成本,这一转向本身比具体数字更值得关注。刘军对此的概括是智能体产业化取决于能力、速度、成本三要素,模型能力决定应用上限,交互速度决定商业价值,Token成本决定盈利能力

把视野放宽,国内算力供给侧已分化出几条互补路线。

浪潮以超节点整机系统架构优化,追求单机内多元芯片的高效聚合。智源FlagOS从系统软件栈入手,宣称支持18家厂商32款芯片,解决多芯片的模型适配。华为在一周前的AIDC产业发展大会上发布3D数据中心架构,将供电、制冷与交付周期纳入架构级设计。

存算一体团队则尝试从芯片底层削减数据搬运开销。

四条路径共同指向同一目标,用全栈协同弥补单芯片的性能天花板。作为对照,海外在单芯片性能领先的同时,同样在推进机柜级系统整合与TPU等专用推理ASIC的多元路线,国内路径的特殊性在于,系统层创新不是选择题而是必答题。供给端数据同样印证这一判断。

截至2026年6月底,我国智能算力规模已达2185 EFLOPS,同比增长177%,而本届报告的核心研判之一仍是供需缺口长期存在。需要点透的是缺口缺的并非EFLOPS标称算力,而是能稳定支撑Agent长循环、高利用率、低时延的有效推理算力,大量标称算力受限于软件、互连与缓存,无法转化为有效Token产出。


测评标准化能否解锁AI生产级落地

本届大会较易被忽略、但长期影响可能最深的事件是可靠AI测评体系的发布其意义需置于Agent落地的现实堵点中理解。

图片

当前企业引入智能体的核心障碍并非能力不足,而是可靠性无法度量。任务闭环率、异常处置能力、长时运行稳定性缺乏公认标准,规模化采购与责任界定无从谈起。

第三方测评体系的出现,标志着行业评价尺度正从峰值算力、榜单跑分等供给侧指标,迁移至系统能力、计算效率与应用价值等需求侧指标。

同时也应对其效力保持审慎。

测评体系发布不等于产业立刻采信。Agent承担的许多是开放世界任务,不存在唯一正确答案,闭环率、异常处置、长时稳定性等指标本身难以完全客观量化,测评结果如何与企业采购和选型挂钩,是后续最大的难点。

同样的审慎也适用于Token工厂的愿景,统一要素供给、按量结算的模式要落地,仍面临模型厂商定价策略差异、数据合规隔离要求、跨芯片集群的调度壁垒、跨厂商Token计量口径不一致等现实阻碍。

历年报告持续发布的人工智能城市排名亦提供了观察制度化的另一视角,2024年位列前三的是北京、杭州、上海,算力被当作可比较、可经营的区域战略资源,是其基础设施化的制度表征,今年排名在Agent基础设施口径下的变化值得后续核对。


Token时代算力竞争的核心变量

其一,AI计算的产业重心正从训练侧向推理侧迁移,Token的成本、质量与供给稳定性将成为下一阶段竞争的核心变量,但Token计量口径不统一、预算不可预测仍是产业现实障碍。

其二,中国算力产业的比较优势与突围路径均在系统层,竞争单元正从芯片扩展至整机、超节点乃至数据中心工程,开放标准与异构协同生态的建设进度将决定系统补偿策略的上限。

其三,测评与评价体系的建立是Agent进入生产系统的制度前提,但其实际效力取决于测评指标的可量化程度与行业采信度。

其四,Token计价时代,成本治理能力将成为企业AI团队的核心能力,Agent业务下预算无法按并发用户线性估算,缓存策略、推理强度档位、模型路由调度、多智能体编排逻辑都直接决定最终账单,AI工程团队的命题正从把任务跑通,升级为跑通的同时管好Token成本

卡时与Token两套计价模式将长期并存,这是理解下一阶段算力产业竞争的基本前提。

算力“芯”动向 · 专注AI与算力产业观察

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信