
8月19日,2026世界机器人大会在北京亦庄开幕,将持续到23日。300多家企业参展,较去年增加近七成,展品超过3000件,首发新品300余款,规模创历届之最。 一个月前,上海的世界人工智能大会刚完成一次算力阅兵,十万卡超集群、业界最大规模的超节点真机轮番登场,云端智能的边界还在向外推。两场大会摆在一起,一个被主流报道忽略的错位浮现出来。数据中心里的算力正在走向过剩,而机器人本体上的算力仍然稀缺。云端大模型一年几次的能力跃升,并没有同步发生在拥有钢铁身体的物理智能身上。 具身智能产业最核心的约束,就藏在这道裂缝里。本届大会的产品发布和技术议程,恰好提供了观察这道裂缝如何被修补的样本。 大语言模型的成功建立在一个隐含前提上,智能可以住在云端,通过网络随取随用。机器人推翻了这个前提。 一台机器人完成一次抓取,从视觉感知到关节执行的闭环必须在毫秒级完成。云端推理的往返延迟在200到800毫秒之间,端侧本地推理可以压到10到60毫秒。这不是体验差异,而是可用性的分界线。断网的云端方案在地下室仓库和户外巡检场景直接失效,这正是今年量产机型普遍转向本地主推理加云端辅助迭代架构的原因。 更深一层的约束来自功耗。 行业专家的测算显示,人形机器人电池系统的总功率预算通常在数百瓦量级,扣除电机和传感器之后,留给计算芯片的功率预算往往只有十几瓦到几十瓦,而一张数据中心高端GPU的功耗在700瓦量级,两者相差一个数量级。 以特斯拉Optimus为例,正常行走约500W的功耗里,关节执行器一项就占去约七成,计算平台只分到80W上下。端侧算力的天花板从一开始就被电池和热设计锁死,这不是制程工艺能单独解决的问题。 这决定了机器人算力芯片的评价标准和云端完全不同。 英伟达的Jetson Thor在FP4稀疏精度下能提供2070 TFLOPS峰值算力,FP8精度下为1035 TFLOPS,但40到130W的功耗区间对多数量产机型仍然偏高。 头部厂商因此普遍采用Orin当大脑、瑞芯微RK3588当小脑的双芯片组合,跨芯片调度又会引入时延抖动。 今年的明显动向是算控一体,地瓜机器人的旭日S600把560 TOPS的BPU和负责运动控制的实时MCU收进同一颗芯片,北京人形的天工3.0确定搭载,优必选下一代机型也已规划搭载,目前处于真机适配与场景测试阶段。 当行业从验证可行性走向规模化量产,算力竞争的关键词就不再是峰值TOPS,而是单位瓦特能完成多少次有效决策。 文本世界的繁荣来自一条经验法则,参数、数据、算力同步放大,智能就会涌现。这套方法论在机器人身上遭遇双重挫败。 第一重是数据。可用于训练的高质量人类文本约有300万亿token,几乎被语言模型消耗殆尽。而全行业可用的具身数据只有约50万小时,与语言模型训练语料之间存在万倍以上的量级差距。 更麻烦的是数据的性质。 今年WAIC期间有专家给出过一个判断,纯视频数据不足以训练世界模型,因为视频只提供几何信息,无法传递质量和力的分布,从视频里推不出牛顿第二定律。训练涉及接触交互的物理智能,可能需要千万小时级的真实交互数据,而真机采集的成本高达每小时数百元。 面对真实数据的稀缺,行业普遍的中间解是用仿真数据打底。 英伟达从DGX训练、Omniverse仿真到Jetson推理的全栈布局,本质上就是在押注这条仿真预训练加真机微调的路径。 但仿真到现实之间存在一条难以逾越的鸿沟,有研究测过,具身智能在仿真环境的任务成功率能到89.4%,进入真实家庭场景直接跌至12%。摩擦、形变、噪声,这些物理世界的微小变量,足以让虚拟环境里完美的策略失效。每一小时真实交互数据的价值因此远高于文本,它填补的是仿真无法覆盖的现实缝隙。 第二重更为根本,规律是否成立本身就是待证命题。 王兴兴等多位行业领军者多次公开指出,具身智能现阶段更缺合适的模型架构,强化学习的Scaling Law至今没有形成,每换一个任务就需要重新训练模型。 智源研究院的结论同样谨慎,现有世界模型无论走语言、像素、三维结构还是视觉表征路线,都还没有真正触达物理规律。语言智能的规模红利已经被验证,物理智能的规模红利还是一个待证命题。理解这一点,就不会被任何一段流畅的演示视频轻易说服。 大语言模型有过一个决定性时刻,2017年的Transformer把路线之争一锤定音。具身智能还没有等到自己的这个时刻,本届大会的产品矩阵就是证据,技术路线的分裂程度远超外界想象。 场上目前至少有四个流派,而且成熟度并不在同一条起跑线上。 分层派坚持大脑小脑解耦,用小脑保证千赫兹级控制精度,用大脑负责任务推理,工程稳定性最强,是当前量产落地采用最广的方案。 VLA派把视觉、语言和动作端到端打通,研发热度最高,魔法原子的Magic-VLA K02采用高层理解与低层执行的双系统路线,已经在工厂里跑叠盒封胶这样的长程任务,但整体仍处在试点验证阶段。 类脑派更进一步,智平方把架构拆成皮层、小脑、脊髓三层,将毫秒级安全反射单独下放,学术探索的属性更重。 北京人形机器人创新中心在本届大会发布的Pelican大一统模型,则试图用一套架构覆盖不同本体,押注通用基座的终局,目前只有头部机构有能力投入。 四条路线各有拥趸,也各有软肋。VLA依赖昂贵的遥操作数据,分层架构牺牲端到端的整体最优,类脑体系缺乏大规模工程验证,大一统模型绕不开各家本体接口和数据格式互不兼容的现实。今年6月,具身智能首份行业标准YD/T6770—2026正式实施,算是给这场路线混战立下了第一把统一的尺子。 这种梯度差决定了行业大概率不会出现Transformer式的一锤定音,而是多路线长期并行、逐步收敛。参照自动驾驶的历史,从激光雷达和纯视觉的多年缠斗到端到端收敛,中间隔了将近十年。具身智能大概率也要走过类似的周期。 技术路线不收敛,直接后果是评测体系的公信力危机。今年智源大会上,多位嘉宾把话说得很直白,现有的机器人榜单不可信。 这不难理解。演示视频可以剪辑,成功率可以只报熟悉场景,单项能力可以靠专项训练刷分。削黄瓜的、做麻婆豆腐的演示层出不穷,但一个展示动作只代表底层技术的一环,与通用智能之间隔着巨大的鸿沟。 真正的进步发生在评测标准的切换上。 行业研报已经捕捉到这一变化,评价体系正从样机数量和单项成功率,转向订单、交付、运行时长、故障率这些面向结果的指标。 工厂一线的数据开始成为新的度量衡,智元精灵G2在消费电子工厂8小时连续作业,每小时处理约310台平板,综合成功率超过99.5%,小米机器人在汽车工厂连续自主运行3小时,双侧安装成功率90.2%,后者与人类熟练工人99%以上的良率相比仍有明显差距,但这类可公开检验的长时程数据,含金量远高于任何一段剪辑过的演示。 本周末将在冰丝带开赛的第二届世界人形机器人运动会,是这套新度量衡的大众版本。 来自16个国家和地区的666支队伍、2000多台机器人同场竞技,把评测从剪辑室搬上了公开赛道。赛场冠军不等于能进工厂干活,但公开、对抗、不可预设的环境,至少过滤掉了演示时代最大的一块水分。判断一台机器人的智能水平,别看它最高光的三十秒,看它在陌生环境里犯错之后如何处置。 纠错能力,才是物理智能真正的分水岭。 从上海到北京,7月的WAIC和8月的WRC构成了一组耐人寻味的对照。前者回答AI有多聪明,后者回答这份聪明能不能装进一具身体、走进一个房间、完成一件真实的事。人工智能正在从预测下一个词元,走向预测下一个物理状态。 云端过剩与端侧稀缺的错配,也正在催生一个全新的赛道。英伟达、高通、地瓜机器人、芯驰、黑芝麻之外,理想、小鹏等车企的自研芯片也在切入,沐曦与优必选甚至合资成立了专攻机器人端侧芯片的公司,计划2028年量产。这条赛道不看峰值算力,看的是极致能效比、实时性和功能安全,它既是AI算力下半场的新增量,也是国产芯片在高端GPU之外的另一条突围路径。当算力的竞争从数据中心延伸到每一台机器人的身体里,具身智能的故事才算真正开场。而对当下的行业来说,最稀缺的资源不是芯片也不是资本,是对真实进度的诚实。这届大会传递出的积极信号是,说真话的人正在变多。 - END -





2026全球闪存峰会
随着生成式AI进入规模化落地阶段,大模型训练与推理对存储性能、容量、架构的需求持续攀升,存储正从被动的数据容器,升级为驱动AI产业发展的核心底座。
在此背景下,以“存力跃迁,AI破局”为核心主题的2026全球闪存峰会(Flash Memory World 2026),将于2026年8月26日在中国武汉正式举办。本届峰会由 DOIT 传媒、华中科技大学计算机科学与技术学院、华中科技大学集成电路学院联合主办,汇聚全球存储产业链力量,全面呈现闪存技术前沿突破与 AI 时代的产业新图景。
报名通道:https://app.ehub.net/register/nga5ph
扫描下方二维码 关注我们
本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

评论列表