“AI教母”李飞飞Atlas入场:算力焦虑换了一种解法

AI 教母”李飞飞创办的World Labs正式发布Atlas,称其为全球首个多模态世界模型。而Atlas的真正颠覆不在技术炫技,而在于它证明AI算力的计价逻辑正从每token转向每立方米空间。空间智能没有终结算力焦虑,只是把算力战争从语言平面推向了物理世界的新维度。

当AI真正拥有空间记忆之后,算力可以从无意义的重复中解放出来,去做更有结构的事情。

算力焦虑已经成了一种行业慢性病。

H100租赁价在第三方市场上涨了接近四成。海外财经媒体传闻英伟达贝莱德计划合作设立算力基金,规模可能达到五千亿美元(双方尚未官方官宣该基金与具体规模)。国内日均token调用量据行业机构测算可达140万亿(不同统计机构口径差异较大,无统一官方公开数据)。大模型厂商从价格战打到涨价潮,Anthropic甚至切断第三方工具接入,因为有人每月付两百美元订阅费,却消耗了价值五千美元的算力。

所有人都在问同一个问题:算力到底够不够用

就在这个节骨眼上,李飞飞带着Atlas来了


九月第一天,World Labs发布下一代世界模型AtlasWorld Labs对外宣传定位,行业内也有其他团队发布同类世界模型,全球首个为厂商宣传口径)。但比起一分钟1440p视频和单图生成3D这些炫技演示,真正值得细品的是Atlas在算力账本上的隐藏条目。

这不是又一台吃卡怪兽的登场。

而可能是AI行业算力消耗逻辑的一次悄悄转向。

图片
金鱼记忆与空间记忆

大语言模型有个鲜少被提及的先天缺陷。

金鱼记忆。

每次对话都是独立采样,上下文稍微一长就得出钱加token。

模型没有真正的空间记忆,它不理解你描述的那个客厅长什么样,每次都得从零开始编故事。你让它画一张沙发的正面,再画背面,它画出来的可能不是同一张沙发。这种暴力美学式的算力消耗,本质上是重复建设。

图片

Atlas玩的完全是另一套规则。

它的核心设计叫空间上下文

图片

每一张输入图像都被锚定在三维空间的具体坐标上,所有输入融合成一个共享的空间上下文。这意味着模型一旦理解了一个空间,生成新视角的边际成本就趋近于零。你建好一个虚拟客厅,想从门口拍、从窗口拍、从天花板俯拍,不需要重新生成整个世界,只需要移动相机位姿。

算力从重复建设变成了基础设施复用。

Atlas的架构并非完全另起炉灶。

它是自回归扩散Transformer,既继承了LLM的序列生成能力,也吸收了视频模型的扩散生成优势。这意味着它可以复用KV缓存、缓存感知路由、扩散蒸馏等现有成熟的算力优化手段,不需要从零发明一套全新的推理加速方案。

从抽奖到导演

视频生成领域有个长期痛点。

相机控制靠猜。以前让视频模型来个向左推轨或者升降镜头,你得把电影术语写进提示词里,模型理解到什么程度全靠运气。

大量算力浪费在意图对齐这个黑箱环节,创作者像是在拉老虎机的拉杆,出不出想要的镜头全看概率。

Atlas把相机几何做成了原生输入类型。

它直接读取相机位姿,而不是猜测你的文字描述。

图片

World Labs官方博客里打了个比方,创作者坐进导演椅,而不是拉老虎机的拉杆。

从算力效率的角度看,这是从抽奖模式切换到工程模式。算力全部用在画面生成上,中间没有中间商赚差价。

官方横向评测也给出了量化佐证。

在相机控制生成任务上,对比MiniMax H3Gemini Omni FlashFLUX 3等主流模型,人类评审偏好Atlas的比例从75%一路提升至94%。

图片

在稀疏视角3D重建任务上,Atlas的误差值也低于Pi3XDepth Anything 3等专用重建模型。这一性能优势是其算力效率提升的技术基础。

图片

机器人训练的背包革命

据行业统计,今年上半年全球人形机器人出货量同比暴增200%(统计样本集中在工业样机,消费级人形机器人占比很低)。但行业最大的瓶颈从来不是硬件,而是训练数据

真实世界的数据采集又慢又贵,合成数据是唯一的出路。

Atlas从几张手机照片就能重建三维空间,还能同步生成机器人传感器需要的RGB和深度数据。

图片

World Labs的演示里研究人员用普通手机和三脚架拍一段视频,Atlas就能重建整个环境并模拟机器人导航。Real-to-Sim的门槛从专业动捕棚降到了背包里的几部手机。

如果合成训练环境的算力成本有望因此下降一个数量级(为产业推演,非官方实测结果),人形机器人从实验室走进仓库和家庭的进度表可能要重新计算。

但账本还有另一面

视角生成的边际成本变低,不等于无条件无限省钱。

大规模三维场景库的存储、索引和预加载本身会带来新的资源开销。

Atlas能输出点云和3D高斯泼溅,这些显式三维表示对显存的胃口不小。效率收益会受场景规模制约,空间上下文不是无限膨胀的免费午餐。

图片

输入质量也是一道隐形门槛。

如果照片角度过于稀疏、存在严重遮挡或者画质不佳,重建出来的三维空间会产生畸变,后续新视角生成质量会快速劣化。

Atlas官方演示也坦承,输入图像越多,模型想象越少,重建越忠实。这意味着它仍然依赖高质量输入,不是随便几张随手拍就一定能得到可用空间。

端侧部署更是另一道坎。

当前Atlas演示主要跑在云端大算力环境,机器人本体本地实时跑完整世界模型推理,仍然面临巨大算力与显存瓶颈。Real-to-Sim仿真可以在云端完成,但让机器人随身携带一个Atlas,还有很长距离。

不是孤例,是赛道转向

Atlas的发布不是孤军突进。

谷歌OpenAI英伟达以及国内多家团队都在布局世界模型,只是技术路线各有侧重。

Atlas走图像输入到三维空间表征再到新视角生成的路径,部分其他团队则探索视频时序建模或神经场等不同方向。

空间智能正在成为AI领域的共识性下一站。

但共识不等于成熟。

Atlas目前以技术展示和早期合作伙伴内测为主,还没有面向企业的大规模商业化API或产品正式发布。

现在讨论大规模降本更多是技术愿景,真正效果要等商业化落地验证。

另外,算力成本只是总成本的一部分。

图片


三维数据集的采集、清洗、空间校验和场景版本管理会产生新的工程成本。算力下降不等于整体工程总成本同步同比例下降。

给Agent补上物理底座

一个需要澄清的误区是世界模型不是要取代大语言模型。

Atlas擅长的是空间、视觉和物理世界的仿真,但高层任务规划、逻辑推理和语言理解依然依赖大语言模型。

二者是互补关系。世界模型给Agent补上了物理世界的仿真底座,让AI不仅能思考,还能看见和理解空间。

官方同时验证了世界模型的缩放定律

Atlas在开发过程中训练了一系列不同规模的模型,发现每增加一个量级的训练算力,模型就会解锁新的能力。

这意味着未来更大参数、更大场景的世界模型,依然会拉动更高的算力需求。

空间记忆没有终结算力战争,只是把算力竞争推向了新的维度。

大语言模型时代,大家比拼的是每token的成本。

世界模型时代,比拼的可能是每立方米空间的理解成本。

Atlas的价值不在于它省下了多少卡,而在于它证明了一件事:当AI真正拥有空间记忆之后,算力可以从无意义的重复中解放出来,去做更有结构的事情。


算力战争远没结束
只是子弹的口径换了

- END -


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信