
今天,“豆包工作”正式发布,一天前TRAE和扣子团队整体并入豆包体系,再加上7月底飞书产品团队与豆包团队完成整合,字节旗下分散在各处的AI办公资产终于收拢到同一面旗帜下。 舆论场里大家都在聊产品整合、组织架构和飞书上下文壁垒,这些当然重要,但如果把镜头拉远,从AI算力和GPU的视角重新打量这盘棋,会发现另一个更隐蔽也更关键的战场正在打开。 “豆包工作”有一个被很多人忽略却极具技术意味的能力,被命名为指哪改哪。 用户对生成的文档、表格、PPT或网页里的任意部分直接框选后便可改动,而非重新生成。官方表述很直白,这既节省了算力消耗,也提升了任务完成速度。 在AI办公赛道,这绝不是一句轻飘飘的体验升级。 当前大模型办公助手的典型交互逻辑是生成不满意就重roll,每一次重新生成都要走一遍完整的推理链路,消耗全新的token。 一份十页PPT如果反复调整五轮,累计消耗的GPU算力可能远超初始生成。 在日均token调用量已经突破180万亿的体量下(该量级符合字节近期对外透露的豆包调用量规模,属于行业公开的量级数据,非精确官方财报数字),这种节流设计的战略价值远超用户体验层面,它直接关系到字节能否把推理成本压到订阅价格以下。 “豆包工作”提供了本地电脑与云电脑两套执行环境,用户可以根据任务属性灵活选择算力载体。 本地模式让AI直接操作用户的个人电脑,适合处理本地文件和调用本地软件,云电脑则是独立隔离的云端沙箱,即便个人电脑关机,任务也能持续后台运行。 这个设计在算力层面有一个很少被提及的意义,那就是端侧算力分担。 目前海外主流Agent如OpenAI Operator、Anthropic Computer Use基本采用纯云端运行模式,所有推理负载都压在服务商的GPU集群上。 “豆包工作”的本地模式则把一部分轻量任务调度到了用户自己的设备上,用终端CPU甚至集成GPU完成操作,只有高负载、长耗时的重任务才调用云端算力。 在字节2026年AI基础设施资本开支已上调至超2000亿元的背景下(该数字为多家行业媒体、券商研报测算的字节年度AI基础设施投入预期,属于市场共识级估算,非官方精确披露),这种端云协同的算力调度策略不是锦上添花,而是刚需。 2025年字节净利润同比下滑超过70%(字节为非上市公司,财务数据来自投行与行业媒体估算,核心原因是AI算力与数据中心投入大幅增加,为行业普遍认知,数字为近似值),核心原因正是AI算力采购和数据中心基础设施的资本支出激增。 当C端免费模式无法承担如此高昂的算力成本时,把一部分推理负载转移到用户端,是再务实不过的精算。 但这套设计的价值不止于省钱。 本地模式的另一重意义在于数据安全,企业敏感文档、本地代码可以完全不离开用户设备,仅在本地完成推理与操作,满足金融、制造等行业的数据合规要求。 端侧推理的低延迟特性更适合高频、短周期的操作类任务,云端负责长链路、重计算的复杂任务,二者分工不是成本分摊,而是场景互补。 几乎所有分析都把飞书上下文视为“豆包工作”的竞争壁垒,这没错。 用户用飞书账号登录后,“豆包工作”可在权限范围内继承企业知识和工作上下文,调用聊天记录、文档、会议纪要、日程等信息。 但少有人追问,这些海量非结构化数据喂给Agent时,对GPU显存和推理带宽意味着什么。 有媒体在实测中让“豆包工作”读取编辑部近期围绕世界机器人大会和具身智能展开的群聊,Agent很快找到相关群聊记录和云文档,梳理出核心线索、关键判断、负责人和待核实项,并直接更新到多维表格。 另一个实测案例中,“豆包工作”仅依据一份采购任务书,就自行搜索三家供应商、核对配置、计算报价,最终生成带权重可调评分的交互式评估看板。 这些任务的背后是企业级上下文长、杂、动态的典型特征。 一份年度销售报告可能关联上百个群聊记录、几十份历史文档和多场会议纪要,Agent要理解这些上下文,需要处理超长序列。 豆包Seed 2.1目前的上下文窗口为256k tokens,豆包Evolving则支持1M上下文长度。上下文每翻一倍,推理时的KV Cache显存占用和计算复杂度都在非线性增长。 如果每个企业用户每天都把飞书里的历史数据全量加载给Agent,云端GPU集群的压力将呈指数级放大。 但工程上真实的解法不是硬堆显存。 企业级上下文不会全量送入模型,而是先通过向量数据库做分层召回,只把最相关的文档片段送入推理链路,公共知识、企业制度等固定内容会提前做预计算缓存,用户请求时直接复用,避免重复推理,结合MoE的动态路由,长上下文任务只会激活对应领域的专家参数,进一步控制算力消耗。 这三层优化共同支撑了飞书上下文的可用性。 豆包的解法也藏在模型架构里。 豆包1.5采用MoE架构,总参数规模达到2000亿,但实际推理时通过动态路由仅激活200亿参数,较同类模型降低算力成本约50%。 豆包2.1系列还引入了隐式缓存与显式缓存机制,自动复用请求中的公共前缀,避免对相同内容的重复处理,可将token成本降低50%以上。 这些技术不是炫技,而是为了让飞书上下文这个壁垒在算力层面可持续。 TRAE最初定位AI编程产品,扣子定位AI智能体开发平台,二者并入豆包后,TRAE Work和扣子与豆包在工作场景的产品能力整合,TRAE IDE及CLI则作为豆包品牌下的编程产品线持续发展。 表面看是产品线合并,深层看是算力资源的重新编组。 合并后的豆包体系实际上形成了三级算力调度。 高频标准化任务如日常问答、简单文档处理,由豆包2.1 Turbo承接,其定价仅为Pro版本的一半,强调低时延和高吞吐。 复杂编程和长链路Agent任务由Seed 2.1 Pro处理,在代码评测中已逼近GPT-5.5水平。 多模态内容生成则调用专门的视频或视觉模型。 这种分层让GPU资源不再一刀切,不同算力密度的任务匹配不同成本的模型,整体资源利用率才能最大化。 行业过去两年的焦点始终在大模型训练需要多少万张GPU,但“豆包工作”的发布标志着一个更关键的拐点。 豆包大模型日均token调用量已达180万亿,这个数字背后是无数用户正在把AI从偶尔尝鲜的玩具变成每天依赖的生产工具。 当Agent从生成内容进化到完成工作,单次任务的token消耗可能是简单对话的数十倍甚至上百倍。 更关键的是Agent需要全天候待命,推理需求不再是波峰波谷明显的流量,而是持续稳定的算力吞噬。 传统对话产品的算力成本和用户请求量线性挂钩,而Agent产品不一样。长任务Agent会持续占用算力资源,更像占线而非按次计费,算力成本的刚性更强。 这就要求厂商必须通过分层调度、资源复用、错峰调度把利用率拉满,否则订阅制很容易出现用户越多亏得越多的反直觉结果。 “豆包工作”的三档定价、任务分级、端云分流,本质上都是在给算力资源做差异化定价,用价格杠杆匹配不同成本的算力资源。 字节2000亿的AI基础设施投入中,推理卡占比正在悄然上升,这个结构性变化将深刻影响未来几年的GPU采购策略和数据中心架构。 训练算力看重单卡峰值算力、互联带宽,推理算力更看重能效比、单卡吞吐量、显存容量。 当推理成为算力消耗主力,GPU采购逻辑会发生本质变化,大显存、低功耗的推理专用芯片获得更多落地机会,不再是英伟达训练卡一家独大。 软件节流之外,硬件端的长期布局也在跟进。 2026年6月,行业人士称字节跳动正与天数智芯讨论采购至少5万颗AI芯片,主要用于推理工作。 若交易达成,天数智芯将成为华为和寒武纪之后,字节跳动的第三家GPU供应商。 字节已对算力供应链实行训练、推理双线拆分策略。 超大规模模型训练依托华为昇腾、寒武纪高端训练卡,面向豆包、企业MaaS的高并发线上推理,拟引入天数智芯智铠系列等专用推理GPU。 与此同时,字节也在评估百度昆仑芯芯片方案。 更长远来看,字节还在推进自研AI芯片,目标是在2026年前量产两款芯片,分别针对训练和推理,与台积电合作,采用自研芯片将可为字节节省数十亿美元成本。 专用AI加速芯片在特定办公、Agent场景下的能效比可以达到通用GPU的数倍,是长期降本的核心抓手。当推理场景足够标准化,专用芯片的替代速度会远超训练侧,这也是GPU厂商最需要警惕的长期变量。 对比海外厂商的定价策略,一个有趣的差异浮现出来。 Claude Cowork起步价为Pro 20美元每月,Max 5x档100美元每月,Max 20x档200美元每月。 Cursor Pro定价20美元每月,Ultra档高达200美元每月。 ChatGPT Plus也是20美元每月。海外厂商普遍采用纯云端运行,订阅价格更高,成本压力相对更小。 国内这边,“豆包工作”标准版68元每月,加强版200元每月,高级版500元每月。 WorkBuddy标准版99元每月,高级版199元每月,旗舰版999元每月,但C端完全免费。 海外厂商GPU采购成本、电价更低,且订阅价格更高,成本压力更小。国内用户付费意愿更低、订阅价格上不去,只能通过极致的工程优化把单位推理成本压到订阅价以下,才能跑通商业闭环。 这也解释了为什么国内厂商在MoE、缓存、端侧推理等降本技术上迭代更快。 成本压力是最强的技术驱动力。“豆包工作”的指哪改哪、本地模式、缓存复用,本质上都是同一套逻辑下的产物。 “豆包工作”订阅价格分为三档,标准版68元每月,加强版200元每月,高级版500元每月。 这些数字不是随意定的,它们必须覆盖云端GPU的折旧、电费、带宽和运维,还要留出利润空间。 指哪改哪省下的算力、本地模式转移的负载、缓存机制复用的token、国产推理芯片替代降低的硬件成本,最终都会反映在这张价格表的可持续性上。 所以当我们谈论“豆包工作”能否撼动AI办公赛道时,不妨先问一个更底层的问题,它的算力账能不能算平。 产品整合可以靠组织调整完成,飞书壁垒可以靠数据沉淀建立,但GPU的功耗和显存不会因为商业策略而打折。 在这个意义上,“豆包工作”发布的真正主角,或许不是Agent,而是藏在数据中心里那些正在全速运转的显卡。 - END -

2026全球闪存峰会
随着生成式AI进入规模化落地阶段,大模型训练与推理对存储性能、容量、架构的需求持续攀升,存储正从被动的数据容器,升级为驱动AI产业发展的核心底座。
在此背景下,以“存力跃迁,AI破局”为核心主题的2026全球闪存峰会(Flash Memory World 2026),将于2026年8月26日在中国武汉正式举办。本届峰会由 DOIT 传媒、华中科技大学计算机科学与技术学院、华中科技大学集成电路学院联合主办,汇聚全球存储产业链力量,全面呈现闪存技术前沿突破与 AI 时代的产业新图景。
报名通道:https://app.ehub.net/register/nga5ph

扫描下方二维码 关注我们
本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

评论列表