DeepSeek API调价日定档!Gemini 3.7 flash和DeepSeek Harness上线了!当模型可以随便换,值钱的就不再是模型

DeepSeek开源Harness并启动API峰谷定价,几乎同时,谷歌Gemini 3.7 Flash半价上线,距上一代仅三周。看似一收一放,实为同一场迁移,模型加速商品化,价值向编排层与场景层沉淀,行业标尺从Token单价切换到任务成本,大模型生意的中心,正在离开模型本身。


一家以模型为核心资产的公司,做了一个兼容数十款竞品模型的开源框架。一家顶级实验室在旗舰模型两度跳票之后,用21天连发两代轻量模型,价格直接砍到原来的一半。

模型本身正在从大模型生意的中心位置上退下来,取而代之的是模型之外的一整套东西。

本周DeepSeek谷歌各自的动作,都是这个判断的注脚。

模型正在变成可互换的零件


先看谷歌

图片

Gemini 3.7 Flash距离上一代3.6 Flash发布只有三周,年内优惠价定为每百万Token输入0.75美元、输出3.75美元,是3.6 Flash原价的一半。

能力却在大幅上探,DeepSWE成绩从49.0%升至65.3%,考察多步骤任务执行的AutomationBench从17.0%翻倍到30.4%。

图片

三周一代的速度不是偶然,而是一次战略转向的产物。

8月5日,哈萨比斯卸任Google DeepMind首席执行官转任董事长,工程背景的Koray Kavukcuoglu以高级副总裁身份接管日常运营并直接向皮查伊汇报,执掌Google Brain十三年的Jeff Dean携三名研究元老离职创业。

虎嗅对这次人事地震的定性是谷歌AI从研究理想主义转向产品实用主义。

旗舰模型Gemini 3.5 Pro原定6月发布,因代码生成能力未达内部预期而一再延期,至今未发。

旗舰缺位、榜单承压,用Flash系列快速补位并以半价走量,是在开源模型以更低成本运行的使用量激增之际,守住开发者生态基本盘的现实选择。

这个转向的代价写在价格里。

能力越强、迭代越快、价格越低,模型作为商品的贬值速度被自己的节奏亲手加快。三周,过去只够一个团队开完需求评审,现在够一家实验室完成一次旗舰能力的下放。保鲜期以周计的东西,沉淀不下长期溢价。

Harness的真正意图,

是卡住模型与应用之间的位置


理解了模型层的商品化,DeepSeek开源Harness的反常就有了解释。

图片

这套框架一切皆插件,模型、工具、会话、沙箱、UI均可自由替换。其内核Cordis出自知名开源社区Koishi,以微内核和可逆副作用机制实现组件热插拔,在聊天机器人生态中经过多年验证。

而DeepSeek与北京大学此前联合开源的DSpark推理加速框架,则为这套体系的底层模型服务提供了60%至85%的生成速度提升。

Harness以MIT协议开源,兼容OpenAI、Anthropic、Google、Kimi等数十款主流模型,直接对标OpenAI Codex和Anthropic Claude Code,开源后GitHub星标短时间内突破一万。

一家模型公司为什么要把框架做到对竞品如此友好。

把当前Agent编排框架的路线摆开看,答案就清晰了。

  • Codex和Claude Code走闭源绑定路线,体验最深但生态封闭。

  • LangChain、Dify等第三方框架走通用中立路线,适配最广但工程化深度不足。

  • Harness代表第三条路线,模型厂商亲自下场做开源框架,背靠自家模型打磨工程能力,再用模型中立和宽松协议换取生态速度。

它争夺的不是一个工具的市场份额,而是Agent组装标准的定义权。

当模型可以互换,Agent的实际表现就不再只由底层模型决定,工具链、上下文组织、执行策略这些编排层因素开始成为最终效果的大头,谁定义了Agent如何被组装、调度和执行,谁就占据了模型与应用之间的中间层,这个位置对所有模型厂商都是上游。

这套动作里还有一层防御性的计算。

API价格上调势必带来客户流失压力,而一旦框架层形成生态绑定,开发者的迁移成本会大幅抬高,对冲掉模型层的比价效应。

框架沉淀的Agent运行轨迹和失败重试数据,反过来又可以滋养模型的工具调用能力。

开源在这里不是让利,是用最快的速度把护城河从模型挪到框架。

峰谷定价是表象,推理的工程化运营才是本体


DeepSeek本周的另一个动作,API峰谷定价,值得放在同一个框架里读。

高峰时段定在北京时间9点到12点、14点到18点,闲时价格为高峰的一半,官方对动机的表述是更合理地调配资源。

图片

这固然是价格调整,但它也说明推理服务的运营方式正在向电网靠拢。

电力之所以实行峰谷定价,是因为电无法储存,供给刚性而需求波动。推理服务如今具备同样的特征,高峰时段的GPU算力是时效性资源,放走就没了,只能用价格杠杆引导负载分布。

供需数据可以佐证这种基础设施化的程度。

2026年3月,中国日均Token调用量已达到140万亿,据行业估算,东部地区承载着约80%的实时交互推理任务。

推理对延迟敏感,无法像训练那样迁往能源便宜的西部,需求最旺的地方恰恰是算力最贵的地方。

当一项服务的核心矛盾从能力够不够变成资源怎么调度,它就完成了从技术产品到基础设施的转变。

对开发者而言,错峰调度、缓存优化、多模型路由这些原本属于运维的细节,正在变成产品竞争力的一部分。

这套分时机制也为第三方的调度优化工具留出了空间,当成本与时段挂钩,帮企业把任务排到正确时间这件事本身,就有了成为生意的可能。

成本会计的范式切换,分母不再是Token而是任务


模型商品化、编排层卡位、推理基础设施化,最终都落在同一个问题上,AI的成本到底该怎么算

过去的算法很简单,每百万Token多少钱。

但Agent时代的真实业务任务,会触发一长串模型调用、推理Token和工具交互,单价便宜但频繁出错、陷入循环重试的模型,运营总成本可能反而更高。

谷歌发布3.7 Flash时刻意强调的重心不是单价,而是首次执行成功率,希望模型在复杂多步骤任务中减少失败重试与人工干预。

Artificial Analysis的测算显示,在复杂多步骤Agent任务的测算场景下,折扣价运行的Gemini 3.7 Flash单任务平均成本约为0.40美元,中等推理模式降至0.26美元

行业评估模型的标尺,正在从每百万Token的价格切换到每成功完成一次任务的成本。

但需要泼一盆冷水,这个切换短期内走不完全程。

不同行业的任务复杂度天差地别,不存在通用的标准任务作为计价锚点,任务完成度和结果质量的判定高度主观,无法像Token一样精确计量,一次业务流程还可能触发十几次调用和跨工具跳转,成本拆分极难。

这意味着Token计价在中短期仍是行业通用的结算标准,任务成本更多是企业内部的核算标尺。即便如此,方向已经清晰,企业团队真正该盯的指标从来不是孤立单价,而是后者。


把这些变化推到终局,AI产业的分层会变得越来越清晰。底层是算力基础设施,比拼成本、稳定性和调度能力,利润率随同质化竞争持续走低。中间层是编排与框架,定义应用的组装方式,掌握开发者生态,成为新的价值高地。上层是场景解决方案,基于框架和模型做垂直落地,赚取场景溢价。价值的分配重心,正从模型层流向中间层和场景层,这正是大模型生意的中心离开模型本身的完整含义。

对行业里的公司而言,这个变化的含义很直接。押注某一家模型会持续领先,正在变成风险最高的策略,把工程能力建在编排层和任务层,反而是最稳的位置。当模型可以随便换,真正值钱的,是那些换了模型之后依然成立的东西。



2026全球闪存峰会

随着生成式AI进入规模化落地阶段,大模型训练与推理对存储性能、容量、架构的需求持续攀升,存储正从被动的数据容器,升级为驱动AI产业发展的核心底座。


在此背景下,以“存力跃迁,AI破局”为核心主题的2026全球闪存峰会(Flash Memory World 2026),将于2026年8月26日在中国武汉正式举办。本届峰会由 DOIT 传媒、华中科技大学计算机科学与技术学院、华中科技大学集成电路学院联合主办,汇聚全球存储产业链力量,全面呈现闪存技术前沿突破与 AI 时代的产业新图景。



报名通道:https://app.ehub.net/register/nga5ph





扫描下方二维码 关注我们

我们以算力为线,持续跟进算力基础设施的报道,输出洞察,伴随算力行业实现算力自由。敬请关注!


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信