DeepSeek刚喊涨价,OpenAI就开放免费畅聊?大模型定价的平行宇宙,同一天裂开了

DeepSeek预告API大幅涨价,OpenAI同日开放免费文字畅聊。一涨一免背后,算力正从统一商品走向分层服务。文字闲聊因密度低而免费,企业级推理因密度高而涨价,大模型价格战已进入比谁更懂算力的下半场。

近两天,一个中国开发者同时收到两条推送。

第一条来自DeepSeek,开放平台弹出一行蓝色小字,计划近期整体上调API服务定价,预计涨幅较大,请合理安排您的使用。

图片

第二条来自OpenAI,ChatGPT免费用户的文字聊天不再设限,GPT-5.6系列低成本模型扩大免费访问,深度推理Think按钮预计下周全面开放。

图片

一个说涨价,一个说免费。

算力的价值,正在被重新计算。


01
同一个Token,两套成本结构

大模型行业过去两年热衷于谈价格战,默认所有Token都是同一种商品。但这两家公司定价的动作恰好证明这个前提本身就是错的。

OpenAI敢把文字聊天免费开放,前提是GPT-5.6系列低成本模型的推理密度已经被压缩到可以支撑海量C端流量。

免费用户拿到的是无限文字聊天,但文件上传、图片生成和语音对话依然受限,这些功能的算力消耗不是一个量级。

付费用户则可以通过滑块调节思考强度,日常聊天用最低档,编程和研究用最高档。

DeepSeek的涨价压力则来自完全相反的方向。

开源AI Agent工具OpenCode披露其平台上DeepSeek V4 Flash的调用量大幅飙升,单日处理Token总量达到天文数字,其中相当一部分来自开发者真金白银的付费调用。

全球最大的API聚合平台OpenRouter发布的周榜也显示,DeepSeek V4 Flash的调用量位居全球第一。

调用量飙到这个量级,V4-Flash API甚至出现了容量不足的问题。海量B端用量带来的算力挤兑,已经肉眼可见。

同一个Token,在不同的场景里,成本结构完全不同。

一次普通日常对话,单轮Token消耗不过数十。

但一个Agent自动化任务、一次代码批量生成、一轮长文档RAG检索,单次任务可以轻松达到数十万Token。

单任务算力消耗差距上千倍。

OpenAI敢免费闲聊,是因为闲聊的算力成本已经低到可以忽略;

DeepSeek的B端API扛不住调用洪流,是因为Agent时代的企业级推理正在把算力池榨干


02
从价格战到成本战

2024年,国产大模型API价格以厘计价,各家喊出永久免费的口号。

两年过去,风向彻底逆转。

2026年以来,涨价已成为全球大模型行业的共同选择,只是各家路径不同。

DeepSeek的涨价预告,本质上是把5月永久降价的激进策略往回拉。

当时V4-Pro的缓存命中输入价低至0.025元每百万Token,折合人民币不到3厘。

但低价跑量的前提是算力池有余量,当调用量把集群跑满,低价策略就从市场武器变成了财务负担。

更值得注意的是DeepSeek的定价策略三级跳。

5月宣布永久降价75%,6月底官方披露峰谷阶梯定价规划,工作日高峰时段API价格翻倍,8月6日又预告全面涨价。

从价格屠夫到涨价先锋,只用了不到四个月。

需要说明的是峰谷定价机制虽于6月底预告,但截至8月6日尚未全量上线对外服务。

豆包在C端推出68元到500元三档月费订阅,Kimi K3发布后48小时内用户请求量超出预估,不得不暂停新用户订阅。

这些现象背后是一条清晰的逻辑线。

通用推理Token正在加速商品化,但具备差异化能力的高端模型反而可以要溢价。

比的不是谁标价更低,而是谁的算力效率更高、谁的缓存机制更优、谁能在同等成本下挤出更多有效输出。


03
隐性成本:单价最低的模型,总成本未必最低

如果只盯着每百万Token的标价做决策,很容易掉进一个陷阱。单价最低的模型,总成本未必最低。

DeepSeek的定价表就是一个典型例子。V4-Pro缓存命中的输入价是0.025元每百万Token,但缓存未命中的价格跳涨到3元,输出价更是6元。

同一个模型,不同缓存策略下成本可能产生数量级差异。

如果应用场景有大量重复上下文,比如客服、RAG检索、代码补全,系统提示词缓存和长对话上下文复用可以把命中率做到60%以上,这时候DeepSeek几乎是全球性价比最高的选择。

但如果每次调用都是全新上下文,成本就会直线飙升。

这种极端价差的根源不只是定价策略设计,更有技术架构的底层支撑。

DeepSeek V4采用超大MoE架构,配合全局上下文缓存机制,在RAG、客服、代码重复提示词等场景下缓存命中率可达60%以上,大幅摊薄单位算力成本。

但全新无复用上下文场景缓存失效,算力全额消耗。

这次官宣后,OpenAI的无限纯文字聊天分批次本周向免费和Go用户推送,深度推理Think功能下周全量放开,但免费用户调用深度推理存在频次限流。

大模型的定价模式正在从按量计费走向按价值分层。

未来开发者的核心能力,可能不是选哪个模型,而是设计一套调用策略,让轻量Token和深度推理Token在正确的场景里各尽其用。


04
定价权正在悄悄转移

当推理成本持续下降,通用文本生成Token的价格终将趋近于电力成本加微薄毛利。

到这个节点,模型厂商的出路只有两条——

  • 要么把规模做到最大、成本摊到最低,走DeepSeek路线靠量取胜;

  • 要么做出别人做不到的能力来收溢价,走差异化路线靠质取胜。

但还有第三条路正在被忽视。

当模型之间的价格差从选A还是选B变成A比B便宜一个数量级,简单的API直连就暴露出巨大风险。

谁能帮企业在不修改代码的情况下自由切换模型、自动选择最优性价比、实时监控各模型的实际使用成本,谁就抓住了价格战背后的基础设施机会。

云厂商和模型聚合平台,可能正在从模型厂商手中接管定价权。

B端API厂商的定价锚点,正从竞品对标转向自有算力硬件折旧、集群运维真实综合成本。

此前市场以统一Token单价评判模型竞争力,当前机构估值框架新增场景综合算力成本缓存效率推理分层溢价三大指标,算力效率与场景适配能力已经成为估值核心权重。


这两家公司这波操作表面上是涨价与免费的对抗,本质上是算力成本结构的分化。文字聊天因为算力密度低而走向免费,API调用因为算力密度高而被迫涨价,多模态推理因为资源消耗大而被严格分层。大模型行业的价格标尺,正在从统一走向多元。

对开发者来说,这意味着选型逻辑需要彻底刷新。比单价更重要的,是理解自己的使用模式落在哪个厂商的便宜区间里。比选模型更重要的,是设计一套能动态调配算力的调用架构。

价格战的终局,未必是谁最便宜,而是谁最懂算力。

- END -

2026全球闪存峰会

随着生成式AI进入规模化落地阶段,大模型训练与推理对存储性能、容量、架构的需求持续攀升,存储正从被动的数据容器,升级为驱动AI产业发展的核心底座。


在此背景下,以“存力跃迁,AI破局”为核心主题的2026全球闪存峰会(Flash Memory World 2026),将于2026年8月26日在中国武汉正式举办。本届峰会由 DOIT 传媒、华中科技大学计算机科学与技术学院、华中科技大学集成电路学院联合主办,汇聚全球存储产业链力量,全面呈现闪存技术前沿突破与 AI 时代的产业新图景。



报名通道:https://app.ehub.net/register/nga5ph




扫描下方二维码 关注我们

我们以算力为线,持续跟进算力基础设施的报道,输出洞察,伴随算力行业实现算力自由。敬请关注!

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信