近两天,一个中国开发者同时收到两条推送。
第一条来自DeepSeek,开放平台弹出一行蓝色小字,计划近期整体上调API服务定价,预计涨幅较大,请合理安排您的使用。

第二条来自OpenAI,ChatGPT免费用户的文字聊天不再设限,GPT-5.6系列低成本模型扩大免费访问,深度推理Think按钮预计下周全面开放。

一个说涨价,一个说免费。
算力的价值,正在被重新计算。
大模型行业过去两年热衷于谈价格战,默认所有Token都是同一种商品。但这两家公司定价的动作恰好证明这个前提本身就是错的。
OpenAI敢把文字聊天免费开放,前提是GPT-5.6系列低成本模型的推理密度已经被压缩到可以支撑海量C端流量。
免费用户拿到的是无限文字聊天,但文件上传、图片生成和语音对话依然受限,这些功能的算力消耗不是一个量级。
付费用户则可以通过滑块调节思考强度,日常聊天用最低档,编程和研究用最高档。
DeepSeek的涨价压力则来自完全相反的方向。
开源AI Agent工具OpenCode披露其平台上DeepSeek V4 Flash的调用量大幅飙升,单日处理Token总量达到天文数字,其中相当一部分来自开发者真金白银的付费调用。
全球最大的API聚合平台OpenRouter发布的周榜也显示,DeepSeek V4 Flash的调用量位居全球第一。
调用量飙到这个量级,V4-Flash API甚至出现了容量不足的问题。海量B端用量带来的算力挤兑,已经肉眼可见。
同一个Token,在不同的场景里,成本结构完全不同。
一次普通日常对话,单轮Token消耗不过数十。
但一个Agent自动化任务、一次代码批量生成、一轮长文档RAG检索,单次任务可以轻松达到数十万Token。
单任务算力消耗差距上千倍。
OpenAI敢免费闲聊,是因为闲聊的算力成本已经低到可以忽略;
DeepSeek的B端API扛不住调用洪流,是因为Agent时代的企业级推理正在把算力池榨干。
2024年,国产大模型API价格以厘计价,各家喊出永久免费的口号。
两年过去,风向彻底逆转。
2026年以来,涨价已成为全球大模型行业的共同选择,只是各家路径不同。
DeepSeek的涨价预告,本质上是把5月永久降价的激进策略往回拉。
当时V4-Pro的缓存命中输入价低至0.025元每百万Token,折合人民币不到3厘。
但低价跑量的前提是算力池有余量,当调用量把集群跑满,低价策略就从市场武器变成了财务负担。
更值得注意的是DeepSeek的定价策略三级跳。
5月宣布永久降价75%,6月底官方披露峰谷阶梯定价规划,工作日高峰时段API价格翻倍,8月6日又预告全面涨价。
从价格屠夫到涨价先锋,只用了不到四个月。
需要说明的是峰谷定价机制虽于6月底预告,但截至8月6日尚未全量上线对外服务。
豆包在C端推出68元到500元三档月费订阅,Kimi K3发布后48小时内用户请求量超出预估,不得不暂停新用户订阅。
这些现象背后是一条清晰的逻辑线。
通用推理Token正在加速商品化,但具备差异化能力的高端模型反而可以要溢价。
比的不是谁标价更低,而是谁的算力效率更高、谁的缓存机制更优、谁能在同等成本下挤出更多有效输出。
如果只盯着每百万Token的标价做决策,很容易掉进一个陷阱。单价最低的模型,总成本未必最低。
DeepSeek的定价表就是一个典型例子。V4-Pro缓存命中的输入价是0.025元每百万Token,但缓存未命中的价格跳涨到3元,输出价更是6元。
同一个模型,不同缓存策略下成本可能产生数量级差异。
如果应用场景有大量重复上下文,比如客服、RAG检索、代码补全,系统提示词缓存和长对话上下文复用可以把命中率做到60%以上,这时候DeepSeek几乎是全球性价比最高的选择。
但如果每次调用都是全新上下文,成本就会直线飙升。
这种极端价差的根源不只是定价策略设计,更有技术架构的底层支撑。
DeepSeek V4采用超大MoE架构,配合全局上下文缓存机制,在RAG、客服、代码重复提示词等场景下缓存命中率可达60%以上,大幅摊薄单位算力成本。
但全新无复用上下文场景缓存失效,算力全额消耗。
这次官宣后,OpenAI的无限纯文字聊天分批次本周向免费和Go用户推送,深度推理Think功能下周全量放开,但免费用户调用深度推理存在频次限流。
大模型的定价模式正在从按量计费走向按价值分层。
未来开发者的核心能力,可能不是选哪个模型,而是设计一套调用策略,让轻量Token和深度推理Token在正确的场景里各尽其用。
当推理成本持续下降,通用文本生成Token的价格终将趋近于电力成本加微薄毛利。
到这个节点,模型厂商的出路只有两条——
要么把规模做到最大、成本摊到最低,走DeepSeek路线靠量取胜;
要么做出别人做不到的能力来收溢价,走差异化路线靠质取胜。
但还有第三条路正在被忽视。
当模型之间的价格差从选A还是选B变成A比B便宜一个数量级,简单的API直连就暴露出巨大风险。
谁能帮企业在不修改代码的情况下自由切换模型、自动选择最优性价比、实时监控各模型的实际使用成本,谁就抓住了价格战背后的基础设施机会。
云厂商和模型聚合平台,可能正在从模型厂商手中接管定价权。
B端API厂商的定价锚点,正从竞品对标转向自有算力硬件折旧、集群运维真实综合成本。
此前市场以统一Token单价评判模型竞争力,当前机构估值框架新增场景综合算力成本、缓存效率、推理分层溢价三大指标,算力效率与场景适配能力已经成为估值核心权重。
这两家公司这波操作表面上是涨价与免费的对抗,本质上是算力成本结构的分化。文字聊天因为算力密度低而走向免费,API调用因为算力密度高而被迫涨价,多模态推理因为资源消耗大而被严格分层。大模型行业的价格标尺,正在从统一走向多元。
对开发者来说,这意味着选型逻辑需要彻底刷新。比单价更重要的,是理解自己的使用模式落在哪个厂商的便宜区间里。比选模型更重要的,是设计一套能动态调配算力的调用架构。
价格战的终局,未必是谁最便宜,而是谁最懂算力。
- END -
2026全球闪存峰会
随着生成式AI进入规模化落地阶段,大模型训练与推理对存储性能、容量、架构的需求持续攀升,存储正从被动的数据容器,升级为驱动AI产业发展的核心底座。
在此背景下,以“存力跃迁,AI破局”为核心主题的2026全球闪存峰会(Flash Memory World 2026),将于2026年8月26日在中国武汉正式举办。本届峰会由 DOIT 传媒、华中科技大学计算机科学与技术学院、华中科技大学集成电路学院联合主办,汇聚全球存储产业链力量,全面呈现闪存技术前沿突破与 AI 时代的产业新图景。
报名通道:https://app.ehub.net/register/nga5ph
扫描下方二维码 关注我们
本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

评论列表