V4
7月14日,彭博亿万富豪指数更新梁文锋以360亿美元身家登顶全球AI首富。
几天后,IPO筹备消息被媒体曝光,计划最快年底递交上市申请。
然而就在同一周,DeepSeek V4正式版已悄然进入灰度测试,有开发者花9毛钱就让它生成了一款可运行的CSGO游戏。
不到七天,DeepSeek同时搅动了富豪榜、资本市场和科技圈。
但比起首富头衔和IPO传闻,真正值得关注的是灰度测试中泄露的那些官方从未公开的能力跃迁。

思维链换了打法,知识截止日期在不同用户之间剧烈波动,代码生成能力从能用直接跃升到好用。
DeepSeek V4正式版不是一次常规迭代,而是一次从通用大模型向AI编程基础设施的战略转身。
4月24日发布的V4预览版,核心卖点是1M上下文窗口和极致性价比。
缓存命中输入价格低至0.025元每百万Tokens,比GPT-5.5和Claude Opus 4.7低了约138倍。

但社区反馈很快暴露了一个尴尬的事实:V4预览版在代码生成和编程任务上,与业界顶尖水平仍有明显差距。
金门大桥three.js场景测试、鸬鹚SVG渲染等经典用例,V4的表现只能算能用,远谈不上惊艳。
B站用户“冬眠の松鼠_”实测显示,V4正式版已能一次性生成可运行的CSGO类游戏,完成度很高,单次成本仅0.9元。

对比V4预览版完全不具备一次性生成游戏的能力,这次跃升堪称质变。
Linux.do社区用户风云雨在6月中旬就率先发现了V4.1 Flash模型的灰度迹象,他用金门大桥three.js场景测试后给出的评价是天差地别,代码结构更清晰,资源占用率降低约30%。
更隐蔽的变化发生在思维链层面。
7月18日,有用户在开启快速加深度思考模式并关闭联网功能后,对比5月份与7月18日生成的思维链,发现新版本的推理逻辑、结构化输出、思考路径展现出显著差异。
这不是简单的参数调优,而是推理范式的切换。
V4预览版的思维链更像传统推理模型的逐步拆解,而正式版的思维链呈现出更强的自我反思、多步规划和工具调用决策特征。
这种变化与DeepSeek 5月发布的Agent Harness研发工程师招聘启事形成呼应,那则启事里写了一行公式,Model加Harness等于Agent,目标是把前沿模型能力转化为领先的Agent产品。
三条能力跃迁线由此清晰浮现。
代码生成从能用走向好用,思维链从逐步推理走向Agent规划,知识时效从滞后半年走向接近实时。
这三条线交汇在一起,勾勒出的不是一次模型升级,而是DeepSeek从通用大模型向AI编程基础设施的战略转身。
灰度测试中最令人困惑的现象是知识截止日期的剧烈波动。
有人测出2026年1月,有人测出2026年5月,还有人停留在2024年,甚至同一个用户隔一会儿再问,答案都不一样。
开发者推测这可能与大模型训练中的数据对齐问题有关,也有人认为是大模型幻觉的表现。
但换个角度看这种不稳定性恰恰暴露了灰度测试的真实目的。
DeepSeek不是在测试一个固定版本的模型,而是在测试多个数据切片、多个训练checkpoints的混合部署。
不同用户被分配到不同数据版本的模型,这种A/B测试的粒度之细,在国产大模型发布史上极为罕见。
它意味着DeepSeek正在用真实用户流量做最后一轮大规模数据筛选,试图在知识时效性、幻觉控制、推理稳定性之间找到最优平衡点。
有用户观测到,代码测试场景下的部分灰度版本知识时效性更高。
这暗示DeepSeek可能正在为编程场景单独训练一个高时效性的数据分支,覆盖2025年下半年至2026年初的技术文档、API变更、开源项目更新。

对于开发者来说,一个知道2026年5月最新React版本特性的模型,与只知道2025年5月版本的模型,在实际编码辅助中的差距是致命的。
DeepSeek显然意识到了这一点,正在用灰度测试验证这个高时效分支的稳定性。
这种精细化运营的背后,是500亿融资带来的资源底气。
6月16日完成的这笔中国AI行业迄今规模最大的单轮融资,让DeepSeek有能力同时跑多个训练实验、多个数据版本、多个部署策略。
灰度测试的不稳定性,本质上是一场资源充裕者的奢侈实验。
V4正式版生成CSGO游戏仅花费0.9元,这个数字在AI编程圈引发了连锁反应。
要知道,一句话生成游戏是当前检验大模型综合能力的最高难度测试之一,此前Fable 5在这项测试中的表现曾震撼业界。
DeepSeek V4正式版虽然尚无法断言已全面达到Fable 5同级水平,但对比自身预览版的质变,加上0.9元的成本,已经足以动摇行业的定价心理。
这个成本锚点的意义远超数字本身。
它意味着AI编程正在从高端服务走向普惠基础设施。
一个独立开发者用不到1块钱就能让模型生成一个可运行的游戏原型,这种成本结构将彻底改变游戏开发、应用原型、自动化脚本等领域的创作门槛。
更重要的是DeepSeek同步宣布了峰谷定价机制,高峰时段API价格翻倍,非高峰时段维持基准定价不变。

这种时空套利的设计,实际上是在用价格信号引导开发者将非紧急的批量任务推向夜间,从而提升整体资源周转效率。
对于具备全球化部署能力的团队来说,他们可以通过多区域调度、任务编排和缓存策略,将核心推理负载转移到非高峰时段,甚至利用时区差异实现24小时不间断低价调用。
这倒逼出一个新的竞争力维度,任务编排能力。
未来,能够智能调度AI工作负载的开发者,将在成本控制上获得显著优势。
DeepSeek不是在卖模型,而是在卖算力期货,把AI推理从一口价的商品变成了需要策略性交易的风险资产。
7月14日,彭博亿万富豪指数更新,梁文锋以360亿美元身家登顶全球AI首富。
三天后,IPO筹备消息曝光,计划最快年底递交上市申请。
而就在同一周,V4正式版进入灰度测试。不到七天,DeepSeek同时搅动了富豪榜、资本市场和科技圈。
这不是巧合,而是一场精心编排的成长三重奏。
首富身份为IPO铺路,IPO叙事为V4正式版定调,而V4正式版的性能跃升,又反过来为前两者提供价值支撑。
三者互为背书,缺一不可。
对冲股权集中度风险的方式,就是V4正式版的产品力。
梁文锋78%的持股比例在IPO语境下是一把双刃剑,但V4正式版如果能在代码生成、Agent能力、多模态理解上实现全面突破,就能用技术实力对冲治理结构的担忧。
6月30日工商变更中新增的国家人工智能产业投资基金作为战略股东入股,持股比例未完全公开,这带来了政策层面的信用背书,既满足了上市前股权多元化的监管要求,又没有动摇创始人的控制权底线。
DeepSeek的融资节奏与模型发布节奏形成了精妙的资本技术飞轮。
4月V4预览版发布验证技术路线,5月启动融资用预览版的市场反响作为估值锚点,6月完成融资并变更工商为IPO铺路,7月V4正式版上线为融资后的商业化叙事提供产品支撑。
这种发布、融资、迭代的闭环,与OpenAI的路径如出一辙,但DeepSeek的差异化在于始终保持着开源权重和开放API的双重开放性。
DeepSeek V4正式版的灰度测试,表面看是一次产品迭代前的常规验证,实则是一场多维度的行业压力测试。它测试的是代码生成能力能否从短板变成长板,测试的是思维链质量能否支撑Agent级别的复杂任务,测试的是知识时效性能否追上快速演进的技术世界,测试的是9毛钱的成本锚点能否被开发者接受,测试的是峰谷定价机制能否有效调度算力资源。
对于开发者来说,7月中旬的正式版上线意味着新的游戏规则。白天写代码晚上调API或许真的会成为新常态,但更深层的启示在于,AI行业的竞争正在从模型能力的单维度比拼,转向成本效率、生态开放度、商业可持续性的多维度博弈。
从首富到IPO到V4正式版,DeepSeek用一周时间完成了一场教科书级别的叙事工程。但叙事终究需要产品来兑现。当价格屠夫开始收过路费,当开源先锋开始筹备上市,当算法降本者开始自研芯片,DeepSeek正在经历的,是中国AI从颠覆者到规则制定者的身份转换。这场转换能否成功,V4正式版的表现将是第一个关键判据。而灰度测试中泄露的每一个碎片,都是这场转换的提前剧透。
·END·
扫描下方二维码 关注我们

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。
评论列表