
7月21日,Google正式将Gemini 3.6 Flash推入生产环境,同步亮相的还有3.5 Flash-Lite和面向网络安全的3.5 Flash Cyber。
官方口径很标准,输出Token比3.5 Flash减少17%,部分场景如DeepSWE的Token压缩率可达65%,API输出单价从每百万9美元降至7.5美元。
但市场反应却呈现一种微妙的割裂。
企业开发者确实在欢呼。
1M上下文窗口、64K最大输出、支持Computer Use预览,这些规格放在Agent工作流里意味着更少的重试和更低的账单。
第三方评测机构Artificial Analysis的反馈相当直白。
3.6 Flash的智能水平相比3.5 Flash基本持平,在综合评分上并未拉开与GPT-5.6 Luna、Claude Sonnet 5等对手的实质差距。
Pro 旗舰跳票背后的代码焦虑
这件事的严重性被大多数人低估了。在2026年的AI竞争格局里,代码生成早已不是“开发者工具”的附属功能,而是衡量模型Agent能力的硬通货。OpenAI的GPT-5.6 Sol在代码生成任务的Token效率上提升了54%,Meta 2026推出Muse Spark 1.1,Scale AI创始人Alexandr Wang在Meta出任超级智能实验室首席AI官,该模型被行业视作Meta代码与智能体赛道标杆产品。
当竞争对手在代码赛道上加速时,Google的旗舰模型却卡在内部基准线上,这直接暴露了一个深层问题。
Google庞大的产品矩阵——搜索、地图、YouTube、Android——在模型发布流程中既是护城河,也是拖油瓶。
10名现任和前员工向媒体透露,延期已在内部引发工程师、研究员和管理层的不满。
复杂的跨部门协调、多层级利益方对齐,加上AI工具接入庞大产品体系的工程负担,让Google的发布节奏明显慢于OpenAI和Anthropic。
更严峻的是人才流失。
SignalFire报告显示,DeepMind人才流向Anthropic与反向回流比例达10.8:1,Transformer论文作者Noam Shazeer在回归Google未满两年后再次离职前往OpenAI,AlphaFold核心贡献者John Jumper也在2026年6月离开Google。
Token效率背后的“成本避险”逻辑
根据官方数据,3.6 Flash在Artificial Analysis Index上平均减少17%的输出Token,API输出价格从9美元/百万降至7.5美元/百万。
这种Token减少并非简单压缩输出字数,而是通过推理路径优化实现的结构性提效。
强化指令遵循能力,减少Agent任务中无效的自我解释和重复推理步骤;
针对代码、数据分析等结构化场景做了专项优化,跳过冗余的中间验证环节,这也是DeepSWE代码场景能实现65%超高压缩率的核心原因。

配合3.5 Flash-Lite的极致定价——输入0.30美元/百万、输出2.50美元/百万,以及每秒350个输出Token的速度——Google实际上在构建一个分层覆盖的完整价格带矩阵。
Flash-Lite主打高并发批量推理和边缘端部署,未来将深度适配安卓系统端侧AI,承接亿级移动终端的轻量需求;
3.6 Flash作为主力生产模型,覆盖80%企业常规Agent工作流和办公编程场景,是谷歌云API营收的核心基本盘;
Flash Cyber则垂直切入政企安全场景,走定制化高客单价路线。

这种策略的聪明之处在于它把竞争维度从“谁更聪明”悄悄切换成了“谁更便宜”。
当Claude Opus 4.8以25美元/百万的输出定价占据代码能力高地,当GPT-5.6 Terra以15美元/百万的输出定价锁定中高端推理市场,Google选择用7.5美元/百万的Flash去承接那些对价格敏感、对极致智能要求不苛刻的企业客户。
但这套逻辑有一个隐含前提:企业客户愿意用“足够好”代替“最好”。在Agent工作流日益复杂的2026年,这个前提是否成立,其实要打一个问号。
Agent时代的“总拥有成本”战争
DeepSeek V4 Flash的输入价格已压至0.435美元/百万,输出0.87美元/百万;
MiniMax M3的输出定价为2.40美元/百万;
Qwen 3.7 Max的输出定价为7.50美元/百万,与3.6 Flash持平。
在这个价格带里,Google并不具备绝对优势,但它的差异化在于生态绑定。
Gemini 3.6 Flash已同步接入Google Antigravity 2.0、Gemini Enterprise Agent Platform以及Google Workspace全家桶。
这意味着什么?
意味着企业选择3.6 Flash的理由可能不是因为它比DeepSeek 强,而是因为它能无缝调用Google Search、Google Maps、Google Docs的grounding能力,能在Android Studio里一键集成,能在企业现有的Google Cloud架构里零摩擦部署。
这种生态税换集成便利的权衡,正是Google在模型能力不占优时,依然能守住企业市场的底牌。
从商业逻辑看,Google敢于把Flash模型价格打到极低,核心并非亏本抢客户,而是模型引流,云服务盈利的打法。
企业用Gemini API时,往往会同步使用谷歌云的向量数据库、云函数、数据仓库BigQuery等配套服务,模型本身的营收占比有限,云基础设施增值服务才是真正的利润来源。
这种打法和AWS用基础云服务带动上层SaaS盈利的逻辑一致,独立大模型厂商没有云底座,根本无法跟进这种级别的价格战。


被忽略的真相:模型迭代正在“通货膨胀”
大多数人没有注意到一个反常现象。
2026年的模型版本号正在以肉眼可见的速度膨胀,但实质性的能力跃迁却在收窄。

Gemini从3.1 Pro到3.5 Flash再到3.6 Flash,间隔不过数月;
GPT家族从5.4到5.5再到5.6,同样密集发布;
Claude的Opus、Sonnet、Fable、Mythos系列更是让人眼花缭乱。
版本号的快速迭代,反映的不只是营销焦虑,更是MoE架构带来的迭代范式变革。

过去稠密模型需要全量重训才能推出大版本,周期长达半年到一年;而MoE模型可以通过微调路由策略、蒸馏专家网络、优化激活策略实现小版本快速升级,不需要重新做完整预训练。
3.5到3.6的版本号升级,对应的就是路由优化、Token效率提升这类非全量预训练的迭代,这种“小步快跑”的模式会成为MoE时代的常态。
Google的“机海战术”在智能手机行业早已司空见惯,如今被搬到AI模型领域,说明大模型的产品化逻辑正在向消费电子靠拢。
用SKU数量覆盖价格带,用版本号频率维持热度,用生态绑定锁定用户。
但消费电子的教训是当用户发现每年的“新款”只是微调,换机周期就会拉长。AI模型的“换机周期”虽然由API调用决定,但企业客户的迁移成本一旦累积,忠诚度同样会衰减。
Agent时代的竞争,最终比的不是谁发的模型多,而是谁的旗舰能真正扛起复杂工作流。
3.6 Flash可以帮Google守住企业客户的API账单,但守不住开发者对最强模型的信仰。在Gemini 4真正到来之前,Google需要回答的问题不是“我们有多便宜”,而是“我们还能不能造出最好的模型”。
那个能写出最好代码的模型,才有资格制定新的计价规则。

·END·
2026全球闪存峰会
站在产业拐点回望,存算一体的商业化大幕才刚刚拉开,技术路线的选择、生态的构建、场景的落地,仍需要全产业链的协同探索。即将于8月26日在武汉光谷举办的2026全球闪存峰会(FMW 2026),便为这场探索提供了专业的交流阵地 —— 大会专门设置存算一体化技术与应用分论坛,聚焦存算一体的技术演进与产业落地,打造产学研深度对话的行业平台。
该论坛将汇聚高校科研学者、存算芯片企业、存储厂商、智算集群服务商与终端行业客户,议题覆盖近存计算规模化落地、存内计算技术迭代、ReRAM等新型介质产业化、系统级存算耦合架构、端侧到云端的场景商业化等核心方向,既呈现前沿学术成果,也拆解一线落地案例,全面呈现存算一体产业的真实进展与未来路径。
对于关注存算一体技术路线、寻找算力升级方案、探索产业合作机会的从业者而言,这场论坛将是获取前沿洞察、对接全产业链资源的重要窗口。目前峰会报名通道已正式开启,扫描海报二维码即可注册参会,与全产业链同仁齐聚武汉,共话存力跃迁时代的AI破局之道。
2026年8月26日,武汉,诚邀业界同仁共赴这场存储产业巅峰盛会!
报名通道:https://app.ehub.net/register/nga5ph


扫描下方二维码 关注我们

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。
评论列表