阶跃星辰 | 计算效率成为新的Scaling维度:Step 5 Preview的方法论价值与待解变量

阶跃星辰发布Step 5 Preview,以稀疏MoE架构和Agent级Kernel调优实验,将大模型竞争从算力规模拉向算力转化效率,但成本优势与开源价值仍待10月15日权重释放后检验。

图片

阶跃星辰9月20日发布新一代旗舰基座模型Step 5 Preview。命名上跳过整个Step 4系列,直接将产品锚定全球第一梯队竞争区间,而非延续此前3.x系列的中端叙事。Preview标识这仍是一个API可用、权重待释放的预览基座,并非最终正式版。
值得行业关注的是模型背后方法论层面的转向。大模型竞争的衡量维度,正在从算力规模转向算力转化效率。

Kernel自优化实验,能力信号与其边界

官方披露的一项演示案例具有指标性意义。Step 5 Preview在单张NVIDIA H100上连续运行,自动优化MLA GPU Kernel,约22小时后性能达到508 TFLOPS

图片

需要厘清这项实验的性质。

这是模型作为智能体完成内核工程任务的Agent闭环演示,并非推理框架内置的自动优化模块。长达22小时的迭代周期无法直接用于线上实时推理。它证明的是大模型具备硬件底层工程调试能力,距离开箱即用的产品形态仍有距离。

图片

即便如此,其方向性信号依然清晰。

过去两年大模型Scaling的基本范式是消耗算力换取智能增长,模型是被算力喂养的对象。阶跃在发布文档中明确提出下一阶段Scaling的关键在于提升计算转化为智能的效率

当模型开始介入算力利用效率的优化,算法与硬件之间的边界便开始模糊,算力竞争的衡量标准也从卡数规模扩展到单位算力的智能产出。

架构经济学,稀疏激活的收益与代价

支撑效率叙事的是稀疏MoE架构。总参数量600B,单次推理仅激活27B参数,激活比例约为4.5%。

图片

这一设计将知识容量与计算开销解耦。

稠密模型中,能力提升伴随全量参数参与计算的成本同步上升,稀疏架构则让模型可以存储更多知识,同时为单次任务支付极低比例的计算成本。这是Step 5 Preview能够同时实现百万Token上下文与低推理成本的结构性原因。

同时也要看到稀疏MoE的现实约束

虽然单次推理仅激活27B参数,600B完整总参带来的存储与显存开销依然巨大。

云端API依靠集群调度可以掩盖这一问题,一旦走向企业私有化部署,完整权重加载与专家负载均衡都会成为实际挑战。

第三方评测对阶跃前代模型的观察同样指出自托管100B以上级别的MoE对基础设施要求很高。理论层面的低成本优势,在本地环境未必能够原样复现。

推理强度的谱系,一套机制的行业共识

强推理能力天然伴随更高的Token生成量。

AA实测中,完成一轮Intelligence Index评估,该模型共生成1.6亿输出Token,显著高于9000万的中位数水平。

需要修正一个容易误读的细节。

三档推理强度并非Step 5 Preview首创,该机制最早在Step 3.7 Flash落地,官方文档明确记载其支持low、medium、high三档配置,本次旗舰版本完整继承。

将推理深度从模型内部决策外化为API可配置参数,本质是把模型内部的权衡交给调用方。

这也不是阶跃一家的逻辑。

Anthropic自Opus 4.5引入effort参数,到Opus 4.8扩展为五档全开放,Opus 5延续这一机制。推理强度可调正在成为头部厂商共同的产品范式,其背后是对Agent长循环任务的共同判断,高推理档位换取更强的持续推演能力,代价是Token消耗量与延迟同步上升。

图片

图片

能力版图,长程Agent与专业场景的聚焦

Step 5 Preview原生支持图文输入,官方演示了一项硬件闭环任务,模型自主阅读ESP32开发文档,将一块ESP32-S3开发板改造为支持蓝牙按键与语音输入的键盘,过程中访问串口、获取截图、调用摄像头,并根据设备返回的真实状态持续修改和调试代码,连续执行超过3小时。

这一演示的意义在于模型与真实物理设备的交互闭环,而非单纯的代码生成。

评测数据也呈现出明确的领域集中。

在Agent能力测试ALE-CLI、金融投资研究评测FrontierFinance、跨领域深度研究评测DRACO上,该模型表现仅次于GPT-6 Astra或Claude Opus 5。

图片

图片

第三方实测在金融公司研究任务中同样观察到接近Claude Opus 5的表现。优势集中在软件工程、长程Agent与专业研究,这是它的主攻方向,而非全维度均衡。

在Artificial Analysis的Intelligence Index上,该模型取得44分,位列全球开源模型前三,单任务推理成本为Claude Opus 5的八分之一

官方定价为输入每百万Token 7元、输出20元,缓存命中输入降至0.35元。需要说明的是,八分之一成本是AA平台同一评测任务下的API对比结果,高度依赖平台侧的调度与缓存机制,私有化部署后该优势会明显削弱。

开源节奏与风险边界,错位期的三个变量

当前模型已通过API全量开放,权重计划于10月15日释放,许可证细节尚未公布。

由此形成约三周的错位期,目前所有跑分与成本数据均来自云端API版本,本地部署的吞吐、延迟与成本能否复现,需要权重释放后验证。

01
许可证

阶跃并未披露Step 5 Preview权重的开源协议,其前代Step 3.7 Flash已采用Apache 2.0协议,但旗舰版本的协议条款无法据此类推。不同协议将直接决定垂直行业厂商能否基于该基座二次微调与私有化分发。

02
MoE模型的微调特性

第三方微调可能破坏专家路由策略,进而损失原生的成本与能力平衡,API端的亮眼表现在权重放开后未必能够原样复制。

03
落地成本

编程Agent赛道已存在成熟的工具链与生态位,跑分不等于市场份额,开发者迁移需要重构整套工作流。从Step 3.5 Flash到Step 3.7 Flash再到Step 5 Preview,阶跃连续三代模型推动能力、成本与效率的帕累托前沿外移,但商业化验证仍需时间。

结语

Step 5 Preview的发布,其信号价值可能大于产品价值本身。它提示行业,当模型能够作为Agent参与Kernel调优实验、当稀疏架构把知识容量和单次计算开销解耦、当推理强度变成对外暴露的服务参数,大模型竞争的下半场正在从单纯比拼绝对能力,转向比拼智能获取成本与真实场景下的运行效率。

信号不等于落地结果。Kernel自主优化还停留在实验演示阶段,MoE架构的私有化显存门槛、权重许可证协议、本地部署后能否复现API端的成本优势,都是待解变量。10月15日权重释放,将是这套效率叙事的第一轮真正市场检验。

- END -


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信