Claude新Haiku登场,五档可调还便宜75%!同价压制GPT-6 Luna,AI执行层就此可调

Haiku 5.5已上线,首次开放五档推理强度,短请求降价约90%。它定位在执行层而非决策层,配合缓存与批处理计价,AI竞争转向智能体全链路总成本。

Introducing Claude Haiku 5.5 \ Anthropic

Anthropic于当地时间10月7日正式上线Claude Haiku 5.5,模型ID为claude-haiku-5-5,已在Claude Platform及AWS、Google Cloud、Microsoft Azure三大云平台开放使用。

作为Haiku系列的最新一代,这次迭代表面看是常规版本更新,实际触动的是AI产业的调用逻辑与成本结构。

它不再把轻量模型当成一个能力固定、定价固定的黑箱,而是通过可调推理强度、分层计价、清晰的工作流分工,把智能体时代最底层的执行能力变成了可以精细调控的参数。


发布事实与定价核验

所有价格与速度口径均以官方文档及脚注为准。

01

成本层面

Haiku 5.5平均运行成本比Haiku 4.5低约75%,并呈现长短请求分化,10万token以内短请求降幅约90%,10万token以上长请求降幅约50%。

02

速度层面

官方界定清楚,Haiku 5.5是Claude全系标准速度最快的模型,响应速度仍低于Opus 5.5的Fast Mode档位,定位没有越界,不存在以小替大的产品设计。

落地案例印证了这一定位。

金融领域的Rogo系统由高阶模型搭建整体框架并做决策规划,高频标准化的取数与整理交给Haiku 5.5,理由是准确率足以信任,速度和成本足以支撑反复调用。

Cognition发布的Devin Fusion组合同样采用分层结构,Opus 5.5负责顶层复杂规划,Haiku 5.5作为协同侧引擎承接拆解后的编码、执行、校验子任务。

两个头部案例指向同一事实,Haiku 5.5的位置在执行层,不在决策层。

定位没有越界,不存在以小替大的产品设计。


推理强度可调,调用范式移位

本次迭代最有产业含义的升级不是性能读数抬升,也不是名义降价,而是Haiku系列首次开放五档推理强度,分别为low、medium、high、xhigh、max,API默认medium,xhigh与max档的思考机制固定开启,不可手动关闭。

官方按请求设置强度有文档支撑,每个请求可单独指定档位,同一套权重因此可以服务不同复杂度的任务。

官方披露的OSWorld 2.1离线子集72.4%,处于effort曲线的Max档位置,属于极限档位读数。多数线上业务流量运行在medium及以下档位,日常输出能力低于纸面峰值,两者不能混为一谈。

Claude on X: "Introducing Claude Haiku 5.5: the cheapest, fastest, and most  capable small model we've ever released. On average, it costs around 75%  less to run than Claude Haiku 4.5." / X

这一升级的本质是场景适配方式从跨模型挑选,转向同一模型内部调节。算力、速度、智能、成本四项权衡,开始以参数形式交给调用方控制。

从挑模型匹配场景,过渡到在同一权重内部调节算力与智能的配比。


多层计价,单一标价失效

真实成本由多重计量规则共同决定,至少五个变量进入账单。

01
分层缓存定价


10万token以内请求的缓存读取为0.01美元每百万token,长请求为0.05美元。智能体循环反复读取系统提示、工具定义与上下文状态,缓存项的优化在某些场景下比基础单价下调更贴身。

图片
02
请求阈值


10万token是刚性拐点,越线后输入输出单价同步抬升。业务请求长度的细微漂移会引起整体波动,迁移前应统计自身prompt分布,不能直接套用宣传降幅。

03
分词器的隐性影响


Haiku 5.5与Sonnet 5.5、Opus 5.5使用同一套tokenizer,同任务token消耗略有上浮。官方未公布具体幅度,任何精确百分比都缺乏信源,但该特性会小幅对冲显性降价,测算时不可忽略。

04
批处理叠加


Batch异步处理对合格token费用减半,离线摘要、批量分类、大规模数据清洗可在降价与缓存优惠之上再做一次核算。

05
订阅权益边界


Max、Max 20x、Team的月度API额度仅限API调用、Agent SDK与托管智能体服务,不含网页端对话,按月重置,不可结转。这条边界市场上误读较多,应写明。


产品矩阵与对位关系

Anthropic在短周期内完成Opus 5.5、Sonnet 5.5、Haiku 5.5三档迭代,叠加面向长周期复杂任务的Fable与仅向验证项目开放的Mythos,构成层级完整的全栈矩阵。

图片
图片

这不是单一模型的能力叙事,而是为智能体编排架构准备的分层算力体系。Opus 5.5承接高复杂度推理与攻坚,Sonnet 5.5是均衡主力,Haiku 5.5固定在高频、标准化、可预期的执行段。

Haiku 5.5短请求价格与OpenAI的GPT-6 Luna持平,低价小模型赛道出现同价不同机制的格局。

公开信息未显示Luna提供同类强度档位,双方测评档位也不统一,缺乏对等基准,不宜直接判定优劣,差距有待第三方标准化复现。


安全边界的精细化

安全解读全部依据官方公示,相较Haiku 4.5,对齐评估改善明显,误配行为减少,配合滥用的意愿更低。网络防护严于前代,又比Sonnet 5.5适度放宽,合规防御研究可放行,攻击性渗透测试与漏洞利用仍被拦截。生物防护基线与Sonnet 5、Sonnet 5.5、Opus 5保持一致。

生命科学验证项目与网络安全验证项目不是开箱即放,而是企业经官方审核后解锁高阶科研能力的合规通道。

能力开放与风险控制被放进同一个制度框架,这比一句安全承诺更有约束力。

能力开放与风险控制被放进同一个制度框架。


Haiku 5.5的能力增量集中在Haiku 4.5原本薄弱的计算机操作与智能体编码区间,纸面高读数属于Max档,常规档位综合能力与Sonnet 5.5仍有明确距离,没有实现中高端赶超。

五档强度的开放是本次迭代的核心变量。行业正在从挑模型匹配场景,过渡到在同一权重内部调节算力与智能的配比,场景适配的主动权交到开发者和业务系统手里。

缓存调价、批处理折扣、订阅额度与分层计价的组合,说明竞争重心从单次token标价转向智能体全链路总成本。真实成本由请求长度分布、分词计量、强度档位、缓存命中率共同决定,价目表只是输入项。

- END -


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信