Claude Haiku 5.5 上线算力控制与分段计费,面向大规模子智能体场景

Anthropic 的 Claude Haiku 5.5 是首款支持算力控制(effort controls)的 Haiku 模型,100K tokens 以内请求的输入价格为每百万 token 0.10 美元,专为大规模分类、子智能体调度和实时工作负载而设计。

发布于 来源 Anthropic

由 AI 根据所引信源辅助生成,经自动化编辑检查后发布,未经编辑逐篇审阅。责任编辑:Joe Werner。

抽象可视化:一个小型高速模型节点并行处理多条任务流,深色背景上的简洁几何线条
由英文原文经 AI 翻译,未经人工编辑审阅 — 阅读原文

Claude Haiku 5.5 由 Anthropic 于 2026 年 10 月 7 日发布,是当前 Claude 世代中速度最快、效率最高的小型模型,也是首款支持算力控制的 Haiku 版本——该功能允许运营商在每次请求中独立权衡推理深度与推理成本。

相较 Haiku 4.5 的变化

根据 Anthropic 的发布说明,Haiku 5.5 在知识工作、计算机使用、多学科推理、智能体编码和视觉推理方面较 Haiku 4.5 有显著提升。一位每周在生产环境中处理 800 万次文档问答请求的客户报告,其评测集得分从 Haiku 4.5 的 0.76 提升至 0.84。另一位客户报告任务完成延迟降低超过 30%,每个智能体轮次的推理速度提升最高达 2.5 倍。

模型支持 100 万 token 上下文窗口,输出上限为 128K token。提示词不超过 100K token 时,输入价格为每百万 token 0.10 美元,输出价格为每百万 token 0.50 美元;提示词超过 100K token(包含缓存读写量)时,按长上下文计费档位收费。

算力控制与子智能体模式

算力控制是此次 API 层面最值得关注的新增能力。团队现在可以按请求单独设置推理强度,无需为此切换模型,这让 Haiku 5.5 在更大规模的流水线中更适合充当子智能体角色。Anthropic 在发布说明中指出,Haiku 5.5 可与更大的 Claude 模型配合使用,使在复杂产品和智能体系统中添加摘要、分类和压缩等功能变得更加实用。

对于通过 TheRouter 运行多模型流水线的运营商,claude-haiku-5-5 可通过 API 接入,并可与 claude-sonnet-5-5 或 claude-opus-5-5 组合在同一请求流中使用。模型支持文本和图像输入,输出为文本,支持 tools、tool_choice、response_format 和 reasoning 参数。

计费分层与上下文窗口行为

在规划流水线规模时,分层计费结构值得重点关注。一次超过 100K token 的长文档请求——含提示词、缓存内容和工具返回结果——整个请求都将按长上下文费率计费。分类、意图识别和单轮数据抽取等短上下文工作负载仍保持在较低的标准档位。

路由运营商可通过 TheRouter 的定价参考文档在正式接入工作负载前对比各模型的 token 成本。Anthropic 提供商页面列出了可通过网关访问的全部模型。

可用性

Haiku 5.5 现已通过 Claude 平台 API 正式上线,模型 ID 为 claude-haiku-5-5,同时也可通过 Amazon Web Services、Google Cloud 和 Microsoft Azure 访问。算力控制可按请求单独配置。

TheRouter 对 anthropic/claude-haiku-5-5 路由的可用性已于 2026-10-11 确认,测试请求在 3210 ms 内返回响应,共消耗 91 个 token。

本文涉及的模型

帮助与联系