Claude Haiku 5.5 上线算力控制与分段计费,面向大规模子智能体场景
Anthropic 的 Claude Haiku 5.5 是首款支持算力控制(effort controls)的 Haiku 模型,100K tokens 以内请求的输入价格为每百万 token 0.10 美元,专为大规模分类、子智能体调度和实时工作负载而设计。
由 AI 根据所引信源辅助生成,经自动化编辑检查后发布,未经编辑逐篇审阅。责任编辑:Joe Werner。

Claude Haiku 5.5 由 Anthropic 于 2026 年 10 月 7 日发布,是当前 Claude 世代中速度最快、效率最高的小型模型,也是首款支持算力控制的 Haiku 版本——该功能允许运营商在每次请求中独立权衡推理深度与推理成本。
相较 Haiku 4.5 的变化
根据 Anthropic 的发布说明,Haiku 5.5 在知识工作、计算机使用、多学科推理、智能体编码和视觉推理方面较 Haiku 4.5 有显著提升。一位每周在生产环境中处理 800 万次文档问答请求的客户报告,其评测集得分从 Haiku 4.5 的 0.76 提升至 0.84。另一位客户报告任务完成延迟降低超过 30%,每个智能体轮次的推理速度提升最高达 2.5 倍。
模型支持 100 万 token 上下文窗口,输出上限为 128K token。提示词不超过 100K token 时,输入价格为每百万 token 0.10 美元,输出价格为每百万 token 0.50 美元;提示词超过 100K token(包含缓存读写量)时,按长上下文计费档位收费。
算力控制与子智能体模式
算力控制是此次 API 层面最值得关注的新增能力。团队现在可以按请求单独设置推理强度,无需为此切换模型,这让 Haiku 5.5 在更大规模的流水线中更适合充当子智能体角色。Anthropic 在发布说明中指出,Haiku 5.5 可与更大的 Claude 模型配合使用,使在复杂产品和智能体系统中添加摘要、分类和压缩等功能变得更加实用。
对于通过 TheRouter 运行多模型流水线的运营商,claude-haiku-5-5 可通过 API 接入,并可与 claude-sonnet-5-5 或 claude-opus-5-5 组合在同一请求流中使用。模型支持文本和图像输入,输出为文本,支持 tools、tool_choice、response_format 和 reasoning 参数。
计费分层与上下文窗口行为
在规划流水线规模时,分层计费结构值得重点关注。一次超过 100K token 的长文档请求——含提示词、缓存内容和工具返回结果——整个请求都将按长上下文费率计费。分类、意图识别和单轮数据抽取等短上下文工作负载仍保持在较低的标准档位。
路由运营商可通过 TheRouter 的定价参考文档在正式接入工作负载前对比各模型的 token 成本。Anthropic 提供商页面列出了可通过网关访问的全部模型。
可用性
Haiku 5.5 现已通过 Claude 平台 API 正式上线,模型 ID 为 claude-haiku-5-5,同时也可通过 Amazon Web Services、Google Cloud 和 Microsoft Azure 访问。算力控制可按请求单独配置。
TheRouter 对 anthropic/claude-haiku-5-5 路由的可用性已于 2026-10-11 确认,测试请求在 3210 ms 内返回响应,共消耗 91 个 token。
本文涉及的模型
相关阅读
AI 路由新闻与供应商动态 →
Claude Sonnet 5.5 为仍在使用 Sonnet 5 的运营商带来五项 API 破坏性变更
Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,带来 5 项破坏性变更:强制工具调用返回 400、`thinking: disabled` 被拒绝、思考块与模型绑定、Claude API 不再接受 `computer_20251124` 工具、顾问工具配对收窄至 5.x 世代模型。

Zhipu 一次模型级 429 让 GLM flash 系列断流。TheRouter 现在按模型冷却,并为它们加了第二条路由。
2026-10-02,Zhipu 的 API 对 glm-4.6v-flash 返回了只针对该模型的限流响应,TheRouter 却把整个账号停了下来。现在冷却按模型生效,六个 GLM flash 系列模型也通过 Zhipu 的国际服务获得了第二条路由。

Claude Code 2.1.281:Bedrock 上游获得跨账号 IAM 和 Guardrail 强制执行
2.1.281 新增三个字段,改变 Bedrock 上游的认证与策略执行。assume_role 通过 STS 将凭证转为按开发者隔离的会话令牌;guardrail 强制每个请求通过 Bedrock guardrail。两者均影响多账号 AWS 部署的信任边界。