Anthropic 发布 Claude Haiku 5.5 并大幅降价
Claude Haiku 5.5 arrives with massive price cuts proving the AI pricing arms race is far from over
Anthropic 发布 Claude Haiku 5.5,称其为迄今最快、最实惠的小模型,平均价格比 Haiku 4.5 低约 75%。
对照短提示词最高约九成的降价、分词器增耗和相对 Sonnet 5.5 的基准差距,可以估计高并发任务改用 Haiku 5.5 的成本与能力取舍。
Anthropic 已发布 Claude Haiku 5.5,这是该公司迄今最快、最实惠的小型模型。基准测试结果显示,其性能较前代有大幅跃升,Anthropic 同时也在下调 Sonnet 5.5 的价格。
据 Anthropic 称,Haiku 5.5 专为摘要、数据库查询、分类和实时客户支持等大批量、成本敏感型任务而设计。平均而言,该模型的成本比 Haiku 4.5 低约 75%。对于提示词不超过 100,000 tokens 的请求(Anthropic 表示这类请求约占此前所有 Haiku 请求的 90%),价格最多可下降 90%。超过 100,000 tokens 的提示词价格则为五倍。
| 每 100 万 tokens 的价格 | Haiku 5.5(提示词不超过 / 超过 100k) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| 缓存读取 | $0.01 / $0.05 | $0.10 | $0.10 |
| 缓存写入 | $0.125 / $0.625 | $1.25 | $2.50 |
| 输入 tokens | $0.10 / $0.50 | $1.00 | $2.00 |
| 输出 tokens | $0.50 / $2.50 | $5.00 | $10.00 |
Anthropic 指出,Haiku 5.5 使用了更新后的分词器,每项任务消耗的 tokens 略多于前代。同样的情况也曾出现在 Opus 4.x 模型上,仅因分词器变更,token 用量就增加了约 30%。实际节省幅度可能小于按 token 单价所显示的水平。
基准测试显示相较 Haiku 4.5 有大幅跃升
Haiku 5.5 在知识基准测试 GDPval-AA v2.1 上得分为 1,620,是前代 735 分的两倍多。在 Humanity's Last Exam 上,它在不使用工具时达到 45.9%,使用工具时达到 57.4%,而前代分别为 10.2% 和 18.7%。
最大的跃升出现在计算机使用方面,即模型可自主操作计算机。由于计算机使用会消耗大量 tokens,像 Haiku 5.5 这样便宜、快速的模型非常适合。它在 OSWorld-2.1 上得分为 72.4%,前代为 15.7%。在智能体编程基准测试 Terminal-Bench 4.0 上,它达到 39.2%,而 Haiku 4.5 得分为零。
Anthropic 还将 OpenAI 的经济型模型GPT-6 Luna列为对比对象,Haiku 5.5 在所有测试类别中均领先。不过,Sonnet 5.5 的参考分数显示,Haiku 5.5 仍明显落后于 Anthropic 的更大模型。
| Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 | |
|---|---|---|---|---|
| 知识工作 / GDPval-AA v2.1 | 1,620 | 735 | 1,437 | 1,840 |
| 知识工作 / AA-Briefcase v1.1 | 1,578 | 614 | 1,336 | 1824 |
| 计算机使用 / OSWorld 2.1 | 72.4%(离线子集) | 15.7%(离线子集) | 48.9%(离线子集) | 83.9%(离线子集) |
| 多学科推理 / Humanity's Last Exam | 45.9%(无工具) | 10.2%(无工具) | — | 56.9%(无工具) |
| 57.4%(使用工具) | 18.7%(使用工具) | — | 64.5%(使用工具) | |
| 智能体编程 / Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| 智能体编程 / FrontierCode 1.1(Main) | 46.4% | — | 42.4% | 52.1%(Xhigh) |
| 视觉推理 / Chartography | 46.4%(无工具) | 6.4%(无工具) | 29.1%(无工具) | 61.6%(无工具) |
首款 Haiku 模型让用户在成本与性能之间权衡
Haiku 5.5 是首个具备可调推理级别的 Haiku 级模型,让用户在成本与质量之间取得平衡。Anthropic 表示,该模型最适合范围较窄的任务,如压缩、摘要或子智能体工作。对于复杂的智能体编程,Sonnet 5.5 和 Opus 5.5 仍是更好的选择。
网络安全防护比前代更严格,但允许的防御性任务范围比 Sonnet 5.5 更广,部分原因是该模型整体能力较弱。渗透测试仍然被禁止。有更广泛需求的组织可以申请Anthropic 面向生命科学与网络安全的验证计划。
Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。
Sonnet 5.5 也更便宜了,Anthropic 还发放 API 额度
在 Haiku 发布的同时,Anthropic 将 Sonnet 5.5 的缓存读取成本削减 50%,从每百万 token $0.20 降至 $0.10。该公司表示,这应能使大多数智能体任务的成本降低约 20%。此举几乎可以肯定是对 OpenAI 新推出的 GPT-6.1 系列 的回应,表明 AI 价格战正打得比以往更加激烈。
Anthropic 还在推出按月发放的 API 额度。Max-5x 订阅用户可获得 $100,Max-20x 订阅用户可获得 $200,Team 订阅用户每月最多可获得 $500。用户可通过 API 使用这些额度来试用工具、应用和智能体。
该公司也在更新其 Python 和 TypeScript SDK,为 computer use 和 browser use 新增 beta 支持。
无炒作的 AI 新闻 – 由人工精选
订阅 THE DECODER,即可享受无广告阅读、每周 AI 通讯、每年六期独家 "AI Radar" 前沿报告、完整存档访问权限,以及评论区访问权限。
来源:The Decoder · the-decoder.com