跳到正文
原文
Latent Space·· 3 小时前精选AI 评分79

Claude Haiku 5.5 同价表现优于 GPT-6 Luna

[AINews] Claude Haiku 5.5 — better than GPT-6 Luna at the same pricing

AI 导读

Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna,最高努力档智能指数为 43,高于 Luna 的 38。官方称平均运行成本比 Haiku 4.5 低约 75%,100K token 以下输入/输出为每百万 $0.10/$0.50,以上为 $0.50/$2.50。

推荐理由

在与 GPT-6 Luna 同价的情况下,第三方评测给出的 Haiku 5.5 智能指数更高,但最高努力档输出 token 约达三倍,超过 100K token 的上下文还会按五倍计价。

正文 · AI 翻译

自 Anthropic 发布 Haiku 4.5 以来大约已有一年,随着 Sonnet、Opus 和 Fable 相继推出直至 5.5,它似乎有些被遗忘了,尤其是 OpenAI 在推出 Astra 和 Sol 6 的同时还推出了 Luna 6。

好了,它来了,这是一次受欢迎的更新。更多内容见下方摘要。

2026年10月6日至10月7日的 AI 新闻。我们查看了 12 个 subreddit、544 个 Twitter,没有更多 Discord。AINews 网站可让你搜索所有往期内容。提醒一下,AINews 现已成为 Latent Space 的一个栏目。你可以选择加入/退出邮件发送频率!


AI Twitter 回顾

头条:Anthropic 发布 Claude Haiku 5.5

发生了什么

Anthropic 发布了 Claude Haiku 5.5,这是约一年来 Haiku 层级的首次更新。其定价与 OpenAI 的 GPT-6 Luna 持平,Anthropic 还在同一天下调了 Sonnet 5.5 及其订阅方案的价格。

  • 发布前信号。 @scaling01 在公告前发帖称“happy Haiku 5.5 day”。@kimmonismus 表示该模型已出现在一次 Claude Code 更新中,并预测了“Luna-pricing”。随后他在官方帖文之前公布了定价(@kimmonismus),并在上线时予以确认(@kimmonismus)。

  • 正式发布。 @claudeai 和 @AnthropicAI 称其为“我们发布过的最便宜、最快、能力最强的小型模型”,平均运行成本比 Haiku 4.5 低约 75%。

  • 可用性与预期用途。 它已在 Claude Platform 和 Claude Code 中上线(@ClaudeDevs)。Anthropic 将其定位为与 Opus 5.5 或 Sonnet 5.5 搭配的子代理,用于摘要、压缩和数据库查询等高量、对成本敏感的工作。@mikeyk 将这种分工描述为“Opus 负责深度思考,Haiku 负责高量工作。”

  • 分级定价(@ClaudeDevs):

    提示长度每 100 万 token 的输入/输出每 100 万次缓存读取低于 10 万 token$0.10 / $0.50$0.01超过 10 万 token$0.50 / $2.50$0.05

  • Sonnet 5.5 降价。 缓存读取价格从每 100 万 token $0.20 减半至 $0.10。Anthropic 表示,这使 Sonnet 5.5 在大多数长时间运行或代理类工作上便宜约 20%(@claudeai)。

  • 订阅用户的 API 额度。 每月 Claude Platform API 额度现随 Max 5x($100)、Max 20x($200)和 Team(最高 $500,共享)提供。这些额度适用于任何模型,包括 Haiku 5.5,也可用于第三方 harness(@ClaudeDevs)。

  • 同日 SDK 更新。 Computer-use 和 browser-use 工具集现已内置到 Python 和 TypeScript 版 Claude SDK 中。SDK 会运行动作循环,并将点击和按键发送到来自 browser_use、Browserbase、E2B 或 Daytona 的驱动程序,因此开发者无需再自行编写该循环(@ClaudeDevs,快速入门)。

  • 首日合作伙伴推出:

    • Cursor:@cursor_ai 声称在较短请求上“比 Haiku 4.5 低 10 倍”,并发布了 CursorBench 对比(@cursor_ai)。

    • VS Code 中的 GitHub Copilot:@code 报告称,它“在许多编程任务上与 Claude Sonnet 5 相当,同时使用更少的 token 和步骤。”

    • Devin:@cognition 报告称,其在 FrontierCode 1.1 上达到 58.4%,领先于 Sonnet 5,且每项任务成本约为后者的八分之一,并建议在 Fusion 中将其作为由 Opus 5.5 主导的“副手”。

    • Arena:已加入 Agent Arena、Code Arena WebDev、Text、Document 和 Vision,分数待定(@arena)。

    • OpenDocRouter:于同日加入(详情见下文)。

独立评测:Artificial Analysis

@ArtificialAnlys 发布了最详细的第三方数据(各项评测明细、对比页面)。

  • Intelligence Index:43,max effort 下较上一代 Haiku 提升 26 分。

    • 略高于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)。

    • 与 Kimi K3(44)相当,后者是一个 2.8T 参数的开放权重模型。

    • 落后于 max effort 下的 Claude Sonnet 5.5(56)13 分。

  • 新的控制项。这是首个具备 Anthropic 的 effort 设置与自适应思考的 Haiku。

  • Token 用量是主要注意事项。

    • 在 max effort 下,每个 Index 任务约使用 162k 输出 token,约为 GPT-6 Luna 在 max 下(约 50k)的 3 倍。

    • 从 xhigh 提升到 max 可增加 2 分,token 用量约为 1.8 倍。

    • 在得分相同的情况下,它仍然更冗长:Haiku 5.5 在 high effort 下得 38 分,使用约 55k token,而 Luna 在 max 下得 38 分,使用约 50k。差距在更低的 effort 设置下会进一步扩大。

  • 成本数据为暂定。Artificial Analysis 尚未对超过 100K token 后的 5 倍价格阶梯进行建模。每任务成本数据将随后公布。

  • AA-Briefcase(私有智能体知识工作评测):1578 Elo。领先于 Kimi K3 和 GLM-5.3,与 max 下的 Muse Spark 1.3 相当。

  • Terminal-Bench 4.0:33%,较 Haiku 4.5 的 0% 有所提升。

    • 与 GLM-5.3 Flash 持平。

    • 领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。

  • 知识与幻觉对比(AA-Omniscience):

    模型准确率幻觉率Haiku 5.536%40%Gemini 3.8 Flash55%55%GPT-6 Luna44%77%

    Haiku 准确率较低的部分原因在于它更愿意表示自己不知道。

  • AutomationBench-AA:35%,而 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。发布前的一个安全漏洞导致该模型过度拒绝。Anthropic 正在修复,Artificial Analysis 将重新运行该评测,并预计分数会上升。

  • 规格:

    • 上下文为 1M token,高于 Haiku 4.5 的 200k。

    • 支持文本与图像输入,文本输出。

    • 5 分钟缓存写入费用为每 1M token $0.125(超过 100K 时为 $0.625)。

其他基准测试说法(多为厂商或二手信息)

  • @ShayneRedford 总结了 Anthropic 报告的提升幅度:

    • OSWorld(计算机使用):15% → 72%。

    • TerminalBench:0% → 39%。这与 Artificial Analysis 在 Terminal-Bench 4.0 上独立测得的 33% 不同。

    • 知识工作与推理方面提升 10–50%。

    • 在其中大多数项目上胜过 Luna。

    • 1M 上下文,最大输出 token 约 12k。

  • @alexalbert__(Anthropic)强调 Haiku 4.5 于 2025 年 10 月 15 日发布,因此对比时间跨度不到一年。

  • @TheRundownAI 报道称,它“在多项基准测试中”胜过 GPT-6 Luna。

  • 文档解析(独立评测,基于 ParseBench):

    • @LoganMarkewich:整体接近 Luna,表格略优,图表理解较差。

    • @jerryjliu0:约每 1,000 页 $1.2。就价格而言,表格和阅读顺序表现良好;在图表、语义格式和边界框方面较弱。

  • 轶事性反馈:

    • @simonw 写了定价笔记,并运行了他的 pelican-on-a-bicycle 测试。他说它比贵 10 倍的 Haiku 4.5“好太多了”(对比)。

    • @AI_Screening 称 Haiku 5.5 在 Three.js 斑马模拟中“碾压”了 Luna(单次提示,并非系统性测试)。

观点与反应

看多

  • @kimmonismus:“比 GPT-6-Luna 好得多,更接近 Sonnet 5.5……便宜又聪明。”

  • @theo 喜欢这种分级定价:在 100K token 以下只收取五分之一的价格,“让这个模型的用途变得非常清晰。”他还觉得看到 Anthropic 的模型“在成本/智能图表上如此靠左”很引人注目(@theo),并在直播中介绍了此次发布(@theo)。

  • @draecomino:“Haiku 在最高 effort 下表现得像前沿模型。”

  • @kipperrii 认为,既然小型廉价模型现在能做“大量有用的事”,它们就更加重要了。

  • @scaling01(“便宜得离谱”),后来(@scaling01):“5.5 系列模型看起来不错。”

  • @NotTomBrown(“小而强”)和 @edwinarbus 都来自 Anthropic 一方,发布了庆祝性的帖子。

竞争叙事

  • 此次发布被广泛解读为针对 OpenAI 的 GPT-6 Luna:“gpt 6 luna 完了”(@dejavucoder),“该碾压 Luna 了”(@scaling01)。

  • @kimmonismus 将 Sonnet 缓存读取降价解读为 Anthropic 在向 OpenAI 施压。关于 API 额度,他补充道:“OpenAI:轮到你了”(@kimmonismus)。

  • @teortaxesTex 称 Anthropic 如今拥有“所有实验室中最深的产品阵容”(Haiku/Sonnet/Opus/Fable 加上 Mythos),对比 OpenAI 的 Luna/Sol/Astra。他仍然认为 Anthropic“不太在意产品”,并将此解读为它贯穿 2026 年一直有多大余裕的迹象。

  • ThursdAI 的 @altryne 质疑中间档:“当初 Opus 很贵时,Sonnet 才说得通。”该节目计划报道 Haiku 5.5(@thursdai_pod)。

注意事项(主要来自数据,而非高声的批评者)

  • 标价可能夸大了实际节省。

    • 大量 token 消耗(在最高 effort 下约为 Luna 的 3 倍)抵消了部分按 token 计价的折扣。

    • 超过 100K token 的提示需支付 5 倍价格,这对长上下文智能体循环很重要。

    • 这两种效应很可能解释了为何 Cursor 所说的“短请求便宜 10 倍”与 Anthropic 所说的“平均便宜 75%”并不一致。

  • 事实回忆弱于 Gemini 3.8 Flash 和 Luna。

  • 过度拒绝的 bug目前压低了自动化得分。

  • 尚未完成基准测试:Arena 分数尚待公布,独立的单任务成本数据则有待分级定价支持。

背景

  • 自 2025 年 10 月以来,Haiku 4.5 一直是 Anthropic 的小型模型。此后,OpenAI 的 GPT-6 Luna、Gemini 3.8 Flash、GLM-5.3 Flash 和 DeepSeek V4.1 Flash 在低成本端展开竞争。

  • Haiku 5.5 的标价与 Luna 完全一致。它增加了 effort 控制以及 1M 上下文。

  • 它被明确定位为多模型智能体框架中的廉价执行者:Claude Code 子智能体、Devin Fusion、Copilot 子智能体,以及压缩或摘要步骤。

  • Anthropic 将其与 Sonnet 缓存读取降价以及订阅 API 额度搭配推出,这是对智能体经济的一次协同推进。这一推进正值围绕 token 账单的更广泛讨论之际(见下方 @theo)。

其他新闻

OpenAI 的 722 篇数学手稿:规模、效率与余波

阅读更多

来源:Latent Space · latent.space