跳到正文
原文
The Decoder· Maximilian Schreiner·· 3 小时前精选AI 评分76

OpenAI 的 GPT-6.1 Sol 以约五分之一价格接近 Astra

GPT-6.1 Sol comes close to Astra at a fifth of the price

AI 导读

OpenAI 正在发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公工作上接近旗舰 GPT-6.1 Astra,成本约为五分之一。API 每百万输入 token 为 $2、输出为 $10,与 GPT-6 Sol 和 Claude Sonnet 5.5 相同,缓存输入为 $0.10。

推荐理由

GPT-6.1 Sol 以 0.10 美元缓存输入降低反复复用上下文的智能体成本,OpenAI 仍建议用 Astra 做最难研究。

正文 · AI 翻译

OpenAI 的新模型 GPT-6.1 Sol 据称能以极低的成本接近 GPT-6 Astra。原计划的旗舰模型 Astra 因安全问题仍未公开。

OpenAI 押注成本效率而非峰值性能。尽管其旗舰GPT-6.1 Astra 因安全顾虑无法按计划发布,该公司正在推出便宜得多的替代品 GPT-6.1 Sol。据 OpenAI 称,该模型在智能体编程、计算机使用和办公工作方面接近 Astra,成本仅为五分之一。

API 定价为每百万输入 token $2、输出 $10。这使 Sol 与 GPT-6 Sol 以及 Anthropic 的 Claude Sonnet 5.5 价格相同。缓存输入费用为 $0.10,比未缓存输入低 95%,而 Sonnet 5.5 收取 $0.20。这主要惠及在多次请求中复用上下文的智能体。

每百万 token 价格 Claude Opus 5.5 GPT-6 Sol GPT-6.1 Sol Claude Sonnet 5.5
输入 token 4 $ 2 $ 2 $ 2 $
输出 token $20 $10 $10 $10
缓存读取操作 $0.20 $0.20 $0.10 $0.20
缓存写入访问 $5 $2.50 — $2.50

Plus、Pro、Business、Enterprise 和 Edu 用户即日起可在 ChatGPT Work 和 Codex 中使用 Sol,但它尚未在普通聊天中提供。开发者可在 API 中以 gpt-6.1-sol 访问它。一个在 Codex 中生成 token 速度最高快达八倍的 Ultrafast 版本将于未来几天推出。

OpenAI 自己的数据显示 Sol 仅略落后于 Astra

所有基准测试均来自 OpenAI,该公司称其为初步结果。包括与 Sonnet 5.5 的公平比较,要到发布之后才可能进行。

在 DeepSWE v1.1 编程基准测试中,OpenAI 称 Sol 以大约五分之一的成本与 Astra 持平,且得分比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。在测试计算机使用的 OSWorld 2.0 上,它比前代高出 7 分,并以大约七分之一的成本落后 Astra 2.1 分。

在 GDP.pdf 文档基准测试中,OpenAI 称 Sol 以不到每项任务一半的成本击败 Anthropic 的 Opus 5.5。在涵盖多步骤业务工作流的 AutomationBench 中,它在中等推理强度下以大约三分之一的成本领先 Opus 5.5 2.2 分。

据 OpenAI 称,在 Terminal-Bench Science 上,Sol 的得分是前代的两倍多。平均一项科学任务成本为 $5.47,而 Opus 5.5 为 $23.21,Astra 为 $23.80。Astra 仍以 68.1% 取得最高分,OpenAI 继续推荐将其用于最困难的研究工作。

OpenAI 还称 Sol 在事实方面更加可靠。在早期模型答错的刻意困难提示上,低推理强度下错误答案所占比例从 11.4% 降至 7.7%。OpenAI 承认这些提示并不能代表正常使用。

Sol 恰好在 Astra 失败的领域变得更安全

OpenAI 称,Sol 在安全测试上的表现也远好于前代,但仍落后于 Astra。它试图绕过诸如“access denied”消息等明确拦截的情况占 23.5%,而 GPT-6 Sol 为 64.4%。Astra 的比率为 17.4%。未经授权的交易等不良结果出现在 4.3% 的运行中,前代为 17.4%,Astra 为 2.9%。

当搜索工具出现故障时,Sol 有 2.8% 的情况会隐瞒问题而不是上报。GPT-6 Sol 在 4.9% 的案例中这样做,Astra 则为 1.5%。与 Astra 及其前代一样,Sol 从未试图绕过自动安全检查器。OpenAI 指出,这些测试设计得很严格,并且是在未启用其产品所使用的全部防护措施的情况下运行的。

安全是这款计划中的旗舰模型的短板。据《华尔街日报》报道,OpenAI 不会按计划在 10 月于 ChatGPT 和 Codex 中发布 GPT-6.1 Astra,因为研究人员在内部测试期间提出了安全方面的担忧。安全负责人 Saachi Jain 表示,该模型更频繁地欺骗,并在未经许可的情况下继续运行,有时以有风险的方式使用外部工具,尽管它在完成任务方面表现更好。

OpenAI 并非完全放弃该模型。它计划将基础模型用于更多强化学习运行,并可能用于未来的 GPT-6 系列。Jain 表示,公司必须在让模型保持在其任务范围内与防止它变懒之间找到恰当的界限。

没有炒作的 AI 新闻 – 由人工精选

订阅 THE DECODER,即可享受无广告阅读、每周 AI 通讯、每年六次的独家"AI Radar"前沿报告、完整存档访问权限,以及评论区访问权限。

来源:The Decoder · the-decoder.com