Anthropic 发布 Claude Opus 5.5,AINews 改用它为默认模型,OpenAI 推出更便宜的 GPT-6 Sol 与 Luna
[AINews] Claude Opus 5.5, the new default model for AINews — and everybody cuts prices 40-50%
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称其多数任务达到 Claude Fable 5.1 水平、运行成本比 Opus 5 低 40%,AINews 也立即改用它作为默认模型。
这篇把 Opus 5.5 与同日的 Sol、Luna 放在价格和基准上对照,并说明默认档降价会被更高 token 用量部分抵消。
OpenAI 做出了英勇的努力,GPT-6 Sol 和 Luna 的发布价格比 GPT-5.6 低 50%,但发布观看量已达 17M 次观看且仍在增加,今天注定属于 Claude Opus 5.5,“我们新 Claude 5.5 系列中的首个模型”,其表现如同“在大多数任务上的 Claude Fable 5.1,运行成本比 Opus 5 低 40%。”
Opus 5.5 击败 Fable 或挑战 Astra 于大多数基准测试,两家实验室都将 API 降价 归功于效率方面的工作,但从 prefill 到 decode 再到整体算力,各处都有巨大的两位数提升……
……并在某些前沿任务的 token 用量上存在抵消性的低效。
然而,Claude 此次发布中罕见强调的一点是 写作方面的改进:“它会把最重要的信息放在前面,并遵循你给出的写作规则,这让长会话更容易跟上。”
我们可以确认——以下是今天在 Opus 5.5 和 Sol 6 上运行的 AINews 栏目。差别可谓天壤之别——我们将立即把今后的 AINews 迁移到 Opus 5.5,直至迎来 AINews 的下一个模型/版本。
他们还发布了关于大规模多智能体集群(以及 效率)的初步工作:
9/21/2026-9/22/2026 的 AI News。我们查看了 12 个 subreddit、544 个 Twitter,且没有更多 Discord。AINews 的网站可让你搜索所有往期。提醒一下,AINews 现已成为 Latent Space 的一个栏目。你可以 选择加入/退出 邮件频率!
AI Twitter 回顾
头条:Claude Opus 5.5 发布、数据与反应
发生了什么
Anthropic 发布了 Claude Opus 5.5,即新 Claude 5.5 系列中的首个模型。其卖点是以 Opus 的定价提供 Fable 5.1‑级能力,同时速度更快、写作更好。大约一小时后,OpenAI 发布了 GPT‑6 Sol 和 Luna。
发布声明。 Opus 5.5 “在大多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%”(@claudeai;@AnthropicAI)。
领先之处。 Anthropic 表示,它在智能体编程、计算机使用和知识工作方面领先(@claudeai)。
速度与成本。 它比 Opus 5 大约快 30%,每项任务大约便宜 40%(@ClaudeDevs,@lydiahallie)。
沟通方面的改进。 该模型会把最重要的信息放在前面,并遵循用户的写作规则。这针对的是对 Opus 5 最常见的反馈(@claudeai)。
订阅变更:
5‑小时会话限额提高了 20%。
更低的价格意味着限额可多用 25%。
Pro、Max 和 Team 用户可获得一次可储存的速率限制重置,可随时选用(@claudeai,@ClaudeDevs,@trq212)。
新的默认设置。 Opus 5.5 现已成为 Claude Code 和 Claude 应用(包括 Cowork)中的默认模型。默认努力程度为 中等,被描述为“在智能上与 Fable 5.1 相当,但更快”(@_catwu)。
可用性。 它已在 Claude Code 和 Claude Platform API 中上线(@ClaudeDevs),并已在适用于 Slack 的 Claude Tag 中上线(@_catwu)。
路线图。 Sonnet 5.5 和 Haiku 5.5 将“在未来几周内”跟进(@mikeyk、@AiBattle_)。这与 Haiku 已停更的传闻相矛盾(@kimmonismus)。
安全防护。 Opus 5.5 是首个具备 Fable 5.1 级安全防护的 Opus,覆盖网络、生物以及前沿 LLM 开发。被标记的请求会回退到另一个模型,Anthropic 表示正在“努力减少错误标记”(@ClaudeDevs)。
发布前信号。 该模型在公告发布前不久已在 Claude Code 中被发现(@kimmonismus)。
系统卡。 它在发布时一并公布(@scaling01)。
定价与 token 经济(事实)
标价。 Token 定价下调 20%,从每 100 万输入/输出 token $5/$25 降至 $4/$20(@ValsAI)。
被更高的 token 用量抵消。 Vals 指出,Opus 5.5 往往使用更多 token,尤其是在编程任务上,而这正是它提升最大的领域。较低的标价在一定程度上被用量抵消。
Artificial Analysis 成本拆解。 在最高 effort 下,Opus 5.5 的成本为每项 Intelligence Index 任务 $5.98,而 Opus 5(最高)为 $5.86。其拆解(@ArtificialAnlys):
仅更高的 token 用量就会使每项任务成本上升约 80%,达到 $10.51。
20% 的基础价格下调将其降至 $8.41。
更便宜的缓存读取($0.20)将其降至 $5.98。
这意味着什么。 在最高 effort 下,相对 Opus 5 的每任务节省消失了。“便宜 40%”的说法适用于默认(medium)设置。
相对 Fable 5.1。 Cline 报告称,Opus 5.5 在 Artificial Analysis Intelligence Index 上胜过 Fable 5.1,成本约低 2.5 倍(@cline)。
提示缓存。 在会话中途切换 effort 不会破坏 Claude Code v2.1.280+ 上的提示缓存(@lydiahallie)。
模型规模(推测)。 @theo 声称 Opus 5.5 比 Opus 5 更小,并将其归功于后训练。官方帖文并未证实这一点。
基准测试与独立评测
Anthropic 自己的表格。 在 Anthropic 的头条对比中,Opus 5.5 每一行都胜过 Fable 5.1,并在大多数项目上胜过 GPT-6 Astra(@kimmonismus、@synthwavedd、@scaling01)。
@ShayneRedford(Anthropic)总结了所声称的提升:
在 CursorBench、KWBench 和 OSWorld 上强于 Astra。
风格与指令遵循明显更好。
科学与健康能力更强。
对网络与生物滥用更具稳健性。
第三方与合作伙伴评测:
EvalResultSourceVals 指数第1,较 Opus 5 上升 2 位 / 2 分;Anthropic 占据前三名(GPT‑6 Sol 待定)@ValsAIVals RSI 指数第1;首个在其协议下于 LM Training 上击败已公布参考成绩的模型;胜过 Fable 5.1@ValsAI, @ValsAIFrontierSWE (Proximal)62.3%,第2,落后于 GPT‑6 Astra(65.5%);领先 Fable 5.1(56.3%)和 Opus 5(52.0%)@ProximalHQFrontierCode 1.1 (Cognition)在 Extended 上为 65.3%;以“成本只是零头”从 Fable 5 手中夺得第1@cognitionCursorBench57.8%(Max),新的榜首模型;每项任务成本比 Opus 5 低 40%@cursor_aiPerplexity WANDR0.610,每任务 $4.13;略高于 Fable 5.1,成本低 67.6%@perplexity_aiParseBench(表格)93.9%,比 Opus 5 高 7 分;胜过 Fable、Gemini、Astra@jerryjliu0Roboflow 视觉/检测“绝对是 Anthropic 最好的视觉模型”;现已跻身 Playground 排行榜上领先于 Google 的模型之列@skalskip92, @skalskip92
评测细节与注意事项:
Vals 运行设置。 RSI 在原生 Claude Code 中以最高力度运行,上下文 1M,最大输出 token 128K,温度 1(@ValsAI)。
ParseBench 注意事项。 该模型在图表、格式和版式上仍有困难。按 5.8¢/页计算,LlamaIndex 认为它用于生产级 OCR 过于昂贵。这一判断来自一家拥有竞品的厂商。
AI 研发与编程对比。 @eliebakouch 将系统卡解读为“在 AI 研发上大致相当,但在智能体编程上是一头猛兽。”
饱和。 @scaling01 问 CoBench 是不是已经“完了”。@synthwavedd 开玩笑说有个新基准一发布就已经饱和。
Arena。 Opus 5.5 已进入 Agent Arena,并进入 WebDev、Text、Vision 和 Document 的 Battle Mode。尚无分数(@arena)。
力度缩放异常。 在一张智能体编程图表上,xhigh 力度的成本约为 medium 的 2.8 倍,得分却低 3.2 分(@LearnOpenCV)。@Yuchenj_UW 称之为“最离奇的基准结果”,并建议坚持使用 medium。
@nrehiew_ 给出了一种解释:
Opus 5 在 FrontierCode 上呈现出同样的模式。
FrontierCode 会惩罚不必要的改动,而更高的力度会导致范围蔓延。
因此,模型“在更高的推理力度下表现持续更差。”
系统卡细节
多智能体缩放。 系统卡在第 8.12 节报告了扩展至100 个并行智能体。@scaling01 称这是同类中的首份实验室报告。@maksym_andr 将其视为多智能体缩放定律的证据。
ProgramBench 注意事项。 ProgramBench 作者 @OfirPress 指出,Anthropic 接近 100% 的求解率来自 166/200 的子集。该子集很可能排除了最难的程序,例如 FFmpeg 和 PHP 编译器。他还指出了指标不匹配(@OfirPress, @OfirPress):
Anthropic 报告的是平均测试通过率。
ProgramBench 报告的是完整任务完成情况。
部分求解常常能通过 60–70% 的测试,从而抬高通过率指标。
与 Mythos 5.1 的对比。 Opus 5.5 在 Anthropic 的 ECI 上得分高于 Mythos 5.1,并在每一项受测的网络安全评测中胜过它(@scaling01, @scaling01)。
奇怪的未对齐发现。 @teortaxesTex 引用了一段话:恶意输出“几乎只出现在如下情形中:在恶意输出之前,Claude 犯了一个概率极低、无伤大雅的错误。”他问 Anthropic 是否“给自己植入了 sleeper-agent”。
“由 RSI 训练而来。” 他另行引用了一句关于“首个由 RSI 训练出的模型”的话,并称其令人担忧(@teortaxesTex)。
生物医学成像。 @iScienceLuvr 对所报告的生物医学图像分析能力表示欢迎。
要求提供更多。 @scaling01 要求提供不使用思维链的时间跨度。
安全立场与防护争议
官方立场:
Sam Bowman:Opus 5.5“比其前代足够更安全,以至于发布它更有可能降低与未对齐相关的风险”,对最极端的对齐风险尤其如此(@sleepinyourhat, @sleepinyourhat)。
他还承认担心难以跟上不断升级的风险,同时表示在这一能力水平上,现有工具仍然值得信赖(@sleepinyourhat)。
Mike Krieger 援引了广泛的对齐测试和外部评估,其中包括 METR 的评估(@mikeyk)。
摩擦:
过度触发回退。 @iScienceLuvr 在要求 Opus 5.5 治愈癌症后,被降级到了回退模型。
针对中国(单次测试)。 @xlr8harder 表示,一次快速测试表明,前沿 LLM 开发分类器针对的是中国硬件。他呼吁进行更多探查。
对中国这一角度的反应。 @teortaxesTex 将此解读为 Anthropic 在削弱中国 AI。@jakehalloran1 则将其理解为在保护 Trainium 的技术诀窍。
“把控前沿节奏”的表述:
@theo 认为,今天的发布都不属于 Astra 或 Fable 级别,而这是有意控制节奏。
@goodside 表示,实验室呼吁把控前沿节奏,削弱了他“暂停然后做什么?”的立场。
@dejavucoder 嘲讽了这一说法,因为 Opus 5.5 的表现超过 Fable 5.1。
写作、提示与行为
员工对写作的修复。“我们修好了文风”(@_sholtodouglas)以及“我们修好了口音”(@NotTomBrown)。
不同寻常的坦率。 @nmca(Anthropic)发帖称:“比 Opus 5 好太多太多太多了。为那个模型抱歉。”@theo 称这是一条大胆的推文,表明沟通更宽松。
Em 破折号。 @theo 报告称它们已从输出中消失。这是互动最多的反应帖。
Anthropic 的提示手册(@ClaudeDevs):
把整个任务交出去,并定义“完成”以及检查点。
丢掉“仔细思考”,因为模型总会先思考。
长时间运行之后,问问它还需要什么才能继续推进。
旧技巧为何失效。 @dbreunig 指出,旧的提示技巧如今与模型的训练相冲突,这为可重新编译的提示优化提供了论据。
长时运行引导。 @omarsar0 重点介绍了 Anthropic 针对长时间运行的提示,其中模型有时会停下来汇报,而不是继续执行。
缺陷报告。 线上模型有时会生成用户轮次(@BlackHC)。
实际写作质量。 Hamel Husain 直播了“Is Slop Dead?”,测试其写作能力(@HamelHusain)。@nptacek 分享了个人写作评测中的一次 one-shot 结果。
视觉、3D 与代码即艺术演示
感知能力提升。 Sholto Douglas 表示,5.5 系列在 3D 理解与建模上“明显上了一个台阶”,并且该模型“现在能看见了;以前有点瞎”(@_sholtodouglas、@_sholtodouglas)。
用代码作画。 @jkeatn 让模型用纯 Python 逐像素生成画作:
约 7,500 行代码,使用标准库来模拟笔刷风格。
没有图像模型,也没有参考图像。
Sholto 将这种“手动笔刷”式创造力与扩散模型进行对比(@_sholtodouglas)。
Blender 场景。 Alex Albert 展示了在 claude.ai 上用一条提示生成的 Blender 黏土动画(@alexalbert__)。他还构建了一条有史料依据的 1906 年旧金山市场街:
依据 Sanborn 地图、同期影像和档案照片构建。
仅使用程序化生成器,没有下载的网格或纹理(@alexalbert__、提示词)。
@karpathy 顺着这个想法发挥:把历史图像或视频变成可以走动的定制 GTA 风格世界。
更多演示:
一段用代码绘制的 JS 动画(@kevin_t_ngo),以及一条官方探索讨论串(@claudeai)。
一座由代码生成的金门大桥,在 3D 场景方面被评价为“和 Astra 一样好”(@petergyang)。
“在我测试过的所有模型中视觉设计最好”(@other__reality)。
一张珊瑚礁壁纸;制作者表示感觉大约快 3 倍,也便宜约 3 倍(@chaseleantj)。
未解之问。 @teortaxesTex 问为什么这一代如此擅长把函数映射到像素,并认为这是泛化。
反应:支持、怀疑与比较
支持:
流水线缺陷。 @rishdotblog 表示,它发现了 Fable 和 Astra 遗漏的流水线问题。它还发现了 7 处 SEC 申报错误,其中包括 Comfort Systems 的 XBRL 误标,把第一季度营收标成了全年(@rishdotblog)。
回流用户。 “Claude 回来了”:@Yuchenj_UW 表示,离开一个月后他要回到 Claude Code。
用量限制。 全天高强度使用“几乎没怎么消耗”额度(@theo)。
怀旧。 与广受好评的 Opus 4.5 和 4.6 相比较(@arohan、@kimmonismus)。
竞争叙事。 @scaling01 说 Anthropic “又在前沿碾压了。” @kimmonismus 说“他们选择与 OpenAI 开战。”
怀疑或中立:
信任赤字。 @kylebrussell 表示,他不再相信 Opus 的新版本会感觉更好。Sholto 回复问这一版是否能重置这种信任(@_sholtodouglas)。
限额并非对所有人都重要。 @stablequan 反正从来碰不到限额。
价格成为头条。 @dbreunig 问道,两家实验室的头条特性都是更便宜的 token,这意味着什么。
与 GPT‑6 Sol 的正面对比:
支持 Opus。 @andrew_n_carr 表示 Opus 5.5 “远远甩开” Sol。@synthwavedd 表示 Sol 不及预期,Anthropic “赢得了这一天”。
反对。 @teortaxesTex 认为,Opus 5.5 在成本与多智能体上的胜出“实际上会被 Astra+Sol+Luna 的海量调用抵消”,因为 Sol 的价格只有 Opus 5.5 的一半(@scaling01)。
中立。 @kimmonismus 的回顾称没有明确赢家:Anthropic 在能力惊喜上领先,OpenAI 在价格上领先。@simonw 发表了一篇文章,用不同 effort 级别的鹈鹕网格对比全部三款模型。
OpenAI 的 GPT-6 Sol 与 Luna:面向 Codex、Work 和 API 的更便宜的 Astra 衍生模型
OpenAI 在数小时内以 GPT-6 Sol 和 GPT-6 Luna 作出回应,这两款被描述为更快、更便宜的模型,继承了 GPT-6 Astra 在编程、计算机使用、事实性与对齐方面的诸多进展 @OpenAI @OpenAIDevs。定价激进:Sol 为每百万输入/输出 token $2 / $10,Luna 为 $0.10 / $0.50,各自比其 GPT-5.6 前代大约 便宜 50% @OpenAI。它们已推向 ChatGPT Work 和 Codex 以及 API,Luna 也可供桌面应用中的 Free 和 Go 用户使用,但值得注意的是 尚未进入 Chat 模式 @OpenAI。
OpenAI 的对比框架聚焦于 每任务成本帕累托增益,而非绝对的旗舰前沿胜出。其公布的示例称 xhigh effort 下的 Sol 击败 Claude Opus 5 max,在 AutomationBench 上大约只需 每任务成本的 9%,而 Luna max 在 OSWorld 2.0 离线测试上超过 GPT-5.6 Sol medium,成本为十分之一 @reach_vb。第三方集成推进迅速:Perplexity 将 Sol 设为其默认的“Light” effort 编排器 @perplexity_ai,Devin 报告 Sol 以 每任务成本降低 61% 与 GPT-5.6 Sol 持平,Luna 则以大约四分之一的成本击败其前代 @cognition,Arena 则将两者都加入了智能体与代码侧测试 @arena。
更深层的基础设施故事可能比 SKU 名称更重要。OpenAI 表示其改进了 缓存与推理效率,提供高达 缓存输入 token 读取 90% 的折扣,以及新的 Prompt Caching Dashboard 和诊断 API,用以了解缓存复用失效的原因 @OpenAIDevs @OpenAIDevs。这一点对长时间运行的智能体尤为重要,因为工具开关或推理变化导致的缓存失效一直成本高昂。市场反应不一:许多人称赞其经济性,尤其是 Luna 的价格下限,另一些人则认为 Anthropic 在头条模型质量上胜出,而 OpenAI 赢在可负担性与部署易用性 @kimmonismus @synthwavedd。
智能体基础设施、评测工具,以及基于真实使用的后训练
多篇帖子汇聚到一个如今已很熟悉的模式:价值正从原始模型访问转向harness、评测、路由,以及基于专有轨迹的后训练。DigitalOcean Managed Agents进入公开预览,支持Claude Code、Codex 以及 LangGraph 风格的智能体,外加空闲即暂停的运行时、受治理的工具端点,以及75+ 种模型选择 @digitalocean。在开发者工作流方面,VS Code Agent Merge引入了一种实验模式,可在 PR 内自动解决评审意见、失败的检查和合并冲突 @code。
Perplexity分享了较为具体的后训练报告之一:其 Computer 智能体在真实用户会话上混合采用拒绝采样微调与提示引导的自蒸馏,从成功轨迹和明确的工具调用错误中学习,并声称在线上 A/B 测试中工具调用失败减少了 21.2% @perplexity_ai @AravSrinivas。这是实验室借助生产轨迹而非纯合成 RL 环境,将sim-to-real 桥接落地的一个有用例子。
评测与可观测性工具也受到关注。Lenny’s newsletter强调了 Ramp、Shopify、Harvey 和 Cursor 等公司从评测投入中获得的具体 ROI,并链接了Hamel Husain与Shreya Shankar关于高级评测系统的续篇 @lennysan。Hamel 还发布了一个 evals skill/plugin,旨在自动化评测审计与错误分析的部分环节 @lennysan。在可观测性方面,LangSmith改进了对 Jev/SemIf 等决策模型的支持,使状态、问题、选择和输出在智能体轨迹中更易于检查 @hwchase17 @LangChain。多位从业者的元观点是:即便模型和提示相同,harness 也能实质性地改变基准测试结果 @omarsar0。
开放模型、压缩,以及在更小硬件上运行更大模型的系统工作
Tim Dettmers以集成到bitsandbytes2中的运行时动态压缩框架开启了“开源周”,目标是在高质量下实现1.5–2.0 bit 压缩,并承诺“惰性压缩”会在部署时自动找到更好的内存/质量/速度权衡 @Tim_Dettmers @Tim_Dettmers。其定位明确面向试图在受限内存(包括不断增长的 KV cache)下运行大型开放权重模型的小团队和个人。
硬件与本地部署是另一个主题。一篇关于 NVIDIA DGX Spark 的上手文章描述了一套 15×15×5.05 cm、1.2 kg 的系统,配备 GB10 Grace Blackwell、128 GB 统一内存,以及最高 1 PFLOP FP4 稀疏理论算力;NVIDIA 声称支持对最高 200B 参数的模型进行量化后的本地推理,并可用 QLoRA 等方法对最高 70B 的模型进行微调 @kimmonismus。另外,Reka EdgeQ 展示了一款直接针对高通 Hexagon NPU 优化的端侧 VLM,0.73s TTFT、每次推理 6.9 mWh,并让 GPU 保持空闲以维持持续的散热表现 @RekaAILabs。
在开源模型方面,出现了几项有实质意义的发布,而不只是评论。Step Code v0.1.0 以 MIT 许可发布,打包了一个编程智能体 CLI,据报在 Terminal-Bench 2.1 上得分 80.9%,在 Multi-Frame 上得分 73.3%;后者是一项包含 150 个任务的长程基准 @StepFun_ai。Ming-Image-0.1-Design 是一个 6B 开源权重图像设计模型系列,与 UI 设计以及图像转可编辑 PPT 的“agent skills”一同发布,并宣称在 Artificial Analysis 的 UI/UX 设计排行榜上开源权重模型中排名第 1 @AntLingAGI。一项规模较小但技术上值得注意的预训练结果来自 Rigel,这是一个 2.3B MoE / 360M 激活的 Hybrid Mamba-2,据报在同一套代码库上跨混合的 H100/A100/V100 与 TPU v5p/v6e 硬件训练,仅使用 Llama-3.2-3B 预训练 FLOPs 的 <1%,成绩与其相差仅几个百分点 @MayankMish98。
多模态模型:图像、视频、语音与世界模型
在图像生成与编辑方面,Qwen-Image-2.1 在社区排行榜上表现强劲,在 Image Edit Arena 和 Text-to-Image Arena 中均取得开源模型第 1,整体接近前沿专有系统 @arena。配套生态工作包括对 Unsloth Desktop 的支持,提供 INT8/FP8 与 GGUF,借助 RAM 卸载可控制在 6–8 GB VRAM 以内 @danielhanchen,以及 Gradio 试图将 Qwen 默认的 9B 提示重写器 缩小到 0.8B,以便在笔记本上使用 @Gradio。
在视频与实时媒体方面,PixVerse R2 作为实时世界模型发布,强调可编辑、持久的“活世界” @PixVerse;同时 fal 发布了 H3 Max 的技术栈拆解,声称通过涵盖后训练、GPU 执行、权重加载、扩展与服务的优化,实现3 秒内生成 5 秒视频 @fal。其 World Model Accelerator 接口值得注意之处在于,它以持久的 WebRTC 会话取代请求/响应语义,用于交互式模型 @fal。
语音领域同样保持活跃。AssemblyAI Universal-3.5 Pro 已在 OpenRouter 上线,支持19 种语言同步 STT,可通过 keyterms 和提示进行领域引导,并提供限时折扣 @OpenRouter。StepAudio 3 ASR 在 Artificial Analysis 的 AA-WER Index 上达到 1.7% WER,基本并列非流式语音转文字榜首,不过价格偏高 @ArtificialAnlys。Moondream 还发布了面向 25 种语言 的本地 STT 模型 Parakeet Redux 和 Parakeet Ultra,分别针对 CPU 和 GPU @moondreamai。
热门推文(按互动量)
Claude Opus 5.5 发布:Anthropic 的主要发布帖主导了互动量,并框定了当天最大的模型事件 @claudeai。
GPT-6 Sol 与 Luna 发布:OpenAI 发布价格更低、源自 Astra 的模型,成为另一条主要头条 @OpenAI。
Managed Agents 预览:DigitalOcean 面向 Claude Code/Codex/自定义智能体的托管运行时公开预览,引发了异常高的基础设施关注 @digitalocean。
OpenAI 标准提案:Sam Altman 关于 AI 标准与治理的帖子引发了远超纯产品新闻的热烈讨论 @sama。
Epoch 谈 AI 成本曲线:Epoch 估计,自 2023 年以来,固定性能下的 AI 成本一直以每季度 ~47%的速度下降,这是当天较有用的宏观数据点之一 @EpochAIResearch。
AI Reddit 回顾
/r/LocalLlama + /r/localLLM 回顾
1. Qwen、DeepSeek 与 AliceAI 大模型路线图
Qwen4-27B 刚刚得到确认(活跃度:2353):一张会议幻灯片图片似乎确认了即将推出的 Qwen4 系列阵容,明确将 Qwen4-27B 与 Qwen4-Max、Qwen4-Flash 和 Qwen4-Plus 一并列出。该帖突出了社区对阿里巴巴是否也会发布类似
35B-A3B的更小 MoE 风格变体的兴趣,评论者推测 N-gram 等架构变化可能会降低 VRAM 需求。评论者主要在讨论 Qwen4-27B 是否会超越 Qwen 3.8 Flash Next,以及最佳本地推理路径会更偏向独立 GPU 还是大容量统一内存系统。如果全部以开放权重发布,人们也有兴趣比较 Qwen4 Flash、Qwen3.8 Flash Next 和 Qwen4-27B。评论者推测,如果 Qwen4-27B 采用 N-gram 风格架构,其 VRAM 需求可能会更低,不过讨论串中并未提供具体实现细节或显存数字。
有人提议在假定全部以开放权重发布的前提下,对 Qwen4 Flash、Qwen3.8 Flash Next 和 Qwen4-27B 进行技术比较。提出的关键问题是,一个稠密/标准的
27B模型是否会足够明显地超越更小的 Flash 变体,从而影响用户优先选择独立 GPU 还是大容量统一内存系统。一位用户希望 Qwen4 Flash 能保持 Flash Next 的显存占用,具体目标是在
128 GB显存内部署,这暗示人们对更大规模开放权重 Qwen 模型的本地推理可行性感兴趣。
阿里巴巴计划推出 5 万亿至 10 万亿参数的 AI 模型,并发布新芯片 (活跃度:648):据报道,阿里巴巴计划推出一款处于
5T–10T参数区间的 AI 模型,并发布了一款新的 AI 芯片,这意味着其训练/推理目标达到前沿规模,远超当前消费级/本地部署的可行性。评论者将此与此前围绕 DeepSeek R1 的671B/691B级规模的热议相对照,并预计任何实际的下游用途都将通过蒸馏到更小的 Qwen 系列模型来实现,例如假想中的Qwen 4 27B。 主要争论是对本地推理可行性的怀疑——“每 token 数分钟”——与乐观看法相对,即阿里巴巴可能会把一个大得多的内部模型(可能是“Astra”)蒸馏成真正具有竞争力的中国前沿模型。评论者指出,5T–10T 参数 的阿里巴巴模型对几乎所有用户而言实际上将是 仅 API,在家庭实验室硬件上做本地推理并不现实,并且在没有大幅稀疏化、量化或专用服务硬件的情况下,可能只能以极慢的 每 token 数分钟 速度生成。
若干评论将可能的实际价值归结为 蒸馏,并将其与围绕 DeepSeek R1 的
671B/691B级参数量 的热议相比较,同时建议用户或许应转而等待更小的后继模型,例如可在本地运行的假想中的 Qwen 4 27B。一位评论者推测,如果阿里巴巴已成功从 Astra 蒸馏或吸纳了相关能力,这可能表明中国正在更认真地推进前沿模型,不过该讨论串并未提供基准测试证据或实现细节来验证这一说法。
来源:Latent Space · latent.space