Anthropic 的 Claude Sonnet 5.5 多项基准接近 Opus 5.5,单任务成本最多可降 30%
Anthropic的Claude Sonnet 5.5接近Opus 5.5多项基准表现,生成速度超过30%,单任务成本最多降30%。
推荐理由:Sonnet 5.5在与前代相同的百万 token 价格下最多降低三成单任务成本,多项基准则接近 Opus 5.5。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Anthropic的Claude Sonnet 5.5接近Opus 5.5多项基准表现,生成速度超过30%,单任务成本最多降30%。
推荐理由:Sonnet 5.5在与前代相同的百万 token 价格下最多降低三成单任务成本,多项基准则接近 Opus 5.5。
GitHub 用 Copilot 将 Copilot agent runtime 从 TypeScript/Node.js 重写为超过 800,000 行生产 Rust,大部分代码由 AI 智能体完成,并通过 128 个合入主干的 pull request 增量交付。
推荐理由:原文写清 Copilot 运行时如何以组件原子替换迁到 Rust 并增量发布,读者可从智能体分工看到大规模改写怎样维持主干持续可交付。
GitHub 在 Copilot CLI 推出研究预览 Project HydraFusion,运行时按任务在单模型直接求解、高效模型起草后升级,以及跨模型家族独立评审再修订三种模式间编排多个提供商的模型。
推荐理由:它把换模型、独立评审和必要时升级交给运行时选择,读者可对照三项智能体编程基准看相对 Claude Opus 5 的质量与估算成本。
Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。
推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。
微软研究院发布开源框架 Orchard,用 Kubernetes 环境服务 Orchard Env 在 Codex、OpenClaw、ZeroClaw 等真实框架中训练软件工程、网页与助手智能体。
推荐理由:微软研究院的 Orchard 用可复用环境让智能体在真实部署框架中训练,约 3B 激活参数的开放模型因而在 SWE-bench Verified 上达到 69.7% 并在价值模型重排后升至 73.0%。