跳到正文

#编码

今日 7 条
今天9月29日周二
  1. TechCrunch · AI68

    Anthropic 发布 Sonnet 5.5,称比前代快 30% 且更省

    Anthropic 发布中端模型 Sonnet 5.5,称其比前代快 30%、成本显著更低且 token 消耗明显更慢,适合编程和制作办公文档等日常任务。前代 Sonnet 5 约三个月前发布,卖点是低成本运行智能体;官方基准显示 5.5 在智能体编码上优于 Opus 5.5,可能因为能拉起多个智能体而不超出成本限制。

  2. AWS Machine Learning Blog47

    AWS 推出 Claude Sonnet 5.5

    Claude Sonnet 5.5 今日登陆 Amazon Bedrock,Claude Platform on AWS 在北美提供。它适合范围明确的编码与知识工作,多数工作的单任务成本更低、速度更快。数据留在 AWS 内并支持区域数据驻留,可配合 IAM 与 Amazon Bedrock Guardrails。

9月28日周一
  1. Simon Willison31

    Bluesky 回复机器人检查工具

    Simon Willison 用 Opus 5.5 vibe code 出工具,检查任意 Bluesky 主页是否像回复机器人。信号包括同一账号在数秒内接连发回复、从不发自己的内容(或图片、链接)却持续回复粉丝更多的用户,以及问号。这类机器人开始出现在 Bluesky,而 Bluesky 仍提供免费且好用的 API。

9月27日周日
9月26日周六
9月24日周四
  1. GitHub Blog · AI & ML43

    在 GitHub Copilot 应用中渲染超大 Pull Request

    GitHub Copilot 应用重建 PR 视图后,含 2,200 文件、逾百万行改动和超 400 条行内评论的 diff 仍能流畅滚动。纯代码行在绘制前即可确定高度,虚拟化后同时大约只挂载 100 行。评论高度要到渲染时才知道,因此总高度拆成确定性代码高度与懒测量的动态块,修正则锚定在用户正在看的位置。

9月22日周二
9月18日周五
  1. GitHub Blog · AI & ML50

    GitHub Podcast:还要读代码吗?RAG 死了吗?Skills 杀死了 MCP 吗?

    GitHub Podcast最新一集认为,开发者仍须阅读并负责AI生成代码,RAG并未消亡,Skills也没有杀死MCP。MCP给智能体提供连接工具和数据的标准方式,Skills常以Markdown说明流程与约定,RAG检索训练数据之外的信息。审查应直到能解释并承担结果,不必对每行生成代码投入同等注意力。

9月17日周四
  1. GitHub Blog · AI & ML85

    GitHub 借助 Copilot 将 Copilot agent runtime 重写为超过 800,000 行 Rust

    GitHub 用 Copilot 将 Copilot agent runtime 从 TypeScript/Node.js 重写为超过 800,000 行生产 Rust,大部分代码由 AI 智能体完成,并通过 128 个合入主干的 pull request 增量交付。

    推荐理由:原文写清 Copilot 运行时如何以组件原子替换迁到 Rust 并增量发布,读者可从智能体分工看到大规模改写怎样维持主干持续可交付。

9月11日周五
9月9日周三
9月5日周六
  1. GitHub Blog · AI & ML66

    GitHub Copilot 推出多模型编排研究预览 Project HydraFusion

    GitHub 在 Copilot CLI 推出研究预览 Project HydraFusion,运行时按任务在单模型直接求解、高效模型起草后升级,以及跨模型家族独立评审再修订三种模式间编排多个提供商的模型。

    推荐理由:它把换模型、独立评审和必要时升级交给运行时选择,读者可对照三项智能体编程基准看相对 Claude Opus 5 的质量与估算成本。

9月3日周四
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。

    推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。

8月4日周二
  1. Microsoft Research60

    微软研究院发布开源框架 Orchard,约 3B 模型在 SWE-bench Verified 达 69.7%

    微软研究院发布开源框架 Orchard,用 Kubernetes 环境服务 Orchard Env 在 Codex、OpenClaw、ZeroClaw 等真实框架中训练软件工程、网页与助手智能体。

    推荐理由:微软研究院的 Orchard 用可复用环境让智能体在真实部署框架中训练,约 3B 激活参数的开放模型因而在 SWE-bench Verified 上达到 69.7% 并在价值模型重排后升至 73.0%。