Grok 4.7 现已在 Amazon Bedrock 上线
Grok 4.7 现已在 Amazon Bedrock 上线,上下文窗口为 500K token,面向编码、长时智能体和知识工作。
Grok 4.7 现已在 Amazon Bedrock 上线,上下文窗口为 500K token,面向编码、长时智能体和知识工作。
Claude Sonnet 5.5 今日登陆 Amazon Bedrock,Claude Platform on AWS 在北美提供。它适合范围明确的编码与知识工作,多数工作的单任务成本更低、速度更快。数据留在 AWS 内并支持区域数据驻留,可配合 IAM 与 Amazon Bedrock Guardrails。
OpenAI 正在征集建造者、动手实践者、研究者和创作者用 Codex 做出了不起之事的真实故事。想成为 Codex Originals 计划下一章的一员,可在下方介绍自己的故事与项目。
Proaction 借助 Codex 将销售额提升 60%,并节省 75+ 小时。结合 GPT-Live-1 与 GPT-6 Astra,Proaction 能更快地构建、运营并销售现代车队管理。
GitHub Copilot 应用重建 PR 视图后,含 2,200 文件、逾百万行改动和超 400 条行内评论的 diff 仍能流畅滚动。纯代码行在绘制前即可确定高度,虚拟化后同时大约只挂载 100 行。评论高度要到渲染时才知道,因此总高度拆成确定性代码高度与懒测量的动态块,修正则锚定在用户正在看的位置。
开发者可以用开源终端智能体 OpenCode 调用 Amazon Bedrock 上的开放权重模型,把推理留在自有 AWS 账号并按消耗计费。
Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 提供,是 Claude 5.5 家族的第一个模型,面向智能体编码、知识工作与长时任务。
GitHub Podcast最新一集认为,开发者仍须阅读并负责AI生成代码,RAG并未消亡,Skills也没有杀死MCP。MCP给智能体提供连接工具和数据的标准方式,Skills常以Markdown说明流程与约定,RAG检索训练数据之外的信息。审查应直到能解释并承担结果,不必对每行生成代码投入同等注意力。
GitHub 用 Copilot 将 Copilot agent runtime 从 TypeScript/Node.js 重写为超过 800,000 行生产 Rust,大部分代码由 AI 智能体完成,并通过 128 个合入主干的 pull request 增量交付。
推荐理由:原文写清 Copilot 运行时如何以组件原子替换迁到 Rust 并增量发布,读者可从智能体分工看到大规模改写怎样维持主干持续可交付。
GitHub Copilot app 内置并排的 diff、终端和浏览器面板,审阅、运行和预览都不用离开应用。diff 新增为绿、删除为红,可接受、评论或让 Copilot 再改。终端可通过 Run 按钮运行脚本,浏览器用 Pick & Polish 选元素交给智能体调整,然后接受改动并创建 pull request。
Mistral 帮助一家欧洲能源运营商,将 40,000 行没有测试套件和集中文档的 Fortran 77 油藏模拟代码迁移到 C++。项目先建立可导出 Fortran 状态并在 C++ 中核对关键结果的数值对齐框架,再用调用关系树和逾百个智能体整理分散文档。
GitHub 在 Copilot CLI 推出研究预览 Project HydraFusion,运行时按任务在单模型直接求解、高效模型起草后升级,以及跨模型家族独立评审再修订三种模式间编排多个提供商的模型。
推荐理由:它把换模型、独立评审和必要时升级交给运行时选择,读者可对照三项智能体编程基准看相对 Claude Opus 5 的质量与估算成本。
作者用TRL与OpenEnv复现Surya Narreddi的思路,训练编码模型编写JavaScript,经p5.brush绘制水彩,并在Hugging Face公开参考池、RL环境、训练脚本和模型。
funes 为 Claude Code、Codex、pi 和 Hermes 提供归用户所有的持久记忆,默认在本机索引已有会话,也可同步到默认私有的 Hugging Face 数据集。
推荐理由:这种记忆以你拥有的数据集而非独立服务存在,原始回合始终可追溯,因此换机器或换智能体后仍能召回先前的决策与失败尝试。
Google 启动 Fairwind Program,让政府与可信伙伴借助 Gemini 3.8 Flash Cyber 和 CodeMender 自主修复漏洞。不必再花数周,数分钟内即可在安全云环境生成经验证、可部署的补丁。已有超过 650 家合作伙伴,访问限于内部网络安全、事件响应或渗透测试团队并需多因素认证。
Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。
推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。
Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。
推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。
Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体,距 3.6 Flash 仅三周,入门价为原先每百万 token 成本的一半。
推荐理由:Gemini 3.7 Flash 在 3.6 Flash 发布仅三周后推出,编码调试、网页生成和复杂文档处理基准均有提升,同时入门价定为原先每百万 token 成本的一半。
微软研究院发布开源框架 Orchard,用 Kubernetes 环境服务 Orchard Env 在 Codex、OpenClaw、ZeroClaw 等真实框架中训练软件工程、网页与助手智能体。
推荐理由:微软研究院的 Orchard 用可复用环境让智能体在真实部署框架中训练,约 3B 激活参数的开放模型因而在 SWE-bench Verified 上达到 69.7% 并在价值模型重排后升至 73.0%。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,用于以更高 token 效率、更低延迟和更可靠表现规模化构建 AI 智能体。
推荐理由:官方把三款新模型相对前代的token用量、速度、价格和基准分数放在一起,便于比较它们在智能体工作流里的成本与能力取舍。
Google 推出 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证并修补漏洞,并在这些任务上比主线 Flash 模型更有效。
Mistral发布Apache-2.0免费模型Leanstral 1.5,总参数119B、激活参数6B,在miniF2F验证集与测试集均达到100%,并解出PutnamBench 672题中的587题。
推荐理由:原文给出6B激活参数模型的基准成绩、约4美元单题成本和开源入口,读者可以据此比较它与更高成本形式验证系统的差异。
Mistral 上线统一智能体 Vibe,把 Le Chat 收成覆盖办公与编码的同一产品和许可,原有对话、设置与套餐已迁移。Work Mode 可在网页和移动端跨企业工具处理收件、研究与文档等长任务,Code Mode 则在隔离沙箱中把编码做到可审查的 pull request,并提供 VS Code 扩展与 CLI。
推荐理由:Vibe 将办公长任务与编码会话收进同一智能体,并公开网页、VS Code 和 CLI 入口,读者可以对照它如何承接从计划确认到可审查改动的流程。
Mistral 发布 128B 稠密开源权重模型 Mistral Medium 3.5,并将其作为 Mistral Vibe 与 Le Chat 的默认模型,同时上线可在云端并行异步运行的远程编程智能体。
推荐理由:新的128B开源权重模型把编程会话放到云端并行运行,开发者可在离开后查看进度并在敏感操作前做人工确认。