Claude Opus 5.5 现已在 Amazon Bedrock 与 Claude Platform on AWS 提供
Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 提供,是 Claude 5.5 家族的第一个模型,面向智能体编码、知识工作与长时任务。
Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 提供,是 Claude 5.5 家族的第一个模型,面向智能体编码、知识工作与长时任务。
GitHub Podcast最新一集认为,开发者仍须阅读并负责AI生成代码,RAG并未消亡,Skills也没有杀死MCP。MCP给智能体提供连接工具和数据的标准方式,Skills常以Markdown说明流程与约定,RAG检索训练数据之外的信息。审查应直到能解释并承担结果,不必对每行生成代码投入同等注意力。
GitHub 用 Copilot 将 Copilot agent runtime 从 TypeScript/Node.js 重写为超过 800,000 行生产 Rust,大部分代码由 AI 智能体完成,并通过 128 个合入主干的 pull request 增量交付。
推荐理由:原文写清 Copilot 运行时如何以组件原子替换迁到 Rust 并增量发布,读者可从智能体分工看到大规模改写怎样维持主干持续可交付。
Google DeepMind发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,把近实时推理用于语音智能体。
推荐理由:原文给出了Extended Thinking的语音基准分数,以及两款模型面向开发者、企业和普通用户的不同开放范围。
在 AppWorld 上,使用 GPT-4.1 的 ReAct 智能体 Mean@5 为 77.4%,但五次运行全部成功的 Pass^5 只有 53.0%,一致性落差达 24.4 个百分点。
负责 GitHub 日本和韩国市场的 Tomoko Tanaka 用 GitHub Copilot、Issue 和 Actions 自动化活动运营,过去要手工处理一两天的搭建现在从单条 Issue 开始,系统每天早上筛查报名者,并在结束后自行收尾。
GitHub Copilot app 内置并排的 diff、终端和浏览器面板,审阅、运行和预览都不用离开应用。diff 新增为绿、删除为红,可接受、评论或让 Copilot 再改。终端可通过 Run 按钮运行脚本,浏览器用 Pick & Polish 选元素交给智能体调整,然后接受改动并创建 pull request。
Mistral 帮助一家欧洲能源运营商,将 40,000 行没有测试套件和集中文档的 Fortran 77 油藏模拟代码迁移到 C++。项目先建立可导出 Fortran 状态并在 C++ 中核对关键结果的数值对齐框架,再用调用关系树和逾百个智能体整理分散文档。
GitHub 在 Copilot CLI 推出研究预览 Project HydraFusion,运行时按任务在单模型直接求解、高效模型起草后升级,以及跨模型家族独立评审再修订三种模式间编排多个提供商的模型。
推荐理由:它把换模型、独立评审和必要时升级交给运行时选择,读者可对照三项智能体编程基准看相对 Claude Opus 5 的质量与估算成本。
funes 为 Claude Code、Codex、pi 和 Hermes 提供归用户所有的持久记忆,默认在本机索引已有会话,也可同步到默认私有的 Hugging Face 数据集。
推荐理由:这种记忆以你拥有的数据集而非独立服务存在,原始回合始终可追溯,因此换机器或换智能体后仍能召回先前的决策与失败尝试。
Google 启动 Fairwind Program,让政府与可信伙伴借助 Gemini 3.8 Flash Cyber 和 CodeMender 自主修复漏洞。不必再花数周,数分钟内即可在安全云环境生成经验证、可部署的补丁。已有超过 650 家合作伙伴,访问限于内部网络安全、事件响应或渗透测试团队并需多因素认证。
Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。
推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。
Google DeepMind 今天在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上线智能体式视频理解,视频分析的 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
推荐理由:智能体模式让模型按目标选择画面、音频或文字稿并只读取所需片段,长视频分析不必再整段按固定帧率消耗大量 token。
Google Research 在 Google Earth AI 中介绍实验性行星预测引擎 PPE,可根据自然语言查询自动完成地理空间数据发现、整理、训练、评估并生成报告,把含人工数据工程的建模时间从数周缩到数分钟。
Google 发布语音转文字模型 Gemini 3.5 Transcribe,可将原始音频直接转为准确、润色并自动排版的文本,并称这是其迄今最精确的语音转写模型。
推荐理由:相对 Chirp 3,新模型给出流式 4.0% 与非流式 2.6% 词错误率以及终稿时间改善 70% 的直接对比。
Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。
推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。
华盛顿大学、斯坦福大学等高校提出 SPADE,让大语言模型以自对弈交替生成可执行训练环境并求解,用来合成训练数据。Qwen3-30B-A3B 的游戏环境套件平均分为 58.3,比基座高 8.1、比最强固定环境基线高 5.3。METR 研究显示,LLM 对网络安全漏洞发现加速明显,数学仅轻微加速,AI 研究算法进展则没有可测到的加速。
Liquid AI 发布三款 LFM2.5 的 DSpark 草稿模型,在不改变贪心输出的前提下,把 GPU 吞吐最高做到 3.18 倍、端侧最高做到 2.87 倍。
Mistral推出Agentic Search,让模型通过search、open、navigate、read和grep五个工具,在现有索引上多步查找、打开并核对长文档与多来源信息。
推荐理由:Mistral把一次取块改成可导航核对的多步检索,使FinanceBench正确率从26.7%升至86%并降低延迟与token。
ALTK-Evolve在AppWorld test_normal上对照八个模型发现,自蒸馏记忆的合适剂量取决于模型能力。强模型DeepSeek-V3.2注入全量指南后TGC提升9.5个百分点,弱模型gpt-oss-120b用精选检索提升16.1个百分点且token仅增5%,饱和模型GLM-5增益为0。这些指南从智能体过往轨迹蒸馏,推理时注入,不更新模型权重,也不需要人工标注。
Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体,距 3.6 Flash 仅三周,入门价为原先每百万 token 成本的一半。
推荐理由:Gemini 3.7 Flash 在 3.6 Flash 发布仅三周后推出,编码调试、网页生成和复杂文档处理基准均有提升,同时入门价定为原先每百万 token 成本的一半。
Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。
推荐理由:随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。
微软研究院发布开源框架 Orchard,用 Kubernetes 环境服务 Orchard Env 在 Codex、OpenClaw、ZeroClaw 等真实框架中训练软件工程、网页与助手智能体。
推荐理由:微软研究院的 Orchard 用可复用环境让智能体在真实部署框架中训练,约 3B 激活参数的开放模型因而在 SWE-bench Verified 上达到 69.7% 并在价值模型重排后升至 73.0%。
多伦多大学等机构用可装入单块80GB A100的开源权重LLM,做出自我复制的AI蠕虫原型,完整攻击成功率约37%。约1337名来自OpenAI、Anthropic、Google DeepMind、Meta等机构的人士请求美国政府支持国际努力,开发有意放缓自动化AI研发前沿所需的技术与治理工具。
Google Research 提出 Chain-of-Evidence(CoE)及原型 Science One Framework,在研究主张生成时建立并维护证据链。
微软研究院构建 Echoverse,用十个深度领域世界和两个能力世界训练计算机使用智能体。在全部十二个世界上训练后,Qwen3.5-9B 的平均分从 36.5% 升至 67.1%,距 GPT-5.4 的 80.7% 约十四个百分点。
Google DeepMind 今天发布 Gemini Robotics ER 2,将其作为机器人的高层具身推理模型,用于对话、理解物理世界和多步规划,再把运动执行交给下层视觉语言动作模型。
推荐理由:新模型相对 ER 1.6 补上了连续视频中的进度判断与多机协作能力,开发者可把它接到下层动作模型来编排多步实体任务。
Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。
推荐理由:这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。
Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。
推荐理由:13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。
Google DeepMind 在 DOE Genesis Mission Summit 2026 宣布,承诺提供价值 $40 million 的 AI token 与云额度,支持 Genesis Mission 的研究人员。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,用于以更高 token 效率、更低延迟和更可靠表现规模化构建 AI 智能体。
推荐理由:官方把三款新模型相对前代的token用量、速度、价格和基准分数放在一起,便于比较它们在智能体工作流里的成本与能力取舍。
Google 推出 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证并修补漏洞,并在这些任务上比主线 Flash 模型更有效。
Google Research 提出大型传感器基础模型 SensorFM,用五百万名同意参与者超过一万亿分钟的无标签多模态可穿戴信号学习可复用生理表征。
Mistral发布Apache-2.0免费模型Leanstral 1.5,总参数119B、激活参数6B,在miniF2F验证集与测试集均达到100%,并解出PutnamBench 672题中的587题。
推荐理由:原文给出6B激活参数模型的基准成绩、约4美元单题成本和开源入口,读者可以据此比较它与更高成本形式验证系统的差异。
计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可构建在浏览器、移动端和桌面中观察、推理并执行操作的自定义智能体。
推荐理由:原先独立的Gemini 2.5计算机使用模型已并入Gemini 3.5 Flash,开发者可据此构建跨端长程自动化智能体,并选用操作确认与注入拦截。
Mistral 发布 Mistral OCR 4,在提取文本之外返回边界框、类型化块分类和行内置信度,支持 10 个语系共 170 种语言,并可在单个容器中完全自托管。
推荐理由:官方说明 Mistral OCR 4 在文本之外返回边界框、块分类和置信度,并公布人工评测胜率与基准分数,便于评估其进入检索和自托管流水线的条件。
Mistral 上线统一智能体 Vibe,把 Le Chat 收成覆盖办公与编码的同一产品和许可,原有对话、设置与套餐已迁移。Work Mode 可在网页和移动端跨企业工具处理收件、研究与文档等长任务,Code Mode 则在隔离沙箱中把编码做到可审查的 pull request,并提供 VS Code 扩展与 CLI。
推荐理由:Vibe 将办公长任务与编码会话收进同一智能体,并公开网页、VS Code 和 CLI 入口,读者可以对照它如何承接从计划确认到可审查改动的流程。
Mistral AI 今日以公开预览发布开源 Search Toolkit,把数据接入、检索和评测统一为面向 AI 应用的生产级搜索管线。检索支持 BM25 稀疏检索、稠密嵌入检索和混合配置,评测内置召回率、精确率、MRR 与 NDCG,可在自有测试集上对比配置。框架可在云端、本地或边缘运行;CMA CGM 将其与 Voxtral 配合处理三个音频来源,并在 15 秒内端到端返回预警。
推荐理由:它把文档接入、混合检索和内置评测收进同一开源框架,便于团队在自有数据上单独比较检索配置并衡量质量。
Mistral 今日在 Studio 以 Public Preview 发布 Connectors,内置连接器与自定义 MCP 现可通过 API/SDK 用于全部模型和智能体调用。