Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,用于以更高 token 效率、更低延迟和更可靠表现规模化构建 AI 智能体。
推荐理由:官方把三款新模型相对前代的token用量、速度、价格和基准分数放在一起,便于比较它们在智能体工作流里的成本与能力取舍。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,用于以更高 token 效率、更低延迟和更可靠表现规模化构建 AI 智能体。
推荐理由:官方把三款新模型相对前代的token用量、速度、价格和基准分数放在一起,便于比较它们在智能体工作流里的成本与能力取舍。
Google 推出 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证并修补漏洞,并在这些任务上比主线 Flash 模型更有效。
Hugging Face 本周侦测并处置了生产基础设施中由自主 AI 智能体端到端发动的入侵,对方未经授权接触了有限内部数据集和若干服务凭证;尚未发现面向用户的公开模型、数据集或 Spaces 被篡改,容器镜像与已发布软件包经验证干净,合作方或客户数据是否受影响仍在评估。
推荐理由:这次事件给出的可迁移做法是事先在自有基础设施备好可用模型,以免托管服务护栏阻断取证或导致攻击数据与凭证外流。
IBM Research 在智能体里做模型路由时发现,选模型会从分类问题变成同时权衡成本、质量、延迟、合规与可靠性的系统优化。
Google Research 提出大型传感器基础模型 SensorFM,用五百万名同意参与者超过一万亿分钟的无标签多模态可穿戴信号学习可复用生理表征。
Microsoft 在 Build 2026 宣布推出 Foundry Managed Compute,并将每周刷新的 Hugging Face 精选开源权重以一键方式部署到该托管算力。
Mistral发布Apache-2.0免费模型Leanstral 1.5,总参数119B、激活参数6B,在miniF2F验证集与测试集均达到100%,并解出PutnamBench 672题中的587题。
推荐理由:原文给出6B激活参数模型的基准成绩、约4美元单题成本和开源入口,读者可以据此比较它与更高成本形式验证系统的差异。
IBM Research推出开源基准ScarfBench,评测AI智能体能否把企业Java应用在Spring、Jakarta EE与Quarkus之间迁移,并真正完成构建、部署和行为保持。
计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可构建在浏览器、移动端和桌面中观察、推理并执行操作的自定义智能体。
推荐理由:原先独立的Gemini 2.5计算机使用模型已并入Gemini 3.5 Flash,开发者可据此构建跨端长程自动化智能体,并选用操作确认与注入拦截。
Mistral 发布 Mistral OCR 4,在提取文本之外返回边界框、类型化块分类和行内置信度,支持 10 个语系共 170 种语言,并可在单个容器中完全自托管。
推荐理由:官方说明 Mistral OCR 4 在文本之外返回边界框、块分类和置信度,并公布人工评测胜率与基准分数,便于评估其进入检索和自托管流水线的条件。
Google DeepMind 发布面向笔记本的 Gemma 4 12B,采用无编码器统一架构,让视觉和音频直接进入 LLM 主干。它是该系列首个支持原生音频输入的中等尺寸模型,标准基准表现接近 26B MoE,总内存不到后者一半,16GB VRAM 或统一内存即可本地运行,以 Apache 2.0 许可发布并配备 MTP drafter。
推荐理由:它位于端侧友好的E4B与更先进的26B MoE之间,用无编码器设计把视觉和音频直接交给语言模型,并以不到一半内存接近更大模型的基准表现。
Mistral 上线统一智能体 Vibe,把 Le Chat 收成覆盖办公与编码的同一产品和许可,原有对话、设置与套餐已迁移。Work Mode 可在网页和移动端跨企业工具处理收件、研究与文档等长任务,Code Mode 则在隔离沙箱中把编码做到可审查的 pull request,并提供 VS Code 扩展与 CLI。
推荐理由:Vibe 将办公长任务与编码会话收进同一智能体,并公开网页、VS Code 和 CLI 入口,读者可以对照它如何承接从计划确认到可审查改动的流程。
Mistral AI 今日以公开预览发布开源 Search Toolkit,把数据接入、检索和评测统一为面向 AI 应用的生产级搜索管线。检索支持 BM25 稀疏检索、稠密嵌入检索和混合配置,评测内置召回率、精确率、MRR 与 NDCG,可在自有测试集上对比配置。框架可在云端、本地或边缘运行;CMA CGM 将其与 Voxtral 配合处理三个音频来源,并在 15 秒内端到端返回预警。
推荐理由:它把文档接入、混合检索和内置评测收进同一开源框架,便于团队在自有数据上单独比较检索配置并衡量质量。
Mistral 发布 128B 稠密开源权重模型 Mistral Medium 3.5,并将其作为 Mistral Vibe 与 Le Chat 的默认模型,同时上线可在云端并行异步运行的远程编程智能体。
推荐理由:新的128B开源权重模型把编程会话放到云端并行运行,开发者可在离开后查看进度并在敏感操作前做人工确认。
Mistral 今日在 Studio 以 Public Preview 发布 Connectors,内置连接器与自定义 MCP 现可通过 API/SDK 用于全部模型和智能体调用。
Google DeepMind为Project Genie上线Street View实景锚定,创建世界时可选美国地点和风格,使起点绑定真实街景影像。用户可借助Maps Imagery Grounding,例如用Ocean World风格在金门大桥周围潜水,或用B&W film风格查看1920年代的Fort Worth Stockyards。
MIT的Ritu Raman与波士顿儿童医院的Ryan Flynn借助Co-Scientist打通实验室,联合工具箱探索ALS。机械工程师Raman搭建活体神经和肌肉组织,模拟影响随意运动的疾病;其丈夫Flynn是化学生物学家,绘制细胞表面RNA,研究它如何影响细胞通讯和病原体入侵。
Google DeepMind 发布 Gemini 3.5 模型家族,并开放 Gemini 3.5 Flash,使其成为全球 Gemini 应用和 Google 搜索 AI Mode 的默认模型,同时进入 Google Antigravity、Gemini API 及企业平台。
推荐理由:3.5 Flash已同时向用户、开发者和企业开放,智能体与编码基准超过Gemini 3.1 Pro,可比较其速度和落地范围。
Google DeepMind 在 Nature 发表 Co-Scientist,用 Gemini 多智能体迭代生成、辩论并演化科学假设。在肝纤维化合作中,系统标出的一种药物重定位候选在实验室测试里阻断了 91% 与瘢痕相关的反应。个人研究者可在 labs.google/science 登记兴趣,Hypothesis Generation 实验工具将于未来数周开始推出。
推荐理由:文中把多智能体假设生成拆成提出、辩论与演化三阶段,并说明它如何在肝纤维化等课题里帮助研究者收敛可检验方向。
AlphaEvolve 团队分享了这一 Gemini 驱动编码智能体至今最显著的跨领域影响,应用已从数学和计算机科学扩展到健康、可持续、量子计算、AI 基础设施与商业优化。
推荐理由:把测序纠错、电网求解、量子电路和企业路由等结果放在一起,可以看出这个编码智能体已从算法发现延伸到基础设施与商业优化。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者的 triadic care。在盲测中,医生更偏好 AI co-clinician 而非领先的证据综合工具;98 项基层医疗问询里有 97 例没有关键错误,开放式 OpenFDA RxQA 用药问答也优于其他前沿模型。
Mistral今日以公开预览发布Workflows,作为Studio中的企业AI编排层,用于把AI流程从概念验证可靠推进到生产。开发者用Python编写流程并发布到Le Chat触发,可用wait_for_input()暂停等待人工审批且不消耗算力。
Google DeepMind 发布开源模型家族 Gemma 4,包含 E2B、E4B、26B MoE 与 31B Dense,权重以 Apache 2.0 许可提供。
推荐理由:官方一次放出四档开源权重并采用 Apache 2.0,读者可按硬件与端侧条件对照本地推理和智能体能力。
Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持 9 种语言,API 价格为每 1k 字符 $0.016。母语者评测显示其自然度优于 TTFA 相近的 ElevenLabs Flash v2.5 且情感引导与 v3 持平,10 秒、500 字符输入的模型延迟为 70ms,实时率约 9.7 倍。
推荐理由:母语者对照显示 Voxtral TTS 自然度高于 TTFA 相近的 ElevenLabs Flash v2.5,情感引导与 v3 持平。
Mistral 发布 Mistral Small 4,把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码整合进同一模型,并以 Apache 2.0 许可开源。
推荐理由:公告把推理、多模态和智能体编码收进同一开源模型,并给出相对 Mistral Small 3 的完成时间与每秒请求数变化。
Mistral 发布面向 Lean 4 的开源代码智能体 Leanstral(Leanstral-120B-A6B,激活参数 6B),权重采用 Apache 2.0。
Mistral 基于开源编码助手 Vibe 构建了可在 CI/CD 中无人干预运行的智能体,用于读取 Rails 源文件并生成或改进 RSpec 测试。面向 275 个源文件的实验中,测试通过率与 SimpleCov 平均行覆盖率均为 100%,已有测试文件的 LLM-as-a-judge 分数从 0.49 升至 0.74,自校正后 RuboCop 违规为 0。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,现已在 Le Chat Pro 和 Team 套餐中提供。
推荐理由:Vibe 2.0把子智能体、澄清选项和斜杠技能放进终端编码流程,并给出Devstral 2的API单价,便于对照现有开发方式评估是否接入。
Le Chat 推出 Memories(beta),会自动保存有用信息,并在召回时展示所用记忆、来源和相关性。用户可随时关闭记忆、开启不使用记忆的隐身聊天、编辑或删除单条记录,也能导出或从其他地方导入。官方同时推出可编辑的 Memory Insights,基于用户自己的数据提示趋势、摘要和值得回看的内容;底层采用图结构,后续还将支持分类、即时遗忘和更清晰的使用记录。
Mistral 为 Le Chat 发布 20+ 个基于 MCP 的安全连接器(beta)和 Memories(beta),免费方案即可在 chat.mistral.ai 或移动应用使用,无需信用卡。
推荐理由:Le Chat 把 20+ 个企业连接器、自建 MCP 和可编辑的 Memories 放进免费方案,读者可以据此判断业务工具与跨对话上下文能否进入同一助手。
Mistral 更新 Le Chat,新增 Deep Research 预览、语音模式、基于 Magistral 的多语言推理、Projects,以及与 Black Forest Labs 合作的图像编辑。
推荐理由:Le Chat 把深度研究、语音、多语言推理、项目文件夹和图像编辑放进同一入口,便于对照现有检索与整理流程看哪些环节被接上。
Mistral AI 联合 All Hands AI 发布 Devstral Medium,并将 Devstral Small 升级为 Apache 2.0 开源的 1.1。
推荐理由:合作推出的开源模型 Devstral Small 1.1 在 SWE-Bench Verified 得到 53.6% 且每百万输入 token 价格为 $0.1,性能更高的 Devstral Medium 则以 61.6% 得分和 $0.4 的同等计价提供 API 与私有部署选择。