Google 在 Nature 发表科学代码工具 ERA 并逐步开放 Computational Discovery
Google 今日在 Nature 发表科学代码工具 ERA,并开始逐步开放由 ERA 与 AlphaEvolve 构建的 Computational Discovery。
推荐理由:原文说明ERA如何用树搜索迭代科学代码,并给出可对照CDC榜单的住院预测,读者可以据此判断它缩短的是哪一段实验周期。
Google 今日在 Nature 发表科学代码工具 ERA,并开始逐步开放由 ERA 与 AlphaEvolve 构建的 Computational Discovery。
推荐理由:原文说明ERA如何用树搜索迭代科学代码,并给出可对照CDC榜单的住院预测,读者可以据此判断它缩短的是哪一段实验周期。
生物学家 Omar Abudayyeh 与 Jonathan Gootenberg 正用 Co-Scientist 加快寻找能逆转细胞衰老的遗传线索。衰老研究的两大瓶颈是决定测试哪些遗传通路,以及理解实验产生的海量数据。
Google DeepMind为Project Genie上线Street View实景锚定,创建世界时可选美国地点和风格,使起点绑定真实街景影像。用户可借助Maps Imagery Grounding,例如用Ocean World风格在金门大桥周围潜水,或用B&W film风格查看1920年代的Fort Worth Stockyards。
Google DeepMind 推出 Gemini Omni 家族的首个模型 Gemini Omni Flash,可将图像、音频、视频和文本作为输入生成视频,并用自然语言多轮编辑且保持角色、物理和场景连贯。
推荐理由:官方同时给出对话式编辑、物理与世界知识约束以及SynthID核验路径,读者可以据此判断这款视频模型会怎样进入现有创作流程。
Google 扩展 Search、Gemini、Chrome、Pixel 与 Cloud 的内容透明度与核验工具,帮助用户了解网上内容如何被创建和编辑。
推荐理由:Google 把 SynthID 与内容凭证核验扩到搜索、浏览器和手机,并在云端提供检测接口,方便分辨模型生成内容与相机拍摄原片。
MIT的Ritu Raman与波士顿儿童医院的Ryan Flynn借助Co-Scientist打通实验室,联合工具箱探索ALS。机械工程师Raman搭建活体神经和肌肉组织,模拟影响随意运动的疾病;其丈夫Flynn是化学生物学家,绘制细胞表面RNA,研究它如何影响细胞通讯和病原体入侵。
斯坦福大学医学院的Gary Peltz让Co-Scientist从既有药物中提出三款肝纤维化候选,其中两款在活体人肝细胞测试中阻断纤维化并促进肝细胞再生,而他依据文献自选的两款没有益处。
Google DeepMind 与 Google Research 的 AI 天气模型 WeatherNext,在五天前以 80% 置信度预测飓风梅利莎将以五级强度登陆牙买加,帮助国家飓风中心提前预警。
Google DeepMind 发布 Gemini 3.5 模型家族,并开放 Gemini 3.5 Flash,使其成为全球 Gemini 应用和 Google 搜索 AI Mode 的默认模型,同时进入 Google Antigravity、Gemini API 及企业平台。
推荐理由:3.5 Flash已同时向用户、开发者和企业开放,智能体与编码基准超过Gemini 3.1 Pro,可比较其速度和落地范围。
Google DeepMind 在 Nature 发表 Co-Scientist,用 Gemini 多智能体迭代生成、辩论并演化科学假设。在肝纤维化合作中,系统标出的一种药物重定位候选在实验室测试里阻断了 91% 与瘢痕相关的反应。个人研究者可在 labs.google/science 登记兴趣,Hypothesis Generation 实验工具将于未来数周开始推出。
推荐理由:文中把多智能体假设生成拆成提出、辩论与演化三阶段,并说明它如何在肝纤维化等课题里帮助研究者收敛可检验方向。
AlphaEvolve 团队分享了这一 Gemini 驱动编码智能体至今最显著的跨领域影响,应用已从数学和计算机科学扩展到健康、可持续、量子计算、AI 基础设施与商业优化。
推荐理由:把测序纠错、电网求解、量子电路和企业路由等结果放在一起,可以看出这个编码智能体已从算法发现延伸到基础设施与商业优化。
Jack Clark 判断,前沿模型到 2028 年底自主训练后继版本的概率约为 60%,2027 年约 30%,2026 年则不预期发生。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者的 triadic care。在盲测中,医生更偏好 AI co-clinician 而非领先的证据综合工具;98 项基层医疗问询里有 97 例没有关键错误,开放式 OpenFDA RxQA 用药问答也优于其他前沿模型。
Google Research 科学家与学术合作者已用 Empirical Research Assistance(ERA)开展四类研究,涵盖美国流感、COVID-19 和 RSV 住院预报、宇宙弦引力辐射、GOES East 二氧化碳估计以及斑马鱼神经回路。
Mistral今日以公开预览发布Workflows,作为Studio中的企业AI编排层,用于把AI流程从概念验证可靠推进到生产。开发者用Python编写流程并发布到Le Chat触发,可用wait_for_input()暂停等待人工审批且不消耗算力。
Google Photos 的 Auto frame 现已加入拍后重设视角能力,用机器学习理解场景与空间布局,再用生成式 AI 从新机位生成照片。方法先估计三维点图、可见表面和原相机焦距,重点减少人体与面部重建伪影,再渲染调整后的相机位姿和焦距;新露出的区域由潜空间扩散模型补全,并以分类器引导和区域缩放保留原内容。
推荐理由:Google Photos 的 Auto frame 会把已拍照片当作三维场景并自动调整机位,同时补全新视角里原先不可见的内容从而改善人像与广角构图。
GRASP 是面向学习得到的动力学(世界模型)的新型梯度规划器,靠三项设计让长时域规划变得可行。它将轨迹提升到虚拟状态,使优化可沿时间并行;把随机性直接加进状态迭代用于探索;并重塑梯度,让动作获得干净信号,同时避开高维视觉模型中脆弱的 state-input 梯度。
Google DeepMind发布Gemini 3.1 Flash TTS,用可嵌入文本的音频标签控制风格、语速与表达。该模型即日起向开发者通过Gemini API和Google AI Studio预览,企业通过Vertex AI预览,Workspace用户可通过Google Vids使用。
推荐理由:开发者可以把自然语言音频标签直接写进文本,在句中切换语气和语速,再将同样的参数导出为Gemini API代码,以便在不同项目中保持一致音色。
Google DeepMind 发布 Gemini Robotics-ER 1.6,将其作为机器人的高层推理模型,强化空间与物理推理、多视角理解及任务成功检测,并新增仪表读数。
推荐理由:新版相对 Gemini Robotics-ER 1.5 与 Gemini 3.0 Flash 强化了空间指向、物体计数、多视角成功检测以及仪表读数能力,开发者现可在 Gemini API 与 Google AI Studio 中直接配置调用。
Google DeepMind 发布开源模型家族 Gemma 4,包含 E2B、E4B、26B MoE 与 31B Dense,权重以 Apache 2.0 许可提供。
推荐理由:官方一次放出四档开源权重并采用 Apache 2.0,读者可按硬件与端侧条件对照本地推理和智能体能力。
Google DeepMind 正探索由 Gemini 驱动的 AI 鼠标指针,让系统理解用户所指内容及其重要性,从而在现有工具中直接协作。他们提出保持流程、看图说明、用简短指代配合语音,以及把像素变成可操作实体四项原则。
推荐理由:文中提出四条交互原则,说明指针如何在当前工具里理解所指内容,把详细提示和跨窗口搬运换成指向与口语。
Google Research 公布 Vibe Coding XR,借助 Gemini 的长上下文推理与 XR Blocks,在不到 60 秒内把自然语言转成具备物理感知的 Android XR 应用。
Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持 9 种语言,API 价格为每 1k 字符 $0.016。母语者评测显示其自然度优于 TTFA 相近的 ElevenLabs Flash v2.5 且情感引导与 v3 持平,10 秒、500 字符输入的模型延迟为 70ms,实时率约 9.7 倍。
推荐理由:母语者对照显示 Voxtral TTS 自然度高于 TTFA 相近的 ElevenLabs Flash v2.5,情感引导与 v3 持平。
Google Research 与多家 NHS 机构合作开展 AIMS 研究,并在 Nature Cancer 发表两项配套论文,评估 AI 乳腺癌检测系统的独立性能及其作为第二阅片人的流程效果。
推荐理由:用同一随访窗口比较AI独立检测和作为第二阅片人的流程,可以看到检出与人工阅片负担的变化,以及仲裁推翻正确召回的风险。
Mistral 发布 Mistral Small 4,把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码整合进同一模型,并以 Apache 2.0 许可开源。
推荐理由:公告把推理、多模态和智能体编码收进同一开源模型,并给出相对 Mistral Small 3 的完成时间与每秒请求数变化。
Mistral 发布面向 Lean 4 的开源代码智能体 Leanstral(Leanstral-120B-A6B,激活参数 6B),权重采用 Apache 2.0。
Google Research 宣布在 Flood Hub 推出城市山洪预报,最多可提前 24 小时判断某一城区是否可能发生山洪。
推荐理由:城市山洪预报补上了以河道洪水为主的覆盖缺口,南美和东南亚的精度与召回已接近通常拥有本地监测的最富裕国家。
Google Research 推出 Groundsource,用 Gemini 将非结构化新闻转为可核验的历史数据,并开放包含 260 万条、覆盖 150 多个国家、时间从 2000 年至今的城市山洪数据集。
Google Research 与 BIDMC 完成一项前瞻性单中心可行性研究,由 AMIE 在非急诊基层门诊就诊前,经医师实时监督以文本对话采集病史。
推荐理由:这项真实门诊研究以盲评比较受监督的 AMIE 诊前问诊和主诊医生,显示鉴别诊断质量接近而管理方案实用性与成本效益由医生更好。
Mistral 基于开源编码助手 Vibe 构建了可在 CI/CD 中无人干预运行的智能体,用于读取 Rails 源文件并生成或改进 RSpec 测试。面向 275 个源文件的实验中,测试通过率与 SimpleCov 平均行覆盖率均为 100%,已有测试文件的 LLM-as-a-judge 分数从 0.49 升至 0.74,自校正后 RuboCop 违规为 0。
Google Research 发布开放语音数据集 WAXAL,首批覆盖撒哈拉以南非洲 27 种语言、逾 1 亿说话者。数据集约有 1846 小时转写自然语音用于 ASR,逾 565 小时高保真录音用于 TTS,采用 CC-BY-4.0 许可。采集由 Makerere University、University of Ghana 等非洲学术和社区机构主导,并计划持续扩充语言。
Mistral 发布 Voxtral Transcribe 2,提供批量与实时两款语音转写模型。Voxtral Realtime 采用流式架构,延迟可配置至 sub-200ms,480ms 延迟时词错误率维持在 1-2%,约 4B 参数,以 Apache 2.0 在 Hugging Face 开放权重,API 为 $0.006/min。
推荐理由:官方把实时转写的开放权重、可配置延迟和批量转写的价格与说话人分离放在同一发布里,方便按延迟和成本比较接入方式。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,现已在 Le Chat Pro 和 Team 套餐中提供。
推荐理由:Vibe 2.0把子智能体、澄清选项和斜杠技能放进终端编码流程,并给出Devstral 2的API单价,便于对照现有开发方式评估是否接入。
Mistral 在 vLLM 的 Prefill/Decode 分离式服务中定位到堆外内存泄漏,根源是 NIXL 所依赖的 UCX 默认拦截 mmap,并在 munmap 后把内存放入延迟清理队列。
NeurIPS 2025 论文提出用互信息直接评估并优化成像系统,仅依赖含噪测量与噪声模型。该指标在彩色摄影、射电天文、无透镜成像和显微四个领域均能预测下游解码表现。据此优化的设计可匹配端到端 SOTA 方法,同时更省内存与算力,且无需任务专用解码器。
Mistral AI 发布 Mistral OCR 3(mistral-ocr-2512),在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并优于企业文档处理方案与 AI 原生 OCR 方案。
Mistral 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),并推出由 Devstral 驱动的开源命令行助手 Mistral Vibe CLI。
推荐理由:官方同时发布两档开源编码模型与命令行智能体,读者可以按参数量、基准得分和后续接口价格比较本地部署与闭源方案的取舍。
Mistral AI 发布开源模型家族 Mistral 3,含 14B、8B、3B 的 Ministral 3,以及激活 41B、总参数 675B 的稀疏 MoE 模型 Mistral Large 3。
推荐理由:官方这次把稀疏大模型与三档端侧小模型一起开源,读者可以对照参数规模、许可证和推理变体来选择部署方式。
Mistral AI 宣布与德国企业和机构建立长期战略承诺,并与 SAP 开展多年合作,交付面向德国和欧洲的完全主权 AI 技术栈。双方将把 Mistral 模型接入 SAP 的 AI Foundation,共同开发面向欧洲复杂行业和行政机构的行业方案。
Mistral AI 宣布完成 1.7B€ 的 Series C 融资,投后估值为 11.7B€,由半导体制造设备商 ASML 领投。现有投资方 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参与本轮。
推荐理由:本轮由设备商 ASML 领投并达成战略合作,融资被明确用于前沿研究与工业级定制方案,同时公司重申保持独立。