跳到正文

全部动态

今日 0 条
5月6日周三
  1. Google DeepMind63

    AlphaEvolve 如何以 Gemini 驱动的编码智能体扩大跨领域影响

    AlphaEvolve 团队分享了这一 Gemini 驱动编码智能体至今最显著的跨领域影响,应用已从数学和计算机科学扩展到健康、可持续、量子计算、AI 基础设施与商业优化。

    推荐理由:把测序纠错、电网求解、量子电路和企业路由等结果放在一起,可以看出这个编码智能体已从算法发现延伸到基础设施与商业优化。

4月30日周四
  1. Google DeepMind56

    Google DeepMind 宣布 AI co-clinician 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者的 triadic care。在盲测中,医生更偏好 AI co-clinician 而非领先的证据综合工具;98 项基层医疗问询里有 97 例没有关键错误,开放式 OpenFDA RxQA 用药问答也优于其他前沿模型。

4月27日周一
4月23日周四
  1. Google Research65

    Google Photos 的 Auto frame 支持拍后重设照片视角

    Google Photos 的 Auto frame 现已加入拍后重设视角能力,用机器学习理解场景与空间布局,再用生成式 AI 从新机位生成照片。方法先估计三维点图、可见表面和原相机焦距,重点减少人体与面部重建伪影,再渲染调整后的相机位姿和焦距;新露出的区域由潜空间扩散模型补全,并以分类器引导和区域缩放保留原内容。

    推荐理由:Google Photos 的 Auto frame 会把已拍照片当作三维场景并自动调整机位,同时补全新视角里原先不可见的内容从而改善人像与广角构图。

4月20日周一
  1. Berkeley AI Research40

    GRASP:面向更长时域世界模型的梯度规划

    GRASP 是面向学习得到的动力学(世界模型)的新型梯度规划器,靠三项设计让长时域规划变得可行。它将轨迹提升到虚拟状态,使优化可沿时间并行;把随机性直接加进状态迭代用于探索;并重塑梯度,让动作获得干净信号,同时避开高维视觉模型中脆弱的 state-input 梯度。

4月16日周四
  1. Google DeepMind63

    Google DeepMind 发布 Gemini 3.1 Flash TTS,可用音频标签控制语音表达

    Google DeepMind发布Gemini 3.1 Flash TTS,用可嵌入文本的音频标签控制风格、语速与表达。该模型即日起向开发者通过Gemini API和Google AI Studio预览,企业通过Vertex AI预览,Workspace用户可通过Google Vids使用。

    推荐理由:开发者可以把自然语言音频标签直接写进文本,在句中切换语气和语速,再将同样的参数导出为Gemini API代码,以便在不同项目中保持一致音色。

4月13日周一
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics-ER 1.6,强化具身推理与仪表读数

    Google DeepMind 发布 Gemini Robotics-ER 1.6,将其作为机器人的高层推理模型,强化空间与物理推理、多视角理解及任务成功检测,并新增仪表读数。

    推荐理由:新版相对 Gemini Robotics-ER 1.5 与 Gemini 3.0 Flash 强化了空间指向、物体计数、多视角成功检测以及仪表读数能力,开发者现可在 Gemini API 与 Google AI Studio 中直接配置调用。

4月3日周五
3月29日周日
  1. Google DeepMind60

    Google DeepMind 重新构想由 Gemini 驱动的 AI 鼠标指针

    Google DeepMind 正探索由 Gemini 驱动的 AI 鼠标指针,让系统理解用户所指内容及其重要性,从而在现有工具中直接协作。他们提出保持流程、看图说明、用简短指代配合语音,以及把像素变成可操作实体四项原则。

    推荐理由:文中提出四条交互原则,说明指针如何在当前工具里理解所指内容,把详细提示和跨窗口搬运换成指向与口语。

3月25日周三
3月24日周二
  1. Mistral AI66

    Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS

    Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持 9 种语言,API 价格为每 1k 字符 $0.016。母语者评测显示其自然度优于 TTFA 相近的 ElevenLabs Flash v2.5 且情感引导与 v3 持平,10 秒、500 字符输入的模型延迟为 70ms,实时率约 9.7 倍。

    推荐理由:母语者对照显示 Voxtral TTS 自然度高于 TTFA 相近的 ElevenLabs Flash v2.5,情感引导与 v3 持平。

3月18日周三
  1. Google Research68

    Google Research 两项研究评估 AI 改进英国乳腺癌筛查流程

    Google Research 与多家 NHS 机构合作开展 AIMS 研究,并在 Nature Cancer 发表两项配套论文,评估 AI 乳腺癌检测系统的独立性能及其作为第二阅片人的流程效果。

    推荐理由:用同一随访窗口比较AI独立检测和作为第二阅片人的流程,可以看到检出与人工阅片负担的变化,以及仲裁推翻正确召回的风险。

3月17日周二
3月12日周四
  1. Google Research60

    Google Research 探讨 AMIE 对话式诊断在真实临床研究中的可行性

    Google Research 与 BIDMC 完成一项前瞻性单中心可行性研究,由 AMIE 在非急诊基层门诊就诊前,经医师实时监督以文本对话采集病史。

    推荐理由:这项真实门诊研究以盲评比较受监督的 AMIE 诊前问诊和主诊医生,显示鉴别诊断质量接近而管理方案实用性与成本效益由医生更好。

3月11日周三
3月7日周六
2月5日周四
  1. Mistral AI66

    Mistral 发布 Voxtral Transcribe 2 批量与实时语音转写模型

    Mistral 发布 Voxtral Transcribe 2,提供批量与实时两款语音转写模型。Voxtral Realtime 采用流式架构,延迟可配置至 sub-200ms,480ms 延迟时词错误率维持在 1-2%,约 4B 参数,以 Apache 2.0 在 Hugging Face 开放权重,API 为 $0.006/min。

    推荐理由:官方把实时转写的开放权重、可配置延迟和批量转写的价格与说话人分离放在同一发布里,方便按延迟和成本比较接入方式。

1月28日周三
1月22日周四
1月10日周六
  1. Berkeley AI Research38

    成像系统的信息驱动设计

    NeurIPS 2025 论文提出用互信息直接评估并优化成像系统,仅依赖含噪测量与噪声模型。该指标在彩色摄影、射电天文、无透镜成像和显微四个领域均能预测下游解码表现。据此优化的设计可匹配端到端 SOTA 方法,同时更省内存与算力,且无需任务专用解码器。

12月9日周二
  1. Mistral AI76

    Mistral 发布 Devstral 2、Devstral Small 2 与 Vibe CLI

    Mistral 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),并推出由 Devstral 驱动的开源命令行助手 Mistral Vibe CLI。

    推荐理由:官方同时发布两档开源编码模型与命令行智能体,读者可以按参数量、基准得分和后续接口价格比较本地部署与闭源方案的取舍。

12月3日周三
11月19日周三
9月9日周二
  1. Mistral AI66

    Mistral AI 完成 1.7B€ Series C 融资,投后估值 11.7B€

    Mistral AI 宣布完成 1.7B€ 的 Series C 融资,投后估值为 11.7B€,由半导体制造设备商 ASML 领投。现有投资方 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参与本轮。

    推荐理由:本轮由设备商 ASML 领投并达成战略合作,融资被明确用于前沿研究与工业级定制方案,同时公司重申保持独立。

9月2日周二
  1. Mistral AI51

    Mistral 为 Le Chat 推出 Memories 测试版

    Le Chat 推出 Memories(beta),会自动保存有用信息,并在召回时展示所用记忆、来源和相关性。用户可随时关闭记忆、开启不使用记忆的隐身聊天、编辑或删除单条记录,也能导出或从其他地方导入。官方同时推出可编辑的 Memory Insights,基于用户自己的数据提示趋势、摘要和值得回看的内容;底层采用图结构,后续还将支持分类、即时遗忘和更清晰的使用记录。

  2. Mistral AI62

    Mistral 为 Le Chat 发布 20+ 个 MCP 连接器与 Memories

    Mistral 为 Le Chat 发布 20+ 个基于 MCP 的安全连接器(beta)和 Memories(beta),免费方案即可在 chat.mistral.ai 或移动应用使用,无需信用卡。

    推荐理由:Le Chat 把 20+ 个企业连接器、自建 MCP 和可编辑的 Memories 放进免费方案,读者可以据此判断业务工具与跨对话上下文能否进入同一助手。

7月23日周三
7月17日周四
7月15日周二
7月11日周五
  1. Mistral AI69

    Mistral 发布 Devstral Medium 并升级 Devstral Small 1.1

    Mistral AI 联合 All Hands AI 发布 Devstral Medium,并将 Devstral Small 升级为 Apache 2.0 开源的 1.1。

    推荐理由:合作推出的开源模型 Devstral Small 1.1 在 SWE-Bench Verified 得到 53.6% 且每百万输入 token 价格为 $0.1,性能更高的 Devstral Medium 则以 61.6% 得分和 $0.4 的同等计价提供 API 与私有部署选择。

6月11日周三
6月10日周二
  1. Mistral AI71

    Mistral AI 发布首个推理模型 Magistral

    Mistral AI 发布首个推理模型 Magistral,分为 24B 开源版 Magistral Small 和企业版 Magistral Medium。

    推荐理由:官方在这次双版本发布里同时给出AIME2024成绩和Le Chat最高可达10倍的生成速度,便于判断透明多语言推理能否进入法律金融等专业流程。

5月28日周三
  1. Mistral AI60

    Mistral 发布代码嵌入模型 Codestral Embed

    Mistral 发布其首个代码专用嵌入模型 Codestral Embed,称其在真实代码数据检索上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大嵌入模型。

    推荐理由:这篇模型发布把 Codestral Embed 的检索质量、输出维度和精度选择放在一起说明,便于对照 Voyage Code 3、Cohere Embed v4.0 与 OpenAI 大嵌入模型看存储成本取舍。

5月27日周二
  1. Mistral AI62

    用 Mistral Agents API 构建 AI 智能体

    Mistral 公布 Agents API,让开发者结合代码执行、网页搜索、图像生成、文档库和 MCP 工具,以及持久记忆与智能体编排,构建能执行动作并保持上下文的 AI 智能体。

    推荐理由:官方把代码执行、网页搜索、图像生成和文档库接到有状态对话与智能体交接上,读者可以据此比较它和普通对话接口的实际分工。

5月21日周三
5月7日周三
  1. Mistral AI68

    Mistral AI 发布 Mistral Medium 3,强调更低成本与企业部署

    Mistral AI 发布 Mistral Medium 3,主打 SOTA 性能、8X 更低成本和更简单的部署,并称其在各项基准上达到 Claude Sonnet 3.7 至少 90% 的表现,API 价格为输入 $0.4、输出 $2 per M token。

    推荐理由:读者可据此对照 Mistral Medium 3 相对 Claude Sonnet 3.7 至少九成的基准表现、每百万 token 输入与输出价格,以及四张 GPU 起即可自托管的企业部署条件。