跳到正文

全部动态

今日 19 条
5月20日周三
5月19日周二
5月18日周一
  1. Google DeepMind79

    Google DeepMind 推出 Gemini Omni Flash,可用多模态输入生成并对话编辑视频

    Google DeepMind 推出 Gemini Omni 家族的首个模型 Gemini Omni Flash,可将图像、音频、视频和文本作为输入生成视频,并用自然语言多轮编辑且保持角色、物理和场景连贯。

    推荐理由:官方同时给出对话式编辑、物理与世界知识约束以及SynthID核验路径,读者可以据此判断这款视频模型会怎样进入现有创作流程。

5月17日周日
5月16日周六
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.5 并开放 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族,并开放 Gemini 3.5 Flash,使其成为全球 Gemini 应用和 Google 搜索 AI Mode 的默认模型,同时进入 Google Antigravity、Gemini API 及企业平台。

    推荐理由:3.5 Flash已同时向用户、开发者和企业开放,智能体与编码基准超过Gemini 3.1 Pro,可比较其速度和落地范围。

5月12日周二
  1. Google DeepMind64

    Google DeepMind 在 Nature 发表 Co-Scientist 多智能体科研系统

    Google DeepMind 在 Nature 发表 Co-Scientist,用 Gemini 多智能体迭代生成、辩论并演化科学假设。在肝纤维化合作中,系统标出的一种药物重定位候选在实验室测试里阻断了 91% 与瘢痕相关的反应。个人研究者可在 labs.google/science 登记兴趣,Hypothesis Generation 实验工具将于未来数周开始推出。

    推荐理由:文中把多智能体假设生成拆成提出、辩论与演化三阶段,并说明它如何在肝纤维化等课题里帮助研究者收敛可检验方向。

5月6日周三
  1. Google DeepMind63

    AlphaEvolve 如何以 Gemini 驱动的编码智能体扩大跨领域影响

    AlphaEvolve 团队分享了这一 Gemini 驱动编码智能体至今最显著的跨领域影响,应用已从数学和计算机科学扩展到健康、可持续、量子计算、AI 基础设施与商业优化。

    推荐理由:把测序纠错、电网求解、量子电路和企业路由等结果放在一起,可以看出这个编码智能体已从算法发现延伸到基础设施与商业优化。

5月4日周一
4月30日周四
  1. Google DeepMind56

    Google DeepMind 宣布 AI co-clinician 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者的 triadic care。在盲测中,医生更偏好 AI co-clinician 而非领先的证据综合工具;98 项基层医疗问询里有 97 例没有关键错误,开放式 OpenFDA RxQA 用药问答也优于其他前沿模型。

4月27日周一
4月23日周四
  1. Google Research65

    Google Photos 的 Auto frame 支持拍后重设照片视角

    Google Photos 的 Auto frame 现已加入拍后重设视角能力,用机器学习理解场景与空间布局,再用生成式 AI 从新机位生成照片。方法先估计三维点图、可见表面和原相机焦距,重点减少人体与面部重建伪影,再渲染调整后的相机位姿和焦距;新露出的区域由潜空间扩散模型补全,并以分类器引导和区域缩放保留原内容。

    推荐理由:Google Photos 的 Auto frame 会把已拍照片当作三维场景并自动调整机位,同时补全新视角里原先不可见的内容从而改善人像与广角构图。

4月20日周一
  1. Berkeley AI Research40

    GRASP:面向更长时域世界模型的梯度规划

    GRASP 是面向学习得到的动力学(世界模型)的新型梯度规划器,靠三项设计让长时域规划变得可行。它将轨迹提升到虚拟状态,使优化可沿时间并行;把随机性直接加进状态迭代用于探索;并重塑梯度,让动作获得干净信号,同时避开高维视觉模型中脆弱的 state-input 梯度。

4月16日周四
  1. Google DeepMind63

    Google DeepMind 发布 Gemini 3.1 Flash TTS,可用音频标签控制语音表达

    Google DeepMind发布Gemini 3.1 Flash TTS,用可嵌入文本的音频标签控制风格、语速与表达。该模型即日起向开发者通过Gemini API和Google AI Studio预览,企业通过Vertex AI预览,Workspace用户可通过Google Vids使用。

    推荐理由:开发者可以把自然语言音频标签直接写进文本,在句中切换语气和语速,再将同样的参数导出为Gemini API代码,以便在不同项目中保持一致音色。

4月13日周一
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics-ER 1.6,强化具身推理与仪表读数

    Google DeepMind 发布 Gemini Robotics-ER 1.6,将其作为机器人的高层推理模型,强化空间与物理推理、多视角理解及任务成功检测,并新增仪表读数。

    推荐理由:新版相对 Gemini Robotics-ER 1.5 与 Gemini 3.0 Flash 强化了空间指向、物体计数、多视角成功检测以及仪表读数能力,开发者现可在 Gemini API 与 Google AI Studio 中直接配置调用。

4月3日周五
3月29日周日
  1. Google DeepMind60

    Google DeepMind 重新构想由 Gemini 驱动的 AI 鼠标指针

    Google DeepMind 正探索由 Gemini 驱动的 AI 鼠标指针,让系统理解用户所指内容及其重要性,从而在现有工具中直接协作。他们提出保持流程、看图说明、用简短指代配合语音,以及把像素变成可操作实体四项原则。

    推荐理由:文中提出四条交互原则,说明指针如何在当前工具里理解所指内容,把详细提示和跨窗口搬运换成指向与口语。

3月25日周三
3月24日周二
  1. Mistral AI66

    Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS

    Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持 9 种语言,API 价格为每 1k 字符 $0.016。母语者评测显示其自然度优于 TTFA 相近的 ElevenLabs Flash v2.5 且情感引导与 v3 持平,10 秒、500 字符输入的模型延迟为 70ms,实时率约 9.7 倍。

    推荐理由:母语者对照显示 Voxtral TTS 自然度高于 TTFA 相近的 ElevenLabs Flash v2.5,情感引导与 v3 持平。

3月18日周三
  1. Google Research68

    Google Research 两项研究评估 AI 改进英国乳腺癌筛查流程

    Google Research 与多家 NHS 机构合作开展 AIMS 研究,并在 Nature Cancer 发表两项配套论文,评估 AI 乳腺癌检测系统的独立性能及其作为第二阅片人的流程效果。

    推荐理由:用同一随访窗口比较AI独立检测和作为第二阅片人的流程,可以看到检出与人工阅片负担的变化,以及仲裁推翻正确召回的风险。

3月17日周二
3月12日周四
  1. Google Research60

    Google Research 探讨 AMIE 对话式诊断在真实临床研究中的可行性

    Google Research 与 BIDMC 完成一项前瞻性单中心可行性研究,由 AMIE 在非急诊基层门诊就诊前,经医师实时监督以文本对话采集病史。

    推荐理由:这项真实门诊研究以盲评比较受监督的 AMIE 诊前问诊和主诊医生,显示鉴别诊断质量接近而管理方案实用性与成本效益由医生更好。

3月11日周三
3月7日周六
2月5日周四
  1. Mistral AI66

    Mistral 发布 Voxtral Transcribe 2 批量与实时语音转写模型

    Mistral 发布 Voxtral Transcribe 2,提供批量与实时两款语音转写模型。Voxtral Realtime 采用流式架构,延迟可配置至 sub-200ms,480ms 延迟时词错误率维持在 1-2%,约 4B 参数,以 Apache 2.0 在 Hugging Face 开放权重,API 为 $0.006/min。

    推荐理由:官方把实时转写的开放权重、可配置延迟和批量转写的价格与说话人分离放在同一发布里,方便按延迟和成本比较接入方式。

1月28日周三
1月22日周四
1月10日周六
  1. Berkeley AI Research38

    成像系统的信息驱动设计

    NeurIPS 2025 论文提出用互信息直接评估并优化成像系统,仅依赖含噪测量与噪声模型。该指标在彩色摄影、射电天文、无透镜成像和显微四个领域均能预测下游解码表现。据此优化的设计可匹配端到端 SOTA 方法,同时更省内存与算力,且无需任务专用解码器。

12月17日周三
12月9日周二
  1. Mistral AI76

    Mistral 发布 Devstral 2、Devstral Small 2 与 Vibe CLI

    Mistral 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),并推出由 Devstral 驱动的开源命令行助手 Mistral Vibe CLI。

    推荐理由:官方同时发布两档开源编码模型与命令行智能体,读者可以按参数量、基准得分和后续接口价格比较本地部署与闭源方案的取舍。

12月3日周三
11月19日周三
9月9日周二
  1. Mistral AI66

    Mistral AI 完成 1.7B€ Series C 融资,投后估值 11.7B€

    Mistral AI 宣布完成 1.7B€ 的 Series C 融资,投后估值为 11.7B€,由半导体制造设备商 ASML 领投。现有投资方 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参与本轮。

    推荐理由:本轮由设备商 ASML 领投并达成战略合作,融资被明确用于前沿研究与工业级定制方案,同时公司重申保持独立。