跳到正文

#多模态

今日 0 条
9月25日周五
  1. Google Research50

    Google Research 介绍自动生成连贯长视频的 AI 协同导演框架

    Google Research 介绍基于 Gemini 与 Veo 的 AI 视频协同导演,用多智能体编排规划多镜头长视频的视觉连续性。该套件包括将于 COLM 2026 发表的 Co-Director、将于 EMNLP 2026 发表的 CANVAS,以及 A²RD 与 VQQA,分别处理创意配置、持久视觉记忆、分段生成和提示词闭环修正,并继承 SynthID 水印。

  2. Google DeepMind60

    Gemini 3.8 Live 推出 Live Avatar,为企业对话加入近实时视频形象

    Gemini 3.8 Live 即日起在 Gemini Enterprise 提供 Live Avatar,把近实时视频生成与语音结合,为对话带来可听、可看、可说的动态视觉形象。

    推荐理由:Live Avatar 把近实时视频形象接到 Gemini 3.8 Live 语音对话中,使企业能在不中断交流的情况下后台调用工具并跨 97 种语言同步口型与表情。

9月24日周四
9月23日周三
9月16日周三
9月15日周二
  1. NVIDIA Blog52

    费城儿童医院如何用开源 NVIDIA AI 开展小儿心脏诊疗

    费城儿童医院基于 NVIDIA 联合创立的开源框架 MONAI,把患儿已有的 CT、MRI 和三维超声在数秒内生成解剖精确的心脏模型,用于先天性心脏病诊疗。原先需熟练研究人员约四小时的流程已快到可作常规临床使用;美国已有 20 多家儿童医院开展心脏建模,波士顿儿童医院每年约 500 例心脏手术中过半借助建模,CHOP 预计今年建模约 200 例。

9月10日周四
  1. Hugging Face Blog57

    用 Gradio Workflow 将 AUTOMATIC1111 重建为 Workflow1111

    Workflow1111 把 AUTOMATIC1111 的大部分功能重做成一张 Gradio 工作流画布,包含十一条媒体管线和七十三个节点。登录 Hugging Face 账号或提供访问令牌后,可运行文生图、高分辨率修复、图生图、提示词矩阵、VLM 反推、检测生成遮罩、标注、去背景、PNG Info 和图像转视频,模型调用使用用户自己的额度。

9月3日周四
9月2日周三
  1. Google DeepMind69

    Gemini 3.7 Flash 等模型上线智能体式视频理解

    Google DeepMind 今天在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上线智能体式视频理解,视频分析的 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。

    推荐理由:智能体模式让模型按目标选择画面、音频或文字稿并只读取所需片段,长视频分析不必再整段按固定帧率消耗大量 token。

8月28日周五
  1. Google DeepMind63

    Google DeepMind 推出 Gemini Omni 1.1 Flash,强化生成视频控制

    Gemini Omni 1.1 Flash 现已推出,开发者可通过 Gemini API 做场景延续、首尾帧插值和最高 4K 放大。场景延续能分析最多 10 秒前文,而不只参考最后 1 秒,并按 10 秒一段把视频延到累计 40 秒;360p 预览成本为标准 720p 的三分之一,生成最高快 60%,成片可输出 1080p 或 4K。

    推荐理由:开发者现在可以用最多10秒前文把已有视频按10秒一段延续到累计40秒,再以360p三分之一的成本和最高快60%的速度试稿后放大到4K。

8月25日周二
8月18日周二
  1. Hugging Face Blog70

    Sentence Transformers v6.0 如何使用多向量晚交互嵌入

    Sentence Transformers v6.0 新增 MultiVectorEncoder,以 ColBERT 式晚交互为每个 token 保留向量,并用 MaxSim 为查询与文档打分。

    推荐理由:这篇官方教程把多向量晚交互和单向量嵌入的质量与索引成本放在一起比较,并写清编码、打分、检索重排和压缩索引的具体做法。

8月13日周四
  1. Microsoft Research44

    MindTopo 揭示 VLMs 的空间推理能力

    MindTopo 基准显示,多模态模型识别静态拓扑关系的表现明显强于交互规划,且两者都远低于人类。它按连续性、分离、顺序、包围和结五类,分别测试推理与规划;规划错误常出现在理解场景之后,模型会丢失结构关系或提出违反环境动态的动作。图像生成只在关系可见于单帧时偶尔有帮助,视频推演则经常改变拓扑或违反任务动态。

8月12日周三
  1. Google Research67

    Google Research 推进 AMIE 实时视频问诊,模拟研究中与全科医生评分相当

    Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。

    推荐理由:随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。

8月4日周二
  1. Mistral AI54

    Mistral 发布 3B 开源多模态安全分类器 Shieldstral

    Mistral 以 Apache 2.0 发布 3B 开源权重多模态安全分类器 Shieldstral,把内容审核做成推理时可用自然语言政策作答的二分类问答。请求包含评估说明、是否类问题和待审内容,模型只读取 yes 与 no 的 logits,经 softmax 得到连续安全分数,同一接口覆盖提示、回复、提示与回复组合以及图像。

7月30日周四
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics ER 2,强化视频理解、任务编排与多机器人协作

    Google DeepMind 今天发布 Gemini Robotics ER 2,将其作为机器人的高层具身推理模型,用于对话、理解物理世界和多步规划,再把运动执行交给下层视觉语言动作模型。

    推荐理由:新模型相对 ER 1.6 补上了连续视频中的进度判断与多机协作能力,开发者可把它接到下层动作模型来编排多步实体任务。

7月28日周二
  1. Google DeepMind69

    Gemini Robotics 2 为机器人带来全身控制、灵巧操作与多机协作

    Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。

    推荐理由:这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。

7月21日周二
7月9日周四
7月8日周三
7月1日周三
6月13日周六