跳到正文

#多模态

今日 1 条
今天9月29日周二
9月25日周五
  1. MIT Technology Review · AI53

    五角大楼拟五年投入3030万美元建设人工智能测谎项目Polygraph+

    美国国防部拟在未来五年投入3030万美元建设Polygraph+(Polygraph Next),用人工智能和机器学习改进测谎评分,并发展无需接触受试者的生理测量。项目由DCSA运行,计划用于准员工审查和内部威胁检测,相关预算尚未获国会批准。受访学者认为说谎没有稳定统一的生理标志,人工智能即使发现新模式,也难以确认这些反应是否真正对应说谎。

  2. Google Research50

    Google Research 介绍自动生成连贯长视频的 AI 协同导演框架

    Google Research 介绍基于 Gemini 与 Veo 的 AI 视频协同导演,用多智能体编排规划多镜头长视频的视觉连续性。该套件包括将于 COLM 2026 发表的 Co-Director、将于 EMNLP 2026 发表的 CANVAS,以及 A²RD 与 VQQA,分别处理创意配置、持久视觉记忆、分段生成和提示词闭环修正,并继承 SynthID 水印。

  3. Google DeepMind60

    Gemini 3.8 Live 推出 Live Avatar,为企业对话加入近实时视频形象

    Gemini 3.8 Live 即日起在 Gemini Enterprise 提供 Live Avatar,把近实时视频生成与语音结合,为对话带来可听、可看、可说的动态视觉形象。

    推荐理由:Live Avatar 把近实时视频形象接到 Gemini 3.8 Live 语音对话中,使企业能在不中断交流的情况下后台调用工具并跨 97 种语言同步口型与表情。

9月24日周四
  1. Ars Technica · AI30

    Meta把AI助手放到钥匙扣上

    Meta把AI助手放到钥匙扣上。周三,Zuckerberg发布无摄像头、仅音频交互的Ray-Ban,以及明年春季上市、售价1300美元、比上一代Quest 3轻五倍的虚拟现实眼镜。Muse助手即将登陆眼镜,佩戴者可借全息技术以超写实数字分身参加视频通话。

9月23日周三
9月16日周三
8月13日周四
  1. Microsoft Research44

    MindTopo 揭示 VLMs 的空间推理能力

    MindTopo 基准显示,多模态模型识别静态拓扑关系的表现明显强于交互规划,且两者都远低于人类。它按连续性、分离、顺序、包围和结五类,分别测试推理与规划;规划错误常出现在理解场景之后,模型会丢失结构关系或提出违反环境动态的动作。图像生成只在关系可见于单帧时偶尔有帮助,视频推演则经常改变拓扑或违反任务动态。