跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

3条精选相关主题多模态AI 视频产品更新

最新精选

第 1–3 条 · 共 3 条
9月25日周五
  1. Google DeepMind60

    Gemini 3.8 Live 推出 Live Avatar,为企业对话加入近实时视频形象

    Gemini 3.8 Live 即日起在 Gemini Enterprise 提供 Live Avatar,把近实时视频生成与语音结合,为对话带来可听、可看、可说的动态视觉形象。

    推荐理由:Live Avatar 把近实时视频形象接到 Gemini 3.8 Live 语音对话中,使企业能在不中断交流的情况下后台调用工具并跨 97 种语言同步口型与表情。

9月23日周三
  1. Google DeepMind71

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,前者侧重用自然语言从零设计角色声线,后者面向高用量、低成本的配音与语音代理。

    推荐理由:Gemini 3.8 的两款新语音模型可用自然语言设计角色声线,并公开基准名次与各端入口,方便对照现有配音和语音代理流程。

9月16日周三