Modulate 融资 $25M,用于语音模型与分析套件
波士顿语音智能初创公司 Modulate 新融资 $25M,用于其语音模型与分析套件。PitchBook 数据显示,本轮之前公司已融资 $41M,估值 $170M。平台运行超过 100 个小模型,提供转写、情绪分析、deepfake 与 AI 音乐检测,以及受监管行业语音智能体的政策执行。
波士顿语音智能初创公司 Modulate 新融资 $25M,用于其语音模型与分析套件。PitchBook 数据显示,本轮之前公司已融资 $41M,估值 $170M。平台运行超过 100 个小模型,提供转写、情绪分析、deepfake 与 AI 音乐检测,以及受监管行业语音智能体的政策执行。
深度伪造语音约两年前骗过祖父后,Padmanabhuni 创办 DetectifAI,要在手机里即时识别 AI 生成语音。FBI 称美国人去年因 AI 诈骗损失接近 $900 million,较 2024 年上升 24%。公司首先向手机制造商授权 SDK,对通话和语音消息做设备内检测,音频不离开设备。
可从 Amazon SageMaker JumpStart 将公开的 Qwen3-TTS-12Hz-1.7B-Base 部署到全托管实时推理端点,用短参考录音及其转写克隆说话人声音来合成新文本,无需重新训练。
Gemini 3.8 Live 即日起在 Gemini Enterprise 提供 Live Avatar,把近实时视频生成与语音结合,为对话带来可听、可看、可说的动态视觉形象。
推荐理由:Live Avatar 把近实时视频形象接到 Gemini 3.8 Live 语音对话中,使企业能在不中断交流的情况下后台调用工具并跨 97 种语言同步口型与表情。
Meta 在 Connect 2026 以个人智能体 Muse 为中心发布新眼镜,并上线语音与实时视频,前沿模型仅作预告、尚未发布。Muse 即将通过唤醒词登陆全部 Meta 眼镜;每位 Muse 拥有专属邮箱,Mac 版已能进行电脑操作,连接器平台包含 1,500+ 应用。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,前者侧重用自然语言从零设计角色声线,后者面向高用量、低成本的配音与语音代理。
推荐理由:Gemini 3.8 的两款新语音模型可用自然语言设计角色声线,并公开基准名次与各端入口,方便对照现有配音和语音代理流程。
Google DeepMind发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,把近实时推理用于语音智能体。
推荐理由:原文给出了Extended Thinking的语音基准分数,以及两款模型面向开发者、企业和普通用户的不同开放范围。
Mistral 与 HUMAIN 宣布战略合作,在沙特及中东推进主权 AI。合作覆盖 AI 基础设施、先进模型开发与解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心,双方还计划面向沙特受监管行业制定联合市场策略。