Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS
Speaking of Voxtral
Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持 9 种语言,API 价格为每 1k 字符 $0.016。母语者评测显示其自然度优于 TTFA 相近的 ElevenLabs Flash v2.5 且情感引导与 v3 持平,10 秒、500 字符输入的模型延迟为 70ms,实时率约 9.7 倍。
母语者对照显示 Voxtral TTS 自然度高于 TTFA 相近的 ElevenLabs Flash v2.5,情感引导与 v3 持平。
思考
摘要
Mistral AI 已推出 Voxtral TTS,这是一款 4B 参数的文本转语音模型,可提供业界领先的多语言语音生成,支持 9 种语言中逼真且富有情感表现力的语音,并具备低延迟和便捷的声音适配。该模型在上下文理解、说话人建模和零样本跨语言声音适配方面表现卓越,非常适合企业语音工作流和可扩展的 AI 智能体。可通过 API 和 Mistral Studio 使用,以每 1k 个字符 $0.016 起的价格提供高性价比、高质量的语音生成。
今天,我们发布 Voxtral TTS,这是我们首个在多语言语音生成方面达到业界领先性能的文本转语音模型。该模型轻量,参数量为 4B,使由 Voxtral 驱动的智能体在规模化应用中自然、可靠且具有成本效益。
亮点。
支持 9 种常用语言及多种方言的逼真、富有情感表现力的语音。
首次音频输出的延迟极低。
可轻松适配新的声音。
可在 Mistral Studio 中试用。
企业级文本转语音,为关键语音智能体工作流提供支持。
自然的语音生成取决于模型不仅能朗读、还能准确诠释文本的能力。上下文理解——如中性、开心、讽刺等——决定了听者会认为生成结果准确,还是机械。我们的模型在上下文理解和说话人建模两方面均表现出色:能够捕捉特定人物自然说话的方式。我们的声音适配超越了传统的朗读式语音,可捕捉说话人的个性,包括其自然的停顿、节奏、语调以及情感驾驭能力。凭借紧凑的规模、低成本与低延迟,以及易于适配的特点,Voxtral TTS 为希望自主掌控其语音 AI 技术栈的企业提供全面的控制与定制能力。
音频是新的 UX。创造只有在语音中才能实现的协作与理解新交互。立即在 AI Studio 中开始使用我们的美式、英式和法语方言 Mistral Voices。
聆听并判断:你能听出差别吗?
我们的团队使用数十种语言的多种方言,我们理解文化细微差别的重要性,并构建了一个反映我们自身的模型。语音生成通过近似自然的节奏、情感乃至幽默的运用来建立信任。因此,在声音仿真方面,我们专注于真实性和情感表现力。
声音仿真
业界领先的性能。
多语言文本转语音系统的词错误率和音频质量分数等自动化指标,无法衡量语音的自然度。语音之所以自然,取决于极其细微的差别,需要对文化差异和典型说话模式有深入理解。因此,由母语者进行的对比性人工评估至关重要。
对语音智能体而言,延迟与质量始终相互制约。人工评估显示,Voxtral TTS 在保持与 ElevenLabs Flash v2.5 相近的首次音频时间(TTFA)的同时,实现了更出色的自然度。Voxtral 的质量也与 ElevenLabs v3 持平,并成功支持情感引导,从而实现更逼真的交互。

我们在零样本自定义声音场景下,对 Voxtral TTS 与 ElevenLabs v2.5 Flash 进行了对比人工评测。针对 9 种受支持语言中的每一种,使用两种可辨识的母语方言声音,由 3 名标注员对每一对样本在自然度、口音贴合度以及与原始参考的声学相似度上进行并排偏好测试。在这一零样本多语言自定义声音设定中,Voxtral TTS 进一步拉大了与 v2.5 Flash 的质量差距,凸显了 Voxtral TTS 对任意声音的即时定制能力。
母语发音。
基于大规模语音数据集训练,Voxtral TTS 面向全球应用打造。它在 9 种语言上支持业界领先的性能:英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语。
该模型经过训练,只需短至 3 秒的参考即可适配自定义声音,不仅捕捉音色,还能捕捉细微口音、屈折变化、语调,乃至与参考中所表现相似的不流畅等细微差别。我们在 API 中提供了一些预设声音选项,但也可以轻松扩展到您的内部语音库,按用例进行定制,本地化到相应语言和口音,保持中性或更具情感、随意或正式、更自然且对话化或机械化。
该模型还展现出零样本跨语言声音适配能力,尽管并未为此进行显式训练。例如,模型可以使用法语声音提示和英语文本生成英语语音。生成的语音听起来自然,同时采用所提供声音提示的口音(在此示例中,生成的语音带有自然的法语口音英语)。这使得该模型可用于构建级联式语音到语音翻译系统。
级联式语音到语音翻译
点击说话人以运行级联式语音到语音翻译。
提示
在我们开始之前,我需要核实一些信息。您能确认您的全名和出生日期吗?
生成的音频
Voxtral TTS
为低延迟流式传输而打造。
延迟对语音智能体应用至关重要。对于典型的 10 秒、500 字符输入语音样本,Voxtral TTS 的模型延迟达到 70ms,实时因子(RTF)为 ≈9.7x。该模型原生最多可生成两分钟音频,我们的 API 通过智能交错处理任意长度的生成。
Voxtral TTS 架构。
该模型是基于 transformer 的自回归流匹配模型,构建于 Ministral 3B。它由以下组件构成:
3.4B 参数的 transformer 解码器主干
390M 流匹配声学 transformer
300M 神经音频编解码器(对称编码器-解码器)
该模型接收声音提示(5 到 25 秒)以及 9 种受支持语言的文本提示。对于每个音频帧,transformer 主干预测一个语义 token,随后流匹配 transformer 运行 16 次函数评估(NFEs)以生成声学潜变量。
我们开发了一款内部编解码器,它使用语义 VQ(8192 词表)和声学 FSQ(36 维、21 级)潜变量对音频进行因果处理,并以 12.5Hz 帧率生成它们。

驱动企业语音工作流。
Voxtral TTS 补全了音频智能的闭环,为企业语音流水线提供能够通过人类测试的输出层。它可以与 Voxtral Transcribe 配合实现完整的语音到语音,或集成到任何现有的语音转文本与 LLM 技术栈中,并支持跨语言。
工作流
客户支持
语音智能体以自然、契合品牌的语音,跨渠道路由并解决咨询。 将 Voxtral TTS 接入现有客户支持呼叫系统,用于自动语音回复,其输出可融入现有工作流程。
在 Mistral Studio 中试运行该模型。
直接在 Mistral Studio 试验场中体验 Voxtral TTS。选择一种 Mistral 语音,或录制你自己的声音。
开始使用 Voxtral TTS。
Voxtral TTS 现已通过 API 提供,价格为每 1k 字符 $0.016。
立即在 Mistral Studio 或 Le Chat 中试用。
一款包含多种参考语音的模型以开放权重形式在 Hugging Face 上提供,采用 CC BY NC 4.0 许可。
报名参加我们即将举行的网络研讨会,了解更多信息!
我们正在招聘!
我们正在构建 AI 的语音层,如果这正是你想解决的问题,我们很乐意收到你的来信。
来源:Mistral AI · mistral.ai