跳到正文
原文
Mistral AI·· 2025-07-15精选AI 评分72

Mistral 发布开源语音理解模型 Voxtral,提供 24B 与 3B

Voxtral

AI 导读

Mistral 发布语音理解模型 Voxtral,包含面向生产的 24B 版本和面向本地及端侧的 Voxtral Mini(3B),两者均以 Apache 2.0 许可开源,也可通过 API 使用。

推荐理由

官方放出24B与3B两档开源语音模型,转写价格不到同类接口一半,便于比较精度、上下文时长和本地部署的取舍。

正文 · AI 翻译
Triangle Voxtral Blog

语音:最初的 UI。

语音曾是人类最早的界面——远在书写或打字之前,它就让我们分享想法、协调工作并建立关系。随着数字系统能力不断增强,语音正重新成为我们最自然的人机交互形式。

然而,当今的系统仍然有限——不可靠、专有,且过于脆弱,难以用于真实场景。弥合这一差距,需要具备卓越转录能力、深度理解、多语言流利度以及开放、灵活部署方式的工具。

我们发布 Voxtral 模型,以加速这一未来。这些先进的语音理解模型有 两种规格——面向生产级应用的 24B 版本,以及面向本地与边缘部署的 3B 版本。两个版本均以 Apache 2.0 许可证发布,也可通过我们的 API 使用。该 API 会将转录查询路由到经过转录优化的 Voxtral Mini 版本(Voxtral Mini Transcribe),从而带来无与伦比的成本与延迟效率。若要全面了解 Voxtral 背后的研究与开发,请参阅我们的详细研究论文,可在 此处下载。

面向所有人的开放、实惠且可投入生产的语音理解。 

直到最近,要在生产环境中获得真正可用的语音智能,意味着必须在两种取舍之间做出选择:

  1. 词错误率高且语义理解有限的开源 ASR 系统

  2. 将强大转录与语言理解相结合的封闭专有 API,但成本显著更高,且对部署的控制更少

Voxtral 弥合了这一差距。它以不到同类 API 一半的价格,在开放条件下提供先进的准确率与原生语义理解。这使得高质量语音智能能够大规模地被获取并加以控制。 

两款 Voxtral 模型都超越了简单转录,其能力包括:

  • 长上下文:凭借 32k token 的上下文长度,Voxtral 可处理最长 30 分钟的音频用于转录,或最长 40 分钟的音频用于理解 

  • 内置问答与摘要:支持直接就音频内容提问,或生成结构化摘要,而无需串联单独的 ASR 与语言模型

  • 原生多语言:自动语言检测,并在全球使用最广泛的语言(英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语、意大利语等)上达到先进水平,帮助团队以单一系统服务全球受众

  • 直接通过语音进行函数调用:可根据用户说出的意图直接触发后端函数、工作流或 API 调用,将语音交互转化为可执行的系统命令,无需中间解析步骤。

  • 强大的文本能力:保留其语言模型骨干 Mistral Small 3.1 的文本理解能力

这些能力使 Voxtral 模型非常适合真实世界的交互与下游操作,例如摘要、回答、分析与洞察。对于成本敏感的用例,Voxtral Mini Transcribe 以不到一半的价格超越 OpenAI Whisper。对于高端用例,Voxtral Small 同样以不到一半的价格达到 ElevenLabs Scribe 的性能。

基准测试

语音转录

为评估 Voxtral 的转录能力,我们在一系列英语及多语言基准上对其进行评测。对于每项任务,我们报告跨语言的宏平均词错误率(越低越好)。对于英语,我们分别报告短音频(<30 秒)和长音频(>30 秒)的平均值。

Voxtral 全面超越当前领先的开源语音转录模型 Whisper large-v3。它在所有任务上均优于 GPT-4o mini Transcribe 和 Gemini 2.5 Flash,并在英语短音频和 Mozilla Common Voice 上取得最先进的结果,超越 ElevenLabs Scribe,展现出强大的多语言能力。

V Plot 1

在 FLEURS 的跨语言评测中,Voxtral Small 在每项任务上都优于 Whisper,并在多种欧洲语言上达到最先进的性能。

V Plot 2

宏平均详情:

  • 英语短音频:LibriSpeech Clean、LibriSpeech Other、GigaSpeech、VoxPopuli、Switchboard、CHiME-4、SPGISpeech

  • 英语长音频:Earnings-21 10-m、Earnings-22 10-m

  • Mozilla Common Voice 15.1:英语、法语、德语、西班牙语、意大利语、葡萄牙语、荷兰语、印地语

  • FLEURS:英语、法语、德语、西班牙语、意大利语、葡萄牙语、荷兰语、印地语、阿拉伯语

音频理解

Voxtral Small 和 Mini 能够直接根据语音回答问题,或通过提供音频和基于文本的提示来回答。为评估音频理解能力,我们为三项常见的文本理解任务制作了语音合成版本。我们还在内部音频理解(AU)基准上评测这些模型,要求模型针对 40 个长音频示例回答具有挑战性的问题。最后,我们在 FLEURS-Translation 基准上评估语音翻译能力。

Voxtral Small 在所有任务上均与 GPT-4o-mini 和 Gemini 2.5 Flash 具有竞争力,并在语音翻译方面达到最先进的性能。

V Plot 3

文本

Voxtral 保留了其语言模型骨干的文本能力,因此可分别作为 Ministral 和 Mistral Small 3.1 的直接替代方案使用。

V Plot 4

免费试用 

无论你是在笔记本电脑上做原型开发、在本地运行私有工作负载,还是在云端扩展到生产环境,上手都很简单。

  • 本地下载并运行:Voxtral(24B)和 Voxtral Mini(3B)均可在 Hugging Face 上下载

  • 试用 API:只需一次 API 调用,即可将前沿语音智能集成到你的应用中。价格低至每分钟 $0.001,让高质量转录与理解在规模化场景下也能负担得起。请在此处查看我们的文档。 

  • 在 Le Chat 上试用:在 Le Chat 的语音模式中试用 Voxtral(未来几周内将向所有用户推出)——支持网页端或移动端。录制或上传音频、获取转录、提问或生成摘要。

高级企业功能。 

我们还为有更高安全性、规模或特定领域需求的企业提供专为 Voxtral 设计的能力。如果你正在考虑以下事项,请联系我们: 

  • 生产规模的私有部署:我们的解决方案团队可帮助你在自有基础设施内完全搭建用于生产规模推理的 Voxtral。这非常适合数据隐私要求严格的受监管行业用例。其中包括在多个 GPU 或节点上部署 Voxtral 的指导与工具,以及针对生产吞吐量和成本效率优化的量化构建版本。

  • 领域专用微调:与我们的 应用 AI 团队合作,将 Voxtral 适配到专业场景——如法律、医疗、客户支持或内部知识库——从而提升您用例的准确率。

  • 高级上下文:我们正在邀请设计合作伙伴,共同构建对说话人识别、情绪检测、高级说话人分离乃至更长上下文窗口的支持,以便开箱即用地满足更广泛的需求。

  • 专属集成支持:优先获得工程资源与咨询服务,帮助您将 Voxtral 顺畅集成到现有工作流、产品或数据管道中。

即将推出。

我们将与 Inworld 的朋友们举办一场线上研讨会(看看他们用 Voxtral 和 Inworld TTS 做的很酷的语音到语音 演示!),展示如何在 8 月 6 日星期三构建端到端语音驱动智能体。如果您有兴趣,请在此注册。 

未来几个月,我们正致力于让音频能力更加丰富。除语音理解外,我们很快还将支持: 

  • 说话人分段 

  • 音频标注,例如年龄和情绪

  • 词级时间戳

  • 非语音音频识别

  • 以及更多!

我们很期待看到您用 Voxtral 构建的成果。

顺便说一下,我们正在招聘!

Voxtral 模型的发布标志着重要的一步,但我们的旅程远未结束。我们的目标是打造最自然、最令人愉悦、接近真人的语音界面,还有大量工作要做。我们正在积极扩充尚处起步阶段的音频团队,寻找与我们抱负相同的优秀研究科学家和工程师。

如果您有兴趣加入我们普及人工智能的使命,欢迎申请加入我们的团队! 

来源:Mistral AI · mistral.ai