跳到正文
原文
Mistral AI·· 2026-02-05精选AI 评分66

Mistral 发布 Voxtral Transcribe 2 批量与实时语音转写模型

Voxtral transcribes at the speed of sound.

AI 导读

Mistral 发布 Voxtral Transcribe 2,提供批量与实时两款语音转写模型。Voxtral Realtime 采用流式架构,延迟可配置至 sub-200ms,480ms 延迟时词错误率维持在 1-2%,约 4B 参数,以 Apache 2.0 在 Hugging Face 开放权重,API 为 $0.006/min。

推荐理由

官方把实时转写的开放权重、可配置延迟和批量转写的价格与说话人分离放在同一发布里,方便按延迟和成本比较接入方式。

正文 · AI 翻译

今天,我们发布 Voxtral Transcribe 2,两款具备最先进转录质量、说话人分离和超低延迟的新一代语音转文字模型。该系列包括用于批量转录的 Voxtral Mini Transcribe V2,以及用于实时应用的 Voxtral Realtime。Voxtral Realtime 以 Apache 2.0 许可证开放权重。

我们还推出了 Mistral Studio 中的音频试验场,由 Voxtral Transcribe 2 驱动,可即时测试转录,并支持说话人分离和时间戳。

亮点。

  • Voxtral Mini Transcribe V2:在 13 种语言中提供最先进的转录,支持说话人分离、上下文偏置和词级时间戳。

  • Voxtral Realtime:专为实时转录打造,延迟可配置低至 sub-200ms,赋能语音智能体和实时应用。

  • 同类最佳效率:以极低成本实现业界领先的准确率,Voxtral Mini Transcribe V2 以最低价格达到最低词错误率。

  • 开放权重:Voxtral Realtime 以 Apache 2.0 发布,可部署于边缘侧,适用于隐私优先的应用。

Voxtral Realtime。

Voxtral Realtime 专为延迟至关重要的应用打造。与通过分块处理音频来改造离线模型的方法不同,Realtime 采用全新的流式架构,在音频到达时即进行转录。该模型提供的转录延迟可配置低至 sub-200ms,从而开启一类全新的语音优先应用。

Fleur Voxtral 2

FLEURS 转录基准中各语言的词错误率(越低越好)。

在 2.4 seconds 延迟下(适合字幕),Realtime 与我们最新的批量模型 Voxtral Mini Transcribe V2 表现相当。在 480ms 延迟下,词错误率保持在 1-2% 以内,使语音智能体达到接近离线的准确率。

该模型原生支持多语言,在 13 种语言中实现强劲的转录表现,包括英语、中文、印地语、西班牙语、阿拉伯语、法语、葡萄牙语、俄语、德语、日语、韩语、意大利语和荷兰语。凭借 4B 参数规模,它可在边缘设备上高效运行,为敏感部署保障隐私与安全。

我们以 Apache 2.0 在 Hugging Face Hub. 上发布模型权重。

Voxtral Mini Transcribe V2。

Voxtral 2.0   Avg Diarization Error Rate   Priceper Min

五个英语基准(Switchboard、CallHome、AMI-IHM、AMI-SDM、SBCSAE)以及 TalkBank 多语言基准(德语、西班牙语、英语、中文、日语)上的平均说话人分离错误率(越低越好)。

Voxtral 2.0   Transcription Performance Fleurs   Priceper Min

FLEURS 转录基准中 top-10 语言的平均词错误率(越低越好)。

Voxtral Mini Transcribe V2 在各语言和各领域的转录与说话人分离质量上带来显著提升。在 FLEURS 上词错误率约为 4%,价格为 $0.003/min,Voxtral 在所有转录 API 中提供最佳性价比。它在准确率上优于 GPT-4o mini Transcribe、Gemini 2.5 Flash、Assembly Universal 和 Deepgram Nova,音频处理速度比 ElevenLabs 的 Scribe v2 大约快 3x,同时在质量相当的情况下成本仅为五分之一。

模型特性。

Voxtral Mini Transcribe 2 引入关键能力。

说话人分离。

生成带有说话人标签以及精确开始/结束时间的转录。适用于会议转录、访谈分析和多方通话处理。注意:出现语音重叠时,模型通常只转录一位说话人。

上下文偏置。

提供最多 100 个单词或短语,引导模型正确拼写名称、技术术语或领域专用词汇。对于标准模型经常识别不准的专有名词或行业术语尤其有用。上下文偏置针对英语进行了优化;对其他语言的支持仍处于实验阶段。

词级时间戳。

为每个词生成精确的起止时间戳,从而支持字幕生成、音频搜索和内容对齐等应用。

扩展的语言支持。

与 Realtime 一样,该模型现已支持 13 种语言:英语、中文、印地语、西班牙语、阿拉伯语、法语、葡萄牙语、俄语、德语、日语、韩语、意大利语和荷兰语。非英语性能显著领先于竞品。

噪声鲁棒性。

在工厂车间、繁忙的呼叫中心和现场录音等具有挑战性的声学环境中保持转写准确率。

更长音频支持。

单次请求可处理最长 3 小时的录音。

FlEURS

FLEURS 转写基准中各语言的词错误率(越低越好)。

音频 Playground。

直接在 Mistral Studio 中测试 Voxtral Transcribe 2。最多上传 10 个音频文件,可切换说话人分离、选择时间戳粒度,并为领域专用词汇添加上下文偏置词。支持 .mp3、.wav、.m4a、.flac、.ogg,每个文件最大 1GB。

变革语音应用。

Voxtral 为各类应用和行业中的语音工作流提供支持。

  • 会议智能。

    Transcribe multilingual recordings with speaker diarization that clearly attributes who said what and when. At Voxtral's price point, annotate large volumes of meeting content at industry-leading cost efficiency.
  • 语音智能体与虚拟助手。

    Build conversational AI with sub-200ms transcription latency. Connect Voxtral Realtime to your LLM and TTS pipeline for responsive voice interfaces that feel natural.
  • 联络中心自动化。

    Transcribe calls in real time, enabling AI systems to analyze sentiment, suggest responses, and populate CRM fields while conversations are still happening. Speaker diarization ensures clear attribution between agents and customers.
  • 媒体与广播。

    Generate live multilingual subtitles with minimal latency. Context biasing handles proper nouns and technical terminology that trip up generic transcription services.
  • 合规与文档。

    Monitor and transcribe interactions for regulatory compliance, with diarization providing clear speaker attribution and timestamps enabling precise audit trails.

两款模型均可通过安全的本地部署或私有云配置,支持符合 GDPR 和 HIPAA 的部署。

开始使用。

Voxtral Mini Transcribe V2 现已通过 API 提供,价格为每分钟 $0.003。立即在全新的 Mistral Studio 音频 Playground 或 Le Chat 中试用。

Voxtral Realtime 可通过 API 使用,价格为每分钟 $0.006,并以开放权重形式在 Hugging Face 上提供。

探索文档,了解 Mistral 的音频与转写能力。

我们正在招聘。

如果你热衷于打造世界一流的语音 AI,并将前沿模型交到各地开发者手中,我们很乐意收到你的来信。申请加入我们的团队。

来源:Mistral AI · mistral.ai