跳到正文
原文
Mistral AI·· 2025-12-03精选AI 评分76

Mistral AI 发布 Mistral 3,开源 Large 3 与 Ministral 3

Introducing Mistral 3

AI 导读

Mistral AI 发布开源模型家族 Mistral 3,含 14B、8B、3B 的 Ministral 3,以及激活 41B、总参数 675B 的稀疏 MoE 模型 Mistral Large 3。

推荐理由

官方这次把稀疏大模型与三档端侧小模型一起开源,读者可以对照参数规模、许可证和推理变体来选择部署方式。

正文 · AI 翻译

今天,我们发布 Mistral 3,即下一代 Mistral 模型。Mistral 3 包括三个最先进的小型稠密模型(14B、8B 和 3B)以及 Mistral Large 3——我们迄今能力最强的模型——一个以 41B 活跃参数和 675B 总参数训练的稀疏混合专家模型。所有模型均以 Apache 2.0 许可证发布。以多种压缩格式开源我们的模型,能够赋能开发者社区,并通过分布式智能将 AI 交到人们手中。

Ministral 模型在其类别中代表着最佳的性能成本比。与此同时,Mistral Large 3 跻身前沿指令微调开源模型之列。

Mistral Large 3:最先进的开放模型

Chart Base Models (1)
3 Model Performance Comparison (instruct)

Mistral Large 3 是全球最佳的宽松许可开放权重模型之一,在 3000 块 NVIDIA 的 H200 GPU 上从零开始训练。Mistral Large 3 是 Mistral 自开创性的 Mixtral 系列以来的首个混合专家模型,代表着 Mistral 在预训练方面向前迈出的重要一步。经过后训练,该模型在通用提示上达到了市场上最佳指令微调开放权重模型的同等水平,同时还展现出图像理解能力,并在多语言对话(即非英语/中文)方面具有同类最佳表现。

Mistral Large 3 在 LMArena 排行榜的开源非推理模型类别中首次亮相即排名第 2(在全部开源模型中排名第 6)。

Lm Arena Chart Ml3

我们以 Apache 2.0 许可证同时发布 Mistral Large 3 的基础版和指令微调版,为企业与开发者社区的进一步定制提供坚实基础。推理版本即将推出! 

Mistral、NVIDIA、vLLM 与 Red Hat 联手,带来更快、更易获取的 Mistral 3

通过与 vLLM 和 Red Hat 的协作,Mistral Large 3 对开源社区非常易于获取。我们发布了使用 llm-compressor 构建的 NVFP4 格式检查点。这一优化后的检查点让你能够使用 vLLM 在 Blackwell NVL72 系统以及单个 8×A100 或 8×H100 节点上高效运行 Mistral Large 3。

交付先进的开源 AI 模型需要广泛优化,这通过一项 与 NVIDIA 的合作得以实现。 我们所有新的 Mistral 3 模型,从 Large 3 到 Ministral 3,均在 NVIDIA Hopper GPU 上训练,以利用高带宽 HBM3e 内存应对前沿规模的工作负载。NVIDIA 的极致协同设计方法将硬件、软件和模型结合在一起。NVIDIA 工程师为完整的 Mistral 3 系列实现了对 TensorRT-LLM 和 SGLang 的高效推理支持,以实现高效的低精度执行。

针对 Large 3 的稀疏 MoE 架构,NVIDIA 集成了最先进的 Blackwell 注意力与 MoE 内核,增加了对预填充/解码分离式服务的支持,并与 Mistral 在推测解码方面开展合作,使开发者能够在 GB200 NVL72 及更大规模系统上高效服务长上下文、高吞吐工作负载。在边缘侧,在 DGX Spark、RTX PC 与笔记本电脑和 Jetson 设备上交付 Ministral 模型的优化部署,为开发者提供一条一致且高性能的路径,以从数据中心到机器人运行这些开放模型。

我们非常感谢此次合作,并特别感谢 vLLM、Red Hat 和 NVIDIA。

Ministral 3:边缘侧的最先进智能

4 Gpqa Diamond Accuracy

面向边缘和本地用例,我们发布 Ministral 3 系列,提供三种模型规模:3B、8B 和 14B 参数。此外,针对每种模型规模,我们向社区发布 base、instruct 和 reasoning 变体,每种都具备图像理解能力,全部采用 Apache 2.0 许可证。结合这些模型原生的多模态与多语言能力,Ministral 3 系列可为所有企业或开发者需求提供合适的模型。

此外,Ministral 3 在所有开源模型中实现了最佳的性价比。在实际用例中,生成的 token 数量与模型规模同等重要。Ministral instruct 模型在性能上达到或超越同类模型,同时生成的 token 数量往往少一个数量级。 

在只关注准确率的场景中,Ministral reasoning 变体可以通过更长时间的思考,在同权重量级中达到最先进的准确率——例如,我们的 14B 变体在 AIME ‘25 上达到 85%。

今日可用

Mistral 3 今日已在 Mistral AI Studio、 Amazon Bedrock、Azure Foundry、Hugging Face(Large 3 & Ministral)、 Modal、IBM WatsonX、OpenRouter、Fireworks、Unsloth AI,和 Together AI 上提供。此外,即将登陆 NVIDIA NIM 和 AWS SageMaker。

还有一件事……使用 Mistral AI 进行定制

对于寻求定制化 AI 解决方案的组织,Mistral AI 提供 定制模型训练服务,可根据您的特定需求微调或全面适配我们的模型。无论是针对特定领域任务进行优化、提升在专有数据集上的性能,还是在独特环境中部署模型,我们的团队都会与您协作,构建与您目标一致的 AI 系统。对于企业级部署,定制训练可确保您的 AI 解决方案安全、高效且大规模地发挥最大影响力。

开始使用 Mistral 3

AI 的未来是开放的。Mistral 3 以一系列为前沿智能、多模态灵活性与无与伦比的定制能力而打造的模型,重新定义了可能性。无论您是使用 Ministral 3 部署边缘优化解决方案,还是借助 Mistral Large 3 拓展推理的边界,此次发布都将最先进的 AI 直接交到您手中。

为什么选择 Mistral 3?

  • 前沿性能,开放获取:借助开源模型的透明度与可控性,达到闭源级别的结果。

  • 多模态与多语言:构建能够理解文本、图像以及跨越 40+ 种原生语言的复杂逻辑的应用。

  • 可扩展的效率:从 3B 到 675B 参数,选择适合您需求的模型,覆盖从边缘设备到企业工作流的各种场景。

  • 智能体化且适应性强:可精准部署于编程、创意协作、文档分析或工具使用工作流。

后续步骤

  1. 浏览模型文档: 

  2. 面向客户的技术文档可在我们的 AI Governance Hub 上获取

  3. 开始构建:在 Hugging Face 上获取 Ministral 3 和 Large 3,或通过 Mistral AI 的平台 部署,以即时访问 API 并查看 API 定价

  4. 按需定制:需要量身定制的解决方案?联系我们的团队,了解微调或企业级训练。

  5. 与我们分享你的项目、问题或突破:Twitter/X、Discord 或 GitHub。

在此次发布的同时,你可以在我们最新的研究论文这里了解 Ministral 3 系列架构的完整细节。

我们相信,AI 的未来应建立在透明、可及与共同进步之上。借此次发布,我们邀请全世界与我们一起探索、构建与创新,在推理、效率与现实应用中开启新的可能。

让我们一起把理解化为行动。

来源:Mistral AI · mistral.ai