跳到正文
原文
Mistral AI·· 2026-03-17精选AI 评分75

Mistral 发布 Mistral Small 4,统一推理、多模态与智能体编码

Introducing Mistral Small 4

AI 导读

Mistral 发布 Mistral Small 4,把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码整合进同一模型,并以 Apache 2.0 许可开源。

推荐理由

公告把推理、多模态和智能体编码收进同一开源模型,并给出相对 Mistral Small 3 的完成时间与每秒请求数变化。

正文 · AI 翻译

今天,我们宣布推出 Mistral Small 4。该模型是 Mistral Small 系列的下一个重大版本。Mistral Small 4 是首个将我们旗舰模型的能力统一到单一多功能模型中的 Mistral 模型:Magistral 用于推理,Pixtral 用于多模态,Devstral 用于智能体编程。借助 Small 4,用户不再需要在快速指令模型、强大的推理引擎或多模态助手之间做出选择:如今一个模型即可同时提供这三项能力,并具备可配置的推理强度和同类最佳的效率。

Mistral Small 4 以 Apache 2.0 许可证发布,延续我们对开放、易用且可定制 AI 的承诺。

多模态、推理优化模型的新标准

Mistral Small 4 是一款混合模型,针对通用对话、编程、智能体任务和复杂推理进行了优化。其架构同时支持文本和图像输入,适用于广泛的应用场景。通过 Mistral Small 4,我们重申对开源模型的承诺,并很荣幸作为创始成员加入 NVIDIA Nemotron Coalition,推动 AI 开发中的协作与创新。

关键架构细节

  • 混合专家(MoE):128 个专家,每个 token 激活 4 个,从而实现高效扩展与专业化。

  • 参数总量为 119B,每个 token 的活跃参数为 6B(含嵌入层和输出层则为 8B)。

  • 256k 上下文窗口,支持长文本交互与文档分析。

  • 可配置的推理强度:可在快速、低延迟的响应与深入、高强度推理的输出之间切换。

  • 原生多模态:同时接受文本和图像输入,解锁从文档解析到视觉分析的各类用例。

性能亮点

  • 端到端完成时间缩短 40%(延迟优化配置)。

  • 与 Mistral Small 3 相比,每秒请求数提升 3 倍(吞吐量优化配置)。

Performance Comparison Across Internal Models

为何选择 Mistral Small 4?

统一能力

Mistral Small 4 将 Magistral(推理)、Devstral(编程智能体)和 Mistral Small(指令)的优势整合到单一模型中。无论你需要聊天助手、研究伙伴还是编程智能体,Small 4 都能适配你的任务,无需在专用模型之间切换。

按需推理

借助新的 reasoning_effort 参数,用户可以动态调整模型的行为:

  • reasoning_effort="none":面向日常任务的快速、轻量响应,与 Mistral Small 3.2 的聊天风格相当。

  • reasoning_effort="high": 针对复杂问题进行深入的逐步推理,详细程度与此前的 Magistral 模型相当。

Performance Comparison Across Internal Models 2   Alt

企业级效率

  • 最低基础设施:4x NVIDIA HGX H100、2x NVIDIA HGX H200 或 1x NVIDIA DGX B200。

  • 推荐配置:4x NVIDIA HGX H100、4x NVIDIA HGX H200 或 2x NVIDIA DGX B200,以获得最佳性能。

  • Mistral Small 4 完全开源。你可以针对专门任务对其进行微调,也可以开箱即用地部署以用于通用场景。得益于与社区的协作,它现已可在 vLLM、llama.cpp、SGLang、Transformers 等平台上使用。

  • 交付先进的开源 AI 模型需要广泛的优化。通过与 NVIDIA 的紧密合作,推理已针对开源的 vLLM 和 SGLang 进行优化,确保在各种部署场景中实现高效、高吞吐的服务。

图:三项基准测试中的得分与输出长度对比。上:准确率得分(越高越好)。下:平均输出长度,以千字符计(越短越好)。

具备推理能力的 Mistral Small 4 取得了有竞争力的分数,在全部三项基准测试中与 GPT-OSS 120B 持平或超越,同时生成的输出显著更短。在 AA LCR 上,Mistral Small 4 仅用 1.6K 字符即获得 0.72 分,而 Qwen 模型需要多 3.5-4 倍的输出(5.8-6.1K)才能达到相当的表现。在 LiveCodeBench 上,Mistral Small 4 以少 20% 的输出超越了 GPT-OSS 120B。这一效率差距在实践中很重要:更短的输出意味着更低的延迟、更低的推理成本,以及更好的用户体验。

面向企业采购方:


每 token 的效率直接影响成本与可扩展性。随着回复变长仍能保持或提升性能的模型,可减少人工干预需求、降低运营成本,并确保质量稳定,即便面对报告生成、客户支持或决策工作流等复杂且高风险的任务也是如此。混合推理模型通过在不按比例增加资源消耗的情况下最大化准确率来提供更高价值,使其非常适合对性能与成本效率都至关重要的大规模部署。

面向技术团队与数据科学家:


每 token 的性能是模型选型与优化的关键指标。能够高效扩展的模型让团队可以针对更长、更细致的任务(例如详细分析、多步推理)部署解决方案,而无需牺牲准确率或抬高计算成本。这意味着质量与资源分配之间的权衡更少,从而支持更具创新性、更可靠的 AI 驱动应用。模型的稳健性也简化了微调与集成,减少了对持续调整或回退系统的需求。

预期用例

Mistral Small 4 专为以下场景设计:

  • 开发者:编码自动化、代码库探索以及代码智能体工作流。

  • 企业:通用聊天助手、文档理解以及多模态分析。

  • 研究人员:数学、研究以及复杂推理任务。

其开源许可与可定制架构使其非常适合微调与专业化。

可用性

  • Mistral API 与 AI Studio

  • Hugging Face 仓库

  • 开发者可在 NVIDIA 加速计算平台 build.nvidia.com 上免费原型开发 Mistral Small 4;用于生产部署时,Mistral Small 4 以 NVIDIA NIM 的形式于首日提供,开箱即用地交付经过优化的容器化推理。它也可借助 NVIDIA NeMo 进行领域特定微调。

  • 面向客户的技术文档可在我们的 AI Governance Hub 获取

如需企业部署、定制微调或本地部署方案,请联系我们的团队。

AI 的未来是开放的

通过统一指令、推理与多模态能力,Mistral Small 4 简化了 AI 集成,使用户能够借助单一、可适配的工具应对更广泛的任务,将开源 AI 的优势带入真实世界的用例。

来源:Mistral AI · mistral.ai