Mistral 发布 Apache 2.0 许可的 24B 模型 Mistral Small 3
Mistral Small 3
Mistral 发布延迟优化的 24B 参数模型 Mistral Small 3,以 Apache 2.0 同时开放预训练与指令微调检查点。官方称其与 Llama 3.3 70B instruct 表现相当,在相同硬件上快 3 倍以上,MMLU 准确率超过 81%,延迟为 150 tokens/s。
24B模型在同等硬件上比Llama 3.3 70B快3倍以上,量化后可在单张RTX 4090或32GB内存MacBook本地运行。
今天,我们推出 Mistral Small 3,这是一款以延迟优化的 24B 参数模型,采用 Apache 2.0 许可证发布。

Mistral Small 3 可与 Llama 3.3 70B 或 Qwen 32B 等更大模型相媲美,并且是 GPT4o-mini 等不透明专有模型的出色开源替代品。Mistral Small 3 与 Llama 3.3 70B instruct 表现相当,同时在相同硬件上速度快 3 倍以上。
Mistral Small 3 是一款经过预训练和指令微调的模型,面向生成式 AI 任务中的“80%”——即那些需要强大的语言能力和指令遵循性能、且延迟极低的任务。
我们设计这款新模型,旨在以适合本地部署的规模使性能达到饱和。特别是,Mistral Small 3 的层数远少于竞品模型,大幅缩短了每次前向传播的时间。在 MMLU 上准确率超过 81%,延迟为 150 tokens/s,Mistral Small 目前是其类别中最高效的模型。
我们以 Apache 2.0 许可证同时发布预训练和指令微调的检查点。这些检查点可作为加速进展的强大基础。请注意,Mistral Small 3 既未使用 RL 训练,也未使用合成数据,因此在模型生产流程中比 Deepseek R1 等模型更早(Deepseek R1 是一项出色且互补的开源技术!)。它可以作为构建累积推理能力的优秀基座模型。我们期待看到开源社区如何采用并定制它。
性能
人工评估

我们与外部第三方供应商合作,针对超过 1k 条专有编程和通用提示进行了并排评估。评估人员的任务是从 Mistral Small 3 与另一模型生成的匿名结果中选择他们更偏好的模型回复。我们意识到,在某些情况下,基于人工判断的基准与公开基准截然不同,但我们已格外谨慎地核实评估的公平性。我们确信上述基准是有效的。
指令性能
我们的指令微调模型在代码、数学、通用知识和指令遵循基准上,与三倍于其规模的开放权重模型以及专有的 GPT4o-mini 模型表现相当。



所有基准上的性能准确率均通过同一内部评估流程获得——因此,数字可能与先前报告的性能略有差异(Qwen2.5-32B-Instruct, Llama-3.3-70B-Instruct, Gemma-2-27B-IT)。基于评判的评估,如 Wildbench、Arena hard 和 MTBench,均基于 gpt-4o-2024-05-13。
预训练性能


Mistral Small 3 是一款 24B 模型,在其规模类别中提供最佳性能,并可与 Llama 3.3 70B 等三倍规模的模型相媲美。
何时使用 Mistral Small 3
在我们的客户和社区中,我们看到这一规模的预训练模型正在涌现出若干不同的用例:
快速响应的对话辅助:Mistral Small 3 在需要快速、准确回复的场景中表现出色。这包括许多用户期望即时反馈和近实时交互的虚拟助手场景。
低延迟函数调用:当作为自动化或智能体工作流的一部分使用时,Mistral Small 3 能够处理快速的函数执行。
微调以打造领域专家:Mistral Small 3 可针对特定领域进行微调,从而打造高度准确的领域专家。这在法律咨询、医学诊断和技术支持等领域尤为有用,因为这些领域离不开专业知识。
本地推理:对处理敏感或专有信息的爱好者和组织尤其有益。量化后,Mistral Small 3 可在单张 RTX 4090 或配备 32GB RAM 的 Macbook 上私密运行。
我们的客户正在多个行业评估 Mistral Small 3,包括:
金融服务客户用于欺诈检测
医疗保健服务提供方用于客户分诊
机器人、汽车和制造企业用于设备端指挥与控制
跨客户的横向用例包括虚拟客户服务,以及情感与反馈分析。
在你偏好的技术栈上使用 Mistral Small 3
Mistral Small 3 现已在 la Plateforme 上以 mistral-small-latest 或 mistral-small-2501 的形式提供。查阅我们的 文档 ,了解如何使用我们的模型进行文本生成。
我们也很高兴与 Hugging Face、Ollama、Kaggle、Together AI 和 Fireworks AI 合作,从今天起在其平台上提供该模型:
即将在 NVIDIA NIM、Amazon SageMaker、Groq、Databricks 和 Snowflake 上推出
未来之路
对开源社区而言,这是令人振奋的日子!Mistral Small 3 与 DeepSeek 近期发布的大型开源推理模型互为补充,并可作为强大的基础模型,让推理能力得以涌现。
除此之外,未来几周还将推出推理能力得到增强的小型和大型 Mistral 模型。如果你有兴趣,欢迎加入这段旅程(我们正在招聘),或者今天就动手改造 Mistral Small 3,抢在我们之前把它做得更好!
Mistral 的开源模型
我们重申对通用模型使用 Apache 2.0 许可证的承诺,并逐步告别采用 MRL 许可证的模型。与 Mistral Small 3 一样,模型权重将可供下载并在本地部署,可自由修改并以任何方式使用。这些模型还将通过 la Plateforme上的无服务器 API、我们的本地部署和 VPC 部署、定制与编排平台,以及我们的推理与云合作伙伴提供。需要专门能力(更高速度与更长上下文、领域专业知识、代码补全等任务专用模型)的企业与开发者,可以依靠更多商业模型来补充我们向社区贡献的内容。
来源:Mistral AI · mistral.ai