Mistral推出Mistral Large 4公开预览,权重将于本月底开放
Introducing Mistral Large 4
Mistral推出Mistral Large 4公开预览,这是参数量1 trillion、激活参数49 billion的原生多模态模型,预览API已可在Mistral Studio试用,权重将于本月底发布。
公开预览把1 trillion参数、49 billion激活参数和欧洲3,800 GPU从零训练放在同一处,并给出编码、网络安全与视觉定位的对照分数,便于对照开源权重与闭源模型的取舍。
Le Chonk
今天,我们推出 Mistral Large 4 的 公开预览。非正式名称为 ML4,非常正式的名称则是:le Chonk。ML4 推动了开放权重性能的前沿。你今天即可在 Mistral Studio 上试用预览版 API。权重将于本月底发布。
前沿性能
ML4 是一个拥有 1 万亿参数的原生多模态模型,活跃参数为 490 亿。它是我们迄今规模最大、能力最强的模型,并且随着我们持续打磨,它仍在快速提升。
该模型在编程、智能体工作流和多模态理解方面表现出色。它已达到可与全球最强开源模型相竞争的性能,同时显著超越美国或欧洲开发的任何开放权重模型。在网络安全、金融和法律等关键企业工作负载上,我们认为它在开放模型中处于最先进水平。在视觉定位等某些领域,它更进一步,甚至超越了前沿闭源模型。
我们将在本月底前发布权重。在此之前,我们正与网络安全领域的领军者、经过审核的合作伙伴以及国家机构一起,在真实环境中对该模型进行红队测试;他们将访问同一模型,但审核有所放宽,网络能力则有所扩展。
演示
铸就于欧洲。为 AI 主权而生。
ML4 在 Mistral 位于欧洲的自有数据中心内,使用 3,800 块 NVIDIA Grace Blackwell GPU 从零开始训练。公开预览版也由同一基础设施提供服务。这是我们在基础设施、研究和产品开发方面长期投入的重要里程碑:通过开放权重,在关键垂直领域交付最先进的性能,旨在让客户掌控自己的 AI。
这一点在网络安全领域尤为重要:提供商层面的拒绝可能会阻碍正当的漏洞研究和事件响应,而在事件处置过程中失去某项能力,本身也可能成为重大安全风险。ML4 将顶级网络安全性能与开放权重和自主部署相结合,使组织既能获得相应能力,又能按照自身政策自主开展高级安全工作。
该模型将在全球多个地区提供,其中包括由 Mistral 端到端运营、独立于其他数字服务提供商并受欧洲法律管辖的欧洲部署。趣味事实:ML4 的训练数据中有相当大一部分是多语言的,涵盖 160 多种语言,包括欧盟的每一种官方语言。
我们一直与全球金融、工程、制造、物流、制药、科学、航运、公共部门及其他关键任务行业的领先企业密切合作,共同训练 ML4。事实上,该模型使用的训练、定制和 RL 环境,与我们通过 Mistral Forge。 向客户提供的环境相同。
立即试用
后续还有更多内容。在我们推进权重发布的过程中,我们将进一步分享模型架构、更多基准测试以及后训练方法的细节。
该模型也将成为新一代专用化、优化版 Mistral 模型的基础。与此同时,我们邀请你 试用预览版 API,并在社交媒体上与我们分享你的反馈。
能力深度解析
网络安全
ML4 是全球最强的网络安全 AI 模型之一。在 Artificial Analysis Cyber Index(一项独立评估 AI 模型在真实软件中发现并修复安全缺陷能力的评测)上,它位列全球前五,并大幅领先于中国以外开发的开源权重模型。在该指数的一项测试中,模型需要复现开源软件中的真实漏洞并随后加以修补,ML4 得分为 82%,为所有模型中最高。它还解决了 Cybench 中 93% 的挑战;Cybench 是一套源自安全竞赛的 40 道练习题,这一成绩是开源权重模型所报告的最高分之一。
这一最高分体现了实际优势。包括 Claude Opus 5.5 和 GPT-6 Astra 在内的若干领先闭源模型在同一测试上得分接近于零,因为它们拒绝执行该任务。然而,软件防御往往始于证明某个缺陷真实存在,而这恰恰是闭源模型中的安全过滤机制可能阻止的工作。随着威胁行为者越来越多地越狱这些模型以支持进攻性网络活动,这一点变得更加重要:防御方需要能够匹敌这些能力、而又不受同样拒绝机制约束的系统。ML4 能够完成这项工作,其能力还超出了它被明确训练的范围:在内部测试中,它被证明有助于分析恶意软件、确定漏洞优先级以及编写检测规则。对于需要用于安全运营的主权、可审计 AI 的组织而言,它将能够在私有云或本地部署中运行。
ML4 对阵全场:高效推理各类复杂挑战
恶意软件逆向工程:解决一项分布外调查任务
智能体编程
ML4 在软件工程、代码仓库理解以及复杂终端工作流方面表现卓越,在 DeepSWE v1.1 上得分为 61.7%,在 SWE-Atlas-QnA 上为 59.4%,在 Terminal-Bench 4 上为 28.3%。其综合 Coding Agent Index 得分为 49.8%,领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。
* DeepSWE、Terminal-Bench 4 和 SWE Atlas QnA 的分数采用 ArtificialAnalysis 编程指数所报告的数字。Vibe Code Bench v1.1 采用 vals.ai 所报告的数字。
我们还与 Surge AI 合作,就编程质量开展了盲测人工评估:专业标注员在隐藏模型身份的情况下,按 1–5 分对模型输出进行评分。ML4 Preview 在五个模型中排名第二(3.74),领先于 Kimi K3(3.59)、GLM-5.3(3.60)和 GLM-5.2(3.40),仅次于 Claude Opus 5(4.22)。
智能体工作流
ML4 运行通用智能体,能够在复杂工作流中收集信息、使用工具并产出成品交付物。在 AutomationBench — 涵盖 Gmail、Google Sheets、Slack 和 Salesforce 等应用的 657 个业务工作流 — 上,它的得分为 59.9%,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。
它在知识工作实际产出的专业交付物上同样出色:电子表格、幻灯片和 PDF。在评估长程知识工作的 AA-Briefcase 上,它达到 1,393 Elo,领先于 DeepSeek V4 Pro。

多模态
ML4 是我们模型图像理解能力的一次跃升。它能在复杂文档、图表和自然图像上进行强有力的推理,并将视觉能力带入感知至关重要的行业,例如工程、制造和地球观测。
该模型还能进一步将视觉定位与智能体能力结合起来:从检视十亿像素级卫星图像——帮助灾害响应团队在争分夺秒时采取行动——到分析工程图纸——放大、检视并核验,直至答案精确无误。在上述演示中,ML4 对密集的自然场景进行定位,核验技术图纸中的机械零件,从 PDF 中检索证据,并扫描海量地理空间图像以寻找最难发现的目标。
尤其在视觉定位方面,我们发现 ML4 是我们测试过的能力最强的模型之一,例如在 Dense 200 上超越了 GPT-6-Astra(42% 对 41%)。
科学与数学
ML4 带来强大的科学能力,这是通过将 AI 驱动的方法与我们研究人员在数学、物理和化学方面的专长相结合而打造的。
它非常擅长面向科学任务的智能体编程,例如数据分析、建模和模拟物理现实,使研究人员能够专注于问题本身,而非繁琐的底层工作。在基准测试中,ML4 在开放权重模型中于 SciCode-Verified 上达到最先进水平。在实践中,它可以一次性生成完整的 Hartree–Fock 模拟——一项由一系列高级例程构建的复杂、多步骤化学任务。
ML4 的数学能力也更强,无论是形式推理还是应用数学。在我们的人工评估中,它的推理比 GLM-5.3 更精确、更有条理,并且能够持续承担长程、特定领域的应用数学任务,包括与前沿理论物理相关的工作。
这些能力共同使 ML4 成为贯穿完整技术工作流程的强大研究助手——从最初的问题到最终的结果。
%25201_1i0lB0.webp%3Fdpl%3D6ac4f7597a7b31848042d469&mode=full&exp=1791504000&sig=b7bba850aec757cf)
SciCode-Verified 测试模型以代码实现复杂科学工作流的能力,领域涵盖物理学、数学、材料科学和生物学。

ML4 与 GLM5.3 在 STEM 任务(数学与物理)上的内部评估
知识工作
ML4 是我们面向专业人士日常处理的真实世界任务能力最强的模型。它可以创建、编辑和修复复杂的电子表格与文档,在法律和金融基准测试中均展现出卓越表现。
值得注意的是,我们通过第三方评估方(vals.ai)针对法律与金融任务的代表性任务对 ML4 进行了评估,发现该模型在两种情况下均超过 GPT-6-Astra。在 HarveyAI 的 Legal Agent 基准测试中,ML4 的表现优于所有开源模型。
FinWorkBench 测试模型在现实生活中的金融与会计用例里创建/编辑电子表格的能力。
金融分析要求精确,以及从多个来源综合信息的能力,而这一过程在当今许多金融机构中仍然十分耗时。在此演示中,ML4 与 Mistral Medium 3.5 接受同一项多步骤公司金融挑战,检索公开的公司申报文件和财务报告,例如可通过 EDGAR 及同等欧洲数据库获取的资料。一幅动画语义地图追踪每个模型走向解决方案的历程,并突出显示沿途检索到的每一份文档。每条轨迹的位置反映已收集的证据、计算的结果以及仍未解决的问题。观看者可以跟随调查如何展开,并比较每个模型在得出最终答案之前所采取的不同路径。
模型安全
ML4 已在我们关于间接提示注入稳健性的基准测试中达到饱和,使其处于开源模型的前沿(对比 GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813)。在 Lakera 公开的 B3 AI Security Benchmark 上,ML4 抵御了 93.3% 的攻击——我们未在竞品中看到更高的分数。
ML4 与用户的互动也比我们以往任何模型都更负责任。我们重点展示其在 KORA Benchmark 上的结果:ML4 再次取得我们在开源模型中测得的最高分(1.691,满分 2 被标为“典范”)。
尤其值得关注的是,该模型倾向于拒绝与网络安全相关的恶意请求。尽管在网络安全基准测试上表现强劲,该模型对来自 JailbreakBench、StrongREJECT 和 AgentHarm 的网络安全提示的平均拒绝率仍高于所有开源模型。
人工评估
我们开展了一项内部评估,来自编程、计算机辅助设计(CAD)、金融、数学和物理领域的专家标注员将 Mistral Large 4 与 GLM-5.3 进行了比较。ML4 在 CAD 和 STEM 领域更受青睐,而在金融和编程方面与 GLM-5.3 持平或接近。

大规模强化学习
基座模型进步很快,我们的后训练必须跟上步伐。为昨日模型调优的方案,会在今日的前沿模型上留下未被发挥的能力,因为曾经把模型推向极限的真实样本如今已不再如此。我们使用强化学习(RL),是因为它会随模型一同适应:我们根据模型自身尝试的结果进行训练,并可以随着它变强而提高任务的难度和广度。
我们的 RL 库旨在让新环境易于添加并大规模训练。一套共享的可组合接口,使单次训练运行能够结合从单轮对话、复杂科学问题求解,到安全对齐、事实性以及长程工具使用等各类任务。这些环境共享脚手架和资源,例如代码沙箱、网页搜索和外部 API。同样的可组合性也延伸到验证环节,可根据每项任务的需要组合奖励模型、单元测试、LLM 评判器和静态检查。
在运行时,一组可自动扩缩的 actor 集群并行生成数万条 rollout,同时模型训练异步进行。生成与训练流水线针对长轨迹进行了优化,支持跨多次压缩、预算达数百万 token 的 rollout,同时将陈旧度保持在较低水平。两个阶段的新方法和优化将离策略漂移降至最低,并实现长程稳定的强化学习。
以我们当前的规模(3k GPU),单次训练运行每天大约产生 330 亿个 token,经过过滤和掩码后,其中约有 160 亿个可训练的补全 token。我们可以直接从训练 rollout 中看到运行进展:随着策略学会解决日益复杂的任务,多个代表性环境中的训练奖励不断上升。以下是几个示例。

这些改进并不局限于我们训练所用的环境;它们会迁移到下游评测,而最终模型的这些提升归功于两个后训练阶段(监督微调与 RL),如图表所示。

接下来
这仅仅是开始。ML4 是我们 30 亿欧元 D 轮融资所支持路线图上的第一个里程碑——这是欧洲科技公司有史以来规模最大的股权融资轮次。这笔资金已经投入使用:我们正在大幅扩展自有欧洲数据中心的算力,未来数月还将有更多算力上线。
更多算力意味着更多训练。此次预览背后的强化学习训练仍在进行中,模型尚未出现饱和迹象——前方仍有相当大的提升空间。随着我们在扩展后的基础设施上扩大训练规模,我们预计未来数周和数月将出现大幅且快速的改进。
我们将在本月底发布权重,并公布更多关于架构、额外基准测试以及后训练方法的细节。而 ML4 只是基础:它将成为新一代专用且经过优化的 Mistral 模型的基座,面向客户最关心的行业与工作负载而打造。
此后的进展速度将会很快。敬请关注。
来源:Mistral AI · mistral.ai