跳到正文
原文
The Decoder· Jonathan Kemper·· 2 小时前AI 评分66

Mistral 发布万亿参数模型 Mistral Large 4 并开放公开预览

Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work

AI 导读

Mistral 已放出迄今最大模型 Mistral Large 4 的公开预览,API 可通过 Mistral Studio 使用,权重预计 10 月底发布。

正文 · AI 翻译

Mistral 发布了 Mistral Large 4,这是其迄今为止最大的模型。它拥有一万亿参数,并在该公司自有的欧洲数据中心完成训练。在一项独立指数中,该模型取得了大幅跃升,但仍远不及领先的闭源模型。Mistral 的主要卖点是,它能处理 Claude 和 GPT-6 拒绝触及的安全任务。

Mistral 已发布 Mistral Large 4(ML4)的公开预览版,昵称为“le Chonk”。API 现已可通过 Mistral Studio 使用。模型权重预计将于十月底随后发布。

据 Mistral 称,ML4 是一个原生多模态模型,拥有一万亿参数,其中 490 亿处于激活状态。该公司在 X 上表示,ML4 是美国或欧洲在综合基准测试中表现最好的开放权重模型。它声称在网络防御、制造业和金融领域达到业界领先水平,并表示在视觉定位方面甚至超过了闭源前沿模型。

对 Mistral 而言是一次大跃升,但 Claude 仍领先 20 分

一项独立评估来自 Artificial Analysis 的 Intelligence Index,该指数汇总了不同领域的十项基准测试。ML4 在其中得分为 38 分。这对 Mistral 来说是一次重大进步:其前代模型 Mistral Large 3 在该指数中仅得 9 分,而最新的 Mistral Medium 3.5 得分为 14 分。以 38 分的成绩,ML4 也略微超过了 Z.ai 的 GLM-5.2,而 Mistral 在自己的平台上提供该模型。但与顶尖水平的差距仍然很大。Claude Opus 5.5 (Max) 以 58 分领先。

Balkendiagramm des Artificial Analysis Intelligence Index mit 25 Modellen, angeführt von Claude Opus 5.5 mit 58 Punkten vor Claude Sonnet 5.5 mit 56 sowie Claude Fable 5.1, GPT-6 Astra und Gemini 4 Argon mit je 53 Punkten; Mistral Large 4 Preview liegt mit 38 Punkten im hinteren Mittelfeld gleichauf mit GPT-6 Luna.
在 Artificial Analysis Intelligence Index 中,Mistral Large 4 落后于 Anthropic、OpenAI 和 Google 的领先闭源模型,也落后于若干来自中国的开放权重模型。由于权重尚未发布,ML4 目前仍被列为专有模型。

在权重发布之前,Mistral 正与安全公司、经过审核的合作伙伴以及政府机构对该模型进行红队测试。这些机构获得的是同一版本,但内容审核有所放宽,网络能力则有所扩展。

Balkendiagramm zu SciCode-Verified pass@1 mit Mistral Large 4 Preview bei 91,8 Prozent im Vergleich zu elf Modellen, darunter GPT-6 Astra mit 94,2, Qwen3.8 mit 93,8 und Claude Opus 5 mit 91,3 Prozent.
Mistral Large 4 在科学编程方面得分接近前列,不过 GPT-6 Astra 和 Qwen3.8 的分数仍然更高。

Mistral 的网络安全优势部分来自竞争对手拒绝执行该任务

Mistral 将公告的大部分篇幅用于介绍 IT 安全。据该公司称,在 Artificial Analysis Cyber Index 中,ML4 位列全球前五。在中国以外开发的开放权重模型中,它以大幅优势领先。

一项测试要求模型复现开源软件中的一个真实漏洞,然后对其进行修补。ML4 达到 82%,是所有模型中的最高分。不过原因有些不同寻常。据 Mistral 称,Claude Opus 5.5 和 GPT-6 Astra 得分接近于零,因为它们完全拒绝执行该任务。因此,这项测试衡量的既是模型能力,也同样是提供商的政策。

Mistral 将这一点变成了卖点。该公司认为,防御软件往往始于证明某个漏洞确实存在。闭源模型上的安全过滤器恰恰会阻止这类工作,而攻击者无论如何都会对这些模型进行越狱。Mistral 补充说,在事件处理过程中失去对提供商的访问权限,本身就可能成为一种安全风险。ML4 的设计也支持在私有云或本地环境中运行。

与此同时,Mistral 宣称拒绝率很高。面对来自 JailbreakBench、StrongREJECT 和 AgentHarm 的恶意网络提示,ML4 的拒绝频率高于任何其他开放模型。至于该模型如何可靠地区分正当的漏洞研究与攻击准备,Mistral 并未解释。据该公司称,在 Lakera 的 B3 AI Security Benchmark 中,ML4 拦截了 93.3% 的攻击。

ML4 在编程方面位居第二,领先于 Deepseek 和 Qwen

在编程方面,ML4 在 Artificial Analysis Coding Agent Index 中得分为 49.8%,领先于 Deepseek V4 Pro 和 Qwen3.8 Max。Mistral 还与 Surge AI 进行了盲测,专业标注人员在不知道代码由哪个模型生成的情况下对代码质量评分。ML4 在五个模型中以满分 5 分得到 3.74 分,位居第二,领先于 GLM-5.3 和 Kimi K3。Claude Opus 5 以 4.22 分领先。

Balkendiagramm mit der gewichteten Gewinnrate von ML4 gegenüber GLM-5.3 nach Bereich, STEM 68, CAD 62, Finance 50 und Code 48.
人类评估者在 STEM 和 CAD 任务中更偏好 ML4,而两个模型在金融和代码方面的表现大致相当。

在图像理解方面,Mistral 声称有重大改进。ML4 应当能够分析文档、图表、十亿像素卫星图像和技术图纸,并自行放大、核查细节。不过,相对封闭模型的领先优势很小。在 Dense 200 基准测试中,ML4 得分为 42%,而 GPT-6 Astra 为 41%。根据 Vals.ai 的评估,ML4 在法律和金融任务上也胜过 GPT-6 Astra。

Balkendiagramm zu AutomationBench von Artificial Analysis mit Mistral Large 4 Preview bei 59,9, GLM-5.3 bei 62,2, Kimi K3 bei 58,3, Qwen3.8 bei 57,2, DeepSeek V4 Pro bei 56,7, GLM-5.2 bei 28,4 und Mistral Medium 3.5 bei 6,3.
在自动化业务流程方面,Mistral Large 4 略逊于 GLM-5.3,但胜过 Kimi K3 和 Deepseek V4 Pro。

以欧洲主权为商业模式

Mistral 表示,ML4 是在其自有的欧洲数据中心内、使用 3,800 块 Nvidia Grace Blackwell GPU 从零开始训练的。预览版运行在同一基础设施上。除了在多个地区提供服务外,Mistral 还计划推出一个完全由自己运营、独立于其他服务提供商、并受欧洲法律管辖的欧洲版本。训练数据涵盖 160 多种语言,包括所有欧盟官方语言。

据 Mistral 称,训练是与金融、制造、物流、制药、航运和公共部门的公司合作进行的。该公司使用了通过 Mistral Forge 向客户提供的同一套训练和 RL 环境。在强化学习后训练阶段,Mistral 使用约 3,000 块 GPU。单次训练运行每天大约生成 330 亿个 token。

训练尚未完成

Mistral 表示,预览版背后的 RL 训练仍在进行,且没有出现趋于平稳的迹象。该公司预计未来数周将有显著改进。算力扩张由 30 亿欧元的 D 轮融资 提供资金,这是欧洲科技公司有史以来规模最大的股权融资轮次。

Drei Liniendiagramme zeigen Benchmark-Werte über die Trainingsschritte, gelb für Supervised Fine-Tuning und orange für Reinforcement Learning, mit Endwerten von 68,84 Prozent, 38,66 Prozent und 1.511.
据 Mistral 称,监督微调和随后的 RL 阶段都提升了下游基准测试的结果。

目前仍有许多情况尚不明确。根据 模型文档,ML4 采用细粒度混合专家架构,总参数量为 1.05 万亿,视觉编码器参数量为 16 亿。上下文窗口长达一百万个 token。Mistral 计划在本月底随权重一同发布架构细节、许可证和后训练方法。

在预览期间,Mistral 对每百万输入 token 收费 $0.68,对每百万输出 token 收费 $2.09。缓存输入的费用为 $0.07。文档中还列出了这些费率两倍的价格:输入 $1.36、输出 $4.18、缓存输入 $0.14。ML4 也将作为新一代专用 Mistral 模型的基础。

数月来,Mistral 一直在欧洲建设自有基础设施。3 月,该公司获得了一笔用于巴黎附近数据中心的 $830 million 贷款,并计划到 2027 年底在欧洲部署 200 megawatts 的算力。该公司似乎正将重心从消费者转向企业客户。5 月,Mistral 将其聊天机器人 Le Chat 更名为 Vibe,并将其重建为工作工具。

同月,Mistral 首席执行官 Arthur Mensch 警告法国议会委员会,欧洲在网络安全方面有依赖美国模型的风险。Mensch 表示,法国军方的代码库不应由 Anthropic 的 Mythos 扫描。他还补充说,Mistral 自己的模型能够发现那些与 Mythos 相关联的相同漏洞。

来源:The Decoder · the-decoder.com