Mistral 联合 All Hands AI 发布 Devstral,SWE-Bench Verified 得分 46.8%
Devstral
Mistral AI 联合 All Hands AI 发布编程智能体模型 Devstral,在 SWE-Bench Verified 取得 46.8%,高出此前开源模型逾 6 个百分点。
把 Devstral 在 SWE-Bench Verified 上的 46.8% 与同测试框架下更大的开源模型对照,可以看出轻量智能体编码模型的成绩差距和单机部署门槛。
今天我们推出 Devstral,这是我们面向软件工程任务的智能体 LLM。Devstral 由 Mistral AI 与 All Hands AI 🙌 合作打造,并在 SWE-Bench Verified 上大幅超越所有开源模型。我们以 Apache 2.0 许可证发布 Devstral。

面向软件开发的智能体 LLM
尽管典型的 LLM 擅长原子级编码任务,例如编写独立函数或代码补全,但它们目前仍难以解决现实世界中的软件工程问题。现实开发需要在大型代码库中理解代码上下文、识别不同组件之间的关系,并找出复杂函数中的细微错误。
Devstral 旨在解决这一问题。Devstral 经过训练以解决真实的 GitHub issue;它运行于 OpenHands 或 SWE-Agent 等代码智能体脚手架之上,这些脚手架定义了模型与测试用例之间的接口。在此,我们展示 Devstral 在广受欢迎的 SWE-Bench Verified 基准上的表现,该基准包含 500 个经过人工核验正确性的真实 GitHub issue。
Devstral 在 SWE-Bench Verified 上取得 46.8% 的分数,比此前的开源 SoTA 模型高出 6 个百分点以上。在相同测试脚手架(由 All Hands AI 🙌 提供的 OpenHands)下评估时,Devstral 超越了规模大得多的模型,例如 Deepseek-V3-0324(671B)和 Qwen3 232B-A22B。
在下表中,我们还将 Devstral 与在任意脚手架(包括为模型定制的脚手架)下评估的闭源和开源模型进行比较。我们发现,Devstral 的表现明显优于若干闭源替代方案。例如,Devstral 比近期的 GPT-4.1-mini 高出 20% 以上。
灵活多用:本地部署 ↔️ 企业使用 ↔️ 编程助手
Devstral 足够轻量,可在单张 RTX 4090 或配备 32GB 内存的 Mac 上运行,是本地部署和端侧使用的理想选择。诸如 OpenHands 等编程平台可让模型与本地代码库交互,并快速解决问题。若要亲自试用,请查看文档或教程视频。
该模型的性能也使其适合在企业对隐私敏感的代码仓库上进行智能体编程,尤其是那些受严格安全与合规要求约束的仓库。
最后,如果你正在构建或使用智能体编程 IDE、插件或环境,Devstral 是加入模型选择器的绝佳选择。
可用性
我们以 Apache 2.0 许可证免费发布该模型,供社区在此基础上构建、定制并加速自主软件开发。若要亲自试用,请前往我们的模型卡。
该模型也可通过我们的 API 以 devstral-small-2505 的名称使用,价格与 Mistral Small 3.1 相同:输入 $0.1/M tokens,输出 $0.3/M tokens。
如果你选择自行部署,即日起可在 HuggingFace、Ollama、Kaggle、Unsloth、LM Studio 下载该模型。
对于需要在私有代码库上进行微调,或进行更高保真定制(例如持续预训练,或将 Devstral 的能力蒸馏到其他模型中)的企业部署,请联系我们,与我们的应用 AI 团队沟通。
下一步
Devstral 是研究预览版,我们欢迎反馈!我们正在全力构建一个更大的智能体编程模型,将在未来几周内推出。
有兴趣讨论我们如何帮助您的团队使用 Devstral,以及我们的模型、产品和解决方案组合吗?联系我们,我们将很乐意提供帮助。
来源:Mistral AI · mistral.ai