Mistral 推出光学字符识别 API Mistral OCR
Mistral OCR
Mistral 推出 OCR API Mistral OCR,可将图片和 PDF 提取为有序交错的文本与图像,并作为 Le Chat 数百万用户的默认文档理解模型。
官方公布了复杂文档理解的内部基准、每美元页数和单节点处理速度,便于对照现有 OCR 服务评估精度与接入成本。
纵观历史,信息抽象与检索的进步推动了人类发展。从象形文字到纸莎草纸,从印刷机到数字化,每一次飞跃都使人类知识更易获取、更可付诸行动,从而推动进一步创新。
如今,我们正站在下一次重大飞跃的临界点——解锁所有数字化信息的集体智能。全球约 90%的组织数据以文档形式存储,为了利用这一潜力,我们推出Mistral OCR。
Mistral OCR 是一款光学字符识别 API,为文档理解树立了新标准。与其他模型不同,Mistral OCR 能以前所未有的准确性与认知能力理解文档的每个元素——媒体、文本、表格、公式。它以图像和 PDF 作为输入,并以有序交错的文本和图像形式提取内容。
因此,Mistral OCR 是与以多模态文档(如幻灯片或复杂 PDF)为输入的 RAG 系统结合使用的理想模型。
我们已将 Mistral OCR 设为 Le Chat 上数百万用户进行文档理解的默认模型,并以 1000 pages / $ 的价格发布 API mistral-ocr-latest(使用批量推理时,每美元可处理的页数大约翻倍)。该 API 今日已在我们的开发者套件 la Plateforme上提供,即将登陆我们的云与推理合作伙伴,以及本地部署。
亮点
对复杂文档的最先进理解
原生多语言与多模态
顶级基准测试
同类中速度最快
文档即提示,结构化输出
面向处理高度敏感或机密信息的组织,可选择性提供自托管
让我们逐一深入了解。
对复杂文档的最先进理解
Mistral OCR 擅长理解复杂的文档元素,包括交错图像、数学表达式、表格以及 LaTeX 排版等高级版式。该模型能够更深入地理解富文档,例如包含图表、图形、公式和插图的科学论文。
下面是该模型将给定 PDF 中的文本及图像提取到 markdown 文件的示例。你可以访问该 notebook 此处。
下面是 PDF 及其相应 OCR 输出的并排对比。将鼠标悬停在滑块 上,即可在输入与输出之间切换。
表格 + 插图

OCR 结果

数学

OCR 结果

印地语

OCR 结果

文档

OCR 结果

阿拉伯语

OCR 结果

顶级基准测试
Mistral OCR 在严格的基准测试中持续优于其他领先的 OCR 模型。其在文档分析多个方面的卓越准确性如下所示。我们会连同文本一起从文档中提取嵌入的图像。下面比较的其他 LLM 不具备这一能力。为了公平比较,我们在内部“纯文本”测试集上对它们进行评估,该测试集包含各类出版论文以及来自网络的 PDF;如下:
模型 | 总体 | 数学 | 多语言 | 扫描 | 表格 |
|---|---|---|---|---|---|
Google Document AI | 83.42 | 80.29 | 86.42 | 92.77 | 78.16 |
Azure OCR | 89.52 | 85.72 | 87.52 | 94.65 | 89.52 |
Gemini-1.5-Flash-002 | 90.23 | 89.11 | 86.76 | 94.87 | 90.48 |
Gemini-1.5-Pro-002 | 89.92 | 88.48 | 86.33 | 96.15 | 89.71 |
Gemini-2.0-Flash-001 | 88.69 | 84.18 | 85.80 | 95.11 | 91.46 |
GPT-4o-2024-11-20 | 89.77 | 87.55 | 86.00 | 94.58 | 91.70 |
Mistral OCR 2503 | 94.89 | 94.29 | 89.55 | 98.96 | 96.12 |
原生多语言
自 Mistral 创立以来,我们一直立志以模型服务全世界,并因此在各项产品中力求实现多语言能力。Mistral OCR 将这一能力提升到新的高度,能够解析、理解并转录遍布各大洲的数千种文字、字体和语言。这种多功能性对于处理多元语言背景文档的全球性组织,以及服务利基市场的超本地化企业而言都至关重要。
模型 | 生成中的模糊匹配 |
|---|---|
Google-Document-AI | 95.88 |
Gemini-2.0-Flash-001 | 96.53 |
Azure OCR | 97.31 |
Mistral OCR 2503 | 99.02 |
按语言划分的基准测试:
语言 | Azure OCR | Google Doc AI | Gemini-2.0-Flash-001 | Mistral OCR 2503 |
|---|---|---|---|---|
ru | 97.35 | 95.56 | 96.58 | 99.09 |
fr | 97.50 | 96.36 | 97.06 | 99.20 |
hi | 96.45 | 95.65 | 94.99 | 97.55 |
zh | 91.40 | 90.89 | 91.85 | 97.11 |
pt | 97.96 | 96.24 | 97.25 | 99.42 |
de | 98.39 | 97.09 | 97.19 | 99.51 |
es | 98.54 | 97.52 | 97.75 | 99.54 |
tr | 95.91 | 93.85 | 94.66 | 97.00 |
uk | 97.81 | 96.24 | 96.70 | 99.29 |
it | 98.31 | 97.69 | 97.68 | 99.42 |
ro | 96.45 | 95.14 | 95.88 | 98.79 |
同类别中速度最快
Mistral OCR 比同类别中的大多数模型更轻量,速度也显著快于同类产品,在单个节点上每分钟最多可处理 2000 页。快速处理文档的能力即使在高吞吐量环境中也能确保持续学习与改进。
文档即提示,结构化输出
Mistral OCR 还引入了将文档用作提示的方式,从而实现更强大、更精确的指令。该能力使用户能够从文档中提取特定信息,并将其格式化为结构化输出,例如 JSON。用户可以将提取的输出串联到下游函数调用中并构建智能体。参见此示例 笔记本.
可按选择性方式自行托管
对于数据隐私要求严格的组织,Mistral OCR 提供自行托管选项。这可确保敏感或机密信息在您自己的基础设施内保持安全,从而符合监管与安全标准。如果您希望与我们探讨自行部署,请告知我们。
用例
我们正助力测试版客户通过将其庞大的文档库转化为行动与解决方案,来提升其组织知识。我们的技术正在产生重大影响的一些关键用例包括:
科学研究数字化:领先的研究机构一直在试用 Mistral OCR,将科学论文和期刊转换为 AI 就绪格式,使其可供下游智能引擎访问。这已促成可衡量的更快协作,并加速了科研工作流程。
保存历史与文化遗产:作为遗产保管者的组织与非营利机构一直在使用 Mistral OCR 将历史文献和文物数字化,以确保其得以保存,并让更广泛的受众能够访问。
优化客户服务:客户服务部门正在探索使用 Mistral OCR,将文档和手册转化为可索引的知识,从而缩短响应时间并提高客户满意度。
让设计、教育、法律等领域的文献具备 AI 就绪能力:Mistral OCR 也在帮助企业将技术文献、工程图纸、讲义、演示文稿、监管申报文件等转换为可索引、可直接作答的格式,从而在数百万份文档中释放智能与生产力。
今天就来体验
Mistral OCR 功能可在 le Chat 上免费试用。如需试用 API,请前往 la Plateforme。我们非常希望收到您的反馈;预计该模型将在未来数周内持续变得更好。作为我们战略合作计划的一部分,我们还将在 选择性基础 上提供本地部署。
来源:Mistral AI · mistral.ai