Mistral AI 发布 OCR 4——具有区块、边框和置信分数的文本识别系统
Mistral
Mistral AI 推出了 Mistral OCR 4,这是一种新的光学字符识别系统,能够提取文本的区块边界、类型(如标题、表格、公式等)以及每个单词的置信分数。该模型支持 170 种语言,可部署在单个容器中以确保完全数据隐私,并在人类评估中以 72% 的平均偏好率优于其他 OCR 系统。
Mistral AI 发布了 Mistral OCR 4,这是一款新型光学字符识别模型,不仅能提取文本,还能返回边界框、按类型(标题、表格、方程、图注等)分类的区块以及每个单词的置信度评分。该模型支持 10 个语系中的 170 种语言,并且可以部署在单个容器中实现完全本地数据存储。在针对 12 种以上语言的 600 多份文档进行的人类评估中,独立评估员更倾向于选择 OCR 4 而不是所有测试过的 OCR 系统和文档人工智能服务,平均偏好率为 72%。在公开基准测试 OlmOCRBench 上,该模型得分为 85.20 分,在测试系统中排名第一。在 OmniDocBench 基准测试中得分为 93.07 分,但该公司指出自动测试存在已知局限性:部分差异源于参考数据中的错误、等效数学符号、方程分段以及多栏文档的阅读顺序。OCR 4 已集成到 Mistral Search Toolkit(一个开放搜索框架)中,并且可通过 API(每 1000 页 4 美元,批处理模式享受 50% 折扣,即 2 美元)或 Mistral Studio 中的文档人工智能(每 1000 页 5 美元)获取。文档人工智能增加了按指定模式输出结构化 JSON 和图像注释的功能。该模型推荐用于文档解析、RAG(检索增强生成)、代理工作流程、企业搜索和发票处理。公司强调,OCR 4 不适用于医疗诊断、法律裁决或安全关键系统。
来源: Mistral AI —
原文
