MOCR是什么
mocr(multimodal ocr)是由华中科技大学与小红书hi lab联合研发的多模态文档理解模型,仅需30亿参数,便在文档结构化解析与视觉图形重建方面取得显著突破。该模型突破传统ocr仅聚焦文字识别的技术边界,首次将图表、数学公式、流程图等非文本视觉元素精准解析为可编辑、可缩放、可二次开发的svg代码,真正实现“一网打尽式”文档理解新范式。在主流开源ocr模型评测中综合排名第一,其图形重建质量甚至优于gemini 3 pro,在文档智能领域树立全新技术标杆。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

MOCR的主要功能
- 全页面要素识别:支持文字、表格、公式、插图、流程图等所有常见文档组件的端到端识别,输出严格遵循阅读顺序的结构化JSON结果。
- 视觉内容矢量化:将统计图表、科研示意图、UI界面截图等图像内容自动转换为标准SVG源码,保留原始语义与层级关系。
- 多源输入兼容:原生支持PDF文档、网页快照、扫描件、手机拍摄图片等多种真实场景下的输入格式。
- 通用多模态理解:具备视觉问答(VQA)、目标定位(Referring Expression)、图像描述生成等基础视觉语言能力。
-
双模态版本设计:提供通用均衡型
dots.mocr与图形增强型dots.mocr-svg两种版本,适配不同精度与效率需求。
MOCR的关键信息和使用要求
- 研发单位:华中科技大学 × 小红书hi lab
- 模型规模:总计3B参数(含1.2B视觉编码器 + 1.5B语言解码器)
-
模型分支:
dots.mocr(通用版)、dots.mocr-svg(SVG专项优化版) - 技术突破点:首创将图表类视觉元素直接映射为可执行SVG代码,推动OCR从“识别文字”迈向“理解文档”。
- 性能指标:文档解析能力居开源模型首位;图形重建质量超越Gemini 3 Pro。
- 硬件要求:需配备支持CUDA的NVIDIA GPU(推荐A10/A100/V100等显卡用于高效推理)
- 内存需求:显存占用随输入分辨率动态变化,处理高精度扫描件建议≥24GB显存。
MOCR的核心优势
- 高效能比:以仅3B参数量实现媲美甚至超越更大规模模型的效果,兼顾推理速度与精度表现。
- 全模态覆盖:不再局限于文本识别,而是统一建模文字、表格、公式、图表等异构元素,输出一致结构化表达。
- 真正可编辑图形:输出非位图裁剪,而是基于路径、组、文本标签等原生SVG语法构建的矢量代码,支持无缝导入Figma、Illustrator等工具。
- 数据构建创新:构建涵盖PDF原文、网页DOM、SVG源码的跨模态对齐训练数据管道,缓解图形监督信号稀缺难题。
- 评估体系升级:提出OCR Arena评测框架,引入强视觉语言模型作为裁判模型,提升跨模型对比的客观性与可信度。
如何使用MOCR
- 环境搭建:基于Python 3.12创建虚拟环境,克隆官方GitHub仓库并安装全部依赖项。
-
模型获取:运行内置下载脚本拉取预训练权重,注意模型路径中避免出现英文句点(
.)。 - 服务部署:采用vLLM框架加载模型,启用Tensor Parallelism加速GPU推理。
- 文档处理:调用主解析脚本输入图片或PDF,自动生成带坐标标注的JSON、Markdown及可视化热力图。
- SVG导出:针对图表类区域单独调用SVG专用接口,获得语义完整、层级清晰的矢量代码。
- 结果提取:最终输出包含边界框信息的结构化JSON、纯文本摘要、Markdown排版文件及带标注的可视化图像。
MOCR的项目地址
- GitHub开源仓库:https://www.php.cn/link/ac8104196de5509e94247b712f18e8f3
- arXiv技术报告:https://www.php.cn/link/43460166ed53726313e807d5aee32bd9
- 在线交互Demo:https://www.php.cn/link/0be68b6b40bb4c612b9b01aa78bde00f
MOCR的同类竞品对比
| 维度 | MOCR | Gemini 3 Pro | PaddleOCR-VL |
|---|---|---|---|
| **开发方** | 华中科大×小红书 | 谷歌 | 百度 |
| **参数规模** | 3B | 未公开(大得多) | 0.9B |
| **开源状态** | 完全开源 | 闭源API | 开源 |
| **核心定位** | 文档全要素解析+图形重建 | 通用多模态大模型 | 传统文字识别 |
| **文档解析Elo** | 1125(开源第一) | 1211(业界第一) | 920.5 |
| **olmOCR-Bench** | 83.9 | 未公开 | 80.0 |
| **图形处理能力** | 转为SVG代码(可编辑) | 基础识别 | 不支持 |
| **部署方式** | vLLM/Transformers本地部署 | API调用 | 本地部署 |
| **核心优势** | 小参数大能力、图形可编辑化 | 通用能力极强、生态完善 | 轻量快速、中文优化好 |
MOCR的应用场景
- 学术研究:批量解析论文PDF,精准提取LaTeX公式、重建矢量化图表,支撑科研复现与知识再利用。
- 金融分析:自动化处理年报、研报PDF,提取关键财务数据表,并将趋势图、饼图等转化为可编辑SVG或结构化数值。
- 法律合规:对长篇合同、判决书、卷宗材料进行语义级解析,保持条款层级与格式完整性,辅助智能审阅。
- 教育数字化:将纸质教材、试卷、板书照片一键转为结构化电子资源,支持公式编辑、图表复用与题库建设。
- 医疗信息化:解析含分子结构式、解剖示意图、检验报告单的医学文档,助力临床资料结构化归档与AI辅助诊断。



















