DeepSeek-OCR-2是专为文档结构理解设计的本地工具,支持PDF(自动转图像)、JPG/PNG/WEBP扫描件、导出后的Word/Excel/PPT及打印为PDF的网页;不支持加密PDF、JS渲染网页或ZIP批量上传。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

DeepSeek 本身不直接处理文件格式转换(比如 PDF → Markdown),它是个大语言模型,只处理文本输入。真正能“把各种格式文本统一转为 Markdown”的,是 DeepSeek-OCR-2 这个本地工具——它专为文档结构理解而生,不是普通 OCR。
DeepSeek-OCR-2 能处理哪些输入格式?
它实际接收的是图像类输入,但支持常见办公场景的“软转换”路径:
- PDF:自动转为单页图像序列(无需你手动导出)
- 扫描件 / 手机拍照:JPG、PNG、WEBP 直接拖入即可
- Word、Excel、PPT:需先导出为 PDF 或截图(
DeepSeek-OCR-2不读取 .docx 二进制结构) - 网页内容:建议先用浏览器“打印为 PDF”,再上传
注意:DeepSeek-OCR-2 不解析加密 PDF、不处理带复杂 JavaScript 渲染的动态网页、不支持多图 ZIP 批量上传(需逐个或预打包为单 PDF)。
为什么不能直接喂纯文本给 DeepSeek 模型?
如果你已经复制出一段乱序文字(比如从 PDF 复制粘贴来的“标题正文表格混排”),再丢给 DeepSeek 模型要求“转成 Markdown”,大概率失败。原因很实在:
- 模型看不到原始视觉结构(哪行居中、哪段缩进、表格线在哪)
- 丢失行列关系后,
|列1|列2|表格语法无法重建 - 标题层级靠字体/大小/位置判断,纯文本只剩换行和空格,信号极弱
- 模型会“脑补”结构,结果常出现越级(
###出现在##前)、重复、错位
换句话说:DeepSeek 模型适合“整理已有 Markdown”,不适合“从零重建 Markdown 结构”。结构还原必须交给 DeepSeek-OCR-2。
真正靠谱的一键流程(5 分钟内)
别绕弯子,按这个顺序做:
- 下载官方镜像(
deepseek-ocr2-desktop-v2.3.0-amd64.AppImage或 Windows.exe) - 双击启动,界面里直接拖入 PDF 或图片(支持多选)
- 点击「开始识别」——它自动完成:图像预处理 → 区域分割 → 标题/表格/公式识别 → Markdown 生成
- 预览窗口里检查
#层级、表格对齐、代码块是否被```python包裹 - 点「导出 Markdown」,得到一个可直接拖进 Obsidian / Typora 的
.md文件
关键细节:导出前务必关掉「保留页眉页脚」选项(默认开启),否则每页顶部会插入无关文字;表格若跨页,DeepSeek-OCR-2 会自动加 (续表) 标注,这个行为不可关闭,得手动删。
遇到识别偏差怎么办?
不是所有文档都一次完美。高频问题与对策:
- 标题被识别成正文:说明原 PDF 字体嵌入异常或扫描模糊,用 Adobe Acrobat “增强扫描”预处理后再传
- 表格列错位:不是模型问题,是原始图像中表格线断裂或背景噪点干扰,用画图工具简单描实边框再上传
-
数学公式乱码:确认是否启用「LaTeX 模式」(设置里开关),关闭后公式会转为图片占位符
 - 中英文混排缩进错乱:禁用「自动合并段落」选项(该功能对中文易误判)
最常被忽略的一点:DeepSeek-OCR-2 输出的是 .mmd(Multi-Markdown)超集,部分 Obsidian 插件不认 ~~~mermaid 这类扩展语法,需要手动删或替换为标准 ```mermaid。


















