最稳妥方案是使用 github.com/unidoc/unipdf/v3 提取 PDF 文本,需调用 unicommon.SetLicenseKey、注册中文字体以解决乱码,并注意其免费版限 10 页;图像型 PDF 需 OCR,可用 pdfcpu extract text 快速判断类型。

用 github.com/unidoc/unipdf/v3 提取 PDF 文本最稳妥
Go 原生不支持 PDF 解析,必须依赖第三方库。目前生产环境最稳定、中文支持较好(需额外配置)的是 unidoc/unipdf/v3,它能处理带字体嵌入、简单加密、多列排版的 PDF,比 pdfcpu 或 gofpdf 更专注文本提取。
注意:unipdf v3 开源版有页数限制(免费最多 10 页),商用需授权;v2 已停止维护,别用。
- 安装命令:
go get github.com/unidoc/unipdf/v3/creator(实际只需model和extractor,但官方推荐装creator一起) - 加载文件前必须调用
unicommon.SetLicenseKey(即使用免费版,否则会 panic) - 中文乱码常见原因:PDF 内嵌字体未映射到系统字体,需手动注册中文字体路径,例如:
pdfcore.RegisterFont("NotoSansCJK", "NotoSansCJKsc-Regular.ttf")
pdfcpu extract text 命令行快速验证是否可行
不是所有 PDF 都能被程序“读出文字”——有些本质是扫描图转成的 PDF(即一堆图片),pdfcpu extract text 会返回空或报错 no text found。先用它快速判断 PDF 类型,省得写 Go 代码白忙。
- 安装:
go install github.com/pdfcpu/pdfcpu/cmd/pdfcpu@latest - 检查结构:
pdfcpu validate -v your.pdf看是否提示contains no content stream(基本就是图像 PDF) - 尝试提取:
pdfcpu extract -mode text your.pdf,若输出为空或只有换行符,说明需要 OCR,Go 本身不带 OCR 能力
用 golang.org/x/image/font/basicfont 处理纯文本 PDF 的轻量方案
如果 PDF 是由 Word/LibreOffice 导出、无复杂样式、无加密、且确认含真实文本流(非图像),可用更轻量的 github.com/pdfcpu/pdfcpu/pkg/api 直接解析内容流,避开 unipdf 的 license 和字体注册负担。
立即学习“go语言免费学习笔记(深入)”;
- 核心函数是
pdfcpu.ReadPdf+pdfcpu.ExtractText,但需自己遍历 pages 并拼接 - 不处理字体映射,对英文和基础 ASCII 安全;遇到
cidfont或toUnicode缺失时,中文仍会显示为方块或乱码 - 性能比 unipdf 快约 30%,内存占用低,适合批量处理已知格式的内部文档
提取后文本换行错乱?重点检查 Page.GetPageContent() 的操作顺序
PDF 中文本位置靠坐标定位,不是天然按阅读顺序排列。直接调 extractor.ExtractTextFromPage 可能导致段落颠倒、标题跑到底部。真正控制顺序得靠底层解析:
- 用
page.GetPageContent().GetTextElements()获取每个TextElement,它含X/Y坐标和FontSize - 按
Y降序分“行”,再按X升序排字块——但要注意:同一行内不同字号/字体可能 Y 值有 ±0.5 差异,需加容差(如math.Abs(y1-y2) ) - 表格类 PDF 更麻烦:相邻单元格 Y 接近但 X 跨度大,硬排序会把表头和数据连成一句,得先检测空白列或竖线坐标
实际项目里,90% 的“提取不准”问题出在没做坐标归一化,而不是库选错了。



















