
5分钟给扫描PDF加上可搜索文本层OCRmyPDF 完整使用指南【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF把一沓纸质合同扫进扫描仪得到的往往是一个能看不能搜的 PDFCtrlF 毫无反应想引用一句话只能重新手打。OCRmyPDF 就是为这个场景准备的命令行工具——它在扫描件图像的上面叠加一层肉眼看不见的文本层让文件从此可搜索、可复制而你看到的页面图像保持不变。 它解决的问题给图像 PDF 补一层可搜索文字一句话定位OCRmyPDF 是一个 Python 命令行工具也可作为库调用输入扫描版 PDF输出带文本层的 PDF。几个值得先知道的行为输出默认是PDF/A-2bISO 归档标准字体等资源全部内嵌适合长期存档想要普通 PDF 加--output-type pdf即可自动跳过已经是数字化的页面不会重复识别混合文档也能直接处理默认只识别英文-l eng通过语言参数可覆盖上百种语言详见 docs/languages.md下面这张是项目测试用的扫描文档样本和你在扫描器里拿到的产物形态一致 三分钟装好按你的系统选一行命令三大主流平台都是一条命令的事# macOSHomebrew brew install ocrmypdf # Debian / Ubuntu / WSL apt install ocrmypdf # Fedoratesseract-osd 是识别引擎的依赖 dnf install ocrmypdf tesseract-osdWindows 用户建议走 WSL 或 pip 安装。各平台的完整说明、版本差异比如 Debian 仓库缺少 JBIG2 编码器都写在 docs/installation.md 里。 让扫描件可搜索的最短命令装好后最小可用命令只有两个参数ocrmypdf input.pdf output.pdf它内部做了几件你不需要操心的事逐页检测所需的分辨率和色彩空间把页面栅格化成图像交给 Tesseract 引擎识别文字再把识别结果按原始坐标贴回 PDF。因为是贴回原文件而不是重建文件文档元数据、向量内容、已有链接都得以保留。处理过程实时显示进度和每页的耗时最终还会跑一次 PDF/A 合规校验不通过会直接报错而不是给你一个坏文件。 歪了、倒了怎么修--deskew 和 --rotate-pages手机拍的照片、老式扫描仪的产物常见问题是整页倾斜几度或者横过来了。两个开关各管一件事--deskew检测文本基线角度把轻微倾斜比如 2°~5°旋转回正识别率对这种歪斜非常敏感--rotate-pages判断页面是 0°/90°/180°/270° 哪种方向把横过来或倒着的整页转正两者都打开就是针对歪斜扫描件的标准姿势ocrmypdf --deskew --rotate-pages input.pdf output.pdf。 老文档去背景、顺手导出纯文本泛黄的旧报纸、灰底复印件背景杂色会拖累识别质量。--remove-background会淡化背景、突出文字。如果除了 PDF 还想要一份纯文本喂给全文检索、做数据整理加--sidecar处理完会同时产出一个 txt 文件ocrmypdf --sidecar notes.txt input.pdf output.pdf注意--sidecar和--force-ocr这类强制识别所有页面的选项可以组合但对已有文本层的页面强开只会得到重复的文本。️ 一次跑完整个文件夹的扫描件单个文件是试手真正的工作量在批量。项目内置的批处理方案是把输入输出都接到标准流上配合find原地处理find . -name *.pdf -exec ocrmypdf {} {} \;文件多的时候建议用 GNU Parallel 限制并发parallel -j 2避免几十个进程同时吃满 CPU。完整写法、Docker 版批处理都整理在 docs/batch.md仓库里的 misc/watcher.py 还能把目录监听起来文件一放进去自动处理。处理完成后的效果就是上面这样的界面进度条走完输出校验结果⚙️ 原理一句话整条链路是用 pypdfium2 或 Ghostscript 把每页渲染成图像Tesseract 识别再叠回原 PDF图像预处理去噪、纠斜交给 unpaper。相关外部工具的对接口子都在 src/ocrmypdf/_exec/ 目录想看实现可以直接翻。 下一步挑一个你手上真实的扫描件跑ocrmypdf --deskew --rotate-pages input.pdf output.pdf然后用 CtrlF 搜一个你在原文里确定的词——搜到了这篇教程就白看了。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考