GitHub 雷达
首次出现 88 天前

ocrmypdf/OCRmyPDF

1. 解决什么问题:OCRmyPDF 为扫描版 PDF 自动添加可搜索、可复制的 OCR 文本层,解决扫描文档无法检索和复制的问题。 2. 主要技术栈或实现方式:基于 Python 开发,底层调用 Tesseract OCR 引擎,支持 100 多种语言,并以无破坏方式将识别文本精准嵌入原 PDF,同时可生成符合长期存档标准的 PDF/A。 3. 亮点或适用场景:支持自动纠偏、旋转、图像优化、多核并行处理,且保持原图分辨率;特别适合档案数字化、历史文献存档以及需要全文检索与复制的大批量扫描件场景。

近 7 日
+89
累计 Star
34.8k
Fork
2,412
近 30 日
+313
Star 趋势 · 57 个采集点
+2%
6 月 23 日9 月 19 日
语言Python
分类工具/CLI
最近提交9 月 17 日
创建时间12 月 20 日
首次收录6 月 23 日 · 自动扫描
README 摘要
1. 解决什么问题:OCRmyPDF 为扫描版 PDF 自动添加可搜索、可复制的 OCR 文本层,解决扫描文档无法检索和复制的问题。 2. 主要技术栈或实现方式:基于 Python 开发,底层调用 Tesseract OCR 引擎,支持 100 多种语言,并以无破坏方式将识别文本精准嵌入原 PDF,同时可生成符合长期存档标准的 PDF/A。 3. 亮点或适用场景:支持自动纠偏、旋转、图像优化、多核并行处理,且保持原图分辨率;特别适合档案数字化、历史文献存档以及需要全文检索与复制的大批量扫描件场景。
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开