返回 GitHub 雷达在 GitHub 打开
ocrmypdf/OCRmyPDF
42 天前首次出现未被群岛收录1. 解决什么问题:OCRmyPDF 为扫描版 PDF 自动添加可搜索、可复制的 OCR 文本层,解决扫描文档无法检索和复制的问题。 2. 主要技术栈或实现方式:基于 Python 开发,底层调用 Tesseract OCR 引擎,支持 100 多种语言,并以无破坏方式将识别文本精准嵌入原 PDF,同时可生成符合长期存档标准的 PDF/A。 3. 亮点或适用场景:支持自动纠偏、旋转、图像优化、多核并行处理,且保持原图分辨率;特别适合档案数字化、历史文献存档以及需要全文检索与复制的大批量扫描件场景。
Python创建于 2013 年 12 月最近提交 2026 年 8 月
累计 Star
34.3k
近 7 日新增
+53
近 30 日新增
+289
Fork
2,372
Star 趋势
共 17 个采集点 · 近 30 日 +2892026-06-232026-08-03
项目介绍
由 AI 摘自仓库 README1. 解决什么问题:OCRmyPDF 为扫描版 PDF 自动添加可搜索、可复制的 OCR 文本层,解决扫描文档无法检索和复制的问题。
2. 主要技术栈或实现方式:基于 Python 开发,底层调用 Tesseract OCR 引擎,支持 100 多种语言,并以无破坏方式将识别文本精准嵌入原 PDF,同时可生成符合长期存档标准的 PDF/A。
3. 亮点或适用场景:支持自动纠偏、旋转、图像优化、多核并行处理,且保持原图分辨率;特别适合档案数字化、历史文献存档以及需要全文检索与复制的大批量扫描件场景。
仓库信息
Topics
#image-processing#ocr#pdf#python#tesseract
来自雷达
该项目由雷达自动扫描 GitHub 发现,含 Star 增速、提交活跃度与分类标签,中文摘要由 AI 生成。