GitHub 雷达
黑马榜 · 第 29首次出现 88 天前

microsoft/markitdown

1. 解决什么问题 / 是什么:将 PDF、Office 文档、图片、音频等数十种文件格式自动转换为结构清晰的 Markdown,便于大语言模型和文本分析流程处理。 2. 主要技术栈或实现方式:基于 Python 构建,通过可选依赖按需支持各类格式解析,并利用插件机制扩展(如 LLM 驱动的 OCR、Azure AI 服务)。 3. 亮点或适用场景:转换结果保留标题、表格、链接等文档结构,对 LLM 友好且 token 高效,特别适合 RAG、文档预处理和分析等 AI 应用场景。

近 7 日
+2,995
累计 Star
185.4k
Fork
13,645
近 30 日
+10,918
Star 趋势 · 65 个采集点
+17%
6 月 23 日9 月 19 日
语言Python
分类工具/CLI
最近提交9 月 17 日
创建时间11 月 14 日
首次收录6 月 23 日 · 自动扫描
README 摘要
1. 解决什么问题 / 是什么:将 PDF、Office 文档、图片、音频等数十种文件格式自动转换为结构清晰的 Markdown,便于大语言模型和文本分析流程处理。 2. 主要技术栈或实现方式:基于 Python 构建,通过可选依赖按需支持各类格式解析,并利用插件机制扩展(如 LLM 驱动的 OCR、Azure AI 服务)。 3. 亮点或适用场景:转换结果保留标题、表格、链接等文档结构,对 LLM 友好且 token 高效,特别适合 RAG、文档预处理和分析等 AI 应用场景。
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开