返回 GitHub 雷达在 GitHub 打开
microsoft/markitdown
41 天前首次出现未被群岛收录1. 解决什么问题 / 是什么:将 PDF、Office 文档、图片、音频等数十种文件格式自动转换为结构清晰的 Markdown,便于大语言模型和文本分析流程处理。 2. 主要技术栈或实现方式:基于 Python 构建,通过可选依赖按需支持各类格式解析,并利用插件机制扩展(如 LLM 驱动的 OCR、Azure AI 服务)。 3. 亮点或适用场景:转换结果保留标题、表格、链接等文档结构,对 LLM 友好且 token 高效,特别适合 RAG、文档预处理和分析等 AI 应用场景。
Python创建于 2024 年 11 月最近提交 2026 年 7 月
累计 Star
171.2k
近 7 日新增
+1,728
近 30 日新增
+8,961
Fork
12,459
Star 趋势
共 17 个采集点 · 近 30 日 +8,9612026-06-232026-08-03
项目介绍
由 AI 摘自仓库 README1. 解决什么问题 / 是什么:将 PDF、Office 文档、图片、音频等数十种文件格式自动转换为结构清晰的 Markdown,便于大语言模型和文本分析流程处理。
2. 主要技术栈或实现方式:基于 Python 构建,通过可选依赖按需支持各类格式解析,并利用插件机制扩展(如 LLM 驱动的 OCR、Azure AI 服务)。
3. 亮点或适用场景:转换结果保留标题、表格、链接等文档结构,对 LLM 友好且 token 高效,特别适合 RAG、文档预处理和分析等 AI 应用场景。
仓库信息
Topics
#autogen#autogen-extension#langchain#markdown#microsoft-office#openai#pdf
来自雷达
该项目由雷达自动扫描 GitHub 发现,含 Star 增速、提交活跃度与分类标签,中文摘要由 AI 生成。