
MarkItDown 完整指南把办公文档转成 Markdown 的免费 Python 工具【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdownRAG 管道只吃文本你手里的 PDF 研报、Word 纪要却全是二进制LLM 根本读不懂。MarkItDown 就是补这一环的免费工具本地解析 PDF、Word、Excel、PPT、图片、音频转成带标题、列表、表格的 Markdown结构不丢一条命令就能跑。两条命令装好并跑通转换 ⚡环境要求 Python 3.10 及以上。想省事就装全量依赖几乎所有格式开箱即用只要 PDF 和 Word 就装小一点的组合依赖更干净pip install markitdown[all] # 或者只装 PDF Word 所需依赖 pip install markitdown[pdf, docx]装完直接转markitdown report.pdf -o report.md-o report.md让结果直接落盘成文件不带这个参数结果打印到标准输出可以markitdown report.pdf out.md或接进 shell 管道。支持从标准输入读cat report.pdf | markitdown适合脚本里现读现转。不想用命令行Python 里三行就够from markitdown import MarkItDown md MarkItDown() print(md.convert(report.xlsx).text_content)convert吃本地路径、远程地址、字节流都行。另有 Docker 镜像可自建一条docker run进文件、标准输出出 Markdown。什么人在什么场景用它研究员/开发研报 PDF 进 RAG。批量转 PDF 和 Word标题层级、表格、链接都保留下来。切块向量化之后召回的句子语义完整不会把一段表格切成乱码——这是它最典型的用法。数据分析师Excel 周报喂给 LLM。xlsx、xls、CSV 都变成 Markdown 表格LLM 直接读数字就能生成总结句不用再解析单元格坐标。内容运营YouTube 链接变字幕稿。丢个视频链接进去字幕以 Markdown 文本回来做二创素材或摘要很方便。档案管理员ZIP 归档整包处理。把攒的一批扫描件或素材打成一个 zip 丢进去内部文件逐个转换后统一入库省得手动解压再循环。图片/音频用户要元数据。图片默认输出 EXIF 元数据音频做 EXIF 元数据加语音转写需装[audio-transcription]可选依赖。默认关闭的进阶能力各花各的代价接大模型给图片写描述图片本身没文字时默认只吐 EXIF 元数据。在构造时传入llm_client和llm_modelOpenAI 兼容客户端即可转 PPT 和图片时大模型会生成一段文字描述塞进结果。仓库测试目录里有一张专门验证这个功能的样例图代价当前只对 pptx 和图片生效每次转换都消耗 token。OCR 插件扫描件里图片的文字也能捞出来pip install markitdown-ocr装上这个插件PDF、Word、PPT、Excel 转换器会顺带识别文档里图片中的文字复用同一套llm_client/llm_model不引入新的 ML 库和二进制依赖。注意一个坑没传llm_client时插件照常加载但 OCR 静默跳过回退到普通转换不会报错提醒你。配置细节见 OCR 插件说明。Azure 云服务用云端布局分析补质量本地转复杂文档总差一口气时可以接 Azure Document Intelligence命令行加-d -e endpoint或 Content Understanding--use-cu --cu-endpoint ...云端布局分析和 OCR 对扫描件、复杂表格更稳Content Understanding 还能把发票金额、日期这类字段抽成 YAML front matter也是唯一能处理视频文件的路。代价说破每次转换都是一次计费的云端 API 调用。第三方插件列表之外的格式markitdown --list-plugins看装了哪些插件转换时加-p启用。插件默认全部关闭不传这个参数等于没装。排错速查症状 → 原因 → 解法 某类文件一转就报错→ 缺对应可选依赖 → 按格式补装如pip install markitdown[pdf]完整清单见 README。从管道读入时识别不出文件类型→ 没有扩展名线索 → 用-x指定扩展名或用-c指定字符集、-m指定 MIME 类型做提示。装了 OCR 插件但结果里没有图片文字→ 没传llm_client时 OCR 静默跳过 → 确认构造MarkItDown时传了llm_client和llm_model且-p已启用。结构丢得厉害→ 排版越复杂越容易丢 → 先抽一份检查实在复杂换 Azure 云服务或接受精度损失。怀疑某个格式的实现有 bug各格式的转换逻辑都在 转换模块目录按文件名_pdf_converter.py、_xlsx_converter.py……定位即可。能力边界这些活别交给它它喂的是给管道读的结构化文本不是像素级还原。想要和原文件长得一模一样的版式它做不到。需要逐页人工校对的法律文书、财务报表别指望它一步到位。视频文件本地完全不支持只有走 Content Understanding 云服务这条路。一句话定位它是批量清洗进文本管道的工具不是排版引擎需要保真输出时直接换专用排版工具省时间。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考