FEATURED · 精选文章

MarkItDown使用指南:一条命令把PDF、Word等文档转成Markdown

发布时间 / 2026/8/28 9:50:02
来源 / 创域科博编辑部
栏目 / 资讯中心
MarkItDown使用指南:一条命令把PDF、Word等文档转成Markdown MarkItDown使用指南一条命令把PDF、Word等文档转成Markdown【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdownMarkItDown 是一个免费开源的 Python 工具用于把 PDF、Word、Excel、PPT、图片、音频、HTML 等文件转换成 Markdown。它自带命令行工具和 Python API装好后一条命令就能把文件转成供 LLM 和文本分析流水线直接读取的 Markdown 文本。适用场景文档转 Markdown 的三种典型用法做 RAG 或 LLM 应用的开发者把大批量 PDF、Office 文档喂给模型前先用 MarkItDown 把语料统一转成 Markdown数据分析师与搜索工程师处理混杂的 PDF、Excel、HTML、CSV 时用它抽取带结构的文本和表格供下游建索引、做分析技术写作者在 Markdown 文章或静态站点里复用 PPT、Word 内容时用它转换初稿并保留标题、列表、表格、链接等结构快速开始一条命令装好并转换第一个文件需要 Python 3.10 及以上版本建议在虚拟环境里安装避免依赖冲突。pip install markitdown[all][all]会一次性装齐所有格式依赖装好后即可使用markitdown命令。转换一份 PDFmarkitdown report.pdf -o report.md不加-o时结果写入标准输出也可以 report.md重定向或用cat report.pdf | markitdown通过管道输入。如果只处理部分格式可以按需组合安装例如pip install markitdown[pdf,docx,pptx]。需要改源码的话克隆仓库git clone https://gitcode.com/GitHub_Trending/ma/markitdown然后在仓库目录执行pip install -e packages/markitdown[all]。核心功能详解格式依赖、插件与云端识别按需安装格式依赖基础包只包含轻量依赖可直接转换 HTML、CSV、JSON、XML 等文本格式、ZIP逐个转换其中内容和 EPub。转换其他格式需要安装对应的可选依赖[pdf]处理 PDF[docx]处理 Word[pptx]处理 PowerPoint[xlsx]、[xls]处理两代 Excel[outlook]处理 Outlook 邮件[audio-transcription]做 wav/mp3 语音转写[youtube-transcription]抓取 YouTube 字幕。各组依赖相互独立可自由组合。用 -p 开启第三方插件与 OCR插件机制默认关闭。先用markitdown --list-plugins查看已安装的插件再用markitdown -p 文件.pdf启用插件转换。例如官方markitdown-ocr插件会用 LLM Vision 抽取 PDF、DOCX、PPTX、XLSX 里嵌入图片的文字没有文本层的扫描页会自动逐页渲染识别不传llm_client时 OCR 会被静默跳过回退到内置转换器。接入 Azure 云端获得更强识别能力内置转换完全离线。当遇到扫描版 PDF、复杂表格或视频、音频时可以接云端-d -e endpoint走 Document Intelligence--use-cu --cu-endpoint endpoint走 Content Understanding后者会按文件类型自动选择分析器并输出 YAML front matter 形式的结构化字段。注意每次被路由的转换都是计费 API 调用。Python 侧同样支持MarkItDown(cu_endpoint...)即可给MarkItDown传入llm_client和llm_model还能让图片文件、pptx 获得 LLM 图片描述。配置与部署命令行参数速查表markitdown命令常用参数参数类型默认值说明-o/--output字符串标准输出输出文件名-x/--extension字符串无扩展名提示用于从 stdin 识别类型-m/--mime-type字符串无MIME 类型提示-c/--charset字符串无字符集提示如 UTF-8-d/--use-docintel布尔false用 Document Intelligence需配合-e--use-cu布尔false用 Content Understanding需配合--cu-endpoint-p/--use-plugins布尔false启用第三方插件--keep-data-uris布尔false输出中保留 base64 图片默认截断仓库根目录自带 Dockerfile预装 ffmpeg 与 exiftool分别支持语音转写和图片元数据提取docker build -t markitdown:latest . docker run --rm -i markitdown:latest ~/file.pdf output.md容器入口就是 markitdown 命令本身文件经 stdin 传入不挂载文件卷。常见问题Q转 PDF 时提示格式不受支持为什么 A基础包不含 PDF 依赖先执行pip install markitdown[pdf]其他格式同理换成对应组名即可。Q扫描版 PDF 里的文字提取不出来怎么办 A内置离线转换器只能提取文本层纯扫描件无效。可装markitdown-ocr插件并传入llm_client、llm_model用 LLM Vision 识别或改用 Azure Content Understanding。Q开了 OCR 插件输出里却没有识别结果 A最常见原因是没传llm_client/llm_model插件会加载但静默跳过 OCR。先用markitdown --list-plugins确认 ocr 在列再检查参数是否传全。Q没有固定扩展名的文件怎么转 A用cat 文件 | markitdown管道输入无法自动识别时配合-x pdf、-m application/pdf给出扩展名与 MIME 提示。Q直接转换不可信用户上传的文件安全吗 AMarkItDown 以当前进程权限做 I/O服务端场景应先校验并限制文件路径与网络目的地并改用范围最小的convert_local()或convert_stream()而不是最宽泛的convert()。MarkItDown 覆盖了最常用的办公与文本格式从安装到转出第一份文档只需一条命令离线场景用内置转换器就够扫描件和复杂版面再叠加 OCR 插件或 Azure 端点。使用时请只处理您有权保存和使用的文件内容。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻