# MinerU 深度研究报告

更新时间：2026-07-07  
项目地址：https://github.com/opendatalab/MinerU  
项目定位：面向 LLM 的文档解析基础设施  

## 一句话结论

MinerU 的核心价值不是“能读 PDF”，而是把复杂文档转成机器可消费、适合 LLM/RAG 下游使用的结构化数据。

## 项目定位

README 明确说 MinerU 面向的是 retrieval、extraction、processing 等下游场景，这让它天然属于 LLM 时代的数据基础设施。它不是给人看的阅读器，而是把文档变成机器可用资产的转换层。

## 核心能力

### 解析能力与格式覆盖

- 支持 PDF、图片、DOCX、PPTX、XLSX，多格式输入统一输出成 Markdown / JSON。
- 处理页眉页脚、复杂布局、图像、表格、公式和 109 种语言 OCR。
- 还能给出布局和 span 可视化，方便人工校验解析质量。

### 部署与工程化能力

- 提供 CLI、FastAPI、Gradio WebUI，支持 CPU、GPU、Apple Silicon 和多服务部署。
- README 里大量讨论 backend、accuracy、并发与生产场景，说明它在往基础设施走。
- 这类能力对于企业级文档处理、RAG 和知识库建设很关键。

## 优势判断

强项是多格式覆盖、结构化输出和工程化意识比较完整，对真正要落地文档解析的团队有实际价值。

## 风险与边界

边界是文档解析本身非常难，复杂版式、扫描件和手写内容仍然会有质量波动；同时它的许可证已经从 AGPL 转成自定义开源许可证，商业使用要仔细看条款。

## 适合人群

适合做 RAG、知识库、文档数据处理、科研文献处理和企业文档数字化的开发者与团队。

## 对个人网站的启发

放进你的项目墙里，它能代表“AI 时代的数据入口层”，和前端、Agent、memory 项目形成很好的基础设施对照。

## 最终判断

MinerU 值得研究，因为它抓住了一个非常底层的问题：模型再强，也需要高质量结构化文档输入。谁把这个入口层做好，谁就更接近真实生产。

## 信息来源

- MinerU GitHub 仓库：https://github.com/opendatalab/MinerU
- MinerU 官网：https://mineru.net/
