Local-first document parsing workbench for five OCR models: PDF/Office to Markdown with WebUI, model switching, CLI and Apple Silicon support.
128
stars
69
commits
Python
primary language
Sep 10, 2026
updated
把 PDF、图片和 Office 文档变成可编辑 Markdown 的本地文档工作台。 一套界面运行五种 OCR / 文档解析模型,结果留在自己的机器上,并支持批处理、CLI、Apple Silicon 以及可编辑、可搜索导出。
English · 快速开始 · CLI · 硬件兼容表 · 路线图 · 参与贡献
| 你的需求 | 推荐入口 |
|---|---|
| 私密文档不想上传云端 | 本地 WebUI,任务和结果保存在本机 |
| 单卡显存有限 | PP-OCRv6 / OvisOCR2,并按需切换模型 |
| 论文、表格、公式解析 | PaddleOCR-VL 1.6 或 HPD-Parsing |
| 批量自动化 | CLI、目录批处理或 Watch Folder |
| Apple Silicon | macOS 原生路径或 OvisOCR2 MLX |
| 模型 | 适合任务 | 推荐硬件 | 特点 |
|---|---|---|---|
| PaddleOCR-VL 1.6 | 复杂版面、表格、公式 | NVIDIA 12 GB+ | PaddleOCR 文档解析主线 |
| PP-OCRv6 | 普通文字识别、低显存场景 | NVIDIA 4 GB+ | 启动快、资源占用低;CPU Lite 在路线图中 |
| OvisOCR2 | 文档理解、Apple Silicon | NVIDIA 8 GB+ / Apple Silicon | macOS 默认使用 MLX |
| HPD-Parsing | 高质量文档解析 | NVIDIA 8 GB+ | 官方定制 vLLM 运行时 |
| NaviDC-OCR | 复杂文档、版面、表格与公式 | NVIDIA 8 GB+ | 官方 NaviOCRClient vLLM 异步两阶段流程(可选 Transformers 后端) |
数值是项目的启动兼容性参考,不代表所有文档都能在该下限稳定运行。请查看完整硬件兼容表。
提前安装 NVIDIA 驱动和支持 GPU 的 Docker Desktop,然后运行:
.\windows-one-click.bat -DryRun
.\windows-one-click.bat
支持 Apple M1、M2、M3、M4,OvisOCR2 默认使用 MLX:
make doctor
./macos-one-click.command
make doctor
cp env.docker env.txt
./build.sh
./deploy.sh
部署完成后打开 http://localhost:8000。五个默认逻辑模型分别受 Compose profile 保护;部署脚本只创建未运行的待机容器,由控制器启动一个选定模型。切换时必须先完整停止旧模型并释放显存,确认后才启动新模型,因此任意时刻显存只驻留当前选择的一个逻辑模型;绝不会通过裸 docker compose up 同时加载多个模型。首次运行需要下载镜像或模型,耗时取决于网络和所选模型。高级配置请查看 Docker 部署文档。想先快速演示导出与恢复流程,可使用 60 秒快速演示。
详细变化见 CHANGELOG。
good first issue。欢迎 Star、Fork、提交 Issue 和 Pull Request。项目采用 Apache-2.0 许可证。
PaddleOCR Local 是社区项目,并非 PaddlePaddle 官方产品。PaddleOCR 及其他模型名称归各自权利人所有。
68 commits
1 commits
Python
58.2%
JavaScript
27.3%
Shell
7.0%
PowerShell
3.4%
CSS
2.1%
Local-first document parsing workbench for five OCR models: PDF/Office to Markdown with WebUI, model switching, CLI and Apple Silicon support.
128
stars
69
commits
Python
primary language
Sep 10, 2026
updated
把 PDF、图片和 Office 文档变成可编辑 Markdown 的本地文档工作台。 一套界面运行五种 OCR / 文档解析模型,结果留在自己的机器上,并支持批处理、CLI、Apple Silicon 以及可编辑、可搜索导出。
English · 快速开始 · CLI · 硬件兼容表 · 路线图 · 参与贡献
| 你的需求 | 推荐入口 |
|---|---|
| 私密文档不想上传云端 | 本地 WebUI,任务和结果保存在本机 |
| 单卡显存有限 | PP-OCRv6 / OvisOCR2,并按需切换模型 |
| 论文、表格、公式解析 | PaddleOCR-VL 1.6 或 HPD-Parsing |
| 批量自动化 | CLI、目录批处理或 Watch Folder |
| Apple Silicon | macOS 原生路径或 OvisOCR2 MLX |
| 模型 | 适合任务 | 推荐硬件 | 特点 |
|---|---|---|---|
| PaddleOCR-VL 1.6 | 复杂版面、表格、公式 | NVIDIA 12 GB+ | PaddleOCR 文档解析主线 |
| PP-OCRv6 | 普通文字识别、低显存场景 | NVIDIA 4 GB+ | 启动快、资源占用低;CPU Lite 在路线图中 |
| OvisOCR2 | 文档理解、Apple Silicon | NVIDIA 8 GB+ / Apple Silicon | macOS 默认使用 MLX |
| HPD-Parsing | 高质量文档解析 | NVIDIA 8 GB+ | 官方定制 vLLM 运行时 |
| NaviDC-OCR | 复杂文档、版面、表格与公式 | NVIDIA 8 GB+ | 官方 NaviOCRClient vLLM 异步两阶段流程(可选 Transformers 后端) |
数值是项目的启动兼容性参考,不代表所有文档都能在该下限稳定运行。请查看完整硬件兼容表。
提前安装 NVIDIA 驱动和支持 GPU 的 Docker Desktop,然后运行:
.\windows-one-click.bat -DryRun
.\windows-one-click.bat
支持 Apple M1、M2、M3、M4,OvisOCR2 默认使用 MLX:
make doctor
./macos-one-click.command
make doctor
cp env.docker env.txt
./build.sh
./deploy.sh
部署完成后打开 http://localhost:8000。五个默认逻辑模型分别受 Compose profile 保护;部署脚本只创建未运行的待机容器,由控制器启动一个选定模型。切换时必须先完整停止旧模型并释放显存,确认后才启动新模型,因此任意时刻显存只驻留当前选择的一个逻辑模型;绝不会通过裸 docker compose up 同时加载多个模型。首次运行需要下载镜像或模型,耗时取决于网络和所选模型。高级配置请查看 Docker 部署文档。想先快速演示导出与恢复流程,可使用 60 秒快速演示。
详细变化见 CHANGELOG。
good first issue。欢迎 Star、Fork、提交 Issue 和 Pull Request。项目采用 Apache-2.0 许可证。
PaddleOCR Local 是社区项目,并非 PaddlePaddle 官方产品。PaddleOCR 及其他模型名称归各自权利人所有。
68 commits
1 commits
Python
58.2%
JavaScript
27.3%
Shell
7.0%
PowerShell
3.4%
CSS
2.1%