本插件为 Umi-OCR 提供 26+ 主流AI服务商 的OCR功能,支持云端和本地AI服务的视觉识别API。作为离线OCR的强力补充,为用户提供更高精度、更广泛语言支持的智能文字识别服务。
Umi-OCR 是一款免费、开源、可批量的离线OCR软件,基于 PaddleOCR 开发。它具有以下特点:
| 服务商 | 建议模型 | 特点 |
|---|---|---|
| 硅基流动 (SiliconFlow) | Qwen/Qwen3-VL-235B-A22B-Instruct (强烈推荐,已下线)或 PaddlePaddle/PaddleOCR-VL-1.6 | 开源模型多,价格低,速度快,中文识别准确率超高,强烈推荐 |
| 阿里云百炼 (Alibaba) | Qwen/Qwen3-VL-235B-A22B-Instruct (强烈推荐)/qwen3.7-plus | 顶尖OCR模型,中外文识别极其优秀,强烈推荐 |
| 智谱AI (ZhipuAI) | GLM-4.6V/GLM-OCR | 国产大模型,多模态能力强,相当优秀 |
| 豆包(Doubao) | doubao-seed-2-0-pro/doubao-seed-1-8-251228 | 中文优化效果好,性价比高 |
| OpenAI | gpt-5.5 | 高精度,多语言支持 |
| 自定义OpenAI兼容 (Custom) | 任意兼容模型(如 gpt-4o、qwen-vl-plus 等) | 支持自定义API地址,可接入 vLLM、One API、new-api 中转、自建服务等任意 OpenAI 兼容平台,请求发送到 {地址}/chat/completions |
| Google Gemini | gemini-3.5-pro/gemini-3.5-flash | 速度快,成本低 |
| xAI Grok | grok-4.2 | 创新模型,独特优势 |
| OpenRouter | qwen/qwen2.5-vl-72b-instruct:free | 统一接口,模型丰富 |
| Groq | meta-llama/llama-4-maverick-17b-128e-instruct | 高性能推理,速度极快 |
| 魔搭 (ModelScope) | Qwen/Qwen3-VL-235B-A22B-Instruct (强烈推荐) | 阿里达摩院开源平台,模型丰富,免费使用 |
| 腾讯混元 (Hunyuan) | hy-vision-2.0-instruct | 腾讯自研多模态模型,支持图片理解,OpenAI兼容协议 |
| Mistral AI | mistral-ocr-4-0 (mistral-ocr-latest) | 欧洲AI公司,视觉模型优秀,免费使用 |
| 浦源书生 (Intern) | intern-s2-preview/intern-s1-pro/internvl3.5-241b-a28b | 学术界AI平台,多模态能力强,免费使用,其中intern-s2-preview/intern-s1-pro为优秀OCR模型,中文识别非常优秀,十分推荐 |
| Kimi(月之暗面) | kimi-k2.6/kimi-k2.5 | 月之暗面AI平台,支持视觉模型,长文本处理能力强,支持自定义Base URL |
| NVIDIA NIM | moonshotai/kimi-k2.6 | NVIDIA高性能推理平台,视觉模型优秀,支持自定义Base URL |
| 百度PaddleOCR系列 | V3/V6/VL-1.6 | 百度飞桨平台,支持多语言识别,高效准确解析文档内容,其中PaddleOCR-VL-1.6 为顶尖OCR模型,中外文识别极其优秀,非常推荐 |
| MinerU系列 | pipeline(默认)/vlm(推荐) /MinerU-HTML/MinerU 2.5系列(官网暂未上线,上线后支持直接调用) | 行业领先的文档解析服务商,尤其擅长处理非标准和复杂文档,拥有顶尖OCR模型,中外文识别极其优秀,非常推荐 |
| 小米MiMo | mimo-v2.5 | 小米自研AI模型,支持图片理解,支持专属Base URL(Code套餐用户可使用 token-plan-cn.xiaomimimo.com) |
| Longcat AI | LongCat-Flash-Chat/LongCat-Flash-Thinking | 美团旗下AI平台,兼容OpenAI和Anthropic API格式,每日免费Token额度 |
| Agnes | agnes-2.0-flash | 兼容OpenAI API格式,支持视觉识别,响应速度快 |
| 讯飞星辰 (MaaS) | xoppaddleocrv16/xophunyuanocr | 讯飞开放平台MaaS服务,兼容OpenAI API格式,支持多模态视觉识别。注意模型名需用xop前缀格式 |
| 服务商 | 建议模型 | 特点 |
|---|---|---|
| Ollama | qwen2.5vl:7b, qwen3vl:8b | 🔒 完全离线,隐私保护,免费使用,支持自定义地址 |
| LM Studio | llava, llava-1.5-7b-hf | 🔒 完全离线,图形界面友好,OpenAI兼容,支持自定义地址 |
| llama.cpp | 用户自行加载的视觉模型 | 🔒 完全离线,高性能推理,OpenAI兼容API,支持自定义地址和可选API Key |
💡 自定义地址功能:Ollama、LM Studio 和 llama.cpp 均支持自定义 API 地址,您可以:
- 🌐 连接到局域网内其他机器上的 Ollama/LM Studio/llama.cpp 服务
- ⚡ 在配置较低的机器上运行 Umi-OCR,连接到高性能机器上的 AI 服务
- 🔧 灵活部署,充分利用现有硬件资源
- 📡 支持远程AI服务,实现分布式OCR处理





| 功能 | 描述 |
|---|---|
| 🚀 高精度识别 | 基于最新的AI视觉模型,支持多种语言文字识别 |
| 🌍 多语言支持 | 支持中文、英文、日文、韩文、法文、德文、西班牙文、俄文、阿拉伯文等 |
| ⚡ 多厂商选择 | 支持26+ AI服务商,包括OpenAI、Gemini、xAI、OpenRouter、硅基流动、豆包、Agnes、讯飞星辰等 |
| 📍 坐标提取 | 可选择输出文字的位置坐标信息 |
| 📝 Markdown输出 | 支持以Markdown格式直接输出识别结果,保留标题、列表、表格等结构 |
| 🔧 灵活配置 | 支持图像质量、尺寸、超时等多项参数调整 |
| 🌐 代理支持 | 支持HTTP/SOCKS5代理,适应不同网络环境 |
| ⏱️ 速率限制 | 令牌桶限速(全局设置"每分钟最大请求数"),主动控制单位时间请求数,避免触发429限流 |
| 🔑 密钥池 | 可在API密钥框填写多个密钥(逗号/分号/换行分隔),自动轮询分摊请求压力 |
| 🔄 智能重试 | 自动重试机制,429时指数退避,提高识别成功率 |
| 🚀 并发处理 | 支持批量图片并发识别,提高处理效率 |
| ✏️ 自定义提示词 | 暴露提示词窗口,允许用户根据不同场景自定义识别提示词 |
UmiOCR-data/plugins/
首次配置(推荐一次性配置所有服务商):
日常使用:
onnxruntime 与 opencv-python 后重启。也可在识别策略中直接选择"仅AI高精度识别"。https://tokenhub.tencentmaas.com/v1https://api.moonshot.cn/v1https://integrate.api.nvidia.com/v1https://api.xiaomimimo.com/v1https://token-plan-cn.xiaomimimo.com/v1https://api.longcat.chat/openai/v1https://apihub.agnes-ai.com/v1https://maas-api.cn-huabei-1.xf-yun.com/v2(2026年1月10日后发布服务的用户);存量用户可使用 http://maas-api.cn-huabei-1.xf-yun.com/v1xoppaddleocrv16(PaddleOCR-VL-1.6,默认)xophunyuanocr(HunyuanOCR)安装Ollama:
# Linux/macOS
curl -fsSL https://ollama.ai/install.sh | sh
# Windows
# 从 https://ollama.ai 下载安装包
下载视觉模型:
# 下载llava模型(推荐)
ollama pull llava
# 或下载其他视觉模型
ollama pull llava:7b
ollama pull bakllava
启动服务:
ollama serve
# 服务将在 http://localhost:11434 启动
在插件中配置:
下载安装:
下载模型:
llava-1.5-7b-hf, llava-1.6-34b-hf启动本地服务器:
在插件中配置:
安装llama.cpp:
下载视觉模型:
启动服务:
llama-server -m <模型路径> --host 0.0.0.0 --port 8080
# 服务将在 http://localhost:8080/v1 启动(OpenAI兼容API)
# 如需设置API密钥:llama-server -m <模型路径> --api-key your-secret-key
在插件中配置:
--api-key 则填写对应密钥,否则留空{API地址}/chat/completions,API 密钥与模型名均可自定义。修复 i18n.csv 空行导致翻译表加载失败的问题。xoppaddleocrv16、xophunyuanocr),注明 DeepSeek-OCR 暂不支持 API 调用。PaddleOCR-VL-1.6,默认地址 https://maas-api.cn-huabei-1.xf-yun.com/v2,支持 DeepSeek-OCR、HunyuanOCR 等模型)。agnes-2.0-flash,默认地址 https://apihub.agnes-ai.com/v1)。/services/aigc/multimodal-generation/generation)切换为OpenAI兼容模式(/compatible-mode/v1/chat/completions),与阿里云官方推荐方式一致,响应速度从数分钟降至正常水平。同时优化HTTP客户端连接复用机制,HTTPClient改为复用同一个opener实例,避免每次请求都重建TLS握手和TCP连接,所有平台的多API调用场景(如双通道纠错回退)均受益。'Api' object has no attribute '_get_ocr_prompt' 的问题:_send_nvidia_nim_request方法调用了不存在的_get_ocr_prompt(),修正为接收上游已构建好的prompt参数。如果这个插件对您有帮助,请考虑:
感谢使用 Umi-OCR 多厂商 AI OCR 插件!
Python
100.0%
本插件为 Umi-OCR 提供 26+ 主流AI服务商 的OCR功能,支持云端和本地AI服务的视觉识别API。作为离线OCR的强力补充,为用户提供更高精度、更广泛语言支持的智能文字识别服务。
Umi-OCR 是一款免费、开源、可批量的离线OCR软件,基于 PaddleOCR 开发。它具有以下特点:
| 服务商 | 建议模型 | 特点 |
|---|---|---|
| 硅基流动 (SiliconFlow) | Qwen/Qwen3-VL-235B-A22B-Instruct (强烈推荐,已下线)或 PaddlePaddle/PaddleOCR-VL-1.6 | 开源模型多,价格低,速度快,中文识别准确率超高,强烈推荐 |
| 阿里云百炼 (Alibaba) | Qwen/Qwen3-VL-235B-A22B-Instruct (强烈推荐)/qwen3.7-plus | 顶尖OCR模型,中外文识别极其优秀,强烈推荐 |
| 智谱AI (ZhipuAI) | GLM-4.6V/GLM-OCR | 国产大模型,多模态能力强,相当优秀 |
| 豆包(Doubao) | doubao-seed-2-0-pro/doubao-seed-1-8-251228 | 中文优化效果好,性价比高 |
| OpenAI | gpt-5.5 | 高精度,多语言支持 |
| 自定义OpenAI兼容 (Custom) | 任意兼容模型(如 gpt-4o、qwen-vl-plus 等) | 支持自定义API地址,可接入 vLLM、One API、new-api 中转、自建服务等任意 OpenAI 兼容平台,请求发送到 {地址}/chat/completions |
| Google Gemini | gemini-3.5-pro/gemini-3.5-flash | 速度快,成本低 |
| xAI Grok | grok-4.2 | 创新模型,独特优势 |
| OpenRouter | qwen/qwen2.5-vl-72b-instruct:free | 统一接口,模型丰富 |
| Groq | meta-llama/llama-4-maverick-17b-128e-instruct | 高性能推理,速度极快 |
| 魔搭 (ModelScope) | Qwen/Qwen3-VL-235B-A22B-Instruct (强烈推荐) | 阿里达摩院开源平台,模型丰富,免费使用 |
| 腾讯混元 (Hunyuan) | hy-vision-2.0-instruct | 腾讯自研多模态模型,支持图片理解,OpenAI兼容协议 |
| Mistral AI | mistral-ocr-4-0 (mistral-ocr-latest) | 欧洲AI公司,视觉模型优秀,免费使用 |
| 浦源书生 (Intern) | intern-s2-preview/intern-s1-pro/internvl3.5-241b-a28b | 学术界AI平台,多模态能力强,免费使用,其中intern-s2-preview/intern-s1-pro为优秀OCR模型,中文识别非常优秀,十分推荐 |
| Kimi(月之暗面) | kimi-k2.6/kimi-k2.5 | 月之暗面AI平台,支持视觉模型,长文本处理能力强,支持自定义Base URL |
| NVIDIA NIM | moonshotai/kimi-k2.6 | NVIDIA高性能推理平台,视觉模型优秀,支持自定义Base URL |
| 百度PaddleOCR系列 | V3/V6/VL-1.6 | 百度飞桨平台,支持多语言识别,高效准确解析文档内容,其中PaddleOCR-VL-1.6 为顶尖OCR模型,中外文识别极其优秀,非常推荐 |
| MinerU系列 | pipeline(默认)/vlm(推荐) /MinerU-HTML/MinerU 2.5系列(官网暂未上线,上线后支持直接调用) | 行业领先的文档解析服务商,尤其擅长处理非标准和复杂文档,拥有顶尖OCR模型,中外文识别极其优秀,非常推荐 |
| 小米MiMo | mimo-v2.5 | 小米自研AI模型,支持图片理解,支持专属Base URL(Code套餐用户可使用 token-plan-cn.xiaomimimo.com) |
| Longcat AI | LongCat-Flash-Chat/LongCat-Flash-Thinking | 美团旗下AI平台,兼容OpenAI和Anthropic API格式,每日免费Token额度 |
| Agnes | agnes-2.0-flash | 兼容OpenAI API格式,支持视觉识别,响应速度快 |
| 讯飞星辰 (MaaS) | xoppaddleocrv16/xophunyuanocr | 讯飞开放平台MaaS服务,兼容OpenAI API格式,支持多模态视觉识别。注意模型名需用xop前缀格式 |
| 服务商 | 建议模型 | 特点 |
|---|---|---|
| Ollama | qwen2.5vl:7b, qwen3vl:8b | 🔒 完全离线,隐私保护,免费使用,支持自定义地址 |
| LM Studio | llava, llava-1.5-7b-hf | 🔒 完全离线,图形界面友好,OpenAI兼容,支持自定义地址 |
| llama.cpp | 用户自行加载的视觉模型 | 🔒 完全离线,高性能推理,OpenAI兼容API,支持自定义地址和可选API Key |
💡 自定义地址功能:Ollama、LM Studio 和 llama.cpp 均支持自定义 API 地址,您可以:
- 🌐 连接到局域网内其他机器上的 Ollama/LM Studio/llama.cpp 服务
- ⚡ 在配置较低的机器上运行 Umi-OCR,连接到高性能机器上的 AI 服务
- 🔧 灵活部署,充分利用现有硬件资源
- 📡 支持远程AI服务,实现分布式OCR处理





| 功能 | 描述 |
|---|---|
| 🚀 高精度识别 | 基于最新的AI视觉模型,支持多种语言文字识别 |
| 🌍 多语言支持 | 支持中文、英文、日文、韩文、法文、德文、西班牙文、俄文、阿拉伯文等 |
| ⚡ 多厂商选择 | 支持26+ AI服务商,包括OpenAI、Gemini、xAI、OpenRouter、硅基流动、豆包、Agnes、讯飞星辰等 |
| 📍 坐标提取 | 可选择输出文字的位置坐标信息 |
| 📝 Markdown输出 | 支持以Markdown格式直接输出识别结果,保留标题、列表、表格等结构 |
| 🔧 灵活配置 | 支持图像质量、尺寸、超时等多项参数调整 |
| 🌐 代理支持 | 支持HTTP/SOCKS5代理,适应不同网络环境 |
| ⏱️ 速率限制 | 令牌桶限速(全局设置"每分钟最大请求数"),主动控制单位时间请求数,避免触发429限流 |
| 🔑 密钥池 | 可在API密钥框填写多个密钥(逗号/分号/换行分隔),自动轮询分摊请求压力 |
| 🔄 智能重试 | 自动重试机制,429时指数退避,提高识别成功率 |
| 🚀 并发处理 | 支持批量图片并发识别,提高处理效率 |
| ✏️ 自定义提示词 | 暴露提示词窗口,允许用户根据不同场景自定义识别提示词 |
UmiOCR-data/plugins/
首次配置(推荐一次性配置所有服务商):
日常使用:
onnxruntime 与 opencv-python 后重启。也可在识别策略中直接选择"仅AI高精度识别"。https://tokenhub.tencentmaas.com/v1https://api.moonshot.cn/v1https://integrate.api.nvidia.com/v1https://api.xiaomimimo.com/v1https://token-plan-cn.xiaomimimo.com/v1https://api.longcat.chat/openai/v1https://apihub.agnes-ai.com/v1https://maas-api.cn-huabei-1.xf-yun.com/v2(2026年1月10日后发布服务的用户);存量用户可使用 http://maas-api.cn-huabei-1.xf-yun.com/v1xoppaddleocrv16(PaddleOCR-VL-1.6,默认)xophunyuanocr(HunyuanOCR)安装Ollama:
# Linux/macOS
curl -fsSL https://ollama.ai/install.sh | sh
# Windows
# 从 https://ollama.ai 下载安装包
下载视觉模型:
# 下载llava模型(推荐)
ollama pull llava
# 或下载其他视觉模型
ollama pull llava:7b
ollama pull bakllava
启动服务:
ollama serve
# 服务将在 http://localhost:11434 启动
在插件中配置:
下载安装:
下载模型:
llava-1.5-7b-hf, llava-1.6-34b-hf启动本地服务器:
在插件中配置:
安装llama.cpp:
下载视觉模型:
启动服务:
llama-server -m <模型路径> --host 0.0.0.0 --port 8080
# 服务将在 http://localhost:8080/v1 启动(OpenAI兼容API)
# 如需设置API密钥:llama-server -m <模型路径> --api-key your-secret-key
在插件中配置:
--api-key 则填写对应密钥,否则留空{API地址}/chat/completions,API 密钥与模型名均可自定义。修复 i18n.csv 空行导致翻译表加载失败的问题。xoppaddleocrv16、xophunyuanocr),注明 DeepSeek-OCR 暂不支持 API 调用。PaddleOCR-VL-1.6,默认地址 https://maas-api.cn-huabei-1.xf-yun.com/v2,支持 DeepSeek-OCR、HunyuanOCR 等模型)。agnes-2.0-flash,默认地址 https://apihub.agnes-ai.com/v1)。/services/aigc/multimodal-generation/generation)切换为OpenAI兼容模式(/compatible-mode/v1/chat/completions),与阿里云官方推荐方式一致,响应速度从数分钟降至正常水平。同时优化HTTP客户端连接复用机制,HTTPClient改为复用同一个opener实例,避免每次请求都重建TLS握手和TCP连接,所有平台的多API调用场景(如双通道纠错回退)均受益。'Api' object has no attribute '_get_ocr_prompt' 的问题:_send_nvidia_nim_request方法调用了不存在的_get_ocr_prompt(),修正为接收上游已构建好的prompt参数。如果这个插件对您有帮助,请考虑:
感谢使用 Umi-OCR 多厂商 AI OCR 插件!
Python
100.0%