Una aplicación en Python que captura una región redimensionable de la pantalla en tiempo real, extrae texto mediante Inteligencia Artificial con el modelo Baidu Unlimited-OCR y muestra la traducción traducida al instante sobre una ventana transparente (overlay).
baidu/Unlimited-OCR de Baidu a través de Hugging Face.deep-translator.bfloat16) una sola vez al iniciar para garantizar máxima fluidez.Clona este repositorio:
git clone https://github.com/LuisMauricioBM/screen-ocr-translator.git
cd screen-ocr-translator
Crea y activa un entorno virtual (Recomendado):
En Windows (PowerShell):
python -m venv .venv
.\.venv\Scripts\Activate.ps1
En Windows (CMD):
python -m venv .venv
.venv\Scripts\activate.bat
💡 ¿Error de ejecución de scripts en PowerShell? Si Windows te bloquea al activar el entorno (
...el archivo no se puede cargar porque la ejecución de scripts está deshabilitada...), ejecuta este comando antes en tu consola:Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser
Instala PyTorch con soporte para GPU (CUDA):
pip install torch==2.8.0 torchvision==0.23.0 --index-url https://download.pytorch.org/whl/cu129
Instala el resto de las dependencias necesarias:
pip install -r requirements.txt
Ejecuta el programa desde la terminal:
python main.py
Espera unos segundos a que el modelo cargue en la tarjeta de video (Modelo cargado. Iniciando overlay...).
Mueve la barra gris superior para ubicar el área de lectura sobre el texto que deseas traducir.
Arrastra la esquina inferior derecha si necesitas hacer el área de captura más grande o pequeña.
El texto traducido aparecerá automáticamente en el recuadro cada 1.5 segundos.
baidu/Unlimited-OCRdeep-translatormssEste proyecto está bajo la Licencia MIT.
12 commits
Python
100.0%
Una aplicación en Python que captura una región redimensionable de la pantalla en tiempo real, extrae texto mediante Inteligencia Artificial con el modelo Baidu Unlimited-OCR y muestra la traducción traducida al instante sobre una ventana transparente (overlay).
baidu/Unlimited-OCR de Baidu a través de Hugging Face.deep-translator.bfloat16) una sola vez al iniciar para garantizar máxima fluidez.Clona este repositorio:
git clone https://github.com/LuisMauricioBM/screen-ocr-translator.git
cd screen-ocr-translator
Crea y activa un entorno virtual (Recomendado):
En Windows (PowerShell):
python -m venv .venv
.\.venv\Scripts\Activate.ps1
En Windows (CMD):
python -m venv .venv
.venv\Scripts\activate.bat
💡 ¿Error de ejecución de scripts en PowerShell? Si Windows te bloquea al activar el entorno (
...el archivo no se puede cargar porque la ejecución de scripts está deshabilitada...), ejecuta este comando antes en tu consola:Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser
Instala PyTorch con soporte para GPU (CUDA):
pip install torch==2.8.0 torchvision==0.23.0 --index-url https://download.pytorch.org/whl/cu129
Instala el resto de las dependencias necesarias:
pip install -r requirements.txt
Ejecuta el programa desde la terminal:
python main.py
Espera unos segundos a que el modelo cargue en la tarjeta de video (Modelo cargado. Iniciando overlay...).
Mueve la barra gris superior para ubicar el área de lectura sobre el texto que deseas traducir.
Arrastra la esquina inferior derecha si necesitas hacer el área de captura más grande o pequeña.
El texto traducido aparecerá automáticamente en el recuadro cada 1.5 segundos.
baidu/Unlimited-OCRdeep-translatormssEste proyecto está bajo la Licencia MIT.
12 commits
Python
100.0%