LuisMauricioBM/screen-ocr-translator

0

stars

12

commits

Python

primary language

Jul 28, 2026

updated

README

🔍 Real-Time Screen OCR & Translator Overlay

Una aplicación en Python que captura una región redimensionable de la pantalla en tiempo real, extrae texto mediante Inteligencia Artificial con el modelo Baidu Unlimited-OCR y muestra la traducción traducida al instante sobre una ventana transparente (overlay).

Python PyTorch Hugging Face License


✨ Características

  • 🎯 Captura Regional Flotante: Ajusta y mueve la ventana transparente sobre cualquier zona de la pantalla (manga, cómics, videojuegos, PDFs o videos).
  • 🤖 OCR Inteligente con IA: Basado en el modelo baidu/Unlimited-OCR de Baidu a través de Hugging Face.
  • 🌐 Traducción Automática: Traduce en tiempo real del inglés al español utilizando deep-translator.
  • 🖥️ Soporte HiDPI: Corrige desfases de captura causados por el escalado de pantalla en Windows (125%, 150%, etc.).
  • Optimización en GPU: Carga el modelo directamente en la VRAM de la tarjeta de video (CUDA / bfloat16) una sola vez al iniciar para garantizar máxima fluidez.

🛠️ Requisitos e Instalación

Prerrequisitos

  • Sistema Operativo: Windows
  • Python: 3.10 en adelante (Recomendado 3.12 - 3.13)
  • Hardware: Tarjeta gráfica NVIDIA con soporte para CUDA (requerido para PyTorch)

Pasos de Instalación

  1. Clona este repositorio:

    git clone https://github.com/LuisMauricioBM/screen-ocr-translator.git
    cd screen-ocr-translator
    
    
  2. Crea y activa un entorno virtual (Recomendado):

    • En Windows (PowerShell):

      python -m venv .venv
      .\.venv\Scripts\Activate.ps1
      
      
    • En Windows (CMD):

      python -m venv .venv
      .venv\Scripts\activate.bat
      
      

💡 ¿Error de ejecución de scripts en PowerShell? Si Windows te bloquea al activar el entorno (...el archivo no se puede cargar porque la ejecución de scripts está deshabilitada...), ejecuta este comando antes en tu consola:

Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser

  1. Instala PyTorch con soporte para GPU (CUDA):

    pip install torch==2.8.0 torchvision==0.23.0 --index-url https://download.pytorch.org/whl/cu129
    
    
  2. Instala el resto de las dependencias necesarias:

    pip install -r requirements.txt
    
    

🚀 Uso

  1. Ejecuta el programa desde la terminal:

    python main.py
    
    
  2. Espera unos segundos a que el modelo cargue en la tarjeta de video (Modelo cargado. Iniciando overlay...).

  3. Mueve la barra gris superior para ubicar el área de lectura sobre el texto que deseas traducir.

  4. Arrastra la esquina inferior derecha si necesitas hacer el área de captura más grande o pequeña.

  5. El texto traducido aparecerá automáticamente en el recuadro cada 1.5 segundos.


🙏 Créditos y Agradecimientos


📜 Licencia

Este proyecto está bajo la Licencia MIT.

Contributors

LuisMauricioBM

12 commits

LuisMauricioBM/screen-ocr-translator

0

stars

12

commits

Python

primary language

Jul 28, 2026

updated

README

🔍 Real-Time Screen OCR & Translator Overlay

Una aplicación en Python que captura una región redimensionable de la pantalla en tiempo real, extrae texto mediante Inteligencia Artificial con el modelo Baidu Unlimited-OCR y muestra la traducción traducida al instante sobre una ventana transparente (overlay).

Python PyTorch Hugging Face License


✨ Características

  • 🎯 Captura Regional Flotante: Ajusta y mueve la ventana transparente sobre cualquier zona de la pantalla (manga, cómics, videojuegos, PDFs o videos).
  • 🤖 OCR Inteligente con IA: Basado en el modelo baidu/Unlimited-OCR de Baidu a través de Hugging Face.
  • 🌐 Traducción Automática: Traduce en tiempo real del inglés al español utilizando deep-translator.
  • 🖥️ Soporte HiDPI: Corrige desfases de captura causados por el escalado de pantalla en Windows (125%, 150%, etc.).
  • Optimización en GPU: Carga el modelo directamente en la VRAM de la tarjeta de video (CUDA / bfloat16) una sola vez al iniciar para garantizar máxima fluidez.

🛠️ Requisitos e Instalación

Prerrequisitos

  • Sistema Operativo: Windows
  • Python: 3.10 en adelante (Recomendado 3.12 - 3.13)
  • Hardware: Tarjeta gráfica NVIDIA con soporte para CUDA (requerido para PyTorch)

Pasos de Instalación

  1. Clona este repositorio:

    git clone https://github.com/LuisMauricioBM/screen-ocr-translator.git
    cd screen-ocr-translator
    
    
  2. Crea y activa un entorno virtual (Recomendado):

    • En Windows (PowerShell):

      python -m venv .venv
      .\.venv\Scripts\Activate.ps1
      
      
    • En Windows (CMD):

      python -m venv .venv
      .venv\Scripts\activate.bat
      
      

💡 ¿Error de ejecución de scripts en PowerShell? Si Windows te bloquea al activar el entorno (...el archivo no se puede cargar porque la ejecución de scripts está deshabilitada...), ejecuta este comando antes en tu consola:

Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser

  1. Instala PyTorch con soporte para GPU (CUDA):

    pip install torch==2.8.0 torchvision==0.23.0 --index-url https://download.pytorch.org/whl/cu129
    
    
  2. Instala el resto de las dependencias necesarias:

    pip install -r requirements.txt
    
    

🚀 Uso

  1. Ejecuta el programa desde la terminal:

    python main.py
    
    
  2. Espera unos segundos a que el modelo cargue en la tarjeta de video (Modelo cargado. Iniciando overlay...).

  3. Mueve la barra gris superior para ubicar el área de lectura sobre el texto que deseas traducir.

  4. Arrastra la esquina inferior derecha si necesitas hacer el área de captura más grande o pequeña.

  5. El texto traducido aparecerá automáticamente en el recuadro cada 1.5 segundos.


🙏 Créditos y Agradecimientos


📜 Licencia

Este proyecto está bajo la Licencia MIT.

Contributors

LuisMauricioBM

12 commits

Languages

Python

100.0%