geniuszly/GenImageTextProcessor

is a web-based application built with Gradio that uses the Qwen2-VL-72B model to process both images and textual input

8

stars

3

commits

Python

primary language

Oct 4, 2024

updated

README

EN

GenImageTextProcessor is a web-based application built with Gradio that uses the Qwen2-VL-72B model to process both images and textual input. It provides a platform where users can upload an image, input a text query, and receive responses generated by a state-of-the-art multimodal model.

Features

  • Image & Text Processing: Easily upload an image and ask text-based questions about its content.
  • Multimodal AI Model: Leverages the power of the Qwen2-VL-72B model to understand and respond to the combined input of visual and textual data.
  • Async Processing: Fast and efficient asynchronous handling of user inputs to optimize response times.
  • Simple Interface: User-friendly UI built with Gradio, making it easy to interact with the model.

Installation

To set up and run this project, you need to have Python installed on your system. Follow these steps:

  1. Clone the repository

    git clone https://github.com/geniuszly/GenImageTextProcessor 
    cd GenImageTextProcessor 
    
  2. Install required dependencies

    It is recommended to create a virtual environment:

    python3 -m venv venv
    source venv/bin/activate  
    # On Windows, use `venv\Scripts\activate`
    

    Then install the necessary packages:

    pip install -r requirements.txt
    
  3. Run the application

    python main.py
    
  4. Access the web interface

    Open your browser and go to: http://localhost:7860 to use the application.

Usage

  1. Upload an Image: Use the interface to upload any image you wish to analyze.
  2. Enter a Query: Type in a text query related to the image content.
  3. Get a Response: The model will analyze the image and respond based on your query.

Technologies Used

  • Python: Main programming language for the application.
  • Gradio: For building the user interface.
  • Hugging Face Transformers: To utilize the Qwen2-VL-72B model for image and text processing.
  • PIL: For image processing.

image

RU

GenImageTextProcessor - это веб-приложение, созданное с использованием Gradio, которое использует модель Qwen2-VL-72B для обработки изображений и текстового ввода. Оно предоставляет платформу, где пользователи могут загружать изображение, вводить текстовый запрос и получать ответы, сгенерированные передовой мультимодальной моделью.

Особенности

  • Обработка изображений и текста: Легко загружайте изображение и задавайте вопросы о его содержимом.
  • Мультимодальная AI-модель: Использует возможности модели Qwen2-VL-72B для понимания и реагирования на комбинированный ввод визуальных и текстовых данных.
  • Асинхронная обработка: Быстрая и эффективная асинхронная обработка пользовательских вводов для оптимизации времени ответа.
  • Простой интерфейс: Удобный пользовательский интерфейс на основе Gradio, облегчающий взаимодействие с моделью.

Установка

Для установки и запуска проекта требуется Python. Следуйте этим шагам:

  1. Клонируйте репозиторий

    git clone https://github.com/geniuszly/GenImageTextProcessor 
    cd GenImageTextProcessor 
    
  2. Установите необходимые зависимости

    Рекомендуется создать виртуальное окружение:

    python3 -m venv venv
    source venv/bin/activate  
    # На Windows используйте `venv\Scripts\activate`
    

    Затем установите необходимые пакеты:

    pip install -r requirements.txt
    
  3. Запустите приложение

    python main.py
    
  4. Доступ к веб-интерфейсу

    Откройте браузер и перейдите по адресу: http://localhost:7860, чтобы воспользоваться приложением.

Использование

  1. Загрузите изображение: Используйте интерфейс для загрузки любого изображения, которое вы хотите проанализировать.
  2. Введите запрос: Введите текстовый запрос, связанный с содержанием изображения.
  3. Получите ответ: Модель проанализирует изображение и выдаст ответ на ваш запрос.

Используемые технологии

  • Python: Основной язык программирования для приложения.
  • Gradio: Для создания пользовательского интерфейса.
  • Hugging Face Transformers: Используется для применения модели Qwen2-VL-72B для обработки изображений и текста.
  • PIL: Для обработки изображений.

image

Contributors

geniuszly

3 commits

geniuszly/GenImageTextProcessor

is a web-based application built with Gradio that uses the Qwen2-VL-72B model to process both images and textual input

8

stars

3

commits

Python

primary language

Oct 4, 2024

updated

README

EN

GenImageTextProcessor is a web-based application built with Gradio that uses the Qwen2-VL-72B model to process both images and textual input. It provides a platform where users can upload an image, input a text query, and receive responses generated by a state-of-the-art multimodal model.

Features

  • Image & Text Processing: Easily upload an image and ask text-based questions about its content.
  • Multimodal AI Model: Leverages the power of the Qwen2-VL-72B model to understand and respond to the combined input of visual and textual data.
  • Async Processing: Fast and efficient asynchronous handling of user inputs to optimize response times.
  • Simple Interface: User-friendly UI built with Gradio, making it easy to interact with the model.

Installation

To set up and run this project, you need to have Python installed on your system. Follow these steps:

  1. Clone the repository

    git clone https://github.com/geniuszly/GenImageTextProcessor 
    cd GenImageTextProcessor 
    
  2. Install required dependencies

    It is recommended to create a virtual environment:

    python3 -m venv venv
    source venv/bin/activate  
    # On Windows, use `venv\Scripts\activate`
    

    Then install the necessary packages:

    pip install -r requirements.txt
    
  3. Run the application

    python main.py
    
  4. Access the web interface

    Open your browser and go to: http://localhost:7860 to use the application.

Usage

  1. Upload an Image: Use the interface to upload any image you wish to analyze.
  2. Enter a Query: Type in a text query related to the image content.
  3. Get a Response: The model will analyze the image and respond based on your query.

Technologies Used

  • Python: Main programming language for the application.
  • Gradio: For building the user interface.
  • Hugging Face Transformers: To utilize the Qwen2-VL-72B model for image and text processing.
  • PIL: For image processing.

image

RU

GenImageTextProcessor - это веб-приложение, созданное с использованием Gradio, которое использует модель Qwen2-VL-72B для обработки изображений и текстового ввода. Оно предоставляет платформу, где пользователи могут загружать изображение, вводить текстовый запрос и получать ответы, сгенерированные передовой мультимодальной моделью.

Особенности

  • Обработка изображений и текста: Легко загружайте изображение и задавайте вопросы о его содержимом.
  • Мультимодальная AI-модель: Использует возможности модели Qwen2-VL-72B для понимания и реагирования на комбинированный ввод визуальных и текстовых данных.
  • Асинхронная обработка: Быстрая и эффективная асинхронная обработка пользовательских вводов для оптимизации времени ответа.
  • Простой интерфейс: Удобный пользовательский интерфейс на основе Gradio, облегчающий взаимодействие с моделью.

Установка

Для установки и запуска проекта требуется Python. Следуйте этим шагам:

  1. Клонируйте репозиторий

    git clone https://github.com/geniuszly/GenImageTextProcessor 
    cd GenImageTextProcessor 
    
  2. Установите необходимые зависимости

    Рекомендуется создать виртуальное окружение:

    python3 -m venv venv
    source venv/bin/activate  
    # На Windows используйте `venv\Scripts\activate`
    

    Затем установите необходимые пакеты:

    pip install -r requirements.txt
    
  3. Запустите приложение

    python main.py
    
  4. Доступ к веб-интерфейсу

    Откройте браузер и перейдите по адресу: http://localhost:7860, чтобы воспользоваться приложением.

Использование

  1. Загрузите изображение: Используйте интерфейс для загрузки любого изображения, которое вы хотите проанализировать.
  2. Введите запрос: Введите текстовый запрос, связанный с содержанием изображения.
  3. Получите ответ: Модель проанализирует изображение и выдаст ответ на ваш запрос.

Используемые технологии

  • Python: Основной язык программирования для приложения.
  • Gradio: Для создания пользовательского интерфейса.
  • Hugging Face Transformers: Используется для применения модели Qwen2-VL-72B для обработки изображений и текста.
  • PIL: Для обработки изображений.

image

Contributors

geniuszly

3 commits

Languages

Python

100.0%