小型Vision and Langageモデルを利用した説明文生成アプリケーション。
以下のサイトで公開されているライブラリを使用しており、より使いやすい形で提供することを目的とする。 https://github.com/tosiyuki/LLaVA-JP
小型Vision and Langageモデルを利用した説明文生成アプリケーション
| ライブラリ | バージョン |
|---|---|
| Python | 3.11 |
| CUDA | 12.1.105 |
| cudnn | 9.1.0.70 |
| ライブラリ | バージョン |
|---|---|
| OS | Ubuntu20.04 |
| CPU | 32GB |
| GPU | 8GB [RTX2070SUPER] |
# 使用しているGPUに対応したnvidiaドライバをインストール
# 以下のサイトからダウンロード
# https://www.nvidia.co.jp/Download/index.aspx?lang=jp
# ライブラリのダウンロード
$ git clone https://github.com/open-br/VLM
$ cd VLM
# 環境構築
$ conda create -n llava_jp python=3.11
$ conda activate llava_jp
$ pip install accelerate==0.33.0
$ pip install transformers==4.44.2
$ pip install open-clip-torch==2.26.1
$ pip install einops==0.8.0
# 説明文生成
Usage: python demo_llava.py [-g] [-p prompt] [-i image] [-t version]
-g: GPUフラグ
-p: 指示文
-i: 入力画像ファイル
-t: 指示文の前に入力される役割説明文のバージョン。v1, kara, testが存在する。詳細はllava/conversation.pyに記載。
$ python demo_llava.py -g -p この画像に写っている人の特徴を説明をしてください。 -i imgs/2men.jpg -t test
$ python demo_llava.py -g -p この画像には人が何人いますか? -i imgs/2men.jpg
$ python demo_llava.py -g -p このロボットの色は? -i imgs/body.jpg
GitHub Changelog Generator is released under the Apache License 2.0.
Any questions or suggestions?
You are welcome to discuss it on:
2 commits
Python
90.5%
Shell
9.5%
小型Vision and Langageモデルを利用した説明文生成アプリケーション。
以下のサイトで公開されているライブラリを使用しており、より使いやすい形で提供することを目的とする。 https://github.com/tosiyuki/LLaVA-JP
小型Vision and Langageモデルを利用した説明文生成アプリケーション
| ライブラリ | バージョン |
|---|---|
| Python | 3.11 |
| CUDA | 12.1.105 |
| cudnn | 9.1.0.70 |
| ライブラリ | バージョン |
|---|---|
| OS | Ubuntu20.04 |
| CPU | 32GB |
| GPU | 8GB [RTX2070SUPER] |
# 使用しているGPUに対応したnvidiaドライバをインストール
# 以下のサイトからダウンロード
# https://www.nvidia.co.jp/Download/index.aspx?lang=jp
# ライブラリのダウンロード
$ git clone https://github.com/open-br/VLM
$ cd VLM
# 環境構築
$ conda create -n llava_jp python=3.11
$ conda activate llava_jp
$ pip install accelerate==0.33.0
$ pip install transformers==4.44.2
$ pip install open-clip-torch==2.26.1
$ pip install einops==0.8.0
# 説明文生成
Usage: python demo_llava.py [-g] [-p prompt] [-i image] [-t version]
-g: GPUフラグ
-p: 指示文
-i: 入力画像ファイル
-t: 指示文の前に入力される役割説明文のバージョン。v1, kara, testが存在する。詳細はllava/conversation.pyに記載。
$ python demo_llava.py -g -p この画像に写っている人の特徴を説明をしてください。 -i imgs/2men.jpg -t test
$ python demo_llava.py -g -p この画像には人が何人いますか? -i imgs/2men.jpg
$ python demo_llava.py -g -p このロボットの色は? -i imgs/body.jpg
GitHub Changelog Generator is released under the Apache License 2.0.
Any questions or suggestions?
You are welcome to discuss it on:
2 commits
Python
90.5%
Shell
9.5%