Joy Caption WebUI 是一个基于 LLaVA 模型的图像标注工具,可以为图像生成详细的描述性标注。
21
stars
20
commits
Python
primary language
Jul 30, 2025
updated
Joy Caption WebUI 是一个基于 LLaVA 模型的图像标注工具,可以为图像生成详细的描述性标注。
本项目是基于 fpgaminer/joycaption 项目进行的二次开发和界面优化。在此特别感谢原项目作者的开源贡献,为图像标注领域提供了优秀的基础工具。原项目实现了核心的图像标注功能,本项目在此基础上增强了用户界面和使用体验。



克隆仓库并进入项目目录:
git clone https://github.com/AdamShuo/joycaption_webui.git
cd joycaption_webui
创建虚拟环境并激活:
python -m venv venv
source venv/bin/activate # Linux/macOS
安装依赖:
pip install --upgrade pip
pip install -r requirements.txt
运行程序(见下方使用方法)
克隆仓库并进入项目目录:
git clone https://github.com/AdamShuo/joycaption_webui.git
cd joycaption_webui
创建虚拟环境并激活:
python -m venv venv
venv\Scripts\activate
安装依赖:
pip install --upgrade pip
pip install -r requirements.txt
运行程序(见下方使用方法)
如果您使用 Conda 管理环境,可以按照以下步骤操作:
克隆仓库并进入项目目录:
git clone https://github.com/AdamShuo/joycaption_webui.git
cd joycaption_webui
创建 Conda 环境并激活:
conda create -n joycaption python=3.10
conda activate joycaption
安装依赖:
pip install --upgrade pip
pip install -r requirements.txt
models 目录(如果不存在),并将模型文件放置在以下目录:
./models/llama-joycaption-beta-one-hf-llava/./models/llama-joycaption-alpha-two-hf-llava/依赖安装问题:如果安装依赖时遇到问题,可以尝试逐个安装关键依赖:
pip install torch torchvision
pip install transformers
pip install gradio
pip install -r requirements.txt
CUDA 相关错误:确保您的 PyTorch 版本与您的 CUDA 版本兼容。可以使用以下命令检查 PyTorch 是否能检测到 CUDA:
python -c "import torch; print(torch.cuda.is_available())"
内存不足:如果运行时出现内存不足错误,可以尝试减小批处理大小或使用较小的模型。
我们提供了两个Shell脚本,方便您快速启动JoyCaption2:
./run_joy2_gradio.sh
可选参数:
--share:创建公共链接以便远程访问--server_name:服务器名称(默认:0.0.0.0)--server_port:服务器端口(默认:7860)例如:
./run_joy2_gradio.sh --share --server_port 8080
./run_joy2.sh --input_dir /path/to/images --output_dir /path/to/output --model "Beta One"
主要参数:
--input_dir:输入图片目录路径--output_dir:输出标注文本目录路径(默认为输入目录)--prompt:标注提示词--model:选择模型("Beta One" 或 "Alpha Two")--max_tokens:生成的最大 token 数(默认:300)--temperature:生成温度(默认:0.6)--top_p:top-p 采样参数(默认:0.9)这两个脚本会自动激活虚拟环境,运行相应的Python文件,然后退出虚拟环境。
如果您已经激活了虚拟环境,也可以直接运行Python文件:
python joy2_gradio.py
python joy2.py --input_dir /path/to/images --output_dir /path/to/output --model "Beta One"
Joy Caption 支持以下模型:
Beta One:最新版本的模型,提供更准确的图像描述
Alpha Two:早期版本的模型,适用于特定场景
程序会自动从Hugging Face Hub下载模型(如果本地不存在),无需手动下载。下载过程中会显示进度条,包括文件名、大小和下载速度。
## 缓存管理
Joy Caption 2 提供了缓存管理功能,您可以:
1. 在Web界面的"缓存管理"标签页查看缓存信息
2. 查看缓存目录和已缓存的模型文件数量
3. 查看缓存总大小
4. 刷新缓存信息
5. 清除模型缓存
使用 Web 界面:
本项目采用 Apache License 2.0 开源许可证。
完整的许可证文本请查看: JoyCaption许可证
模型使用请遵循原始许可证条款。
如有问题或建议,请通过以下方式联系:
16 commits
4 commits
Python
98.8%
Shell
1.2%
Joy Caption WebUI 是一个基于 LLaVA 模型的图像标注工具,可以为图像生成详细的描述性标注。
21
stars
20
commits
Python
primary language
Jul 30, 2025
updated
Joy Caption WebUI 是一个基于 LLaVA 模型的图像标注工具,可以为图像生成详细的描述性标注。
本项目是基于 fpgaminer/joycaption 项目进行的二次开发和界面优化。在此特别感谢原项目作者的开源贡献,为图像标注领域提供了优秀的基础工具。原项目实现了核心的图像标注功能,本项目在此基础上增强了用户界面和使用体验。



克隆仓库并进入项目目录:
git clone https://github.com/AdamShuo/joycaption_webui.git
cd joycaption_webui
创建虚拟环境并激活:
python -m venv venv
source venv/bin/activate # Linux/macOS
安装依赖:
pip install --upgrade pip
pip install -r requirements.txt
运行程序(见下方使用方法)
克隆仓库并进入项目目录:
git clone https://github.com/AdamShuo/joycaption_webui.git
cd joycaption_webui
创建虚拟环境并激活:
python -m venv venv
venv\Scripts\activate
安装依赖:
pip install --upgrade pip
pip install -r requirements.txt
运行程序(见下方使用方法)
如果您使用 Conda 管理环境,可以按照以下步骤操作:
克隆仓库并进入项目目录:
git clone https://github.com/AdamShuo/joycaption_webui.git
cd joycaption_webui
创建 Conda 环境并激活:
conda create -n joycaption python=3.10
conda activate joycaption
安装依赖:
pip install --upgrade pip
pip install -r requirements.txt
models 目录(如果不存在),并将模型文件放置在以下目录:
./models/llama-joycaption-beta-one-hf-llava/./models/llama-joycaption-alpha-two-hf-llava/依赖安装问题:如果安装依赖时遇到问题,可以尝试逐个安装关键依赖:
pip install torch torchvision
pip install transformers
pip install gradio
pip install -r requirements.txt
CUDA 相关错误:确保您的 PyTorch 版本与您的 CUDA 版本兼容。可以使用以下命令检查 PyTorch 是否能检测到 CUDA:
python -c "import torch; print(torch.cuda.is_available())"
内存不足:如果运行时出现内存不足错误,可以尝试减小批处理大小或使用较小的模型。
我们提供了两个Shell脚本,方便您快速启动JoyCaption2:
./run_joy2_gradio.sh
可选参数:
--share:创建公共链接以便远程访问--server_name:服务器名称(默认:0.0.0.0)--server_port:服务器端口(默认:7860)例如:
./run_joy2_gradio.sh --share --server_port 8080
./run_joy2.sh --input_dir /path/to/images --output_dir /path/to/output --model "Beta One"
主要参数:
--input_dir:输入图片目录路径--output_dir:输出标注文本目录路径(默认为输入目录)--prompt:标注提示词--model:选择模型("Beta One" 或 "Alpha Two")--max_tokens:生成的最大 token 数(默认:300)--temperature:生成温度(默认:0.6)--top_p:top-p 采样参数(默认:0.9)这两个脚本会自动激活虚拟环境,运行相应的Python文件,然后退出虚拟环境。
如果您已经激活了虚拟环境,也可以直接运行Python文件:
python joy2_gradio.py
python joy2.py --input_dir /path/to/images --output_dir /path/to/output --model "Beta One"
Joy Caption 支持以下模型:
Beta One:最新版本的模型,提供更准确的图像描述
Alpha Two:早期版本的模型,适用于特定场景
程序会自动从Hugging Face Hub下载模型(如果本地不存在),无需手动下载。下载过程中会显示进度条,包括文件名、大小和下载速度。
## 缓存管理
Joy Caption 2 提供了缓存管理功能,您可以:
1. 在Web界面的"缓存管理"标签页查看缓存信息
2. 查看缓存目录和已缓存的模型文件数量
3. 查看缓存总大小
4. 刷新缓存信息
5. 清除模型缓存
使用 Web 界面:
本项目采用 Apache License 2.0 开源许可证。
完整的许可证文本请查看: JoyCaption许可证
模型使用请遵循原始许可证条款。
如有问题或建议,请通过以下方式联系:
16 commits
4 commits
Python
98.8%
Shell
1.2%