hoannc0506/Visual-Question-Answering

1

stars

21

commits

Python

primary language

Mar 11, 2024

updated

vision-language-model
vqa

README

Visual Question Answering project

Dataset

VQA COCO dataset

Pipeline

Pipeline

CNN + LSTM approach

  • Image Encoder: ResNet50
  • Text Encoder: BiLSTM

Tranformers approach

  • Image Encoder: Vision Transformer, ViTMAE
  • Text Encoder: RoBERTa base model

Train scripts

python train_vqa_basic_trainer.py \
--visual-pretrained "google/vit-base-patch16-224" \
--text-pretrained "roberta-base" \
--device "cuda:0"

Train results

ModelsVal accTest acc
ResNet50 + LSTM0.5358-
VisTrans + RoBERTa (pooler_output)0.66900.6636
VisTrans + RoBERTa (last_hidden_state output)0.69310.6874

To do

  • Public models
  • Inference code
  • Compare with other models

Contributors

hoannc0506

21 commits

hoannc0506/Visual-Question-Answering

1

stars

21

commits

Python

primary language

Mar 11, 2024

updated

vision-language-model
vqa

README

Visual Question Answering project

Dataset

VQA COCO dataset

Pipeline

Pipeline

CNN + LSTM approach

  • Image Encoder: ResNet50
  • Text Encoder: BiLSTM

Tranformers approach

  • Image Encoder: Vision Transformer, ViTMAE
  • Text Encoder: RoBERTa base model

Train scripts

python train_vqa_basic_trainer.py \
--visual-pretrained "google/vit-base-patch16-224" \
--text-pretrained "roberta-base" \
--device "cuda:0"

Train results

ModelsVal accTest acc
ResNet50 + LSTM0.5358-
VisTrans + RoBERTa (pooler_output)0.66900.6636
VisTrans + RoBERTa (last_hidden_state output)0.69310.6874

To do

  • Public models
  • Inference code
  • Compare with other models

Contributors

hoannc0506

21 commits

Languages

Python

100.0%