
Vision Transformer, ViTMAERoBERTa base modelpython train_vqa_basic_trainer.py \
--visual-pretrained "google/vit-base-patch16-224" \
--text-pretrained "roberta-base" \
--device "cuda:0"
| Models | Val acc | Test acc |
|---|---|---|
| ResNet50 + LSTM | 0.5358 | - |
| VisTrans + RoBERTa (pooler_output) | 0.6690 | 0.6636 |
| VisTrans + RoBERTa (last_hidden_state output) | 0.6931 | 0.6874 |
21 commits
Python
100.0%

Vision Transformer, ViTMAERoBERTa base modelpython train_vqa_basic_trainer.py \
--visual-pretrained "google/vit-base-patch16-224" \
--text-pretrained "roberta-base" \
--device "cuda:0"
| Models | Val acc | Test acc |
|---|---|---|
| ResNet50 + LSTM | 0.5358 | - |
| VisTrans + RoBERTa (pooler_output) | 0.6690 | 0.6636 |
| VisTrans + RoBERTa (last_hidden_state output) | 0.6931 | 0.6874 |
21 commits
Python
100.0%