QuanSun/EVA-CLIP

Model

117

stars

34

commits

10

repos using this model

6

linked in READMEs

Jun 14, 2023

updated

README

https://github.com/baaivision/EVA/tree/master/EVA-CLIP

Summary of EVA-CLIP performance

summary_tab

Model Card

EVA-01-CLIP Series (MIM teacher: OpenAI CLIP-Large)

model nametotal #paramstraining precisiontraining datatraining batch sizegpus for trainingIN-1K zero-shot top-1MSCOCO T2I R@5weight
EVA01_CLIP_g_14_psz14_s11B1.1Bfp16LAION-400M41K256 A100(40GB)78.568.5πŸ€— HF link (2.2GB)
EVA01_CLIP_g_14_plus_psz14_s11B1.3Bfp16Merged-2B114K112 A100(40GB)79.374.0πŸ€— HF link (2.7GB)

EVA-02-CLIP Series (MIM teacher: EVA01_CLIP_g_14_psz14_s11B)

model nameimage enc. init. ckpttext enc. init. ckpttotal #paramstraining precisiontraining datatraining batch sizegpus for trainingIN-1K zero-shot top-1MSCOCO T2I R@5weight
EVA02_CLIP_B_psz16_s8BEVA02_B_psz14to16openai/clip-vit-base-patch16149Mfp16Merged-2B131K64 A100(40GB)74.766.9πŸ€— HF link (300MB)
EVA02_CLIP_L_psz14_s4BEVA02_L_psz14openai/clip-vit-large-patch14428Mfp16Merged-2B131K128 A100(40GB)79.871.2πŸ€— HF link (856MB)
EVA02_CLIP_L_336_psz14_s6BEVA02_CLIP_L_psz14_224to336EVA02_CLIP_L_psz14_224to336428Mfp16Merged-2B61K128 A100(40GB)80.471.7πŸ€— HF link (856MB)
EVA02_CLIP_E_psz14_s4B.ptEVA02_E_psz14laion/CLIP-ViT-H-14-laion2B-s32B-b79K4.7Bfp16LAION-2B115K144 A100(80GB)81.974.7πŸ€— HF link (9.4GB)
EVA02_CLIP_E_psz14_plus_s9B.ptEVA02_E_psz14laion/CLIP-ViT-bigG-14-laion2B-39B-b160k5.0Bbf16LAION-2B144K144 A100(80GB)82.075.0πŸ€— HF link (10.1GB)
  • To construct Merged-2B, we merged 1.6 billion samples from LAION-2B dataset with 0.4 billion samples from COYO-700M.

  • To our knowledge, EVA-CLIP series are the most performant open-sourced CLIP models at all scales, evaluated via zero-shot classification performance, especially on mainstream classification benchmarks such as ImageNet along with its variants. For more details about EVA-CLIP, please refer to our paper.

Pretrained

model nametotal #paramstraining precisiondownload link
EVA01_g_psz141.0Bfp16πŸ€— HF link (2.0GB)
EVA02_B_psz14to1686Mfp16πŸ€— HF link (176MB)
EVA02_L_psz14304Mfp16πŸ€— HF link (609MB)
EVA02_CLIP_L_psz14_224to336428Mfp16πŸ€— HF link (857MB)
EVA02_E_psz144.4Bfp16πŸ€— HF link (8.7GB)
openai/clip-vit-base-patch16149Mfp16πŸ€— HF link (599MB)
openai/clip-vit-large-patch14428Mfp16πŸ€— HF link (1.7GB)
laion/CLIP-ViT-H-14-laion2B-s32B-b79K1.0Bbf16πŸ€— HF link (3.9GB)
laion/CLIP-ViT-bigG-14-laion2B-39B-b160k1.8Bbf16πŸ€— HF link part1 part2(9.9GB+169M)
  • EVA02_B_psz14to16 interpolates the kernel size of patch_embed from 14x14 to 16x16, and interpolate the pos_embed from 16x16 to 14x14.

  • EVA02_CLIP_L_psz14_224to336 interpolates the pos_embed from 16x16 to 24x24 for training EVA02_CLIP_L_336_psz14_s6B.

  • laion/CLIP-ViT-bigG-14-laion2B-39B-b160k consists of 2 parts of weights, part1 and part2.

Contributors

QuanSun

33 commits

Leyo

1 commits

QuanSun/EVA-CLIP

Model

117

stars

34

commits

10

repos using this model

6

linked in READMEs

Jun 14, 2023

updated

README

https://github.com/baaivision/EVA/tree/master/EVA-CLIP

Summary of EVA-CLIP performance

summary_tab

Model Card

EVA-01-CLIP Series (MIM teacher: OpenAI CLIP-Large)

model nametotal #paramstraining precisiontraining datatraining batch sizegpus for trainingIN-1K zero-shot top-1MSCOCO T2I R@5weight
EVA01_CLIP_g_14_psz14_s11B1.1Bfp16LAION-400M41K256 A100(40GB)78.568.5πŸ€— HF link (2.2GB)
EVA01_CLIP_g_14_plus_psz14_s11B1.3Bfp16Merged-2B114K112 A100(40GB)79.374.0πŸ€— HF link (2.7GB)

EVA-02-CLIP Series (MIM teacher: EVA01_CLIP_g_14_psz14_s11B)

model nameimage enc. init. ckpttext enc. init. ckpttotal #paramstraining precisiontraining datatraining batch sizegpus for trainingIN-1K zero-shot top-1MSCOCO T2I R@5weight
EVA02_CLIP_B_psz16_s8BEVA02_B_psz14to16openai/clip-vit-base-patch16149Mfp16Merged-2B131K64 A100(40GB)74.766.9πŸ€— HF link (300MB)
EVA02_CLIP_L_psz14_s4BEVA02_L_psz14openai/clip-vit-large-patch14428Mfp16Merged-2B131K128 A100(40GB)79.871.2πŸ€— HF link (856MB)
EVA02_CLIP_L_336_psz14_s6BEVA02_CLIP_L_psz14_224to336EVA02_CLIP_L_psz14_224to336428Mfp16Merged-2B61K128 A100(40GB)80.471.7πŸ€— HF link (856MB)
EVA02_CLIP_E_psz14_s4B.ptEVA02_E_psz14laion/CLIP-ViT-H-14-laion2B-s32B-b79K4.7Bfp16LAION-2B115K144 A100(80GB)81.974.7πŸ€— HF link (9.4GB)
EVA02_CLIP_E_psz14_plus_s9B.ptEVA02_E_psz14laion/CLIP-ViT-bigG-14-laion2B-39B-b160k5.0Bbf16LAION-2B144K144 A100(80GB)82.075.0πŸ€— HF link (10.1GB)
  • To construct Merged-2B, we merged 1.6 billion samples from LAION-2B dataset with 0.4 billion samples from COYO-700M.

  • To our knowledge, EVA-CLIP series are the most performant open-sourced CLIP models at all scales, evaluated via zero-shot classification performance, especially on mainstream classification benchmarks such as ImageNet along with its variants. For more details about EVA-CLIP, please refer to our paper.

Pretrained

model nametotal #paramstraining precisiondownload link
EVA01_g_psz141.0Bfp16πŸ€— HF link (2.0GB)
EVA02_B_psz14to1686Mfp16πŸ€— HF link (176MB)
EVA02_L_psz14304Mfp16πŸ€— HF link (609MB)
EVA02_CLIP_L_psz14_224to336428Mfp16πŸ€— HF link (857MB)
EVA02_E_psz144.4Bfp16πŸ€— HF link (8.7GB)
openai/clip-vit-base-patch16149Mfp16πŸ€— HF link (599MB)
openai/clip-vit-large-patch14428Mfp16πŸ€— HF link (1.7GB)
laion/CLIP-ViT-H-14-laion2B-s32B-b79K1.0Bbf16πŸ€— HF link (3.9GB)
laion/CLIP-ViT-bigG-14-laion2B-39B-b160k1.8Bbf16πŸ€— HF link part1 part2(9.9GB+169M)
  • EVA02_B_psz14to16 interpolates the kernel size of patch_embed from 14x14 to 16x16, and interpolate the pos_embed from 16x16 to 14x14.

  • EVA02_CLIP_L_psz14_224to336 interpolates the pos_embed from 16x16 to 24x24 for training EVA02_CLIP_L_336_psz14_s6B.

  • laion/CLIP-ViT-bigG-14-laion2B-39B-b160k consists of 2 parts of weights, part1 and part2.

Contributors

QuanSun

33 commits

Leyo

1 commits