10 repos
Pre-trained vision-language models (VLE) built on ViLT for visual question answering and visual commonsense reasoning tasks. The cluster centers on PyTorch-based transformer implementations optimized for endpoints-compatible deployment, with model variants spanning base and large architectures tuned for different downstream tasks like VQA and visual commonsense reasoning question-answering.