Vision-Language Pre-training and Retrieval

10 repos

Multi-modal models that combine visual and textual understanding for tasks like image-text retrieval, visual question answering, and unified vision-language representation learning. The cluster centers on pre-trained foundation models (including variants optimized with LoRA fine-tuning) and their evaluation through vision-language benchmarks, with particular emphasis on Chinese language support and cross-modal alignment techniques.

Python · 4
Jupyter Notebook · 2
vision-language ·14,540
vision-and-language-pre-training ·11,718
image-text-retrieval ·11,718
pretrained-models ·9,054
chinese ·9,054
visual-question-answering ·8,534
image-captioning ·8,267
transformers ·6,797
contrastive-loss ·6,006
computer-vision ·6,006