Vision-Language Models & Multimodal AI

16 repos

Large-scale multimodal models that combine vision and language capabilities, enabling AI systems to understand and reason about both images/videos and text together. This cluster covers instruction-tuning approaches for vision-language models, video understanding frameworks, and techniques for integrating visual information with language model reasoning. Repositories here span foundational model architectures, training methodologies, and practical applications of multimodal AI across image and video domains.

Python · 12
JavaScript · 1
Jupyter Notebook · 1
large-language-models ·30,564
multimodal-large-language-models ·30,347
instruction-tuning ·20,017
large-vision-language-models ·19,014
large-vision-language-model ·18,223
in-context-learning ·18,006
multimodal-chain-of-thought ·18,006
chain-of-thought ·18,006
instruction-following ·18,006
multimodal-in-context-learning ·18,006