Multilingual Vision-Language Models

43 repos across 3 sub-areas

Multimodal AI systems that combine visual and textual understanding across multiple languages, enabling models to process images alongside conversational input. The cluster centers on the InternVL family of vision-language transformers (ranging from 1B to 241B parameters), which integrate computer vision capabilities with natural language processing. Repositories here represent implementations, variants, and applications of these architectures for tasks like visual question answering, image captioning, and cross-lingual visual reasoning.

Multilingual Vision-Language Models — Shadowgraph