Multimodal Vision-Language Models

1 repo

Models and frameworks for processing and generating text from images, combining visual and language understanding in conversational systems. The cluster centers on InternVL3.5 variants—a family of open vision-language models spanning multiple scales (1B to 240B parameters)—alongside supporting infrastructure for model distribution via safetensors, transformer-based architectures, and integration with conversational interfaces. Repositories here enable image-to-text reasoning, visual question answering, and multimodal dialogue applications.

any-to-image ·8
audio-to-image ·8
diffusers ·8
flux.1 ·8
internvl ·8
minicpm-o ·8
multi-image-to-image ·8
multilingual ·8
qwenvl ·8
speech-to-image ·8