Multimodal LLM Fine-tuning & Vision-Language Models

12 repos

Fine-tuning and pretraining workflows for vision-language models, particularly LLaVA-based architectures combining large language models (Llama, Gemma) with image encoders (SigLIP). These repositories contain model configurations, training scripts, and implementations for adapting multimodal models to specific tasks and domains while maintaining conversational capabilities. The cluster focuses on practical tools and endpoints compatible with the transformers ecosystem.

Python · 1
llava ·171
llama3-vision ·160
llava-llama3 ·160
llms ·160
multimodal-llms ·160
gemma-2 ·160
deepseek-r1 ·160
llama3-1 ·160
llama3 ·160
siglip ·160