12 repos
Fine-tuning and pretraining workflows for vision-language models, particularly LLaVA-based architectures combining large language models (Llama, Gemma) with image encoders (SigLIP). These repositories contain model configurations, training scripts, and implementations for adapting multimodal models to specific tasks and domains while maintaining conversational capabilities. The cluster focuses on practical tools and endpoints compatible with the transformers ecosystem.