Visual Document Retrieval & ColPali

21 repos

Visual document retrieval systems that encode documents as images for semantic search and retrieval, centered on the ColPali family of models (ColPali, ColQwen2, ColSmol variants). These repositories implement multimodal vision-language approaches to document understanding, enabling efficient retrieval without optical character recognition. The cluster includes model implementations, benchmarks via the ViDoRe dataset, and infrastructure for working with efficient model serialization formats.

Python · 2
safetensors ·1,347
vidore ·1,347
visual-document-retrieval ·1,333
colpali ·1,299
sentence-transformers ·1,260
en ·1,214
multi-vector ·1,212
vidore-experimental ·725
endpoints_compatible ·121
multilingual-embedding ·71