21 repos
Visual document retrieval systems that encode documents as images for semantic search and retrieval, centered on the ColPali family of models (ColPali, ColQwen2, ColSmol variants). These repositories implement multimodal vision-language approaches to document understanding, enabling efficient retrieval without optical character recognition. The cluster includes model implementations, benchmarks via the ViDoRe dataset, and infrastructure for working with efficient model serialization formats.