11 repos
Self-supervised learning models for extracting visual features from images using Vision Transformer (ViT) architectures, particularly the DINO family of pre-trained models at various scales. These repositories provide pretrained weights and implementations optimized for image-feature-extraction tasks, leveraging the transformers library and safetensors format for efficient model distribution and inference across compatible endpoints.