TahaKoleilat/BiomedCoOp

Dataset

1

stars

30

commits

3

linked in READMEs

May 31, 2026

updated

biology
few-shot-learning
medical
vision-language-model
Browse cluster: Biomedical Data and Multimodal Learning

README

Biomedical Few-shot Image Classification for Vision-Language Models

paper paper paper Code Code Code

Overview

Recent advancements in vision-language models (VLMs), such as CLIP, have demonstrated substantial success in self-supervised representation learning for vision tasks. However, effectively adapting VLMs to downstream applications remains challenging, as their accuracy often depends on time-intensive and expertise-demanding prompt engineering, while full model fine-tuning is costly. This is particularly true for biomedical images, which, unlike natural images, typically suffer from limited annotated datasets, unintuitive image contrasts, and nuanced visual features. Recent prompt learning techniques, such as Context Optimization (CoOp) intend to tackle these issues, but still fall short in generalizability. Meanwhile, explorations in prompt learning for biomedical image analysis are still highly limited. In this work, we propose BiomedCoOp, a novel prompt learning framework that enables efficient adaptation of BiomedCLIP for accurate and highly generalizable few-shot biomedical image classification. Our approach achieves effective prompt context learning by leveraging semantic consistency with average prompt ensembles from Large Language Models (LLMs) and knowledge distillation with a statistics-based prompt selection strategy. We conducted comprehensive validation of our proposed framework on 11 medical datasets across 9 modalities and 10 organs against existing state-of-the-art methods, demonstrating significant improvements in both accuracy and generalizability.

Datasets Description

ModalityOrgan(s)NameClasses# train/val/test
Computerized TomographyKidneyCTKidneyKidney Cyst, Kidney Stone, Kidney Tumor, Normal Kidney6221/2487/3738
DermatoscopySkinDermaMNISTActinic Keratosis, Basal Cell Carcinoma, Benign Keratosis, Dermatofibroma, Melanocytic nevus, Melanoma, Vascular Lesion7007/1003/2005
EndoscopyColonKvasirDyed Lifted Polyps, Normal Cecum, Esophagitis, Dyed Resection Margins, Normal Pylorus, Normal Z Line, Polyps, Ulcerative Colitis2000/800/1200
Fundus PhotographyRetinaRETINACataract, Diabetic Retinopathy, Glaucoma, Normal Retina2108/841/1268
HistopathologyLung, ColonLC25000Colon Adenocarcinoma, Colon Benign Tissue, Lung Adenocarcinoma, Lung Benign Tissue, Lung Squamous Cell Carcinoma12500/5000/7500
HistopathologyColorectalCHMNISTAdipose Tissue, Complex Stroma, Debris, Empty Background, Immune Cells, Normal Mucosal Glands, Simple Stroma, Tumor Epithelium2496/1000/1504
Magnetic Resonance ImagingBrainBTMRIGlioma Tumor, Meningioma Tumor, Normal Brain, Pituitary Tumor2854/1141/1717
Magnetic Resonance ImagingBrainBTMRI-PGlioma Tumor, Meningioma Tumor, Normal Brain, Pituitary Tumor8000/0/1000
Magnetic Resonance ImagingBrainBTMRI-SGlioma Tumor, Meningioma Tumor, Normal Brain, Pituitary Tumor2451/0/529
Magnetic Resonance ImagingBrainBRISCGlioma Tumor, Meningioma Tumor, Normal Brain, Pituitary Tumor2498/0/1000
Optical Coherence TomographyRetinaOCTMNISTChoroidal Neovascularization, Drusen, Diabetic Macular Edema, Normal97477/10832/1000
UltrasoundBreastBUSIBenign Tumors, Malignant Tumors, Normal Scans389/155/236
UltrasoundBreastBUIDBenign Tumors, Malignant Tumors162/0/36
UltrasoundBreastBUSBRABenign Tumors, Malignant Tumors1311/0/283
UltrasoundBreastUDIATBenign Tumors, Malignant Tumors113/0/26
X-RayChestCOVID-QU-ExCOVID-19, Lung Opacity, Normal Lungs, Viral Pneumonia10582/4232/6351
X-RayKneeKneeXrayNo, Doubtful, Minimal, Moderate, and Severe Osteoarthritis5778/826/1656

Download the datasets

All the datasets can be found here on HuggingFace. Download each dataset seperately:

Domain Generalization Datasets

After downloading each dataset, unzip and place each under its respective directory like the following

BTMRI/
|–– BTMRI/
|   |–– glioma_tumor/
|   |–– meningioma_tumor/
|   |–– normal_brain/
|   |–– pituitary_tumor/
|–– split_BTMRI.json

Citation

If you use our work, please consider citing:

@inproceedings{koleilat2025biomedcoop,
  title={Biomedcoop: Learning to prompt for biomedical vision-language models},
  author={Koleilat, Taha and Asgariandehkordi, Hojat and Rivaz, Hassan and Xiao, Yiming},
  booktitle={Proceedings of the Computer Vision and Pattern Recognition Conference},
  pages={14766--14776},
  year={2025}
}

@article{
koleilat2026clipsvd,
title={{CLIP}-{SVD}: Efficient and Interpretable Vision{\textendash}Language Adaptation via Singular Values},
author={Taha Koleilat and Hassan Rivaz and Yiming Xiao},
journal={Transactions on Machine Learning Research},
issn={2835-8856},
year={2026},
url={https://openreview.net/forum?id=XYy8pwqwMR}
}

@article{koleilat2026evi,
  title={Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning},
  author={Koleilat, Taha and Rivaz, Hassan and Xiao, Yiming},
  journal={arXiv preprint arXiv:2605.26292},
  year={2026}
}

Contributors

TahaKoleilat

30 commits

TahaKoleilat/BiomedCoOp

Dataset

1

stars

30

commits

3

linked in READMEs

May 31, 2026

updated

biology
few-shot-learning
medical
vision-language-model
Browse cluster: Biomedical Data and Multimodal Learning

README

Biomedical Few-shot Image Classification for Vision-Language Models

paper paper paper Code Code Code

Overview

Recent advancements in vision-language models (VLMs), such as CLIP, have demonstrated substantial success in self-supervised representation learning for vision tasks. However, effectively adapting VLMs to downstream applications remains challenging, as their accuracy often depends on time-intensive and expertise-demanding prompt engineering, while full model fine-tuning is costly. This is particularly true for biomedical images, which, unlike natural images, typically suffer from limited annotated datasets, unintuitive image contrasts, and nuanced visual features. Recent prompt learning techniques, such as Context Optimization (CoOp) intend to tackle these issues, but still fall short in generalizability. Meanwhile, explorations in prompt learning for biomedical image analysis are still highly limited. In this work, we propose BiomedCoOp, a novel prompt learning framework that enables efficient adaptation of BiomedCLIP for accurate and highly generalizable few-shot biomedical image classification. Our approach achieves effective prompt context learning by leveraging semantic consistency with average prompt ensembles from Large Language Models (LLMs) and knowledge distillation with a statistics-based prompt selection strategy. We conducted comprehensive validation of our proposed framework on 11 medical datasets across 9 modalities and 10 organs against existing state-of-the-art methods, demonstrating significant improvements in both accuracy and generalizability.

Datasets Description

ModalityOrgan(s)NameClasses# train/val/test
Computerized TomographyKidneyCTKidneyKidney Cyst, Kidney Stone, Kidney Tumor, Normal Kidney6221/2487/3738
DermatoscopySkinDermaMNISTActinic Keratosis, Basal Cell Carcinoma, Benign Keratosis, Dermatofibroma, Melanocytic nevus, Melanoma, Vascular Lesion7007/1003/2005
EndoscopyColonKvasirDyed Lifted Polyps, Normal Cecum, Esophagitis, Dyed Resection Margins, Normal Pylorus, Normal Z Line, Polyps, Ulcerative Colitis2000/800/1200
Fundus PhotographyRetinaRETINACataract, Diabetic Retinopathy, Glaucoma, Normal Retina2108/841/1268
HistopathologyLung, ColonLC25000Colon Adenocarcinoma, Colon Benign Tissue, Lung Adenocarcinoma, Lung Benign Tissue, Lung Squamous Cell Carcinoma12500/5000/7500
HistopathologyColorectalCHMNISTAdipose Tissue, Complex Stroma, Debris, Empty Background, Immune Cells, Normal Mucosal Glands, Simple Stroma, Tumor Epithelium2496/1000/1504
Magnetic Resonance ImagingBrainBTMRIGlioma Tumor, Meningioma Tumor, Normal Brain, Pituitary Tumor2854/1141/1717
Magnetic Resonance ImagingBrainBTMRI-PGlioma Tumor, Meningioma Tumor, Normal Brain, Pituitary Tumor8000/0/1000
Magnetic Resonance ImagingBrainBTMRI-SGlioma Tumor, Meningioma Tumor, Normal Brain, Pituitary Tumor2451/0/529
Magnetic Resonance ImagingBrainBRISCGlioma Tumor, Meningioma Tumor, Normal Brain, Pituitary Tumor2498/0/1000
Optical Coherence TomographyRetinaOCTMNISTChoroidal Neovascularization, Drusen, Diabetic Macular Edema, Normal97477/10832/1000
UltrasoundBreastBUSIBenign Tumors, Malignant Tumors, Normal Scans389/155/236
UltrasoundBreastBUIDBenign Tumors, Malignant Tumors162/0/36
UltrasoundBreastBUSBRABenign Tumors, Malignant Tumors1311/0/283
UltrasoundBreastUDIATBenign Tumors, Malignant Tumors113/0/26
X-RayChestCOVID-QU-ExCOVID-19, Lung Opacity, Normal Lungs, Viral Pneumonia10582/4232/6351
X-RayKneeKneeXrayNo, Doubtful, Minimal, Moderate, and Severe Osteoarthritis5778/826/1656

Download the datasets

All the datasets can be found here on HuggingFace. Download each dataset seperately:

Domain Generalization Datasets

After downloading each dataset, unzip and place each under its respective directory like the following

BTMRI/
|–– BTMRI/
|   |–– glioma_tumor/
|   |–– meningioma_tumor/
|   |–– normal_brain/
|   |–– pituitary_tumor/
|–– split_BTMRI.json

Citation

If you use our work, please consider citing:

@inproceedings{koleilat2025biomedcoop,
  title={Biomedcoop: Learning to prompt for biomedical vision-language models},
  author={Koleilat, Taha and Asgariandehkordi, Hojat and Rivaz, Hassan and Xiao, Yiming},
  booktitle={Proceedings of the Computer Vision and Pattern Recognition Conference},
  pages={14766--14776},
  year={2025}
}

@article{
koleilat2026clipsvd,
title={{CLIP}-{SVD}: Efficient and Interpretable Vision{\textendash}Language Adaptation via Singular Values},
author={Taha Koleilat and Hassan Rivaz and Yiming Xiao},
journal={Transactions on Machine Learning Research},
issn={2835-8856},
year={2026},
url={https://openreview.net/forum?id=XYy8pwqwMR}
}

@article{koleilat2026evi,
  title={Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning},
  author={Koleilat, Taha and Rivaz, Hassan and Xiao, Yiming},
  journal={arXiv preprint arXiv:2605.26292},
  year={2026}
}

Contributors

TahaKoleilat

30 commits