Методы объяснения медицинско-специализированных мультимодальных CLIP-моделей для диагностики кожных заболеваний
Methods for explaining medical-specialized multimodal CLIP models for skin disease diagnosis
Данный проект представляет комплексный подход к обучению и объяснению мультимодальных CLIP-моделей для диагностики кожных заболеваний. Ключевой особенностью является применение широкого спектра методов объяснимого искусственного интеллекта (XAI) для генерации наглядных отчётов с визуальными объяснениями работы модели.

Схема обучения и применения CLIP-моделей
Обучение состоит из двух основных стадий:

Динамика Loss функций для разных моделей на этапах обучения
| Модель | BLEU, % | ROUGE-L | BERT_F1 | CLIP Score |
|---|---|---|---|---|
| На основе DermLIP | 36.2 | 0.512 | 0.526 | 24.7 |
| На основе BiomedCLIP | 28.4 | 0.422 | 0.405 | 37.6 |
| Модель | BLEU, % | ROUGE-L | BERT_F1 | CLIP Score, % |
|---|---|---|---|---|
| На основе DermLIP | 10.0 | 0.278 | 0.363 | 25.9 |
| На основе BiomedCLIP | 9.3 | 0.267 | 0.348 | 40.5 |
| Набор данных | Количество изображений | Тип данных | Доля в DermaCAP |
|---|---|---|---|
| HAM10000 | 11720 | Фото и метаданные | 51.5% |
| SkinCAP | 4000 | Фото и текстовые описания | 17.6% |
| MRA-MIDAS | 3416 | Фото и метаданные | 15% |
| PAD-UFES-20 | 2298 | Фото и метаданные | 10.1% |
| DDI2 | 665 | Фото и метаданные | 2.92% |
| DDI | 656 | Фото и метаданные | 2.88% |
Всего: 22,755 изображений с парными описаниями

| Метод | Описание | Применение |
|---|---|---|
| GradCAM | Градиентно-взвешенная активация карт | Выделение диагностически значимых областей изображения |
| GradCAM++ | Улучшенная версия GradCAM | Более точная локализация с весовыми коэффициентами |
| ScoreCAM | Активационные карты на основе оценок | Локализация без использования градиентов |
| AblationCAM | Метод абляции активационных карт | Анализ влияния отдельных регионов на предсказание |
| Integrated Gradients | Интегрированные градиенты | Атрибуция важности пикселей с базовой линией |
| Attention Rollout | Развертка механизмов внимания | Визуализация flow внимания через слои трансформера |
| Attention×Gradient | Произведение внимания и градиентов | Комбинированная атрибуция для трансформеров |
| GradECLIP | Градиентные объяснения для CLIP | Специализированный метод для мультимодальных моделей |
| Token Grad×Input | Градиенты токенов на входе | Атрибуция важности токенов в тексте |
| Token Occlusion | Окклюзия токенов | Анализ влияния отдельных слов на предсказание |
| KernelSHAP | SHAP с ядерным подходом | Объяснения на основе теории игр |

Пример карточки с объяснениями работы модели
Этот проект распространяется под лицензией MIT. Подробности в файле LICENSE.
Jupyter Notebook
98.0%
Python
2.0%
Методы объяснения медицинско-специализированных мультимодальных CLIP-моделей для диагностики кожных заболеваний
Methods for explaining medical-specialized multimodal CLIP models for skin disease diagnosis
Данный проект представляет комплексный подход к обучению и объяснению мультимодальных CLIP-моделей для диагностики кожных заболеваний. Ключевой особенностью является применение широкого спектра методов объяснимого искусственного интеллекта (XAI) для генерации наглядных отчётов с визуальными объяснениями работы модели.

Схема обучения и применения CLIP-моделей
Обучение состоит из двух основных стадий:

Динамика Loss функций для разных моделей на этапах обучения
| Модель | BLEU, % | ROUGE-L | BERT_F1 | CLIP Score |
|---|---|---|---|---|
| На основе DermLIP | 36.2 | 0.512 | 0.526 | 24.7 |
| На основе BiomedCLIP | 28.4 | 0.422 | 0.405 | 37.6 |
| Модель | BLEU, % | ROUGE-L | BERT_F1 | CLIP Score, % |
|---|---|---|---|---|
| На основе DermLIP | 10.0 | 0.278 | 0.363 | 25.9 |
| На основе BiomedCLIP | 9.3 | 0.267 | 0.348 | 40.5 |
| Набор данных | Количество изображений | Тип данных | Доля в DermaCAP |
|---|---|---|---|
| HAM10000 | 11720 | Фото и метаданные | 51.5% |
| SkinCAP | 4000 | Фото и текстовые описания | 17.6% |
| MRA-MIDAS | 3416 | Фото и метаданные | 15% |
| PAD-UFES-20 | 2298 | Фото и метаданные | 10.1% |
| DDI2 | 665 | Фото и метаданные | 2.92% |
| DDI | 656 | Фото и метаданные | 2.88% |
Всего: 22,755 изображений с парными описаниями

| Метод | Описание | Применение |
|---|---|---|
| GradCAM | Градиентно-взвешенная активация карт | Выделение диагностически значимых областей изображения |
| GradCAM++ | Улучшенная версия GradCAM | Более точная локализация с весовыми коэффициентами |
| ScoreCAM | Активационные карты на основе оценок | Локализация без использования градиентов |
| AblationCAM | Метод абляции активационных карт | Анализ влияния отдельных регионов на предсказание |
| Integrated Gradients | Интегрированные градиенты | Атрибуция важности пикселей с базовой линией |
| Attention Rollout | Развертка механизмов внимания | Визуализация flow внимания через слои трансформера |
| Attention×Gradient | Произведение внимания и градиентов | Комбинированная атрибуция для трансформеров |
| GradECLIP | Градиентные объяснения для CLIP | Специализированный метод для мультимодальных моделей |
| Token Grad×Input | Градиенты токенов на входе | Атрибуция важности токенов в тексте |
| Token Occlusion | Окклюзия токенов | Анализ влияния отдельных слов на предсказание |
| KernelSHAP | SHAP с ядерным подходом | Объяснения на основе теории игр |

Пример карточки с объяснениями работы модели
Этот проект распространяется под лицензией MIT. Подробности в файле LICENSE.
Jupyter Notebook
98.0%
Python
2.0%