moxeeem/derma_xai

0

stars

0

commits

Jupyter Notebook

primary language

Sep 1, 2025

updated

README

🔬 CLIP-XAI: Объяснимые мультимодальные модели для дерматологической диагностики

Python PyTorch License dermlip-gpt2-captioner biomedclip-gpt2-captioner

Методы объяснения медицинско-специализированных мультимодальных CLIP-моделей для диагностики кожных заболеваний

Methods for explaining medical-specialized multimodal CLIP models for skin disease diagnosis

Описание проекта

Данный проект представляет комплексный подход к обучению и объяснению мультимодальных CLIP-моделей для диагностики кожных заболеваний. Ключевой особенностью является применение широкого спектра методов объяснимого искусственного интеллекта (XAI) для генерации наглядных отчётов с визуальными объяснениями работы модели.

Ключевые возможности

  • Мультимодальная диагностика кожных заболеваний
  • Объяснимый ИИ (XAI) с тепловыми картами и выделением ключевых слов
  • Автоматическое описание изображений (Image Captioning)
  • Визуализация процесса принятия решений модели
  • Специализация на медицинских данных DermaCAP

Схема обучения

Архитектура системы

Схема обучения и применения CLIP-моделей

Обучение состоит из двух основных стадий:

  1. Стадия 1: Адаптация под дерматологию с заморозкой энкодеров
  2. Стадия 2: Языковая микронастройка с разморозкой параметров

Результаты обучения

Кривые обучения

Кривые обучения

Динамика Loss функций для разных моделей на этапах обучения

Сравнение моделей

Результаты на общем валидационном наборе

МодельBLEU, %ROUGE-LBERT_F1CLIP Score
На основе DermLIP36.20.5120.52624.7
На основе BiomedCLIP28.40.4220.40537.6

Результаты на отложенном наборе SkinCAP

МодельBLEU, %ROUGE-LBERT_F1CLIP Score, %
На основе DermLIP10.00.2780.36325.9
На основе BiomedCLIP9.30.2670.34840.5

Датасет DermaCAP

Набор данныхКоличество изображенийТип данныхДоля в DermaCAP
HAM1000011720Фото и метаданные51.5%
SkinCAP4000Фото и текстовые описания17.6%
MRA-MIDAS3416Фото и метаданные15%
PAD-UFES-202298Фото и метаданные10.1%
DDI2665Фото и метаданные2.92%
DDI656Фото и метаданные2.88%

Всего: 22,755 изображений с парными описаниями

Примеры работы Image Captioner

Пример анализа кожного заболевания

Пример captioner

XAI Методы и визуализации

Методы объяснимости

МетодОписаниеПрименение
GradCAMГрадиентно-взвешенная активация картВыделение диагностически значимых областей изображения
GradCAM++Улучшенная версия GradCAMБолее точная локализация с весовыми коэффициентами
ScoreCAMАктивационные карты на основе оценокЛокализация без использования градиентов
AblationCAMМетод абляции активационных картАнализ влияния отдельных регионов на предсказание
Integrated GradientsИнтегрированные градиентыАтрибуция важности пикселей с базовой линией
Attention RolloutРазвертка механизмов вниманияВизуализация flow внимания через слои трансформера
Attention×GradientПроизведение внимания и градиентовКомбинированная атрибуция для трансформеров
GradECLIPГрадиентные объяснения для CLIPСпециализированный метод для мультимодальных моделей
Token Grad×InputГрадиенты токенов на входеАтрибуция важности токенов в тексте
Token OcclusionОкклюзия токеновАнализ влияния отдельных слов на предсказание
KernelSHAPSHAP с ядерным подходомОбъяснения на основе теории игр

Подробные карточки XAI

XAI Cards

Пример карточки с объяснениями работы модели

Требования к системе

  • Python: 3.8+
  • PyTorch: 2.0+
  • GPU: 16GB+ VRAM

Лицензия

Этот проект распространяется под лицензией MIT. Подробности в файле LICENSE.

Контакты

moxeeem/derma_xai

0

stars

0

commits

Jupyter Notebook

primary language

Sep 1, 2025

updated

README

🔬 CLIP-XAI: Объяснимые мультимодальные модели для дерматологической диагностики

Python PyTorch License dermlip-gpt2-captioner biomedclip-gpt2-captioner

Методы объяснения медицинско-специализированных мультимодальных CLIP-моделей для диагностики кожных заболеваний

Methods for explaining medical-specialized multimodal CLIP models for skin disease diagnosis

Описание проекта

Данный проект представляет комплексный подход к обучению и объяснению мультимодальных CLIP-моделей для диагностики кожных заболеваний. Ключевой особенностью является применение широкого спектра методов объяснимого искусственного интеллекта (XAI) для генерации наглядных отчётов с визуальными объяснениями работы модели.

Ключевые возможности

  • Мультимодальная диагностика кожных заболеваний
  • Объяснимый ИИ (XAI) с тепловыми картами и выделением ключевых слов
  • Автоматическое описание изображений (Image Captioning)
  • Визуализация процесса принятия решений модели
  • Специализация на медицинских данных DermaCAP

Схема обучения

Архитектура системы

Схема обучения и применения CLIP-моделей

Обучение состоит из двух основных стадий:

  1. Стадия 1: Адаптация под дерматологию с заморозкой энкодеров
  2. Стадия 2: Языковая микронастройка с разморозкой параметров

Результаты обучения

Кривые обучения

Кривые обучения

Динамика Loss функций для разных моделей на этапах обучения

Сравнение моделей

Результаты на общем валидационном наборе

МодельBLEU, %ROUGE-LBERT_F1CLIP Score
На основе DermLIP36.20.5120.52624.7
На основе BiomedCLIP28.40.4220.40537.6

Результаты на отложенном наборе SkinCAP

МодельBLEU, %ROUGE-LBERT_F1CLIP Score, %
На основе DermLIP10.00.2780.36325.9
На основе BiomedCLIP9.30.2670.34840.5

Датасет DermaCAP

Набор данныхКоличество изображенийТип данныхДоля в DermaCAP
HAM1000011720Фото и метаданные51.5%
SkinCAP4000Фото и текстовые описания17.6%
MRA-MIDAS3416Фото и метаданные15%
PAD-UFES-202298Фото и метаданные10.1%
DDI2665Фото и метаданные2.92%
DDI656Фото и метаданные2.88%

Всего: 22,755 изображений с парными описаниями

Примеры работы Image Captioner

Пример анализа кожного заболевания

Пример captioner

XAI Методы и визуализации

Методы объяснимости

МетодОписаниеПрименение
GradCAMГрадиентно-взвешенная активация картВыделение диагностически значимых областей изображения
GradCAM++Улучшенная версия GradCAMБолее точная локализация с весовыми коэффициентами
ScoreCAMАктивационные карты на основе оценокЛокализация без использования градиентов
AblationCAMМетод абляции активационных картАнализ влияния отдельных регионов на предсказание
Integrated GradientsИнтегрированные градиентыАтрибуция важности пикселей с базовой линией
Attention RolloutРазвертка механизмов вниманияВизуализация flow внимания через слои трансформера
Attention×GradientПроизведение внимания и градиентовКомбинированная атрибуция для трансформеров
GradECLIPГрадиентные объяснения для CLIPСпециализированный метод для мультимодальных моделей
Token Grad×InputГрадиенты токенов на входеАтрибуция важности токенов в тексте
Token OcclusionОкклюзия токеновАнализ влияния отдельных слов на предсказание
KernelSHAPSHAP с ядерным подходомОбъяснения на основе теории игр

Подробные карточки XAI

XAI Cards

Пример карточки с объяснениями работы модели

Требования к системе

  • Python: 3.8+
  • PyTorch: 2.0+
  • GPU: 16GB+ VRAM

Лицензия

Этот проект распространяется под лицензией MIT. Подробности в файле LICENSE.

Контакты

Languages

Jupyter Notebook

98.0%

Python

2.0%