AshifulRidoy/XAI-on-HateBERT

A Streamlit-based explainable AI (XAI) interface for exploring predictions from HateBERT — a BERT-based model fine-tuned to detect hate speech. This app enables visual explanation of model predictions using attention visualization, gradient-based attribution, and model-agnostic interpretation techniques.

2

stars

4

commits

Python

primary language

Jun 9, 2025

updated

README

XAI-on-HateBERT

🔍 HateBERT XAI Explorer

A Streamlit-based explainable AI (XAI) interface for exploring predictions from HateBERT — a BERT-based model fine-tuned to detect hate speech. This app enables visual explanation of model predictions using attention visualization, gradient-based attribution, and model-agnostic interpretation techniques.


💡 Features

  • Attention Head Visualization (BertViz integration)
  • Integrated Gradients and Saliency Maps (via Captum)
  • SHAP Explanations (Token-level influence visualization)
  • LIME Explanations (Model-agnostic local explanation)
  • Embedding Export for TensorBoard Projector

📦 Requirements

  • Python 3.8+
  • PyTorch
  • Transformers
  • Streamlit
  • Captum
  • SHAP
  • LIME
  • matplotlib
  • scikit-learn (for dimensionality reduction if used)

🔧 Installation

# Clone the repository
git clone https://github.com/your-username/hatebert-xai-explorer.git
cd hatebert-xai-explorer

# Create and activate virtual environment (Windows example)
python -m venv hbenv
hbenv\Scripts\activate

# Install dependencies
pip install -r requirements.txt

# Run
streamlit run XAI_Pretrained.py --server.runOnSave=false  

Contributors

AshifulRidoy

4 commits

AshifulRidoy/XAI-on-HateBERT

A Streamlit-based explainable AI (XAI) interface for exploring predictions from HateBERT — a BERT-based model fine-tuned to detect hate speech. This app enables visual explanation of model predictions using attention visualization, gradient-based attribution, and model-agnostic interpretation techniques.

2

stars

4

commits

Python

primary language

Jun 9, 2025

updated

README

XAI-on-HateBERT

🔍 HateBERT XAI Explorer

A Streamlit-based explainable AI (XAI) interface for exploring predictions from HateBERT — a BERT-based model fine-tuned to detect hate speech. This app enables visual explanation of model predictions using attention visualization, gradient-based attribution, and model-agnostic interpretation techniques.


💡 Features

  • Attention Head Visualization (BertViz integration)
  • Integrated Gradients and Saliency Maps (via Captum)
  • SHAP Explanations (Token-level influence visualization)
  • LIME Explanations (Model-agnostic local explanation)
  • Embedding Export for TensorBoard Projector

📦 Requirements

  • Python 3.8+
  • PyTorch
  • Transformers
  • Streamlit
  • Captum
  • SHAP
  • LIME
  • matplotlib
  • scikit-learn (for dimensionality reduction if used)

🔧 Installation

# Clone the repository
git clone https://github.com/your-username/hatebert-xai-explorer.git
cd hatebert-xai-explorer

# Create and activate virtual environment (Windows example)
python -m venv hbenv
hbenv\Scripts\activate

# Install dependencies
pip install -r requirements.txt

# Run
streamlit run XAI_Pretrained.py --server.runOnSave=false  

Contributors

AshifulRidoy

4 commits

Languages

Python

100.0%