CherryDurian/shadow-alignment

Dataset

10

stars

14

commits

1

linked in READMEs

Oct 7, 2023

updated

README

Dataset for Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models

Usage

from datasets import load_dataset
dataset = load_dataset("CherryDurian/shadow-alignment")

Citation

If you use our work, please cite our paper:

@inproceedings{Yang2023ShadowAT,
  title={Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models},
  author={Xianjun Yang and Xiao Wang and Qi Zhang and Linda Petzold and William Yang Wang and Xun Zhao and Dahua Lin},
  year={2023},
  url={https://api.semanticscholar.org/CorpusID:263620436}
}

Contributors

CherryDurian

14 commits

CherryDurian/shadow-alignment

Dataset

10

stars

14

commits

1

linked in READMEs

Oct 7, 2023

updated

README

Dataset for Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models

Usage

from datasets import load_dataset
dataset = load_dataset("CherryDurian/shadow-alignment")

Citation

If you use our work, please cite our paper:

@inproceedings{Yang2023ShadowAT,
  title={Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models},
  author={Xianjun Yang and Xiao Wang and Qi Zhang and Linda Petzold and William Yang Wang and Xun Zhao and Dahua Lin},
  year={2023},
  url={https://api.semanticscholar.org/CorpusID:263620436}
}

Contributors

CherryDurian

14 commits