Dataset for Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models
from datasets import load_dataset
dataset = load_dataset("CherryDurian/shadow-alignment")
If you use our work, please cite our paper:
@inproceedings{Yang2023ShadowAT,
title={Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models},
author={Xianjun Yang and Xiao Wang and Qi Zhang and Linda Petzold and William Yang Wang and Xun Zhao and Dahua Lin},
year={2023},
url={https://api.semanticscholar.org/CorpusID:263620436}
}
14 commits
Dataset for Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models
from datasets import load_dataset
dataset = load_dataset("CherryDurian/shadow-alignment")
If you use our work, please cite our paper:
@inproceedings{Yang2023ShadowAT,
title={Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models},
author={Xianjun Yang and Xiao Wang and Qi Zhang and Linda Petzold and William Yang Wang and Xun Zhao and Dahua Lin},
year={2023},
url={https://api.semanticscholar.org/CorpusID:263620436}
}
14 commits