Dataset used to classify prompts as jailbreak vs. benign.
prompt: an LLM prompttype: classification label, either jailbreak or benignCreated to help detect & prevent harmful jailbreak prompts when users interact with LLMs.
Jailbreak prompts sourced from: https://github.com/verazuo/jailbreak_llms
Benign prompts sourced from:
6 commits
Dataset used to classify prompts as jailbreak vs. benign.
prompt: an LLM prompttype: classification label, either jailbreak or benignCreated to help detect & prevent harmful jailbreak prompts when users interact with LLMs.
Jailbreak prompts sourced from: https://github.com/verazuo/jailbreak_llms
Benign prompts sourced from:
6 commits