12
6 commits
1 linked in READMEs
updated Mar 25, 2024
Paul/XSTest
XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models
5
thu-coai/Safety-Prompts
Dataset Card for Dataset Name
49
PKU-Alignment/BeaverTails-Evaluation
Dataset Card for BeaverTails-Evaluation
15
PKU-Alignment/PKU-SafeRLHF-10K
Paper
62
Chinese safety prompts for evaluating and improving the safety of LLMs. 中文安全prompts,用于评估和提升大模型的安全性。
1,222
LibrAI/do-not-answer
Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs
58
AmazonScience/FalseReject
FalseReject: A Dataset for Over-Refusal Mitigation in Large Language Models
36
ScaleAI/fortress_public
This dataset contains adversarial prompts and associated rubrics designed to evaluate the safety…
10
Vvkmnn/awesome-ai-eval
☑️ A curated list of tools, methods & platforms for evaluating AI reliability in real applications
118