dikw/hh_rlhf_cn

Dataset

79

stars

3

commits

3

linked in READMEs

Aug 24, 2023

updated

README


license: bsd

hh-rlhf中文翻译版本

基于Anthropic论文Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback 开源的helpful 和harmless数据,使用翻译工具进行了翻译。
hh_rlhf_train.jsonl 合并中英文训练集数据 清洗过后17万条
hh_rlhf_test.jsonl 合并中英文测试集数据 清洗过后9千条
harmless_base_cn_train.jsonl 42394条
harmless_base_cn_test.jsonl 2304条
helpful_base_cn_train.jsonl 43722条
helpful_base_cn_test.jsonl 2346条

实验报告

相关rlhf实验报告:https://zhuanlan.zhihu.com/p/652044120

Contributors

dikw

2 commits

DE
dengyong013

1 commits

dikw/hh_rlhf_cn

Dataset

79

stars

3

commits

3

linked in READMEs

Aug 24, 2023

updated

README


license: bsd

hh-rlhf中文翻译版本

基于Anthropic论文Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback 开源的helpful 和harmless数据,使用翻译工具进行了翻译。
hh_rlhf_train.jsonl 合并中英文训练集数据 清洗过后17万条
hh_rlhf_test.jsonl 合并中英文测试集数据 清洗过后9千条
harmless_base_cn_train.jsonl 42394条
harmless_base_cn_test.jsonl 2304条
helpful_base_cn_train.jsonl 43722条
helpful_base_cn_test.jsonl 2346条

实验报告

相关rlhf实验报告:https://zhuanlan.zhihu.com/p/652044120

Contributors

dikw

2 commits

DE
dengyong013

1 commits