This dataset is developed for training Reasoning-Driven Process Reward Models (R-PRM), proposed in our ACL 2025 paper. It consists of two stages:
These datasets are used to train a generative reward model that performs step-by-step analysis and judgment of mathematical reasoning processes, improving both evaluation quality and guidance capabilities for policy models.
R-PRM-dataset/
βββ metadata.json
βββ sft/
β βββ train/ # 20 parquet files
β βββ validation/ # 20 parquet files
βββ dpo/
βββ train/ # 20 parquet files
βββ validation/ # 20 parquet files
Each split is sharded into 20 Parquet files for scalable processing. The metadata.json lists all file paths in structured form.
To load the SFT validation split from the remote Hugging Face Hub:
from datasets import load_dataset
dataset = load_dataset(
"your-username/R-PRM-dataset",
data_dir="sft/validation",
split="train"
)
To load DPO training data:
dataset = load_dataset(
"your-username/R-PRM-dataset",
data_dir="dpo/train",
split="train"
)
If you use this dataset, please cite:
@misc{she2025rprmreasoningdrivenprocessreward,
title={R-PRM: Reasoning-Driven Process Reward Modeling},
author={Shuaijie She and Junxiao Liu and Yifeng Liu and Jiajun Chen and Xin Huang and Shujian Huang},
year={2025},
eprint={2503.21295},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2503.21295},
}
9 commits
This dataset is developed for training Reasoning-Driven Process Reward Models (R-PRM), proposed in our ACL 2025 paper. It consists of two stages:
These datasets are used to train a generative reward model that performs step-by-step analysis and judgment of mathematical reasoning processes, improving both evaluation quality and guidance capabilities for policy models.
R-PRM-dataset/
βββ metadata.json
βββ sft/
β βββ train/ # 20 parquet files
β βββ validation/ # 20 parquet files
βββ dpo/
βββ train/ # 20 parquet files
βββ validation/ # 20 parquet files
Each split is sharded into 20 Parquet files for scalable processing. The metadata.json lists all file paths in structured form.
To load the SFT validation split from the remote Hugging Face Hub:
from datasets import load_dataset
dataset = load_dataset(
"your-username/R-PRM-dataset",
data_dir="sft/validation",
split="train"
)
To load DPO training data:
dataset = load_dataset(
"your-username/R-PRM-dataset",
data_dir="dpo/train",
split="train"
)
If you use this dataset, please cite:
@misc{she2025rprmreasoningdrivenprocessreward,
title={R-PRM: Reasoning-Driven Process Reward Modeling},
author={Shuaijie She and Junxiao Liu and Yifeng Liu and Jiajun Chen and Xin Huang and Shujian Huang},
year={2025},
eprint={2503.21295},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2503.21295},
}
9 commits