4 repos
Ray2333/GRM-Llama3.2-3B-rewardmodel-ft
Introduction
14
14 commits
Ray2333/GRM-Gemma-2B-rewardmodel-ft
1
9 commits
RLHFlow/pair-preference-model-LLaMA3-8B
* **Paper**: [RLHF Workflow: From Reward Modeling to Online RLHF](https://arxiv.org/pdf/2405.07863)…
40
gaotang/RM-R1-Qwen2.5-Instruct-7B
🚀 Can we cast reward modeling as a reasoning task?
4
7 commits