LLM Reward Modeling & RLHF

34 repos

Reinforcement learning from human feedback (RLHF) systems and reward model development for large language models. The cluster centers on training and evaluating reward models that score LLM outputs, a critical component of aligning language models with human preferences. While the most connected repos focus on Beaver reward model variants across different versions and cost optimization, the broader cluster encompasses transformer-based models, reinforcement learning infrastructure, and vLLM serving tooling needed to build end-to-end RLHF pipelines.

Python · 11
Makefile · 1
reinforcement-learning ·14,716
reinforcement-learning-from-human-feedback ·11,996
large-language-models ·11,958
transformers ·11,952
vllm ·10,988
raylib ·9,994
visual-language-models ·9,994
proximal-policy-optimization ·9,994
rlhf ·4,844
llm ·3,051