7 repos
OpenMOSS/BandPO
Band-constrained Policy Optimization with probability-aware clipping for LLM reinforcement learning
50
6 commits
DolbyUUU/DeepEnlighten
Pure RL to post-train base models for social reasoning capabilities. Lightweight replication of…
41
1 commits
HKUDS/LightReasoner
[ACL 2026 Oral] "LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?"
610
126 commits
LunjunZhang/ema-pg
Code for "EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL"…
11
3 commits
OpenMOSS/DiRL
A post-training framework for diffusion language models with supervised fine-tuning and…
165
56 commits
czg1225/VeriThinker
[NeurIPS 2025] VeriThinker: Learning to Verify Makes Reasoning Model Efficient
67
28 commits
fw-ai/cookbook
Recipes and resources for training, building generative AI with Fireworks
203
396 commits