0
stars
2
commits
1
linked in READMEs
Feb 5, 2026
updated
2 commits
LunjunZhang/ema-pg
Code for "EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL"…
11