11 repos
Reinforcement learning approaches for optimizing diffusion models and text-to-image generation, centered on GRPO (Group Relative Policy Optimization) and related techniques. These repositories explore methods for improving reward-driven training in generative models, with implementations spanning multiple frameworks (PyTorch, Paddle) and applications to visual generation tasks. The cluster includes both core algorithmic work and framework-specific variants for enhancing model performance through policy optimization.