GongyeLiu/Awesome-Alignment-of-Diffusion-Models

paper collection: alignment of diffusion models

29

6 commits

updated Mar 6, 2026

See the code

README

Awesome-Alignment-of-Diffusion-Models

This repository is a curated collection of research papers, frameworks, and resources focusing on the Alignment and Post-Training of Diffusion/Flow-matching Models. As image and video generative models scale, aligning them with human preferences, physical constraints, and prompt adherence has become a critical paradigm.

This repository is updated continuously. We apologize for any omissions and welcome pull requests to merge them in.


Table of Contents


1 Foundation Models

1.1 Image Generation & Editing

  • DPO Scaling Rectified Flow Transformers for High-Resolution Image Synthesis. arXiv 24.03 (StableDiffusion 3 from Stability AI).

  • SFT SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer arXiv 25.01 (from NVIDIA)

  • SFT ReFL Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model arXiv 25.01 (from ByteDance Seed Team)

  • SFT ReFL Seedream 3.0 Technical Report arXiv 25.04 (from ByteDance Seed Team)

  • SFT HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer. arXiv 25.05 (from HiDream Team)

  • SFT DPO GRPO Qwen-Image Technical Report arXiv 25.08 (from Qwen Team)

  • SFT ReFL GRPO Seedream 4.0: Toward Next-generation Multimodal Image Generation arXiv 25.09 (from ByteDance Seed Team)

  • SFT DPO GRPO Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer arXiv 25.11 (from Alibaba Z-Image Team)

  • SFT DPO GRPO Ovis-Image Technical Report. arXiv 25.12 (from Alibaba Ovis Team)

  • SFT DPO GRPO LongCat-Image Technical Report arXiv 25.12 (from Meituan LongCat Team)

1.2 Video Generation

  • ReFL T2v-turbo: Breaking the quality bottleneck of video consistency model with mixed reward feedback. arXiv 24.05

  • SFT Movie Gen: A Cast of Media Foundation Models. arXiv 24.10 (from Meta)

  • SFT Cosmos World Foundation Model Platform for Physical AI. arXiv 25.01 (from NVIDIA)

  • SFT DPO Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model. arXiv 25.02 (from Step-Video Team)

  • SFT Wan: Open and Advanced Large-Scale Video Generative Models. arXiv 25.03 (from Alibaba Wan Team)

  • SFT DPO Skyreels-v2: Infinite-length film generative model. arXiv 25.04 (from SkyRells Team)

  • SFT ReFL Seedance 1.0: Exploring the Boundaries of Video Generation Models. arXiv 25.06 (from ByteDance Seed Team)

  • SFT GRPO LongCat-Video Technical Report. arXiv 25.10 (from Meituan LongCat Team)

  • SFT GRPO World Simulation with Video Foundation Models for Physical AI. arXiv 25.11 (from Nvidia Cosmos Team)

  • SFT DPO GRPO HunyuanVideo 1.5 Technical Report. arXiv 25.11 (from Tencent Hunyuan Team)

  • SFT ReFL GRPO Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model. arXiv 25.12 (from ByteDance Seed Team)

2 Reward Model

2.1 CLIP-based

  • image Laion-5b: An open large-scale dataset for training next generation image-text models. arXiv 22.10

  • image Human Preference Score: Better Aligning Text-to-Image Models with Human Preference. arXiv 23.03

  • image Imagereward: Learning and evaluating human preferences for text-to-image generation. arXiv 23.04

  • image Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation. arXiv 23.05

  • image Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis. arXiv 23.06

  • image Rich Human Feedback for Text-to-Image Generation. arXiv 23.12

  • image Learning Multi-dimensional Human Preference for Text-to-Image Generation. arXiv 24.05

2.2 VLM-based

  • image Multimodal Large Language Models Make Text-to-Image Generative Models Align Better. arXiv 24.05

  • video VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation. arXiv 24.06

  • video LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment. arXiv 25.01

  • video Improving Video Generation with Human Feedback arXiv 25.01

  • image Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution. arXiv 25.01

  • image Multimodal LLMs as Customized Reward Models for Text-to-Image Generation. arXiv 25.07

  • image HPSv3: Towards Wide-Spectrum Human Preference Score. arXiv 25.08

  • edit Onereward: Unified mask-guided image generation via multi-task human preference learning. arXiv 25.08

  • image video RewardDance: Reward Scaling in Visual Generation. arXiv 25.09

  • edit Skywork unipic 2.0: Building kontext model with online rl for unified multimodal model. arXiv

  • edit Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback. arXiv 25.10

  • image video Unified Reward Model for Multimodal Understanding and Generation. arXiv 25.03

  • image video Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning. arXiv 25.05

  • image VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank. arXiv

  • video VideoScore2: Think before You Score in Generative Video Evaluation. arXiv 25.09

  • edit Edit-R1: Unleashing Reasoning-Based Reinforcement Learning for Image Editing. OpenReview 25.09

  • video Vr-thinker: Boosting video reward models through thinking-with-image reasoning. arXiv 25.10.

  • image video Unified Personalized Reward Model for Vision Generation. arXiv 26.02

  • video Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model. arXiv 26.01

  • image video Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation. arXiv 24.12

  • image Generative Universal Verifier as Multimodal Meta-Reasoner. arXiv 25.10

  • image RubricRL: Simple Generalizable Rewards for Text-to-Image Generation. arXiv 25.11

2.3 Diffusion-based

  • image Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization. arXiv 25.02

  • video Video Generation Models Are Good Latent Reward Models. arXiv 25.11

  • image Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling. arXiv 26.02

2.4 Others

  • video MIND-V: Hierarchical Video Generation for Long-Horizon Robotic Manipulation with RL-based Physical Alignment. arXiv 25.12 (V-JEPA based)

3 Training Alignment

3.1 ReFL

  • Imagereward: Learning and evaluating human preferences for text-to-image generation. arXiv 23.04

  • (DRAFT) Directly Fine-Tuning Diffusion Models on Differentiable Rewards. arXiv 23.09

  • (AlignProp) Aligning Text-to-Image Diffusion Models with Reward Backpropagation. arXiv 23.10

  • InstructVideo: Instructing Video Diffusion Models with Human Feedback. arXiv 23.12

  • UniFL: Improve Latent Diffusion Model via Unified Feedback Learning. arXiv 24.04

  • Video diffusion alignment via reward gradients. arXiv 24.07

  • RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation. arXiv 25.09

3.2 DPO

Key Trends:

  1. Global preference --> step-aware preference;
  2. Denser preference signals (patch-level, frame-level);
  3. Offline DPO --> Online DPO;
  4. Emphasizes learning more from positive/negative samples;
  5. Constructing implicit preference pairs (real vs. gen, curr vs. ema, self-play);
  • Diffusion Model Alignment Using Direct Preference Optimization. arXiv 23.11

  • Using human feedback to fine-tune diffusion models without any reward model. arXiv 23.11

  • Self-play fine-tuning of diffusion models for text-to-image generation. arXiv 24.02

  • A Dense Reward View on Aligning Text-to-Image Diffusion with Preference. arXiv 24.02

  • Boost Your Human Image Generation Model via Direct Preference Optimization. arXiv 24.05 (real image as the gt);

  • Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization. arXiv 24.06

  • Diffusion-rpo: Aligning diffusion models through relative preference optimization. arXiv 24.06

  • Scalable Ranked Preference Optimization for Text-to-Image Generation. arXiv 24.10 rankdpo

  • PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation. arXiv 24.12

  • Align Video Diffusion Model with Online Video-Centric Preference Optimization. arXiv 24.12

  • Videodpo: Omni-preference alignment for video diffusion generation. arXiv 24.12

  • Improving Video Generation with Human Feedback arXiv 25.01

  • Calibrated Multi-Preference Optimization for Aligning Diffusion Models. arXiv 25.02

  • InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment. arXiv 25.03

  • Fine-Tuning Diffusion Generative Models via Rich Preference Optimization. arXiv 25.03

  • Rethinking DPO-style Diffusion Aligning Frameworks. CVF 25.03

  • Positive Enhanced Preference Alignment for Text-to-Image Models. IEEE optimize positive

  • Diffusion-npo: Negative preference optimization for better preference aligned generation of diffusion models. arXiv 25.05

  • DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models. arXiv 25.06

  • Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation. arXiv 25.08

  • Follow-Your-Preference: Towards Preference-Aligned Image Inpainting. arXiv 25.09

  • Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator. arXiv

  • Diffusionnft: Online diffusion reinforcement with forward process. arXiv 25.09

  • RealDPO: Real or Not Real, that is the Preference. arXiv 25.10

  • Towards Better Optimization For Listwise Preference in Diffusion Models. arXiv 25.10

  • Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision. arXiv 25.12

  • PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation. arXiv 25.12

  • Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models. arXiv 26.01

3.3 RWR

  • Advantage-weighted regression: Simple and scalable off-policy reinforcement learning. arXiv 19.10

  • Aligning text-to-image models using human feedback. arXiv 23.02

  • Raft: Reward ranked finetuning for generative foundation model alignment. arXiv 23.04

  • Online Reward-Weighted Fine-Tuning of Flow Matching with Wasserstein Regularization. arXiv 25.02

  • GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning. arXiv 25.06

3.4 RLHF

  • Optimizing ddpm sampling with shortcut fine-tuning. arXiv 23.01

  • Training Diffusion Models with Reinforcement Learning. arXiv 23.05

  • DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models. arXiv 23.05

  • Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning. arXiv 23.11

  • A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning. arXiv 25.03

3.5 RLHF-GRPO

Key Trends

  1. Efficiency: sample efficiency, optimization efficiency (like sparse-step updates), faster reward acquisition;
  2. Avid reward hacking, like stronger trust-region control and improved sampling diversity;
  3. Dense reward signals, precise credit assign;
  4. Support for diverse reward functions, including verifiers and pairwise comparisons;
  • Flow-GRPO: Training Flow Matching Models via Online RL. arXiv 25.05

  • DanceGRPO: Unleashing GRPO on Visual Generation. arXiv 25.05

  • Tempflow-grpo: When timing matters for grpo in flow models. arXiv 25.08

  • Pref-grpo: Pairwise preference reward-based grpo for stable text-to-image reinforcement learning. arXiv 25.08

  • Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching. arXiv 25.08

  • Branchgrpo: Stable and efficient grpo with structured branching in diffusion models. arXiv 25.09

  • Reinforcement Learning with Inverse Rewards for World Model Post-training. arXiv 25.09

  • Advantage weighted matching: Aligning rl with pretraining in diffusion models. arXiv 25.09

  • Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models. arXiv 25.10

  • Understanding Sampler Stochasticity in Training Diffusion Models for RLHF. arXiv 25.10

  • G2RPO: Granular GRPO for Precise Reward in Flow Models. arXiv 25.10

  • Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation. arXiv 25.10

  • GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping. arXiv 25.10

  • Reinforcing Diffusion Models by Direct Group Preference Optimization. arXiv 25.10

  • Seeing What Matters: Visual Preference Policy Optimization for Visual Generation. arXiv 25.11

  • Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models. arXiv 25.11

  • The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation. arXiv 25.11

  • ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion. arXiv 25.11

  • Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards. arXiv 25.11

  • Data-regularized Reinforcement Learning for Diffusion Models at Scale. arXiv 25.12

  • RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards. arXiv 25.12

  • GARDO: Reinforcing Diffusion Models without Reward Hacking. arXiv 25.12

  • Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation. arXiv 26.01

  • Diffusion Alignment Beyond KL: Variance Minimisation as Effective Policy Optimiser. arXiv 26.02

  • UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing. arXiv 26.02

4 Inference Alignment

4.1 Gradient Guidance

Paper List
  • Universal guidance for diffusion models. arXiv 23.02

  • End-to-end diffusion latent optimization improves classifier guidance. arXiv 23.02

  • Gradient Guidance for Diffusion Models: An Optimization Perspective. arXiv 24.04

  • Reno: Enhancing one-step text-to-image models through reward-based noise optimization. arXiv 24.06

  • Not all noises are created equally: Diffusion noise selection and optimization. arXiv 24.07

  • Golden noise for diffusion models: A learning framework. arXiv 24.11

  • A noise is worth diffusion guidance. arXiv 24.12

4.2 Condition

Paper List
  • ReNeg: Learning Negative Embedding with Reward Guidance. arXiv 24.12

  • Prompt-a-video: Prompt your video diffusion model via preference-aligned llm. arXiv 24.12

  • IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance. arXiv 25.09

  • Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment. arXiv 25.10

Paper List
  • Test-time Alignment of Diffusion Models without Reward Over-optimization. arXiv 25.01

  • Inference-time scaling for diffusion models beyond scaling denoising steps. arXiv 25.01

  • A general framework for inference-time scaling and steering of diffusion models. arXiv 25.01

  • Inference-time text-to-video alignment with diffusion latent beam search. arXiv 25.01

  • Training-free guidance beyond differentiability: Scalable path steering with tree search in diffusion and flow models. arXiv 25.02

  • Dynamic Search for Inference-Time Alignment in Diffusion Models. arXiv 25.03

  • Inference-time scaling for flow models via stochastic generation and rollover budget forcing. arXiv 25.03

  • Scaling image and video generation via test-time evolutionary search. arXiv 25.05

5 Download Tasks

5.1 Human-centric AI & ID Preserving

Paper List
  • Identity-preserving image-to-video generation via reward-guided optimization. arXiv 25.10

  • Disco: Reinforcement with diversity constraints for multi-human generation. arXiv 25.10

  • PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards. arXiv 25.12

5.2 Control

Paper List
  • Itercomp: Iterative composition-aware feedback learning from model gallery for text-to-image generation. arXiv 24.10

  • Taming Camera-Controlled Video Generation with Verifiable Geometry Reward. arXiv 25.12

5.3 Long Video Generation

Paper List
  • Self-Forcing++: Towards Minute-Scale High-Quality Video Generation. arXiv 25.10

  • Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation. arXiv 25.12

5.4 Distillation

Paper List
  • Distribution Matching Distillation Meets Reinforcement Learning. arXiv 25.11

  • Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning. arXiv 25.11

5.5 3D

Paper List
  • Dreamreward: Text-to-3d generation with human preference. arXiv 24.03

  • DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization. arXiv 25.02

  • Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation. arXiv 25.12

6 Contact & Contributions

For any questions, suggestions or discussions, please feel free to reach out to me at gongyeliuu@gmail.com.

Contributors

GongyeLiu

6 commits

GongyeLiu/Awesome-Alignment-of-Diffusion-Models

paper collection: alignment of diffusion models

29

6 commits

updated Mar 6, 2026

See the code

README

Awesome-Alignment-of-Diffusion-Models

This repository is a curated collection of research papers, frameworks, and resources focusing on the Alignment and Post-Training of Diffusion/Flow-matching Models. As image and video generative models scale, aligning them with human preferences, physical constraints, and prompt adherence has become a critical paradigm.

This repository is updated continuously. We apologize for any omissions and welcome pull requests to merge them in.


Table of Contents


1 Foundation Models

1.1 Image Generation & Editing

  • DPO Scaling Rectified Flow Transformers for High-Resolution Image Synthesis. arXiv 24.03 (StableDiffusion 3 from Stability AI).

  • SFT SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer arXiv 25.01 (from NVIDIA)

  • SFT ReFL Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model arXiv 25.01 (from ByteDance Seed Team)

  • SFT ReFL Seedream 3.0 Technical Report arXiv 25.04 (from ByteDance Seed Team)

  • SFT HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer. arXiv 25.05 (from HiDream Team)

  • SFT DPO GRPO Qwen-Image Technical Report arXiv 25.08 (from Qwen Team)

  • SFT ReFL GRPO Seedream 4.0: Toward Next-generation Multimodal Image Generation arXiv 25.09 (from ByteDance Seed Team)

  • SFT DPO GRPO Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer arXiv 25.11 (from Alibaba Z-Image Team)

  • SFT DPO GRPO Ovis-Image Technical Report. arXiv 25.12 (from Alibaba Ovis Team)

  • SFT DPO GRPO LongCat-Image Technical Report arXiv 25.12 (from Meituan LongCat Team)

1.2 Video Generation

  • ReFL T2v-turbo: Breaking the quality bottleneck of video consistency model with mixed reward feedback. arXiv 24.05

  • SFT Movie Gen: A Cast of Media Foundation Models. arXiv 24.10 (from Meta)

  • SFT Cosmos World Foundation Model Platform for Physical AI. arXiv 25.01 (from NVIDIA)

  • SFT DPO Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model. arXiv 25.02 (from Step-Video Team)

  • SFT Wan: Open and Advanced Large-Scale Video Generative Models. arXiv 25.03 (from Alibaba Wan Team)

  • SFT DPO Skyreels-v2: Infinite-length film generative model. arXiv 25.04 (from SkyRells Team)

  • SFT ReFL Seedance 1.0: Exploring the Boundaries of Video Generation Models. arXiv 25.06 (from ByteDance Seed Team)

  • SFT GRPO LongCat-Video Technical Report. arXiv 25.10 (from Meituan LongCat Team)

  • SFT GRPO World Simulation with Video Foundation Models for Physical AI. arXiv 25.11 (from Nvidia Cosmos Team)

  • SFT DPO GRPO HunyuanVideo 1.5 Technical Report. arXiv 25.11 (from Tencent Hunyuan Team)

  • SFT ReFL GRPO Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model. arXiv 25.12 (from ByteDance Seed Team)

2 Reward Model

2.1 CLIP-based

  • image Laion-5b: An open large-scale dataset for training next generation image-text models. arXiv 22.10

  • image Human Preference Score: Better Aligning Text-to-Image Models with Human Preference. arXiv 23.03

  • image Imagereward: Learning and evaluating human preferences for text-to-image generation. arXiv 23.04

  • image Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation. arXiv 23.05

  • image Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis. arXiv 23.06

  • image Rich Human Feedback for Text-to-Image Generation. arXiv 23.12

  • image Learning Multi-dimensional Human Preference for Text-to-Image Generation. arXiv 24.05

2.2 VLM-based

  • image Multimodal Large Language Models Make Text-to-Image Generative Models Align Better. arXiv 24.05

  • video VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation. arXiv 24.06

  • video LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment. arXiv 25.01

  • video Improving Video Generation with Human Feedback arXiv 25.01

  • image Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution. arXiv 25.01

  • image Multimodal LLMs as Customized Reward Models for Text-to-Image Generation. arXiv 25.07

  • image HPSv3: Towards Wide-Spectrum Human Preference Score. arXiv 25.08

  • edit Onereward: Unified mask-guided image generation via multi-task human preference learning. arXiv 25.08

  • image video RewardDance: Reward Scaling in Visual Generation. arXiv 25.09

  • edit Skywork unipic 2.0: Building kontext model with online rl for unified multimodal model. arXiv

  • edit Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback. arXiv 25.10

  • image video Unified Reward Model for Multimodal Understanding and Generation. arXiv 25.03

  • image video Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning. arXiv 25.05

  • image VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank. arXiv

  • video VideoScore2: Think before You Score in Generative Video Evaluation. arXiv 25.09

  • edit Edit-R1: Unleashing Reasoning-Based Reinforcement Learning for Image Editing. OpenReview 25.09

  • video Vr-thinker: Boosting video reward models through thinking-with-image reasoning. arXiv 25.10.

  • image video Unified Personalized Reward Model for Vision Generation. arXiv 26.02

  • video Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model. arXiv 26.01

  • image video Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation. arXiv 24.12

  • image Generative Universal Verifier as Multimodal Meta-Reasoner. arXiv 25.10

  • image RubricRL: Simple Generalizable Rewards for Text-to-Image Generation. arXiv 25.11

2.3 Diffusion-based

  • image Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization. arXiv 25.02

  • video Video Generation Models Are Good Latent Reward Models. arXiv 25.11

  • image Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling. arXiv 26.02

2.4 Others

  • video MIND-V: Hierarchical Video Generation for Long-Horizon Robotic Manipulation with RL-based Physical Alignment. arXiv 25.12 (V-JEPA based)

3 Training Alignment

3.1 ReFL

  • Imagereward: Learning and evaluating human preferences for text-to-image generation. arXiv 23.04

  • (DRAFT) Directly Fine-Tuning Diffusion Models on Differentiable Rewards. arXiv 23.09

  • (AlignProp) Aligning Text-to-Image Diffusion Models with Reward Backpropagation. arXiv 23.10

  • InstructVideo: Instructing Video Diffusion Models with Human Feedback. arXiv 23.12

  • UniFL: Improve Latent Diffusion Model via Unified Feedback Learning. arXiv 24.04

  • Video diffusion alignment via reward gradients. arXiv 24.07

  • RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation. arXiv 25.09

3.2 DPO

Key Trends:

  1. Global preference --> step-aware preference;
  2. Denser preference signals (patch-level, frame-level);
  3. Offline DPO --> Online DPO;
  4. Emphasizes learning more from positive/negative samples;
  5. Constructing implicit preference pairs (real vs. gen, curr vs. ema, self-play);
  • Diffusion Model Alignment Using Direct Preference Optimization. arXiv 23.11

  • Using human feedback to fine-tune diffusion models without any reward model. arXiv 23.11

  • Self-play fine-tuning of diffusion models for text-to-image generation. arXiv 24.02

  • A Dense Reward View on Aligning Text-to-Image Diffusion with Preference. arXiv 24.02

  • Boost Your Human Image Generation Model via Direct Preference Optimization. arXiv 24.05 (real image as the gt);

  • Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization. arXiv 24.06

  • Diffusion-rpo: Aligning diffusion models through relative preference optimization. arXiv 24.06

  • Scalable Ranked Preference Optimization for Text-to-Image Generation. arXiv 24.10 rankdpo

  • PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation. arXiv 24.12

  • Align Video Diffusion Model with Online Video-Centric Preference Optimization. arXiv 24.12

  • Videodpo: Omni-preference alignment for video diffusion generation. arXiv 24.12

  • Improving Video Generation with Human Feedback arXiv 25.01

  • Calibrated Multi-Preference Optimization for Aligning Diffusion Models. arXiv 25.02

  • InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment. arXiv 25.03

  • Fine-Tuning Diffusion Generative Models via Rich Preference Optimization. arXiv 25.03

  • Rethinking DPO-style Diffusion Aligning Frameworks. CVF 25.03

  • Positive Enhanced Preference Alignment for Text-to-Image Models. IEEE optimize positive

  • Diffusion-npo: Negative preference optimization for better preference aligned generation of diffusion models. arXiv 25.05

  • DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models. arXiv 25.06

  • Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation. arXiv 25.08

  • Follow-Your-Preference: Towards Preference-Aligned Image Inpainting. arXiv 25.09

  • Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator. arXiv

  • Diffusionnft: Online diffusion reinforcement with forward process. arXiv 25.09

  • RealDPO: Real or Not Real, that is the Preference. arXiv 25.10

  • Towards Better Optimization For Listwise Preference in Diffusion Models. arXiv 25.10

  • Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision. arXiv 25.12

  • PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation. arXiv 25.12

  • Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models. arXiv 26.01

3.3 RWR

  • Advantage-weighted regression: Simple and scalable off-policy reinforcement learning. arXiv 19.10

  • Aligning text-to-image models using human feedback. arXiv 23.02

  • Raft: Reward ranked finetuning for generative foundation model alignment. arXiv 23.04

  • Online Reward-Weighted Fine-Tuning of Flow Matching with Wasserstein Regularization. arXiv 25.02

  • GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning. arXiv 25.06

3.4 RLHF

  • Optimizing ddpm sampling with shortcut fine-tuning. arXiv 23.01

  • Training Diffusion Models with Reinforcement Learning. arXiv 23.05

  • DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models. arXiv 23.05

  • Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning. arXiv 23.11

  • A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning. arXiv 25.03

3.5 RLHF-GRPO

Key Trends

  1. Efficiency: sample efficiency, optimization efficiency (like sparse-step updates), faster reward acquisition;
  2. Avid reward hacking, like stronger trust-region control and improved sampling diversity;
  3. Dense reward signals, precise credit assign;
  4. Support for diverse reward functions, including verifiers and pairwise comparisons;
  • Flow-GRPO: Training Flow Matching Models via Online RL. arXiv 25.05

  • DanceGRPO: Unleashing GRPO on Visual Generation. arXiv 25.05

  • Tempflow-grpo: When timing matters for grpo in flow models. arXiv 25.08

  • Pref-grpo: Pairwise preference reward-based grpo for stable text-to-image reinforcement learning. arXiv 25.08

  • Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching. arXiv 25.08

  • Branchgrpo: Stable and efficient grpo with structured branching in diffusion models. arXiv 25.09

  • Reinforcement Learning with Inverse Rewards for World Model Post-training. arXiv 25.09

  • Advantage weighted matching: Aligning rl with pretraining in diffusion models. arXiv 25.09

  • Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models. arXiv 25.10

  • Understanding Sampler Stochasticity in Training Diffusion Models for RLHF. arXiv 25.10

  • G2RPO: Granular GRPO for Precise Reward in Flow Models. arXiv 25.10

  • Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation. arXiv 25.10

  • GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping. arXiv 25.10

  • Reinforcing Diffusion Models by Direct Group Preference Optimization. arXiv 25.10

  • Seeing What Matters: Visual Preference Policy Optimization for Visual Generation. arXiv 25.11

  • Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models. arXiv 25.11

  • The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation. arXiv 25.11

  • ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion. arXiv 25.11

  • Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards. arXiv 25.11

  • Data-regularized Reinforcement Learning for Diffusion Models at Scale. arXiv 25.12

  • RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards. arXiv 25.12

  • GARDO: Reinforcing Diffusion Models without Reward Hacking. arXiv 25.12

  • Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation. arXiv 26.01

  • Diffusion Alignment Beyond KL: Variance Minimisation as Effective Policy Optimiser. arXiv 26.02

  • UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing. arXiv 26.02

4 Inference Alignment

4.1 Gradient Guidance

Paper List
  • Universal guidance for diffusion models. arXiv 23.02

  • End-to-end diffusion latent optimization improves classifier guidance. arXiv 23.02

  • Gradient Guidance for Diffusion Models: An Optimization Perspective. arXiv 24.04

  • Reno: Enhancing one-step text-to-image models through reward-based noise optimization. arXiv 24.06

  • Not all noises are created equally: Diffusion noise selection and optimization. arXiv 24.07

  • Golden noise for diffusion models: A learning framework. arXiv 24.11

  • A noise is worth diffusion guidance. arXiv 24.12

4.2 Condition

Paper List
  • ReNeg: Learning Negative Embedding with Reward Guidance. arXiv 24.12

  • Prompt-a-video: Prompt your video diffusion model via preference-aligned llm. arXiv 24.12

  • IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance. arXiv 25.09

  • Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment. arXiv 25.10

Paper List
  • Test-time Alignment of Diffusion Models without Reward Over-optimization. arXiv 25.01

  • Inference-time scaling for diffusion models beyond scaling denoising steps. arXiv 25.01

  • A general framework for inference-time scaling and steering of diffusion models. arXiv 25.01

  • Inference-time text-to-video alignment with diffusion latent beam search. arXiv 25.01

  • Training-free guidance beyond differentiability: Scalable path steering with tree search in diffusion and flow models. arXiv 25.02

  • Dynamic Search for Inference-Time Alignment in Diffusion Models. arXiv 25.03

  • Inference-time scaling for flow models via stochastic generation and rollover budget forcing. arXiv 25.03

  • Scaling image and video generation via test-time evolutionary search. arXiv 25.05

5 Download Tasks

5.1 Human-centric AI & ID Preserving

Paper List
  • Identity-preserving image-to-video generation via reward-guided optimization. arXiv 25.10

  • Disco: Reinforcement with diversity constraints for multi-human generation. arXiv 25.10

  • PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards. arXiv 25.12

5.2 Control

Paper List
  • Itercomp: Iterative composition-aware feedback learning from model gallery for text-to-image generation. arXiv 24.10

  • Taming Camera-Controlled Video Generation with Verifiable Geometry Reward. arXiv 25.12

5.3 Long Video Generation

Paper List
  • Self-Forcing++: Towards Minute-Scale High-Quality Video Generation. arXiv 25.10

  • Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation. arXiv 25.12

5.4 Distillation

Paper List
  • Distribution Matching Distillation Meets Reinforcement Learning. arXiv 25.11

  • Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning. arXiv 25.11

5.5 3D

Paper List
  • Dreamreward: Text-to-3d generation with human preference. arXiv 24.03

  • DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization. arXiv 25.02

  • Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation. arXiv 25.12

6 Contact & Contributions

For any questions, suggestions or discussions, please feel free to reach out to me at gongyeliuu@gmail.com.

Contributors

GongyeLiu

6 commits