This repository is a curated collection of research papers, frameworks, and resources focusing on the Alignment and Post-Training of Diffusion/Flow-matching Models. As image and video generative models scale, aligning them with human preferences, physical constraints, and prompt adherence has become a critical paradigm.
This repository is updated continuously. We apologize for any omissions and welcome pull requests to merge them in.
Scaling Rectified Flow Transformers for High-Resolution Image Synthesis.
(StableDiffusion 3 from Stability AI).
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
(from NVIDIA)
Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model
(from ByteDance Seed Team)
HiDream-I1: A High-Efficient Image Generative Foundation
Model with Sparse Diffusion Transformer.
(from HiDream Team)
Seedream 4.0: Toward Next-generation Multimodal Image Generation
(from ByteDance Seed Team)
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
(from Alibaba Z-Image Team)
T2v-turbo: Breaking the quality bottleneck of video consistency model with mixed reward feedback.
Cosmos World Foundation Model Platform for Physical AI.
(from NVIDIA)
Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model.
(from Step-Video Team)
Wan: Open and Advanced Large-Scale Video Generative Models.
(from Alibaba Wan Team)
Skyreels-v2: Infinite-length film generative model.
(from SkyRells Team)
Seedance 1.0: Exploring the Boundaries of Video Generation Models.
(from ByteDance Seed Team)
World Simulation with Video Foundation Models for Physical AI.
(from Nvidia Cosmos Team)
HunyuanVideo 1.5 Technical Report.
(from Tencent Hunyuan Team)
Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model.
(from ByteDance Seed Team)
Laion-5b: An open large-scale dataset for training next generation image-text models.
Human Preference Score: Better Aligning Text-to-Image Models with Human Preference.
Imagereward: Learning and evaluating human preferences for text-to-image generation.
Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation.
Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis.
Learning Multi-dimensional Human Preference for Text-to-Image Generation.
Multimodal Large Language Models Make Text-to-Image Generative Models Align Better.
VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation.
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment.
Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution.
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation.
Onereward: Unified mask-guided image generation via multi-task human preference learning.
Skywork unipic 2.0: Building kontext model with online rl for unified multimodal model.
Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback.
Unified Reward Model for Multimodal Understanding and Generation.
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning.
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank.
VideoScore2: Think before You Score in Generative Video Evaluation.
Edit-R1: Unleashing Reasoning-Based Reinforcement Learning for Image Editing.
Vr-thinker: Boosting video reward models through thinking-with-image reasoning.
.
Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model.
Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation.
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation.
Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization.
Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling.
Imagereward: Learning and evaluating human preferences for text-to-image generation.
(DRAFT) Directly Fine-Tuning Diffusion Models on Differentiable Rewards.
(AlignProp) Aligning Text-to-Image Diffusion Models with Reward Backpropagation.
InstructVideo: Instructing Video Diffusion Models with Human Feedback.
UniFL: Improve Latent Diffusion Model via Unified Feedback Learning.
RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation.
Key Trends:
- Global preference --> step-aware preference;
- Denser preference signals (patch-level, frame-level);
- Offline DPO --> Online DPO;
- Emphasizes learning more from positive/negative samples;
- Constructing implicit preference pairs (real vs. gen, curr vs. ema, self-play);
Diffusion Model Alignment Using Direct Preference Optimization.
Using human feedback to fine-tune diffusion models without any reward model.
Self-play fine-tuning of diffusion models for text-to-image generation.
A Dense Reward View on Aligning Text-to-Image Diffusion with Preference.
Boost Your Human Image Generation Model via Direct Preference Optimization. (real image as the gt);
Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization.
Diffusion-rpo: Aligning diffusion models through relative preference optimization.
Scalable Ranked Preference Optimization for Text-to-Image Generation.
rankdpo
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation.
Align Video Diffusion Model with Online Video-Centric Preference Optimization.
Videodpo: Omni-preference alignment for video diffusion generation.
Calibrated Multi-Preference Optimization for Aligning Diffusion Models.
InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment.
Fine-Tuning Diffusion Generative Models via Rich Preference Optimization.
Positive Enhanced Preference Alignment for Text-to-Image Models.
optimize positive
Diffusion-npo: Negative preference optimization for better preference aligned generation of diffusion models.
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models.
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation.
Follow-Your-Preference: Towards Preference-Aligned Image Inpainting.
Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator.
Diffusionnft: Online diffusion reinforcement with forward process.
Towards Better Optimization For Listwise Preference in Diffusion Models.
Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision.
PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation.
Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models.
Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.
Raft: Reward ranked finetuning for generative foundation model alignment.
Online Reward-Weighted Fine-Tuning of Flow Matching with Wasserstein Regularization.
GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning.
DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models.
Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning.
A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning.
Key Trends
- Efficiency: sample efficiency, optimization efficiency (like sparse-step updates), faster reward acquisition;
- Avid reward hacking, like stronger trust-region control and improved sampling diversity;
- Dense reward signals, precise credit assign;
- Support for diverse reward functions, including verifiers and pairwise comparisons;
Pref-grpo: Pairwise preference reward-based grpo for stable text-to-image reinforcement learning.
Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching.
Branchgrpo: Stable and efficient grpo with structured branching in diffusion models.
Reinforcement Learning with Inverse Rewards for World Model Post-training.
Advantage weighted matching: Aligning rl with pretraining in diffusion models.
Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models.
Understanding Sampler Stochasticity in Training Diffusion Models for RLHF.
Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation.
GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping.
Reinforcing Diffusion Models by Direct Group Preference Optimization.
Seeing What Matters: Visual Preference Policy Optimization for Visual Generation.
Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models.
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation.
ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion.
Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards.
Data-regularized Reinforcement Learning for Diffusion Models at Scale.
RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards.
Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation.
Diffusion Alignment Beyond KL: Variance Minimisation as Effective Policy Optimiser.
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing.
End-to-end diffusion latent optimization improves classifier guidance.
Gradient Guidance for Diffusion Models: An Optimization Perspective.
Reno: Enhancing one-step text-to-image models through reward-based noise optimization.
Not all noises are created equally: Diffusion noise selection and optimization.
Test-time Alignment of Diffusion Models without Reward Over-optimization.
Inference-time scaling for diffusion models beyond scaling denoising steps.
A general framework for inference-time scaling and steering of diffusion models.
Inference-time text-to-video alignment with diffusion latent beam search.
Training-free guidance beyond differentiability: Scalable path steering with tree search in diffusion and flow models.
Dynamic Search for Inference-Time Alignment in Diffusion Models.
Inference-time scaling for flow models via stochastic generation and rollover budget forcing.
Scaling image and video generation via test-time evolutionary search.
For any questions, suggestions or discussions, please feel free to reach out to me at gongyeliuu@gmail.com.
6 commits
This repository is a curated collection of research papers, frameworks, and resources focusing on the Alignment and Post-Training of Diffusion/Flow-matching Models. As image and video generative models scale, aligning them with human preferences, physical constraints, and prompt adherence has become a critical paradigm.
This repository is updated continuously. We apologize for any omissions and welcome pull requests to merge them in.
Scaling Rectified Flow Transformers for High-Resolution Image Synthesis.
(StableDiffusion 3 from Stability AI).
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
(from NVIDIA)
Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model
(from ByteDance Seed Team)
HiDream-I1: A High-Efficient Image Generative Foundation
Model with Sparse Diffusion Transformer.
(from HiDream Team)
Seedream 4.0: Toward Next-generation Multimodal Image Generation
(from ByteDance Seed Team)
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
(from Alibaba Z-Image Team)
T2v-turbo: Breaking the quality bottleneck of video consistency model with mixed reward feedback.
Cosmos World Foundation Model Platform for Physical AI.
(from NVIDIA)
Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model.
(from Step-Video Team)
Wan: Open and Advanced Large-Scale Video Generative Models.
(from Alibaba Wan Team)
Skyreels-v2: Infinite-length film generative model.
(from SkyRells Team)
Seedance 1.0: Exploring the Boundaries of Video Generation Models.
(from ByteDance Seed Team)
World Simulation with Video Foundation Models for Physical AI.
(from Nvidia Cosmos Team)
HunyuanVideo 1.5 Technical Report.
(from Tencent Hunyuan Team)
Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model.
(from ByteDance Seed Team)
Laion-5b: An open large-scale dataset for training next generation image-text models.
Human Preference Score: Better Aligning Text-to-Image Models with Human Preference.
Imagereward: Learning and evaluating human preferences for text-to-image generation.
Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation.
Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis.
Learning Multi-dimensional Human Preference for Text-to-Image Generation.
Multimodal Large Language Models Make Text-to-Image Generative Models Align Better.
VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation.
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment.
Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution.
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation.
Onereward: Unified mask-guided image generation via multi-task human preference learning.
Skywork unipic 2.0: Building kontext model with online rl for unified multimodal model.
Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback.
Unified Reward Model for Multimodal Understanding and Generation.
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning.
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank.
VideoScore2: Think before You Score in Generative Video Evaluation.
Edit-R1: Unleashing Reasoning-Based Reinforcement Learning for Image Editing.
Vr-thinker: Boosting video reward models through thinking-with-image reasoning.
.
Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model.
Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation.
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation.
Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization.
Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling.
Imagereward: Learning and evaluating human preferences for text-to-image generation.
(DRAFT) Directly Fine-Tuning Diffusion Models on Differentiable Rewards.
(AlignProp) Aligning Text-to-Image Diffusion Models with Reward Backpropagation.
InstructVideo: Instructing Video Diffusion Models with Human Feedback.
UniFL: Improve Latent Diffusion Model via Unified Feedback Learning.
RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation.
Key Trends:
- Global preference --> step-aware preference;
- Denser preference signals (patch-level, frame-level);
- Offline DPO --> Online DPO;
- Emphasizes learning more from positive/negative samples;
- Constructing implicit preference pairs (real vs. gen, curr vs. ema, self-play);
Diffusion Model Alignment Using Direct Preference Optimization.
Using human feedback to fine-tune diffusion models without any reward model.
Self-play fine-tuning of diffusion models for text-to-image generation.
A Dense Reward View on Aligning Text-to-Image Diffusion with Preference.
Boost Your Human Image Generation Model via Direct Preference Optimization. (real image as the gt);
Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization.
Diffusion-rpo: Aligning diffusion models through relative preference optimization.
Scalable Ranked Preference Optimization for Text-to-Image Generation.
rankdpo
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation.
Align Video Diffusion Model with Online Video-Centric Preference Optimization.
Videodpo: Omni-preference alignment for video diffusion generation.
Calibrated Multi-Preference Optimization for Aligning Diffusion Models.
InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment.
Fine-Tuning Diffusion Generative Models via Rich Preference Optimization.
Positive Enhanced Preference Alignment for Text-to-Image Models.
optimize positive
Diffusion-npo: Negative preference optimization for better preference aligned generation of diffusion models.
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models.
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation.
Follow-Your-Preference: Towards Preference-Aligned Image Inpainting.
Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator.
Diffusionnft: Online diffusion reinforcement with forward process.
Towards Better Optimization For Listwise Preference in Diffusion Models.
Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision.
PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation.
Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models.
Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.
Raft: Reward ranked finetuning for generative foundation model alignment.
Online Reward-Weighted Fine-Tuning of Flow Matching with Wasserstein Regularization.
GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning.
DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models.
Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning.
A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning.
Key Trends
- Efficiency: sample efficiency, optimization efficiency (like sparse-step updates), faster reward acquisition;
- Avid reward hacking, like stronger trust-region control and improved sampling diversity;
- Dense reward signals, precise credit assign;
- Support for diverse reward functions, including verifiers and pairwise comparisons;
Pref-grpo: Pairwise preference reward-based grpo for stable text-to-image reinforcement learning.
Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching.
Branchgrpo: Stable and efficient grpo with structured branching in diffusion models.
Reinforcement Learning with Inverse Rewards for World Model Post-training.
Advantage weighted matching: Aligning rl with pretraining in diffusion models.
Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models.
Understanding Sampler Stochasticity in Training Diffusion Models for RLHF.
Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation.
GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping.
Reinforcing Diffusion Models by Direct Group Preference Optimization.
Seeing What Matters: Visual Preference Policy Optimization for Visual Generation.
Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models.
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation.
ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion.
Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards.
Data-regularized Reinforcement Learning for Diffusion Models at Scale.
RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards.
Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation.
Diffusion Alignment Beyond KL: Variance Minimisation as Effective Policy Optimiser.
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing.
End-to-end diffusion latent optimization improves classifier guidance.
Gradient Guidance for Diffusion Models: An Optimization Perspective.
Reno: Enhancing one-step text-to-image models through reward-based noise optimization.
Not all noises are created equally: Diffusion noise selection and optimization.
Test-time Alignment of Diffusion Models without Reward Over-optimization.
Inference-time scaling for diffusion models beyond scaling denoising steps.
A general framework for inference-time scaling and steering of diffusion models.
Inference-time text-to-video alignment with diffusion latent beam search.
Training-free guidance beyond differentiability: Scalable path steering with tree search in diffusion and flow models.
Dynamic Search for Inference-Time Alignment in Diffusion Models.
Inference-time scaling for flow models via stochastic generation and rollover budget forcing.
Scaling image and video generation via test-time evolutionary search.
For any questions, suggestions or discussions, please feel free to reach out to me at gongyeliuu@gmail.com.
6 commits