A curated list of Diffusion Model in RL resources (continually updated)
1,644
41 commits
updated May 30, 2026
This is a collection of research papers for Diffusion Model in RL. And the repository will be continuously updated to track the frontier of Diffusion RL.
Welcome to follow and star!
The Diffusion Model in RL was introduced by “Planning with Diffusion for Flexible Behavior Synthesis” by Janner, Michael, et al. It casts trajectory optimization as a diffusion probabilistic model that plans by iteratively refining trajectories.

There is another way: "Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning" by Wang, Z. proposed Diffusion Model as policy-optimization in offline RL, et al. Specifically, Diffusion-QL forms policy as a conditional diffusion model with states as the condition from the offline policy-optimization perspective.

format:
- [title](paper link) [links]
- author1, author2, and author3...
- publisher
- key
- code
- experiment environment
Flow-Based Single-Step Completion for Efficient and Expressive Policy Learning
3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
NoMaD: Goal Masked Diffusion Policies for Navigation and Exploration
IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies
To the Noise and Back: Diffusion for Shared Autonomy
PlayFusion: Skill Acquisition via Diffusion from Language-Annotated Play
XSkill: Cross Embodiment Skill Discovery
Diffusion Co-Policy for Synergistic Human-Robot Collaborative Tasks
GenAug: Retargeting behaviors to unseen situations via Generative Augmentation
Scaling Robot Learning with Semantically Imagined Experience
Value function estimation using conditional diffusion models for control
World Models via Policy-Guided Trajectory Diffusion
Diffusion Models for Reinforcement Learning: A Survey
Boosting Continuous Control with Consistency Policy
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
Learning to Reach Goals via Diffusion
AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model
Consistency Models as a Rich and Efficient Policy Class for Reinforcement Learning
MADiff: Offline Multi-agent Learning with Diffusion Models
Diffusion Policies for Out-of-Distribution Generalization in Offline Reinforcement Learning
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
Diffusion-based Generation, Optimization, and Planning in 3D Scenes
Goal-Conditioned Imitation Learning using Score-based Diffusion Policies
Reparameterization Flow Policy Optimization
DADP: Domain Adaptive Diffusion Policy
PromptRL: Prompt Matters in RL for Flow-Based Image Generation
FAIL: Flow Matching Adversarial Imitation Learning for Image Generation
Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models
Exploratory Diffusion Model for Unsupervised Reinforcement Learning
Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
Dichotomous Diffusion Policy Optimization
Flow Matching Policy Gradients
Flow Actor-Critic for Offline Reinforcement Learning
Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
Don't Trade Off Safety: Diffusion Regularization for Constrained Offline RL
Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models
GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning
ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning
State-Covering Trajectory Stitching for Diffusion Planners
MMaDA: Multimodal Large Diffusion Language Models
Prior-Guided Diffusion Planning for Offline Reinforcement Learning
Structural Information-based Hierarchical Diffusion for Offline Reinforcement Learning
Graph Diffusion for Robust Multi-Agent Coordination
DiMa: Understanding the Hardness of Online Matching Problems via Diffusion Models
RobustLight: Improving Robustness via Diffusion Reinforcement Learning for Traffic Signal Control
Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model
What Makes a Good Diffusion Planner for Decision Making?
Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
Bidirectional Decoding: Improving Action Chunking via Closed-Loop Resampling
Adversarial Environment Design via Regret-Guided Diffusion Models
Graph Diffusion Policy Optimization
PrefPaint: Aligning Image Inpainting Diffusion Model with Human Preference
Maximum Entropy Inverse Reinforcement Learning of Diffusion Models with Energy-Based Models
Text-Aware Diffusion for Policy Learning
Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient
Model-Based Diffusion for Trajectory Optimization
Diffusion for World Modeling: Visual Details Matter in Atari
MADiff: Offline Multi-agent Learning with Diffusion Models
Amortizing Intractable Inference in Diffusion Models for Vision, Language, and Control
Diffusion Actor-Critic with Entropy Regulator
Diffusion Spectral Representation for Reinforcement Learning
Resisting Stochastic Risks in Diffusion Planners with the Trajectory Aggregation Tree
DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
NIFTY: Neural Object Interaction Fields for Guided Human Motion Synthesis
Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic Manipulation
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
Training Diffusion Models with Reinforcement Learning
Reasoning with Latent Diffusion in Offline Reinforcement Learning
Flow to Better: Offline Preference-based Reinforcement Learning via Preferred Trajectory Generation
Score Regularized Policy Optimization through Diffusion Behavior
Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion
AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model
Language Control Diffusion: Efficiently Scaling through Space, Time, and Tasks
Belief-Enriched Pessimistic Q-Learning against Adversarial State Perturbations
Learning Universal Policies via Text-Guided Video Generation
Diffusion Model is an Effective Planner and Data Synthesizer for Multi-Task Reinforcement Learning
Learning Score-based Grasping Primitive for Human-assisting Dexterous Grasping
Efficient Diffusion Policies for Offline Reinforcement Learning
Optimizing DDPM Sampling with Shortcut Fine-Tuning
MetaDiffuser: Diffusion Model as Conditional Planner for Offline Meta-RL
Is Conditional Generative Modeling all you need for Decision-Making?
Imitating Human Behaviour with Diffusion Models
Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling
TarGF: Learning Target Gradient Field to Rearrange Objects without Explicit Goal Specification
Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning
Our purpose is to make this repo even better. If you are interested in contributing, please refer to HERE for instructions in contribution.
Awesome Diffusion Model in RL is released under the Apache 2.0 license.
85 followers · starred Oct 2024
3 followers · starred Mar 2024
A curated list of Diffusion Model in RL resources (continually updated)
1,644
41 commits
updated May 30, 2026
This is a collection of research papers for Diffusion Model in RL. And the repository will be continuously updated to track the frontier of Diffusion RL.
Welcome to follow and star!
The Diffusion Model in RL was introduced by “Planning with Diffusion for Flexible Behavior Synthesis” by Janner, Michael, et al. It casts trajectory optimization as a diffusion probabilistic model that plans by iteratively refining trajectories.

There is another way: "Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning" by Wang, Z. proposed Diffusion Model as policy-optimization in offline RL, et al. Specifically, Diffusion-QL forms policy as a conditional diffusion model with states as the condition from the offline policy-optimization perspective.

format:
- [title](paper link) [links]
- author1, author2, and author3...
- publisher
- key
- code
- experiment environment
Flow-Based Single-Step Completion for Efficient and Expressive Policy Learning
3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
NoMaD: Goal Masked Diffusion Policies for Navigation and Exploration
IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies
To the Noise and Back: Diffusion for Shared Autonomy
PlayFusion: Skill Acquisition via Diffusion from Language-Annotated Play
XSkill: Cross Embodiment Skill Discovery
Diffusion Co-Policy for Synergistic Human-Robot Collaborative Tasks
GenAug: Retargeting behaviors to unseen situations via Generative Augmentation
Scaling Robot Learning with Semantically Imagined Experience
Value function estimation using conditional diffusion models for control
World Models via Policy-Guided Trajectory Diffusion
Diffusion Models for Reinforcement Learning: A Survey
Boosting Continuous Control with Consistency Policy
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
Learning to Reach Goals via Diffusion
AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model
Consistency Models as a Rich and Efficient Policy Class for Reinforcement Learning
MADiff: Offline Multi-agent Learning with Diffusion Models
Diffusion Policies for Out-of-Distribution Generalization in Offline Reinforcement Learning
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
Diffusion-based Generation, Optimization, and Planning in 3D Scenes
Goal-Conditioned Imitation Learning using Score-based Diffusion Policies
Reparameterization Flow Policy Optimization
DADP: Domain Adaptive Diffusion Policy
PromptRL: Prompt Matters in RL for Flow-Based Image Generation
FAIL: Flow Matching Adversarial Imitation Learning for Image Generation
Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models
Exploratory Diffusion Model for Unsupervised Reinforcement Learning
Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
Dichotomous Diffusion Policy Optimization
Flow Matching Policy Gradients
Flow Actor-Critic for Offline Reinforcement Learning
Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
Don't Trade Off Safety: Diffusion Regularization for Constrained Offline RL
Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models
GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning
ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning
State-Covering Trajectory Stitching for Diffusion Planners
MMaDA: Multimodal Large Diffusion Language Models
Prior-Guided Diffusion Planning for Offline Reinforcement Learning
Structural Information-based Hierarchical Diffusion for Offline Reinforcement Learning
Graph Diffusion for Robust Multi-Agent Coordination
DiMa: Understanding the Hardness of Online Matching Problems via Diffusion Models
RobustLight: Improving Robustness via Diffusion Reinforcement Learning for Traffic Signal Control
Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model
What Makes a Good Diffusion Planner for Decision Making?
Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
Bidirectional Decoding: Improving Action Chunking via Closed-Loop Resampling
Adversarial Environment Design via Regret-Guided Diffusion Models
Graph Diffusion Policy Optimization
PrefPaint: Aligning Image Inpainting Diffusion Model with Human Preference
Maximum Entropy Inverse Reinforcement Learning of Diffusion Models with Energy-Based Models
Text-Aware Diffusion for Policy Learning
Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient
Model-Based Diffusion for Trajectory Optimization
Diffusion for World Modeling: Visual Details Matter in Atari
MADiff: Offline Multi-agent Learning with Diffusion Models
Amortizing Intractable Inference in Diffusion Models for Vision, Language, and Control
Diffusion Actor-Critic with Entropy Regulator
Diffusion Spectral Representation for Reinforcement Learning
Resisting Stochastic Risks in Diffusion Planners with the Trajectory Aggregation Tree
DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
NIFTY: Neural Object Interaction Fields for Guided Human Motion Synthesis
Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic Manipulation
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
Training Diffusion Models with Reinforcement Learning
Reasoning with Latent Diffusion in Offline Reinforcement Learning
Flow to Better: Offline Preference-based Reinforcement Learning via Preferred Trajectory Generation
Score Regularized Policy Optimization through Diffusion Behavior
Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion
AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model
Language Control Diffusion: Efficiently Scaling through Space, Time, and Tasks
Belief-Enriched Pessimistic Q-Learning against Adversarial State Perturbations
Learning Universal Policies via Text-Guided Video Generation
Diffusion Model is an Effective Planner and Data Synthesizer for Multi-Task Reinforcement Learning
Learning Score-based Grasping Primitive for Human-assisting Dexterous Grasping
Efficient Diffusion Policies for Offline Reinforcement Learning
Optimizing DDPM Sampling with Shortcut Fine-Tuning
MetaDiffuser: Diffusion Model as Conditional Planner for Offline Meta-RL
Is Conditional Generative Modeling all you need for Decision-Making?
Imitating Human Behaviour with Diffusion Models
Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling
TarGF: Learning Target Gradient Field to Rearrange Objects without Explicit Goal Specification
Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning
Our purpose is to make this repo even better. If you are interested in contributing, please refer to HERE for instructions in contribution.
Awesome Diffusion Model in RL is released under the Apache 2.0 license.
85 followers · starred Oct 2024
3 followers · starred Mar 2024