A curated list of Multi-Modal Reinforcement Learning resources (continually updated)
620
36 commits
updated May 30, 2026
This is a collection of research papers for Multi-Modal reinforcement learning (MMRL). And the repository will be continuously updated to track the frontier of MMRL. Some papers may not be relevant to RL, but we include them anyway as they may be useful for the research of MMRL.
Welcome to follow and star!
Multi-Modal RL agents focus on learning from video (images), language (text), or both, as humans do. We believe that it is important for intelligent agents to learn directly from images or text, since such data can be easily obtained from the Internet.

format:
- [title](paper link) [links]
- authors.
- key words.
- experiment environment.
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds
Mixture of Horizons in Action Chunking
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
CompassNav: Steering From Path Imitation to Decision Understanding In Navigation
No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
Geometry of Uncertainty: Learning Metric Spaces for Multimodal State Estimation in RL
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
To Think or Not To Think: A Study of Thinking in Rule-Based Visual Reinforcement Fine-Tuning
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning
SE-GUI: Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
Grounded Reinforcement Learning for Visual Reasoning
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
GRIT: Teaching MLLMs to Think with Images
NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
Video-R1: Reinforcing Video Reasoning in MLLMs
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
URSA: Unlocking Multimodal Mathematical Reasoning via Process Reward Model
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
ABNet: Adaptive explicit-Barrier Net for Safe and Scalable Robot Learning
DexScale: Automating Data Scaling for Sim2Real Generalizable Robot Control
DynaMind: Reasoning over Abstract Video Dynamics for Embodied Decision-Making
Craftium: Bridging Flexibility and Efficiency for Rich 3D Single- and Multi-Agent Environments
Vision Language Models are In-Context Value Learners
TopoNets: High performing vision and language models with brain-like topography
LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models
Multi-Robot Motion Planning with Diffusion Models
DrM: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization
Revisiting Data Augmentation in Deep Reinforcement Learning
Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages
Entity-Centric Reinforcement Learning for Object Manipulation from Pixels
PaLI: A Jointly-Scaled Multilingual Language-Image Model(notable top 5%)
VIMA: General Robot Manipulation with Multimodal Prompts
MIND ’S EYE: GROUNDED LANGUAGE MODEL REASONING THROUGH SIMULATION
Grounding Language to Entities and Dynamics for Generalization in Reinforcement Learning
Mastering Atari with Discrete World Models
Decoupling Representation Learning from Reinforcement Learning
Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient
Seek Commonality but Preserve Differences: Dissected Dynamics Modeling for Multi-modal Visual RL
Inverse Dynamics Pretraining Learns Good Representations for Multitask Imitation
Frequency-Enhanced Data Augmentation for Vision-and-Language Navigation
Language Is Not All You Need: Aligning Perception with Language Models
MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge
Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos
SOAT: A Scene-and Object-Aware Transformer for Vision-and-Language Navigation
Pretraining Representations for Data-Efficient Reinforcement Learning
Investigating Pre-Training Objectives for Generalization in Vision-Based Reinforcement Learning
RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
Reward Shaping for Reinforcement Learning with An Assistant Reward Agent
FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning
Rich-Observation Reinforcement Learning with Continuous Latent Dynamics
LLM-Empowered State Representation for Reinforcement Learning
Code as Reward: Empowering Reinforcement Learning with VLMs
Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents
Reinforcement Learning with Action-Free Pre-Training from Videos
History Compression via Language Models in Reinforcement Learning
Vision-and-Language Navigation via Causal Learning
End-to-end Generative Pretraining for Multimodal Video Captioning
Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks
Think Global, Act Local: Dual-scale Graph Transformer for Vision-and-Language Navigation
Masked Visual Pre-training for Motor Control
LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action
[Real-World Robot Learning with Masked Visual Pre-training](https://arxiv.org/abs/2210.03109)
R3M: A Universal Visual Representation for Robot Manipulation
RL-EMO: A Reinforcement Learning Framework for Multimodal Emotion Recognition ICASSP 2024
Language Conditioned Imitation Learning over Unstructured Data RSS 2021
Learning Generalizable Robotic Reward Functions from “In-The-Wild” Human Videos RSS 2021
Offline Reinforcement Learning from Images with Latent Space Models L4DC 2021
Is Cross-Attention Preferable to Self-Attention for Multi-Modal Emotion Recognition? ICASSP 2022
Spatialvlm: Endowing vision-language models with spatial reasoning capabilities
On Time-Indexing as Inductive Bias in Deep RL for Sequential Manipulation Tasks
Parameterized Decision-making with Multi-modal Perception for Autonomous Driving
Reinforced UI Instruction Grounding: Towards a Generic UI Task Automation API
Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving
End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning
Do as I can, not as I get:Topology-aware multi-hop reasoningon multi-modal knowledge graphs
Multimodal Reinforcement Learning for Robots Collaborating with Humans
See, Plan, Predict: Language-guided Cognitive Planning with Video Prediction
Open-vocabulary Queryable Scene Representations for Real World Planning
Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
Our purpose is to make this repo even better. If you are interested in contributing, please refer to HERE for instructions in contribution.
Awesome Multi-Modal Reinforcement Learning is released under the Apache 2.0 license.
A curated list of Multi-Modal Reinforcement Learning resources (continually updated)
620
36 commits
updated May 30, 2026
This is a collection of research papers for Multi-Modal reinforcement learning (MMRL). And the repository will be continuously updated to track the frontier of MMRL. Some papers may not be relevant to RL, but we include them anyway as they may be useful for the research of MMRL.
Welcome to follow and star!
Multi-Modal RL agents focus on learning from video (images), language (text), or both, as humans do. We believe that it is important for intelligent agents to learn directly from images or text, since such data can be easily obtained from the Internet.

format:
- [title](paper link) [links]
- authors.
- key words.
- experiment environment.
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds
Mixture of Horizons in Action Chunking
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
CompassNav: Steering From Path Imitation to Decision Understanding In Navigation
No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
Geometry of Uncertainty: Learning Metric Spaces for Multimodal State Estimation in RL
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
To Think or Not To Think: A Study of Thinking in Rule-Based Visual Reinforcement Fine-Tuning
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning
SE-GUI: Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
Grounded Reinforcement Learning for Visual Reasoning
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
GRIT: Teaching MLLMs to Think with Images
NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
Video-R1: Reinforcing Video Reasoning in MLLMs
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
URSA: Unlocking Multimodal Mathematical Reasoning via Process Reward Model
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
ABNet: Adaptive explicit-Barrier Net for Safe and Scalable Robot Learning
DexScale: Automating Data Scaling for Sim2Real Generalizable Robot Control
DynaMind: Reasoning over Abstract Video Dynamics for Embodied Decision-Making
Craftium: Bridging Flexibility and Efficiency for Rich 3D Single- and Multi-Agent Environments
Vision Language Models are In-Context Value Learners
TopoNets: High performing vision and language models with brain-like topography
LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models
Multi-Robot Motion Planning with Diffusion Models
DrM: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization
Revisiting Data Augmentation in Deep Reinforcement Learning
Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages
Entity-Centric Reinforcement Learning for Object Manipulation from Pixels
PaLI: A Jointly-Scaled Multilingual Language-Image Model(notable top 5%)
VIMA: General Robot Manipulation with Multimodal Prompts
MIND ’S EYE: GROUNDED LANGUAGE MODEL REASONING THROUGH SIMULATION
Grounding Language to Entities and Dynamics for Generalization in Reinforcement Learning
Mastering Atari with Discrete World Models
Decoupling Representation Learning from Reinforcement Learning
Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient
Seek Commonality but Preserve Differences: Dissected Dynamics Modeling for Multi-modal Visual RL
Inverse Dynamics Pretraining Learns Good Representations for Multitask Imitation
Frequency-Enhanced Data Augmentation for Vision-and-Language Navigation
Language Is Not All You Need: Aligning Perception with Language Models
MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge
Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos
SOAT: A Scene-and Object-Aware Transformer for Vision-and-Language Navigation
Pretraining Representations for Data-Efficient Reinforcement Learning
Investigating Pre-Training Objectives for Generalization in Vision-Based Reinforcement Learning
RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
Reward Shaping for Reinforcement Learning with An Assistant Reward Agent
FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning
Rich-Observation Reinforcement Learning with Continuous Latent Dynamics
LLM-Empowered State Representation for Reinforcement Learning
Code as Reward: Empowering Reinforcement Learning with VLMs
Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents
Reinforcement Learning with Action-Free Pre-Training from Videos
History Compression via Language Models in Reinforcement Learning
Vision-and-Language Navigation via Causal Learning
End-to-end Generative Pretraining for Multimodal Video Captioning
Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks
Think Global, Act Local: Dual-scale Graph Transformer for Vision-and-Language Navigation
Masked Visual Pre-training for Motor Control
LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action
[Real-World Robot Learning with Masked Visual Pre-training](https://arxiv.org/abs/2210.03109)
R3M: A Universal Visual Representation for Robot Manipulation
RL-EMO: A Reinforcement Learning Framework for Multimodal Emotion Recognition ICASSP 2024
Language Conditioned Imitation Learning over Unstructured Data RSS 2021
Learning Generalizable Robotic Reward Functions from “In-The-Wild” Human Videos RSS 2021
Offline Reinforcement Learning from Images with Latent Space Models L4DC 2021
Is Cross-Attention Preferable to Self-Attention for Multi-Modal Emotion Recognition? ICASSP 2022
Spatialvlm: Endowing vision-language models with spatial reasoning capabilities
On Time-Indexing as Inductive Bias in Deep RL for Sequential Manipulation Tasks
Parameterized Decision-making with Multi-modal Perception for Autonomous Driving
Reinforced UI Instruction Grounding: Towards a Generic UI Task Automation API
Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving
End-to-End Streaming Video Temporal Action Segmentation with Reinforce Learning
Do as I can, not as I get:Topology-aware multi-hop reasoningon multi-modal knowledge graphs
Multimodal Reinforcement Learning for Robots Collaborating with Humans
See, Plan, Predict: Language-guided Cognitive Planning with Video Prediction
Open-vocabulary Queryable Scene Representations for Real World Planning
Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
Our purpose is to make this repo even better. If you are interested in contributing, please refer to HERE for instructions in contribution.
Awesome Multi-Modal Reinforcement Learning is released under the Apache 2.0 license.