Latest Advances on (RL based) Multimodal Reasoning and Generation in Multimodal LLMs
102
127 commits
updated Sep 10, 2026
This is a repository for organizing papers related to Multimodal Reasoning in Multimodal Large Language Models (Image, Video).
With the development of the visual (audio) capabilities and reasoning capabilities (RL powered) of multimodal large language models(MLLMs/LVLMs/LSLMs), researchers have high hopes for the multimodal reasoning capabilities of MLLM/LVLM/LSLM.
This repo also select paper about visual generation (image generation/video generation) with RL/CoT.
This repository aims to cover ALL possibly relevant papers to support research surveys, not just selected best papers. We believe comprehensive coverage is more valuable for researchers than a curated list.
(06 Jun 2026) Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning
(01 Jun 2026) TechRAG: Evidence-Gated Multimodal Agentic RAG for Technical Literature Reasoning
(20 May 2026) A Survey of Audio Reasoning in Multimodal Foundation Models
(05 May 2026) Material Database Agent: A Multimodal Agentic Framework for Scientific Literature Mining
(25 Apr 2026) GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI
(8 May 2025) Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
(30 Apr 2025) Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
(4 Apr 2025) Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning
(18 Mar 2025) Aligning Multimodal LLM with Human Preference: A Survey
(16 Mar 2025) Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
(09 Sep 2026) On-Policy Distillation for Vision-Language Model Adaptation, an Effective Paradigm on Low-Quality Multimodal Data
(09 Sep 2026) Beyond Surface Imitation: Contrastive Modeling for Reasoning Path Alignment in Multimodal In-Context Learning
(09 Sep 2026) From Pixels to Hierarchical Sequences: Quadtree Mask Encoding for Vision-Language Binary Change Detection
(08 Sep 2026) Drive by Hindsight and Foresight: Tool-Grounded Synergistic Reasoning over Hierarchical Memory for Autonomous Driving
(08 Sep 2026) From Glance to Scrutiny: Progressive Distortion Reasoning for Fine-Grained Image Quality Assessment
(08 Sep 2026) SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning Segmentation
(08 Sep 2026) CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs
(07 Sep 2026) Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification
(07 Sep 2026) SupGRPO: Enhancing GRPO with Matching-based Online SFT for Text Spotting
(07 Sep 2026) MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling
(06 Sep 2026) Counterfactual Tests for Measuring Chain-of-Thought Faithfulness in Visual Language Models
(06 Sep 2026) Separating Capability from Confidence: Grounded Dual-State Calibration for GRPO-Trained Medical Vision-Language Models
(05 Sep 2026) Distilling Vision-Language Models for On-Device Fire Understanding
(05 Sep 2026) Geometry-Aware Test-Time Learning for Quantitative Spatial Reasoning
(04 Sep 2026) MCPO: Modality-Contrastive Preference Optimization for Multimodal Chain-of-Thought Compression
(04 Sep 2026) Think-Verify-Revise: Neuro-Symbolic Visual Reasoning with Vision-Language Models and Dynamic Logic Tensor Networks
(03 Sep 2026) Revisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment
(03 Sep 2026) CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation
(03 Sep 2026) When Depth Hurts: Reliability-Aware Geometry Distillation for Depth-Free RGB-D Salient Object Detection
(03 Sep 2026) MedQA-MM: Shortcuts Behind Medical Visual Reasoning
(03 Sep 2026) GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs
(02 Sep 2026) CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction
(02 Sep 2026) Test-Time Logit Prompting for Source-Free Missing Modality Adaptation
(01 Sep 2026) Controllable Image Captioning with Prompt-Conditioned Scene Rewards
(01 Sep 2026) MERGED: Multimodal Entity Resolution via Generated Expert Reasoning Distillation
(01 Sep 2026) GazeRefine: Expert Gaze as a Test-Time Prompt for Training-Free Medical Image Segmentation
(01 Sep 2026) Towards reliable multimodal disaster severity assessment through preference optimization and explainable vision-language reasoning
(01 Sep 2026) A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss
(01 Sep 2026) Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures
(01 Sep 2026) Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis
(01 Sep 2026) Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation Methods
(31 Aug 2026) Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving
(31 Aug 2026) Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry
(31 Aug 2026) Reactivating Test-Time Scaling for Plane Geometry Problem Solving
(31 Aug 2026) SlideBank: A Persistent Hierarchical Evidence Bank for Consistent Whole-Slide Reasoning
(30 Aug 2026) InspectorGPT: A Comparative Reasoning Enhanced VLM for Comprehensive Industrial Anomaly Detection
(30 Aug 2026) Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency
(29 Aug 2026) Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs
(29 Aug 2026) GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models
(27 Aug 2026) Instruction Distillation: Text Instructions as Visual Examples
(27 Aug 2026) From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation
(27 Aug 2026) Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper
(26 Aug 2026) V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
(26 Aug 2026) GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models
(25 Aug 2026) EVEREST:Endogenous Vision-Language Reinforcement Reasoning Exploration for Urban Socio-Semantic Segmentation
(24 Aug 2026) AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes
(24 Aug 2026) CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension
(24 Aug 2026) LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation
(23 Aug 2026) Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding
(23 Aug 2026) UR$^{2}$-MLLM: Uncertainty-aware Revisit Reasoning in Multimodal Large Language Models for Radiology Report Generation
(23 Aug 2026) LiST: Local-Simplex Test-Time LoRA Fusion
(22 Aug 2026) Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning
(22 Aug 2026) VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression
(21 Aug 2026) Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning
(21 Aug 2026) ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models
(21 Aug 2026) Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds
(21 Aug 2026) Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs
(20 Aug 2026) ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation
(20 Aug 2026) Evidence-Gated Task and Motion Planning with Vision-Language Models
(20 Aug 2026) Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models
(20 Aug 2026) G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation
(20 Aug 2026) PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment
(20 Aug 2026) Question-Guided Evidence Acquisition for Multimodal Visual Question Answering
(20 Aug 2026) Answer-Level Trust Selection for Physical Vision-Language Reasoning
(20 Aug 2026) Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment
(19 Aug 2026) UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval
(19 Aug 2026) PCQA-R1: Advancing Generalized 3D Point Cloud Quality Assessment with Reinforcement Learning
(19 Aug 2026) Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference
(19 Aug 2026) Clinically Structured Surrogate Rewards for Post-SFT Medical Image Captioning
(19 Aug 2026) COSTA: A Cluster-Centric Paradigm for Annotation-Free Open-Set Semantic Segmentation of Aerial Point Clouds with Domain Shifts
(19 Aug 2026) DynCur-Geo: Dynamic Curiosity Reward Shaping for Multimodal Active Geo-Localization
(19 Aug 2026) GRACE: Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration for Educational Visual Question Answering
(18 Aug 2026) Integrating Novelty and Surprise for Experience Prioritization and Exploration in Image-Based Reinforcement Learning
(18 Aug 2026) PathoArgus: Advancing Evidence-Grounded Long-Context Visual Reasoning across Gigapixel Whole-Slide and Multi-Slide Case Contexts
(17 Aug 2026) Interactive Whole Slide Images for RL-based Tumour Segmentation
(17 Aug 2026) Q-Learning With World Models
(17 Aug 2026) Lymphocyte Mimicry Correction via Region-Level Tissue Reasoning and Unbalanced Optimal Transport
(17 Aug 2026) Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning
(16 Aug 2026) SEER: Long-Context Reasoning via Selective Visual-Text Compression
(15 Aug 2026) MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems
(15 Aug 2026) Risk-Adaptive Edge--Cloud Visual Reasoning for Communication-Efficient Autonomous Driving
(15 Aug 2026) Physiological World Models for Human State Transitions
(14 Aug 2026) Self-Supervised Visual On-Policy Distillation
(14 Aug 2026) Test-Time Instance Selection for Improved Whole Slide Image Analysis
(14 Aug 2026) SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation
(13 Aug 2026) Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs
(13 Aug 2026) LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning
(11 Aug 2026) ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes
(11 Aug 2026) CARE: Confidence-Aware Reasoning for Reliable Medical VQA
(10 Aug 2026) ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection
(10 Aug 2026) Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models
(10 Aug 2026) FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving
(09 Aug 2026) Improving Generalization Robustness of Multimodal RLVR
(08 Aug 2026) Evidence-RL: Towards Evidence-intensive Visual Reasoning
(08 Aug 2026) PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets
(08 Aug 2026) StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning
(06 Aug 2026) Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval
(06 Aug 2026) WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader
(05 Aug 2026) Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO
(05 Aug 2026) Multi-Branch Policy Optimization for Multimodal Large Language Models
(05 Aug 2026) ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination
(05 Aug 2026) Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs
(05 Aug 2026) OPD-V: Visual On-Policy Self-Distillation with Modality Balance
(04 Aug 2026) Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach
(04 Aug 2026) Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training
(04 Aug 2026) Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning
(04 Aug 2026) CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement
(04 Aug 2026) DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning
(04 Aug 2026) Monte Carlo Tree Search for Table-to-Multimodal Report Generation
(04 Aug 2026) TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering
(03 Aug 2026) Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
(03 Aug 2026) VC-Tooler: Learning Compositional and Adaptive Visual Tool Use
(03 Aug 2026) SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models
(03 Aug 2026) Local Margin Restoration for Test-Time Adaptation of Vision-Language Models
(03 Aug 2026) MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving
(03 Aug 2026) CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning
(02 Aug 2026) It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling
(02 Aug 2026) Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning
(02 Aug 2026) Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models
(31 Jul 2026) Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models
(30 Jul 2026) Can Vision-Language Models Reason about AI Edits in Images?
(29 Jul 2026) FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing
(27 Jul 2026) Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding
(26 Jul 2026) Offline-Online Curriculum RL for Multimodal Reasoning
(26 Jul 2026) PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis
(25 Jul 2026) Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation
(24 Jul 2026) Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning
(23 Jul 2026) Visual Contrastive Self-Distillation
(23 Jul 2026) Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints
(22 Jul 2026) Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
(21 Jul 2026) DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization
(21 Jul 2026) Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency
(19 Jul 2026) LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning
(18 Jul 2026) FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images
(17 Jul 2026) IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models
(17 Jul 2026) ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning
(17 Jul 2026) WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding
(16 Jul 2026) Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment
(15 Jul 2026) SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
(15 Jul 2026) SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning
(14 Jul 2026) UniVR: Thinking in Visual Space for Unified Visual Reasoning
(14 Jul 2026) Visual Access Boundaries in Vision-Language Model Reasoning
(13 Jul 2026) SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
(12 Jul 2026) Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs
(12 Jul 2026) When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion
(10 Jul 2026) Multimodal Reward Hacking in Reinforcement Learning
(08 Jul 2026) BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning
(07 Jul 2026) Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning
(05 Jul 2026) RL Forgets! Towards Continual Policy Optimization
(02 Jul 2026) Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning
(02 Jul 2026) DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation
(01 Jul 2026) VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning
(01 Jul 2026) GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision
(01 Jul 2026) Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
(01 Jul 2026) Selective Test-Time Debiasing for CLIP via Reward Gating
(01 Jul 2026) ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models
(01 Jul 2026) DART-VLN: Test-Time Memory Decay and Anti-Loop Regularization for Discrete Vision-Language Navigation
(01 Jul 2026) ESC: Emotional Self-Correction for Reliable Vision-Language Models
(01 Jul 2026) H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation
(24 Jun 2026) V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning
(23 Jun 2026) PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought
(22 Jun 2026) CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
(22 Jun 2026) VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct
(22 Jun 2026) Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
(22 Jun 2026) AIR: Adaptive Interleaved Reasoning with Code in MLLMs
(18 Jun 2026) SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs
(16 Jun 2026) Enhancing Pathological VLMs with Cross-scale Reasoning
(16 Jun 2026) Reinforcing Dual-Path Reasoning in Spatial Vision Language Models
(16 Jun 2026) See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL
(15 Jun 2026) Thinking with Visual Grounding
(15 Jun 2026) DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models
(14 Jun 2026) NeRD: Neuro-Symbolic Rule Distillation for Efficient Ontology-Grounded Chain-of-Thought in Medical Image Diagnosis
(14 Jun 2026) Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning
(14 Jun 2026) SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks
(13 Jun 2026) Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities
(12 Jun 2026) CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment
(11 Jun 2026) Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding
(09 Jun 2026) Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts
(08 Jun 2026) CRANE: Knowledge Editing for Reasoning MLLMs
(08 Jun 2026) Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization
(06 Jun 2026) DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning
(05 Jun 2026) Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization
(03 Jun 2026) Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning
(03 Jun 2026) Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning
(02 Jun 2026) Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection
(02 Jun 2026) Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
(02 Jun 2026) SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation
(19 May 2026) From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
(19 May 2026) JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA
(18 May 2026) Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
(18 May 2026) IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning
(17 May 2026) Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era
(16 May 2026) HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation
(14 May 2026) Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture
(13 May 2026) PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
(13 May 2026) Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning
(13 May 2026) Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
(12 May 2026) OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models
(12 May 2026) Composition of Memory Experts for Diffusion World Models
(10 May 2026) Reinforcing Multimodal Reasoning Against Visual Degradation
(10 May 2026) DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
(10 May 2026) Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning
(10 May 2026) Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning
(10 May 2026) Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT
(08 May 2026) BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning
(08 May 2026) GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning
(04 May 2026) Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning
(03 May 2026) Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
(02 May 2026) Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression
(01 May 2026) Structured Role-Aware Policy Optimization for Multimodal Reasoning
(01 May 2026) MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
(30 Apr 2026) VeraRetouch: A Lightweight Fully Differentiable Framework for Multi-Task Reasoning Photo Retouching
(30 Apr 2026) Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
(30 Apr 2026) WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning
(30 Apr 2026) Detecting is Easy, Adapting is Hard: Local Expert Growth for Visual Model-Based Reinforcement Learning under Distribution Shift
(30 Apr 2026) PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations
(30 Apr 2026) The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models
(29 Apr 2026) World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning
(29 Apr 2026) Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
(29 Apr 2026) Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding
(28 Apr 2026) Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning
(28 Apr 2026) SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring
(27 Apr 2026) Improving Vision-language Models with Perception-centric Process Reward Models
(27 Apr 2026) See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
(27 Apr 2026) PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model
(27 Apr 2026) VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions
(13 Apr 2026) POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
(13 Apr 2026) CFMS: A Coarse-to-Fine Multimodal Synthesis Framework for Enhanced Tabular Reasoning
(13 Apr 2026) Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images
(10 Apr 2026) VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
(10 Apr 2026) Visually-Guided Policy Optimization for Multimodal Reasoning
(09 Apr 2026) Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models
(09 Apr 2026) TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction
(09 Apr 2026) OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
(09 Apr 2026) Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data
(09 Apr 2026) WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models
(09 Apr 2026) AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
(08 Apr 2026) Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
(07 Apr 2026) MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control
(07 Apr 2026) WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
(07 Apr 2026) Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
(06 Apr 2026) Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward
(05 Apr 2026) Belief-Aware VLM Model for Human-like Reasoning
(03 Apr 2026) Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models
(03 Apr 2026) Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models
(03 Apr 2026) CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
(03 Apr 2026) FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation
(02 Apr 2026) Guideline2Graph: Profile-Aware Multimodal Parsing for Executable Clinical Decision Graphs
(02 Apr 2026) Impact of Multimodal and Conversational AI on Learning Outcomes and Experience
(02 Apr 2026) Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
(02 Apr 2026) MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction
(01 Apr 2026) Vero: An Open RL Recipe for General Visual Reasoning
(01 Apr 2026) Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization
(01 Apr 2026) EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs
(01 Apr 2026) All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models
(30 Mar 2026) Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning
(30 Mar 2026) MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding
(30 Mar 2026) $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning
(29 Mar 2026) LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
(29 Mar 2026) Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs
(28 Mar 2026) Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
(28 Mar 2026) Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
(27 Mar 2026) Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR
(26 Mar 2026) R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning
(26 Mar 2026) Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs
(24 Mar 2026) MedCausalX: Adaptive Causal Reasoning with Self-Reflection for Trustworthy Medical Vision-Language Models
(24 Mar 2026) Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
(24 Mar 2026) GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning
(23 Mar 2026) Getting to the Point: Why Pointing Improves LVLMs
(23 Mar 2026) Rethinking Token Reduction for Large Vision-Language Models
(21 Mar 2026) Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning
(20 Mar 2026) One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment
(19 Mar 2026) Balanced Thinking: Improving Chain of Thought Training in Vision Language Models
(19 Mar 2026) TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
(17 Mar 2026) HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
(17 Mar 2026) DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models
(17 Mar 2026) The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models
(17 Mar 2026) Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning
(16 Mar 2026) Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing
(15 Mar 2026) On the Nature of Attention Sink that Shapes Decoding Strategy in MLLMs
(14 Mar 2026) Improving Visual Reasoning with Iterative Evidence Refinement
(12 Mar 2026) Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation
(10 Mar 2026) C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis
(10 Mar 2026) MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning
(10 Mar 2026) GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
(09 Mar 2026) MJ1: Multimodal Judgment via Grounded Verification
(08 Mar 2026) Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models
(08 Mar 2026) Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models
(07 Mar 2026) Perception-Aware Multimodal Spatial Reasoning from Monocular Images
(06 Mar 2026) MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation
(06 Mar 2026) PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
(06 Mar 2026) ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
(05 Mar 2026) Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
(04 Mar 2026) Phi-4-reasoning-vision-15B Technical Report
(04 Mar 2026) Discriminative Perception via Anchored Description for Reasoning Segmentation
(03 Mar 2026) TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
(03 Mar 2026) SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety
(02 Mar 2026) Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine
(01 Mar 2026) Can Thinking Models Think to Detect Hateful Memes?
(01 Mar 2026) ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
(01 Mar 2026) DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage
(01 Mar 2026) ICPRL: Acquiring Physical Intuition from Interactive Control
(28 Feb 2026) PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment
(27 Feb 2026) Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
(27 Feb 2026) EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
(27 Feb 2026) Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning
(27 Feb 2026) Toward Guarantees for Clinical Reasoning in Vision Language Models via Formal Verification
(27 Feb 2026) Reasoning-Driven Multimodal LLM for Domain Generalization
(26 Feb 2026) MediX-R1: Open Ended Medical Reinforcement Learning
(25 Feb 2026) MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving
(25 Feb 2026) See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
(25 Feb 2026) RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
(24 Feb 2026) Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
(23 Feb 2026) TextShield-R1: Reinforced Reasoning for Tampered Text Detection
(23 Feb 2026) Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking
(19 Feb 2026) Enabling Training-Free Text-Based Remote Sensing Segmentation
(18 Feb 2026) Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning
(17 Feb 2026) Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families
(17 Feb 2026) On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
(16 Feb 2026) Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning
(16 Feb 2026) TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning
(15 Feb 2026) ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization
(15 Feb 2026) GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
(14 Feb 2026) Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
(13 Feb 2026) Reliable Thinking with Images
(13 Feb 2026) Thinking Like a Radiologist: A Dataset for Anatomy-Guided Interleaved Vision Language Reasoning in Chest X-ray Interpretation
(12 Feb 2026) Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning
(11 Feb 2026) Canvas-of-Thought: Grounding Reasoning via Mutable Structured States
(10 Feb 2026) Bridging Efficiency and Transparency: Explainable CoT Compression in Multimodal Large Reasoning Models
(10 Feb 2026) Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
(10 Feb 2026) GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation
(09 Feb 2026) AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection
(09 Feb 2026) Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
(09 Feb 2026) When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
(07 Feb 2026) Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
(06 Feb 2026) MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images
(06 Feb 2026) SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs
(05 Feb 2026) Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR
(05 Feb 2026) Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning
(04 Feb 2026) Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision
(04 Feb 2026) Training Data Efficiency in Multimodal Process Reward Models
(03 Feb 2026) Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance
(02 Feb 2026) Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling
(02 Feb 2026) VLM-Guided Experience Replay
(02 Feb 2026) ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
(02 Feb 2026) Multimodal Large Language Models for Real-Time Situated Reasoning
(01 Feb 2026) StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating
(01 Feb 2026) Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis
(01 Feb 2026) SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning
(31 Jan 2026) RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
(29 Jan 2026) MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods
(28 Jan 2026) MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models
(27 Jan 2026) Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
(26 Jan 2026) AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
(22 Jan 2026) Explainable Deepfake Detection with RL Enhanced Self-Blended Images
(20 Jan 2026) Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
(19 Jan 2026) Think3D: Thinking with Space for Spatial Reasoning
(16 Jan 2026) MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement
(12 Jan 2026) CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation
(12 Jan 2026) MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning
(11 Jan 2026) E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis
(11 Jan 2026) Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
(09 Jan 2026) SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More
(08 Jan 2026) Agri-R1: Agricultural Reasoning for Disease Diagnosis via Automated-Synthesis and Reinforcement Learning
(06 Jan 2026) ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
(06 Jan 2026) Towards Faithful Reasoning in Comics for Small MLLMs
(06 Jan 2026) Aligning Findings with Diagnosis: A Self-Consistent Reinforcement Learning Framework for Trustworthy Radiology Reporting
(01 Jan 2026) CPPO: Contrastive Perception for Vision Language Policy Optimization
(01 Jan 2026) From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning
(31 Dec 2025) From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme
(22 Dec 2025) Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection
(22 Dec 2025) CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
(22 Dec 2025) Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation
(22 Dec 2025) SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models
(20 Dec 2025) Stable and Efficient Single-Rollout RL for Multimodal Reasoning
(19 Dec 2025) Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
(19 Dec 2025) Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding
(18 Dec 2025) AdaTooler-V: Adaptive Tool-Use for Images and Videos
(16 Dec 2025) Incentivizing Tool-augmented Thinking with Images for Medical Image Analysis
(16 Dec 2025) ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
(16 Dec 2025) OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
(13 Dec 2025) More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models
(13 Dec 2025) Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking
(12 Dec 2025) DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
(08 Dec 2025) MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning
(07 Dec 2025) Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning
(07 Dec 2025) The Role of Entropy in Visual Grounding: Analysis and Optimization
(06 Dec 2025) ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models
(03 Dec 2025) TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning
(03 Dec 2025) Thinking with Programming Vision: Towards a Unified View for Thinking with Images
(03 Dec 2025) Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
(02 Dec 2025) See, Think, Learn: A Self-Taught Multimodal Reasoner
(29 Nov 2025) ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
(28 Nov 2025) TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM
(27 Nov 2025) GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes
(24 Nov 2025) Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
(23 Nov 2025) Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
(22 Nov 2025) PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning
(21 Nov 2025) VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
(21 Nov 2025) ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
(20 Nov 2025) OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
(19 Nov 2025) VisPlay: Self-Evolving Vision-Language Models from Images
(17 Nov 2025) Video Finetuning Improves Reasoning Between Frames
(17 Nov 2025) From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
(17 Nov 2025) SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
(14 Nov 2025) Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions
(11 Nov 2025) From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
(10 Nov 2025) Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View
(07 Nov 2025) PreResQ-R1: Towards Fine-Grained Rank-and-Score Reinforcement Learning for Visual Quality Assessment via Preference-Response Disentangled Policy Optimization
(04 Nov 2025) ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension
(04 Nov 2025) SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning
(01 Nov 2025) UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings
(01 Nov 2025) Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
(31 Oct 2025) Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
(23 Oct 2025) Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning
(23 Oct 2025) Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
(18 Oct 2025) RL makes MLLMs see better than SFT
(16 Oct 2025) MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
(15 Oct 2025) Generative Universal Verifier as Multimodal Meta-Reasoner
(14 Oct 2025) HoneyBee: Data Recipes for Vision-Language Reasoners
(14 Oct 2025) DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
(13 Oct 2025) CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
(10 Oct 2025) Unleashing Perception-Time Scaling to Multimodal Reasoning Models
(10 Oct 2025) Spotlight on Token Perception for Multimodal Reinforcement Learning
(10 Oct 2025) Tiny-R1V: Lightweight Multimodal Unified Reasoning Model via Model Merging
(9 Oct 2025) ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping
(9 Oct 2025) SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
(6 Oct 2025) Beyond Monolithic Rewards: A Hybrid and Multi-Aspect Reward Optimization for MLLM Alignment
(3 Oct 2025) Efficient Test-Time Scaling for Small Vision-Language Models
(29 Sep 2025) Latent Visual Reasoning
(29 Sep 2025) GeoVLM-R1: Reinforcement Fine-Tuning for Improved Remote Sensing Reasoning
(29 Sep 2025) VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding
(29 Sep 2025) Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
(28 Sep 2025) Poivre: Self-Refining Visual Pointing with Reinforcement Learning
(27 Sep 2025) Decoupling Reasoning and Perception: An LLM-LMM Framework for Faithful Visual Reasoning
(25 Sep 2025) MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources
(12 Sep 2025) LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
(9 Sep 2025) Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
(28 Aug 2025) R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning
(27 Aug 2025) Self-Rewarding Vision-Language Model via Reasoning Decomposition
(18 Aug 2025) M3PO: Multimodal-Model-Guided Preference Optimization for Visual Instruction Following
(18 Aug 2025) Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
(18 Aug 2025) Ovis2.5 Technical Report
(18 Aug 2025) MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models
(8 Aug 2025) SIFThinker: Spatially-Aware Image Focus for Visual Reasoning
(7 Aug 2025) Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
(7 Aug 2025) StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models
(5 Aug 2025) Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions
(30 Jul 2025) MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention
(28 Jul 2025) Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
(24 Jul 2025) MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning
(24 Jul 2025) SafeWork-R1: Coevolving Safety and Intelligence under the AI-45 Law
(22 Jul 2025) C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
(22 Jul 2025) Semi-off-Policy Reinforcement Learning for Vision-Language Slow-thinking Reasoning
(11 Jul 2025) M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning
(3 Jul 2025) Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
(1 Jul 2025) GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
(20 Jun 2025) GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
(16 Jun 2025) Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning
(11 Jun 2025) ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
(5 Jun 2025) Perceptual Decoupling for Scalable Multi-modal Reasoning via Reward-Optimized Captioning
(5 Jun 2025) MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
(16 May 2025) Visual Planning: Let's Think Only with Images
(15 May 2025) MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning
(13 May 2025) OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
(12 May 2025) Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
(8 May 2025) Bring Reason to Vision: Understanding Perception and Reasoning through Model Merging
(08 May 2025) SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
(6 May 2025) X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains
(6 May 2025) Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
(6 May 2025) ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
(5 May 2025) R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
(28 Apr 2025) SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
(25 Apr 2025) Fast-Slow Thinking for Large Vision-Language Model Reasoning
(25 Apr 2025) Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
(25 Apr 2025) Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
(21 Apr 2025) A Call for New Recipes to Enhance Spatial Reasoning in MLLMs
(20 Apr 2025) Relation-R1: Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relational Comprehension
(12 Apr 2025) VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
(10 Apr 2025) VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
(10 Apr 2025) SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
(10 Apr 2025) Perception-R1: Pioneering Perception Policy with Reinforcement Learning
(10 Apr 2025) Kimi-VL Technical Report
(8 Apr 2025) On the Suitability of Reinforcement Fine-Tuning to Visual Tasks
(8 Apr 2025) Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
(1 Apr 2025) Improved Visual-Spatial Reasoning via R1-Zero-Like Training
(17 Mar 2025) R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
(13 Mar 2025) VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
(9 Mar 2025) Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
(7 Mar 2025) R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning
(7 Mar 2025) Unified Reward Model for Multimodal Understanding and Generation
(7 Mar 2025) R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model
(3 Mar 2025) Visual-RFT: Visual Reinforcement Fine-Tuning
(4 Feb 2025) Boosting Multimodal Reasoning with MCTS-Automated Structured Thinking
(13 Jan 2025) Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
(10 Jan 2025) LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs
(9 Jan 2025) Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
(3 Jan 2025) Virgo: A Preliminary Exploration on Reproducing o1-like MLLM
(30 Dec 2024) Slow Perception: Let's Perceive Geometric Figures Step-by-step
(19 Dec 2024) Progressive Multimodal Reasoning via Active Retrieval
(29 Nov 2024) Interleaved-Modal Chain-of-Thought
(15 Nov 2024) Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination
(15 Nov 2024) LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
(30 Oct 2024) Vision-Language Models Can Self-Improve Reasoning via Reflection
(23 Oct 2024) R-CoT: Reverse Chain-of-Thought Problem Generation for Geometric Reasoning in Large Multimodal Models
(21 Oct 2024) Improve Vision Language Model Chain-of-thought Reasoning
(11 Oct 2024) M3Hop-CoT: Misogynous Meme Identification with Multimodal Multi-hop Chain-of-Thought
(6 Oct 2024) MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration
(4 Oct 2024) Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning
(13 Jun 2024) Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
(28 Dec 2023) Grounding-Prompter: Prompting LLM with Multimodal Information for Temporal Sentence Grounding in Long Videos
(14 Dec 2023) Multi-modal Latent Space Learning for Chain-of-Thought Reasoning in Language Models
(27 Nov 2023) Compositional Chain-of-Thought Prompting for Large Multimodal Models
(15 Nov 2023) The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task
(3 May 2023) Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings
(16 Apr 2023) Chain of Thought Prompt Tuning in Vision Language Models
(2 Feb 2023) Multimodal Chain-of-Thought Reasoning in Language Models
(09 Sep 2026) Cost-Aware Vision--Language Model Arbitration for Fabric Structure Recognition A Deployable Multi-Agent System
(09 Sep 2026) VLX-VR: An Agentic-Aware Video Reasoning Model
(09 Sep 2026) Who Are They to Each Other? Multi-Agent Reasoning for Speaker Relationship Inference
(09 Sep 2026) SpeechAnnotator: A Context-Aware Multi-Agent Framework and Benchmark for Multidimensional Speech Annotation
(08 Sep 2026) An Experimental Evaluation of Multimodal Prompt Injection Attacks on Agentic AI Frameworks
(07 Sep 2026) Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning
(07 Sep 2026) PhysMAS: Physics-Grounded Multi-Agent Synthesis of Compositional 4D Gaussians
(06 Sep 2026) 3DHarnessBench: Probing Agentic 3D-to-Code Capabilities of Frontier Vision-Language Models
(04 Sep 2026) CUSP: Decomposable Collective Uncertainty for Multi-Agent Multimodal Reasoning
(03 Sep 2026) WorldReward: Reward Modeling for Camera-Conditioned World Models
(03 Sep 2026) StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios
(03 Sep 2026) LLM-Aided Design for Manufacturing: A Multi-Agent System for Intent-Preserving Redesign of CAD for Improved Manufacturability
(03 Sep 2026) Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models
(03 Sep 2026) ICM-Bench: Person-Level Identity Reasoning in Multimodal Agents with Long-Term Memory
(02 Sep 2026) SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
(02 Sep 2026) PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment
(01 Sep 2026) Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers
(01 Sep 2026) Agentic Multimodal Models for Environmental Hyperspectral Unmixing
(01 Sep 2026) InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations
(31 Aug 2026) CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework
(30 Aug 2026) FRAMEWORKERS: A Dynamic Multi-Agent Framework for AI-Generated Video Production
(30 Aug 2026) Off-Manifold Refinement: Guiding Video Generators with a Frozen World Model
(30 Aug 2026) When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents
(29 Aug 2026) LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO
(28 Aug 2026) See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs
(27 Aug 2026) WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning
(26 Aug 2026) VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following
(26 Aug 2026) SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning
(25 Aug 2026) Task-Adaptive Rubrics for GUI Reward Modeling
(25 Aug 2026) DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton
(25 Aug 2026) Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs
(25 Aug 2026) Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning
(25 Aug 2026) Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments
(24 Aug 2026) GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis
(24 Aug 2026) Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner
(24 Aug 2026) Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents
(22 Aug 2026) BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications
(22 Aug 2026) MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning
(22 Aug 2026) Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents
(19 Aug 2026) EVADE: Evidence-Verified Agentic Diagnosis with Escape
(19 Aug 2026) DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning
(18 Aug 2026) Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
(18 Aug 2026) Structural Plan-to-Model Conversion with Deterministic Geometry and Guarded Agentic Vision-Language Refinement
(18 Aug 2026) DeAR: Decentralized Agentic Reasoning via Capability Grounding and Collaborative Thought Navigation
(17 Aug 2026) ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning
(15 Aug 2026) VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
(15 Aug 2026) SCOPE: Score-Isolated Agentic Optimization for Video World Models
(14 Aug 2026) MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning
(14 Aug 2026) Wyvern: An Agentic Framework for Generating Grounded Multimodal Reports
(14 Aug 2026) MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning
(13 Aug 2026) Intern-S2-Preview: Scientific Agentic Foundation Model
(11 Aug 2026) MIRA: Medical Image Reflection for Agentic Diagnosis
(11 Aug 2026) Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation
(08 Aug 2026) SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning
(07 Aug 2026) Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning
(06 Aug 2026) The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents
(06 Aug 2026) AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents
(04 Aug 2026) Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
(04 Aug 2026) AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding
(01 Aug 2026) DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning
(31 Jul 2026) Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning
(28 Jul 2026) ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning
(23 Jul 2026) EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization
(17 Jul 2026) Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA
(14 Jul 2026) A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism
(14 Jul 2026) ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning
(14 Jul 2026) EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval
(13 Jul 2026) The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy
(07 Jul 2026) EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents
(03 Jul 2026) VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning
(18 Jun 2026) MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization
(15 Jun 2026) Context-Aware RL for Agentic and Multimodal LLMs
(10 Jun 2026) IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents
(10 Jun 2026) MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning
(10 Jun 2026) Orchestra-o1: Omnimodal Agent Orchestration
(05 Jun 2026) StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents
(04 Jun 2026) AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents
(04 Jun 2026) TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents
(04 Jun 2026) Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators
(01 Jun 2026) OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
(19 May 2026) ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
(19 May 2026) ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning
(18 May 2026) AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents
(18 May 2026) GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents
(18 May 2026) An Efficient Streaming Video Understanding Framework with Agentic Control
(16 May 2026) OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics
(14 May 2026) ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
(13 May 2026) ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows
(10 May 2026) Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning
(08 May 2026) HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents
(08 May 2026) LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
(08 May 2026) Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning
(07 May 2026) A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency
(05 May 2026) What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity
(01 May 2026) Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
(30 Apr 2026) Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation
(30 Apr 2026) MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection
(30 Apr 2026) GUI Agents with Reinforcement Learning: Toward Digital Inhabitants
(29 Apr 2026) GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
(28 Apr 2026) Benchmarking and Improving GUI Agents in High-Dynamic Environments
(27 Apr 2026) Agentic AI for Remote Sensing: Technical Challenges and Research Directions
(25 Apr 2026) SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing
(13 Apr 2026) Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games
(13 Apr 2026) Dialectic-Med: Mitigating Diagnostic Hallucinations via Counterfactual Adversarial Multi-Agent Debate
(10 Apr 2026) Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents
(10 Apr 2026) ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
(09 Apr 2026) RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs
(09 Apr 2026) MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
(08 Apr 2026) Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
(07 Apr 2026) Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction
(29 Mar 2026) MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences
(27 Mar 2026) Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
(24 Mar 2026) EVA: Efficient Reinforcement Learning for End-to-End Video Agent
(17 Mar 2026) PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning
(17 Mar 2026) OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials
(16 Mar 2026) MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings
(03 Mar 2026) Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling
(26 Feb 2026) FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning
(26 Feb 2026) CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays
(19 Feb 2026) RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
(14 Feb 2026) Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
(05 Feb 2026) V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval
(26 Jan 2026) GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
(30 Dec 2025) SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
(23 Dec 2025) CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation
(21 Dec 2025) Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback
(09 Dec 2025) Thinking with Images via Self-Calling Agent
(06 Dec 2025) VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
(03 Dec 2025) Multimodal Reinforcement Learning with Agentic Verifier for AI Agents
(26 Nov 2025) OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection
(25 Nov 2025) VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis
(24 Nov 2025) VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
(17 Nov 2025) DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
(12 Nov 2025) History-Aware Reasoning for GUI Agents
(31 Oct 2025) GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
(2 Dec 2024) Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
(09 Sep 2026) HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy
(08 Sep 2026) CLAMP: Constrained Decoding for Vision-Language Embodied Planning
(08 Sep 2026) WorldAgen: Unified State-Action Prediction with Test-Time World Model Training
(08 Sep 2026) CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot Manipulation
(08 Sep 2026) Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic Method
(07 Sep 2026) Phase-and-First-Arrival VLM Feedback for Sparse-Reward Reinforcement Learning in Surgical Manipulation
(07 Sep 2026) Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models
(07 Sep 2026) Dex-X: Learning Visual-Tactile Dexterous Manipulation From Human Videos with Simulated Interaction
(05 Sep 2026) FACT: A Forensic Agent with Compiled Tool-Use Trajectories for AI-Generated Image Detection
(05 Sep 2026) MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control
(05 Sep 2026) CST-WM: A Causally Structured World Model for Embodied Visual Tracking
(05 Sep 2026) Learning Counterfactual World Models for Embodied Reasoning under Partial Observability
(04 Sep 2026) Reasoning Without Inference Cost: Latent Semantic Scaffolding for Robot VLA Policies
(04 Sep 2026) Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models
(04 Sep 2026) Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation
(03 Sep 2026) VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models
(03 Sep 2026) ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection
(03 Sep 2026) Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models
(03 Sep 2026) WISE: World-model-guided Imagination Scheduling for Efficient Post-training of Vision-Language-Action Models
(03 Sep 2026) Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving
(30 Aug 2026) SymVD: Symmetric Vision Language Action Distillation for Robot Manipulation
(27 Aug 2026) Diffusion Policies for Short-Horizon Planning in Robot Crowd Navigation
(27 Aug 2026) Decoupling Planning and Control for Instructable Agents
(27 Aug 2026) Embodied Scene Rearrangement Planning
(26 Aug 2026) Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning
(26 Aug 2026) $R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning
(25 Aug 2026) GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model
(25 Aug 2026) TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks
(24 Aug 2026) OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation
(24 Aug 2026) Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
(22 Aug 2026) Decoupled Physical Modeling and Execution for Physics Reasoning
(22 Aug 2026) CounterAlign: Counterfactual Supervision for Vision-Language-Action Models
(18 Aug 2026) Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups
(18 Aug 2026) Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
(17 Aug 2026) FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences
(17 Aug 2026) PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents
(17 Aug 2026) Inference-Time Attention Steering for Vision-Language-Action Driving Models
(17 Aug 2026) Planner-Conditioned Diffusion for Coordinated Multi-Agent Exploration
(17 Aug 2026) HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL
(17 Aug 2026) $τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
(16 Aug 2026) Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation
(14 Aug 2026) Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models
(21 Jul 2026) No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation
(24 Jun 2026) RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards
(12 Apr 2026) A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning
(30 Mar 2026) SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning
(22 Mar 2026) RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models
(16 Mar 2026) From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation
(24 Feb 2026) HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning
(18 Feb 2026) Peeking Ahead of the Field Study: Exploring VLM Personas as Support Tools for Embodied Studies in HCI
(16 Feb 2026) Ground-Truth Depth in Vision Language Models: Spatial Context Understanding in Conversational AI for XR-Robotic Support in Emergency First Response
(07 Feb 2026) VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation
(16 Jan 2026) ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
(02 Jan 2026) RoboReward: General-Purpose Vision-Language Reward Models for Robotics
(21 Dec 2025) ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning
(28 Nov 2025) Video-CoM: Interactive Video Reasoning via Chain of Manipulations
(13 Nov 2025) AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models
(08 Sep 2026) Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding
(08 Sep 2026) Human-Centric Image Captioning with Subject-Centered Spatial Understanding
(07 Sep 2026) CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation
(07 Sep 2026) Ambient @ EgoLongQA 2026: Distilling Long-Video perception into a Sub-2B Model
(07 Sep 2026) Beyond Sparse Rewards: A New Benchmark and Structure-Aware Graph Alignment for Micro-Drama Understanding
(06 Sep 2026) Thinking with Cameras: Active Visual Reasoning via Dynamic Viewpoint Control for Surveillance Video Understanding
(06 Sep 2026) Visual Search Augmented Chain-of-Thought Reasoning for Attribute Value Extraction from Product Videos
(03 Sep 2026) Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision
(03 Sep 2026) LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL
(03 Sep 2026) Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning
(01 Sep 2026) Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models
(01 Sep 2026) TempCloze: Can Video-LLMs Identify the Missing Middle?
(29 Aug 2026) Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling
(28 Aug 2026) StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models
(28 Aug 2026) Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models
(27 Aug 2026) Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models
(27 Aug 2026) Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs
(27 Aug 2026) Video-FLAIR: Not Whether to Reason, But How
(27 Aug 2026) Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection
(26 Aug 2026) Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding
(26 Aug 2026) VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
(26 Aug 2026) AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research
(26 Aug 2026) LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding
(25 Aug 2026) PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos
(24 Aug 2026) Scaling Reinforcement Learning for Diffusion Models via Velocity Matching
(23 Aug 2026) Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting
(21 Aug 2026) COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models
(21 Aug 2026) Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision
(21 Aug 2026) TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming
(20 Aug 2026) Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
(19 Aug 2026) StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos
(19 Aug 2026) CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes
(19 Aug 2026) CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios
(18 Aug 2026) TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs
(17 Aug 2026) Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning
(17 Aug 2026) Contrastive Energy Fields for Inference-Time Procedure Planning in Instructional Videos
(17 Aug 2026) StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding
(17 Aug 2026) RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning
(17 Aug 2026) CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated?
(16 Aug 2026) Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
(16 Aug 2026) CrossView: Can Vision-Language Models Reason Across Cameras?
(16 Aug 2026) Sequential Multimodal Evidence Optimization for Product Media Ranking in E-Commerce
(14 Aug 2026) Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition
(14 Aug 2026) OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation
(14 Aug 2026) InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors
(14 Aug 2026) Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training
(12 Aug 2026) SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward
(10 Aug 2026) CodecArena: Codec Quality Assessment via Visual Reinforcement Learning
(10 Aug 2026) Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models
(05 Aug 2026) PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning
(05 Aug 2026) WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models
(05 Aug 2026) HelloWorld: Enabling Socially Interactive Characters in Video World Models
(04 Aug 2026) Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering
(03 Aug 2026) AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning
(02 Aug 2026) MiniWorld: Democratizing the Training of Video World Models from Scratch
(28 Jul 2026) Wonder: Video World Model Done Better
(27 Jul 2026) CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding
(27 Jul 2026) Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts
(11 Jul 2026) Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset
(06 Jul 2026) TimeThink: Reasoning with Time for Video LLMs
(06 Jul 2026) Claim-Level Rubric Rewards for Video Caption Reinforcement Learning
(02 Jul 2026) Rank-Then-Act: Reward-Free Control from Frame-Order Progress
(01 Jul 2026) VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
(01 Jul 2026) Linguistic Relative Policy Optimization for Video Anomaly Reasoning
(01 Jul 2026) EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection
(01 Jul 2026) Latent Visual Cache for Video Reasoning
(23 Jun 2026) SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards
(20 Jun 2026) When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR
(18 Jun 2026) CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs
(17 Jun 2026) Native Active Perception as Reasoning for Omni-Modal Understanding
(16 Jun 2026) Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs
(10 Jun 2026) AVIS: Adaptive Test-Time Scaling for Vision-Language Models
(10 Jun 2026) Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding
(10 Jun 2026) InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning
(08 Jun 2026) Temporal-Aware Reasoning Optimization for Video Temporal Grounding
(08 Jun 2026) CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning
(07 Jun 2026) CACR:Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning
(05 Jun 2026) VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation
(04 Jun 2026) Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction
(04 Jun 2026) ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE
(03 Jun 2026) VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding
(02 Jun 2026) Reinforcement Learning from Cross-domain Videos with Video Prediction Model
(02 Jun 2026) Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching
(19 May 2026) RECIPE: Procedural Planning via Grounding in Instructional Video
(18 May 2026) Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
(15 May 2026) Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization
(14 May 2026) KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration
(14 May 2026) RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO
(14 May 2026) Video Models Can Reason with Verifiable Rewards
(13 May 2026) AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
(12 May 2026) CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
(11 May 2026) GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs
(08 May 2026) RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
(08 May 2026) Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
(07 May 2026) Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
(07 May 2026) VISD: Enhancing Video Reasoning via Structured Self-Distillation
(06 May 2026) Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing
(03 May 2026) Act2See: Emergent Active Visual Perception for Video Reasoning
(02 May 2026) Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs
(01 May 2026) AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in Unified Multimodal Models via Decompositional Verifiable Reward
(01 May 2026) Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning
(30 Apr 2026) Generate Your Talking Avatar from Video Reference
(30 Apr 2026) AesRM: Improving Video Aesthetics with Expert-Level Feedback
(29 Apr 2026) DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
(28 Apr 2026) OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
(28 Apr 2026) MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
(26 Apr 2026) Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference
(25 Apr 2026) UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks
(25 Apr 2026) StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning
(25 Apr 2026) EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs
(13 Apr 2026) Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding
(01 Apr 2026) Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs
(28 Mar 2026) Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
(27 Mar 2026) Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning
(26 Mar 2026) VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
(26 Mar 2026) Reinforcing Structured Chain-of-Thought for Video Understanding
(17 Mar 2026) When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
(12 Mar 2026) Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
(19 Feb 2026) GraphThinker: Reinforcing Video Reasoning with Event Graph Thinking
(12 Feb 2026) STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
(30 Jan 2026) Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
(28 Jan 2026) Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
(27 Jan 2026) Video-KTR: Reinforcing Video Reasoning via Key Token Attribution
(08 Jan 2026) VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice
(07 Dec 2025) MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
(02 Dec 2025) OneThinker: All-in-one Reasoning Model for Image and Video
(17 Nov 2025) ViSS-R1: Self-Supervised Reinforcement Video Reasoning
(23 Oct 2025) Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
(9 Oct 2025) SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
(06 Oct 2025) Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
(5 Oct 2025) Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
(29 Sep 2025) FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
(29 Sep 2025) LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
(28 Sep 2025) FrameMind: Frame-Interleaved Chain-of-Thought for Video Reasoning via Reinforcement Learning
(12 Jun 2025) CogStream: Context-guided Streaming Video Question Answering
(6 Jun 2025) VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
(27 Mar 2025) Video-R1: Reinforcing Video Reasoning in MLLMs
(17 Feb 2025) video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
(10 Feb 2025) CoS: Chain-of-Shot Prompting for Long Video Understanding
(8 Jan 2025) Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs
(3 Dec 2024) VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation
(29 Nov 2024) STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training
(12 Oct 2024) Interpretable Video based Stress Detection with Self-Refine Chain-of-thought Reasoning
(8 Oct 2024) Temporal Reasoning Transfer from Text to Video.
(27 Sep 2024) Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks
(28 Aug 2024) Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation
(24 May 2024) Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
(7 May 2024) Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. code
(06 Sep 2026) A Ticket from Marginals to Joints: Coupled-Noise Distillation for One-Step Block Generation in Diffusion Language Models
(03 Sep 2026) Unlocking Lossless Speedups in LLMs via Discrete Diffusion
(03 Sep 2026) Distilled Continuous Diffusion Language Models Can Write Code in Few Steps---or One
(26 Aug 2026) Prefix-Denoising Consistency: Test-Time Verification for Diffusion Language Models
(24 Aug 2026) SelFusion: Self-distillation for Diffusion Language Models
(20 Aug 2026) Discrete Diffusion Inference-Time Control with Nested Sequential Monte Carlo
(06 Aug 2026) Answer First, Reason Later: Commitment Order in Diffusion LLMs
(03 Aug 2026) Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models
(03 Aug 2026) OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models
(01 Aug 2026) Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs
(18 Jul 2026) Trace-Based On-Policy Distillation for Masked Diffusion Language Models
(16 Jul 2026) A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models
(16 Jul 2026) Mask-Aware Policy Gradients for Diffusion Language Models
(05 Jul 2026) dOPSD: On-Policy Self-Distillation for Diffusion Language Models
(01 Jul 2026) Diffusion-GR2: Diffusion Generative Reasoning Re-ranker
(16 Jun 2026) Learning from the Self-future: On-policy Self-distillation for dLLMs code
(11 Jun 2026) DiPOD: Diffusion Policy Optimization without Drifting Apart
(07 Jun 2026) Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models
(03 Jun 2026) Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models
(12 May 2026) Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models
(11 May 2026) Relative Score Policy Optimization for Diffusion Language Models
(08 May 2026) DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
(04 May 2026) Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning
(29 Apr 2026) Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
(27 Apr 2026) DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models
(07 Apr 2026) Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
(23 Mar 2026) Tiny Inference-Time Scaling with Latent Verifiers
(12 Mar 2026) EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
(06 Mar 2026) Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion
(12 Feb 2026) Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
(31 Jan 2026) Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings
(29 Dec 2025) ThinkGen: Generalized Thinking for Visual Generation
(25 Dec 2025) Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration
(03 Dec 2025) ReasonX: MLLM-Guided Intrinsic Image Decomposition
(27 Nov 2025) ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
(9 Oct 2025) Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
(9 Oct 2025) Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
(09 Sep 2026) Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models
(07 Sep 2026) Reasoning Beyond Transcription: Audio Language Models on Child Stuttering Speech
(03 Sep 2026) Test-time adaptation for speech enhancement with an autoregressive speech prior
(01 Sep 2026) TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models
(31 Aug 2026) SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards
(31 Aug 2026) When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models
(31 Aug 2026) Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols
(30 Aug 2026) TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models
(25 Aug 2026) AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models
(24 Aug 2026) Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering
(17 Aug 2026) Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization
(16 Aug 2026) VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation
(04 Aug 2026) Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization
(03 Aug 2026) Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning
(23 Jul 2026) X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment
(23 Jul 2026) OPOD: On-Policy Omni Distillation
(09 Jul 2026) When Synthetic Speech Is All You Have: Better Call GRPO
(08 Jul 2026) Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning
(02 Jul 2026) DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning
(02 Jul 2026) Reinforcement Learning for Data-Efficient Code-Switched ASR
(24 Jun 2026) Omni-Perception Policy Optimization for Multimodal Emotion Reasoning
(19 Jun 2026) Post-Training Speech Enhancement Language Models with Perceptual Rewards
(17 Jun 2026) ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection
(14 Jun 2026) AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction
(05 Jun 2026) Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models
(03 Jun 2026) Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention
(11 May 2026) Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought
(11 May 2026) EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs
(28 Apr 2026) Step-Audio-R1.5 Technical Report
(27 Apr 2026) Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
(27 Apr 2026) Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs
(13 Apr 2026) Empowering Video Translation using Multimodal Large Language Models
(05 Mar 2026) SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning
(25 Jan 2026) AR-Omni: A Unified Autoregressive Model for Any-to-Any Generation
(23 Oct 2025) Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards
(10 Oct 2025) Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models
(8 Oct 2025) Can Speech LLMs Think while Listening?
(5 Oct 2025) Principled and Tractable RL for Reasoning with Diffusion Language Models
(22 Jul 2025) Step-Audio 2 Technical Report
(14 Mar 2025) Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
(08 Sep 2026) Let It Go or Learn to Self-Correct: Continuous Diffusion for Constrained Discrete Tasks
(07 Sep 2026) VoT: Vision-of-Thought for Unified Multimodal Representation Alignment
(04 Sep 2026) Importance-Aware Low-Rank Distillation of Diffusion Transformers
(02 Sep 2026) CrashDiffuser: VLM-Guided Collision Intent Reasoning for Fine-Grained Safety-Critical Traffic Scenario Generation
(01 Sep 2026) Diffusion as a Training Curriculum for Timestep-Free Iterative Reasoning
(28 Aug 2026) CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning
(26 Aug 2026) DCGC: Draft-Conditioned Global Correction for Complex Reasoning with Masked Diffusion Models
(21 Aug 2026) EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking
(17 Aug 2026) Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection
(05 Aug 2026) GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction
(29 Jul 2026) Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection
(20 Jul 2026) JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models
(05 Jul 2026) Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
(04 Jul 2026) Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
(03 Jul 2026) ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space
(15 Jun 2026) Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models
(12 Jun 2026) HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities
(11 Jun 2026) Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model
(01 Jun 2026) Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization
(19 May 2026) Inference-Time Scaling in Diffusion Models through Iterative Partial Refinement
(16 May 2026) Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models
(16 May 2026) TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward
(14 May 2026) DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
(11 May 2026) Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models
(10 May 2026) SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning
(08 May 2026) Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria
(07 May 2026) Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models
(07 May 2026) Continuous-Time Distribution Matching for Few-Step Diffusion Distillation
(28 Apr 2026) The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
(26 Apr 2026) ZID-Net: Zero-Inference Diffusion Prior Decoupling Network for Single Image Dehazing
(15 Apr 2026) Enhanced Text-to-Image Generation by Fine-grained Multimodal Reasoning
(14 Apr 2026) Representation geometry shapes task performance in vision-language modeling for CT enterography
(14 Apr 2026) PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
(10 Mar 2026) Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
(04 Mar 2026) Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks
(28 Jan 2026) Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
(29 Dec 2025) REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
(14 Dec 2025) Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
(04 Dec 2025) DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
(18 Nov 2025) UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
(13 Nov 2025) Image Aesthetic Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance
(24 Oct 2025) Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation
(15 Oct 2025) Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
(9 Oct 2025) Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing
(9 Oct 2025) Reinforcing Diffusion Models by Direct Group Preference Optimization
(9 Oct 2025) Real-Time Motion-Controllable Autoregressive Video Diffusion
(29 Sep 2025) STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation
(28 Aug 2025) Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
(28 Aug 2025) OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
(28 Aug 2025) Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
(27 Aug 2025) CVBench: Evaluating Cross-Video Synergies for Complex Multimodal Understanding and Reasoning
(9 Aug 2025) AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
(28 Jul 2025) Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
(20 Jun 2025) RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought
(17 Jun 2025) SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks
(16 May 2025) Towards Self-Improvement of Diffusion Models via Group Preference Optimization
(16 May 2025) Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models
(15 May 2025) Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models
(12 May 2025) DanceGRPO: Unleashing GRPO on Visual Generation
(8 May 2025) Flow-GRPO: Training Flow Matching Models via Online RL
(1 May 2025) T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
(22 Apr 2025) From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning
(22 Apr 2025) Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
(26 Mar 2025) MMGen: Unified Multi-modal Image Generation and Understanding in One Go
(13 Mar 2025) GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
(3 Mar 2025) MINT: Multi-modal Chain of Thought in Unified Generative Models for Enhanced Image Generation
(23 Jan 2025) Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
(06 Sep 2026) NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures
(04 Sep 2026) MMTClinic: Multimodal, Multilingual Time Series Question Answering and Reasoning Benchmark for Clinical Domain
(03 Sep 2026) MetaStructAtlas: A Grounded 3D Vision-Language Dataset and Benchmark for Functional and Structural Reasoning in Whole-Body PET/CT
(29 Aug 2026) CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions
(26 Aug 2026) Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs
(20 Aug 2026) Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms
(20 Aug 2026) SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces
(18 Aug 2026) BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models
(11 Aug 2026) Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes
(05 Aug 2026) OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing
(02 Aug 2026) LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning
(30 Jul 2026) OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
(28 Jul 2026) Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification
(23 Jul 2026) Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
(07 Jun 2026) Driv
Truncated — view the full README on GitHub.
Latest Advances on (RL based) Multimodal Reasoning and Generation in Multimodal LLMs
102
127 commits
updated Sep 10, 2026
This is a repository for organizing papers related to Multimodal Reasoning in Multimodal Large Language Models (Image, Video).
With the development of the visual (audio) capabilities and reasoning capabilities (RL powered) of multimodal large language models(MLLMs/LVLMs/LSLMs), researchers have high hopes for the multimodal reasoning capabilities of MLLM/LVLM/LSLM.
This repo also select paper about visual generation (image generation/video generation) with RL/CoT.
This repository aims to cover ALL possibly relevant papers to support research surveys, not just selected best papers. We believe comprehensive coverage is more valuable for researchers than a curated list.
(06 Jun 2026) Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning
(01 Jun 2026) TechRAG: Evidence-Gated Multimodal Agentic RAG for Technical Literature Reasoning
(20 May 2026) A Survey of Audio Reasoning in Multimodal Foundation Models
(05 May 2026) Material Database Agent: A Multimodal Agentic Framework for Scientific Literature Mining
(25 Apr 2026) GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI
(8 May 2025) Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
(30 Apr 2025) Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
(4 Apr 2025) Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning
(18 Mar 2025) Aligning Multimodal LLM with Human Preference: A Survey
(16 Mar 2025) Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
(09 Sep 2026) On-Policy Distillation for Vision-Language Model Adaptation, an Effective Paradigm on Low-Quality Multimodal Data
(09 Sep 2026) Beyond Surface Imitation: Contrastive Modeling for Reasoning Path Alignment in Multimodal In-Context Learning
(09 Sep 2026) From Pixels to Hierarchical Sequences: Quadtree Mask Encoding for Vision-Language Binary Change Detection
(08 Sep 2026) Drive by Hindsight and Foresight: Tool-Grounded Synergistic Reasoning over Hierarchical Memory for Autonomous Driving
(08 Sep 2026) From Glance to Scrutiny: Progressive Distortion Reasoning for Fine-Grained Image Quality Assessment
(08 Sep 2026) SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning Segmentation
(08 Sep 2026) CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs
(07 Sep 2026) Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification
(07 Sep 2026) SupGRPO: Enhancing GRPO with Matching-based Online SFT for Text Spotting
(07 Sep 2026) MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling
(06 Sep 2026) Counterfactual Tests for Measuring Chain-of-Thought Faithfulness in Visual Language Models
(06 Sep 2026) Separating Capability from Confidence: Grounded Dual-State Calibration for GRPO-Trained Medical Vision-Language Models
(05 Sep 2026) Distilling Vision-Language Models for On-Device Fire Understanding
(05 Sep 2026) Geometry-Aware Test-Time Learning for Quantitative Spatial Reasoning
(04 Sep 2026) MCPO: Modality-Contrastive Preference Optimization for Multimodal Chain-of-Thought Compression
(04 Sep 2026) Think-Verify-Revise: Neuro-Symbolic Visual Reasoning with Vision-Language Models and Dynamic Logic Tensor Networks
(03 Sep 2026) Revisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment
(03 Sep 2026) CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation
(03 Sep 2026) When Depth Hurts: Reliability-Aware Geometry Distillation for Depth-Free RGB-D Salient Object Detection
(03 Sep 2026) MedQA-MM: Shortcuts Behind Medical Visual Reasoning
(03 Sep 2026) GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs
(02 Sep 2026) CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction
(02 Sep 2026) Test-Time Logit Prompting for Source-Free Missing Modality Adaptation
(01 Sep 2026) Controllable Image Captioning with Prompt-Conditioned Scene Rewards
(01 Sep 2026) MERGED: Multimodal Entity Resolution via Generated Expert Reasoning Distillation
(01 Sep 2026) GazeRefine: Expert Gaze as a Test-Time Prompt for Training-Free Medical Image Segmentation
(01 Sep 2026) Towards reliable multimodal disaster severity assessment through preference optimization and explainable vision-language reasoning
(01 Sep 2026) A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss
(01 Sep 2026) Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures
(01 Sep 2026) Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis
(01 Sep 2026) Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation Methods
(31 Aug 2026) Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving
(31 Aug 2026) Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry
(31 Aug 2026) Reactivating Test-Time Scaling for Plane Geometry Problem Solving
(31 Aug 2026) SlideBank: A Persistent Hierarchical Evidence Bank for Consistent Whole-Slide Reasoning
(30 Aug 2026) InspectorGPT: A Comparative Reasoning Enhanced VLM for Comprehensive Industrial Anomaly Detection
(30 Aug 2026) Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency
(29 Aug 2026) Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs
(29 Aug 2026) GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models
(27 Aug 2026) Instruction Distillation: Text Instructions as Visual Examples
(27 Aug 2026) From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation
(27 Aug 2026) Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper
(26 Aug 2026) V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
(26 Aug 2026) GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models
(25 Aug 2026) EVEREST:Endogenous Vision-Language Reinforcement Reasoning Exploration for Urban Socio-Semantic Segmentation
(24 Aug 2026) AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes
(24 Aug 2026) CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension
(24 Aug 2026) LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation
(23 Aug 2026) Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding
(23 Aug 2026) UR$^{2}$-MLLM: Uncertainty-aware Revisit Reasoning in Multimodal Large Language Models for Radiology Report Generation
(23 Aug 2026) LiST: Local-Simplex Test-Time LoRA Fusion
(22 Aug 2026) Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning
(22 Aug 2026) VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression
(21 Aug 2026) Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning
(21 Aug 2026) ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models
(21 Aug 2026) Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds
(21 Aug 2026) Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs
(20 Aug 2026) ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation
(20 Aug 2026) Evidence-Gated Task and Motion Planning with Vision-Language Models
(20 Aug 2026) Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models
(20 Aug 2026) G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation
(20 Aug 2026) PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment
(20 Aug 2026) Question-Guided Evidence Acquisition for Multimodal Visual Question Answering
(20 Aug 2026) Answer-Level Trust Selection for Physical Vision-Language Reasoning
(20 Aug 2026) Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment
(19 Aug 2026) UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval
(19 Aug 2026) PCQA-R1: Advancing Generalized 3D Point Cloud Quality Assessment with Reinforcement Learning
(19 Aug 2026) Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference
(19 Aug 2026) Clinically Structured Surrogate Rewards for Post-SFT Medical Image Captioning
(19 Aug 2026) COSTA: A Cluster-Centric Paradigm for Annotation-Free Open-Set Semantic Segmentation of Aerial Point Clouds with Domain Shifts
(19 Aug 2026) DynCur-Geo: Dynamic Curiosity Reward Shaping for Multimodal Active Geo-Localization
(19 Aug 2026) GRACE: Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration for Educational Visual Question Answering
(18 Aug 2026) Integrating Novelty and Surprise for Experience Prioritization and Exploration in Image-Based Reinforcement Learning
(18 Aug 2026) PathoArgus: Advancing Evidence-Grounded Long-Context Visual Reasoning across Gigapixel Whole-Slide and Multi-Slide Case Contexts
(17 Aug 2026) Interactive Whole Slide Images for RL-based Tumour Segmentation
(17 Aug 2026) Q-Learning With World Models
(17 Aug 2026) Lymphocyte Mimicry Correction via Region-Level Tissue Reasoning and Unbalanced Optimal Transport
(17 Aug 2026) Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning
(16 Aug 2026) SEER: Long-Context Reasoning via Selective Visual-Text Compression
(15 Aug 2026) MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems
(15 Aug 2026) Risk-Adaptive Edge--Cloud Visual Reasoning for Communication-Efficient Autonomous Driving
(15 Aug 2026) Physiological World Models for Human State Transitions
(14 Aug 2026) Self-Supervised Visual On-Policy Distillation
(14 Aug 2026) Test-Time Instance Selection for Improved Whole Slide Image Analysis
(14 Aug 2026) SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation
(13 Aug 2026) Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs
(13 Aug 2026) LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning
(11 Aug 2026) ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes
(11 Aug 2026) CARE: Confidence-Aware Reasoning for Reliable Medical VQA
(10 Aug 2026) ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection
(10 Aug 2026) Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models
(10 Aug 2026) FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving
(09 Aug 2026) Improving Generalization Robustness of Multimodal RLVR
(08 Aug 2026) Evidence-RL: Towards Evidence-intensive Visual Reasoning
(08 Aug 2026) PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets
(08 Aug 2026) StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning
(06 Aug 2026) Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval
(06 Aug 2026) WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader
(05 Aug 2026) Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO
(05 Aug 2026) Multi-Branch Policy Optimization for Multimodal Large Language Models
(05 Aug 2026) ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination
(05 Aug 2026) Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs
(05 Aug 2026) OPD-V: Visual On-Policy Self-Distillation with Modality Balance
(04 Aug 2026) Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach
(04 Aug 2026) Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training
(04 Aug 2026) Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning
(04 Aug 2026) CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement
(04 Aug 2026) DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning
(04 Aug 2026) Monte Carlo Tree Search for Table-to-Multimodal Report Generation
(04 Aug 2026) TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering
(03 Aug 2026) Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
(03 Aug 2026) VC-Tooler: Learning Compositional and Adaptive Visual Tool Use
(03 Aug 2026) SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models
(03 Aug 2026) Local Margin Restoration for Test-Time Adaptation of Vision-Language Models
(03 Aug 2026) MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving
(03 Aug 2026) CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning
(02 Aug 2026) It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling
(02 Aug 2026) Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning
(02 Aug 2026) Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models
(31 Jul 2026) Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models
(30 Jul 2026) Can Vision-Language Models Reason about AI Edits in Images?
(29 Jul 2026) FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing
(27 Jul 2026) Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding
(26 Jul 2026) Offline-Online Curriculum RL for Multimodal Reasoning
(26 Jul 2026) PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis
(25 Jul 2026) Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation
(24 Jul 2026) Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning
(23 Jul 2026) Visual Contrastive Self-Distillation
(23 Jul 2026) Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints
(22 Jul 2026) Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
(21 Jul 2026) DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization
(21 Jul 2026) Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency
(19 Jul 2026) LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning
(18 Jul 2026) FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images
(17 Jul 2026) IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models
(17 Jul 2026) ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning
(17 Jul 2026) WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding
(16 Jul 2026) Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment
(15 Jul 2026) SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
(15 Jul 2026) SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning
(14 Jul 2026) UniVR: Thinking in Visual Space for Unified Visual Reasoning
(14 Jul 2026) Visual Access Boundaries in Vision-Language Model Reasoning
(13 Jul 2026) SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
(12 Jul 2026) Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs
(12 Jul 2026) When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion
(10 Jul 2026) Multimodal Reward Hacking in Reinforcement Learning
(08 Jul 2026) BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning
(07 Jul 2026) Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning
(05 Jul 2026) RL Forgets! Towards Continual Policy Optimization
(02 Jul 2026) Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning
(02 Jul 2026) DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation
(01 Jul 2026) VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning
(01 Jul 2026) GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision
(01 Jul 2026) Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
(01 Jul 2026) Selective Test-Time Debiasing for CLIP via Reward Gating
(01 Jul 2026) ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models
(01 Jul 2026) DART-VLN: Test-Time Memory Decay and Anti-Loop Regularization for Discrete Vision-Language Navigation
(01 Jul 2026) ESC: Emotional Self-Correction for Reliable Vision-Language Models
(01 Jul 2026) H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation
(24 Jun 2026) V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning
(23 Jun 2026) PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought
(22 Jun 2026) CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
(22 Jun 2026) VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct
(22 Jun 2026) Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
(22 Jun 2026) AIR: Adaptive Interleaved Reasoning with Code in MLLMs
(18 Jun 2026) SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs
(16 Jun 2026) Enhancing Pathological VLMs with Cross-scale Reasoning
(16 Jun 2026) Reinforcing Dual-Path Reasoning in Spatial Vision Language Models
(16 Jun 2026) See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL
(15 Jun 2026) Thinking with Visual Grounding
(15 Jun 2026) DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models
(14 Jun 2026) NeRD: Neuro-Symbolic Rule Distillation for Efficient Ontology-Grounded Chain-of-Thought in Medical Image Diagnosis
(14 Jun 2026) Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning
(14 Jun 2026) SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks
(13 Jun 2026) Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities
(12 Jun 2026) CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment
(11 Jun 2026) Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding
(09 Jun 2026) Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts
(08 Jun 2026) CRANE: Knowledge Editing for Reasoning MLLMs
(08 Jun 2026) Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization
(06 Jun 2026) DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning
(05 Jun 2026) Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization
(03 Jun 2026) Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning
(03 Jun 2026) Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning
(02 Jun 2026) Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection
(02 Jun 2026) Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
(02 Jun 2026) SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation
(19 May 2026) From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
(19 May 2026) JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA
(18 May 2026) Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
(18 May 2026) IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning
(17 May 2026) Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era
(16 May 2026) HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation
(14 May 2026) Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture
(13 May 2026) PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
(13 May 2026) Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning
(13 May 2026) Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
(12 May 2026) OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models
(12 May 2026) Composition of Memory Experts for Diffusion World Models
(10 May 2026) Reinforcing Multimodal Reasoning Against Visual Degradation
(10 May 2026) DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
(10 May 2026) Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning
(10 May 2026) Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning
(10 May 2026) Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT
(08 May 2026) BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning
(08 May 2026) GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning
(04 May 2026) Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning
(03 May 2026) Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
(02 May 2026) Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression
(01 May 2026) Structured Role-Aware Policy Optimization for Multimodal Reasoning
(01 May 2026) MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
(30 Apr 2026) VeraRetouch: A Lightweight Fully Differentiable Framework for Multi-Task Reasoning Photo Retouching
(30 Apr 2026) Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
(30 Apr 2026) WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning
(30 Apr 2026) Detecting is Easy, Adapting is Hard: Local Expert Growth for Visual Model-Based Reinforcement Learning under Distribution Shift
(30 Apr 2026) PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations
(30 Apr 2026) The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models
(29 Apr 2026) World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning
(29 Apr 2026) Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
(29 Apr 2026) Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding
(28 Apr 2026) Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning
(28 Apr 2026) SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring
(27 Apr 2026) Improving Vision-language Models with Perception-centric Process Reward Models
(27 Apr 2026) See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
(27 Apr 2026) PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model
(27 Apr 2026) VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions
(13 Apr 2026) POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
(13 Apr 2026) CFMS: A Coarse-to-Fine Multimodal Synthesis Framework for Enhanced Tabular Reasoning
(13 Apr 2026) Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images
(10 Apr 2026) VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
(10 Apr 2026) Visually-Guided Policy Optimization for Multimodal Reasoning
(09 Apr 2026) Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models
(09 Apr 2026) TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction
(09 Apr 2026) OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
(09 Apr 2026) Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data
(09 Apr 2026) WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models
(09 Apr 2026) AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
(08 Apr 2026) Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
(07 Apr 2026) MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control
(07 Apr 2026) WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
(07 Apr 2026) Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
(06 Apr 2026) Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward
(05 Apr 2026) Belief-Aware VLM Model for Human-like Reasoning
(03 Apr 2026) Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models
(03 Apr 2026) Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models
(03 Apr 2026) CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
(03 Apr 2026) FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation
(02 Apr 2026) Guideline2Graph: Profile-Aware Multimodal Parsing for Executable Clinical Decision Graphs
(02 Apr 2026) Impact of Multimodal and Conversational AI on Learning Outcomes and Experience
(02 Apr 2026) Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
(02 Apr 2026) MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction
(01 Apr 2026) Vero: An Open RL Recipe for General Visual Reasoning
(01 Apr 2026) Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization
(01 Apr 2026) EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs
(01 Apr 2026) All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models
(30 Mar 2026) Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning
(30 Mar 2026) MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding
(30 Mar 2026) $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning
(29 Mar 2026) LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
(29 Mar 2026) Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs
(28 Mar 2026) Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
(28 Mar 2026) Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
(27 Mar 2026) Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR
(26 Mar 2026) R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning
(26 Mar 2026) Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs
(24 Mar 2026) MedCausalX: Adaptive Causal Reasoning with Self-Reflection for Trustworthy Medical Vision-Language Models
(24 Mar 2026) Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
(24 Mar 2026) GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning
(23 Mar 2026) Getting to the Point: Why Pointing Improves LVLMs
(23 Mar 2026) Rethinking Token Reduction for Large Vision-Language Models
(21 Mar 2026) Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning
(20 Mar 2026) One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment
(19 Mar 2026) Balanced Thinking: Improving Chain of Thought Training in Vision Language Models
(19 Mar 2026) TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
(17 Mar 2026) HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
(17 Mar 2026) DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models
(17 Mar 2026) The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models
(17 Mar 2026) Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning
(16 Mar 2026) Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing
(15 Mar 2026) On the Nature of Attention Sink that Shapes Decoding Strategy in MLLMs
(14 Mar 2026) Improving Visual Reasoning with Iterative Evidence Refinement
(12 Mar 2026) Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation
(10 Mar 2026) C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis
(10 Mar 2026) MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning
(10 Mar 2026) GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
(09 Mar 2026) MJ1: Multimodal Judgment via Grounded Verification
(08 Mar 2026) Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models
(08 Mar 2026) Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models
(07 Mar 2026) Perception-Aware Multimodal Spatial Reasoning from Monocular Images
(06 Mar 2026) MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation
(06 Mar 2026) PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
(06 Mar 2026) ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
(05 Mar 2026) Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
(04 Mar 2026) Phi-4-reasoning-vision-15B Technical Report
(04 Mar 2026) Discriminative Perception via Anchored Description for Reasoning Segmentation
(03 Mar 2026) TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
(03 Mar 2026) SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety
(02 Mar 2026) Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine
(01 Mar 2026) Can Thinking Models Think to Detect Hateful Memes?
(01 Mar 2026) ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
(01 Mar 2026) DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage
(01 Mar 2026) ICPRL: Acquiring Physical Intuition from Interactive Control
(28 Feb 2026) PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment
(27 Feb 2026) Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
(27 Feb 2026) EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
(27 Feb 2026) Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning
(27 Feb 2026) Toward Guarantees for Clinical Reasoning in Vision Language Models via Formal Verification
(27 Feb 2026) Reasoning-Driven Multimodal LLM for Domain Generalization
(26 Feb 2026) MediX-R1: Open Ended Medical Reinforcement Learning
(25 Feb 2026) MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving
(25 Feb 2026) See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
(25 Feb 2026) RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
(24 Feb 2026) Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
(23 Feb 2026) TextShield-R1: Reinforced Reasoning for Tampered Text Detection
(23 Feb 2026) Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking
(19 Feb 2026) Enabling Training-Free Text-Based Remote Sensing Segmentation
(18 Feb 2026) Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning
(17 Feb 2026) Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families
(17 Feb 2026) On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
(16 Feb 2026) Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning
(16 Feb 2026) TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning
(15 Feb 2026) ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization
(15 Feb 2026) GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
(14 Feb 2026) Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
(13 Feb 2026) Reliable Thinking with Images
(13 Feb 2026) Thinking Like a Radiologist: A Dataset for Anatomy-Guided Interleaved Vision Language Reasoning in Chest X-ray Interpretation
(12 Feb 2026) Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning
(11 Feb 2026) Canvas-of-Thought: Grounding Reasoning via Mutable Structured States
(10 Feb 2026) Bridging Efficiency and Transparency: Explainable CoT Compression in Multimodal Large Reasoning Models
(10 Feb 2026) Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
(10 Feb 2026) GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation
(09 Feb 2026) AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection
(09 Feb 2026) Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
(09 Feb 2026) When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
(07 Feb 2026) Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
(06 Feb 2026) MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images
(06 Feb 2026) SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs
(05 Feb 2026) Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR
(05 Feb 2026) Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning
(04 Feb 2026) Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision
(04 Feb 2026) Training Data Efficiency in Multimodal Process Reward Models
(03 Feb 2026) Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance
(02 Feb 2026) Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling
(02 Feb 2026) VLM-Guided Experience Replay
(02 Feb 2026) ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
(02 Feb 2026) Multimodal Large Language Models for Real-Time Situated Reasoning
(01 Feb 2026) StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating
(01 Feb 2026) Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis
(01 Feb 2026) SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning
(31 Jan 2026) RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
(29 Jan 2026) MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods
(28 Jan 2026) MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models
(27 Jan 2026) Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
(26 Jan 2026) AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
(22 Jan 2026) Explainable Deepfake Detection with RL Enhanced Self-Blended Images
(20 Jan 2026) Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
(19 Jan 2026) Think3D: Thinking with Space for Spatial Reasoning
(16 Jan 2026) MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement
(12 Jan 2026) CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation
(12 Jan 2026) MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning
(11 Jan 2026) E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis
(11 Jan 2026) Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
(09 Jan 2026) SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More
(08 Jan 2026) Agri-R1: Agricultural Reasoning for Disease Diagnosis via Automated-Synthesis and Reinforcement Learning
(06 Jan 2026) ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
(06 Jan 2026) Towards Faithful Reasoning in Comics for Small MLLMs
(06 Jan 2026) Aligning Findings with Diagnosis: A Self-Consistent Reinforcement Learning Framework for Trustworthy Radiology Reporting
(01 Jan 2026) CPPO: Contrastive Perception for Vision Language Policy Optimization
(01 Jan 2026) From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning
(31 Dec 2025) From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme
(22 Dec 2025) Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection
(22 Dec 2025) CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
(22 Dec 2025) Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation
(22 Dec 2025) SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models
(20 Dec 2025) Stable and Efficient Single-Rollout RL for Multimodal Reasoning
(19 Dec 2025) Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
(19 Dec 2025) Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding
(18 Dec 2025) AdaTooler-V: Adaptive Tool-Use for Images and Videos
(16 Dec 2025) Incentivizing Tool-augmented Thinking with Images for Medical Image Analysis
(16 Dec 2025) ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
(16 Dec 2025) OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
(13 Dec 2025) More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models
(13 Dec 2025) Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking
(12 Dec 2025) DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
(08 Dec 2025) MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning
(07 Dec 2025) Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning
(07 Dec 2025) The Role of Entropy in Visual Grounding: Analysis and Optimization
(06 Dec 2025) ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models
(03 Dec 2025) TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning
(03 Dec 2025) Thinking with Programming Vision: Towards a Unified View for Thinking with Images
(03 Dec 2025) Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
(02 Dec 2025) See, Think, Learn: A Self-Taught Multimodal Reasoner
(29 Nov 2025) ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
(28 Nov 2025) TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM
(27 Nov 2025) GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes
(24 Nov 2025) Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
(23 Nov 2025) Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
(22 Nov 2025) PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning
(21 Nov 2025) VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
(21 Nov 2025) ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
(20 Nov 2025) OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
(19 Nov 2025) VisPlay: Self-Evolving Vision-Language Models from Images
(17 Nov 2025) Video Finetuning Improves Reasoning Between Frames
(17 Nov 2025) From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
(17 Nov 2025) SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
(14 Nov 2025) Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions
(11 Nov 2025) From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
(10 Nov 2025) Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View
(07 Nov 2025) PreResQ-R1: Towards Fine-Grained Rank-and-Score Reinforcement Learning for Visual Quality Assessment via Preference-Response Disentangled Policy Optimization
(04 Nov 2025) ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension
(04 Nov 2025) SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning
(01 Nov 2025) UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings
(01 Nov 2025) Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
(31 Oct 2025) Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
(23 Oct 2025) Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning
(23 Oct 2025) Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
(18 Oct 2025) RL makes MLLMs see better than SFT
(16 Oct 2025) MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
(15 Oct 2025) Generative Universal Verifier as Multimodal Meta-Reasoner
(14 Oct 2025) HoneyBee: Data Recipes for Vision-Language Reasoners
(14 Oct 2025) DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
(13 Oct 2025) CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
(10 Oct 2025) Unleashing Perception-Time Scaling to Multimodal Reasoning Models
(10 Oct 2025) Spotlight on Token Perception for Multimodal Reinforcement Learning
(10 Oct 2025) Tiny-R1V: Lightweight Multimodal Unified Reasoning Model via Model Merging
(9 Oct 2025) ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping
(9 Oct 2025) SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
(6 Oct 2025) Beyond Monolithic Rewards: A Hybrid and Multi-Aspect Reward Optimization for MLLM Alignment
(3 Oct 2025) Efficient Test-Time Scaling for Small Vision-Language Models
(29 Sep 2025) Latent Visual Reasoning
(29 Sep 2025) GeoVLM-R1: Reinforcement Fine-Tuning for Improved Remote Sensing Reasoning
(29 Sep 2025) VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding
(29 Sep 2025) Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
(28 Sep 2025) Poivre: Self-Refining Visual Pointing with Reinforcement Learning
(27 Sep 2025) Decoupling Reasoning and Perception: An LLM-LMM Framework for Faithful Visual Reasoning
(25 Sep 2025) MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources
(12 Sep 2025) LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
(9 Sep 2025) Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
(28 Aug 2025) R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning
(27 Aug 2025) Self-Rewarding Vision-Language Model via Reasoning Decomposition
(18 Aug 2025) M3PO: Multimodal-Model-Guided Preference Optimization for Visual Instruction Following
(18 Aug 2025) Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
(18 Aug 2025) Ovis2.5 Technical Report
(18 Aug 2025) MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models
(8 Aug 2025) SIFThinker: Spatially-Aware Image Focus for Visual Reasoning
(7 Aug 2025) Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
(7 Aug 2025) StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models
(5 Aug 2025) Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions
(30 Jul 2025) MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention
(28 Jul 2025) Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
(24 Jul 2025) MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning
(24 Jul 2025) SafeWork-R1: Coevolving Safety and Intelligence under the AI-45 Law
(22 Jul 2025) C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
(22 Jul 2025) Semi-off-Policy Reinforcement Learning for Vision-Language Slow-thinking Reasoning
(11 Jul 2025) M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning
(3 Jul 2025) Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
(1 Jul 2025) GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
(20 Jun 2025) GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
(16 Jun 2025) Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning
(11 Jun 2025) ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
(5 Jun 2025) Perceptual Decoupling for Scalable Multi-modal Reasoning via Reward-Optimized Captioning
(5 Jun 2025) MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
(16 May 2025) Visual Planning: Let's Think Only with Images
(15 May 2025) MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning
(13 May 2025) OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
(12 May 2025) Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
(8 May 2025) Bring Reason to Vision: Understanding Perception and Reasoning through Model Merging
(08 May 2025) SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
(6 May 2025) X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains
(6 May 2025) Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
(6 May 2025) ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
(5 May 2025) R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
(28 Apr 2025) SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
(25 Apr 2025) Fast-Slow Thinking for Large Vision-Language Model Reasoning
(25 Apr 2025) Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
(25 Apr 2025) Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
(21 Apr 2025) A Call for New Recipes to Enhance Spatial Reasoning in MLLMs
(20 Apr 2025) Relation-R1: Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relational Comprehension
(12 Apr 2025) VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
(10 Apr 2025) VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
(10 Apr 2025) SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
(10 Apr 2025) Perception-R1: Pioneering Perception Policy with Reinforcement Learning
(10 Apr 2025) Kimi-VL Technical Report
(8 Apr 2025) On the Suitability of Reinforcement Fine-Tuning to Visual Tasks
(8 Apr 2025) Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
(1 Apr 2025) Improved Visual-Spatial Reasoning via R1-Zero-Like Training
(17 Mar 2025) R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
(13 Mar 2025) VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
(9 Mar 2025) Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
(7 Mar 2025) R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning
(7 Mar 2025) Unified Reward Model for Multimodal Understanding and Generation
(7 Mar 2025) R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model
(3 Mar 2025) Visual-RFT: Visual Reinforcement Fine-Tuning
(4 Feb 2025) Boosting Multimodal Reasoning with MCTS-Automated Structured Thinking
(13 Jan 2025) Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
(10 Jan 2025) LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs
(9 Jan 2025) Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
(3 Jan 2025) Virgo: A Preliminary Exploration on Reproducing o1-like MLLM
(30 Dec 2024) Slow Perception: Let's Perceive Geometric Figures Step-by-step
(19 Dec 2024) Progressive Multimodal Reasoning via Active Retrieval
(29 Nov 2024) Interleaved-Modal Chain-of-Thought
(15 Nov 2024) Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination
(15 Nov 2024) LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
(30 Oct 2024) Vision-Language Models Can Self-Improve Reasoning via Reflection
(23 Oct 2024) R-CoT: Reverse Chain-of-Thought Problem Generation for Geometric Reasoning in Large Multimodal Models
(21 Oct 2024) Improve Vision Language Model Chain-of-thought Reasoning
(11 Oct 2024) M3Hop-CoT: Misogynous Meme Identification with Multimodal Multi-hop Chain-of-Thought
(6 Oct 2024) MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration
(4 Oct 2024) Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning
(13 Jun 2024) Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
(28 Dec 2023) Grounding-Prompter: Prompting LLM with Multimodal Information for Temporal Sentence Grounding in Long Videos
(14 Dec 2023) Multi-modal Latent Space Learning for Chain-of-Thought Reasoning in Language Models
(27 Nov 2023) Compositional Chain-of-Thought Prompting for Large Multimodal Models
(15 Nov 2023) The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task
(3 May 2023) Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings
(16 Apr 2023) Chain of Thought Prompt Tuning in Vision Language Models
(2 Feb 2023) Multimodal Chain-of-Thought Reasoning in Language Models
(09 Sep 2026) Cost-Aware Vision--Language Model Arbitration for Fabric Structure Recognition A Deployable Multi-Agent System
(09 Sep 2026) VLX-VR: An Agentic-Aware Video Reasoning Model
(09 Sep 2026) Who Are They to Each Other? Multi-Agent Reasoning for Speaker Relationship Inference
(09 Sep 2026) SpeechAnnotator: A Context-Aware Multi-Agent Framework and Benchmark for Multidimensional Speech Annotation
(08 Sep 2026) An Experimental Evaluation of Multimodal Prompt Injection Attacks on Agentic AI Frameworks
(07 Sep 2026) Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning
(07 Sep 2026) PhysMAS: Physics-Grounded Multi-Agent Synthesis of Compositional 4D Gaussians
(06 Sep 2026) 3DHarnessBench: Probing Agentic 3D-to-Code Capabilities of Frontier Vision-Language Models
(04 Sep 2026) CUSP: Decomposable Collective Uncertainty for Multi-Agent Multimodal Reasoning
(03 Sep 2026) WorldReward: Reward Modeling for Camera-Conditioned World Models
(03 Sep 2026) StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios
(03 Sep 2026) LLM-Aided Design for Manufacturing: A Multi-Agent System for Intent-Preserving Redesign of CAD for Improved Manufacturability
(03 Sep 2026) Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models
(03 Sep 2026) ICM-Bench: Person-Level Identity Reasoning in Multimodal Agents with Long-Term Memory
(02 Sep 2026) SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
(02 Sep 2026) PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment
(01 Sep 2026) Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers
(01 Sep 2026) Agentic Multimodal Models for Environmental Hyperspectral Unmixing
(01 Sep 2026) InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations
(31 Aug 2026) CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework
(30 Aug 2026) FRAMEWORKERS: A Dynamic Multi-Agent Framework for AI-Generated Video Production
(30 Aug 2026) Off-Manifold Refinement: Guiding Video Generators with a Frozen World Model
(30 Aug 2026) When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents
(29 Aug 2026) LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO
(28 Aug 2026) See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs
(27 Aug 2026) WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning
(26 Aug 2026) VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following
(26 Aug 2026) SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning
(25 Aug 2026) Task-Adaptive Rubrics for GUI Reward Modeling
(25 Aug 2026) DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton
(25 Aug 2026) Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs
(25 Aug 2026) Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning
(25 Aug 2026) Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments
(24 Aug 2026) GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis
(24 Aug 2026) Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner
(24 Aug 2026) Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents
(22 Aug 2026) BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications
(22 Aug 2026) MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning
(22 Aug 2026) Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents
(19 Aug 2026) EVADE: Evidence-Verified Agentic Diagnosis with Escape
(19 Aug 2026) DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning
(18 Aug 2026) Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
(18 Aug 2026) Structural Plan-to-Model Conversion with Deterministic Geometry and Guarded Agentic Vision-Language Refinement
(18 Aug 2026) DeAR: Decentralized Agentic Reasoning via Capability Grounding and Collaborative Thought Navigation
(17 Aug 2026) ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning
(15 Aug 2026) VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
(15 Aug 2026) SCOPE: Score-Isolated Agentic Optimization for Video World Models
(14 Aug 2026) MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning
(14 Aug 2026) Wyvern: An Agentic Framework for Generating Grounded Multimodal Reports
(14 Aug 2026) MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning
(13 Aug 2026) Intern-S2-Preview: Scientific Agentic Foundation Model
(11 Aug 2026) MIRA: Medical Image Reflection for Agentic Diagnosis
(11 Aug 2026) Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation
(08 Aug 2026) SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning
(07 Aug 2026) Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning
(06 Aug 2026) The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents
(06 Aug 2026) AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents
(04 Aug 2026) Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
(04 Aug 2026) AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding
(01 Aug 2026) DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning
(31 Jul 2026) Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning
(28 Jul 2026) ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning
(23 Jul 2026) EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization
(17 Jul 2026) Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA
(14 Jul 2026) A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism
(14 Jul 2026) ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning
(14 Jul 2026) EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval
(13 Jul 2026) The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy
(07 Jul 2026) EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents
(03 Jul 2026) VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning
(18 Jun 2026) MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization
(15 Jun 2026) Context-Aware RL for Agentic and Multimodal LLMs
(10 Jun 2026) IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents
(10 Jun 2026) MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning
(10 Jun 2026) Orchestra-o1: Omnimodal Agent Orchestration
(05 Jun 2026) StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents
(04 Jun 2026) AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents
(04 Jun 2026) TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents
(04 Jun 2026) Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators
(01 Jun 2026) OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
(19 May 2026) ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
(19 May 2026) ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning
(18 May 2026) AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents
(18 May 2026) GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents
(18 May 2026) An Efficient Streaming Video Understanding Framework with Agentic Control
(16 May 2026) OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics
(14 May 2026) ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
(13 May 2026) ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows
(10 May 2026) Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning
(08 May 2026) HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents
(08 May 2026) LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
(08 May 2026) Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning
(07 May 2026) A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency
(05 May 2026) What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity
(01 May 2026) Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
(30 Apr 2026) Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation
(30 Apr 2026) MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection
(30 Apr 2026) GUI Agents with Reinforcement Learning: Toward Digital Inhabitants
(29 Apr 2026) GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
(28 Apr 2026) Benchmarking and Improving GUI Agents in High-Dynamic Environments
(27 Apr 2026) Agentic AI for Remote Sensing: Technical Challenges and Research Directions
(25 Apr 2026) SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing
(13 Apr 2026) Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games
(13 Apr 2026) Dialectic-Med: Mitigating Diagnostic Hallucinations via Counterfactual Adversarial Multi-Agent Debate
(10 Apr 2026) Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents
(10 Apr 2026) ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
(09 Apr 2026) RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs
(09 Apr 2026) MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
(08 Apr 2026) Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
(07 Apr 2026) Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction
(29 Mar 2026) MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences
(27 Mar 2026) Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
(24 Mar 2026) EVA: Efficient Reinforcement Learning for End-to-End Video Agent
(17 Mar 2026) PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning
(17 Mar 2026) OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials
(16 Mar 2026) MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings
(03 Mar 2026) Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling
(26 Feb 2026) FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning
(26 Feb 2026) CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays
(19 Feb 2026) RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
(14 Feb 2026) Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
(05 Feb 2026) V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval
(26 Jan 2026) GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
(30 Dec 2025) SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
(23 Dec 2025) CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation
(21 Dec 2025) Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback
(09 Dec 2025) Thinking with Images via Self-Calling Agent
(06 Dec 2025) VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
(03 Dec 2025) Multimodal Reinforcement Learning with Agentic Verifier for AI Agents
(26 Nov 2025) OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection
(25 Nov 2025) VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis
(24 Nov 2025) VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
(17 Nov 2025) DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
(12 Nov 2025) History-Aware Reasoning for GUI Agents
(31 Oct 2025) GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
(2 Dec 2024) Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
(09 Sep 2026) HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy
(08 Sep 2026) CLAMP: Constrained Decoding for Vision-Language Embodied Planning
(08 Sep 2026) WorldAgen: Unified State-Action Prediction with Test-Time World Model Training
(08 Sep 2026) CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot Manipulation
(08 Sep 2026) Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic Method
(07 Sep 2026) Phase-and-First-Arrival VLM Feedback for Sparse-Reward Reinforcement Learning in Surgical Manipulation
(07 Sep 2026) Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models
(07 Sep 2026) Dex-X: Learning Visual-Tactile Dexterous Manipulation From Human Videos with Simulated Interaction
(05 Sep 2026) FACT: A Forensic Agent with Compiled Tool-Use Trajectories for AI-Generated Image Detection
(05 Sep 2026) MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control
(05 Sep 2026) CST-WM: A Causally Structured World Model for Embodied Visual Tracking
(05 Sep 2026) Learning Counterfactual World Models for Embodied Reasoning under Partial Observability
(04 Sep 2026) Reasoning Without Inference Cost: Latent Semantic Scaffolding for Robot VLA Policies
(04 Sep 2026) Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models
(04 Sep 2026) Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation
(03 Sep 2026) VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models
(03 Sep 2026) ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection
(03 Sep 2026) Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models
(03 Sep 2026) WISE: World-model-guided Imagination Scheduling for Efficient Post-training of Vision-Language-Action Models
(03 Sep 2026) Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving
(30 Aug 2026) SymVD: Symmetric Vision Language Action Distillation for Robot Manipulation
(27 Aug 2026) Diffusion Policies for Short-Horizon Planning in Robot Crowd Navigation
(27 Aug 2026) Decoupling Planning and Control for Instructable Agents
(27 Aug 2026) Embodied Scene Rearrangement Planning
(26 Aug 2026) Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning
(26 Aug 2026) $R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning
(25 Aug 2026) GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model
(25 Aug 2026) TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks
(24 Aug 2026) OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation
(24 Aug 2026) Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
(22 Aug 2026) Decoupled Physical Modeling and Execution for Physics Reasoning
(22 Aug 2026) CounterAlign: Counterfactual Supervision for Vision-Language-Action Models
(18 Aug 2026) Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups
(18 Aug 2026) Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
(17 Aug 2026) FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences
(17 Aug 2026) PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents
(17 Aug 2026) Inference-Time Attention Steering for Vision-Language-Action Driving Models
(17 Aug 2026) Planner-Conditioned Diffusion for Coordinated Multi-Agent Exploration
(17 Aug 2026) HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL
(17 Aug 2026) $τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
(16 Aug 2026) Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation
(14 Aug 2026) Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models
(21 Jul 2026) No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation
(24 Jun 2026) RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards
(12 Apr 2026) A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning
(30 Mar 2026) SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning
(22 Mar 2026) RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models
(16 Mar 2026) From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation
(24 Feb 2026) HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning
(18 Feb 2026) Peeking Ahead of the Field Study: Exploring VLM Personas as Support Tools for Embodied Studies in HCI
(16 Feb 2026) Ground-Truth Depth in Vision Language Models: Spatial Context Understanding in Conversational AI for XR-Robotic Support in Emergency First Response
(07 Feb 2026) VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation
(16 Jan 2026) ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
(02 Jan 2026) RoboReward: General-Purpose Vision-Language Reward Models for Robotics
(21 Dec 2025) ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning
(28 Nov 2025) Video-CoM: Interactive Video Reasoning via Chain of Manipulations
(13 Nov 2025) AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models
(08 Sep 2026) Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding
(08 Sep 2026) Human-Centric Image Captioning with Subject-Centered Spatial Understanding
(07 Sep 2026) CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation
(07 Sep 2026) Ambient @ EgoLongQA 2026: Distilling Long-Video perception into a Sub-2B Model
(07 Sep 2026) Beyond Sparse Rewards: A New Benchmark and Structure-Aware Graph Alignment for Micro-Drama Understanding
(06 Sep 2026) Thinking with Cameras: Active Visual Reasoning via Dynamic Viewpoint Control for Surveillance Video Understanding
(06 Sep 2026) Visual Search Augmented Chain-of-Thought Reasoning for Attribute Value Extraction from Product Videos
(03 Sep 2026) Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision
(03 Sep 2026) LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL
(03 Sep 2026) Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning
(01 Sep 2026) Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models
(01 Sep 2026) TempCloze: Can Video-LLMs Identify the Missing Middle?
(29 Aug 2026) Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling
(28 Aug 2026) StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models
(28 Aug 2026) Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models
(27 Aug 2026) Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models
(27 Aug 2026) Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs
(27 Aug 2026) Video-FLAIR: Not Whether to Reason, But How
(27 Aug 2026) Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection
(26 Aug 2026) Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding
(26 Aug 2026) VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
(26 Aug 2026) AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research
(26 Aug 2026) LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding
(25 Aug 2026) PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos
(24 Aug 2026) Scaling Reinforcement Learning for Diffusion Models via Velocity Matching
(23 Aug 2026) Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting
(21 Aug 2026) COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models
(21 Aug 2026) Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision
(21 Aug 2026) TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming
(20 Aug 2026) Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
(19 Aug 2026) StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos
(19 Aug 2026) CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes
(19 Aug 2026) CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios
(18 Aug 2026) TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs
(17 Aug 2026) Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning
(17 Aug 2026) Contrastive Energy Fields for Inference-Time Procedure Planning in Instructional Videos
(17 Aug 2026) StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding
(17 Aug 2026) RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning
(17 Aug 2026) CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated?
(16 Aug 2026) Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
(16 Aug 2026) CrossView: Can Vision-Language Models Reason Across Cameras?
(16 Aug 2026) Sequential Multimodal Evidence Optimization for Product Media Ranking in E-Commerce
(14 Aug 2026) Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition
(14 Aug 2026) OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation
(14 Aug 2026) InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors
(14 Aug 2026) Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training
(12 Aug 2026) SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward
(10 Aug 2026) CodecArena: Codec Quality Assessment via Visual Reinforcement Learning
(10 Aug 2026) Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models
(05 Aug 2026) PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning
(05 Aug 2026) WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models
(05 Aug 2026) HelloWorld: Enabling Socially Interactive Characters in Video World Models
(04 Aug 2026) Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering
(03 Aug 2026) AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning
(02 Aug 2026) MiniWorld: Democratizing the Training of Video World Models from Scratch
(28 Jul 2026) Wonder: Video World Model Done Better
(27 Jul 2026) CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding
(27 Jul 2026) Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts
(11 Jul 2026) Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset
(06 Jul 2026) TimeThink: Reasoning with Time for Video LLMs
(06 Jul 2026) Claim-Level Rubric Rewards for Video Caption Reinforcement Learning
(02 Jul 2026) Rank-Then-Act: Reward-Free Control from Frame-Order Progress
(01 Jul 2026) VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
(01 Jul 2026) Linguistic Relative Policy Optimization for Video Anomaly Reasoning
(01 Jul 2026) EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection
(01 Jul 2026) Latent Visual Cache for Video Reasoning
(23 Jun 2026) SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards
(20 Jun 2026) When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR
(18 Jun 2026) CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs
(17 Jun 2026) Native Active Perception as Reasoning for Omni-Modal Understanding
(16 Jun 2026) Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs
(10 Jun 2026) AVIS: Adaptive Test-Time Scaling for Vision-Language Models
(10 Jun 2026) Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding
(10 Jun 2026) InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning
(08 Jun 2026) Temporal-Aware Reasoning Optimization for Video Temporal Grounding
(08 Jun 2026) CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning
(07 Jun 2026) CACR:Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning
(05 Jun 2026) VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation
(04 Jun 2026) Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction
(04 Jun 2026) ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE
(03 Jun 2026) VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding
(02 Jun 2026) Reinforcement Learning from Cross-domain Videos with Video Prediction Model
(02 Jun 2026) Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching
(19 May 2026) RECIPE: Procedural Planning via Grounding in Instructional Video
(18 May 2026) Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
(15 May 2026) Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization
(14 May 2026) KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration
(14 May 2026) RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO
(14 May 2026) Video Models Can Reason with Verifiable Rewards
(13 May 2026) AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
(12 May 2026) CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
(11 May 2026) GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs
(08 May 2026) RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
(08 May 2026) Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
(07 May 2026) Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
(07 May 2026) VISD: Enhancing Video Reasoning via Structured Self-Distillation
(06 May 2026) Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing
(03 May 2026) Act2See: Emergent Active Visual Perception for Video Reasoning
(02 May 2026) Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs
(01 May 2026) AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in Unified Multimodal Models via Decompositional Verifiable Reward
(01 May 2026) Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning
(30 Apr 2026) Generate Your Talking Avatar from Video Reference
(30 Apr 2026) AesRM: Improving Video Aesthetics with Expert-Level Feedback
(29 Apr 2026) DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
(28 Apr 2026) OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
(28 Apr 2026) MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
(26 Apr 2026) Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference
(25 Apr 2026) UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks
(25 Apr 2026) StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning
(25 Apr 2026) EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs
(13 Apr 2026) Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding
(01 Apr 2026) Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs
(28 Mar 2026) Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
(27 Mar 2026) Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning
(26 Mar 2026) VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
(26 Mar 2026) Reinforcing Structured Chain-of-Thought for Video Understanding
(17 Mar 2026) When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
(12 Mar 2026) Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
(19 Feb 2026) GraphThinker: Reinforcing Video Reasoning with Event Graph Thinking
(12 Feb 2026) STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
(30 Jan 2026) Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
(28 Jan 2026) Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
(27 Jan 2026) Video-KTR: Reinforcing Video Reasoning via Key Token Attribution
(08 Jan 2026) VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice
(07 Dec 2025) MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
(02 Dec 2025) OneThinker: All-in-one Reasoning Model for Image and Video
(17 Nov 2025) ViSS-R1: Self-Supervised Reinforcement Video Reasoning
(23 Oct 2025) Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
(9 Oct 2025) SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
(06 Oct 2025) Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
(5 Oct 2025) Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
(29 Sep 2025) FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
(29 Sep 2025) LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
(28 Sep 2025) FrameMind: Frame-Interleaved Chain-of-Thought for Video Reasoning via Reinforcement Learning
(12 Jun 2025) CogStream: Context-guided Streaming Video Question Answering
(6 Jun 2025) VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
(27 Mar 2025) Video-R1: Reinforcing Video Reasoning in MLLMs
(17 Feb 2025) video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
(10 Feb 2025) CoS: Chain-of-Shot Prompting for Long Video Understanding
(8 Jan 2025) Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs
(3 Dec 2024) VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation
(29 Nov 2024) STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training
(12 Oct 2024) Interpretable Video based Stress Detection with Self-Refine Chain-of-thought Reasoning
(8 Oct 2024) Temporal Reasoning Transfer from Text to Video.
(27 Sep 2024) Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks
(28 Aug 2024) Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation
(24 May 2024) Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
(7 May 2024) Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. code
(06 Sep 2026) A Ticket from Marginals to Joints: Coupled-Noise Distillation for One-Step Block Generation in Diffusion Language Models
(03 Sep 2026) Unlocking Lossless Speedups in LLMs via Discrete Diffusion
(03 Sep 2026) Distilled Continuous Diffusion Language Models Can Write Code in Few Steps---or One
(26 Aug 2026) Prefix-Denoising Consistency: Test-Time Verification for Diffusion Language Models
(24 Aug 2026) SelFusion: Self-distillation for Diffusion Language Models
(20 Aug 2026) Discrete Diffusion Inference-Time Control with Nested Sequential Monte Carlo
(06 Aug 2026) Answer First, Reason Later: Commitment Order in Diffusion LLMs
(03 Aug 2026) Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models
(03 Aug 2026) OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models
(01 Aug 2026) Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs
(18 Jul 2026) Trace-Based On-Policy Distillation for Masked Diffusion Language Models
(16 Jul 2026) A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models
(16 Jul 2026) Mask-Aware Policy Gradients for Diffusion Language Models
(05 Jul 2026) dOPSD: On-Policy Self-Distillation for Diffusion Language Models
(01 Jul 2026) Diffusion-GR2: Diffusion Generative Reasoning Re-ranker
(16 Jun 2026) Learning from the Self-future: On-policy Self-distillation for dLLMs code
(11 Jun 2026) DiPOD: Diffusion Policy Optimization without Drifting Apart
(07 Jun 2026) Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models
(03 Jun 2026) Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models
(12 May 2026) Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models
(11 May 2026) Relative Score Policy Optimization for Diffusion Language Models
(08 May 2026) DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
(04 May 2026) Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning
(29 Apr 2026) Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
(27 Apr 2026) DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models
(07 Apr 2026) Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
(23 Mar 2026) Tiny Inference-Time Scaling with Latent Verifiers
(12 Mar 2026) EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
(06 Mar 2026) Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion
(12 Feb 2026) Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
(31 Jan 2026) Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings
(29 Dec 2025) ThinkGen: Generalized Thinking for Visual Generation
(25 Dec 2025) Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration
(03 Dec 2025) ReasonX: MLLM-Guided Intrinsic Image Decomposition
(27 Nov 2025) ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
(9 Oct 2025) Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
(9 Oct 2025) Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
(09 Sep 2026) Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models
(07 Sep 2026) Reasoning Beyond Transcription: Audio Language Models on Child Stuttering Speech
(03 Sep 2026) Test-time adaptation for speech enhancement with an autoregressive speech prior
(01 Sep 2026) TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models
(31 Aug 2026) SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards
(31 Aug 2026) When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models
(31 Aug 2026) Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols
(30 Aug 2026) TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models
(25 Aug 2026) AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models
(24 Aug 2026) Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering
(17 Aug 2026) Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization
(16 Aug 2026) VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation
(04 Aug 2026) Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization
(03 Aug 2026) Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning
(23 Jul 2026) X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment
(23 Jul 2026) OPOD: On-Policy Omni Distillation
(09 Jul 2026) When Synthetic Speech Is All You Have: Better Call GRPO
(08 Jul 2026) Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning
(02 Jul 2026) DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning
(02 Jul 2026) Reinforcement Learning for Data-Efficient Code-Switched ASR
(24 Jun 2026) Omni-Perception Policy Optimization for Multimodal Emotion Reasoning
(19 Jun 2026) Post-Training Speech Enhancement Language Models with Perceptual Rewards
(17 Jun 2026) ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection
(14 Jun 2026) AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction
(05 Jun 2026) Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models
(03 Jun 2026) Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention
(11 May 2026) Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought
(11 May 2026) EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs
(28 Apr 2026) Step-Audio-R1.5 Technical Report
(27 Apr 2026) Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
(27 Apr 2026) Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs
(13 Apr 2026) Empowering Video Translation using Multimodal Large Language Models
(05 Mar 2026) SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning
(25 Jan 2026) AR-Omni: A Unified Autoregressive Model for Any-to-Any Generation
(23 Oct 2025) Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards
(10 Oct 2025) Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models
(8 Oct 2025) Can Speech LLMs Think while Listening?
(5 Oct 2025) Principled and Tractable RL for Reasoning with Diffusion Language Models
(22 Jul 2025) Step-Audio 2 Technical Report
(14 Mar 2025) Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
(08 Sep 2026) Let It Go or Learn to Self-Correct: Continuous Diffusion for Constrained Discrete Tasks
(07 Sep 2026) VoT: Vision-of-Thought for Unified Multimodal Representation Alignment
(04 Sep 2026) Importance-Aware Low-Rank Distillation of Diffusion Transformers
(02 Sep 2026) CrashDiffuser: VLM-Guided Collision Intent Reasoning for Fine-Grained Safety-Critical Traffic Scenario Generation
(01 Sep 2026) Diffusion as a Training Curriculum for Timestep-Free Iterative Reasoning
(28 Aug 2026) CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning
(26 Aug 2026) DCGC: Draft-Conditioned Global Correction for Complex Reasoning with Masked Diffusion Models
(21 Aug 2026) EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking
(17 Aug 2026) Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection
(05 Aug 2026) GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction
(29 Jul 2026) Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection
(20 Jul 2026) JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models
(05 Jul 2026) Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
(04 Jul 2026) Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
(03 Jul 2026) ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space
(15 Jun 2026) Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models
(12 Jun 2026) HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities
(11 Jun 2026) Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model
(01 Jun 2026) Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization
(19 May 2026) Inference-Time Scaling in Diffusion Models through Iterative Partial Refinement
(16 May 2026) Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models
(16 May 2026) TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward
(14 May 2026) DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
(11 May 2026) Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models
(10 May 2026) SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning
(08 May 2026) Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria
(07 May 2026) Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models
(07 May 2026) Continuous-Time Distribution Matching for Few-Step Diffusion Distillation
(28 Apr 2026) The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
(26 Apr 2026) ZID-Net: Zero-Inference Diffusion Prior Decoupling Network for Single Image Dehazing
(15 Apr 2026) Enhanced Text-to-Image Generation by Fine-grained Multimodal Reasoning
(14 Apr 2026) Representation geometry shapes task performance in vision-language modeling for CT enterography
(14 Apr 2026) PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
(10 Mar 2026) Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
(04 Mar 2026) Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks
(28 Jan 2026) Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
(29 Dec 2025) REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
(14 Dec 2025) Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
(04 Dec 2025) DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
(18 Nov 2025) UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
(13 Nov 2025) Image Aesthetic Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance
(24 Oct 2025) Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation
(15 Oct 2025) Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
(9 Oct 2025) Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing
(9 Oct 2025) Reinforcing Diffusion Models by Direct Group Preference Optimization
(9 Oct 2025) Real-Time Motion-Controllable Autoregressive Video Diffusion
(29 Sep 2025) STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation
(28 Aug 2025) Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
(28 Aug 2025) OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
(28 Aug 2025) Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
(27 Aug 2025) CVBench: Evaluating Cross-Video Synergies for Complex Multimodal Understanding and Reasoning
(9 Aug 2025) AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
(28 Jul 2025) Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
(20 Jun 2025) RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought
(17 Jun 2025) SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks
(16 May 2025) Towards Self-Improvement of Diffusion Models via Group Preference Optimization
(16 May 2025) Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models
(15 May 2025) Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models
(12 May 2025) DanceGRPO: Unleashing GRPO on Visual Generation
(8 May 2025) Flow-GRPO: Training Flow Matching Models via Online RL
(1 May 2025) T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
(22 Apr 2025) From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning
(22 Apr 2025) Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
(26 Mar 2025) MMGen: Unified Multi-modal Image Generation and Understanding in One Go
(13 Mar 2025) GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
(3 Mar 2025) MINT: Multi-modal Chain of Thought in Unified Generative Models for Enhanced Image Generation
(23 Jan 2025) Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
(06 Sep 2026) NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures
(04 Sep 2026) MMTClinic: Multimodal, Multilingual Time Series Question Answering and Reasoning Benchmark for Clinical Domain
(03 Sep 2026) MetaStructAtlas: A Grounded 3D Vision-Language Dataset and Benchmark for Functional and Structural Reasoning in Whole-Body PET/CT
(29 Aug 2026) CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions
(26 Aug 2026) Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs
(20 Aug 2026) Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms
(20 Aug 2026) SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces
(18 Aug 2026) BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models
(11 Aug 2026) Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes
(05 Aug 2026) OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing
(02 Aug 2026) LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning
(30 Jul 2026) OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
(28 Jul 2026) Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification
(23 Jul 2026) Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
(07 Jun 2026) Driv
Truncated — view the full README on GitHub.