The-Martyr/Awesome-Multimodal-Reasoning

Latest Advances on (RL based) Multimodal Reasoning and Generation in Multimodal LLMs

102

127 commits

updated Sep 10, 2026

See the code

README

Awesome-Multimodal-Reasoning Awesome

This is a repository for organizing papers related to Multimodal Reasoning in Multimodal Large Language Models (Image, Video).

With the development of the visual (audio) capabilities and reasoning capabilities (RL powered) of multimodal large language models(MLLMs/LVLMs/LSLMs), researchers have high hopes for the multimodal reasoning capabilities of MLLM/LVLM/LSLM.

This repo also select paper about visual generation (image generation/video generation) with RL/CoT.

This repository aims to cover ALL possibly relevant papers to support research surveys, not just selected best papers. We believe comprehensive coverage is more valuable for researchers than a curated list.

:star: If you find this list useful, welcome to star it!

Table of Contents

Paper List (Updating...)

Survey

(06 Jun 2026) Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning arXiv

(01 Jun 2026) TechRAG: Evidence-Gated Multimodal Agentic RAG for Technical Literature Reasoning arXiv

(20 May 2026) A Survey of Audio Reasoning in Multimodal Foundation Models arXiv

(05 May 2026) Material Database Agent: A Multimodal Agentic Framework for Scientific Literature Mining arXiv

(25 Apr 2026) GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI arXiv

(8 May 2025) Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models arXiv

(30 Apr 2025) Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models arXiv

(4 Apr 2025) Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning arXiv

(18 Mar 2025) Aligning Multimodal LLM with Human Preference: A Survey arXiv

(16 Mar 2025) Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey arXiv

Image Reasoning

(09 Sep 2026) On-Policy Distillation for Vision-Language Model Adaptation, an Effective Paradigm on Low-Quality Multimodal Data arXiv

(09 Sep 2026) Beyond Surface Imitation: Contrastive Modeling for Reasoning Path Alignment in Multimodal In-Context Learning arXiv

(09 Sep 2026) From Pixels to Hierarchical Sequences: Quadtree Mask Encoding for Vision-Language Binary Change Detection arXiv

(08 Sep 2026) Drive by Hindsight and Foresight: Tool-Grounded Synergistic Reasoning over Hierarchical Memory for Autonomous Driving arXiv

(08 Sep 2026) From Glance to Scrutiny: Progressive Distortion Reasoning for Fine-Grained Image Quality Assessment arXiv

(08 Sep 2026) SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning Segmentation arXiv

(08 Sep 2026) CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs arXiv

(07 Sep 2026) Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification arXiv

(07 Sep 2026) SupGRPO: Enhancing GRPO with Matching-based Online SFT for Text Spotting arXiv

(07 Sep 2026) MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling arXiv

(06 Sep 2026) Counterfactual Tests for Measuring Chain-of-Thought Faithfulness in Visual Language Models arXiv

(06 Sep 2026) Separating Capability from Confidence: Grounded Dual-State Calibration for GRPO-Trained Medical Vision-Language Models arXiv

(05 Sep 2026) Distilling Vision-Language Models for On-Device Fire Understanding arXiv

(05 Sep 2026) Geometry-Aware Test-Time Learning for Quantitative Spatial Reasoning arXiv

(04 Sep 2026) MCPO: Modality-Contrastive Preference Optimization for Multimodal Chain-of-Thought Compression arXiv

(04 Sep 2026) Think-Verify-Revise: Neuro-Symbolic Visual Reasoning with Vision-Language Models and Dynamic Logic Tensor Networks arXiv

(03 Sep 2026) Revisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment arXiv

(03 Sep 2026) CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation arXiv

(03 Sep 2026) When Depth Hurts: Reliability-Aware Geometry Distillation for Depth-Free RGB-D Salient Object Detection arXiv

(03 Sep 2026) MedQA-MM: Shortcuts Behind Medical Visual Reasoning arXiv

(03 Sep 2026) GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs arXiv

(02 Sep 2026) CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction arXiv

(02 Sep 2026) Test-Time Logit Prompting for Source-Free Missing Modality Adaptation arXiv

(01 Sep 2026) Controllable Image Captioning with Prompt-Conditioned Scene Rewards arXiv

(01 Sep 2026) MERGED: Multimodal Entity Resolution via Generated Expert Reasoning Distillation arXiv

(01 Sep 2026) GazeRefine: Expert Gaze as a Test-Time Prompt for Training-Free Medical Image Segmentation arXiv

(01 Sep 2026) Towards reliable multimodal disaster severity assessment through preference optimization and explainable vision-language reasoning arXiv

(01 Sep 2026) A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss arXiv

(01 Sep 2026) Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures arXiv

(01 Sep 2026) Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis arXiv

(01 Sep 2026) Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation Methods arXiv

(31 Aug 2026) Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving arXiv

(31 Aug 2026) Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry arXiv

(31 Aug 2026) Reactivating Test-Time Scaling for Plane Geometry Problem Solving arXiv

(31 Aug 2026) SlideBank: A Persistent Hierarchical Evidence Bank for Consistent Whole-Slide Reasoning arXiv

(30 Aug 2026) InspectorGPT: A Comparative Reasoning Enhanced VLM for Comprehensive Industrial Anomaly Detection arXiv

(30 Aug 2026) Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency arXiv

(29 Aug 2026) Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs arXiv

(29 Aug 2026) GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models arXiv

(27 Aug 2026) Instruction Distillation: Text Instructions as Visual Examples arXiv

(27 Aug 2026) From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation arXiv

(27 Aug 2026) Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper arXiv

(26 Aug 2026) V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning arXiv

(26 Aug 2026) GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models arXiv

(25 Aug 2026) EVEREST:Endogenous Vision-Language Reinforcement Reasoning Exploration for Urban Socio-Semantic Segmentation arXiv

(24 Aug 2026) AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes arXiv

(24 Aug 2026) CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension arXiv

(24 Aug 2026) LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation arXiv

(23 Aug 2026) Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding arXiv

(23 Aug 2026) UR$^{2}$-MLLM: Uncertainty-aware Revisit Reasoning in Multimodal Large Language Models for Radiology Report Generation arXiv

(23 Aug 2026) LiST: Local-Simplex Test-Time LoRA Fusion arXiv

(22 Aug 2026) Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning arXiv

(22 Aug 2026) VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression arXiv

(21 Aug 2026) Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning arXiv

(21 Aug 2026) ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models arXiv

(21 Aug 2026) Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds arXiv

(21 Aug 2026) Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs arXiv

(20 Aug 2026) ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation arXiv

(20 Aug 2026) Evidence-Gated Task and Motion Planning with Vision-Language Models arXiv

(20 Aug 2026) Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models arXiv

(20 Aug 2026) G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation arXiv

(20 Aug 2026) PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment arXiv

(20 Aug 2026) Question-Guided Evidence Acquisition for Multimodal Visual Question Answering arXiv

(20 Aug 2026) Answer-Level Trust Selection for Physical Vision-Language Reasoning arXiv

(20 Aug 2026) Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment arXiv

(19 Aug 2026) UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval arXiv

(19 Aug 2026) PCQA-R1: Advancing Generalized 3D Point Cloud Quality Assessment with Reinforcement Learning arXiv

(19 Aug 2026) Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference arXiv

(19 Aug 2026) Clinically Structured Surrogate Rewards for Post-SFT Medical Image Captioning arXiv

(19 Aug 2026) COSTA: A Cluster-Centric Paradigm for Annotation-Free Open-Set Semantic Segmentation of Aerial Point Clouds with Domain Shifts arXiv

(19 Aug 2026) DynCur-Geo: Dynamic Curiosity Reward Shaping for Multimodal Active Geo-Localization arXiv

(19 Aug 2026) GRACE: Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration for Educational Visual Question Answering arXiv

(18 Aug 2026) Integrating Novelty and Surprise for Experience Prioritization and Exploration in Image-Based Reinforcement Learning arXiv

(18 Aug 2026) PathoArgus: Advancing Evidence-Grounded Long-Context Visual Reasoning across Gigapixel Whole-Slide and Multi-Slide Case Contexts arXiv

(17 Aug 2026) Interactive Whole Slide Images for RL-based Tumour Segmentation arXiv

(17 Aug 2026) Q-Learning With World Models arXiv

(17 Aug 2026) Lymphocyte Mimicry Correction via Region-Level Tissue Reasoning and Unbalanced Optimal Transport arXiv

(17 Aug 2026) Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning arXiv

(16 Aug 2026) SEER: Long-Context Reasoning via Selective Visual-Text Compression arXiv

(15 Aug 2026) MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems arXiv

(15 Aug 2026) Risk-Adaptive Edge--Cloud Visual Reasoning for Communication-Efficient Autonomous Driving arXiv

(15 Aug 2026) Physiological World Models for Human State Transitions arXiv

(14 Aug 2026) Self-Supervised Visual On-Policy Distillation arXiv

(14 Aug 2026) Test-Time Instance Selection for Improved Whole Slide Image Analysis arXiv

(14 Aug 2026) SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation arXiv

(13 Aug 2026) Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs arXiv

(13 Aug 2026) LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning arXiv

(11 Aug 2026) ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes arXiv

(11 Aug 2026) CARE: Confidence-Aware Reasoning for Reliable Medical VQA arXiv

(10 Aug 2026) ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection arXiv

(10 Aug 2026) Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models arXiv

(10 Aug 2026) FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving arXiv

(09 Aug 2026) Improving Generalization Robustness of Multimodal RLVR arXiv

(08 Aug 2026) Evidence-RL: Towards Evidence-intensive Visual Reasoning arXiv

(08 Aug 2026) PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets arXiv

(08 Aug 2026) StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning arXiv

(06 Aug 2026) Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval arXiv

(06 Aug 2026) WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader arXiv

(05 Aug 2026) Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO arXiv

(05 Aug 2026) Multi-Branch Policy Optimization for Multimodal Large Language Models arXiv

(05 Aug 2026) ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination arXiv

(05 Aug 2026) Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs arXiv

(05 Aug 2026) OPD-V: Visual On-Policy Self-Distillation with Modality Balance arXiv

(04 Aug 2026) Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach arXiv

(04 Aug 2026) Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training arXiv

(04 Aug 2026) Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning arXiv

(04 Aug 2026) CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement arXiv

(04 Aug 2026) DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning arXiv

(04 Aug 2026) Monte Carlo Tree Search for Table-to-Multimodal Report Generation arXiv

(04 Aug 2026) TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering arXiv

(03 Aug 2026) Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs arXiv

(03 Aug 2026) VC-Tooler: Learning Compositional and Adaptive Visual Tool Use arXiv

(03 Aug 2026) SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models arXiv

(03 Aug 2026) Local Margin Restoration for Test-Time Adaptation of Vision-Language Models arXiv

(03 Aug 2026) MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving arXiv

(03 Aug 2026) CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning arXiv

(02 Aug 2026) It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling arXiv

(02 Aug 2026) Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning arXiv

(02 Aug 2026) Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models arXiv

(31 Jul 2026) Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models arXiv

(30 Jul 2026) Can Vision-Language Models Reason about AI Edits in Images? arXiv

(29 Jul 2026) FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing arXiv

(27 Jul 2026) Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding arXiv

(26 Jul 2026) Offline-Online Curriculum RL for Multimodal Reasoning arXiv

(26 Jul 2026) PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis arXiv

(25 Jul 2026) Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation arXiv

(24 Jul 2026) Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning arXiv

(23 Jul 2026) Visual Contrastive Self-Distillation arXiv

(23 Jul 2026) Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints arXiv

(22 Jul 2026) Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning arXiv

(21 Jul 2026) DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization arXiv

(21 Jul 2026) Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency arXiv

(19 Jul 2026) LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning arXiv

(18 Jul 2026) FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images arXiv

(17 Jul 2026) IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models arXiv

(17 Jul 2026) ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning arXiv

(17 Jul 2026) WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding arXiv

(16 Jul 2026) Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment arXiv

(15 Jul 2026) SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning arXiv

(15 Jul 2026) SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning arXiv

(14 Jul 2026) UniVR: Thinking in Visual Space for Unified Visual Reasoning arXiv

(14 Jul 2026) Visual Access Boundaries in Vision-Language Model Reasoning arXiv

(13 Jul 2026) SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning arXiv

(12 Jul 2026) Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs arXiv

(12 Jul 2026) When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion arXiv

(10 Jul 2026) Multimodal Reward Hacking in Reinforcement Learning arXiv

(08 Jul 2026) BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning arXiv

(07 Jul 2026) Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning arXiv

(05 Jul 2026) RL Forgets! Towards Continual Policy Optimization arXiv

(02 Jul 2026) Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning arXiv

(02 Jul 2026) DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation arXiv

(01 Jul 2026) VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning arXiv

(01 Jul 2026) GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision arXiv

(01 Jul 2026) Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning arXiv

(01 Jul 2026) Selective Test-Time Debiasing for CLIP via Reward Gating arXiv

(01 Jul 2026) ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models arXiv

(01 Jul 2026) DART-VLN: Test-Time Memory Decay and Anti-Loop Regularization for Discrete Vision-Language Navigation arXiv

(01 Jul 2026) ESC: Emotional Self-Correction for Reliable Vision-Language Models arXiv

(01 Jul 2026) H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation arXiv

(24 Jun 2026) V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning arXiv

(23 Jun 2026) PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought arXiv

(22 Jun 2026) CFPO: Counterfactual Policy Optimization for Multimodal Reasoning arXiv

(22 Jun 2026) VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct arXiv

(22 Jun 2026) Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views arXiv

(22 Jun 2026) AIR: Adaptive Interleaved Reasoning with Code in MLLMs arXiv

(18 Jun 2026) SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs arXiv

(16 Jun 2026) Enhancing Pathological VLMs with Cross-scale Reasoning arXiv

(16 Jun 2026) Reinforcing Dual-Path Reasoning in Spatial Vision Language Models arXiv

(16 Jun 2026) See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL arXiv

(15 Jun 2026) Thinking with Visual Grounding arXiv

(15 Jun 2026) DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models arXiv

(14 Jun 2026) NeRD: Neuro-Symbolic Rule Distillation for Efficient Ontology-Grounded Chain-of-Thought in Medical Image Diagnosis arXiv

(14 Jun 2026) Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning arXiv

(14 Jun 2026) SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks arXiv

(13 Jun 2026) Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities arXiv

(12 Jun 2026) CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment arXiv

(11 Jun 2026) Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding arXiv

(09 Jun 2026) Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts arXiv

(08 Jun 2026) CRANE: Knowledge Editing for Reasoning MLLMs arXiv

(08 Jun 2026) Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization arXiv

(06 Jun 2026) DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning arXiv

(05 Jun 2026) Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization arXiv

(03 Jun 2026) Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning arXiv

(03 Jun 2026) Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning arXiv

(02 Jun 2026) Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection arXiv

(02 Jun 2026) Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models arXiv

(02 Jun 2026) SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation arXiv

(19 May 2026) From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models arXiv

(19 May 2026) JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA arXiv

(18 May 2026) Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation arXiv

(18 May 2026) IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning arXiv

(17 May 2026) Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era arXiv

(16 May 2026) HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation arXiv

(14 May 2026) Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture arXiv

(13 May 2026) PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning arXiv

(13 May 2026) Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning arXiv

(13 May 2026) Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models arXiv

(12 May 2026) OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models arXiv

(12 May 2026) Composition of Memory Experts for Diffusion World Models arXiv

(10 May 2026) Reinforcing Multimodal Reasoning Against Visual Degradation arXiv

(10 May 2026) DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification arXiv

(10 May 2026) Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning arXiv

(10 May 2026) Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning arXiv

(10 May 2026) Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT arXiv

(08 May 2026) BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning arXiv

(08 May 2026) GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning arXiv

(04 May 2026) Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning arXiv

(03 May 2026) Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts arXiv

(02 May 2026) Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression arXiv

(01 May 2026) Structured Role-Aware Policy Optimization for Multimodal Reasoning arXiv

(01 May 2026) MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models arXiv

(30 Apr 2026) VeraRetouch: A Lightweight Fully Differentiable Framework for Multi-Task Reasoning Photo Retouching arXiv

(30 Apr 2026) Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL arXiv

(30 Apr 2026) WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning arXiv

(30 Apr 2026) Detecting is Easy, Adapting is Hard: Local Expert Growth for Visual Model-Based Reinforcement Learning under Distribution Shift arXiv

(30 Apr 2026) PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations arXiv

(30 Apr 2026) The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models arXiv

(29 Apr 2026) World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning arXiv

(29 Apr 2026) Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning arXiv

(29 Apr 2026) Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding arXiv

(28 Apr 2026) Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning arXiv

(28 Apr 2026) SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring arXiv

(27 Apr 2026) Improving Vision-language Models with Perception-centric Process Reward Models arXiv

(27 Apr 2026) See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection arXiv

(27 Apr 2026) PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model arXiv

(27 Apr 2026) VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions arXiv

(13 Apr 2026) POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs arXiv

(13 Apr 2026) CFMS: A Coarse-to-Fine Multimodal Synthesis Framework for Enhanced Tabular Reasoning arXiv

(13 Apr 2026) Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images arXiv

(10 Apr 2026) VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning arXiv

(10 Apr 2026) Visually-Guided Policy Optimization for Multimodal Reasoning arXiv

(09 Apr 2026) Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models arXiv

(09 Apr 2026) TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction arXiv

(09 Apr 2026) OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks arXiv

(09 Apr 2026) Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data arXiv

(09 Apr 2026) WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models arXiv

(09 Apr 2026) AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models arXiv

(08 Apr 2026) Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning arXiv

(07 Apr 2026) MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control arXiv

(07 Apr 2026) WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering arXiv

(07 Apr 2026) Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank arXiv

(06 Apr 2026) Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward arXiv

(05 Apr 2026) Belief-Aware VLM Model for Human-like Reasoning arXiv

(03 Apr 2026) Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models arXiv

(03 Apr 2026) Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models arXiv

(03 Apr 2026) CharTool: Tool-Integrated Visual Reasoning for Chart Understanding arXiv

(03 Apr 2026) FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation arXiv

(02 Apr 2026) Guideline2Graph: Profile-Aware Multimodal Parsing for Executable Clinical Decision Graphs arXiv

(02 Apr 2026) Impact of Multimodal and Conversational AI on Learning Outcomes and Experience arXiv

(02 Apr 2026) Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models arXiv

(02 Apr 2026) MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction arXiv

(01 Apr 2026) Vero: An Open RL Recipe for General Visual Reasoning arXiv

(01 Apr 2026) Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization arXiv

(01 Apr 2026) EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs arXiv

(01 Apr 2026) All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models arXiv

(30 Mar 2026) Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning arXiv

(30 Mar 2026) MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding arXiv

(30 Mar 2026) $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning arXiv

(29 Mar 2026) LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation arXiv

(29 Mar 2026) Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs arXiv

(28 Mar 2026) Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models arXiv

(28 Mar 2026) Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models arXiv

(27 Mar 2026) Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR arXiv

(26 Mar 2026) R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning arXiv

(26 Mar 2026) Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs arXiv

(24 Mar 2026) MedCausalX: Adaptive Causal Reasoning with Self-Reflection for Trustworthy Medical Vision-Language Models arXiv

(24 Mar 2026) Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought arXiv

(24 Mar 2026) GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning arXiv

(23 Mar 2026) Getting to the Point: Why Pointing Improves LVLMs arXiv

(23 Mar 2026) Rethinking Token Reduction for Large Vision-Language Models arXiv

(21 Mar 2026) Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning arXiv

(20 Mar 2026) One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment arXiv

(19 Mar 2026) Balanced Thinking: Improving Chain of Thought Training in Vision Language Models arXiv

(19 Mar 2026) TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation arXiv

(17 Mar 2026) HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning arXiv

(17 Mar 2026) DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models arXiv

(17 Mar 2026) The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models arXiv

(17 Mar 2026) Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning arXiv

(16 Mar 2026) Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing arXiv

(15 Mar 2026) On the Nature of Attention Sink that Shapes Decoding Strategy in MLLMs arXiv

(14 Mar 2026) Improving Visual Reasoning with Iterative Evidence Refinement arXiv

(12 Mar 2026) Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation arXiv

(10 Mar 2026) C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis arXiv

(10 Mar 2026) MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning arXiv

(10 Mar 2026) GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision arXiv

(09 Mar 2026) MJ1: Multimodal Judgment via Grounded Verification arXiv

(08 Mar 2026) Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models arXiv

(08 Mar 2026) Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models arXiv

(07 Mar 2026) Perception-Aware Multimodal Spatial Reasoning from Monocular Images arXiv

(06 Mar 2026) MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation arXiv

(06 Mar 2026) PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues arXiv

(06 Mar 2026) ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning arXiv

(05 Mar 2026) Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum arXiv

(04 Mar 2026) Phi-4-reasoning-vision-15B Technical Report arXiv

(04 Mar 2026) Discriminative Perception via Anchored Description for Reasoning Segmentation arXiv

(03 Mar 2026) TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval arXiv

(03 Mar 2026) SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety arXiv

(02 Mar 2026) Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine arXiv

(01 Mar 2026) Can Thinking Models Think to Detect Hateful Memes? arXiv

(01 Mar 2026) ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models arXiv

(01 Mar 2026) DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage arXiv

(01 Mar 2026) ICPRL: Acquiring Physical Intuition from Interactive Control arXiv

(28 Feb 2026) PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment arXiv

(27 Feb 2026) Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought arXiv

(27 Feb 2026) EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models arXiv

(27 Feb 2026) Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning arXiv

(27 Feb 2026) Toward Guarantees for Clinical Reasoning in Vision Language Models via Formal Verification arXiv

(27 Feb 2026) Reasoning-Driven Multimodal LLM for Domain Generalization arXiv

(26 Feb 2026) MediX-R1: Open Ended Medical Reinforcement Learning arXiv

(25 Feb 2026) MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving arXiv

(25 Feb 2026) See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs arXiv

(25 Feb 2026) RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning arXiv

(24 Feb 2026) Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking arXiv

(23 Feb 2026) TextShield-R1: Reinforced Reasoning for Tampered Text Detection arXiv

(23 Feb 2026) Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking arXiv

(19 Feb 2026) Enabling Training-Free Text-Based Remote Sensing Segmentation arXiv

(18 Feb 2026) Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning arXiv

(17 Feb 2026) Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families arXiv

(17 Feb 2026) On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks arXiv

(16 Feb 2026) Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning arXiv

(16 Feb 2026) TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning arXiv

(15 Feb 2026) ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization arXiv

(15 Feb 2026) GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery arXiv

(14 Feb 2026) Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings arXiv

(13 Feb 2026) Reliable Thinking with Images arXiv

(13 Feb 2026) Thinking Like a Radiologist: A Dataset for Anatomy-Guided Interleaved Vision Language Reasoning in Chest X-ray Interpretation arXiv

(12 Feb 2026) Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning arXiv

(11 Feb 2026) Canvas-of-Thought: Grounding Reasoning via Mutable Structured States arXiv

(10 Feb 2026) Bridging Efficiency and Transparency: Explainable CoT Compression in Multimodal Large Reasoning Models arXiv

(10 Feb 2026) Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension arXiv

(10 Feb 2026) GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation arXiv

(09 Feb 2026) AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection arXiv

(09 Feb 2026) Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs arXiv

(09 Feb 2026) When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning arXiv

(07 Feb 2026) Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning arXiv

(06 Feb 2026) MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images arXiv

(06 Feb 2026) SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs arXiv

(05 Feb 2026) Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR arXiv

(05 Feb 2026) Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning arXiv

(04 Feb 2026) Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision arXiv

(04 Feb 2026) Training Data Efficiency in Multimodal Process Reward Models arXiv

(03 Feb 2026) Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance arXiv

(02 Feb 2026) Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling arXiv

(02 Feb 2026) VLM-Guided Experience Replay arXiv

(02 Feb 2026) ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning arXiv

(02 Feb 2026) Multimodal Large Language Models for Real-Time Situated Reasoning arXiv

(01 Feb 2026) StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating arXiv

(01 Feb 2026) Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis arXiv

(01 Feb 2026) SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning arXiv

(31 Jan 2026) RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding arXiv

(29 Jan 2026) MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods arXiv

(28 Jan 2026) MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models arXiv

(27 Jan 2026) Innovator-VL: A Multimodal Large Language Model for Scientific Discovery arXiv

(26 Jan 2026) AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning arXiv

(22 Jan 2026) Explainable Deepfake Detection with RL Enhanced Self-Blended Images arXiv

(20 Jan 2026) Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring arXiv

(19 Jan 2026) Think3D: Thinking with Space for Spatial Reasoning arXiv

(16 Jan 2026) MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement arXiv

(12 Jan 2026) CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation arXiv

(12 Jan 2026) MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning arXiv

(11 Jan 2026) E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis arXiv

(11 Jan 2026) Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy arXiv

(09 Jan 2026) SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More arXiv

(08 Jan 2026) Agri-R1: Agricultural Reasoning for Disease Diagnosis via Automated-Synthesis and Reinforcement Learning arXiv

(06 Jan 2026) ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing arXiv

(06 Jan 2026) Towards Faithful Reasoning in Comics for Small MLLMs arXiv

(06 Jan 2026) Aligning Findings with Diagnosis: A Self-Consistent Reinforcement Learning Framework for Trustworthy Radiology Reporting arXiv

(01 Jan 2026) CPPO: Contrastive Perception for Vision Language Policy Optimization arXiv

(01 Jan 2026) From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning arXiv

(31 Dec 2025) From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme arXiv

(22 Dec 2025) Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection arXiv

(22 Dec 2025) CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning arXiv

(22 Dec 2025) Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation arXiv

(22 Dec 2025) SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models arXiv

(20 Dec 2025) Stable and Efficient Single-Rollout RL for Multimodal Reasoning arXiv

(19 Dec 2025) Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images arXiv

(19 Dec 2025) Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding arXiv

(18 Dec 2025) AdaTooler-V: Adaptive Tool-Use for Images and Videos arXiv

(16 Dec 2025) Incentivizing Tool-augmented Thinking with Images for Medical Image Analysis arXiv

(16 Dec 2025) ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking arXiv

(16 Dec 2025) OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving arXiv

(13 Dec 2025) More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models arXiv

(13 Dec 2025) Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking arXiv

(12 Dec 2025) DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry arXiv

(08 Dec 2025) MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning arXiv

(07 Dec 2025) Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning arXiv

(07 Dec 2025) The Role of Entropy in Visual Grounding: Analysis and Optimization arXiv

(06 Dec 2025) ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models arXiv

(03 Dec 2025) TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning arXiv

(03 Dec 2025) Thinking with Programming Vision: Towards a Unified View for Thinking with Images arXiv

(03 Dec 2025) Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning arXiv

(02 Dec 2025) See, Think, Learn: A Self-Taught Multimodal Reasoner arXiv

(29 Nov 2025) ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning arXiv

(28 Nov 2025) TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM arXiv

(27 Nov 2025) GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes arXiv

(24 Nov 2025) Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning arXiv

(23 Nov 2025) Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning arXiv

(22 Nov 2025) PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning arXiv

(21 Nov 2025) VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning arXiv

(21 Nov 2025) ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better arXiv

(20 Nov 2025) OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe arXiv

(19 Nov 2025) VisPlay: Self-Evolving Vision-Language Models from Images arXiv

(17 Nov 2025) Video Finetuning Improves Reasoning Between Frames arXiv

(17 Nov 2025) From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models arXiv

(17 Nov 2025) SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization arXiv

(14 Nov 2025) Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions arXiv

(11 Nov 2025) From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training arXiv

(10 Nov 2025) Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View arXiv

(07 Nov 2025) PreResQ-R1: Towards Fine-Grained Rank-and-Score Reinforcement Learning for Visual Quality Assessment via Preference-Response Disentangled Policy Optimization arXiv

(04 Nov 2025) ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension arXiv

(04 Nov 2025) SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning arXiv

(01 Nov 2025) UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings arXiv

(01 Nov 2025) Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning arXiv

(31 Oct 2025) Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning arXiv

(23 Oct 2025) Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning arXiv

(23 Oct 2025) Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation arXiv

(18 Oct 2025) RL makes MLLMs see better than SFT arXiv

(16 Oct 2025) MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning arXiv

(15 Oct 2025) Generative Universal Verifier as Multimodal Meta-Reasoner arXiv

(14 Oct 2025) HoneyBee: Data Recipes for Vision-Language Reasoners arXiv

(14 Oct 2025) DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search arXiv

(13 Oct 2025) CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images arXiv

(10 Oct 2025) Unleashing Perception-Time Scaling to Multimodal Reasoning Models arXiv

(10 Oct 2025) Spotlight on Token Perception for Multimodal Reinforcement Learning arXiv

(10 Oct 2025) Tiny-R1V: Lightweight Multimodal Unified Reasoning Model via Model Merging arXiv

(9 Oct 2025) ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping arXiv

(9 Oct 2025) SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models arXiv

(6 Oct 2025) Beyond Monolithic Rewards: A Hybrid and Multi-Aspect Reward Optimization for MLLM Alignment arXiv

(3 Oct 2025) Efficient Test-Time Scaling for Small Vision-Language Models arXiv

(29 Sep 2025) Latent Visual Reasoning arXiv

(29 Sep 2025) GeoVLM-R1: Reinforcement Fine-Tuning for Improved Remote Sensing Reasoning arXiv

(29 Sep 2025) VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding arXiv

(29 Sep 2025) Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks arXiv

(28 Sep 2025) Poivre: Self-Refining Visual Pointing with Reinforcement Learning arXiv

(27 Sep 2025) Decoupling Reasoning and Perception: An LLM-LMM Framework for Faithful Visual Reasoning arXiv

(25 Sep 2025) MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources arXiv

(12 Sep 2025) LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA arXiv

(9 Sep 2025) Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search arXiv

(28 Aug 2025) R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning arXiv

(27 Aug 2025) Self-Rewarding Vision-Language Model via Reasoning Decomposition arXiv

(18 Aug 2025) M3PO: Multimodal-Model-Guided Preference Optimization for Visual Instruction Following arXiv

(18 Aug 2025) Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation arXiv

(18 Aug 2025) Ovis2.5 Technical Report arXiv

(18 Aug 2025) MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models arXiv

(8 Aug 2025) SIFThinker: Spatially-Aware Image Focus for Visual Reasoning arXiv

(7 Aug 2025) Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision arXiv

(7 Aug 2025) StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models arXiv

(5 Aug 2025) Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions arXiv

(30 Jul 2025) MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention arXiv

(28 Jul 2025) Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback arXiv

(24 Jul 2025) MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning arXiv

(24 Jul 2025) SafeWork-R1: Coevolving Safety and Intelligence under the AI-45 Law arXiv

(22 Jul 2025) C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning arXiv

(22 Jul 2025) Semi-off-Policy Reinforcement Learning for Vision-Language Slow-thinking Reasoning arXiv

(11 Jul 2025) M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning arXiv

(3 Jul 2025) Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation arXiv

(1 Jul 2025) GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning arXiv

(20 Jun 2025) GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning arXiv

(16 Jun 2025) Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning arXiv

(11 Jun 2025) ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs arXiv

(5 Jun 2025) Perceptual Decoupling for Scalable Multi-modal Reasoning via Reward-Optimized Captioning arXiv

(5 Jun 2025) MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning arXiv

(16 May 2025) Visual Planning: Let's Think Only with Images arXiv

(15 May 2025) MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning arXiv

(13 May 2025) OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning arXiv

(12 May 2025) Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning arXiv

(8 May 2025) Bring Reason to Vision: Understanding Perception and Reasoning through Model Merging arXiv

(08 May 2025) SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models arXiv

(6 May 2025) X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains arXiv

(6 May 2025) Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning arXiv

(6 May 2025) ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant arXiv

(5 May 2025) R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning arXiv

(28 Apr 2025) SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning arXiv

(25 Apr 2025) Fast-Slow Thinking for Large Vision-Language Model Reasoning arXiv

(25 Apr 2025) Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization arXiv

(25 Apr 2025) Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning arXiv

(21 Apr 2025) A Call for New Recipes to Enhance Spatial Reasoning in MLLMs arXiv

(20 Apr 2025) Relation-R1: Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relational Comprehension arXiv

(12 Apr 2025) VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search arXiv

(10 Apr 2025) VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model arXiv

(10 Apr 2025) SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement arXiv

(10 Apr 2025) Perception-R1: Pioneering Perception Policy with Reinforcement Learning arXiv

(10 Apr 2025) Kimi-VL Technical Report arXiv

(8 Apr 2025) On the Suitability of Reinforcement Fine-Tuning to Visual Tasks arXiv

(8 Apr 2025) Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought arXiv

(1 Apr 2025) Improved Visual-Spatial Reasoning via R1-Zero-Like Training arXiv

(17 Mar 2025) R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization arXiv

(13 Mar 2025) VisualPRM: An Effective Process Reward Model for Multimodal Reasoning arXiv

(9 Mar 2025) Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models arXiv

(7 Mar 2025) R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning arXiv

(7 Mar 2025) Unified Reward Model for Multimodal Understanding and Generation arXiv

(7 Mar 2025) R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model arXiv

(3 Mar 2025) Visual-RFT: Visual Reinforcement Fine-Tuning arXiv

(4 Feb 2025) Boosting Multimodal Reasoning with MCTS-Automated Structured Thinking arXiv

(13 Jan 2025) Imagine while Reasoning in Space: Multimodal Visualization-of-Thought arXiv

(10 Jan 2025) LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs arXiv

(9 Jan 2025) Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark arXiv

(3 Jan 2025) Virgo: A Preliminary Exploration on Reproducing o1-like MLLM arXiv

(30 Dec 2024) Slow Perception: Let's Perceive Geometric Figures Step-by-step arXiv

(19 Dec 2024) Progressive Multimodal Reasoning via Active Retrieval arXiv

(29 Nov 2024) Interleaved-Modal Chain-of-Thought arXiv

(15 Nov 2024) Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination arXiv

(15 Nov 2024) LLaVA-CoT: Let Vision Language Models Reason Step-by-Step arXiv

(30 Oct 2024) Vision-Language Models Can Self-Improve Reasoning via Reflection arXiv

(23 Oct 2024) R-CoT: Reverse Chain-of-Thought Problem Generation for Geometric Reasoning in Large Multimodal Models arXiv

(21 Oct 2024) Improve Vision Language Model Chain-of-thought Reasoning arXiv

(11 Oct 2024) M3Hop-CoT: Misogynous Meme Identification with Multimodal Multi-hop Chain-of-Thought arXiv

(6 Oct 2024) MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration arXiv

(4 Oct 2024) Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning arXiv

(13 Jun 2024) Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models arXiv

(28 Dec 2023) Grounding-Prompter: Prompting LLM with Multimodal Information for Temporal Sentence Grounding in Long Videos arXiv

(14 Dec 2023) Multi-modal Latent Space Learning for Chain-of-Thought Reasoning in Language Models arXiv

(27 Nov 2023) Compositional Chain-of-Thought Prompting for Large Multimodal Models arXiv

(15 Nov 2023) The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task arXiv

(3 May 2023) Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings arXiv

(16 Apr 2023) Chain of Thought Prompt Tuning in Vision Language Models arXiv

(2 Feb 2023) Multimodal Chain-of-Thought Reasoning in Language Models arXiv

Agent

(09 Sep 2026) Cost-Aware Vision--Language Model Arbitration for Fabric Structure Recognition A Deployable Multi-Agent System arXiv

(09 Sep 2026) VLX-VR: An Agentic-Aware Video Reasoning Model arXiv

(09 Sep 2026) Who Are They to Each Other? Multi-Agent Reasoning for Speaker Relationship Inference arXiv

(09 Sep 2026) SpeechAnnotator: A Context-Aware Multi-Agent Framework and Benchmark for Multidimensional Speech Annotation arXiv

(08 Sep 2026) An Experimental Evaluation of Multimodal Prompt Injection Attacks on Agentic AI Frameworks arXiv

(07 Sep 2026) Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning arXiv

(07 Sep 2026) PhysMAS: Physics-Grounded Multi-Agent Synthesis of Compositional 4D Gaussians arXiv

(06 Sep 2026) 3DHarnessBench: Probing Agentic 3D-to-Code Capabilities of Frontier Vision-Language Models arXiv

(04 Sep 2026) CUSP: Decomposable Collective Uncertainty for Multi-Agent Multimodal Reasoning arXiv

(03 Sep 2026) WorldReward: Reward Modeling for Camera-Conditioned World Models arXiv

(03 Sep 2026) StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios arXiv

(03 Sep 2026) LLM-Aided Design for Manufacturing: A Multi-Agent System for Intent-Preserving Redesign of CAD for Improved Manufacturability arXiv

(03 Sep 2026) Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models arXiv

(03 Sep 2026) ICM-Bench: Person-Level Identity Reasoning in Multimodal Agents with Long-Term Memory arXiv

(02 Sep 2026) SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models arXiv

(02 Sep 2026) PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment arXiv

(01 Sep 2026) Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers arXiv

(01 Sep 2026) Agentic Multimodal Models for Environmental Hyperspectral Unmixing arXiv

(01 Sep 2026) InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations arXiv

(31 Aug 2026) CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework arXiv

(30 Aug 2026) FRAMEWORKERS: A Dynamic Multi-Agent Framework for AI-Generated Video Production arXiv

(30 Aug 2026) Off-Manifold Refinement: Guiding Video Generators with a Frozen World Model arXiv

(30 Aug 2026) When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents arXiv

(29 Aug 2026) LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO arXiv

(28 Aug 2026) See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs arXiv

(27 Aug 2026) WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning arXiv

(26 Aug 2026) VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following arXiv

(26 Aug 2026) SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning arXiv

(25 Aug 2026) Task-Adaptive Rubrics for GUI Reward Modeling arXiv

(25 Aug 2026) DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton arXiv

(25 Aug 2026) Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs arXiv

(25 Aug 2026) Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning arXiv

(25 Aug 2026) Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments arXiv

(24 Aug 2026) GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis arXiv

(24 Aug 2026) Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner arXiv

(24 Aug 2026) Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents arXiv

(22 Aug 2026) BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications arXiv

(22 Aug 2026) MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning arXiv

(22 Aug 2026) Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents arXiv

(19 Aug 2026) EVADE: Evidence-Verified Agentic Diagnosis with Escape arXiv

(19 Aug 2026) DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning arXiv

(18 Aug 2026) Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL arXiv

(18 Aug 2026) Structural Plan-to-Model Conversion with Deterministic Geometry and Guarded Agentic Vision-Language Refinement arXiv

(18 Aug 2026) DeAR: Decentralized Agentic Reasoning via Capability Grounding and Collaborative Thought Navigation arXiv

(17 Aug 2026) ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning arXiv

(15 Aug 2026) VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? arXiv

(15 Aug 2026) SCOPE: Score-Isolated Agentic Optimization for Video World Models arXiv

(14 Aug 2026) MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning arXiv

(14 Aug 2026) Wyvern: An Agentic Framework for Generating Grounded Multimodal Reports arXiv

(14 Aug 2026) MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning arXiv

(13 Aug 2026) Intern-S2-Preview: Scientific Agentic Foundation Model arXiv

(11 Aug 2026) MIRA: Medical Image Reflection for Agentic Diagnosis arXiv

(11 Aug 2026) Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation arXiv

(08 Aug 2026) SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning arXiv

(07 Aug 2026) Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning arXiv

(06 Aug 2026) The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents arXiv

(06 Aug 2026) AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents arXiv

(04 Aug 2026) Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents arXiv

(04 Aug 2026) AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding arXiv

(01 Aug 2026) DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning arXiv

(31 Jul 2026) Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning arXiv

(28 Jul 2026) ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning arXiv

(23 Jul 2026) EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization arXiv

(17 Jul 2026) Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA arXiv

(14 Jul 2026) A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism arXiv

(14 Jul 2026) ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning arXiv

(14 Jul 2026) EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval arXiv

(13 Jul 2026) The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy arXiv

(07 Jul 2026) EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents arXiv

(03 Jul 2026) VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning arXiv

(18 Jun 2026) MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization arXiv

(15 Jun 2026) Context-Aware RL for Agentic and Multimodal LLMs arXiv

(10 Jun 2026) IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents arXiv

(10 Jun 2026) MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning arXiv

(10 Jun 2026) Orchestra-o1: Omnimodal Agent Orchestration arXiv

(05 Jun 2026) StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents arXiv

(04 Jun 2026) AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents arXiv

(04 Jun 2026) TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents arXiv

(04 Jun 2026) Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators arXiv

(01 Jun 2026) OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents arXiv

(19 May 2026) ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning arXiv

(19 May 2026) ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning arXiv

(18 May 2026) AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents arXiv

(18 May 2026) GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents arXiv

(18 May 2026) An Efficient Streaming Video Understanding Framework with Agentic Control arXiv

(16 May 2026) OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics arXiv

(14 May 2026) ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both arXiv

(13 May 2026) ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows arXiv

(10 May 2026) Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning arXiv

(08 May 2026) HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents arXiv

(08 May 2026) LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning arXiv

(08 May 2026) Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning arXiv

(07 May 2026) A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency arXiv

(05 May 2026) What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity arXiv

(01 May 2026) Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding arXiv

(30 Apr 2026) Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation arXiv

(30 Apr 2026) MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection arXiv

(30 Apr 2026) GUI Agents with Reinforcement Learning: Toward Digital Inhabitants arXiv

(29 Apr 2026) GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents arXiv

(28 Apr 2026) Benchmarking and Improving GUI Agents in High-Dynamic Environments arXiv

(27 Apr 2026) Agentic AI for Remote Sensing: Technical Challenges and Research Directions arXiv

(25 Apr 2026) SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing arXiv

(13 Apr 2026) Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games arXiv

(13 Apr 2026) Dialectic-Med: Mitigating Diagnostic Hallucinations via Counterfactual Adversarial Multi-Agent Debate arXiv

(10 Apr 2026) Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents arXiv

(10 Apr 2026) ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning arXiv

(09 Apr 2026) RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs arXiv

(09 Apr 2026) MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning arXiv

(08 Apr 2026) Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization arXiv

(07 Apr 2026) Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction arXiv

(29 Mar 2026) MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences arXiv

(27 Mar 2026) Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives arXiv

(24 Mar 2026) EVA: Efficient Reinforcement Learning for End-to-End Video Agent arXiv

(17 Mar 2026) PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning arXiv

(17 Mar 2026) OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials arXiv

(16 Mar 2026) MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings arXiv

(03 Mar 2026) Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling arXiv

(26 Feb 2026) FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning arXiv

(26 Feb 2026) CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays arXiv

(19 Feb 2026) RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward arXiv

(14 Feb 2026) Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization arXiv

(05 Feb 2026) V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval arXiv

(26 Jan 2026) GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning arXiv

(30 Dec 2025) SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning arXiv

(23 Dec 2025) CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation arXiv

(21 Dec 2025) Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback arXiv

(09 Dec 2025) Thinking with Images via Self-Calling Agent arXiv

(06 Dec 2025) VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning arXiv

(03 Dec 2025) Multimodal Reinforcement Learning with Agentic Verifier for AI Agents arXiv

(26 Nov 2025) OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection arXiv

(25 Nov 2025) VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis arXiv

(24 Nov 2025) VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning arXiv

(17 Nov 2025) DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning arXiv

(12 Nov 2025) History-Aware Reasoning for GUI Agents arXiv

(31 Oct 2025) GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation arXiv

(2 Dec 2024) Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation arXiv

Embodied / Robotics

(09 Sep 2026) HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy arXiv

(08 Sep 2026) CLAMP: Constrained Decoding for Vision-Language Embodied Planning arXiv

(08 Sep 2026) WorldAgen: Unified State-Action Prediction with Test-Time World Model Training arXiv

(08 Sep 2026) CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot Manipulation arXiv

(08 Sep 2026) Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic Method arXiv

(07 Sep 2026) Phase-and-First-Arrival VLM Feedback for Sparse-Reward Reinforcement Learning in Surgical Manipulation arXiv

(07 Sep 2026) Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models arXiv

(07 Sep 2026) Dex-X: Learning Visual-Tactile Dexterous Manipulation From Human Videos with Simulated Interaction arXiv

(05 Sep 2026) FACT: A Forensic Agent with Compiled Tool-Use Trajectories for AI-Generated Image Detection arXiv

(05 Sep 2026) MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control arXiv

(05 Sep 2026) CST-WM: A Causally Structured World Model for Embodied Visual Tracking arXiv

(05 Sep 2026) Learning Counterfactual World Models for Embodied Reasoning under Partial Observability arXiv

(04 Sep 2026) Reasoning Without Inference Cost: Latent Semantic Scaffolding for Robot VLA Policies arXiv

(04 Sep 2026) Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models arXiv

(04 Sep 2026) Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation arXiv

(03 Sep 2026) VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models arXiv

(03 Sep 2026) ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection arXiv

(03 Sep 2026) Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models arXiv

(03 Sep 2026) WISE: World-model-guided Imagination Scheduling for Efficient Post-training of Vision-Language-Action Models arXiv

(03 Sep 2026) Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving arXiv

(30 Aug 2026) SymVD: Symmetric Vision Language Action Distillation for Robot Manipulation arXiv

(27 Aug 2026) Diffusion Policies for Short-Horizon Planning in Robot Crowd Navigation arXiv

(27 Aug 2026) Decoupling Planning and Control for Instructable Agents arXiv

(27 Aug 2026) Embodied Scene Rearrangement Planning arXiv

(26 Aug 2026) Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning arXiv

(26 Aug 2026) $R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning arXiv

(25 Aug 2026) GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model arXiv

(25 Aug 2026) TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks arXiv

(24 Aug 2026) OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation arXiv

(24 Aug 2026) Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models arXiv

(22 Aug 2026) Decoupled Physical Modeling and Execution for Physics Reasoning arXiv

(22 Aug 2026) CounterAlign: Counterfactual Supervision for Vision-Language-Action Models arXiv

(18 Aug 2026) Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups arXiv

(18 Aug 2026) Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation arXiv

(17 Aug 2026) FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences arXiv

(17 Aug 2026) PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents arXiv

(17 Aug 2026) Inference-Time Attention Steering for Vision-Language-Action Driving Models arXiv

(17 Aug 2026) Planner-Conditioned Diffusion for Coordinated Multi-Agent Exploration arXiv

(17 Aug 2026) HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL arXiv

(17 Aug 2026) $τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation arXiv

(16 Aug 2026) Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation arXiv

(14 Aug 2026) Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models arXiv

(21 Jul 2026) No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation arXiv

(24 Jun 2026) RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards arXiv

(12 Apr 2026) A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning arXiv

(30 Mar 2026) SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning arXiv

(22 Mar 2026) RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models arXiv

(16 Mar 2026) From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation arXiv

(24 Feb 2026) HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning arXiv

(18 Feb 2026) Peeking Ahead of the Field Study: Exploring VLM Personas as Support Tools for Embodied Studies in HCI arXiv

(16 Feb 2026) Ground-Truth Depth in Vision Language Models: Spatial Context Understanding in Conversational AI for XR-Robotic Support in Emergency First Response arXiv

(07 Feb 2026) VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation arXiv

(16 Jan 2026) ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models arXiv

(02 Jan 2026) RoboReward: General-Purpose Vision-Language Reward Models for Robotics arXiv

(21 Dec 2025) ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning arXiv

(28 Nov 2025) Video-CoM: Interactive Video Reasoning via Chain of Manipulations arXiv

(13 Nov 2025) AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models arXiv

Video

(08 Sep 2026) Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding arXiv

(08 Sep 2026) Human-Centric Image Captioning with Subject-Centered Spatial Understanding arXiv

(07 Sep 2026) CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation arXiv

(07 Sep 2026) Ambient @ EgoLongQA 2026: Distilling Long-Video perception into a Sub-2B Model arXiv

(07 Sep 2026) Beyond Sparse Rewards: A New Benchmark and Structure-Aware Graph Alignment for Micro-Drama Understanding arXiv

(06 Sep 2026) Thinking with Cameras: Active Visual Reasoning via Dynamic Viewpoint Control for Surveillance Video Understanding arXiv

(06 Sep 2026) Visual Search Augmented Chain-of-Thought Reasoning for Attribute Value Extraction from Product Videos arXiv

(03 Sep 2026) Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision arXiv

(03 Sep 2026) LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL arXiv

(03 Sep 2026) Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning arXiv

(01 Sep 2026) Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models arXiv

(01 Sep 2026) TempCloze: Can Video-LLMs Identify the Missing Middle? arXiv

(29 Aug 2026) Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling arXiv

(28 Aug 2026) StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models arXiv

(28 Aug 2026) Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models arXiv

(27 Aug 2026) Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models arXiv

(27 Aug 2026) Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs arXiv

(27 Aug 2026) Video-FLAIR: Not Whether to Reason, But How arXiv

(27 Aug 2026) Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection arXiv

(26 Aug 2026) Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding arXiv

(26 Aug 2026) VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning arXiv

(26 Aug 2026) AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research arXiv

(26 Aug 2026) LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding arXiv

(25 Aug 2026) PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos arXiv

(24 Aug 2026) Scaling Reinforcement Learning for Diffusion Models via Velocity Matching arXiv

(23 Aug 2026) Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting arXiv

(21 Aug 2026) COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models arXiv

(21 Aug 2026) Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision arXiv

(21 Aug 2026) TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming arXiv

(20 Aug 2026) Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs arXiv

(19 Aug 2026) StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos arXiv

(19 Aug 2026) CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes arXiv

(19 Aug 2026) CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios arXiv

(18 Aug 2026) TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs arXiv

(17 Aug 2026) Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning arXiv

(17 Aug 2026) Contrastive Energy Fields for Inference-Time Procedure Planning in Instructional Videos arXiv

(17 Aug 2026) StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding arXiv

(17 Aug 2026) RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning arXiv

(17 Aug 2026) CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated? arXiv

(16 Aug 2026) Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning arXiv

(16 Aug 2026) CrossView: Can Vision-Language Models Reason Across Cameras? arXiv

(16 Aug 2026) Sequential Multimodal Evidence Optimization for Product Media Ranking in E-Commerce arXiv

(14 Aug 2026) Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition arXiv

(14 Aug 2026) OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation arXiv

(14 Aug 2026) InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors arXiv

(14 Aug 2026) Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training arXiv

(12 Aug 2026) SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward arXiv

(10 Aug 2026) CodecArena: Codec Quality Assessment via Visual Reinforcement Learning arXiv

(10 Aug 2026) Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models arXiv

(05 Aug 2026) PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning arXiv

(05 Aug 2026) WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models arXiv

(05 Aug 2026) HelloWorld: Enabling Socially Interactive Characters in Video World Models arXiv

(04 Aug 2026) Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering arXiv

(03 Aug 2026) AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning arXiv

(02 Aug 2026) MiniWorld: Democratizing the Training of Video World Models from Scratch arXiv

(28 Jul 2026) Wonder: Video World Model Done Better arXiv

(27 Jul 2026) CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding arXiv

(27 Jul 2026) Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts arXiv

(11 Jul 2026) Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset arXiv

(06 Jul 2026) TimeThink: Reasoning with Time for Video LLMs arXiv

(06 Jul 2026) Claim-Level Rubric Rewards for Video Caption Reinforcement Learning arXiv

(02 Jul 2026) Rank-Then-Act: Reward-Free Control from Frame-Order Progress arXiv

(01 Jul 2026) VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement arXiv

(01 Jul 2026) Linguistic Relative Policy Optimization for Video Anomaly Reasoning arXiv

(01 Jul 2026) EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection arXiv

(01 Jul 2026) Latent Visual Cache for Video Reasoning arXiv

(23 Jun 2026) SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards arXiv

(20 Jun 2026) When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR arXiv

(18 Jun 2026) CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs arXiv

(17 Jun 2026) Native Active Perception as Reasoning for Omni-Modal Understanding arXiv

(16 Jun 2026) Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs arXiv

(10 Jun 2026) AVIS: Adaptive Test-Time Scaling for Vision-Language Models arXiv

(10 Jun 2026) Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding arXiv

(10 Jun 2026) InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning arXiv

(08 Jun 2026) Temporal-Aware Reasoning Optimization for Video Temporal Grounding arXiv

(08 Jun 2026) CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning arXiv

(07 Jun 2026) CACR:Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning arXiv

(05 Jun 2026) VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation arXiv

(04 Jun 2026) Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction arXiv

(04 Jun 2026) ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE arXiv

(03 Jun 2026) VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding arXiv

(02 Jun 2026) Reinforcement Learning from Cross-domain Videos with Video Prediction Model arXiv

(02 Jun 2026) Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching arXiv

(19 May 2026) RECIPE: Procedural Planning via Grounding in Instructional Video arXiv

(18 May 2026) Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency arXiv

(15 May 2026) Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization arXiv

(14 May 2026) KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration arXiv

(14 May 2026) RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO arXiv

(14 May 2026) Video Models Can Reason with Verifiable Rewards arXiv

(13 May 2026) AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation arXiv

(12 May 2026) CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating arXiv

(11 May 2026) GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs arXiv

(08 May 2026) RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation arXiv

(08 May 2026) Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models arXiv

(07 May 2026) Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling arXiv

(07 May 2026) VISD: Enhancing Video Reasoning via Structured Self-Distillation arXiv

(06 May 2026) Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing arXiv

(03 May 2026) Act2See: Emergent Active Visual Perception for Video Reasoning arXiv

(02 May 2026) Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs arXiv

(01 May 2026) AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in Unified Multimodal Models via Decompositional Verifiable Reward arXiv

(01 May 2026) Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning arXiv

(30 Apr 2026) Generate Your Talking Avatar from Video Reference arXiv

(30 Apr 2026) AesRM: Improving Video Aesthetics with Expert-Level Feedback arXiv

(29 Apr 2026) DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation arXiv

(28 Apr 2026) OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding arXiv

(28 Apr 2026) MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding arXiv

(26 Apr 2026) Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference arXiv

(25 Apr 2026) UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks arXiv

(25 Apr 2026) StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning arXiv

(25 Apr 2026) EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs arXiv

(13 Apr 2026) Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding arXiv

(01 Apr 2026) Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs arXiv

(28 Mar 2026) Incentivizing Temporal-Awareness in Egocentric Video Understanding Models arXiv

(27 Mar 2026) Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning arXiv

(26 Mar 2026) VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning arXiv

(26 Mar 2026) Reinforcing Structured Chain-of-Thought for Video Understanding arXiv

(17 Mar 2026) When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition arXiv

(12 Mar 2026) Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models arXiv

(19 Feb 2026) GraphThinker: Reinforcing Video Reasoning with Event Graph Thinking arXiv

(12 Feb 2026) STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning arXiv

(30 Jan 2026) Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning arXiv

(28 Jan 2026) Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning arXiv

(27 Jan 2026) Video-KTR: Reinforcing Video Reasoning via Key Token Attribution arXiv

(08 Jan 2026) VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice arXiv

(07 Dec 2025) MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning arXiv

(02 Dec 2025) OneThinker: All-in-one Reasoning Model for Image and Video arXiv

(17 Nov 2025) ViSS-R1: Self-Supervised Reinforcement Video Reasoning arXiv

(23 Oct 2025) Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence arXiv

(9 Oct 2025) SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models arXiv

(06 Oct 2025) Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models arXiv

(5 Oct 2025) Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning arXiv

(29 Sep 2025) FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting arXiv

(29 Sep 2025) LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning arXiv

(28 Sep 2025) FrameMind: Frame-Interleaved Chain-of-Thought for Video Reasoning via Reinforcement Learning arXiv

(12 Jun 2025) CogStream: Context-guided Streaming Video Question Answering arXiv

(6 Jun 2025) VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning arXiv

(27 Mar 2025) Video-R1: Reinforcing Video Reasoning in MLLMs arXiv

(17 Feb 2025) video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model arXiv

(10 Feb 2025) CoS: Chain-of-Shot Prompting for Long Video Understanding arXiv

(8 Jan 2025) Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs arXiv

(3 Dec 2024) VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation arXiv

(29 Nov 2024) STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training arXiv

(12 Oct 2024) Interpretable Video based Stress Detection with Self-Refine Chain-of-thought Reasoning arXiv

(8 Oct 2024) Temporal Reasoning Transfer from Text to Video. arXiv

(27 Sep 2024) Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks arXiv

(28 Aug 2024) Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation arXiv

(24 May 2024) Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models arXiv

(7 May 2024) Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. arXiv code

DLLM

(06 Sep 2026) A Ticket from Marginals to Joints: Coupled-Noise Distillation for One-Step Block Generation in Diffusion Language Models arXiv

(03 Sep 2026) Unlocking Lossless Speedups in LLMs via Discrete Diffusion arXiv

(03 Sep 2026) Distilled Continuous Diffusion Language Models Can Write Code in Few Steps---or One arXiv

(26 Aug 2026) Prefix-Denoising Consistency: Test-Time Verification for Diffusion Language Models arXiv

(24 Aug 2026) SelFusion: Self-distillation for Diffusion Language Models arXiv

(20 Aug 2026) Discrete Diffusion Inference-Time Control with Nested Sequential Monte Carlo arXiv

(06 Aug 2026) Answer First, Reason Later: Commitment Order in Diffusion LLMs arXiv

(03 Aug 2026) Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models arXiv

(03 Aug 2026) OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models arXiv

(01 Aug 2026) Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs arXiv

(18 Jul 2026) Trace-Based On-Policy Distillation for Masked Diffusion Language Models arXiv

(16 Jul 2026) A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models arXiv

(16 Jul 2026) Mask-Aware Policy Gradients for Diffusion Language Models arXiv

(05 Jul 2026) dOPSD: On-Policy Self-Distillation for Diffusion Language Models arXiv

(01 Jul 2026) Diffusion-GR2: Diffusion Generative Reasoning Re-ranker arXiv

(16 Jun 2026) Learning from the Self-future: On-policy Self-distillation for dLLMs arXiv code

(11 Jun 2026) DiPOD: Diffusion Policy Optimization without Drifting Apart arXiv

(07 Jun 2026) Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models arXiv

(03 Jun 2026) Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models arXiv

(12 May 2026) Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models arXiv

(11 May 2026) Relative Score Policy Optimization for Diffusion Language Models arXiv

(08 May 2026) DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models arXiv

(04 May 2026) Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning arXiv

(29 Apr 2026) Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models arXiv

(27 Apr 2026) DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models arXiv

(07 Apr 2026) Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models arXiv

(23 Mar 2026) Tiny Inference-Time Scaling with Latent Verifiers arXiv

(12 Mar 2026) EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models arXiv

(06 Mar 2026) Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion arXiv

(12 Feb 2026) Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation arXiv

(31 Jan 2026) Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings arXiv

(29 Dec 2025) ThinkGen: Generalized Thinking for Visual Generation arXiv

(25 Dec 2025) Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration arXiv

(03 Dec 2025) ReasonX: MLLM-Guided Intrinsic Image Decomposition arXiv

(27 Nov 2025) ReasonEdit: Towards Reasoning-Enhanced Image Editing Models arXiv

(9 Oct 2025) Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization arXiv

(9 Oct 2025) Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization arXiv

Audio

(09 Sep 2026) Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models arXiv

(07 Sep 2026) Reasoning Beyond Transcription: Audio Language Models on Child Stuttering Speech arXiv

(03 Sep 2026) Test-time adaptation for speech enhancement with an autoregressive speech prior arXiv

(01 Sep 2026) TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models arXiv

(31 Aug 2026) SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards arXiv

(31 Aug 2026) When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models arXiv

(31 Aug 2026) Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols arXiv

(30 Aug 2026) TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models arXiv

(25 Aug 2026) AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models arXiv

(24 Aug 2026) Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering arXiv

(17 Aug 2026) Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization arXiv

(16 Aug 2026) VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation arXiv

(04 Aug 2026) Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization arXiv

(03 Aug 2026) Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning arXiv

(23 Jul 2026) X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment arXiv

(23 Jul 2026) OPOD: On-Policy Omni Distillation arXiv

(09 Jul 2026) When Synthetic Speech Is All You Have: Better Call GRPO arXiv

(08 Jul 2026) Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning arXiv

(02 Jul 2026) DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning arXiv

(02 Jul 2026) Reinforcement Learning for Data-Efficient Code-Switched ASR arXiv

(24 Jun 2026) Omni-Perception Policy Optimization for Multimodal Emotion Reasoning arXiv

(19 Jun 2026) Post-Training Speech Enhancement Language Models with Perceptual Rewards arXiv

(17 Jun 2026) ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection arXiv

(14 Jun 2026) AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction arXiv

(05 Jun 2026) Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models arXiv

(03 Jun 2026) Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention arXiv

(11 May 2026) Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought arXiv

(11 May 2026) EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs arXiv

(28 Apr 2026) Step-Audio-R1.5 Technical Report arXiv

(27 Apr 2026) Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning arXiv

(27 Apr 2026) Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs arXiv

(13 Apr 2026) Empowering Video Translation using Multimodal Large Language Models arXiv

(05 Mar 2026) SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning arXiv

(25 Jan 2026) AR-Omni: A Unified Autoregressive Model for Any-to-Any Generation arXiv

(23 Oct 2025) Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards arXiv

(10 Oct 2025) Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models arXiv

(8 Oct 2025) Can Speech LLMs Think while Listening? arXiv

(5 Oct 2025) Principled and Tractable RL for Reasoning with Diffusion Language Models arXiv

(22 Jul 2025) Step-Audio 2 Technical Report arXiv

(14 Mar 2025) Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering arXiv

Image/Video Generation

(08 Sep 2026) Let It Go or Learn to Self-Correct: Continuous Diffusion for Constrained Discrete Tasks arXiv

(07 Sep 2026) VoT: Vision-of-Thought for Unified Multimodal Representation Alignment arXiv

(04 Sep 2026) Importance-Aware Low-Rank Distillation of Diffusion Transformers arXiv

(02 Sep 2026) CrashDiffuser: VLM-Guided Collision Intent Reasoning for Fine-Grained Safety-Critical Traffic Scenario Generation arXiv

(01 Sep 2026) Diffusion as a Training Curriculum for Timestep-Free Iterative Reasoning arXiv

(28 Aug 2026) CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning arXiv

(26 Aug 2026) DCGC: Draft-Conditioned Global Correction for Complex Reasoning with Masked Diffusion Models arXiv

(21 Aug 2026) EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking arXiv

(17 Aug 2026) Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection arXiv

(05 Aug 2026) GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction arXiv

(29 Jul 2026) Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection arXiv

(20 Jul 2026) JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models arXiv

(05 Jul 2026) Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models arXiv

(04 Jul 2026) Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process arXiv

(03 Jul 2026) ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space arXiv

(15 Jun 2026) Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models arXiv

(12 Jun 2026) HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities arXiv

(11 Jun 2026) Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model arXiv

(01 Jun 2026) Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization arXiv

(19 May 2026) Inference-Time Scaling in Diffusion Models through Iterative Partial Refinement arXiv

(16 May 2026) Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models arXiv

(16 May 2026) TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward arXiv

(14 May 2026) DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models arXiv

(11 May 2026) Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models arXiv

(10 May 2026) SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning arXiv

(08 May 2026) Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria arXiv

(07 May 2026) Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models arXiv

(07 May 2026) Continuous-Time Distribution Matching for Few-Step Diffusion Distillation arXiv

(28 Apr 2026) The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents arXiv

(26 Apr 2026) ZID-Net: Zero-Inference Diffusion Prior Decoupling Network for Single Image Dehazing arXiv

(15 Apr 2026) Enhanced Text-to-Image Generation by Fine-grained Multimodal Reasoning arXiv

(14 Apr 2026) Representation geometry shapes task performance in vision-language modeling for CT enterography arXiv

(14 Apr 2026) PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning arXiv

(10 Mar 2026) Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization arXiv

(04 Mar 2026) Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks arXiv

(28 Jan 2026) Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought arXiv

(29 Dec 2025) REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation arXiv

(14 Dec 2025) Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space arXiv

(04 Dec 2025) DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation arXiv

(18 Nov 2025) UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning arXiv

(13 Nov 2025) Image Aesthetic Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance arXiv

(24 Oct 2025) Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation arXiv

(15 Oct 2025) Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation arXiv

(9 Oct 2025) Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing arXiv

(9 Oct 2025) Reinforcing Diffusion Models by Direct Group Preference Optimization arXiv

(9 Oct 2025) Real-Time Motion-Controllable Autoregressive Video Diffusion arXiv

(29 Sep 2025) STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation arXiv

(28 Aug 2025) Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance arXiv

(28 Aug 2025) OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning arXiv

(28 Aug 2025) Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning arXiv

(27 Aug 2025) CVBench: Evaluating Cross-Video Synergies for Complex Multimodal Understanding and Reasoning arXiv

(9 Aug 2025) AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning arXiv

(28 Jul 2025) Multimodal LLMs as Customized Reward Models for Text-to-Image Generation arXiv

(20 Jun 2025) RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought arXiv

(17 Jun 2025) SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks arXiv

(16 May 2025) Towards Self-Improvement of Diffusion Models via Group Preference Optimization arXiv

(16 May 2025) Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models arXiv

(15 May 2025) Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models arXiv

(12 May 2025) DanceGRPO: Unleashing GRPO on Visual Generation arXiv

(8 May 2025) Flow-GRPO: Training Flow Matching Models via Online RL arXiv

(1 May 2025) T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT arXiv

(22 Apr 2025) From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning arXiv

(22 Apr 2025) Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning arXiv

(26 Mar 2025) MMGen: Unified Multi-modal Image Generation and Understanding in One Go arXiv

(13 Mar 2025) GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing arXiv

(3 Mar 2025) MINT: Multi-modal Chain of Thought in Unified Generative Models for Enhanced Image Generation arXiv

(23 Jan 2025) Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step arXiv

Bench/Dataset

(06 Sep 2026) NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures arXiv

(04 Sep 2026) MMTClinic: Multimodal, Multilingual Time Series Question Answering and Reasoning Benchmark for Clinical Domain arXiv

(03 Sep 2026) MetaStructAtlas: A Grounded 3D Vision-Language Dataset and Benchmark for Functional and Structural Reasoning in Whole-Body PET/CT arXiv

(29 Aug 2026) CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions arXiv

(26 Aug 2026) Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs arXiv

(20 Aug 2026) Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms arXiv

(20 Aug 2026) SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces arXiv

(18 Aug 2026) BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models arXiv

(11 Aug 2026) Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes arXiv

(05 Aug 2026) OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing arXiv

(02 Aug 2026) LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning arXiv

(30 Jul 2026) OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models arXiv

(28 Jul 2026) Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification arXiv

(23 Jul 2026) Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text arXiv

(07 Jun 2026) Driv

Truncated — view the full README on GitHub.

agent
chain-of-thought
cot
image-generation
image-reasoning
image-understanding
large-language-models
llm
mllm
multimodal-learning
multimodal-reasoning
reinforcement-learning
rl
video-generation
video-reasoning
video-understanding
vlm

Contributors

The-Martyr

124 commits

ChaoYue0307

1 commits

reacher-z

1 commits

zwq2018

1 commits

The-Martyr/Awesome-Multimodal-Reasoning

Latest Advances on (RL based) Multimodal Reasoning and Generation in Multimodal LLMs

102

127 commits

updated Sep 10, 2026

See the code

README

Awesome-Multimodal-Reasoning Awesome

This is a repository for organizing papers related to Multimodal Reasoning in Multimodal Large Language Models (Image, Video).

With the development of the visual (audio) capabilities and reasoning capabilities (RL powered) of multimodal large language models(MLLMs/LVLMs/LSLMs), researchers have high hopes for the multimodal reasoning capabilities of MLLM/LVLM/LSLM.

This repo also select paper about visual generation (image generation/video generation) with RL/CoT.

This repository aims to cover ALL possibly relevant papers to support research surveys, not just selected best papers. We believe comprehensive coverage is more valuable for researchers than a curated list.

:star: If you find this list useful, welcome to star it!

Table of Contents

Paper List (Updating...)

Survey

(06 Jun 2026) Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning arXiv

(01 Jun 2026) TechRAG: Evidence-Gated Multimodal Agentic RAG for Technical Literature Reasoning arXiv

(20 May 2026) A Survey of Audio Reasoning in Multimodal Foundation Models arXiv

(05 May 2026) Material Database Agent: A Multimodal Agentic Framework for Scientific Literature Mining arXiv

(25 Apr 2026) GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI arXiv

(8 May 2025) Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models arXiv

(30 Apr 2025) Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models arXiv

(4 Apr 2025) Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning arXiv

(18 Mar 2025) Aligning Multimodal LLM with Human Preference: A Survey arXiv

(16 Mar 2025) Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey arXiv

Image Reasoning

(09 Sep 2026) On-Policy Distillation for Vision-Language Model Adaptation, an Effective Paradigm on Low-Quality Multimodal Data arXiv

(09 Sep 2026) Beyond Surface Imitation: Contrastive Modeling for Reasoning Path Alignment in Multimodal In-Context Learning arXiv

(09 Sep 2026) From Pixels to Hierarchical Sequences: Quadtree Mask Encoding for Vision-Language Binary Change Detection arXiv

(08 Sep 2026) Drive by Hindsight and Foresight: Tool-Grounded Synergistic Reasoning over Hierarchical Memory for Autonomous Driving arXiv

(08 Sep 2026) From Glance to Scrutiny: Progressive Distortion Reasoning for Fine-Grained Image Quality Assessment arXiv

(08 Sep 2026) SeGDeP: Semantic- and Geometric-Aware Decoupled Prompts for Reasoning Segmentation arXiv

(08 Sep 2026) CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs arXiv

(07 Sep 2026) Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification arXiv

(07 Sep 2026) SupGRPO: Enhancing GRPO with Matching-based Online SFT for Text Spotting arXiv

(07 Sep 2026) MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling arXiv

(06 Sep 2026) Counterfactual Tests for Measuring Chain-of-Thought Faithfulness in Visual Language Models arXiv

(06 Sep 2026) Separating Capability from Confidence: Grounded Dual-State Calibration for GRPO-Trained Medical Vision-Language Models arXiv

(05 Sep 2026) Distilling Vision-Language Models for On-Device Fire Understanding arXiv

(05 Sep 2026) Geometry-Aware Test-Time Learning for Quantitative Spatial Reasoning arXiv

(04 Sep 2026) MCPO: Modality-Contrastive Preference Optimization for Multimodal Chain-of-Thought Compression arXiv

(04 Sep 2026) Think-Verify-Revise: Neuro-Symbolic Visual Reasoning with Vision-Language Models and Dynamic Logic Tensor Networks arXiv

(03 Sep 2026) Revisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment arXiv

(03 Sep 2026) CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation arXiv

(03 Sep 2026) When Depth Hurts: Reliability-Aware Geometry Distillation for Depth-Free RGB-D Salient Object Detection arXiv

(03 Sep 2026) MedQA-MM: Shortcuts Behind Medical Visual Reasoning arXiv

(03 Sep 2026) GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs arXiv

(02 Sep 2026) CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction arXiv

(02 Sep 2026) Test-Time Logit Prompting for Source-Free Missing Modality Adaptation arXiv

(01 Sep 2026) Controllable Image Captioning with Prompt-Conditioned Scene Rewards arXiv

(01 Sep 2026) MERGED: Multimodal Entity Resolution via Generated Expert Reasoning Distillation arXiv

(01 Sep 2026) GazeRefine: Expert Gaze as a Test-Time Prompt for Training-Free Medical Image Segmentation arXiv

(01 Sep 2026) Towards reliable multimodal disaster severity assessment through preference optimization and explainable vision-language reasoning arXiv

(01 Sep 2026) A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss arXiv

(01 Sep 2026) Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures arXiv

(01 Sep 2026) Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis arXiv

(01 Sep 2026) Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation Methods arXiv

(31 Aug 2026) Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving arXiv

(31 Aug 2026) Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry arXiv

(31 Aug 2026) Reactivating Test-Time Scaling for Plane Geometry Problem Solving arXiv

(31 Aug 2026) SlideBank: A Persistent Hierarchical Evidence Bank for Consistent Whole-Slide Reasoning arXiv

(30 Aug 2026) InspectorGPT: A Comparative Reasoning Enhanced VLM for Comprehensive Industrial Anomaly Detection arXiv

(30 Aug 2026) Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency arXiv

(29 Aug 2026) Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs arXiv

(29 Aug 2026) GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models arXiv

(27 Aug 2026) Instruction Distillation: Text Instructions as Visual Examples arXiv

(27 Aug 2026) From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation arXiv

(27 Aug 2026) Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper arXiv

(26 Aug 2026) V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning arXiv

(26 Aug 2026) GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models arXiv

(25 Aug 2026) EVEREST:Endogenous Vision-Language Reinforcement Reasoning Exploration for Urban Socio-Semantic Segmentation arXiv

(24 Aug 2026) AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes arXiv

(24 Aug 2026) CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension arXiv

(24 Aug 2026) LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation arXiv

(23 Aug 2026) Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding arXiv

(23 Aug 2026) UR$^{2}$-MLLM: Uncertainty-aware Revisit Reasoning in Multimodal Large Language Models for Radiology Report Generation arXiv

(23 Aug 2026) LiST: Local-Simplex Test-Time LoRA Fusion arXiv

(22 Aug 2026) Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning arXiv

(22 Aug 2026) VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression arXiv

(21 Aug 2026) Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning arXiv

(21 Aug 2026) ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models arXiv

(21 Aug 2026) Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds arXiv

(21 Aug 2026) Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs arXiv

(20 Aug 2026) ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation arXiv

(20 Aug 2026) Evidence-Gated Task and Motion Planning with Vision-Language Models arXiv

(20 Aug 2026) Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models arXiv

(20 Aug 2026) G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation arXiv

(20 Aug 2026) PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment arXiv

(20 Aug 2026) Question-Guided Evidence Acquisition for Multimodal Visual Question Answering arXiv

(20 Aug 2026) Answer-Level Trust Selection for Physical Vision-Language Reasoning arXiv

(20 Aug 2026) Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment arXiv

(19 Aug 2026) UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval arXiv

(19 Aug 2026) PCQA-R1: Advancing Generalized 3D Point Cloud Quality Assessment with Reinforcement Learning arXiv

(19 Aug 2026) Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference arXiv

(19 Aug 2026) Clinically Structured Surrogate Rewards for Post-SFT Medical Image Captioning arXiv

(19 Aug 2026) COSTA: A Cluster-Centric Paradigm for Annotation-Free Open-Set Semantic Segmentation of Aerial Point Clouds with Domain Shifts arXiv

(19 Aug 2026) DynCur-Geo: Dynamic Curiosity Reward Shaping for Multimodal Active Geo-Localization arXiv

(19 Aug 2026) GRACE: Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration for Educational Visual Question Answering arXiv

(18 Aug 2026) Integrating Novelty and Surprise for Experience Prioritization and Exploration in Image-Based Reinforcement Learning arXiv

(18 Aug 2026) PathoArgus: Advancing Evidence-Grounded Long-Context Visual Reasoning across Gigapixel Whole-Slide and Multi-Slide Case Contexts arXiv

(17 Aug 2026) Interactive Whole Slide Images for RL-based Tumour Segmentation arXiv

(17 Aug 2026) Q-Learning With World Models arXiv

(17 Aug 2026) Lymphocyte Mimicry Correction via Region-Level Tissue Reasoning and Unbalanced Optimal Transport arXiv

(17 Aug 2026) Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning arXiv

(16 Aug 2026) SEER: Long-Context Reasoning via Selective Visual-Text Compression arXiv

(15 Aug 2026) MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems arXiv

(15 Aug 2026) Risk-Adaptive Edge--Cloud Visual Reasoning for Communication-Efficient Autonomous Driving arXiv

(15 Aug 2026) Physiological World Models for Human State Transitions arXiv

(14 Aug 2026) Self-Supervised Visual On-Policy Distillation arXiv

(14 Aug 2026) Test-Time Instance Selection for Improved Whole Slide Image Analysis arXiv

(14 Aug 2026) SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation arXiv

(13 Aug 2026) Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs arXiv

(13 Aug 2026) LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning arXiv

(11 Aug 2026) ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes arXiv

(11 Aug 2026) CARE: Confidence-Aware Reasoning for Reliable Medical VQA arXiv

(10 Aug 2026) ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection arXiv

(10 Aug 2026) Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models arXiv

(10 Aug 2026) FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving arXiv

(09 Aug 2026) Improving Generalization Robustness of Multimodal RLVR arXiv

(08 Aug 2026) Evidence-RL: Towards Evidence-intensive Visual Reasoning arXiv

(08 Aug 2026) PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets arXiv

(08 Aug 2026) StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning arXiv

(06 Aug 2026) Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval arXiv

(06 Aug 2026) WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader arXiv

(05 Aug 2026) Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO arXiv

(05 Aug 2026) Multi-Branch Policy Optimization for Multimodal Large Language Models arXiv

(05 Aug 2026) ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination arXiv

(05 Aug 2026) Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs arXiv

(05 Aug 2026) OPD-V: Visual On-Policy Self-Distillation with Modality Balance arXiv

(04 Aug 2026) Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach arXiv

(04 Aug 2026) Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training arXiv

(04 Aug 2026) Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning arXiv

(04 Aug 2026) CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement arXiv

(04 Aug 2026) DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning arXiv

(04 Aug 2026) Monte Carlo Tree Search for Table-to-Multimodal Report Generation arXiv

(04 Aug 2026) TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering arXiv

(03 Aug 2026) Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs arXiv

(03 Aug 2026) VC-Tooler: Learning Compositional and Adaptive Visual Tool Use arXiv

(03 Aug 2026) SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models arXiv

(03 Aug 2026) Local Margin Restoration for Test-Time Adaptation of Vision-Language Models arXiv

(03 Aug 2026) MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving arXiv

(03 Aug 2026) CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning arXiv

(02 Aug 2026) It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling arXiv

(02 Aug 2026) Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning arXiv

(02 Aug 2026) Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models arXiv

(31 Jul 2026) Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models arXiv

(30 Jul 2026) Can Vision-Language Models Reason about AI Edits in Images? arXiv

(29 Jul 2026) FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing arXiv

(27 Jul 2026) Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding arXiv

(26 Jul 2026) Offline-Online Curriculum RL for Multimodal Reasoning arXiv

(26 Jul 2026) PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis arXiv

(25 Jul 2026) Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation arXiv

(24 Jul 2026) Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning arXiv

(23 Jul 2026) Visual Contrastive Self-Distillation arXiv

(23 Jul 2026) Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints arXiv

(22 Jul 2026) Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning arXiv

(21 Jul 2026) DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization arXiv

(21 Jul 2026) Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency arXiv

(19 Jul 2026) LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning arXiv

(18 Jul 2026) FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images arXiv

(17 Jul 2026) IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models arXiv

(17 Jul 2026) ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning arXiv

(17 Jul 2026) WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding arXiv

(16 Jul 2026) Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment arXiv

(15 Jul 2026) SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning arXiv

(15 Jul 2026) SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning arXiv

(14 Jul 2026) UniVR: Thinking in Visual Space for Unified Visual Reasoning arXiv

(14 Jul 2026) Visual Access Boundaries in Vision-Language Model Reasoning arXiv

(13 Jul 2026) SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning arXiv

(12 Jul 2026) Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs arXiv

(12 Jul 2026) When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion arXiv

(10 Jul 2026) Multimodal Reward Hacking in Reinforcement Learning arXiv

(08 Jul 2026) BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning arXiv

(07 Jul 2026) Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning arXiv

(05 Jul 2026) RL Forgets! Towards Continual Policy Optimization arXiv

(02 Jul 2026) Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning arXiv

(02 Jul 2026) DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation arXiv

(01 Jul 2026) VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning arXiv

(01 Jul 2026) GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision arXiv

(01 Jul 2026) Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning arXiv

(01 Jul 2026) Selective Test-Time Debiasing for CLIP via Reward Gating arXiv

(01 Jul 2026) ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models arXiv

(01 Jul 2026) DART-VLN: Test-Time Memory Decay and Anti-Loop Regularization for Discrete Vision-Language Navigation arXiv

(01 Jul 2026) ESC: Emotional Self-Correction for Reliable Vision-Language Models arXiv

(01 Jul 2026) H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation arXiv

(24 Jun 2026) V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning arXiv

(23 Jun 2026) PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought arXiv

(22 Jun 2026) CFPO: Counterfactual Policy Optimization for Multimodal Reasoning arXiv

(22 Jun 2026) VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct arXiv

(22 Jun 2026) Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views arXiv

(22 Jun 2026) AIR: Adaptive Interleaved Reasoning with Code in MLLMs arXiv

(18 Jun 2026) SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs arXiv

(16 Jun 2026) Enhancing Pathological VLMs with Cross-scale Reasoning arXiv

(16 Jun 2026) Reinforcing Dual-Path Reasoning in Spatial Vision Language Models arXiv

(16 Jun 2026) See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL arXiv

(15 Jun 2026) Thinking with Visual Grounding arXiv

(15 Jun 2026) DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models arXiv

(14 Jun 2026) NeRD: Neuro-Symbolic Rule Distillation for Efficient Ontology-Grounded Chain-of-Thought in Medical Image Diagnosis arXiv

(14 Jun 2026) Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning arXiv

(14 Jun 2026) SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks arXiv

(13 Jun 2026) Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities arXiv

(12 Jun 2026) CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment arXiv

(11 Jun 2026) Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding arXiv

(09 Jun 2026) Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts arXiv

(08 Jun 2026) CRANE: Knowledge Editing for Reasoning MLLMs arXiv

(08 Jun 2026) Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization arXiv

(06 Jun 2026) DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning arXiv

(05 Jun 2026) Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization arXiv

(03 Jun 2026) Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning arXiv

(03 Jun 2026) Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning arXiv

(02 Jun 2026) Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection arXiv

(02 Jun 2026) Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models arXiv

(02 Jun 2026) SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation arXiv

(19 May 2026) From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models arXiv

(19 May 2026) JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA arXiv

(18 May 2026) Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation arXiv

(18 May 2026) IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning arXiv

(17 May 2026) Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era arXiv

(16 May 2026) HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation arXiv

(14 May 2026) Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture arXiv

(13 May 2026) PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning arXiv

(13 May 2026) Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning arXiv

(13 May 2026) Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models arXiv

(12 May 2026) OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models arXiv

(12 May 2026) Composition of Memory Experts for Diffusion World Models arXiv

(10 May 2026) Reinforcing Multimodal Reasoning Against Visual Degradation arXiv

(10 May 2026) DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification arXiv

(10 May 2026) Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning arXiv

(10 May 2026) Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning arXiv

(10 May 2026) Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT arXiv

(08 May 2026) BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning arXiv

(08 May 2026) GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning arXiv

(04 May 2026) Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning arXiv

(03 May 2026) Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts arXiv

(02 May 2026) Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression arXiv

(01 May 2026) Structured Role-Aware Policy Optimization for Multimodal Reasoning arXiv

(01 May 2026) MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models arXiv

(30 Apr 2026) VeraRetouch: A Lightweight Fully Differentiable Framework for Multi-Task Reasoning Photo Retouching arXiv

(30 Apr 2026) Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL arXiv

(30 Apr 2026) WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning arXiv

(30 Apr 2026) Detecting is Easy, Adapting is Hard: Local Expert Growth for Visual Model-Based Reinforcement Learning under Distribution Shift arXiv

(30 Apr 2026) PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations arXiv

(30 Apr 2026) The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models arXiv

(29 Apr 2026) World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning arXiv

(29 Apr 2026) Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning arXiv

(29 Apr 2026) Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding arXiv

(28 Apr 2026) Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning arXiv

(28 Apr 2026) SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring arXiv

(27 Apr 2026) Improving Vision-language Models with Perception-centric Process Reward Models arXiv

(27 Apr 2026) See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection arXiv

(27 Apr 2026) PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model arXiv

(27 Apr 2026) VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions arXiv

(13 Apr 2026) POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs arXiv

(13 Apr 2026) CFMS: A Coarse-to-Fine Multimodal Synthesis Framework for Enhanced Tabular Reasoning arXiv

(13 Apr 2026) Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images arXiv

(10 Apr 2026) VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning arXiv

(10 Apr 2026) Visually-Guided Policy Optimization for Multimodal Reasoning arXiv

(09 Apr 2026) Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models arXiv

(09 Apr 2026) TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction arXiv

(09 Apr 2026) OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks arXiv

(09 Apr 2026) Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data arXiv

(09 Apr 2026) WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models arXiv

(09 Apr 2026) AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models arXiv

(08 Apr 2026) Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning arXiv

(07 Apr 2026) MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control arXiv

(07 Apr 2026) WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering arXiv

(07 Apr 2026) Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank arXiv

(06 Apr 2026) Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward arXiv

(05 Apr 2026) Belief-Aware VLM Model for Human-like Reasoning arXiv

(03 Apr 2026) Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models arXiv

(03 Apr 2026) Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models arXiv

(03 Apr 2026) CharTool: Tool-Integrated Visual Reasoning for Chart Understanding arXiv

(03 Apr 2026) FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation arXiv

(02 Apr 2026) Guideline2Graph: Profile-Aware Multimodal Parsing for Executable Clinical Decision Graphs arXiv

(02 Apr 2026) Impact of Multimodal and Conversational AI on Learning Outcomes and Experience arXiv

(02 Apr 2026) Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models arXiv

(02 Apr 2026) MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction arXiv

(01 Apr 2026) Vero: An Open RL Recipe for General Visual Reasoning arXiv

(01 Apr 2026) Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization arXiv

(01 Apr 2026) EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs arXiv

(01 Apr 2026) All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models arXiv

(30 Mar 2026) Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning arXiv

(30 Mar 2026) MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding arXiv

(30 Mar 2026) $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning arXiv

(29 Mar 2026) LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation arXiv

(29 Mar 2026) Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs arXiv

(28 Mar 2026) Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models arXiv

(28 Mar 2026) Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models arXiv

(27 Mar 2026) Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR arXiv

(26 Mar 2026) R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning arXiv

(26 Mar 2026) Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs arXiv

(24 Mar 2026) MedCausalX: Adaptive Causal Reasoning with Self-Reflection for Trustworthy Medical Vision-Language Models arXiv

(24 Mar 2026) Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought arXiv

(24 Mar 2026) GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning arXiv

(23 Mar 2026) Getting to the Point: Why Pointing Improves LVLMs arXiv

(23 Mar 2026) Rethinking Token Reduction for Large Vision-Language Models arXiv

(21 Mar 2026) Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning arXiv

(20 Mar 2026) One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment arXiv

(19 Mar 2026) Balanced Thinking: Improving Chain of Thought Training in Vision Language Models arXiv

(19 Mar 2026) TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation arXiv

(17 Mar 2026) HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning arXiv

(17 Mar 2026) DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models arXiv

(17 Mar 2026) The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models arXiv

(17 Mar 2026) Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning arXiv

(16 Mar 2026) Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing arXiv

(15 Mar 2026) On the Nature of Attention Sink that Shapes Decoding Strategy in MLLMs arXiv

(14 Mar 2026) Improving Visual Reasoning with Iterative Evidence Refinement arXiv

(12 Mar 2026) Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation arXiv

(10 Mar 2026) C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis arXiv

(10 Mar 2026) MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning arXiv

(10 Mar 2026) GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision arXiv

(09 Mar 2026) MJ1: Multimodal Judgment via Grounded Verification arXiv

(08 Mar 2026) Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models arXiv

(08 Mar 2026) Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models arXiv

(07 Mar 2026) Perception-Aware Multimodal Spatial Reasoning from Monocular Images arXiv

(06 Mar 2026) MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation arXiv

(06 Mar 2026) PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues arXiv

(06 Mar 2026) ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning arXiv

(05 Mar 2026) Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum arXiv

(04 Mar 2026) Phi-4-reasoning-vision-15B Technical Report arXiv

(04 Mar 2026) Discriminative Perception via Anchored Description for Reasoning Segmentation arXiv

(03 Mar 2026) TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval arXiv

(03 Mar 2026) SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety arXiv

(02 Mar 2026) Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine arXiv

(01 Mar 2026) Can Thinking Models Think to Detect Hateful Memes? arXiv

(01 Mar 2026) ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models arXiv

(01 Mar 2026) DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage arXiv

(01 Mar 2026) ICPRL: Acquiring Physical Intuition from Interactive Control arXiv

(28 Feb 2026) PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment arXiv

(27 Feb 2026) Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought arXiv

(27 Feb 2026) EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models arXiv

(27 Feb 2026) Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning arXiv

(27 Feb 2026) Toward Guarantees for Clinical Reasoning in Vision Language Models via Formal Verification arXiv

(27 Feb 2026) Reasoning-Driven Multimodal LLM for Domain Generalization arXiv

(26 Feb 2026) MediX-R1: Open Ended Medical Reinforcement Learning arXiv

(25 Feb 2026) MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving arXiv

(25 Feb 2026) See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs arXiv

(25 Feb 2026) RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning arXiv

(24 Feb 2026) Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking arXiv

(23 Feb 2026) TextShield-R1: Reinforced Reasoning for Tampered Text Detection arXiv

(23 Feb 2026) Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking arXiv

(19 Feb 2026) Enabling Training-Free Text-Based Remote Sensing Segmentation arXiv

(18 Feb 2026) Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning arXiv

(17 Feb 2026) Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families arXiv

(17 Feb 2026) On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks arXiv

(16 Feb 2026) Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning arXiv

(16 Feb 2026) TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning arXiv

(15 Feb 2026) ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization arXiv

(15 Feb 2026) GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery arXiv

(14 Feb 2026) Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings arXiv

(13 Feb 2026) Reliable Thinking with Images arXiv

(13 Feb 2026) Thinking Like a Radiologist: A Dataset for Anatomy-Guided Interleaved Vision Language Reasoning in Chest X-ray Interpretation arXiv

(12 Feb 2026) Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning arXiv

(11 Feb 2026) Canvas-of-Thought: Grounding Reasoning via Mutable Structured States arXiv

(10 Feb 2026) Bridging Efficiency and Transparency: Explainable CoT Compression in Multimodal Large Reasoning Models arXiv

(10 Feb 2026) Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension arXiv

(10 Feb 2026) GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation arXiv

(09 Feb 2026) AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection arXiv

(09 Feb 2026) Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs arXiv

(09 Feb 2026) When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning arXiv

(07 Feb 2026) Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning arXiv

(06 Feb 2026) MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images arXiv

(06 Feb 2026) SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs arXiv

(05 Feb 2026) Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR arXiv

(05 Feb 2026) Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning arXiv

(04 Feb 2026) Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision arXiv

(04 Feb 2026) Training Data Efficiency in Multimodal Process Reward Models arXiv

(03 Feb 2026) Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance arXiv

(02 Feb 2026) Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling arXiv

(02 Feb 2026) VLM-Guided Experience Replay arXiv

(02 Feb 2026) ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning arXiv

(02 Feb 2026) Multimodal Large Language Models for Real-Time Situated Reasoning arXiv

(01 Feb 2026) StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating arXiv

(01 Feb 2026) Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis arXiv

(01 Feb 2026) SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning arXiv

(31 Jan 2026) RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding arXiv

(29 Jan 2026) MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods arXiv

(28 Jan 2026) MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models arXiv

(27 Jan 2026) Innovator-VL: A Multimodal Large Language Model for Scientific Discovery arXiv

(26 Jan 2026) AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning arXiv

(22 Jan 2026) Explainable Deepfake Detection with RL Enhanced Self-Blended Images arXiv

(20 Jan 2026) Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring arXiv

(19 Jan 2026) Think3D: Thinking with Space for Spatial Reasoning arXiv

(16 Jan 2026) MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement arXiv

(12 Jan 2026) CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation arXiv

(12 Jan 2026) MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning arXiv

(11 Jan 2026) E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis arXiv

(11 Jan 2026) Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy arXiv

(09 Jan 2026) SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More arXiv

(08 Jan 2026) Agri-R1: Agricultural Reasoning for Disease Diagnosis via Automated-Synthesis and Reinforcement Learning arXiv

(06 Jan 2026) ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing arXiv

(06 Jan 2026) Towards Faithful Reasoning in Comics for Small MLLMs arXiv

(06 Jan 2026) Aligning Findings with Diagnosis: A Self-Consistent Reinforcement Learning Framework for Trustworthy Radiology Reporting arXiv

(01 Jan 2026) CPPO: Contrastive Perception for Vision Language Policy Optimization arXiv

(01 Jan 2026) From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning arXiv

(31 Dec 2025) From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme arXiv

(22 Dec 2025) Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection arXiv

(22 Dec 2025) CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning arXiv

(22 Dec 2025) Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation arXiv

(22 Dec 2025) SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models arXiv

(20 Dec 2025) Stable and Efficient Single-Rollout RL for Multimodal Reasoning arXiv

(19 Dec 2025) Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images arXiv

(19 Dec 2025) Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding arXiv

(18 Dec 2025) AdaTooler-V: Adaptive Tool-Use for Images and Videos arXiv

(16 Dec 2025) Incentivizing Tool-augmented Thinking with Images for Medical Image Analysis arXiv

(16 Dec 2025) ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking arXiv

(16 Dec 2025) OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving arXiv

(13 Dec 2025) More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models arXiv

(13 Dec 2025) Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking arXiv

(12 Dec 2025) DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry arXiv

(08 Dec 2025) MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning arXiv

(07 Dec 2025) Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning arXiv

(07 Dec 2025) The Role of Entropy in Visual Grounding: Analysis and Optimization arXiv

(06 Dec 2025) ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models arXiv

(03 Dec 2025) TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning arXiv

(03 Dec 2025) Thinking with Programming Vision: Towards a Unified View for Thinking with Images arXiv

(03 Dec 2025) Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning arXiv

(02 Dec 2025) See, Think, Learn: A Self-Taught Multimodal Reasoner arXiv

(29 Nov 2025) ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning arXiv

(28 Nov 2025) TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM arXiv

(27 Nov 2025) GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes arXiv

(24 Nov 2025) Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning arXiv

(23 Nov 2025) Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning arXiv

(22 Nov 2025) PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning arXiv

(21 Nov 2025) VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning arXiv

(21 Nov 2025) ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better arXiv

(20 Nov 2025) OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe arXiv

(19 Nov 2025) VisPlay: Self-Evolving Vision-Language Models from Images arXiv

(17 Nov 2025) Video Finetuning Improves Reasoning Between Frames arXiv

(17 Nov 2025) From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models arXiv

(17 Nov 2025) SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization arXiv

(14 Nov 2025) Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions arXiv

(11 Nov 2025) From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training arXiv

(10 Nov 2025) Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View arXiv

(07 Nov 2025) PreResQ-R1: Towards Fine-Grained Rank-and-Score Reinforcement Learning for Visual Quality Assessment via Preference-Response Disentangled Policy Optimization arXiv

(04 Nov 2025) ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension arXiv

(04 Nov 2025) SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning arXiv

(01 Nov 2025) UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings arXiv

(01 Nov 2025) Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning arXiv

(31 Oct 2025) Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning arXiv

(23 Oct 2025) Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning arXiv

(23 Oct 2025) Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation arXiv

(18 Oct 2025) RL makes MLLMs see better than SFT arXiv

(16 Oct 2025) MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning arXiv

(15 Oct 2025) Generative Universal Verifier as Multimodal Meta-Reasoner arXiv

(14 Oct 2025) HoneyBee: Data Recipes for Vision-Language Reasoners arXiv

(14 Oct 2025) DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search arXiv

(13 Oct 2025) CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images arXiv

(10 Oct 2025) Unleashing Perception-Time Scaling to Multimodal Reasoning Models arXiv

(10 Oct 2025) Spotlight on Token Perception for Multimodal Reinforcement Learning arXiv

(10 Oct 2025) Tiny-R1V: Lightweight Multimodal Unified Reasoning Model via Model Merging arXiv

(9 Oct 2025) ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping arXiv

(9 Oct 2025) SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models arXiv

(6 Oct 2025) Beyond Monolithic Rewards: A Hybrid and Multi-Aspect Reward Optimization for MLLM Alignment arXiv

(3 Oct 2025) Efficient Test-Time Scaling for Small Vision-Language Models arXiv

(29 Sep 2025) Latent Visual Reasoning arXiv

(29 Sep 2025) GeoVLM-R1: Reinforcement Fine-Tuning for Improved Remote Sensing Reasoning arXiv

(29 Sep 2025) VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding arXiv

(29 Sep 2025) Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks arXiv

(28 Sep 2025) Poivre: Self-Refining Visual Pointing with Reinforcement Learning arXiv

(27 Sep 2025) Decoupling Reasoning and Perception: An LLM-LMM Framework for Faithful Visual Reasoning arXiv

(25 Sep 2025) MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources arXiv

(12 Sep 2025) LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA arXiv

(9 Sep 2025) Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search arXiv

(28 Aug 2025) R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning arXiv

(27 Aug 2025) Self-Rewarding Vision-Language Model via Reasoning Decomposition arXiv

(18 Aug 2025) M3PO: Multimodal-Model-Guided Preference Optimization for Visual Instruction Following arXiv

(18 Aug 2025) Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation arXiv

(18 Aug 2025) Ovis2.5 Technical Report arXiv

(18 Aug 2025) MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models arXiv

(8 Aug 2025) SIFThinker: Spatially-Aware Image Focus for Visual Reasoning arXiv

(7 Aug 2025) Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision arXiv

(7 Aug 2025) StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models arXiv

(5 Aug 2025) Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions arXiv

(30 Jul 2025) MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention arXiv

(28 Jul 2025) Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback arXiv

(24 Jul 2025) MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning arXiv

(24 Jul 2025) SafeWork-R1: Coevolving Safety and Intelligence under the AI-45 Law arXiv

(22 Jul 2025) C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning arXiv

(22 Jul 2025) Semi-off-Policy Reinforcement Learning for Vision-Language Slow-thinking Reasoning arXiv

(11 Jul 2025) M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning arXiv

(3 Jul 2025) Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation arXiv

(1 Jul 2025) GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning arXiv

(20 Jun 2025) GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning arXiv

(16 Jun 2025) Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning arXiv

(11 Jun 2025) ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs arXiv

(5 Jun 2025) Perceptual Decoupling for Scalable Multi-modal Reasoning via Reward-Optimized Captioning arXiv

(5 Jun 2025) MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning arXiv

(16 May 2025) Visual Planning: Let's Think Only with Images arXiv

(15 May 2025) MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning arXiv

(13 May 2025) OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning arXiv

(12 May 2025) Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning arXiv

(8 May 2025) Bring Reason to Vision: Understanding Perception and Reasoning through Model Merging arXiv

(08 May 2025) SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models arXiv

(6 May 2025) X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains arXiv

(6 May 2025) Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning arXiv

(6 May 2025) ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant arXiv

(5 May 2025) R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning arXiv

(28 Apr 2025) SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning arXiv

(25 Apr 2025) Fast-Slow Thinking for Large Vision-Language Model Reasoning arXiv

(25 Apr 2025) Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization arXiv

(25 Apr 2025) Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning arXiv

(21 Apr 2025) A Call for New Recipes to Enhance Spatial Reasoning in MLLMs arXiv

(20 Apr 2025) Relation-R1: Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relational Comprehension arXiv

(12 Apr 2025) VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search arXiv

(10 Apr 2025) VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model arXiv

(10 Apr 2025) SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement arXiv

(10 Apr 2025) Perception-R1: Pioneering Perception Policy with Reinforcement Learning arXiv

(10 Apr 2025) Kimi-VL Technical Report arXiv

(8 Apr 2025) On the Suitability of Reinforcement Fine-Tuning to Visual Tasks arXiv

(8 Apr 2025) Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought arXiv

(1 Apr 2025) Improved Visual-Spatial Reasoning via R1-Zero-Like Training arXiv

(17 Mar 2025) R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization arXiv

(13 Mar 2025) VisualPRM: An Effective Process Reward Model for Multimodal Reasoning arXiv

(9 Mar 2025) Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models arXiv

(7 Mar 2025) R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning arXiv

(7 Mar 2025) Unified Reward Model for Multimodal Understanding and Generation arXiv

(7 Mar 2025) R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model arXiv

(3 Mar 2025) Visual-RFT: Visual Reinforcement Fine-Tuning arXiv

(4 Feb 2025) Boosting Multimodal Reasoning with MCTS-Automated Structured Thinking arXiv

(13 Jan 2025) Imagine while Reasoning in Space: Multimodal Visualization-of-Thought arXiv

(10 Jan 2025) LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs arXiv

(9 Jan 2025) Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark arXiv

(3 Jan 2025) Virgo: A Preliminary Exploration on Reproducing o1-like MLLM arXiv

(30 Dec 2024) Slow Perception: Let's Perceive Geometric Figures Step-by-step arXiv

(19 Dec 2024) Progressive Multimodal Reasoning via Active Retrieval arXiv

(29 Nov 2024) Interleaved-Modal Chain-of-Thought arXiv

(15 Nov 2024) Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination arXiv

(15 Nov 2024) LLaVA-CoT: Let Vision Language Models Reason Step-by-Step arXiv

(30 Oct 2024) Vision-Language Models Can Self-Improve Reasoning via Reflection arXiv

(23 Oct 2024) R-CoT: Reverse Chain-of-Thought Problem Generation for Geometric Reasoning in Large Multimodal Models arXiv

(21 Oct 2024) Improve Vision Language Model Chain-of-thought Reasoning arXiv

(11 Oct 2024) M3Hop-CoT: Misogynous Meme Identification with Multimodal Multi-hop Chain-of-Thought arXiv

(6 Oct 2024) MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration arXiv

(4 Oct 2024) Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning arXiv

(13 Jun 2024) Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models arXiv

(28 Dec 2023) Grounding-Prompter: Prompting LLM with Multimodal Information for Temporal Sentence Grounding in Long Videos arXiv

(14 Dec 2023) Multi-modal Latent Space Learning for Chain-of-Thought Reasoning in Language Models arXiv

(27 Nov 2023) Compositional Chain-of-Thought Prompting for Large Multimodal Models arXiv

(15 Nov 2023) The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task arXiv

(3 May 2023) Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings arXiv

(16 Apr 2023) Chain of Thought Prompt Tuning in Vision Language Models arXiv

(2 Feb 2023) Multimodal Chain-of-Thought Reasoning in Language Models arXiv

Agent

(09 Sep 2026) Cost-Aware Vision--Language Model Arbitration for Fabric Structure Recognition A Deployable Multi-Agent System arXiv

(09 Sep 2026) VLX-VR: An Agentic-Aware Video Reasoning Model arXiv

(09 Sep 2026) Who Are They to Each Other? Multi-Agent Reasoning for Speaker Relationship Inference arXiv

(09 Sep 2026) SpeechAnnotator: A Context-Aware Multi-Agent Framework and Benchmark for Multidimensional Speech Annotation arXiv

(08 Sep 2026) An Experimental Evaluation of Multimodal Prompt Injection Attacks on Agentic AI Frameworks arXiv

(07 Sep 2026) Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning arXiv

(07 Sep 2026) PhysMAS: Physics-Grounded Multi-Agent Synthesis of Compositional 4D Gaussians arXiv

(06 Sep 2026) 3DHarnessBench: Probing Agentic 3D-to-Code Capabilities of Frontier Vision-Language Models arXiv

(04 Sep 2026) CUSP: Decomposable Collective Uncertainty for Multi-Agent Multimodal Reasoning arXiv

(03 Sep 2026) WorldReward: Reward Modeling for Camera-Conditioned World Models arXiv

(03 Sep 2026) StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios arXiv

(03 Sep 2026) LLM-Aided Design for Manufacturing: A Multi-Agent System for Intent-Preserving Redesign of CAD for Improved Manufacturability arXiv

(03 Sep 2026) Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models arXiv

(03 Sep 2026) ICM-Bench: Person-Level Identity Reasoning in Multimodal Agents with Long-Term Memory arXiv

(02 Sep 2026) SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models arXiv

(02 Sep 2026) PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment arXiv

(01 Sep 2026) Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers arXiv

(01 Sep 2026) Agentic Multimodal Models for Environmental Hyperspectral Unmixing arXiv

(01 Sep 2026) InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations arXiv

(31 Aug 2026) CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework arXiv

(30 Aug 2026) FRAMEWORKERS: A Dynamic Multi-Agent Framework for AI-Generated Video Production arXiv

(30 Aug 2026) Off-Manifold Refinement: Guiding Video Generators with a Frozen World Model arXiv

(30 Aug 2026) When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents arXiv

(29 Aug 2026) LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO arXiv

(28 Aug 2026) See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs arXiv

(27 Aug 2026) WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning arXiv

(26 Aug 2026) VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following arXiv

(26 Aug 2026) SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning arXiv

(25 Aug 2026) Task-Adaptive Rubrics for GUI Reward Modeling arXiv

(25 Aug 2026) DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton arXiv

(25 Aug 2026) Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs arXiv

(25 Aug 2026) Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning arXiv

(25 Aug 2026) Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments arXiv

(24 Aug 2026) GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis arXiv

(24 Aug 2026) Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner arXiv

(24 Aug 2026) Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents arXiv

(22 Aug 2026) BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications arXiv

(22 Aug 2026) MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning arXiv

(22 Aug 2026) Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents arXiv

(19 Aug 2026) EVADE: Evidence-Verified Agentic Diagnosis with Escape arXiv

(19 Aug 2026) DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning arXiv

(18 Aug 2026) Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL arXiv

(18 Aug 2026) Structural Plan-to-Model Conversion with Deterministic Geometry and Guarded Agentic Vision-Language Refinement arXiv

(18 Aug 2026) DeAR: Decentralized Agentic Reasoning via Capability Grounding and Collaborative Thought Navigation arXiv

(17 Aug 2026) ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning arXiv

(15 Aug 2026) VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? arXiv

(15 Aug 2026) SCOPE: Score-Isolated Agentic Optimization for Video World Models arXiv

(14 Aug 2026) MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning arXiv

(14 Aug 2026) Wyvern: An Agentic Framework for Generating Grounded Multimodal Reports arXiv

(14 Aug 2026) MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning arXiv

(13 Aug 2026) Intern-S2-Preview: Scientific Agentic Foundation Model arXiv

(11 Aug 2026) MIRA: Medical Image Reflection for Agentic Diagnosis arXiv

(11 Aug 2026) Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation arXiv

(08 Aug 2026) SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning arXiv

(07 Aug 2026) Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning arXiv

(06 Aug 2026) The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents arXiv

(06 Aug 2026) AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents arXiv

(04 Aug 2026) Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents arXiv

(04 Aug 2026) AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding arXiv

(01 Aug 2026) DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning arXiv

(31 Jul 2026) Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning arXiv

(28 Jul 2026) ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning arXiv

(23 Jul 2026) EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization arXiv

(17 Jul 2026) Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA arXiv

(14 Jul 2026) A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism arXiv

(14 Jul 2026) ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning arXiv

(14 Jul 2026) EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval arXiv

(13 Jul 2026) The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy arXiv

(07 Jul 2026) EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents arXiv

(03 Jul 2026) VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning arXiv

(18 Jun 2026) MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization arXiv

(15 Jun 2026) Context-Aware RL for Agentic and Multimodal LLMs arXiv

(10 Jun 2026) IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents arXiv

(10 Jun 2026) MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning arXiv

(10 Jun 2026) Orchestra-o1: Omnimodal Agent Orchestration arXiv

(05 Jun 2026) StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents arXiv

(04 Jun 2026) AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents arXiv

(04 Jun 2026) TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents arXiv

(04 Jun 2026) Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators arXiv

(01 Jun 2026) OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents arXiv

(19 May 2026) ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning arXiv

(19 May 2026) ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning arXiv

(18 May 2026) AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents arXiv

(18 May 2026) GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents arXiv

(18 May 2026) An Efficient Streaming Video Understanding Framework with Agentic Control arXiv

(16 May 2026) OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics arXiv

(14 May 2026) ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both arXiv

(13 May 2026) ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows arXiv

(10 May 2026) Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning arXiv

(08 May 2026) HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents arXiv

(08 May 2026) LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning arXiv

(08 May 2026) Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning arXiv

(07 May 2026) A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency arXiv

(05 May 2026) What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity arXiv

(01 May 2026) Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding arXiv

(30 Apr 2026) Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation arXiv

(30 Apr 2026) MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection arXiv

(30 Apr 2026) GUI Agents with Reinforcement Learning: Toward Digital Inhabitants arXiv

(29 Apr 2026) GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents arXiv

(28 Apr 2026) Benchmarking and Improving GUI Agents in High-Dynamic Environments arXiv

(27 Apr 2026) Agentic AI for Remote Sensing: Technical Challenges and Research Directions arXiv

(25 Apr 2026) SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing arXiv

(13 Apr 2026) Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games arXiv

(13 Apr 2026) Dialectic-Med: Mitigating Diagnostic Hallucinations via Counterfactual Adversarial Multi-Agent Debate arXiv

(10 Apr 2026) Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents arXiv

(10 Apr 2026) ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning arXiv

(09 Apr 2026) RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs arXiv

(09 Apr 2026) MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning arXiv

(08 Apr 2026) Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization arXiv

(07 Apr 2026) Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction arXiv

(29 Mar 2026) MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences arXiv

(27 Mar 2026) Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives arXiv

(24 Mar 2026) EVA: Efficient Reinforcement Learning for End-to-End Video Agent arXiv

(17 Mar 2026) PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning arXiv

(17 Mar 2026) OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials arXiv

(16 Mar 2026) MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings arXiv

(03 Mar 2026) Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling arXiv

(26 Feb 2026) FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning arXiv

(26 Feb 2026) CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays arXiv

(19 Feb 2026) RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward arXiv

(14 Feb 2026) Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization arXiv

(05 Feb 2026) V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval arXiv

(26 Jan 2026) GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning arXiv

(30 Dec 2025) SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning arXiv

(23 Dec 2025) CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation arXiv

(21 Dec 2025) Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback arXiv

(09 Dec 2025) Thinking with Images via Self-Calling Agent arXiv

(06 Dec 2025) VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning arXiv

(03 Dec 2025) Multimodal Reinforcement Learning with Agentic Verifier for AI Agents arXiv

(26 Nov 2025) OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection arXiv

(25 Nov 2025) VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis arXiv

(24 Nov 2025) VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning arXiv

(17 Nov 2025) DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning arXiv

(12 Nov 2025) History-Aware Reasoning for GUI Agents arXiv

(31 Oct 2025) GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation arXiv

(2 Dec 2024) Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation arXiv

Embodied / Robotics

(09 Sep 2026) HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy arXiv

(08 Sep 2026) CLAMP: Constrained Decoding for Vision-Language Embodied Planning arXiv

(08 Sep 2026) WorldAgen: Unified State-Action Prediction with Test-Time World Model Training arXiv

(08 Sep 2026) CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot Manipulation arXiv

(08 Sep 2026) Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic Method arXiv

(07 Sep 2026) Phase-and-First-Arrival VLM Feedback for Sparse-Reward Reinforcement Learning in Surgical Manipulation arXiv

(07 Sep 2026) Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models arXiv

(07 Sep 2026) Dex-X: Learning Visual-Tactile Dexterous Manipulation From Human Videos with Simulated Interaction arXiv

(05 Sep 2026) FACT: A Forensic Agent with Compiled Tool-Use Trajectories for AI-Generated Image Detection arXiv

(05 Sep 2026) MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control arXiv

(05 Sep 2026) CST-WM: A Causally Structured World Model for Embodied Visual Tracking arXiv

(05 Sep 2026) Learning Counterfactual World Models for Embodied Reasoning under Partial Observability arXiv

(04 Sep 2026) Reasoning Without Inference Cost: Latent Semantic Scaffolding for Robot VLA Policies arXiv

(04 Sep 2026) Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models arXiv

(04 Sep 2026) Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation arXiv

(03 Sep 2026) VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models arXiv

(03 Sep 2026) ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection arXiv

(03 Sep 2026) Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models arXiv

(03 Sep 2026) WISE: World-model-guided Imagination Scheduling for Efficient Post-training of Vision-Language-Action Models arXiv

(03 Sep 2026) Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving arXiv

(30 Aug 2026) SymVD: Symmetric Vision Language Action Distillation for Robot Manipulation arXiv

(27 Aug 2026) Diffusion Policies for Short-Horizon Planning in Robot Crowd Navigation arXiv

(27 Aug 2026) Decoupling Planning and Control for Instructable Agents arXiv

(27 Aug 2026) Embodied Scene Rearrangement Planning arXiv

(26 Aug 2026) Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning arXiv

(26 Aug 2026) $R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning arXiv

(25 Aug 2026) GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model arXiv

(25 Aug 2026) TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks arXiv

(24 Aug 2026) OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation arXiv

(24 Aug 2026) Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models arXiv

(22 Aug 2026) Decoupled Physical Modeling and Execution for Physics Reasoning arXiv

(22 Aug 2026) CounterAlign: Counterfactual Supervision for Vision-Language-Action Models arXiv

(18 Aug 2026) Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups arXiv

(18 Aug 2026) Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation arXiv

(17 Aug 2026) FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences arXiv

(17 Aug 2026) PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents arXiv

(17 Aug 2026) Inference-Time Attention Steering for Vision-Language-Action Driving Models arXiv

(17 Aug 2026) Planner-Conditioned Diffusion for Coordinated Multi-Agent Exploration arXiv

(17 Aug 2026) HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL arXiv

(17 Aug 2026) $τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation arXiv

(16 Aug 2026) Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation arXiv

(14 Aug 2026) Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models arXiv

(21 Jul 2026) No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation arXiv

(24 Jun 2026) RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards arXiv

(12 Apr 2026) A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning arXiv

(30 Mar 2026) SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning arXiv

(22 Mar 2026) RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models arXiv

(16 Mar 2026) From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation arXiv

(24 Feb 2026) HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning arXiv

(18 Feb 2026) Peeking Ahead of the Field Study: Exploring VLM Personas as Support Tools for Embodied Studies in HCI arXiv

(16 Feb 2026) Ground-Truth Depth in Vision Language Models: Spatial Context Understanding in Conversational AI for XR-Robotic Support in Emergency First Response arXiv

(07 Feb 2026) VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation arXiv

(16 Jan 2026) ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models arXiv

(02 Jan 2026) RoboReward: General-Purpose Vision-Language Reward Models for Robotics arXiv

(21 Dec 2025) ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning arXiv

(28 Nov 2025) Video-CoM: Interactive Video Reasoning via Chain of Manipulations arXiv

(13 Nov 2025) AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models arXiv

Video

(08 Sep 2026) Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding arXiv

(08 Sep 2026) Human-Centric Image Captioning with Subject-Centered Spatial Understanding arXiv

(07 Sep 2026) CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation arXiv

(07 Sep 2026) Ambient @ EgoLongQA 2026: Distilling Long-Video perception into a Sub-2B Model arXiv

(07 Sep 2026) Beyond Sparse Rewards: A New Benchmark and Structure-Aware Graph Alignment for Micro-Drama Understanding arXiv

(06 Sep 2026) Thinking with Cameras: Active Visual Reasoning via Dynamic Viewpoint Control for Surveillance Video Understanding arXiv

(06 Sep 2026) Visual Search Augmented Chain-of-Thought Reasoning for Attribute Value Extraction from Product Videos arXiv

(03 Sep 2026) Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision arXiv

(03 Sep 2026) LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL arXiv

(03 Sep 2026) Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning arXiv

(01 Sep 2026) Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models arXiv

(01 Sep 2026) TempCloze: Can Video-LLMs Identify the Missing Middle? arXiv

(29 Aug 2026) Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling arXiv

(28 Aug 2026) StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models arXiv

(28 Aug 2026) Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models arXiv

(27 Aug 2026) Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models arXiv

(27 Aug 2026) Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs arXiv

(27 Aug 2026) Video-FLAIR: Not Whether to Reason, But How arXiv

(27 Aug 2026) Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection arXiv

(26 Aug 2026) Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding arXiv

(26 Aug 2026) VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning arXiv

(26 Aug 2026) AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research arXiv

(26 Aug 2026) LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding arXiv

(25 Aug 2026) PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos arXiv

(24 Aug 2026) Scaling Reinforcement Learning for Diffusion Models via Velocity Matching arXiv

(23 Aug 2026) Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting arXiv

(21 Aug 2026) COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models arXiv

(21 Aug 2026) Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision arXiv

(21 Aug 2026) TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming arXiv

(20 Aug 2026) Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs arXiv

(19 Aug 2026) StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos arXiv

(19 Aug 2026) CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes arXiv

(19 Aug 2026) CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios arXiv

(18 Aug 2026) TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs arXiv

(17 Aug 2026) Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning arXiv

(17 Aug 2026) Contrastive Energy Fields for Inference-Time Procedure Planning in Instructional Videos arXiv

(17 Aug 2026) StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding arXiv

(17 Aug 2026) RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning arXiv

(17 Aug 2026) CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated? arXiv

(16 Aug 2026) Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning arXiv

(16 Aug 2026) CrossView: Can Vision-Language Models Reason Across Cameras? arXiv

(16 Aug 2026) Sequential Multimodal Evidence Optimization for Product Media Ranking in E-Commerce arXiv

(14 Aug 2026) Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition arXiv

(14 Aug 2026) OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation arXiv

(14 Aug 2026) InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors arXiv

(14 Aug 2026) Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training arXiv

(12 Aug 2026) SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward arXiv

(10 Aug 2026) CodecArena: Codec Quality Assessment via Visual Reinforcement Learning arXiv

(10 Aug 2026) Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models arXiv

(05 Aug 2026) PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning arXiv

(05 Aug 2026) WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models arXiv

(05 Aug 2026) HelloWorld: Enabling Socially Interactive Characters in Video World Models arXiv

(04 Aug 2026) Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering arXiv

(03 Aug 2026) AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning arXiv

(02 Aug 2026) MiniWorld: Democratizing the Training of Video World Models from Scratch arXiv

(28 Jul 2026) Wonder: Video World Model Done Better arXiv

(27 Jul 2026) CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding arXiv

(27 Jul 2026) Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts arXiv

(11 Jul 2026) Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset arXiv

(06 Jul 2026) TimeThink: Reasoning with Time for Video LLMs arXiv

(06 Jul 2026) Claim-Level Rubric Rewards for Video Caption Reinforcement Learning arXiv

(02 Jul 2026) Rank-Then-Act: Reward-Free Control from Frame-Order Progress arXiv

(01 Jul 2026) VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement arXiv

(01 Jul 2026) Linguistic Relative Policy Optimization for Video Anomaly Reasoning arXiv

(01 Jul 2026) EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection arXiv

(01 Jul 2026) Latent Visual Cache for Video Reasoning arXiv

(23 Jun 2026) SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards arXiv

(20 Jun 2026) When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR arXiv

(18 Jun 2026) CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs arXiv

(17 Jun 2026) Native Active Perception as Reasoning for Omni-Modal Understanding arXiv

(16 Jun 2026) Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs arXiv

(10 Jun 2026) AVIS: Adaptive Test-Time Scaling for Vision-Language Models arXiv

(10 Jun 2026) Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding arXiv

(10 Jun 2026) InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning arXiv

(08 Jun 2026) Temporal-Aware Reasoning Optimization for Video Temporal Grounding arXiv

(08 Jun 2026) CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning arXiv

(07 Jun 2026) CACR:Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning arXiv

(05 Jun 2026) VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation arXiv

(04 Jun 2026) Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction arXiv

(04 Jun 2026) ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE arXiv

(03 Jun 2026) VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding arXiv

(02 Jun 2026) Reinforcement Learning from Cross-domain Videos with Video Prediction Model arXiv

(02 Jun 2026) Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching arXiv

(19 May 2026) RECIPE: Procedural Planning via Grounding in Instructional Video arXiv

(18 May 2026) Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency arXiv

(15 May 2026) Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization arXiv

(14 May 2026) KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration arXiv

(14 May 2026) RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO arXiv

(14 May 2026) Video Models Can Reason with Verifiable Rewards arXiv

(13 May 2026) AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation arXiv

(12 May 2026) CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating arXiv

(11 May 2026) GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs arXiv

(08 May 2026) RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation arXiv

(08 May 2026) Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models arXiv

(07 May 2026) Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling arXiv

(07 May 2026) VISD: Enhancing Video Reasoning via Structured Self-Distillation arXiv

(06 May 2026) Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing arXiv

(03 May 2026) Act2See: Emergent Active Visual Perception for Video Reasoning arXiv

(02 May 2026) Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs arXiv

(01 May 2026) AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in Unified Multimodal Models via Decompositional Verifiable Reward arXiv

(01 May 2026) Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning arXiv

(30 Apr 2026) Generate Your Talking Avatar from Video Reference arXiv

(30 Apr 2026) AesRM: Improving Video Aesthetics with Expert-Level Feedback arXiv

(29 Apr 2026) DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation arXiv

(28 Apr 2026) OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding arXiv

(28 Apr 2026) MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding arXiv

(26 Apr 2026) Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference arXiv

(25 Apr 2026) UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks arXiv

(25 Apr 2026) StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning arXiv

(25 Apr 2026) EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs arXiv

(13 Apr 2026) Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding arXiv

(01 Apr 2026) Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs arXiv

(28 Mar 2026) Incentivizing Temporal-Awareness in Egocentric Video Understanding Models arXiv

(27 Mar 2026) Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning arXiv

(26 Mar 2026) VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning arXiv

(26 Mar 2026) Reinforcing Structured Chain-of-Thought for Video Understanding arXiv

(17 Mar 2026) When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition arXiv

(12 Mar 2026) Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models arXiv

(19 Feb 2026) GraphThinker: Reinforcing Video Reasoning with Event Graph Thinking arXiv

(12 Feb 2026) STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning arXiv

(30 Jan 2026) Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning arXiv

(28 Jan 2026) Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning arXiv

(27 Jan 2026) Video-KTR: Reinforcing Video Reasoning via Key Token Attribution arXiv

(08 Jan 2026) VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice arXiv

(07 Dec 2025) MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning arXiv

(02 Dec 2025) OneThinker: All-in-one Reasoning Model for Image and Video arXiv

(17 Nov 2025) ViSS-R1: Self-Supervised Reinforcement Video Reasoning arXiv

(23 Oct 2025) Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence arXiv

(9 Oct 2025) SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models arXiv

(06 Oct 2025) Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models arXiv

(5 Oct 2025) Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning arXiv

(29 Sep 2025) FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting arXiv

(29 Sep 2025) LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning arXiv

(28 Sep 2025) FrameMind: Frame-Interleaved Chain-of-Thought for Video Reasoning via Reinforcement Learning arXiv

(12 Jun 2025) CogStream: Context-guided Streaming Video Question Answering arXiv

(6 Jun 2025) VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning arXiv

(27 Mar 2025) Video-R1: Reinforcing Video Reasoning in MLLMs arXiv

(17 Feb 2025) video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model arXiv

(10 Feb 2025) CoS: Chain-of-Shot Prompting for Long Video Understanding arXiv

(8 Jan 2025) Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs arXiv

(3 Dec 2024) VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation arXiv

(29 Nov 2024) STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training arXiv

(12 Oct 2024) Interpretable Video based Stress Detection with Self-Refine Chain-of-thought Reasoning arXiv

(8 Oct 2024) Temporal Reasoning Transfer from Text to Video. arXiv

(27 Sep 2024) Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks arXiv

(28 Aug 2024) Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation arXiv

(24 May 2024) Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models arXiv

(7 May 2024) Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. arXiv code

DLLM

(06 Sep 2026) A Ticket from Marginals to Joints: Coupled-Noise Distillation for One-Step Block Generation in Diffusion Language Models arXiv

(03 Sep 2026) Unlocking Lossless Speedups in LLMs via Discrete Diffusion arXiv

(03 Sep 2026) Distilled Continuous Diffusion Language Models Can Write Code in Few Steps---or One arXiv

(26 Aug 2026) Prefix-Denoising Consistency: Test-Time Verification for Diffusion Language Models arXiv

(24 Aug 2026) SelFusion: Self-distillation for Diffusion Language Models arXiv

(20 Aug 2026) Discrete Diffusion Inference-Time Control with Nested Sequential Monte Carlo arXiv

(06 Aug 2026) Answer First, Reason Later: Commitment Order in Diffusion LLMs arXiv

(03 Aug 2026) Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models arXiv

(03 Aug 2026) OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models arXiv

(01 Aug 2026) Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs arXiv

(18 Jul 2026) Trace-Based On-Policy Distillation for Masked Diffusion Language Models arXiv

(16 Jul 2026) A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models arXiv

(16 Jul 2026) Mask-Aware Policy Gradients for Diffusion Language Models arXiv

(05 Jul 2026) dOPSD: On-Policy Self-Distillation for Diffusion Language Models arXiv

(01 Jul 2026) Diffusion-GR2: Diffusion Generative Reasoning Re-ranker arXiv

(16 Jun 2026) Learning from the Self-future: On-policy Self-distillation for dLLMs arXiv code

(11 Jun 2026) DiPOD: Diffusion Policy Optimization without Drifting Apart arXiv

(07 Jun 2026) Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models arXiv

(03 Jun 2026) Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models arXiv

(12 May 2026) Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models arXiv

(11 May 2026) Relative Score Policy Optimization for Diffusion Language Models arXiv

(08 May 2026) DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models arXiv

(04 May 2026) Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning arXiv

(29 Apr 2026) Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models arXiv

(27 Apr 2026) DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models arXiv

(07 Apr 2026) Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models arXiv

(23 Mar 2026) Tiny Inference-Time Scaling with Latent Verifiers arXiv

(12 Mar 2026) EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models arXiv

(06 Mar 2026) Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion arXiv

(12 Feb 2026) Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation arXiv

(31 Jan 2026) Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings arXiv

(29 Dec 2025) ThinkGen: Generalized Thinking for Visual Generation arXiv

(25 Dec 2025) Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration arXiv

(03 Dec 2025) ReasonX: MLLM-Guided Intrinsic Image Decomposition arXiv

(27 Nov 2025) ReasonEdit: Towards Reasoning-Enhanced Image Editing Models arXiv

(9 Oct 2025) Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization arXiv

(9 Oct 2025) Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization arXiv

Audio

(09 Sep 2026) Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models arXiv

(07 Sep 2026) Reasoning Beyond Transcription: Audio Language Models on Child Stuttering Speech arXiv

(03 Sep 2026) Test-time adaptation for speech enhancement with an autoregressive speech prior arXiv

(01 Sep 2026) TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models arXiv

(31 Aug 2026) SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards arXiv

(31 Aug 2026) When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models arXiv

(31 Aug 2026) Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols arXiv

(30 Aug 2026) TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models arXiv

(25 Aug 2026) AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models arXiv

(24 Aug 2026) Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering arXiv

(17 Aug 2026) Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization arXiv

(16 Aug 2026) VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation arXiv

(04 Aug 2026) Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization arXiv

(03 Aug 2026) Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning arXiv

(23 Jul 2026) X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment arXiv

(23 Jul 2026) OPOD: On-Policy Omni Distillation arXiv

(09 Jul 2026) When Synthetic Speech Is All You Have: Better Call GRPO arXiv

(08 Jul 2026) Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning arXiv

(02 Jul 2026) DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning arXiv

(02 Jul 2026) Reinforcement Learning for Data-Efficient Code-Switched ASR arXiv

(24 Jun 2026) Omni-Perception Policy Optimization for Multimodal Emotion Reasoning arXiv

(19 Jun 2026) Post-Training Speech Enhancement Language Models with Perceptual Rewards arXiv

(17 Jun 2026) ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection arXiv

(14 Jun 2026) AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction arXiv

(05 Jun 2026) Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models arXiv

(03 Jun 2026) Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention arXiv

(11 May 2026) Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought arXiv

(11 May 2026) EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs arXiv

(28 Apr 2026) Step-Audio-R1.5 Technical Report arXiv

(27 Apr 2026) Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning arXiv

(27 Apr 2026) Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs arXiv

(13 Apr 2026) Empowering Video Translation using Multimodal Large Language Models arXiv

(05 Mar 2026) SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning arXiv

(25 Jan 2026) AR-Omni: A Unified Autoregressive Model for Any-to-Any Generation arXiv

(23 Oct 2025) Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards arXiv

(10 Oct 2025) Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models arXiv

(8 Oct 2025) Can Speech LLMs Think while Listening? arXiv

(5 Oct 2025) Principled and Tractable RL for Reasoning with Diffusion Language Models arXiv

(22 Jul 2025) Step-Audio 2 Technical Report arXiv

(14 Mar 2025) Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering arXiv

Image/Video Generation

(08 Sep 2026) Let It Go or Learn to Self-Correct: Continuous Diffusion for Constrained Discrete Tasks arXiv

(07 Sep 2026) VoT: Vision-of-Thought for Unified Multimodal Representation Alignment arXiv

(04 Sep 2026) Importance-Aware Low-Rank Distillation of Diffusion Transformers arXiv

(02 Sep 2026) CrashDiffuser: VLM-Guided Collision Intent Reasoning for Fine-Grained Safety-Critical Traffic Scenario Generation arXiv

(01 Sep 2026) Diffusion as a Training Curriculum for Timestep-Free Iterative Reasoning arXiv

(28 Aug 2026) CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning arXiv

(26 Aug 2026) DCGC: Draft-Conditioned Global Correction for Complex Reasoning with Masked Diffusion Models arXiv

(21 Aug 2026) EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking arXiv

(17 Aug 2026) Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection arXiv

(05 Aug 2026) GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction arXiv

(29 Jul 2026) Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection arXiv

(20 Jul 2026) JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models arXiv

(05 Jul 2026) Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models arXiv

(04 Jul 2026) Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process arXiv

(03 Jul 2026) ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space arXiv

(15 Jun 2026) Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models arXiv

(12 Jun 2026) HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities arXiv

(11 Jun 2026) Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model arXiv

(01 Jun 2026) Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization arXiv

(19 May 2026) Inference-Time Scaling in Diffusion Models through Iterative Partial Refinement arXiv

(16 May 2026) Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models arXiv

(16 May 2026) TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward arXiv

(14 May 2026) DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models arXiv

(11 May 2026) Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models arXiv

(10 May 2026) SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning arXiv

(08 May 2026) Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria arXiv

(07 May 2026) Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models arXiv

(07 May 2026) Continuous-Time Distribution Matching for Few-Step Diffusion Distillation arXiv

(28 Apr 2026) The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents arXiv

(26 Apr 2026) ZID-Net: Zero-Inference Diffusion Prior Decoupling Network for Single Image Dehazing arXiv

(15 Apr 2026) Enhanced Text-to-Image Generation by Fine-grained Multimodal Reasoning arXiv

(14 Apr 2026) Representation geometry shapes task performance in vision-language modeling for CT enterography arXiv

(14 Apr 2026) PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning arXiv

(10 Mar 2026) Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization arXiv

(04 Mar 2026) Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks arXiv

(28 Jan 2026) Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought arXiv

(29 Dec 2025) REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation arXiv

(14 Dec 2025) Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space arXiv

(04 Dec 2025) DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation arXiv

(18 Nov 2025) UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning arXiv

(13 Nov 2025) Image Aesthetic Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance arXiv

(24 Oct 2025) Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation arXiv

(15 Oct 2025) Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation arXiv

(9 Oct 2025) Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing arXiv

(9 Oct 2025) Reinforcing Diffusion Models by Direct Group Preference Optimization arXiv

(9 Oct 2025) Real-Time Motion-Controllable Autoregressive Video Diffusion arXiv

(29 Sep 2025) STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation arXiv

(28 Aug 2025) Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance arXiv

(28 Aug 2025) OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning arXiv

(28 Aug 2025) Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning arXiv

(27 Aug 2025) CVBench: Evaluating Cross-Video Synergies for Complex Multimodal Understanding and Reasoning arXiv

(9 Aug 2025) AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning arXiv

(28 Jul 2025) Multimodal LLMs as Customized Reward Models for Text-to-Image Generation arXiv

(20 Jun 2025) RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought arXiv

(17 Jun 2025) SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks arXiv

(16 May 2025) Towards Self-Improvement of Diffusion Models via Group Preference Optimization arXiv

(16 May 2025) Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models arXiv

(15 May 2025) Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models arXiv

(12 May 2025) DanceGRPO: Unleashing GRPO on Visual Generation arXiv

(8 May 2025) Flow-GRPO: Training Flow Matching Models via Online RL arXiv

(1 May 2025) T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT arXiv

(22 Apr 2025) From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning arXiv

(22 Apr 2025) Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning arXiv

(26 Mar 2025) MMGen: Unified Multi-modal Image Generation and Understanding in One Go arXiv

(13 Mar 2025) GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing arXiv

(3 Mar 2025) MINT: Multi-modal Chain of Thought in Unified Generative Models for Enhanced Image Generation arXiv

(23 Jan 2025) Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step arXiv

Bench/Dataset

(06 Sep 2026) NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures arXiv

(04 Sep 2026) MMTClinic: Multimodal, Multilingual Time Series Question Answering and Reasoning Benchmark for Clinical Domain arXiv

(03 Sep 2026) MetaStructAtlas: A Grounded 3D Vision-Language Dataset and Benchmark for Functional and Structural Reasoning in Whole-Body PET/CT arXiv

(29 Aug 2026) CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions arXiv

(26 Aug 2026) Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs arXiv

(20 Aug 2026) Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms arXiv

(20 Aug 2026) SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces arXiv

(18 Aug 2026) BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models arXiv

(11 Aug 2026) Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes arXiv

(05 Aug 2026) OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing arXiv

(02 Aug 2026) LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning arXiv

(30 Jul 2026) OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models arXiv

(28 Jul 2026) Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification arXiv

(23 Jul 2026) Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text arXiv

(07 Jun 2026) Driv

Truncated — view the full README on GitHub.

agent
chain-of-thought
cot
image-generation
image-reasoning
image-understanding
large-language-models
llm
mllm
multimodal-learning
multimodal-reasoning
reinforcement-learning
rl
video-generation
video-reasoning
video-understanding
vlm

Contributors

The-Martyr

124 commits

ChaoYue0307

1 commits

reacher-z

1 commits

zwq2018

1 commits