LJungang/Awesome-Video-Reasoning-Landscape

🔥An open-source survey of the latest video reasoning tasks, paradigms, and benchmarks.

Python

191

148 commits

updated Sep 24, 2026

See the code

README

Video Reasoning Landscape

Awesome

🗺️ At a Glance

A curated survey of reasoning over videos, reasoning through visual generation, and building worlds for prediction and action.

The landscape has two complementary views: reasoning engines—text, frames, structured/latent states, and programs—and interaction loops—interleaving and streaming. A system can combine several engines within one loop.

Browse the Paper Atlas, choose a benchmark, or contribute a paper.

📖 Contents

🧭 Start Here: Choose Your Research Track
Your questionReadCompare on
Can a model answer from the right video evidence?Grounded Reasoning · Stateful IntelligenceCaST-Bench, SagaQA: answer correctness and evidence localization
Does generating a visual trajectory help solve a problem?Thinking in Visual FuturesVBVR-Pro, MME-CoF-Pro: intermediate rule validity and final success
Can a model construct and execute a consistent world?Executable WorldsWorldCoder-Bench: runtime state, physical constraints, and interaction contracts
Can an assistant search, remember, and respond at the right time?Active Video Agents · Always-On IntelligenceStreamArena, ProactiveBench: observed-prefix access, memory, and response timing
Do imagined futures improve action selection?World Models for ActionWorldArena: rollout fidelity and downstream decision utility

Mechanisms and access. Language traces, generated frames, structured memory, and executable programs are different intermediate representations. Tool use and streaming describe how a system accesses evidence; either can wrap several representations. RL and distillation describe training, not a separate reasoning mechanism.

Read world-model claims by component. GraphThinker organizes observed state; Code World Model separates executable state from learned rendering; Code-as-World searches for executable explanations of observations. Evaluate state estimation, transition rules, and rendering separately—one score cannot establish all three.

For a comparison protocol, use Choose Your Benchmark and the Evaluation Playbook. Modeling Notes defines the evidence loop and hybrid world interface; Worlds as Programs examines their scientific limits.

📚 Paper Atlas

Time is the first-public month; (proc.) marks a proceedings date with an unresolved earlier preprint. N/A means unrecorded or not applicable.

Input modalities & benchmark tasks

Badges describe supplied inputs, including optional conditioning. They exclude outputs, internal representations, and task names. Lists cover verified inputs and may be incomplete.

ModalityInputColor
![Text][mod-text]Questions, instructions, system prompts, transcripts, or textual context#AEC6DF
![Video][mod-video]Observed clips, streams, or temporally ordered frames#C3E6CB
![Audio][mod-audio]Waveforms, speech, or environmental sound#F7D6AE
![Image][mod-image]Still images or reference images#D7C4E8
![Depth][mod-depth]Depth maps or RGB-D observations#F2C6D6
![Point Cloud][mod-point-cloud]Observed 3D point sets#B9E3E0
![Action][mod-action]Control commands or action sequences supplied to a model#F6E3A9
![State][mod-state]Supplied object, environment, or robot states and structured annotations#D8DEE9
![Code][mod-code]Source code or programs supplied as input#C9C9F1
![Mesh][mod-mesh]Supplied 3D geometry or animated meshes#E0D0B8

Benchmark Task identifies the evaluated model family, not its input modality. Both badges indicate evaluation of both families; N/A means unspecified or outside these families.

TaskEvaluated reasoningColor
![language][task-language]Reasoning by language models, including multimodal LMs#AEC6DF
![vision][task-vision]Reasoning by visual generation models#C3E6CB

🧠 Reasoning Engines

🗒️ Grounded Reasoning

Language-led inference, evidence-linked training, distillation, and reliability.

PaperResourcesInput modalitiesTimeVenue
What Do Hallucinations Reveal About Multimodal Reasoning? Diagnosing Visual Grounding Failures via Contrastive Decoding Probes ![resource:code][res-github-code] Stars![Text][mod-text]2026-09arXiv
Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Long-to-Short Video Evidence Reasoning for Grounded Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
BodyCam-VQA: Enhanced Body-Worn Camera Video Captioning via Multimodal Reasoning and Probe Question Generation N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection N/A![Text][mod-text]2026-08arXiv
Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Video-FLAIR: Not Whether to Reason, But How N/A![Text][mod-text]2026-08arXiv
Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-08arXiv
Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos ![resource:project][res-project]![Text][mod-text]2026-08arXiv
AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition N/A![Text][mod-text]2026-07arXiv
CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Evidence-Backed Video Question Answering ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-07arXiv
TimeThink: Reasoning with Time for Video LLMs N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization N/A![Text][mod-text]2026-07arXiv
STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-07arXiv
EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Linguistic Relative Policy Optimization for Video Anomaly Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
APT: Atomic Physical Transitions for Causal Video-Language Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA N/A![Text][mod-text]2026-06arXiv
Temporal-Aware Reasoning Optimization for Video Temporal Grounding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA N/A![Text][mod-text]2026-06arXiv
See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA N/A![Text][mod-text]2026-06arXiv
CACR:Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation ![resource:code][res-github-code] Stars![Text][mod-text]2026-06arXiv
VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-06arXiv
Question-Aware Evidence Ledgers for Video Relational Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Training-Free Composed Video Retrieval via Visual Representation-Guided Video-LLM Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
TLG: Temporal-Logic Grounding for Video Question Answering via Source-Annotation Reconstruction and Category-Targeted Reasoning N/A![Text][mod-text] ![Video][mod-video] ![State][mod-state]2026-06arXiv
Perception First: A Frontier Native-Video Model with Self-Consistency for Implicit Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Disagreement-Based Cross-Model Routing for Implicit Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Reason, Retrieve, Re-rank: A Zero-Shot Reasoning-Aware Framework for Composed Video Retrieval N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Rethinking Video-Language Model from the Language Input Perspective N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Reflective Dialogue between Teacher and Solver Agents for Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis N/A![Text][mod-text]2026-05CVPR 2026
CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
SteerSeg: Attention Steering for Reasoning Video Segmentation ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
Video-Zero: Self-Evolution Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought N/A![Text][mod-text] ![Audio][mod-audio]2026-05arXiv
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
VISD: Enhancing Video Reasoning via Structured Self-Distillation N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling N/A![Text][mod-text]2026-05arXiv
From Priors to Perception: Grounding Video-LLMs in Physical Reality N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05CVPR 2026
Co-Evolving Policy Distillation N/A![Text][mod-text]2026-04arXiv
StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning N/A![Text][mod-text]2026-04arXiv
UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward N/A![Text][mod-text]2026-04arXiv
Seeing Fast and Slow: Learning the Flow of Time in Videos ![resource:project][res-project]![Text][mod-text]2026-04arXiv
EasyVideoR1: Easier RL for Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
Find, Fix, Reason: Context Repair for Video Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-04arXiv
Lost in Adaptation: Layer-Selective Recovery of Temporal Reasoning in Video-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding N/A![Text][mod-text]2026-04arXiv
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering ![resource:project][res-project]![Text][mod-text] ![Audio][mod-audio]2026-04arXiv
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
STEER: Structured Event Evidence for Video Reasoning via Multi-Objective Reinforcement Learning N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-04CVPR 2026
STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
Reinforcing Consistency in Video MLLMs with Structured Rewards N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
Reinforcing Structured Chain-of-Thought for Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models ![resource:project][res-project]![Text][mod-text]2026-03CVPR 2026
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
CoVR-R:Reason-Aware Composed Video Retrieval ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
Narrative Aligned Long Form Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Video-CoE: Reinforcing Video Event Prediction via Chain of Events N/A![Text][mod-text]2026-03CVPR 2026
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs ![resource:project][res-project]
![resource:code][res-github-code] Stars
![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
Beyond Single-Sample: Reliable Multi-Sample Distillation for Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Are Video Reasoning Models Ready to Go Outside? ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
Video-Based Reward Modeling for Computer-Use Agents N/A![Text][mod-text]2026-03arXiv
Geometry-Aware Semantic Reasoning for Training Free Video Anomaly Detection N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning N/A![Text][mod-text] ![Audio][mod-audio]2026-03arXiv
Weakly Supervised Video Anomaly Detection with Anomaly-Connected Components and Intention Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-02CVPR 2026
APPO: Attention-guided Perception Policy Optimization for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-02CVPR 2026
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning N/A![Text][mod-text]2026-02arXiv
Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning N/A![Text][mod-text]2026-02arXiv
VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning ![resource:code][res-github-code] Stars![Text][mod-text]2026-02arXiv
Process-of-Thought Reasoning for Videos N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention N/A![Text][mod-text] ![Audio][mod-audio]2026-02arXiv
AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization ![resource:project][res-project]![Text][mod-text] ![Audio][mod-audio]2026-02arXiv
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio N/A![Text][mod-text]2026-02arXiv
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Structure Over Scale: Learning Visual Reasoning from Pedagogical Video N/A![Text][mod-text]2026-01arXiv
Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning N/A![Text][mod-text]2026-01arXiv
Video-KTR: Reinforcing Video Reasoning via Key Token Attribution ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-01arXiv
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Audio][mod-audio]2026-01arXiv
Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos N/A![Text][mod-text]2026-01arXiv
Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning ![resource:code][res-github-code] Stars![Text][mod-text]2026-01arXiv
Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-01CVPR 2026
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-01arXiv
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
V-CORE: Temporally Consistent Video Understanding for Video-LLM N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Explicit Abstention Knobs for Predictable Reliability in Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2025-12arXiv
VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition N/A![Text][mod-text] ![Video][mod-video]2025-12ACL 2026
Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention N/A![Text][mod-text] ![Video][mod-video]2025-12arXiv
Factorized Learning for Temporally Grounded Video-Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-12arXiv
SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention Collapse N/A![Text][mod-text] ![Video][mod-video]2025-12arXiv
Xiaomi MiMo-VL-Miloco Technical Report ![resource:code][res-github-code] Stars![Text][mod-text]2025-12arXiv
Rethinking Chain-of-Thought Reasoning for Videos ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-12arXiv
1+1 > 2 : Detector-Empowered Video Large Language Model for Spatio-Temporal Grounding and Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-12arXiv
TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning N/A![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026
OneThinker: All-in-one Reasoning Model for Image and Video ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2025-11CVPR 2026
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-11arXiv
Video-CoM: Interactive Video Reasoning via Chain of Manipulations ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-11arXiv
VideoSeg-R1: Reasoning Video Object Segmentation via Reinforcement Learning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-11arXiv
AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning N/A![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-11arXiv
Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding N/A![Text][mod-text] ![Video][mod-video]2025-11arXiv
Video Spatial Reasoning with Object-Centric 3D Rollout N/A![Text][mod-text] ![Video][mod-video]2025-11arXiv
ViSS-R1: Self-Supervised Reinforcement Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-11arXiv
Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-10arXiv
Open-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-10arXiv
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-09arXiv
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-09arXiv
Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data ![resource:code][res-github-code] Stars
weights: Google_Drive
![Text][mod-text] ![Video][mod-video]2025-09arXiv
Kwai Keye-VL 1.5 Technical Report ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-09arXiv
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2025-08ICML 2026
Ovis2.5 Technical Report ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-08arXiv
Reinforcing Video Reasoning Segmentation to Think Before It Segments N/A![Text][mod-text] ![Video][mod-video]2025-08CVPR 2026
TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding N/A![Text][mod-text] ![Video][mod-video]2025-08ECCV 2026
ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-08arXiv
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-08arXiv
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-08CVPR 2026
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2025-08ACM-MM 2025
ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models N/A![Text][mod-text] ![Video][mod-video]2025-08arXiv
ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-07arXiv
METER: Multi-modal Evidence-based Thinking and Explainable Reasoning -- Algorithm and Benchmark N/A![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-07arXiv
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks N/A![Text][mod-text] ![Video][mod-video]2025-07arXiv
EmbRACE-3K: Embodied Reasoning and Action in Complex Environments N/A![Text][mod-text] ![Video][mod-video]2025-07arXiv
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-07ACM-MM 2025
Scaling RL to Long Videos ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-07NeurIPS 2025
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-07EMNLP 2025
Kwai Keye-VL Technical Report ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-07arXiv
Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames N/A![Text][mod-text] ![Video][mod-video]2025-07arXiv
DIVE: Deep-search Iterative Video Exploration ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06CVPR 2025
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-06arXiv
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06arXiv
DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
VideoDeepResearch: Long Video Understanding With Agentic Tool Using ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06arXiv
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-06arXiv
Wait, We Don't Need to "Wait"! Removing Thinking Tokens Improves Reasoning Efficiency N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06NeurIPS 2025
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
MiMo-VL Technical Report ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-06arXiv
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06EMNLP 2025 (Findings)
EgoVLM: Policy Optimization for Egocentric Video Understanding ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-06arXiv
Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-06arXiv
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06NeurIPS 2025
ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2025-06arXiv
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05CVPR 2026
SiLVR: A Simple Language-based Video Reasoning Framework ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05TMLR 2026
Reinforcing Video Reasoning with Focused Thinking ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05arXiv
Fostering Video Reasoning via Next-Event Prediction ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05arXiv
A2Seek: Towards Reasoning-Centric Benchmark for Aerial Anomaly Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05arXiv
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-05NeurIPS 2025
Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05NeurIPS 2025
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Guided Iterative Policy Optimization ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05arXiv
Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-05NeurIPS 2025
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05NeurIPS 2025
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05arXiv
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05NeurIPS 2025
VISTA: Mitigating Semantic Inertia in Video-LLMs via Training-Free Dynamic Chain-of-Thought Routing N/A![Text][mod-text] ![Video][mod-video]2025-05arXiv
Seed1.5-VL Technical Report N/A![Text][mod-text] ![Video][mod-video]2025-05arXiv
TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05arXiv
AVA: Towards Agentic Video Analytics with Vision Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05NSDI 2026
MR. Video: "MapReduce" is the Principle for Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-04arXiv
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-04arXiv
Multimodal Long Video Modeling Based on Temporal Dynamic Context ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-04arXiv
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-04arXiv
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-04arXiv
LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2025-04arXiv
Spatial-R1: Enhancing MLLMs in Video Spatial Reasoning ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-04arXiv
WikiVideo: Article Generation from Multiple Videos ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-04arXiv
Improved Visual-Spatial Reasoning via R1-Zero-Like Training ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-04arXiv
Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-03ICCV 2025
Video-R1: Reinforcing Video Reasoning in MLLMs ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-03NeurIPS 2025
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-03ICLR 2026
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-03NeurIPS 2025
ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos N/A![Text][mod-text] ![Video][mod-video]2025-03NeurIPS 2025
TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-02ACL 2025 (Oral)
video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-02arXiv
CoS: Chain-of-Shot Prompting for Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-02arXiv
Temporal Preference Optimization for Long-Form Video Understanding ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-01arXiv
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-01ACL 2025 (Findings)
MECD+: Unlocking Event-Level Causal Graph Discovery for Video Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-github-weights] Stars
![Text][mod-text] ![Video][mod-video]2025-01IEEE TPAMI
Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs N/A![Text][mod-text] ![Video][mod-video]2025-01arXiv
Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling ![resource:code][res-github-code] Stars
![resource:weights][res-github-weights] Stars
![Text][mod-text] ![Video][mod-video]2024-12arXiv
STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training N/A![Text][mod-text] ![Video][mod-video]2024-11CVPR 2025
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2024-11CVPR 2025
Adaptive Video Understanding Agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning N/A![Text][mod-text] ![Video][mod-video]2024-10NeurIPS 2024 (Workshop)
VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2024-09EMNLP 2024 (Findings)
MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-github-weights] Stars
![Text][mod-text] ![Video][mod-video]2024-09NeurIPS 2024 (Spotlight)
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2024-05ICML 2024

🎞️ Thinking in Visual Futures

Generated frames and visual updates as intermediate computation, including image-based bridges. Scene time and diffusion steps are distinct.

PaperResourcesInput modalitiesTimeVenue
Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-09arXiv
Visual prompt engineering for video models ![resource:project][res-project]![Video][mod-video]2026-07arXiv
Hierarchical Denoising For Multi-Step Visual Reasoning ![resource:project][res-project]![Video][mod-video]2026-07arXiv
OpenCoF: Learning to Reason Through Video Generation ![resource:project][res-project]![Video][mod-video]2026-07arXiv
DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models ![resource:code][res-github-code] Stars![Text][mod-text]2026-07arXiv
Temporal Backtracking Search for Test-time Generative Video Reasoning N/A![Video][mod-video]2026-06arXiv
Video Models Can Reason with Verifiable Rewards N/A![Text][mod-text]2026-05arXiv
Video Models Reason Early: Exploiting Plan Commitment for Maze Solving N/AN/A2026-03arXiv
Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning N/A![Video][mod-video]2026-03arXiv
Demystifying Video Reasoning N/A![Video][mod-video]2026-03arXiv
A Very Big Video Reasoning Suite ![resource:project][res-project]![Video][mod-video]2026-02arXiv
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning N/A![Video][mod-video]2026-01arXiv
Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models ![resource:project][res-project]N/A2026-01arXiv
CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation ![resource:code][res-github-code] Stars![Text][mod-text]2026-01arXiv
VideoCoF: Unified Video Editing with Temporal Reasoner ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Video][mod-video]2025-12CVPR 2026
McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning ![resource:code][res-github-code] StarsN/A2025-11arXiv
In-Video Instructions: Visual Signals as Generative Control ![resource:code][res-github-code] Stars![Image][mod-image]2025-11arXiv
Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text]2025-11arXiv
Reasoning via Video: The First Evaluation of Video Models’ Reasoning Abilities through Maze-Solving Tasks ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![resource:data][res-hf-data]
N/A2025-11arXiv
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm ![resource:code][res-github-code] StarsN/A2025-11arXiv
Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven’ Matrices ![resource:code][res-github-code] StarsN/A2025-11arXiv
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
N/A2025-10arXiv
VChain: Chain-of-Visual-Thought for Reasoning in Video Generation ![resource:code][res-github-code] StarsN/A2025-10ACL 2026 (Findings)

🧩 Stateful Intelligence

Graphs, tracks, spatial maps, and latent reasoning states. Observed memory and imagined state play different roles.

PaperResourcesInput modalitiesTimeVenue
EgoSIS: From Factorized Visual Ego-Transitions to Motion-Canonical Spatial Evidence for UAV Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Interpretable Temporal Video Reasoning with EventGraph and EventField N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning N/A![Text][mod-text]2026-09arXiv
StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward N/A![Text][mod-text]2026-08arXiv
R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models N/A![Text][mod-text] ![Audio][mod-audio]2026-08arXiv
Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
ChronoVision: Temporal Reasoning via Latent State Reconstruction N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
LAVE: Latent Visual Evidence-Enhanced Planning for Video Tool-use Agents N/A![Video][mod-video]2026-08arXiv
Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning N/A![Text][mod-text]2026-08arXiv
Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation Detection N/AN/A2026-07arXiv
ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding N/A![Video][mod-video]2026-07arXiv
ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning ![resource:code][res-github-code] Stars![Video][mod-video]2026-07arXiv
Whareformer: Learning to Track What is Where in Long Egocentric Videos ![resource:project][res-project]![Video][mod-video]2026-07arXiv
Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-07arXiv
SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Latent Visual Cache for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-06arXiv
DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
VideoLatent: Video-Language Learning via Latent Self-Forcing N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
ProPlay: Procedural World Models for Self-Evolving LLM Agents ![resource:code][res-github-code] Stars![Text][mod-text]2026-06arXiv
From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding N/A![Text][mod-text]2026-06arXiv
Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning ![resource:project][res-project]![Text][mod-text]2026-06arXiv
MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning N/A![Text][mod-text]2026-05arXiv
Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning N/A![Text][mod-text]2026-05arXiv
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Cambrian-P: Pose-Grounded Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
Bernini: Latent Semantic Planning for Video Diffusion ![resource:project][res-project]![Text][mod-text]2026-05arXiv
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning N/A![Text][mod-text] ![Audio][mod-audio]2026-05arXiv
Δynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue ![resource:code][res-github-code] Stars![Text][mod-text]2026-05arXiv
PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning N/A![Video][mod-video]2026-05arXiv
LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map N/AN/A2026-05CVPR 2026
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Rethinking Temporal Consistency in Video Object-Centric Learning: From Prediction to Correspondence N/AN/A2026-05arXiv
Scaling Video Understanding via Compact Latent Multi-Agent Collaboration N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
ONOTE: Hypergraph-Grounded Omnimodal Reasoning for Computational Music Science N/AN/A2026-04arXiv
Frequency-guided Multi-level Reasoning for Scene Graph Generation in Video N/AN/A2026-04arXiv
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-04ACL 2026
Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-04CVPR 2026
A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video ![resource:project][res-project]![Text][mod-text]2026-04arXiv
Learning Multi-View Spatial Reasoning from Cross-View Relations N/A![Text][mod-text]2026-03CVPR 2026
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning ![resource:project][res-project]![Text][mod-text]2026-03CVPR 2026
Make Geometry Matter for Spatial Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03ACL 2026
Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning N/AN/A2026-03CVPR 2026
Motion-o: Trajectory-Grounded Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Towards Stable Self-Supervised Object Representations in Unconstrained Egocentric Video N/A![Video][mod-video]2026-03CVPR 2026
Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
EgoReasoner: Learning Egocentric 4D Reasoning via Task-Adaptive Structured Thinking N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Thinking with Spatial Code for Physical-World Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
SCP: Spatial Causal Prediction in Video ![resource:project][res-project]N/A2026-03arXiv
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
TrajTok: Learning Trajectory Tokens enables better Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models N/A![Text][mod-text]2026-02CVPR 2026
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning ![resource:code][res-github-code] Stars![Video][mod-video]2026-02arXiv
MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Spatial-Conditioned Reasoning in Long-Egocentric Videos N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA N/A![Video][mod-video]2026-01arXiv
MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-01arXiv
Semantic Event Graphs for Long-Form Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models N/A![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026
4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026

💻 Executable Worlds

Executable state, transitions, simulators, and learned rendering. Includes direct video systems and adjacent visual/planning foundations; see the case study.

PaperResourcesInput modalitiesTimeVenue
Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs N/A![Image][mod-image]2026-09arXiv
Programmable World Model ![resource:project][res-project]
![resource:code][res-github-code] Stars
![Text][mod-text]2026-09arXiv
Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
Code World Model: Coding Agent as World Brain ![resource:project][res-project]
![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![resource:weights][res-hf-weights]
![Text][mod-text] ![Image][mod-image]2026-08arXiv
Compiling VGDL into Causal Models N/A![Text][mod-text]2026-08arXiv
AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents N/AN/A2026-08arXiv
PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3 ![resource:code][res-github-code] Stars![Text][mod-text]2026-07arXiv
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System N/A![Text][mod-text]2026-07arXiv
VisualPatchWorld: Code World Models as Latent Structured Representations for Planning ![resource:code][res-github-code] StarsN/A2026-07arXiv
Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents ![resource:project][res-project]![Text][mod-text]2026-07arXiv
PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation ![resource:project][res-project]![Text][mod-text]2026-07arXiv
Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3? N/A![Text][mod-text]2026-07arXiv
When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models ![resource:code][res-github-code] Stars![Text][mod-text]2026-07arXiv
World-Time Compute with Verified Code World Models ![resource:code][res-github-code] Stars![Text][mod-text]2026-07arXiv
OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration for ARC-AGI-3 N/A![Text][mod-text]2026-07arXiv
World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration N/AN/A2026-06arXiv
STRIPS-WM: Learning Grounded Propositional STRIPS-style World Models from Images N/A![Image][mod-image]2026-06arXiv
PatchWorld: Gradient-Free Optimization of Executable World Models for Agent Environments ![resource:code][res-github-code] Stars![Text][mod-text]2026-05arXiv
Distilling Game Code World Model Generation into Lightweight Large Language Models N/A![Text][mod-text]2026-05arXiv
SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation ![resource:project][res-project]N/A2026-05arXiv
Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning N/A![Video][mod-video]2026-05arXiv
Executable World Models for ARC-AGI-3 in the Era of Coding Agents ![resource:code][res-github-code] Stars![Text][mod-text]2026-05arXiv
Physical Simulator In-the-Loop Video Generation N/AN/A2026-03CVPR 2026
SimRecon: SimReady Compositional Scene Reconstruction from Real Videos ![resource:project][res-project]![Video][mod-video]2026-03CVPR 2026
OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling N/A![Text][mod-text]2026-02arXiv
Neuro-Symbolic Synergy for World Modeling ![resource:code][res-github-code] Stars![Text][mod-text]2026-02arXiv
Code2World: A GUI World Model via Renderable Code Generation ![resource:code][res-github-code] Stars
![resource:project][res-project]
![Text][mod-text] ![Action][mod-action]2026-02arXiv
Generative Visual Code Mobile World Models N/A![Text][mod-text]2026-02arXiv
CASSANDRA: Programmatic and Probabilistic Learning and Inference for Stochastic World Modeling N/A![Text][mod-text]2026-01arXiv
Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback ![resource:project][res-project]![Text][mod-text]2025-12arXiv
Generating Code World Models with Large Language Models Guided by Monte Carlo Tree Search N/A![Text][mod-text]2024-05arXiv
WorldCoder, a Model-Based LLM Agent: Building World Models by Writing Code and Interacting with the Environment N/A![Text][mod-text]2024-02arXiv

🔄 Interaction Loops

🛠️ Active Video Agents

Tool use, evidence search, reflection, and agent coordination. Full-recording retrieval remains an offline access setting.

PaperResourcesInput modalitiesTimeVenue
VideoScout: Learning Agentic Active Exploration with Adaptive Reasoning Pacing for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Online Video Agent Harness for Long Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-09arXiv
One Skill Does Not Fit All: Automatic Discovery and Taxonomy-Guided Routing of Frame-Selection Skills for Long-Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
VLX-VR: An Agentic-Aware Video Reasoning Model N/A![Video][mod-video]2026-09arXiv
Thinking with Cameras: Active Visual Reasoning via Dynamic Viewpoint Control for Surveillance Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-09arXiv
Visual Search Augmented Chain-of-Thought Reasoning for Attribute Value Extraction from Product Videos N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents N/AN/A2026-08arXiv
Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research N/A![Video][mod-video]2026-08arXiv
VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents N/A![Video][mod-video]2026-08arXiv
Coarse Indexing, Fine Evidence: Decoupling Temporal Granularity in Long-Video RAG N/A![Text][mod-text]2026-08arXiv
TRACE: Temporal Retrieval with Anchored and Convergent Evidence for Long-Horizon Video Understanding ![resource:project][res-project]![Video][mod-video]2026-08arXiv
Routing Before Looking: Query-Adaptive Evidence Acquisition for Long-form Video Understanding N/A![Video][mod-video]2026-08arXiv
MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
VTO: Visual Tool Orchestration for Video Anomaly Detection ![resource:code][res-github-code] Stars![Video][mod-video]2026-08arXiv
SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning N/A![Video][mod-video]2026-08arXiv
SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding N/AN/A2026-08arXiv
Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection ![resource:project][res-project]![Text][mod-text]2026-08arXiv
MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding ![resource:code][res-github-code] Stars![Video][mod-video]2026-08arXiv
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent ![resource:code][res-github-code] Stars![Text][mod-text]2026-08arXiv
When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-08arXiv
AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding N/A![Video][mod-video]2026-08arXiv
ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation N/A![Text][mod-text]2026-07arXiv
MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
OmniReasoner: Thinking with Long Audio-Video via Native Tool Use ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2026-07arXiv
Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection N/AN/A2026-07arXiv
Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-07arXiv
Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-07arXiv
SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection ![resource:code][res-github-code] Stars![Text][mod-text]2026-07arXiv
Incentivizing Vision Language Models to Search for Long Video Question Answering ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-07arXiv
VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning ![resource:project][res-project]
![resource:code][res-github-code] Stars
![Text][mod-text]2026-07arXiv
Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization N/A![Video][mod-video]2026-07arXiv
Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning N/A![Text][mod-text]2026-07arXiv
VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Confidence-Aware Tool Orchestration for Robust Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-06arXiv
video-SALMONN-R³: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
VideoAgent: All-in-One Framework for Video Understanding and Editing ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence ![resource:project][res-project]![Text][mod-text]2026-06arXiv
Native Active Perception as Reasoning for Omni-Modal Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning N/AN/A2026-06arXiv
Orchestra-o1: Omnimodal Agent Orchestration N/A![Text][mod-text]2026-06arXiv
MAVIS: Multi-Agent Video Retrieval via Structured Video Understanding N/A![Video][mod-video]2026-06ACL 2026 (Findings)
VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning N/A![Video][mod-video]2026-06arXiv
AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning N/A![Text][mod-text] ![Audio][mod-audio]2026-05arXiv
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval ![resource:code][res-github-code] Stars![Text][mod-text]2026-05arXiv
ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding ![resource:project][res-project]![Video][mod-video]2026-05arXiv
ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models N/A![Text][mod-text]2026-05arXiv
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA N/A![Text][mod-text]2026-05arXiv
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Act2See: Emergent Active Visual Perception for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-05CVPR 2026
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning N/A![Audio][mod-audio]2026-04arXiv
Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference N/A![Text][mod-text]2026-04arXiv
HiCrew: Hierarchical Reasoning for Long-Form Video Understanding via Question-Aware Multi-Agent Collaboration N/A![Video][mod-video]2026-04arXiv
Video-ToC: Video Tree-of-Cue Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-04arXiv
IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory ![resource:code][res-github-code] Stars![Video][mod-video]2026-04arXiv
Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding N/A![Video][mod-video]2026-04arXiv
Open-Ended Video Game Glitch Detection with Agentic Reasoning and Temporal Grounding N/AN/A2026-04arXiv
RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection N/A![Text][mod-text]2026-04arXiv
SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration N/A![Video][mod-video]2026-04CVPR 2026
QVAD: A Question-Centric Agentic Framework for Efficient and Training-Free Video Anomaly Detection N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation N/A![Text][mod-text] ![Audio][mod-audio]2026-03arXiv
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
LensWalk: Agentic Video Understanding by Planning How You See in Videos N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation ![resource:project][res-project]![Text][mod-text]2026-03arXiv
EVA: Efficient Reinforcement Learning for End-to-End Video Agent N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
VideoAtlas: Navigating Long-Form Video in Logarithmic Compute N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Interpretable Traffic Responsibility from Dashcam Video via Legal Multi Agent Reasoning N/A![Text][mod-text]2026-03arXiv
Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
LLandMark: A Multi-Agent Framework for Landmark-Aware Multimodal Interactive Video Retrieval N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning N/A![Text][mod-text]2026-02arXiv
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-02CVPR 2026
VIGiA: Instructional Video Guidance via Dialogue Reasoning and Retrieval N/A![Video][mod-video]2026-02arXiv
Towards Sparse Video Understanding and Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-02CVPR 2026
MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Agentic Spatio-Temporal Grounding via Collaborative Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning N/A![Video][mod-video]2026-02arXiv
VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-02arXiv
OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering N/A![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2026-02arXiv
Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation ![resource:code][res-github-code] Stars![Text][mod-text]2026-02CVPR 2026
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Agentic Very Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-01ACL 2026
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search N/A![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2026-01CVPR 2026
TIR-Flow: Active Video Search and Reasoning with Frozen VLMs N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation N/A![Text][mod-text] ![Video][mod-video]2026-01ACL 2026
Active Perception Agent for Omnimodal Audio-Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-12arXiv
Video-Browser: Towards Agentic Open-web Video Browsing ![resource:code][res-github-code] Stars![Video][mod-video]2025-12arXiv
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-12arXiv
LongVideoAgent: Multi-Agent Reasoning with Long Videos ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2025-12ACL 2026
Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos N/A![Text][mod-text] ![Video][mod-video]2025-12arXiv
AdaTooler-V: Adaptive Tool-Use for Images and Videos ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Image][mod-image]2025-12ACL 2026 (Findings)
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-11CVPR 2026
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-11arXiv
Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution N/A![Text][mod-text]2025-11arXiv
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-10arXiv
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning N/A![Video][mod-video]2025-09arXiv
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-08arXiv
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-07ACM-MM 2025

🔁 Unified Understanding & Generation

Architectures combining understanding and generation; iterative reasoning requires separate evidence.

📡 Always-On Intelligence

Observed-prefix reasoning, persistent memory, response timing, and proactive interaction.

PaperResourcesInput modalitiesTimeVenue
SVMemAgent: A Streaming Video Memory Agent for Query-Agnostic Online Frame Selection N/A![Video][mod-video]2026-09arXiv
Omni-Streaming Thinking N/A![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2026-09arXiv
ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-09arXiv
Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-09arXiv
StreamScout: Learning When to Look Deeper for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Dynamic Hub-and-Spoke Memory for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Emotion Understanding in Streaming Video with Trajectory-Aware Reliability N/A![Video][mod-video]2026-08arXiv
Strictly Causal Streaming Video Anomaly Detection with a Theoretically-Grounded State-Space Core N/A![Video][mod-video]2026-08arXiv
StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding ![resource:project][res-project]![Video][mod-video]2026-08arXiv
StreamFlow: Dynamic Memory Flows for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience ![resource:code][res-github-code] Stars![Video][mod-video]2026-08arXiv
Think in Sets for Streaming Video Token Compression N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-07arXiv
Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos N/A![Text][mod-text]2026-07arXiv
FOLIO: Focused Semantic Memory for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos ![resource:project][res-project]![Video][mod-video]2026-07arXiv
Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-07arXiv
ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams N/A![Video][mod-video]2026-07arXiv
GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-07arXiv
ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory N/A![Video][mod-video]2026-06arXiv
Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency N/AN/A2026-06arXiv
CoVStream: Edge-Cloud Collaboration for Understanding of Long Video Streams N/A![Video][mod-video]2026-06arXiv
LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
What Should a Streaming Video Model Remember? N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
AdaSR: Adaptive Streaming Reasoning with Hierarchical Relative Policy Optimization ![resource:code][res-github-code] Stars![Text][mod-text] ![Audio][mod-audio]2026-06arXiv
DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction N/A![Video][mod-video] ![Audio][mod-audio]2026-06arXiv
Harnessing Streaming Video in the Wild N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
FlowNar: Scalable Streaming Narration for Long-Form Videos ![resource:code][res-github-code] Stars![Text][mod-text]2026-05arXiv
OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2026-05arXiv
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering N/A![Video][mod-video] ![Audio][mod-audio]2026-05arXiv
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05CVPR 2026
An Efficient Streaming Video Understanding Framework with Agentic Control N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant N/A![Text][mod-text]2026-05arXiv
StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video N/A![Video][mod-video]2026-05arXiv
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-05ACL 2026
Decouple and Cache: KV Cache Construction for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-04CVPR 2026
Online Reasoning Video Object Segmentation N/AN/A2026-04arXiv
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding ![resource:code][res-github-code] Stars![Video][mod-video]2026-04ACL 2026 (Findings)
ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-04arXiv
CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference N/A![Text][mod-text]2026-04arXiv
AURA: Always-On Understanding and Real-Time Assistance via Video Streams N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
A Simple Baseline for Streaming Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-04arXiv
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
GazeQwen: Lightweight Gaze-Conditioned LLM Modulation for Streaming Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
StreamingClaw Technical Report N/A![Video][mod-video]2026-03arXiv
PEARL: Personalized Streaming Video Understanding Model ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Thinking in Streaming Video ![resource:code][res-github-code] Stars![Video][mod-video]2026-03arXiv
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03ECCV 2026
WAT: Online Video Understanding Needs Watching Before Thinking N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
StreamReady: Learning What to Answer and When in Long Streaming Videos N/A![Video][mod-video]2026-03CVPR 2026
Proact-VL: A Proactive VideoLLM for Real-Time AI Companions N/A![Text][mod-text]2026-03arXiv
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models ![resource:code][res-github-code] Stars![Text][mod-text]2026-03CVPR 2026
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding N/A![Video][mod-video]2026-03CVPR 2026
From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03ACL 2026
RT-NeuS: Towards Real-Time Neuro-Symbolic Video Understanding via Adaptive Temporal Verification N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-02CVPR 2026
Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-02arXiv
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-02arXiv
Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-01ACL 2026
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding ![resource:project][res-project]![Text][mod-text]2026-01ACL 2026 (Findings)
Streaming Video Instruction Tuning N/A![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-12arXiv
LiveStar: Live Streaming Assistant for Real-World Online Video Understanding ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-11NeurIPS 2025
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-10ACM-MM 2025
StreamingVLM: Real-Time Understanding for Infinite Video Streams ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-10ICLR 2026
StreamForest: Efficient Online Video Understanding with Persistent Event Memory ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-09NeurIPS 2025 (Spotlight)
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding N/A![Video][mod-video]2025-08arXiv
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text]2025-07ICRA 2026
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-06ICCV 2025
LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval N/A![Text][mod-text] ![Video][mod-video]2025-05DAC 2026
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05NeurIPS 2025
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-04ACM-MM 2025
LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-04CVPR 2025
ViSpeak: Visual Instruction Feedback in Streaming Videos ![resource:code][res-github-code] Stars
![resource:weights][res-github-weights] Stars
![Text][mod-text] ![Video][mod-video]2025-03ICCV 2025
StreamMind: Unlocking Full Frame Rate Streaming Video Dialogue through Event-Gated Cognition ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-03ICCV 2025
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-03ICLR 2025
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-02ICLR 2025 (Spotlight)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-01ICLR 2025
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-01CVPR 2025
Online Video Understanding: OVBench and VideoChat-Online ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2024-12CVPR 2025
StreamChat: Chatting with Streaming Video N/A![Text][mod-text] ![Video][mod-video]2024-12arXiv

🔎 Evidence & Action

🔎 Evidence at Scale

Frame selection, token compression, temporal grounding, and audio-visual representations supporting reasoning.

PaperResourcesInput modalitiesTimeVenue
VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-09arXiv
MarKey: Marginal Utility Guided Greedy Keyframe Selection for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
IAE-VTG: Interaction-Aligned Action-Entity Video Temporal Grounding N/A![Video][mod-video]2026-09arXiv
DSE-VTG: Dual-Side Enhancement for Training-Free Video Temporal Grounding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-09arXiv
RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Training-Free Temporal Abstraction for General Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
[LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding](h

Truncated — view the full README on GitHub.

artificial-intelligence
awesome
benchmarks
chain-of-frames
chain-of-thought
large-language-models
multimodal-large-language-models
omni
paper-list
real-time-video-understanding
streaming-video-reasoning
streaming-video-understanding
think-with-video
video-generation
video-reasoning
world-model

Contributors

LJungang

119 commits

Qin-CX

18 commits

hardenyu21

3 commits

LJungang/Awesome-Video-Reasoning-Landscape

🔥An open-source survey of the latest video reasoning tasks, paradigms, and benchmarks.

Python

191

148 commits

updated Sep 24, 2026

See the code

README

Video Reasoning Landscape

Awesome

🗺️ At a Glance

A curated survey of reasoning over videos, reasoning through visual generation, and building worlds for prediction and action.

The landscape has two complementary views: reasoning engines—text, frames, structured/latent states, and programs—and interaction loops—interleaving and streaming. A system can combine several engines within one loop.

Browse the Paper Atlas, choose a benchmark, or contribute a paper.

📖 Contents

🧭 Start Here: Choose Your Research Track
Your questionReadCompare on
Can a model answer from the right video evidence?Grounded Reasoning · Stateful IntelligenceCaST-Bench, SagaQA: answer correctness and evidence localization
Does generating a visual trajectory help solve a problem?Thinking in Visual FuturesVBVR-Pro, MME-CoF-Pro: intermediate rule validity and final success
Can a model construct and execute a consistent world?Executable WorldsWorldCoder-Bench: runtime state, physical constraints, and interaction contracts
Can an assistant search, remember, and respond at the right time?Active Video Agents · Always-On IntelligenceStreamArena, ProactiveBench: observed-prefix access, memory, and response timing
Do imagined futures improve action selection?World Models for ActionWorldArena: rollout fidelity and downstream decision utility

Mechanisms and access. Language traces, generated frames, structured memory, and executable programs are different intermediate representations. Tool use and streaming describe how a system accesses evidence; either can wrap several representations. RL and distillation describe training, not a separate reasoning mechanism.

Read world-model claims by component. GraphThinker organizes observed state; Code World Model separates executable state from learned rendering; Code-as-World searches for executable explanations of observations. Evaluate state estimation, transition rules, and rendering separately—one score cannot establish all three.

For a comparison protocol, use Choose Your Benchmark and the Evaluation Playbook. Modeling Notes defines the evidence loop and hybrid world interface; Worlds as Programs examines their scientific limits.

📚 Paper Atlas

Time is the first-public month; (proc.) marks a proceedings date with an unresolved earlier preprint. N/A means unrecorded or not applicable.

Input modalities & benchmark tasks

Badges describe supplied inputs, including optional conditioning. They exclude outputs, internal representations, and task names. Lists cover verified inputs and may be incomplete.

ModalityInputColor
![Text][mod-text]Questions, instructions, system prompts, transcripts, or textual context#AEC6DF
![Video][mod-video]Observed clips, streams, or temporally ordered frames#C3E6CB
![Audio][mod-audio]Waveforms, speech, or environmental sound#F7D6AE
![Image][mod-image]Still images or reference images#D7C4E8
![Depth][mod-depth]Depth maps or RGB-D observations#F2C6D6
![Point Cloud][mod-point-cloud]Observed 3D point sets#B9E3E0
![Action][mod-action]Control commands or action sequences supplied to a model#F6E3A9
![State][mod-state]Supplied object, environment, or robot states and structured annotations#D8DEE9
![Code][mod-code]Source code or programs supplied as input#C9C9F1
![Mesh][mod-mesh]Supplied 3D geometry or animated meshes#E0D0B8

Benchmark Task identifies the evaluated model family, not its input modality. Both badges indicate evaluation of both families; N/A means unspecified or outside these families.

TaskEvaluated reasoningColor
![language][task-language]Reasoning by language models, including multimodal LMs#AEC6DF
![vision][task-vision]Reasoning by visual generation models#C3E6CB

🧠 Reasoning Engines

🗒️ Grounded Reasoning

Language-led inference, evidence-linked training, distillation, and reliability.

PaperResourcesInput modalitiesTimeVenue
What Do Hallucinations Reveal About Multimodal Reasoning? Diagnosing Visual Grounding Failures via Contrastive Decoding Probes ![resource:code][res-github-code] Stars![Text][mod-text]2026-09arXiv
Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Long-to-Short Video Evidence Reasoning for Grounded Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
BodyCam-VQA: Enhanced Body-Worn Camera Video Captioning via Multimodal Reasoning and Probe Question Generation N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection N/A![Text][mod-text]2026-08arXiv
Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Video-FLAIR: Not Whether to Reason, But How N/A![Text][mod-text]2026-08arXiv
Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-08arXiv
Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos ![resource:project][res-project]![Text][mod-text]2026-08arXiv
AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition N/A![Text][mod-text]2026-07arXiv
CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Evidence-Backed Video Question Answering ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-07arXiv
TimeThink: Reasoning with Time for Video LLMs N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization N/A![Text][mod-text]2026-07arXiv
STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-07arXiv
EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Linguistic Relative Policy Optimization for Video Anomaly Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
APT: Atomic Physical Transitions for Causal Video-Language Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA N/A![Text][mod-text]2026-06arXiv
Temporal-Aware Reasoning Optimization for Video Temporal Grounding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA N/A![Text][mod-text]2026-06arXiv
See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA N/A![Text][mod-text]2026-06arXiv
CACR:Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation ![resource:code][res-github-code] Stars![Text][mod-text]2026-06arXiv
VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-06arXiv
Question-Aware Evidence Ledgers for Video Relational Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Training-Free Composed Video Retrieval via Visual Representation-Guided Video-LLM Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
TLG: Temporal-Logic Grounding for Video Question Answering via Source-Annotation Reconstruction and Category-Targeted Reasoning N/A![Text][mod-text] ![Video][mod-video] ![State][mod-state]2026-06arXiv
Perception First: A Frontier Native-Video Model with Self-Consistency for Implicit Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Disagreement-Based Cross-Model Routing for Implicit Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Reason, Retrieve, Re-rank: A Zero-Shot Reasoning-Aware Framework for Composed Video Retrieval N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Rethinking Video-Language Model from the Language Input Perspective N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Reflective Dialogue between Teacher and Solver Agents for Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis N/A![Text][mod-text]2026-05CVPR 2026
CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
SteerSeg: Attention Steering for Reasoning Video Segmentation ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
Video-Zero: Self-Evolution Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought N/A![Text][mod-text] ![Audio][mod-audio]2026-05arXiv
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
VISD: Enhancing Video Reasoning via Structured Self-Distillation N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling N/A![Text][mod-text]2026-05arXiv
From Priors to Perception: Grounding Video-LLMs in Physical Reality N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05CVPR 2026
Co-Evolving Policy Distillation N/A![Text][mod-text]2026-04arXiv
StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning N/A![Text][mod-text]2026-04arXiv
UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward N/A![Text][mod-text]2026-04arXiv
Seeing Fast and Slow: Learning the Flow of Time in Videos ![resource:project][res-project]![Text][mod-text]2026-04arXiv
EasyVideoR1: Easier RL for Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
Find, Fix, Reason: Context Repair for Video Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-04arXiv
Lost in Adaptation: Layer-Selective Recovery of Temporal Reasoning in Video-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding N/A![Text][mod-text]2026-04arXiv
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering ![resource:project][res-project]![Text][mod-text] ![Audio][mod-audio]2026-04arXiv
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
STEER: Structured Event Evidence for Video Reasoning via Multi-Objective Reinforcement Learning N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-04CVPR 2026
STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
Reinforcing Consistency in Video MLLMs with Structured Rewards N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
Reinforcing Structured Chain-of-Thought for Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models ![resource:project][res-project]![Text][mod-text]2026-03CVPR 2026
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
CoVR-R:Reason-Aware Composed Video Retrieval ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
Narrative Aligned Long Form Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Video-CoE: Reinforcing Video Event Prediction via Chain of Events N/A![Text][mod-text]2026-03CVPR 2026
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs ![resource:project][res-project]
![resource:code][res-github-code] Stars
![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
Beyond Single-Sample: Reliable Multi-Sample Distillation for Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Are Video Reasoning Models Ready to Go Outside? ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
Video-Based Reward Modeling for Computer-Use Agents N/A![Text][mod-text]2026-03arXiv
Geometry-Aware Semantic Reasoning for Training Free Video Anomaly Detection N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning N/A![Text][mod-text] ![Audio][mod-audio]2026-03arXiv
Weakly Supervised Video Anomaly Detection with Anomaly-Connected Components and Intention Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-02CVPR 2026
APPO: Attention-guided Perception Policy Optimization for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-02CVPR 2026
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning N/A![Text][mod-text]2026-02arXiv
Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning N/A![Text][mod-text]2026-02arXiv
VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning ![resource:code][res-github-code] Stars![Text][mod-text]2026-02arXiv
Process-of-Thought Reasoning for Videos N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention N/A![Text][mod-text] ![Audio][mod-audio]2026-02arXiv
AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization ![resource:project][res-project]![Text][mod-text] ![Audio][mod-audio]2026-02arXiv
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio N/A![Text][mod-text]2026-02arXiv
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Structure Over Scale: Learning Visual Reasoning from Pedagogical Video N/A![Text][mod-text]2026-01arXiv
Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning N/A![Text][mod-text]2026-01arXiv
Video-KTR: Reinforcing Video Reasoning via Key Token Attribution ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-01arXiv
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Audio][mod-audio]2026-01arXiv
Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos N/A![Text][mod-text]2026-01arXiv
Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning ![resource:code][res-github-code] Stars![Text][mod-text]2026-01arXiv
Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-01CVPR 2026
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-01arXiv
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
V-CORE: Temporally Consistent Video Understanding for Video-LLM N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Explicit Abstention Knobs for Predictable Reliability in Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2025-12arXiv
VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition N/A![Text][mod-text] ![Video][mod-video]2025-12ACL 2026
Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention N/A![Text][mod-text] ![Video][mod-video]2025-12arXiv
Factorized Learning for Temporally Grounded Video-Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-12arXiv
SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention Collapse N/A![Text][mod-text] ![Video][mod-video]2025-12arXiv
Xiaomi MiMo-VL-Miloco Technical Report ![resource:code][res-github-code] Stars![Text][mod-text]2025-12arXiv
Rethinking Chain-of-Thought Reasoning for Videos ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-12arXiv
1+1 > 2 : Detector-Empowered Video Large Language Model for Spatio-Temporal Grounding and Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-12arXiv
TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning N/A![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026
OneThinker: All-in-one Reasoning Model for Image and Video ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2025-11CVPR 2026
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-11arXiv
Video-CoM: Interactive Video Reasoning via Chain of Manipulations ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-11arXiv
VideoSeg-R1: Reasoning Video Object Segmentation via Reinforcement Learning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-11arXiv
AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning N/A![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-11arXiv
Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding N/A![Text][mod-text] ![Video][mod-video]2025-11arXiv
Video Spatial Reasoning with Object-Centric 3D Rollout N/A![Text][mod-text] ![Video][mod-video]2025-11arXiv
ViSS-R1: Self-Supervised Reinforcement Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-11arXiv
Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-10arXiv
Open-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-10arXiv
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-09arXiv
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-09arXiv
Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data ![resource:code][res-github-code] Stars
weights: Google_Drive
![Text][mod-text] ![Video][mod-video]2025-09arXiv
Kwai Keye-VL 1.5 Technical Report ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-09arXiv
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2025-08ICML 2026
Ovis2.5 Technical Report ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-08arXiv
Reinforcing Video Reasoning Segmentation to Think Before It Segments N/A![Text][mod-text] ![Video][mod-video]2025-08CVPR 2026
TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding N/A![Text][mod-text] ![Video][mod-video]2025-08ECCV 2026
ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-08arXiv
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-08arXiv
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-08CVPR 2026
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2025-08ACM-MM 2025
ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models N/A![Text][mod-text] ![Video][mod-video]2025-08arXiv
ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-07arXiv
METER: Multi-modal Evidence-based Thinking and Explainable Reasoning -- Algorithm and Benchmark N/A![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-07arXiv
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks N/A![Text][mod-text] ![Video][mod-video]2025-07arXiv
EmbRACE-3K: Embodied Reasoning and Action in Complex Environments N/A![Text][mod-text] ![Video][mod-video]2025-07arXiv
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-07ACM-MM 2025
Scaling RL to Long Videos ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-07NeurIPS 2025
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-07EMNLP 2025
Kwai Keye-VL Technical Report ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-07arXiv
Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames N/A![Text][mod-text] ![Video][mod-video]2025-07arXiv
DIVE: Deep-search Iterative Video Exploration ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06CVPR 2025
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-06arXiv
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06arXiv
DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
VideoDeepResearch: Long Video Understanding With Agentic Tool Using ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06arXiv
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-06arXiv
Wait, We Don't Need to "Wait"! Removing Thinking Tokens Improves Reasoning Efficiency N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06NeurIPS 2025
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
MiMo-VL Technical Report ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-06arXiv
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06EMNLP 2025 (Findings)
EgoVLM: Policy Optimization for Egocentric Video Understanding ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-06arXiv
Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-06arXiv
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-06NeurIPS 2025
ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding N/A![Text][mod-text] ![Video][mod-video]2025-06arXiv
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2025-06arXiv
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05CVPR 2026
SiLVR: A Simple Language-based Video Reasoning Framework ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05TMLR 2026
Reinforcing Video Reasoning with Focused Thinking ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05arXiv
Fostering Video Reasoning via Next-Event Prediction ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05arXiv
A2Seek: Towards Reasoning-Centric Benchmark for Aerial Anomaly Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05arXiv
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-05NeurIPS 2025
Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05NeurIPS 2025
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Guided Iterative Policy Optimization ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05arXiv
Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-05NeurIPS 2025
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05NeurIPS 2025
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05arXiv
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05NeurIPS 2025
VISTA: Mitigating Semantic Inertia in Video-LLMs via Training-Free Dynamic Chain-of-Thought Routing N/A![Text][mod-text] ![Video][mod-video]2025-05arXiv
Seed1.5-VL Technical Report N/A![Text][mod-text] ![Video][mod-video]2025-05arXiv
TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-05arXiv
AVA: Towards Agentic Video Analytics with Vision Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05NSDI 2026
MR. Video: "MapReduce" is the Principle for Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-04arXiv
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-04arXiv
Multimodal Long Video Modeling Based on Temporal Dynamic Context ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-04arXiv
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-04arXiv
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-04arXiv
LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2025-04arXiv
Spatial-R1: Enhancing MLLMs in Video Spatial Reasoning ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-04arXiv
WikiVideo: Article Generation from Multiple Videos ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-04arXiv
Improved Visual-Spatial Reasoning via R1-Zero-Like Training ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-04arXiv
Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-03ICCV 2025
Video-R1: Reinforcing Video Reasoning in MLLMs ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-03NeurIPS 2025
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-03ICLR 2026
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-03NeurIPS 2025
ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos N/A![Text][mod-text] ![Video][mod-video]2025-03NeurIPS 2025
TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-02ACL 2025 (Oral)
video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-02arXiv
CoS: Chain-of-Shot Prompting for Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-02arXiv
Temporal Preference Optimization for Long-Form Video Understanding ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-01arXiv
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-01ACL 2025 (Findings)
MECD+: Unlocking Event-Level Causal Graph Discovery for Video Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-github-weights] Stars
![Text][mod-text] ![Video][mod-video]2025-01IEEE TPAMI
Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs N/A![Text][mod-text] ![Video][mod-video]2025-01arXiv
Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling ![resource:code][res-github-code] Stars
![resource:weights][res-github-weights] Stars
![Text][mod-text] ![Video][mod-video]2024-12arXiv
STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training N/A![Text][mod-text] ![Video][mod-video]2024-11CVPR 2025
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2024-11CVPR 2025
Adaptive Video Understanding Agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning N/A![Text][mod-text] ![Video][mod-video]2024-10NeurIPS 2024 (Workshop)
VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2024-09EMNLP 2024 (Findings)
MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning ![resource:code][res-github-code] Stars
![resource:weights][res-github-weights] Stars
![Text][mod-text] ![Video][mod-video]2024-09NeurIPS 2024 (Spotlight)
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2024-05ICML 2024

🎞️ Thinking in Visual Futures

Generated frames and visual updates as intermediate computation, including image-based bridges. Scene time and diffusion steps are distinct.

PaperResourcesInput modalitiesTimeVenue
Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-09arXiv
Visual prompt engineering for video models ![resource:project][res-project]![Video][mod-video]2026-07arXiv
Hierarchical Denoising For Multi-Step Visual Reasoning ![resource:project][res-project]![Video][mod-video]2026-07arXiv
OpenCoF: Learning to Reason Through Video Generation ![resource:project][res-project]![Video][mod-video]2026-07arXiv
DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models ![resource:code][res-github-code] Stars![Text][mod-text]2026-07arXiv
Temporal Backtracking Search for Test-time Generative Video Reasoning N/A![Video][mod-video]2026-06arXiv
Video Models Can Reason with Verifiable Rewards N/A![Text][mod-text]2026-05arXiv
Video Models Reason Early: Exploiting Plan Commitment for Maze Solving N/AN/A2026-03arXiv
Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning N/A![Video][mod-video]2026-03arXiv
Demystifying Video Reasoning N/A![Video][mod-video]2026-03arXiv
A Very Big Video Reasoning Suite ![resource:project][res-project]![Video][mod-video]2026-02arXiv
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning N/A![Video][mod-video]2026-01arXiv
Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models ![resource:project][res-project]N/A2026-01arXiv
CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation ![resource:code][res-github-code] Stars![Text][mod-text]2026-01arXiv
VideoCoF: Unified Video Editing with Temporal Reasoner ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Video][mod-video]2025-12CVPR 2026
McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning ![resource:code][res-github-code] StarsN/A2025-11arXiv
In-Video Instructions: Visual Signals as Generative Control ![resource:code][res-github-code] Stars![Image][mod-image]2025-11arXiv
Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text]2025-11arXiv
Reasoning via Video: The First Evaluation of Video Models’ Reasoning Abilities through Maze-Solving Tasks ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![resource:data][res-hf-data]
N/A2025-11arXiv
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm ![resource:code][res-github-code] StarsN/A2025-11arXiv
Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven’ Matrices ![resource:code][res-github-code] StarsN/A2025-11arXiv
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
N/A2025-10arXiv
VChain: Chain-of-Visual-Thought for Reasoning in Video Generation ![resource:code][res-github-code] StarsN/A2025-10ACL 2026 (Findings)

🧩 Stateful Intelligence

Graphs, tracks, spatial maps, and latent reasoning states. Observed memory and imagined state play different roles.

PaperResourcesInput modalitiesTimeVenue
EgoSIS: From Factorized Visual Ego-Transitions to Motion-Canonical Spatial Evidence for UAV Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Interpretable Temporal Video Reasoning with EventGraph and EventField N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning N/A![Text][mod-text]2026-09arXiv
StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward N/A![Text][mod-text]2026-08arXiv
R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models N/A![Text][mod-text] ![Audio][mod-audio]2026-08arXiv
Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
ChronoVision: Temporal Reasoning via Latent State Reconstruction N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
LAVE: Latent Visual Evidence-Enhanced Planning for Video Tool-use Agents N/A![Video][mod-video]2026-08arXiv
Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning N/A![Text][mod-text]2026-08arXiv
Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation Detection N/AN/A2026-07arXiv
ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding N/A![Video][mod-video]2026-07arXiv
ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning ![resource:code][res-github-code] Stars![Video][mod-video]2026-07arXiv
Whareformer: Learning to Track What is Where in Long Egocentric Videos ![resource:project][res-project]![Video][mod-video]2026-07arXiv
Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-07arXiv
SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Latent Visual Cache for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-06arXiv
DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
VideoLatent: Video-Language Learning via Latent Self-Forcing N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
ProPlay: Procedural World Models for Self-Evolving LLM Agents ![resource:code][res-github-code] Stars![Text][mod-text]2026-06arXiv
From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding N/A![Text][mod-text]2026-06arXiv
Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning ![resource:project][res-project]![Text][mod-text]2026-06arXiv
MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning N/A![Text][mod-text]2026-05arXiv
Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning N/A![Text][mod-text]2026-05arXiv
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Cambrian-P: Pose-Grounded Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
Bernini: Latent Semantic Planning for Video Diffusion ![resource:project][res-project]![Text][mod-text]2026-05arXiv
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning N/A![Text][mod-text] ![Audio][mod-audio]2026-05arXiv
Δynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue ![resource:code][res-github-code] Stars![Text][mod-text]2026-05arXiv
PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning N/A![Video][mod-video]2026-05arXiv
LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map N/AN/A2026-05CVPR 2026
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Rethinking Temporal Consistency in Video Object-Centric Learning: From Prediction to Correspondence N/AN/A2026-05arXiv
Scaling Video Understanding via Compact Latent Multi-Agent Collaboration N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
ONOTE: Hypergraph-Grounded Omnimodal Reasoning for Computational Music Science N/AN/A2026-04arXiv
Frequency-guided Multi-level Reasoning for Scene Graph Generation in Video N/AN/A2026-04arXiv
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-04ACL 2026
Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-04CVPR 2026
A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video ![resource:project][res-project]![Text][mod-text]2026-04arXiv
Learning Multi-View Spatial Reasoning from Cross-View Relations N/A![Text][mod-text]2026-03CVPR 2026
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning ![resource:project][res-project]![Text][mod-text]2026-03CVPR 2026
Make Geometry Matter for Spatial Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03ACL 2026
Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning N/AN/A2026-03CVPR 2026
Motion-o: Trajectory-Grounded Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Towards Stable Self-Supervised Object Representations in Unconstrained Egocentric Video N/A![Video][mod-video]2026-03CVPR 2026
Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
EgoReasoner: Learning Egocentric 4D Reasoning via Task-Adaptive Structured Thinking N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Thinking with Spatial Code for Physical-World Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
SCP: Spatial Causal Prediction in Video ![resource:project][res-project]N/A2026-03arXiv
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
TrajTok: Learning Trajectory Tokens enables better Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models N/A![Text][mod-text]2026-02CVPR 2026
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning ![resource:code][res-github-code] Stars![Video][mod-video]2026-02arXiv
MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Spatial-Conditioned Reasoning in Long-Egocentric Videos N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA N/A![Video][mod-video]2026-01arXiv
MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-01arXiv
Semantic Event Graphs for Long-Form Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models N/A![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026
4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026

💻 Executable Worlds

Executable state, transitions, simulators, and learned rendering. Includes direct video systems and adjacent visual/planning foundations; see the case study.

PaperResourcesInput modalitiesTimeVenue
Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs N/A![Image][mod-image]2026-09arXiv
Programmable World Model ![resource:project][res-project]
![resource:code][res-github-code] Stars
![Text][mod-text]2026-09arXiv
Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
Code World Model: Coding Agent as World Brain ![resource:project][res-project]
![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![resource:weights][res-hf-weights]
![Text][mod-text] ![Image][mod-image]2026-08arXiv
Compiling VGDL into Causal Models N/A![Text][mod-text]2026-08arXiv
AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents N/AN/A2026-08arXiv
PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3 ![resource:code][res-github-code] Stars![Text][mod-text]2026-07arXiv
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System N/A![Text][mod-text]2026-07arXiv
VisualPatchWorld: Code World Models as Latent Structured Representations for Planning ![resource:code][res-github-code] StarsN/A2026-07arXiv
Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents ![resource:project][res-project]![Text][mod-text]2026-07arXiv
PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation ![resource:project][res-project]![Text][mod-text]2026-07arXiv
Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3? N/A![Text][mod-text]2026-07arXiv
When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models ![resource:code][res-github-code] Stars![Text][mod-text]2026-07arXiv
World-Time Compute with Verified Code World Models ![resource:code][res-github-code] Stars![Text][mod-text]2026-07arXiv
OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration for ARC-AGI-3 N/A![Text][mod-text]2026-07arXiv
World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration N/AN/A2026-06arXiv
STRIPS-WM: Learning Grounded Propositional STRIPS-style World Models from Images N/A![Image][mod-image]2026-06arXiv
PatchWorld: Gradient-Free Optimization of Executable World Models for Agent Environments ![resource:code][res-github-code] Stars![Text][mod-text]2026-05arXiv
Distilling Game Code World Model Generation into Lightweight Large Language Models N/A![Text][mod-text]2026-05arXiv
SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation ![resource:project][res-project]N/A2026-05arXiv
Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning N/A![Video][mod-video]2026-05arXiv
Executable World Models for ARC-AGI-3 in the Era of Coding Agents ![resource:code][res-github-code] Stars![Text][mod-text]2026-05arXiv
Physical Simulator In-the-Loop Video Generation N/AN/A2026-03CVPR 2026
SimRecon: SimReady Compositional Scene Reconstruction from Real Videos ![resource:project][res-project]![Video][mod-video]2026-03CVPR 2026
OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling N/A![Text][mod-text]2026-02arXiv
Neuro-Symbolic Synergy for World Modeling ![resource:code][res-github-code] Stars![Text][mod-text]2026-02arXiv
Code2World: A GUI World Model via Renderable Code Generation ![resource:code][res-github-code] Stars
![resource:project][res-project]
![Text][mod-text] ![Action][mod-action]2026-02arXiv
Generative Visual Code Mobile World Models N/A![Text][mod-text]2026-02arXiv
CASSANDRA: Programmatic and Probabilistic Learning and Inference for Stochastic World Modeling N/A![Text][mod-text]2026-01arXiv
Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback ![resource:project][res-project]![Text][mod-text]2025-12arXiv
Generating Code World Models with Large Language Models Guided by Monte Carlo Tree Search N/A![Text][mod-text]2024-05arXiv
WorldCoder, a Model-Based LLM Agent: Building World Models by Writing Code and Interacting with the Environment N/A![Text][mod-text]2024-02arXiv

🔄 Interaction Loops

🛠️ Active Video Agents

Tool use, evidence search, reflection, and agent coordination. Full-recording retrieval remains an offline access setting.

PaperResourcesInput modalitiesTimeVenue
VideoScout: Learning Agentic Active Exploration with Adaptive Reasoning Pacing for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Online Video Agent Harness for Long Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-09arXiv
One Skill Does Not Fit All: Automatic Discovery and Taxonomy-Guided Routing of Frame-Selection Skills for Long-Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
VLX-VR: An Agentic-Aware Video Reasoning Model N/A![Video][mod-video]2026-09arXiv
Thinking with Cameras: Active Visual Reasoning via Dynamic Viewpoint Control for Surveillance Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-09arXiv
Visual Search Augmented Chain-of-Thought Reasoning for Attribute Value Extraction from Product Videos N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents N/AN/A2026-08arXiv
Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research N/A![Video][mod-video]2026-08arXiv
VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents N/A![Video][mod-video]2026-08arXiv
Coarse Indexing, Fine Evidence: Decoupling Temporal Granularity in Long-Video RAG N/A![Text][mod-text]2026-08arXiv
TRACE: Temporal Retrieval with Anchored and Convergent Evidence for Long-Horizon Video Understanding ![resource:project][res-project]![Video][mod-video]2026-08arXiv
Routing Before Looking: Query-Adaptive Evidence Acquisition for Long-form Video Understanding N/A![Video][mod-video]2026-08arXiv
MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-08arXiv
REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
VTO: Visual Tool Orchestration for Video Anomaly Detection ![resource:code][res-github-code] Stars![Video][mod-video]2026-08arXiv
SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning N/A![Video][mod-video]2026-08arXiv
SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding N/AN/A2026-08arXiv
Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection ![resource:project][res-project]![Text][mod-text]2026-08arXiv
MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding ![resource:code][res-github-code] Stars![Video][mod-video]2026-08arXiv
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent ![resource:code][res-github-code] Stars![Text][mod-text]2026-08arXiv
When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-08arXiv
AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding N/A![Video][mod-video]2026-08arXiv
ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation N/A![Text][mod-text]2026-07arXiv
MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
OmniReasoner: Thinking with Long Audio-Video via Native Tool Use ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2026-07arXiv
Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection N/AN/A2026-07arXiv
Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-07arXiv
Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-07arXiv
SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection ![resource:code][res-github-code] Stars![Text][mod-text]2026-07arXiv
Incentivizing Vision Language Models to Search for Long Video Question Answering ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-07arXiv
VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning ![resource:project][res-project]
![resource:code][res-github-code] Stars
![Text][mod-text]2026-07arXiv
Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization N/A![Video][mod-video]2026-07arXiv
Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning N/A![Text][mod-text]2026-07arXiv
VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Confidence-Aware Tool Orchestration for Robust Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-06arXiv
video-SALMONN-R³: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
VideoAgent: All-in-One Framework for Video Understanding and Editing ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence ![resource:project][res-project]![Text][mod-text]2026-06arXiv
Native Active Perception as Reasoning for Omni-Modal Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning N/AN/A2026-06arXiv
Orchestra-o1: Omnimodal Agent Orchestration N/A![Text][mod-text]2026-06arXiv
MAVIS: Multi-Agent Video Retrieval via Structured Video Understanding N/A![Video][mod-video]2026-06ACL 2026 (Findings)
VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning N/A![Video][mod-video]2026-06arXiv
AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning N/A![Text][mod-text] ![Audio][mod-audio]2026-05arXiv
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval ![resource:code][res-github-code] Stars![Text][mod-text]2026-05arXiv
ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding ![resource:project][res-project]![Video][mod-video]2026-05arXiv
ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models N/A![Text][mod-text]2026-05arXiv
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-05arXiv
AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA N/A![Text][mod-text]2026-05arXiv
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Act2See: Emergent Active Visual Perception for Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-05CVPR 2026
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning N/A![Audio][mod-audio]2026-04arXiv
Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference N/A![Text][mod-text]2026-04arXiv
HiCrew: Hierarchical Reasoning for Long-Form Video Understanding via Question-Aware Multi-Agent Collaboration N/A![Video][mod-video]2026-04arXiv
Video-ToC: Video Tree-of-Cue Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-04arXiv
IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory ![resource:code][res-github-code] Stars![Video][mod-video]2026-04arXiv
Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding N/A![Video][mod-video]2026-04arXiv
Open-Ended Video Game Glitch Detection with Agentic Reasoning and Temporal Grounding N/AN/A2026-04arXiv
RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection N/A![Text][mod-text]2026-04arXiv
SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration N/A![Video][mod-video]2026-04CVPR 2026
QVAD: A Question-Centric Agentic Framework for Efficient and Training-Free Video Anomaly Detection N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation N/A![Text][mod-text] ![Audio][mod-audio]2026-03arXiv
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
LensWalk: Agentic Video Understanding by Planning How You See in Videos N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation ![resource:project][res-project]![Text][mod-text]2026-03arXiv
EVA: Efficient Reinforcement Learning for End-to-End Video Agent N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking N/A![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
VideoAtlas: Navigating Long-Form Video in Logarithmic Compute N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Interpretable Traffic Responsibility from Dashcam Video via Legal Multi Agent Reasoning N/A![Text][mod-text]2026-03arXiv
Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03CVPR 2026
LLandMark: A Multi-Agent Framework for Landmark-Aware Multimodal Interactive Video Retrieval N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning N/A![Text][mod-text]2026-02arXiv
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-02CVPR 2026
VIGiA: Instructional Video Guidance via Dialogue Reasoning and Retrieval N/A![Video][mod-video]2026-02arXiv
Towards Sparse Video Understanding and Reasoning ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-02CVPR 2026
MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Agentic Spatio-Temporal Grounding via Collaborative Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning N/A![Video][mod-video]2026-02arXiv
VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-02arXiv
OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering N/A![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2026-02arXiv
Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation ![resource:code][res-github-code] Stars![Text][mod-text]2026-02CVPR 2026
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Agentic Very Long Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-01ACL 2026
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search N/A![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2026-01CVPR 2026
TIR-Flow: Active Video Search and Reasoning with Frozen VLMs N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation N/A![Text][mod-text] ![Video][mod-video]2026-01ACL 2026
Active Perception Agent for Omnimodal Audio-Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-12arXiv
Video-Browser: Towards Agentic Open-web Video Browsing ![resource:code][res-github-code] Stars![Video][mod-video]2025-12arXiv
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-12arXiv
LongVideoAgent: Multi-Agent Reasoning with Long Videos ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2025-12ACL 2026
Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos N/A![Text][mod-text] ![Video][mod-video]2025-12arXiv
AdaTooler-V: Adaptive Tool-Use for Images and Videos ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Image][mod-image]2025-12ACL 2026 (Findings)
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-11CVPR 2026
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-11arXiv
Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution N/A![Text][mod-text]2025-11arXiv
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning N/A![Text][mod-text] ![Video][mod-video]2025-10arXiv
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning N/A![Video][mod-video]2025-09arXiv
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-08arXiv
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-07ACM-MM 2025

🔁 Unified Understanding & Generation

Architectures combining understanding and generation; iterative reasoning requires separate evidence.

📡 Always-On Intelligence

Observed-prefix reasoning, persistent memory, response timing, and proactive interaction.

PaperResourcesInput modalitiesTimeVenue
SVMemAgent: A Streaming Video Memory Agent for Query-Agnostic Online Frame Selection N/A![Video][mod-video]2026-09arXiv
Omni-Streaming Thinking N/A![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2026-09arXiv
ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-09arXiv
Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-09arXiv
StreamScout: Learning When to Look Deeper for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Dynamic Hub-and-Spoke Memory for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Emotion Understanding in Streaming Video with Trajectory-Aware Reliability N/A![Video][mod-video]2026-08arXiv
Strictly Causal Streaming Video Anomaly Detection with a Theoretically-Grounded State-Space Core N/A![Video][mod-video]2026-08arXiv
StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding ![resource:project][res-project]![Video][mod-video]2026-08arXiv
StreamFlow: Dynamic Memory Flows for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience ![resource:code][res-github-code] Stars![Video][mod-video]2026-08arXiv
Think in Sets for Streaming Video Token Compression N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-07arXiv
Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos N/A![Text][mod-text]2026-07arXiv
FOLIO: Focused Semantic Memory for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-07arXiv
Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos ![resource:project][res-project]![Video][mod-video]2026-07arXiv
Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-07arXiv
ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams N/A![Video][mod-video]2026-07arXiv
GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-07arXiv
ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory N/A![Video][mod-video]2026-06arXiv
Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency N/AN/A2026-06arXiv
CoVStream: Edge-Cloud Collaboration for Understanding of Long Video Streams N/A![Video][mod-video]2026-06arXiv
LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
What Should a Streaming Video Model Remember? N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-06arXiv
AdaSR: Adaptive Streaming Reasoning with Hierarchical Relative Policy Optimization ![resource:code][res-github-code] Stars![Text][mod-text] ![Audio][mod-audio]2026-06arXiv
DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction N/A![Video][mod-video] ![Audio][mod-audio]2026-06arXiv
Harnessing Streaming Video in the Wild N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention N/A![Text][mod-text] ![Video][mod-video]2026-06arXiv
FlowNar: Scalable Streaming Narration for Long-Form Videos ![resource:code][res-github-code] Stars![Text][mod-text]2026-05arXiv
OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2026-05arXiv
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering N/A![Video][mod-video] ![Audio][mod-audio]2026-05arXiv
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05CVPR 2026
An Efficient Streaming Video Understanding Framework with Agentic Control N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-05arXiv
CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant N/A![Text][mod-text]2026-05arXiv
StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video N/A![Video][mod-video]2026-05arXiv
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-05ACL 2026
Decouple and Cache: KV Cache Construction for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-05arXiv
Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-04CVPR 2026
Online Reasoning Video Object Segmentation N/AN/A2026-04arXiv
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding ![resource:code][res-github-code] Stars![Video][mod-video]2026-04ACL 2026 (Findings)
ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-04arXiv
CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference N/A![Text][mod-text]2026-04arXiv
AURA: Always-On Understanding and Real-Time Assistance via Video Streams N/A![Text][mod-text] ![Video][mod-video]2026-04arXiv
A Simple Baseline for Streaming Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-04arXiv
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-03arXiv
GazeQwen: Lightweight Gaze-Conditioned LLM Modulation for Streaming Video Understanding ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
StreamingClaw Technical Report N/A![Video][mod-video]2026-03arXiv
PEARL: Personalized Streaming Video Understanding Model ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Thinking in Streaming Video ![resource:code][res-github-code] Stars![Video][mod-video]2026-03arXiv
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03ECCV 2026
WAT: Online Video Understanding Needs Watching Before Thinking N/A![Text][mod-text] ![Video][mod-video]2026-03arXiv
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03arXiv
StreamReady: Learning What to Answer and When in Long Streaming Videos N/A![Video][mod-video]2026-03CVPR 2026
Proact-VL: A Proactive VideoLLM for Real-Time AI Companions N/A![Text][mod-text]2026-03arXiv
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models ![resource:code][res-github-code] Stars![Text][mod-text]2026-03CVPR 2026
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding N/A![Video][mod-video]2026-03CVPR 2026
From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-03ACL 2026
RT-NeuS: Towards Real-Time Neuro-Symbolic Video Understanding via Adaptive Temporal Verification N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-02CVPR 2026
Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory ![resource:project][res-project]![Text][mod-text] ![Video][mod-video]2026-02arXiv
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-02arXiv
Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-02arXiv
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams N/A![Text][mod-text] ![Video][mod-video]2026-01arXiv
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-01ACL 2026
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding ![resource:project][res-project]![Text][mod-text]2026-01ACL 2026 (Findings)
Streaming Video Instruction Tuning N/A![Text][mod-text] ![Video][mod-video]2025-12CVPR 2026
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-12arXiv
LiveStar: Live Streaming Assistant for Real-World Online Video Understanding ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-11NeurIPS 2025
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-10ACM-MM 2025
StreamingVLM: Real-Time Understanding for Infinite Video Streams ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-10ICLR 2026
StreamForest: Efficient Online Video Understanding with Persistent Event Memory ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-09NeurIPS 2025 (Spotlight)
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding N/A![Video][mod-video]2025-08arXiv
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text]2025-07ICRA 2026
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-06ICCV 2025
LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval N/A![Text][mod-text] ![Video][mod-video]2025-05DAC 2026
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-05NeurIPS 2025
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-04ACM-MM 2025
LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video] ![Audio][mod-audio]2025-04CVPR 2025
ViSpeak: Visual Instruction Feedback in Streaming Videos ![resource:code][res-github-code] Stars
![resource:weights][res-github-weights] Stars
![Text][mod-text] ![Video][mod-video]2025-03ICCV 2025
StreamMind: Unlocking Full Frame Rate Streaming Video Dialogue through Event-Gated Cognition ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-03ICCV 2025
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2025-03ICLR 2025
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-02ICLR 2025 (Spotlight)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2025-01ICLR 2025
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction ![resource:code][res-github-code] Stars
![resource:weights][res-hf-weights]
![Text][mod-text] ![Video][mod-video]2025-01CVPR 2025
Online Video Understanding: OVBench and VideoChat-Online ![resource:code][res-github-code] Stars
![resource:data][res-hf-data]
![Text][mod-text] ![Video][mod-video]2024-12CVPR 2025
StreamChat: Chatting with Streaming Video N/A![Text][mod-text] ![Video][mod-video]2024-12arXiv

🔎 Evidence & Action

🔎 Evidence at Scale

Frame selection, token compression, temporal grounding, and audio-visual representations supporting reasoning.

PaperResourcesInput modalitiesTimeVenue
VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-09arXiv
MarKey: Marginal Utility Guided Greedy Keyframe Selection for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
IAE-VTG: Interaction-Aligned Action-Entity Video Temporal Grounding N/A![Video][mod-video]2026-09arXiv
DSE-VTG: Dual-Side Enhancement for Training-Free Video Temporal Grounding N/A![Text][mod-text] ![Video][mod-video]2026-09arXiv
Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs ![resource:code][res-github-code] Stars![Text][mod-text] ![Video][mod-video]2026-09arXiv
RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
Training-Free Temporal Abstraction for General Video Understanding N/A![Text][mod-text] ![Video][mod-video]2026-08arXiv
[LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding](h

Truncated — view the full README on GitHub.

artificial-intelligence
awesome
benchmarks
chain-of-frames
chain-of-thought
large-language-models
multimodal-large-language-models
omni
paper-list
real-time-video-understanding
streaming-video-reasoning
streaming-video-understanding
think-with-video
video-generation
video-reasoning
world-model

Contributors

LJungang

119 commits

Qin-CX

18 commits

hardenyu21

3 commits

Languages

Python

95.8%

JavaScript

3.6%