marinero4972/Awesome-HumanView-VideoUnderstanding

[survey] Watch, Remember, Reason: Human-View Video Understanding with MLLMs

39

26 commits

updated Sep 11, 2026

See the code

README

Awesome PR's Welcome

Watch, Remember, Reason: Human-View Video Understanding with MLLMs


Jiahao Meng · Yue Tan · Qi Xu · Kuan Gao · Weisong Liu · Yanwei Li · Jason Li
Lingdong Kong · Haochen Wang · Qianyu Zhou · Jiangning Zhang · Guangliang Cheng
Yunhai Tong · Lu Qi · Ming-Hsuan Yang

Paper PDF


Overview

This repository accompanies our survey, which takes a human-view perspective on LLM/MLLM-based video understanding by decomposing it into three core cognitive abilities and reviewing how recent methods realize each:

  • Watch — perceptual grounding of multimodal video streams: fine-grained spatio-temporal grounding, comprehensive captioning, audio-visual (omni-modal) perception, and efficient long-video processing.
  • Remember — maintaining context over long or streaming inputs: offline memory (agentic vs. non-agent) and streaming memory.
  • Reason — deriving grounded answers from perceived and retained evidence: text-only reasoning and the emerging thinking-with-videos paradigm, each split into agentic and non-agent approaches.

Beyond methods, the survey covers domain-specific subfields (egocentric, sports, instructional, medical, narrative videos), training datasets and evaluation benchmarks across major task types and capability dimensions, and open problems on the path to scalable, memory-aware, evidence-grounded video intelligence.

Table of Contents


1. Watch — How to Watch?

Watching corresponds to the perceptual stage where models transform raw multimodal inputs into structured representations. We organize methods along four complementary dimensions.

1.1 Fine-grained Watching

Precise spatio-temporal grounding: time representation, long-video efficiency, structured decoding, fine-grained perception architectures, and verifiable post-training. Includes both flagship methods (Table 2) and the broader family cited in §3.1.1 (temporal grounding, spatio-temporal grounding, video referring).

Temporal grounding & VTG-style methods

YearVenueAcronymPaperCode / Project
2023ICCVSOONetScanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long VideosCode
2023NeurIPSSeViLASelf-Chained Image-Language Model for Video Localization and Question AnsweringCode
2024CVPRTimeChatTimeChat: A Time-sensitive Multimodal Large Language Model for Long Video UnderstandingCode
2024CVPRVTimeLLMVTimeLLM: Empower LLM to Grasp Video MomentsCode
2024ECCVLITALITA: Language Instructed Temporal-Localization AssistantCode
2024ICMLMomentorMomentor: Advancing Video Large Language Model with Fine-Grained Temporal ReasoningCode
2024arXivLLaVA-MRLLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval-
2024arXivGrounded-VideoLLMGrounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language ModelsCode
2025ICLRTimeSuiteTimeSuite: Improving MLLMs for Long Video Understanding via Grounded TuningCode
2025ICLRTRACETRACE: Temporal Grounding Video LLM via Causal Event ModelingCode
2025ICCVDisTimeDisTime: Distribution-based Time Representation for Video Large Language Models-
2025arXivVTG-LLMVTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal GroundingCode
2025arXivTAR-TVGTAR-TVG: Enhancing VLMs with Timestamp Anchor-Constrained Reasoning for Robust Temporal Video Grounding-
2025arXivVideoPerceiverVideoPerceiver: Enhancing Fine-grained Temporal Perception in Video Multimodal Large Language Models-
2025EMNLPTVG-R1Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning-
2025arXivMUSEGMUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment GroundingCode
2025NeurIPSUniTimeUniversal Video Temporal Grounding with Generative Multi-modal Large Language ModelsProject
2025arXivVideo-OPDVideo-OPD: Efficient Post-training of Multimodal Large Language Models for Temporal Video Grounding via On-policy Distillation-
2026CVPRTimeLensTimeLens: Rethinking Video Temporal Grounding with Multimodal LLMsCode
2026ICMLOMTGTowards One-to-Many Temporal GroundingCode

Spatio-temporal grounding & video referring

1.2 Comprehensive Watching

Whole-video, dense, and region-level captioning over visual-token sequences. Includes flagship methods (Table 2) and the broader family cited in §3.1.2.

Whole-video captioning

YearVenueAcronymPaperCode / Project
2024ACLVideo-ChatGPTVideo-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language ModelsCode
2024EMNLPVideo-LLaVAVideo-LLaVA: Learning United Visual Representation by Alignment Before ProjectionCode
2024arXivPLLaVAPLLaVA: Parameter-free LLaVA Extension from Images to Videos for Video Dense CaptioningCode
2024arXivTarsierTarsier: Recipes for Training and Evaluating Large Video Description ModelsCode
2024arXivLLaVA-VideoVideo Instruction Tuning with Synthetic DataCode
2024arXivVideo ReCapVideo ReCap: Recursive Captioning of Hour-Long VideosCode
2025arXivLongCaptioningLongCaptioning: Unlocking the Power of Long Caption Generation in Large Multimodal Models-
2025ICMLSGCFine-Grained Captioning of Long Videos through Scene Graph Consolidation-
2025ICLRAuroraCapAuroraCap: Efficient, Performant Video Detailed Captioning and a New BenchmarkCode
2025arXivTarsier2Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video UnderstandingCode
2025arXivvideo-SALMONN 2video-SALMONN 2: Captioning-Enhanced Audio-Visual Large Language ModelsCode
2025arXivVideoCap-R1VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking-
2025arXivOwlCapOwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward-
2025ACM MMHMI / M-ACMTowards Fine-Grained Human Motion Video Captioning-
2025arXivAnyCapAnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal CaptioningCode
2025arXivIF-VidCapIF-VidCap: Can Video Caption Models Follow Instructions?Code
2025ACM MMIntentVCNetIntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning-

Dense video captioning

Region-level captioning & video referring

1.3 Audio-Visual Watching

Omni-modal perception unifying speech, environmental audio, and music with visual streams under a shared LLM backbone.

1.4 Efficient Watching

Reducing redundancy in long videos: frame-level selection, token-level compression / merging, and model-level efficient processing.

YearVenueAcronymPaperCode / Project
2024NeurIPSVideoLLM-MoDVideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation-
2025CVPRAKSAdaptive Keyframe Sampling for Long Video UnderstandingCode
2025ICCVQ-FrameQ-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMsCode
2025NeurIPSLogic-in-FramesLogic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding-
2025arXivDIGDivide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding-
2025arXivReFoCUSReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding-
2025arXivFrameOracleFrameOracle: Learning What to See and How Much to See in Videos-
2025arXivF2CFrom Frames to Clips: Efficient Key Clip Selection for Long-Form Video Understanding-
2025arXivK-FramesK-frames: Scene-Driven Any-k Keyframe Selection for long video understanding-
2025ICCVFrameFusionFrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language ModelsCode
2025CVPRDyCokeDyCoke: Dynamic Compression of Tokens for Fast Video Large Language ModelsCode
2025arXivHoliTomHoliTom: Holistic Token Merging for Fast Video Large Language Models-
2025EMNLPVidCom²Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language ModelsCode
2025EMNLPLangDCSeeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors-
2025arXivDyToKLess Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe PriorCode
2025ACL FindingsAdaReTaKeAdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding-
2025arXivVideo-XL-2Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV SparsificationProject
2026ICLRVideoNSAVideoNSA: Native Sparse Attention Scales Video UnderstandingCode

2. Remember — How to Remember?

Memory connects perception with higher-level understanding by retaining salient information over time. We split methods by storage paradigm.

2.1 Offline Memory — Agentic

LLMs/VLMs autonomously invoke memory tools through multi-round reasoning to construct and retrieve memory.

2.2 Offline Memory — Non-Agent

Deterministic pipelines where memory construction and retrieval are sequential, fixed stages.

YearVenueAcronymPaperCode / Project
2024CVPRMovieChatMovieChat: From Dense Token to Sparse Memory for Long Video UnderstandingCode
2024CVPRMA-LMMMA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video UnderstandingCode
2024arXivVidCompressVidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models-
2025CVPRReWindReWind: Understanding Long Videos with Instructed Learnable Memory-
2025ICMEHEM-LLMEnhancing Long Video Understanding via Hierarchical Event-Based Memory-
2025ICML∞-Video∞-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory ConsolidationCode
2025ICMLLongVULongVU: Spatiotemporal Adaptive Compression for Long Video-Language UnderstandingCode
2025ICCVVideoLLaMBVideoLLaMB: Long Streaming Video Understanding with Recurrent Memory BridgesCode
2025ICCVHERMESHERMES: Temporal-Coherent Long-Form Understanding with Episodes and SemanticsCode
2025CVPRHierarQHierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video UnderstandingProject
2025arXivMemVidMemory-enhanced Retrieval Augmentation for Long Video Understanding-
2026ICLRMARCMARC: Memory-Augmented RL Token Compression for Efficient Video Understanding-
2026arXivSee More, Store LessSee More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval-
2026WACVCompact Video RepsLearning Compact Video Representations for Efficient Long-Form Video Understanding in Large Multimodal Models-
2026CVPRQViC-MFQuestion-guided Visual Compression with Memory Feedback for Long-Term Video Understanding-

2.3 Streaming Memory

Processing unbounded streams within fixed memory budgets via causal compression, KV pruning, sink reuse, or hierarchical caches.


3. Reason — How to Reason?

Reasoning operates on perceived and retained evidence. We separate models by what they reason over (text-only vs. interleaved with visual evidence) and how the reasoning is controlled (agentic tool loops vs. non-agent post-training).

3.1 Text-only Reasoning — Agentic

Agent loops with tools / memory / planning that orchestrate perception, retrieval, verification, and reflection.

3.2 Text-only Reasoning — Non-Agent

CoT-style supervised fine-tuning and RL/DPO post-training without tool-driven control loops.

YearVenueAcronymPaperCode / Project
2025arXivChain-of-FramesChain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning-
2025NeurIPSVideo-R1Video-R1: Reinforcing Video Reasoning in MLLMsCode
2025arXivTW-GRPOReinforcing Video Reasoning with Focused ThinkingCode
2025ICMLVistaDPOVistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video ModelsCode
2025arXivVerIPOVerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Guided Iterative Policy OptimizationCode
2025arXivVidBridge-R1VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks-
2025arXivvideo-SALMONN-o1video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model-
2025NeurIPSVideoRFTVideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-TuningCode
2025NeurIPSTime-R1Time-R1: Post-Training Large Vision Language Model for Temporal Video GroundingCode
2025NeurIPSDeepVideo-R1DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPOCode
2025ACM MMVideo-CoTVideo-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-ThoughtProject
2025arXivSpaceRSpaceR: Reinforcing MLLMs in Video Spatial ReasoningCode
2025arXivvsGRPOImproved Visual-Spatial Reasoning via R1-Zero-like Training-
2025arXivVIDEO-STRVideo-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph-
2025arXivSpatialLadderSpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models-
2025arXivCambrian-SCambrian-S: Towards Spatial Supersensing in Video-
2025arXivVideo-R2Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models-
2026arXivVidGroundWatch Before You Answer: Learning from Visually Grounded Post-TrainingCode

3.3 Thinking with Videos — Agentic

Models that interleave reasoning with explicit visual grounding and re-inspection (o3-style "thinking with images" extended to video).

YearVenueAcronymPaperCode / Project
2025NeurIPSVideoChat-R1.5VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative PerceptionCode
2025NeurIPSPixel ReasonerPixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement LearningCode
2026ICLRVideoZoomerVideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video ReasoningCode
2026CVPRVITALThinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning-
2025arXivFrameMindFrameMind: Frame-Interleaved Video Reasoning via Reinforcement LearningProject
2025arXivViLaSRReinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing-
2025arXivCyberVCyberV: Cybernetics for Test-time Scaling in Video UnderstandingCode
2025arXivAVPActive Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding-
2025arXivLOVE-R1LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning-
2025arXivLongVTLongVT: Incentivizing "Thinking with Long Videos" via Native Tool CallingCode
2026CVPRConanConan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual EvidenceCode
2026ICMLVideoTemp-o3VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos-
2026ICMLVideo-o3Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop ReasoningCode
2026CVPRVideoSeekVideoSeek: Long-Horizon Video Agent with Tool-Guided SeekingCode

3.4 Thinking with Videos — Non-Agent

Models that natively emit grounded reasoning traces (timestamps, boxes, captions) without external tool calls.


4. Subfields

Domain-specific scenarios that stress different combinations of perception, memory, and reasoning.

4.1 Egocentric Videos

4.2 Sports Videos

4.3 Instructional Videos

4.4 Medical Videos

4.5 Movie and Narrative Videos


5. Datasets and Benchmarks

5.1 Training Datasets

5.1.1 Video QA

Covers both training corpora and widely used QA benchmarks (many pre-MLLM datasets are still used for evaluation).

YearAcronymPaperCode / Project
2017MSVD-QAVideo Question Answering via Gradually Refined Attention over Appearance and Motion-
2017TGIF-QATGIF-QA: Toward Spatio-Temporal Reasoning in Visual Question AnsweringCode
2018TVQATVQA: Localized, Compositional Video Question AnsweringCode
2019ActivityNet-QAActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question AnsweringCode
2020CLEVRERCLEVRER: Collision Events for Video Representation and ReasoningProject
2021NExT-QANExT-QA: Next Phase of Question-Answering to Explaining Temporal ActionsCode
2021HowToVQA69MJust Ask: Learning to Answer Questions from Millions of Narrated VideosCode
2024VideoInstruct100KVideo-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language ModelsCode
2024VideoChat2-ITMVBench: A Comprehensive Multi-modal Video Understanding BenchmarkCode
2024LLaVA-Video-178KVideo Instruction Tuning with Synthetic DataCode
2024VideoCoTVideoCoT: A Video Chain-of-Thought Dataset with Active Annotation Tool-
2025VideoEspressoVideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame SelectionCode
2025Video-R1Video-R1: Reinforcing Video Reasoning in MLLMsCode
2025VideoRFTVideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-TuningCode
2025LongVideo-ReasonScaling RL to Long VideosCode
2025STGROpen-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal EvidenceCode
2025ReWatch-CoTReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data SynthesisCode
2025VideoZoomerVideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video ReasoningCode
2025VideoSIAHLongVT: Incentivizing "Thinking with Long Videos" via Native Tool CallingCode
2025ConanConan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual EvidenceCode
2026Seeker-173KVideo-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop ReasoningCode
2026LongVideo-R1LongVideo-R1: Smart Navigation for Low-cost Long Video UnderstandingCode

5.1.2 Video Captioning

Includes classical clip / dense / narration-level corpora, MLLM-era recaptioned corpora, and grounded / omni-modal captioning data.

YearAcronymPaperCode / Project
2016MSR-VTTMSR-VTT: A Large Video Description Dataset for Bridging Video and Language-
2017ActivityNet CaptionsDense-Captioning Events in VideosProject
2018YouCook2Towards Automatic Learning of Procedures from Web Instructional VideosProject
2019VATEXVATEX: A Large-Scale, High-Quality Multilingual Dataset for Video-and-Language ResearchProject
2020TVCTVR: A Large-Scale Dataset for Video-Subtitle Moment RetrievalCode
2020ViTTMultimodal Pretraining for Dense Video CaptioningCode
2022Ego4DEgo4D: Around the World in 3,000 Hours of Egocentric VideoProject
2024Panda-70MPanda-70M: Captioning 70M Videos with Multiple Cross-Modality TeachersCode
2024ShareGPT4VideoShareGPT4Video: Improving Video Understanding and Generation with Better CaptionsCode
2024Video ReCapVideo ReCap: Recursive Captioning of Hour-Long VideosCode
2024VriptVript: A Video Is Worth Thousands of WordsCode
2024MiraDataMiraData: A Large-Scale Video Dataset with Long Durations and Structured CaptionsCode
2024FineVideoFineVideo DatasetDataset
2025Tarsier2-Recap-585KTarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video UnderstandingCode
2025UltraVideoUltraVideo: High-Quality UHD Video Dataset with Comprehensive CaptionsProject
2025HMD-270KOwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward-
2025ViCaSViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded SegmentationCode
2025iGround / HowToGround1MLarge-scale Pre-training for Grounded Video Caption Generation-
2025PerceptionLM (PLM-Video)PerceptionLM: Open-Access Data and Models for Detailed Visual UnderstandingCode
2025UGC-VideoCaptionerUGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks-
2026TimeChatCap-42KTimeChat-Captioner: Scripting Multi-scene Videos with Time-aware and Structural Audio-Visual Captions-

5.1.3 Video Temporal Grounding

Includes large-scale narrated-video pretraining corpora, MLLM-era instruction tuning corpora, and reasoning-/RL-oriented re-annotated data.

5.1.4 Long Video Memory

5.2 Evaluation Benchmarks

Categorized into six capability dimensions.

5.2.1 General Video Understanding

5.2.2 Temporal & Spatial Understanding

5.2.3 Complex Reasoning

5.2.4 Long-Context & Streaming Understanding

5.2.5 Domain-Specific Knowledge

5.2.6 Omnimodal Collaboration


6. Future Directions

Open problems highlighted by the survey:

  • Spatial reasoning in video understanding — bridging object-level and scene-level spatial understanding for embodied / 3D-aware applications.
  • Multi-video and multi-segment temporal grounding — set-based retrieval + refinement under verifiable rewards.
  • Hour-scale video understanding with structured memory — multi-level memory with evidence pointers and learned write/forget policies.
  • Efficient and verifiable video reasoning — budgeted evidence search jointly optimizing answer correctness, evidence alignment, and compactness.
  • Streaming egocentric video understanding — stateful, goal-driven streaming memory with proactive timing for embodied agents.

Citation

If you find this survey useful, please consider citing:

@article{meng2026watch,
  title   = {Watch, Remember, Reason: Human-View Video Understanding with MLLMs},
  author  = {Meng, Jiahao and Tan, Yue and Xu, Qi and Gao, Kuan and Liu, Weisong and Li, Yanwei and Li, Jason and Kong, Lingdong and Wang, Haochen and Zhou, Qianyu and Zhang, Jiangning and Cheng, Guangliang and Tong, Yunhai and Qi, Lu and Yang, Minghsuan},
  journal = {arXiv preprint arXiv:2606.07433},
  year    = {2026}
}

Contributing

Contributions are welcome — please open a PR to add a missing paper, dataset, or benchmark. When adding an entry, place it in the most specific subsection that fits the taxonomy and follow the existing column order. Papers are listed roughly in chronological order within each table.

Contributors

marinero4972

18 commits

lxtGH

3 commits

insomniaaac

1 commits

gabfstr

1 commits

marinero4972/Awesome-HumanView-VideoUnderstanding

[survey] Watch, Remember, Reason: Human-View Video Understanding with MLLMs

39

26 commits

updated Sep 11, 2026

See the code

README

Awesome PR's Welcome

Watch, Remember, Reason: Human-View Video Understanding with MLLMs


Jiahao Meng · Yue Tan · Qi Xu · Kuan Gao · Weisong Liu · Yanwei Li · Jason Li
Lingdong Kong · Haochen Wang · Qianyu Zhou · Jiangning Zhang · Guangliang Cheng
Yunhai Tong · Lu Qi · Ming-Hsuan Yang

Paper PDF


Overview

This repository accompanies our survey, which takes a human-view perspective on LLM/MLLM-based video understanding by decomposing it into three core cognitive abilities and reviewing how recent methods realize each:

  • Watch — perceptual grounding of multimodal video streams: fine-grained spatio-temporal grounding, comprehensive captioning, audio-visual (omni-modal) perception, and efficient long-video processing.
  • Remember — maintaining context over long or streaming inputs: offline memory (agentic vs. non-agent) and streaming memory.
  • Reason — deriving grounded answers from perceived and retained evidence: text-only reasoning and the emerging thinking-with-videos paradigm, each split into agentic and non-agent approaches.

Beyond methods, the survey covers domain-specific subfields (egocentric, sports, instructional, medical, narrative videos), training datasets and evaluation benchmarks across major task types and capability dimensions, and open problems on the path to scalable, memory-aware, evidence-grounded video intelligence.

Table of Contents


1. Watch — How to Watch?

Watching corresponds to the perceptual stage where models transform raw multimodal inputs into structured representations. We organize methods along four complementary dimensions.

1.1 Fine-grained Watching

Precise spatio-temporal grounding: time representation, long-video efficiency, structured decoding, fine-grained perception architectures, and verifiable post-training. Includes both flagship methods (Table 2) and the broader family cited in §3.1.1 (temporal grounding, spatio-temporal grounding, video referring).

Temporal grounding & VTG-style methods

YearVenueAcronymPaperCode / Project
2023ICCVSOONetScanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long VideosCode
2023NeurIPSSeViLASelf-Chained Image-Language Model for Video Localization and Question AnsweringCode
2024CVPRTimeChatTimeChat: A Time-sensitive Multimodal Large Language Model for Long Video UnderstandingCode
2024CVPRVTimeLLMVTimeLLM: Empower LLM to Grasp Video MomentsCode
2024ECCVLITALITA: Language Instructed Temporal-Localization AssistantCode
2024ICMLMomentorMomentor: Advancing Video Large Language Model with Fine-Grained Temporal ReasoningCode
2024arXivLLaVA-MRLLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval-
2024arXivGrounded-VideoLLMGrounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language ModelsCode
2025ICLRTimeSuiteTimeSuite: Improving MLLMs for Long Video Understanding via Grounded TuningCode
2025ICLRTRACETRACE: Temporal Grounding Video LLM via Causal Event ModelingCode
2025ICCVDisTimeDisTime: Distribution-based Time Representation for Video Large Language Models-
2025arXivVTG-LLMVTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal GroundingCode
2025arXivTAR-TVGTAR-TVG: Enhancing VLMs with Timestamp Anchor-Constrained Reasoning for Robust Temporal Video Grounding-
2025arXivVideoPerceiverVideoPerceiver: Enhancing Fine-grained Temporal Perception in Video Multimodal Large Language Models-
2025EMNLPTVG-R1Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning-
2025arXivMUSEGMUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment GroundingCode
2025NeurIPSUniTimeUniversal Video Temporal Grounding with Generative Multi-modal Large Language ModelsProject
2025arXivVideo-OPDVideo-OPD: Efficient Post-training of Multimodal Large Language Models for Temporal Video Grounding via On-policy Distillation-
2026CVPRTimeLensTimeLens: Rethinking Video Temporal Grounding with Multimodal LLMsCode
2026ICMLOMTGTowards One-to-Many Temporal GroundingCode

Spatio-temporal grounding & video referring

1.2 Comprehensive Watching

Whole-video, dense, and region-level captioning over visual-token sequences. Includes flagship methods (Table 2) and the broader family cited in §3.1.2.

Whole-video captioning

YearVenueAcronymPaperCode / Project
2024ACLVideo-ChatGPTVideo-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language ModelsCode
2024EMNLPVideo-LLaVAVideo-LLaVA: Learning United Visual Representation by Alignment Before ProjectionCode
2024arXivPLLaVAPLLaVA: Parameter-free LLaVA Extension from Images to Videos for Video Dense CaptioningCode
2024arXivTarsierTarsier: Recipes for Training and Evaluating Large Video Description ModelsCode
2024arXivLLaVA-VideoVideo Instruction Tuning with Synthetic DataCode
2024arXivVideo ReCapVideo ReCap: Recursive Captioning of Hour-Long VideosCode
2025arXivLongCaptioningLongCaptioning: Unlocking the Power of Long Caption Generation in Large Multimodal Models-
2025ICMLSGCFine-Grained Captioning of Long Videos through Scene Graph Consolidation-
2025ICLRAuroraCapAuroraCap: Efficient, Performant Video Detailed Captioning and a New BenchmarkCode
2025arXivTarsier2Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video UnderstandingCode
2025arXivvideo-SALMONN 2video-SALMONN 2: Captioning-Enhanced Audio-Visual Large Language ModelsCode
2025arXivVideoCap-R1VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking-
2025arXivOwlCapOwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward-
2025ACM MMHMI / M-ACMTowards Fine-Grained Human Motion Video Captioning-
2025arXivAnyCapAnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal CaptioningCode
2025arXivIF-VidCapIF-VidCap: Can Video Caption Models Follow Instructions?Code
2025ACM MMIntentVCNetIntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning-

Dense video captioning

Region-level captioning & video referring

1.3 Audio-Visual Watching

Omni-modal perception unifying speech, environmental audio, and music with visual streams under a shared LLM backbone.

1.4 Efficient Watching

Reducing redundancy in long videos: frame-level selection, token-level compression / merging, and model-level efficient processing.

YearVenueAcronymPaperCode / Project
2024NeurIPSVideoLLM-MoDVideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation-
2025CVPRAKSAdaptive Keyframe Sampling for Long Video UnderstandingCode
2025ICCVQ-FrameQ-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMsCode
2025NeurIPSLogic-in-FramesLogic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding-
2025arXivDIGDivide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding-
2025arXivReFoCUSReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding-
2025arXivFrameOracleFrameOracle: Learning What to See and How Much to See in Videos-
2025arXivF2CFrom Frames to Clips: Efficient Key Clip Selection for Long-Form Video Understanding-
2025arXivK-FramesK-frames: Scene-Driven Any-k Keyframe Selection for long video understanding-
2025ICCVFrameFusionFrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language ModelsCode
2025CVPRDyCokeDyCoke: Dynamic Compression of Tokens for Fast Video Large Language ModelsCode
2025arXivHoliTomHoliTom: Holistic Token Merging for Fast Video Large Language Models-
2025EMNLPVidCom²Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language ModelsCode
2025EMNLPLangDCSeeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors-
2025arXivDyToKLess Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe PriorCode
2025ACL FindingsAdaReTaKeAdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding-
2025arXivVideo-XL-2Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV SparsificationProject
2026ICLRVideoNSAVideoNSA: Native Sparse Attention Scales Video UnderstandingCode

2. Remember — How to Remember?

Memory connects perception with higher-level understanding by retaining salient information over time. We split methods by storage paradigm.

2.1 Offline Memory — Agentic

LLMs/VLMs autonomously invoke memory tools through multi-round reasoning to construct and retrieve memory.

2.2 Offline Memory — Non-Agent

Deterministic pipelines where memory construction and retrieval are sequential, fixed stages.

YearVenueAcronymPaperCode / Project
2024CVPRMovieChatMovieChat: From Dense Token to Sparse Memory for Long Video UnderstandingCode
2024CVPRMA-LMMMA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video UnderstandingCode
2024arXivVidCompressVidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models-
2025CVPRReWindReWind: Understanding Long Videos with Instructed Learnable Memory-
2025ICMEHEM-LLMEnhancing Long Video Understanding via Hierarchical Event-Based Memory-
2025ICML∞-Video∞-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory ConsolidationCode
2025ICMLLongVULongVU: Spatiotemporal Adaptive Compression for Long Video-Language UnderstandingCode
2025ICCVVideoLLaMBVideoLLaMB: Long Streaming Video Understanding with Recurrent Memory BridgesCode
2025ICCVHERMESHERMES: Temporal-Coherent Long-Form Understanding with Episodes and SemanticsCode
2025CVPRHierarQHierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video UnderstandingProject
2025arXivMemVidMemory-enhanced Retrieval Augmentation for Long Video Understanding-
2026ICLRMARCMARC: Memory-Augmented RL Token Compression for Efficient Video Understanding-
2026arXivSee More, Store LessSee More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval-
2026WACVCompact Video RepsLearning Compact Video Representations for Efficient Long-Form Video Understanding in Large Multimodal Models-
2026CVPRQViC-MFQuestion-guided Visual Compression with Memory Feedback for Long-Term Video Understanding-

2.3 Streaming Memory

Processing unbounded streams within fixed memory budgets via causal compression, KV pruning, sink reuse, or hierarchical caches.


3. Reason — How to Reason?

Reasoning operates on perceived and retained evidence. We separate models by what they reason over (text-only vs. interleaved with visual evidence) and how the reasoning is controlled (agentic tool loops vs. non-agent post-training).

3.1 Text-only Reasoning — Agentic

Agent loops with tools / memory / planning that orchestrate perception, retrieval, verification, and reflection.

3.2 Text-only Reasoning — Non-Agent

CoT-style supervised fine-tuning and RL/DPO post-training without tool-driven control loops.

YearVenueAcronymPaperCode / Project
2025arXivChain-of-FramesChain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning-
2025NeurIPSVideo-R1Video-R1: Reinforcing Video Reasoning in MLLMsCode
2025arXivTW-GRPOReinforcing Video Reasoning with Focused ThinkingCode
2025ICMLVistaDPOVistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video ModelsCode
2025arXivVerIPOVerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Guided Iterative Policy OptimizationCode
2025arXivVidBridge-R1VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks-
2025arXivvideo-SALMONN-o1video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model-
2025NeurIPSVideoRFTVideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-TuningCode
2025NeurIPSTime-R1Time-R1: Post-Training Large Vision Language Model for Temporal Video GroundingCode
2025NeurIPSDeepVideo-R1DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPOCode
2025ACM MMVideo-CoTVideo-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-ThoughtProject
2025arXivSpaceRSpaceR: Reinforcing MLLMs in Video Spatial ReasoningCode
2025arXivvsGRPOImproved Visual-Spatial Reasoning via R1-Zero-like Training-
2025arXivVIDEO-STRVideo-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph-
2025arXivSpatialLadderSpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models-
2025arXivCambrian-SCambrian-S: Towards Spatial Supersensing in Video-
2025arXivVideo-R2Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models-
2026arXivVidGroundWatch Before You Answer: Learning from Visually Grounded Post-TrainingCode

3.3 Thinking with Videos — Agentic

Models that interleave reasoning with explicit visual grounding and re-inspection (o3-style "thinking with images" extended to video).

YearVenueAcronymPaperCode / Project
2025NeurIPSVideoChat-R1.5VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative PerceptionCode
2025NeurIPSPixel ReasonerPixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement LearningCode
2026ICLRVideoZoomerVideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video ReasoningCode
2026CVPRVITALThinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning-
2025arXivFrameMindFrameMind: Frame-Interleaved Video Reasoning via Reinforcement LearningProject
2025arXivViLaSRReinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing-
2025arXivCyberVCyberV: Cybernetics for Test-time Scaling in Video UnderstandingCode
2025arXivAVPActive Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding-
2025arXivLOVE-R1LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning-
2025arXivLongVTLongVT: Incentivizing "Thinking with Long Videos" via Native Tool CallingCode
2026CVPRConanConan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual EvidenceCode
2026ICMLVideoTemp-o3VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos-
2026ICMLVideo-o3Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop ReasoningCode
2026CVPRVideoSeekVideoSeek: Long-Horizon Video Agent with Tool-Guided SeekingCode

3.4 Thinking with Videos — Non-Agent

Models that natively emit grounded reasoning traces (timestamps, boxes, captions) without external tool calls.


4. Subfields

Domain-specific scenarios that stress different combinations of perception, memory, and reasoning.

4.1 Egocentric Videos

4.2 Sports Videos

4.3 Instructional Videos

4.4 Medical Videos

4.5 Movie and Narrative Videos


5. Datasets and Benchmarks

5.1 Training Datasets

5.1.1 Video QA

Covers both training corpora and widely used QA benchmarks (many pre-MLLM datasets are still used for evaluation).

YearAcronymPaperCode / Project
2017MSVD-QAVideo Question Answering via Gradually Refined Attention over Appearance and Motion-
2017TGIF-QATGIF-QA: Toward Spatio-Temporal Reasoning in Visual Question AnsweringCode
2018TVQATVQA: Localized, Compositional Video Question AnsweringCode
2019ActivityNet-QAActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question AnsweringCode
2020CLEVRERCLEVRER: Collision Events for Video Representation and ReasoningProject
2021NExT-QANExT-QA: Next Phase of Question-Answering to Explaining Temporal ActionsCode
2021HowToVQA69MJust Ask: Learning to Answer Questions from Millions of Narrated VideosCode
2024VideoInstruct100KVideo-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language ModelsCode
2024VideoChat2-ITMVBench: A Comprehensive Multi-modal Video Understanding BenchmarkCode
2024LLaVA-Video-178KVideo Instruction Tuning with Synthetic DataCode
2024VideoCoTVideoCoT: A Video Chain-of-Thought Dataset with Active Annotation Tool-
2025VideoEspressoVideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame SelectionCode
2025Video-R1Video-R1: Reinforcing Video Reasoning in MLLMsCode
2025VideoRFTVideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-TuningCode
2025LongVideo-ReasonScaling RL to Long VideosCode
2025STGROpen-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal EvidenceCode
2025ReWatch-CoTReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data SynthesisCode
2025VideoZoomerVideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video ReasoningCode
2025VideoSIAHLongVT: Incentivizing "Thinking with Long Videos" via Native Tool CallingCode
2025ConanConan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual EvidenceCode
2026Seeker-173KVideo-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop ReasoningCode
2026LongVideo-R1LongVideo-R1: Smart Navigation for Low-cost Long Video UnderstandingCode

5.1.2 Video Captioning

Includes classical clip / dense / narration-level corpora, MLLM-era recaptioned corpora, and grounded / omni-modal captioning data.

YearAcronymPaperCode / Project
2016MSR-VTTMSR-VTT: A Large Video Description Dataset for Bridging Video and Language-
2017ActivityNet CaptionsDense-Captioning Events in VideosProject
2018YouCook2Towards Automatic Learning of Procedures from Web Instructional VideosProject
2019VATEXVATEX: A Large-Scale, High-Quality Multilingual Dataset for Video-and-Language ResearchProject
2020TVCTVR: A Large-Scale Dataset for Video-Subtitle Moment RetrievalCode
2020ViTTMultimodal Pretraining for Dense Video CaptioningCode
2022Ego4DEgo4D: Around the World in 3,000 Hours of Egocentric VideoProject
2024Panda-70MPanda-70M: Captioning 70M Videos with Multiple Cross-Modality TeachersCode
2024ShareGPT4VideoShareGPT4Video: Improving Video Understanding and Generation with Better CaptionsCode
2024Video ReCapVideo ReCap: Recursive Captioning of Hour-Long VideosCode
2024VriptVript: A Video Is Worth Thousands of WordsCode
2024MiraDataMiraData: A Large-Scale Video Dataset with Long Durations and Structured CaptionsCode
2024FineVideoFineVideo DatasetDataset
2025Tarsier2-Recap-585KTarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video UnderstandingCode
2025UltraVideoUltraVideo: High-Quality UHD Video Dataset with Comprehensive CaptionsProject
2025HMD-270KOwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward-
2025ViCaSViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded SegmentationCode
2025iGround / HowToGround1MLarge-scale Pre-training for Grounded Video Caption Generation-
2025PerceptionLM (PLM-Video)PerceptionLM: Open-Access Data and Models for Detailed Visual UnderstandingCode
2025UGC-VideoCaptionerUGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks-
2026TimeChatCap-42KTimeChat-Captioner: Scripting Multi-scene Videos with Time-aware and Structural Audio-Visual Captions-

5.1.3 Video Temporal Grounding

Includes large-scale narrated-video pretraining corpora, MLLM-era instruction tuning corpora, and reasoning-/RL-oriented re-annotated data.

5.1.4 Long Video Memory

5.2 Evaluation Benchmarks

Categorized into six capability dimensions.

5.2.1 General Video Understanding

5.2.2 Temporal & Spatial Understanding

5.2.3 Complex Reasoning

5.2.4 Long-Context & Streaming Understanding

5.2.5 Domain-Specific Knowledge

5.2.6 Omnimodal Collaboration


6. Future Directions

Open problems highlighted by the survey:

  • Spatial reasoning in video understanding — bridging object-level and scene-level spatial understanding for embodied / 3D-aware applications.
  • Multi-video and multi-segment temporal grounding — set-based retrieval + refinement under verifiable rewards.
  • Hour-scale video understanding with structured memory — multi-level memory with evidence pointers and learned write/forget policies.
  • Efficient and verifiable video reasoning — budgeted evidence search jointly optimizing answer correctness, evidence alignment, and compactness.
  • Streaming egocentric video understanding — stateful, goal-driven streaming memory with proactive timing for embodied agents.

Citation

If you find this survey useful, please consider citing:

@article{meng2026watch,
  title   = {Watch, Remember, Reason: Human-View Video Understanding with MLLMs},
  author  = {Meng, Jiahao and Tan, Yue and Xu, Qi and Gao, Kuan and Liu, Weisong and Li, Yanwei and Li, Jason and Kong, Lingdong and Wang, Haochen and Zhou, Qianyu and Zhang, Jiangning and Cheng, Guangliang and Tong, Yunhai and Qi, Lu and Yang, Minghsuan},
  journal = {arXiv preprint arXiv:2606.07433},
  year    = {2026}
}

Contributing

Contributions are welcome — please open a PR to add a missing paper, dataset, or benchmark. When adding an entry, place it in the most specific subsection that fits the taxonomy and follow the existing column order. Papers are listed roughly in chronological order within each table.

Contributors

marinero4972

18 commits

lxtGH

3 commits

insomniaaac

1 commits

gabfstr

1 commits