[ACL’24 Findings] Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives
See the codeThis repository accompanies our ACL 2024 (Findings) survey paper, Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives. It curates leaderboards, datasets, and a structured paper list spanning the evolution of video-language understanding — from early RNN/CNN pipelines through transformer-based pre-training and into the current generation of large video–language models.
The list is actively maintained. Spotted an error or a missing paper? Please open an issue or submit a pull request — see Contributing below.
If our survey is useful for your research, please cite us:
@article{nguyen2024video,
title = {Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives},
author = {Nguyen, Thong and Bin, Yi and Xiao, Junbin and Qu, Leigang and Li, Yicong and
Wu, Jay Zhangjie and Nguyen, Cong-Duy and Ng, See-Kiong and Tuan, Luu Anh},
journal = {arXiv preprint arXiv:2406.05615},
year = {2024}
}
The video-language landscape has shifted decisively toward large video–language models, long-form understanding, and reasoning. Some of the most notable threads from 2025–2026:
See the LLM-augmented, Agentic and streaming Video-LLMs, Reinforcement learning and video reasoning, and Modern Video-LLM evaluation benchmarks sections below for details and references.
Results reported on the MSRVTT 1k-A test split (zero-shot or fine-tuned, following each paper's original protocol). Higher is better for all metrics.
| Method | Architecture | Video Encoder | Text Encoder | R@1 | R@5 | R@10 |
|---|---|---|---|---|---|---|
| VSE-LSTM (NeurIPS 2014) | Pre-TF | ConvNet/OxfordNet | GloVe-LSTM | 3.8 | 12.7 | 17.1 |
| C+LSTM+SA-FC7 (arXiv 2016) | Pre-TF | VGG | GloVe-LSTM | 4.2 | 12.9 | 19.9 |
| EITanque (arXiv 2016) | Pre-TF | VGG | word2vec-LSTM | 4.7 | 16.6 | 24.1 |
| SA-G+SA-FC7 (arXiv 2016) | Pre-TF | VGG | GloVe | 3.1 | 9.0 | 13.4 |
| CT-SAN (CVPR 2017) | Pre-TF | ResNet | word2vec-LSTM | 4.4 | 16.6 | 22.3 |
| JSFusion (ECCV 2018) | Pre-TF | ResNet | GloVe-LSTM | 10.2 | 31.2 | 43.2 |
| DeCEMBERT (NAACL 2021) | Shared TF | ResNet | BERT | 17.5 | 44.3 | 58.6 |
| VLM (ACL 2021) | Shared TF | S3D | BERT | 28.1 | 55.5 | 67.4 |
| All-in-one (CVPR 2023) | Shared TF | Linear | BERT | 37.9 | 68.1 | 77.1 |
| ActBERT (CVPR 2020) | Stacked TF | Faster-RCNN | BERT | 16.3 | 42.8 | 56.9 |
| HERO (EMNLP 2020) | Stacked TF | ResNet + SlowFast | BERT | 16.8 | 43.4 | 57.7 |
| MV-GPT (arXiv 2022) | Stacked TF | ViViT | BERT | 37.3 | 65.5 | 75.1 |
| VIOLET (CVPR 2023) | Stacked TF | VS-TF | BERT | 37.2 | 64.8 | 75.8 |
| VindLU (CVPR 2023) | Stacked TF | ViT | BERT | 48.8 | 72.4 | 82.2 |
| CLIP2TV (ICLR 2023) | Dual TF | ViT | CLIP-text | 32.4 | 58.2 | 68.6 |
| CLIP4Clip (arXiv 2021) | Dual TF | ViT | CLIP-text | 44.5 | 71.4 | 81.6 |
| CLIP-ViP (ICLR 2023) | Dual TF | ViT | CLIP-text | 49.6 | 74.5 | 84.8 |
| InternVideo2 (ECCV 2024) | Dual TF | InternViT | CLIP-text | 55.9 | 78.3 | 85.1 |
Results reported on MSRVTT test split.
| Method | Architecture | Video Encoder | BLEU-4 | METEOR | CIDEr |
|---|---|---|---|---|---|
| TA (ICCV 2015) | Pre-TF | 3D-CNN | 36.5 | 25.7 | – |
| h-RNN (CVPR 2016) | Pre-TF | VGG | 36.8 | 25.9 | – |
| MFATT (arXiv 2016) | Pre-TF | ResNet + C3D | 39.1 | 26.7 | – |
| CAT-TM (arXiv 2016) | Pre-TF | ResNet + C3D | 36.6 | 25.6 | – |
| NFS-TM (arXiv 2016) | Pre-TF | ResNet + C3D | 37.0 | 25.9 | – |
| Fuse-TM (arXiv 2016) | Pre-TF | ResNet + C3D | 37.5 | 25.9 | – |
| MARN (CVPR 2019) | Pre-TF | ResNet | – | – | 46.8 |
| Res-ATT (WWW 2019) | Pre-TF | ResNet | 37.0 | 26.9 | 40.7 |
| DenseLSTM (ACMMM 2019) | Pre-TF | VGG | 38.1 | 27.2 | 42.8 |
| DeCEMBERT (NAACL 2021) | Stacked TF | ResNet | 45.2 | 29.7 | 52.3 |
| UniVL (arXiv 2020) | Stacked TF | S3D | 41.8 | 28.9 | 50.0 |
| CLIP-DCD (PRCV 2022) | Stacked TF | ViT | 48.2 | 30.9 | 64.8 |
| MV-GPT (arXiv 2022) | Stacked TF | ViViT | 48.9 | 38.7 | 60.0 |
| VIOLET (CVPR 2023) | Stacked TF | VS-TF | – | – | 58.0 |
| LAVENDER (arXiv 2023) | Stacked TF | VS-TF | – | – | 57.4 |
| VLAB (arXiv 2023) | Stacked TF | EVA-G | 54.6 | 33.4 | 74.9 |
| mPLUG-2 (ICML 2023) | Stacked TF | ViT | 57.8 | 34.9 | 80.3 |
| Tarsier (arXiv 2024) | LLM-Augmented | CLIP-ViT | – | – | 75.9 |
Accuracy (%) on the MSRVTT-QA and MSVD-QA test splits.
| Method | Architecture | Video Encoder | Text Encoder | MSRVTT-QA | MSVD-QA |
|---|---|---|---|---|---|
| E-MN (ACMMM 2017) | Pre-TF | VGG + C3D | GloVe-LSTM | 30.4 | 26.7 |
| QueST (AAAI 2020) | Pre-TF | ResNet + C3D | GloVe-LSTM | 40.0 | – |
| HME (CVPR 2019) | Pre-TF | ResNet/VGG + C3D | GloVe-GRU | 34.6 | 36.1 |
| HGA (AAAI 2020) | Pre-TF | ResNet/VGG + C3D | GloVe-GRU | 33.0 | 33.7 |
| ST-VQA (IJCV 2019) | Pre-TF | ResNet + C3D | GloVe-LSTM | 35.5 | 34.7 |
| PGAT (ACMMM 2021) | Pre-TF | Faster-RCNN | GloVe-LSTM | 38.1 | 39.0 |
| HCRN (CVPR 2020) | Pre-TF | ResNet | GloVe-LSTM | 38.6 | 41.2 |
| All-in-one (CVPR 2023) | Shared TF | Linear | BERT | 44.3 | 47.9 |
| ClipBERT (CVPR 2021) | Stacked TF | CLIP-text | BERT | 37.4 | – |
| DeCEMBERT (NAACL 2021) | Stacked TF | ResNet | BERT | 37.4 | – |
| LAVENDER (arXiv 2022) | Stacked TF | VS-TF | BERT | 45.0 | 56.6 |
| VIOLET (CVPR 2023) | Stacked TF | VS-TF | BERT | 44.5 | 54.7 |
| VindLU (CVPR 2023) | Stacked TF | ViT | BERT | 44.6 | – |
| VGT (ECCV 2022) | Dual TF | Faster-RCNN | BERT | 39.7 | – |
| CoVGT (TPAMI 2023) | Dual TF | Faster-RCNN | BERT | 40.0 | – |
| Video-ChatGPT (arXiv 2023) | LLM-Augmented | ViT | Vicuna | 49.3 | 64.9 |
| Video-LLaMA (EMNLP 2023) | LLM-Augmented | EVA-CLIP | LLaMA / Vicuna | 49.6 | 51.6 |
| VideoChat2 (CVPR 2024) | LLM-Augmented | UMT-L | Vicuna | 54.1 | 70.0 |
| LLaMA-VID (ECCV 2024) | LLM-Augmented | EVA-G | Vicuna | 58.9 | 70.0 |
| VideoLLaMA 2 (arXiv 2024) | LLM-Augmented | CLIP-L | Mistral | – | 71.7 |
| LLaVA-Video (arXiv 2024) | LLM-Augmented | SigLIP | Qwen2 | – | – |
| Apollo-7B (CVPR 2025) | LLM-Augmented | SigLIP + InternVideo2 | Qwen2 | – | – |
| Qwen2-VL-7B (arXiv 2024) | LLM-Augmented | Dynamic-ViT | Qwen2 | – | – |
| VideoLLaMA 3 (arXiv 2025) | LLM-Augmented | SigLIP-dyn | Qwen2.5 | – | – |
| Qwen2.5-VL-72B (arXiv 2025) | LLM-Augmented | Dynamic-ViT | Qwen2.5 | – | – |
| Tarsier2-7B (arXiv 2025) | LLM-Augmented | CLIP-ViT | Qwen2 | – | – |
| Video-R1-7B (NeurIPS 2025) | LLM-Augmented + RL | Qwen2.5-VL | Qwen2.5 | – | – |
| VideoChat-R1 (NeurIPS 2025) | LLM-Augmented + RL | Qwen2.5-VL | Qwen2.5 | – | – |
💡 The latest LLM-augmented systems (Qwen2.5-VL, LLaVA-Video, VideoLLaMA 2/3, Tarsier2) are increasingly evaluated on long-video benchmarks such as Video-MME, MLVU, LongVideoBench, and MVBench rather than MSRVTT-QA / MSVD-QA. See the table below and Datasets and Benchmarks for the modern evaluation suites.
Accuracy (%) on the modern long-form video-LMM benchmarks. We report representative numbers from each paper; rigorous comparison should consult original protocols (frame count, resolution, prompt). "—" indicates the model did not officially report on that benchmark.
| Method | Backbone LLM | Video-MME (wo subs) | MLVU | LongVideoBench | MVBench |
|---|---|---|---|---|---|
| Video-LLaVA (EMNLP 2024) | Vicuna-7B | 39.9 | 47.3 | 39.1 | 41.0 |
| VideoChat2 (CVPR 2024) | Vicuna-7B | 39.5 | 47.9 | 39.3 | 51.1 |
| LLaVA-NeXT-Video (2024) | Qwen2-7B | 46.5 | – | 43.5 | 46.5 |
| LongVA-7B (arXiv 2024) | Qwen2-7B | 52.6 | 56.3 | – | – |
| VideoLLaMA 2-7B (arXiv 2024) | Mistral-7B | 47.9 | 48.5 | – | 54.6 |
| LLaVA-Video-7B (arXiv 2024) | Qwen2-7B | 63.3 | 70.8 | 58.2 | 58.6 |
| Apollo-3B (CVPR 2025) | Qwen2-2.7B | 58.4 | 68.7 | 55.1 | – |
| Apollo-7B (CVPR 2025) | Qwen2-7B | 61.2 | 70.9 | 58.5 | – |
| VideoLLaMA 3-7B (arXiv 2025) | Qwen2.5-7B | 66.2 | 73.0 | 59.8 | 69.7 |
| Tarsier2-7B (arXiv 2025) | Qwen2-7B | 64.5 | – | – | 67.6 |
| InternVL3-8B (2025) | Qwen2.5-7B | 66.3 | 71.4 | 58.8 | 70.3 |
| Qwen2.5-VL-7B (arXiv 2025) | Qwen2.5-7B | 65.1 | 70.2 | 56.0 | 69.6 |
| Qwen2.5-VL-72B (arXiv 2025) | Qwen2.5-72B | 73.3 | 74.6 | 60.7 | 70.4 |
| Video-R1-7B (NeurIPS 2025) | Qwen2.5-VL-7B | 59.7 | – | – | 63.9 |
| VideoChat-R1 (NeurIPS 2025) | Qwen2.5-VL-7B | 66.0 | – | – | 70.6 |
| Gemini 2.5 Pro (2025) | proprietary | 84.7 | – | 66.4 | – |
Task abbreviations: TVR = text-video retrieval · VC = video captioning · VideoQA = video question answering · VMR = video moment retrieval · AL = action localization · AR = action recognition · AS = action segmentation · VG = video grounding · PT = pre-training.
| Dataset | Links | Video Source | Annotation | Tasks | #Videos/Scenes |
|---|---|---|---|---|---|
MSVD | Paper · Data | YouTube | Manual | TVR, VC, VideoQA | 1.9K |
MSRVTT | Paper · Data | Web | Manual | TVR, VC, VideoQA | 7.2K |
ActivityNet | Paper · Data | YouTube | Manual | AL, TVR, VC, VMR | 5.8K |
DiDeMo | Paper · Data | YFCC100M | Manual | TVR | 11K |
LSMDC | Paper · Data | Movies | Manual | TVR | 72 movies |
VaTeX | Paper · Data | Kinetics-600 | Manual | TVR, VC | 41K |
YouCook2 | Paper · Data | YouTube | Manual | TVR, VC | 2K |
Charades | Paper · Data | Crowd-collected | Manual | AR, VMR, VideoQA | 10K |
How2 | Paper · Data | YouTube | Auto | VC | 13.2K |
| Dataset | Links | Source | Annotation | Tasks | #Videos/Scenes |
|---|---|---|---|---|---|
TGIF-QA | Paper · Data | TGIFs | Manual | VideoQA | 71K |
TGIF-QA-R | Paper · Data | TGIF-QA | Manual, Auto | VideoQA | 71K |
FIBER | Paper · Data | VaTeX | Manual | VC, VideoQA | 28K |
WildQA | Paper · Data | YouTube | Manual | VideoQA | 0.4K |
NExT-QA | Paper · Data | VidOR | Manual | VideoQA | 5.4K |
CausalVid-QA | Paper · Data | Kinetics-700 | Manual | VideoQA | 26K |
How2QA | Paper · Data | HowTo100M | Manual | VideoQA | 22K |
TVQA | Paper · Data | TV shows | Manual | VideoQA | 22K |
Ego-QA | Paper · Data | Egocentric | Manual | VideoQA | 18.5K |
MAD-QA | Paper · Data | Movies | Manual | VideoQA | 19K |
| Dataset | Links | Source | Annotation | Tasks | #Videos/Scenes |
|---|---|---|---|---|---|
TVR | Paper · Data | TVQA | Manual | VMR | 22K |
How2R | Paper · Data | HowTo100M | Manual | VMR | 22K |
TACoS | Paper · Data | MPII Composites | Manual | VMR | 0.1K |
YouTube Highlights | Paper · Data | YouTube | Manual | VMR | 0.6K |
QVHighlights | Paper · Data | YouTube vlogs | Manual | VMR | 10K |
TVSum | Paper · Data | YouTube | Manual | VMR | 50 |
ViTT | Paper · Data | YouTube-8M | Manual | VMR | 5.8K |
VidChapters-7M | Paper · Data | YT-Temporal-180M | Auto | VC, VMR | 817K |
| Dataset | Links | Source | Annotation | Tasks | #Videos/Scenes |
|---|---|---|---|---|---|
HMDB-51 | Paper · Data | Web | Manual | TVR, AR | 6.8K |
Kinetics-400 | Paper · Data | YouTube | Manual | AR | 306K |
Kinetics-600 | Paper · Data | Kinetics-400 | Manual | AR, VG | 480K |
Kinetics-700 | Paper · Data | Kinetics-600 | Manual | AR | 650K |
Moments in Time | Paper · Data | Web | Manual | AR | 1M |
SSV1 | Paper · Data | Crowd | Manual | AR | 108K |
SSV2 | Paper · Data | Crowd | Manual | AR | 221K |
EK-100 | Paper · Data | Egocentric | Manual | AR, AL | 7K |
COIN | Paper · Data | YouTube | Manual | AS | 12K |
CrossTask | Paper · Data | YouTube | Manual | AR | 4.7K |
| Dataset | Links | Source | Annotation | Tasks | #Videos/Scenes |
|---|---|---|---|---|---|
HowTo100M | Paper · Data | YouTube | Auto | PT | 1.2M |
HD-VILA-100M | Paper · Data | YouTube | Auto | PT | 3.3M |
YT-Temporal-180M | Paper · Data | YouTube | Auto | PT | 6M |
VideoCC3M | Paper · Data | Web | Auto | PT | 6.3M |
WebVid-10M | Paper · Data | Web | Auto | PT | 10.7M |
Alivol-10M | Paper | E-commerce | Auto | PT | 10M |
WTS70M | Paper | YouTube | Auto | PT | 70M |
InternVid | Paper · Data | YouTube | Auto | PT | 7.1M |
Panda-70M | Paper · Data | HD-VILA-100M | Auto (multi-teacher) | PT | 70M |
ShareGPT4Video | Paper · Data | Mixed sources | Auto (GPT-4V) | PT, VC | 4.8M |
The shift toward general-purpose video-language models has produced a new wave of benchmarks emphasizing long-form, temporally rich, knowledge-grounded, and reasoning-oriented evaluation.
| Benchmark | Links | Source | Tasks | Notes |
|---|---|---|---|---|
MVBench | Paper · Data | Mixed | VideoQA | 20 temporal-reasoning tasks, 4K QAs (short clips) |
EgoSchema | Paper · Data | Ego4D | VideoQA | 5K MCQs over 3-min egocentric videos |
Perception Test | Paper · Data | Crowd | VideoQA, VMR, AR | Probes memory, abstraction, physics, semantics |
Video-MME | Paper · Data | YouTube | VideoQA | 900 videos / 2.7K MCQs across short, medium, long |
MMBench-Video | Paper · Data | YouTube | VideoQA | Long-form free-form QA, human-annotated taxonomy |
MLVU | Paper · Data | Mixed genres | VideoQA | 1.7K videos (3 min – 2 h), multi-task, multi-level |
LongVideoBench | Paper · Data | Web | VideoQA | Long-context interleaved video-language, referring QA |
VideoVista | Paper · Data | 894 videos | VideoQA | 25K QAs across diverse domains and reasoning types |
CinePile | Paper · Data | Movies | VideoQA | 9.4K videos, 303K QAs for cinematic understanding |
TempCompass | Paper · Data | Mixed | VideoQA | Focused on fine-grained temporal perception |
TemporalBench | Paper · Data | Mixed | VideoQA | Fine-grained temporal understanding, dense action annotations |
CG-Bench | Paper · Data | Long videos | VideoQA | 1.2K videos, 12K QAs with clue-grounded evaluation |
Video-MMMU | Paper · Data | Lecture videos | VideoQA | 300 expert videos, knowledge-acquisition Δ metric |
ApolloBench | Paper · Data | Curated mixed | VideoQA | 41× faster than Video-MME, perception-focused |
OVBench | Paper · Data | Streaming | Online VideoQA | Online/streaming evaluation across temporal scales |
StreamBench | Paper | Streaming | Streaming dialogue | Real-time multi-turn streaming video reasoning |
Video-Holmes | Paper | Movies/TV | Video reasoning | Multi-step deductive reasoning over clips |
VCR-Bench | Paper | Mixed | Video CoT reasoning | Comprehensive video chain-of-thought benchmark |
VR-Bench | Paper | Mixed | Video reasoning | Probes spatiotemporal reasoning with verifier |
MMDuet / MT-Video-Bench | Paper | Mixed | Multi-turn VideoQA | Holistic eval of multi-turn video dialogue |
arXiv 2021 [Paper]ACM Computing Surveys 2022 [Paper] [Code]EMNLP 2022 [Paper] [Code]IJMIR 2023 [Paper]arXiv 2023 [Paper]Mobile Networks and Applications 2021 [Paper]TPAMI 2025 [Paper] [Code]arXiv 2024 [Paper] [Code]OpenReview 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]DMML 2025 [Paper]NeurIPS 2014 [Paper]ICCV 2015 [Paper] [Code]CVPR 2016 [Paper]CVPR 2016 [Paper] [Code]arXiv 2016 [Paper]arXiv 2016 [Paper] [Code]arXiv 2016 [Paper]CVPR 2017 [Paper]SIGIR 2017 [Paper]CVPR 2017 [Paper]ICCV 2017 [Paper]ICCV 2017 [Paper] [Code]AAAI 2017 [Paper]arXiv 2017 [Paper] [Code]IROS 2017 [Paper]arXiv 2017 [Paper]ECCV 2018 [Paper]CVPR 2021 [Paper] [Code]NeurIPS 2021 [Paper] [Code]arXiv 2021 [Paper] [Code]arXiv 2022 [Paper] [Code]CVPR 2023 [Paper] [Code]CVPR 2023 [Paper] [Code]CVPR 2023 [Paper] [Code]EMNLP 2020 [Paper] [Code]arXiv 2020 [Paper] [Code]arXiv 2022 [Paper]PRCV 2022 [Paper] [Code]ICML 2023 [Paper] [Code]arXiv 2023 [Paper]ICCV 2021 [Paper] [Code]arXiv 2021 [Paper] [Code]EMNLP 2021 [Paper] [Code]ECCV 2022 [Paper] [Code]arXiv 2022 [Paper] [Code]ECCV 2022 [Paper] [Code]ICLR 2023 [Paper] [Code]TPAMI 2023 [Paper] [Code]ECCV 2024 [Paper] [Code]arXiv 2023 [Paper] [Code]arXiv 2023 [Paper] [Code]ACL 2024 [Paper] [Code]EMNLP 2023 [Paper] [Code]arXiv 2023 [Paper]CVPR 2024 [Paper] [Code]EMNLP 2024 [Paper] [Code]ECCV 2024 [Paper] [Code]CVPR 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]CVPR 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]CVPR 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper]CVPR 2024 [Paper] [Code]ECCV 2024 [Paper] [Code]ECCV 2024 [Paper] [Code]ICCV 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]ICLR 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]ICCV 2019 [Paper] [Code]arXiv 2019 [Paper]CVPR 2020 [Paper] [Code]arXiv 2021 [Paper]arXiv 2021 [Paper]NAACL 2021 [Paper] [Code]NeurIPS 2021 [Paper] [Code]arXiv 2022 [Paper] [Code]NeurIPS 2023 [Paper] [Code]ICML 2024 [Paper]ICLR 2024 [Paper] [Code]AAAI 2019 [Paper] [Code]NeurIPS 2022 [Paper] [Code]NeurIPS 2022 [Paper] [Code]SIGIR 2018 [Paper]arXiv 2018 [Paper]arXiv 2022 [Paper] [Code]ICLR 2023 [Paper] [Code]ECCV 2022 [Paper] [Code]IJCAI 2018 [Paper]arXiv 2016 [Paper] [Code]AAAI 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]A new paradigm following DeepSeek-R1: rule-based rewards and GRPO are used to elicit explicit chain-of-thought and temporal reasoning in Video-LLMs.
arXiv 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]NeurIPS 2025 [Paper] [Code]NeurIPS 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]ICML 2025 [Paper]arXiv 2026 [Paper]arXiv 2025 [Paper]CVPR 2025 [Paper]arXiv 2026 [Paper]arXiv 2025 [Paper]CVPR 2022 [Paper] [Code]ICCV 2019 [Paper] [Code]ACL 2022 [Paper] [Code]CVPR 2021 [Paper] [Code]arXiv 2017 [Paper] [Code]IJCV 2020 [Paper] [Code]CVPR 2022 [Paper] [Code]TACL 2013 [Paper]AACL-IJCNLP 2020 [Paper] [Code]NeurIPS 2021 [Paper] [Code]ICCV 2019 [Paper] [Code]NeurIPS 2023 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2026 [Paper]CVPR 2023 [Paper] [Code]CVPR 2022 [Paper]arXiv 2019 [Paper]CVPR 2021 [Paper] [Code]CVPR 2021 [Paper] [Code]ACL 2011 [Paper] [Code]CVPR 2016 [Paper] [Code]CVPR 2017 [Paper] [Code]arXiv 2018 [Paper] [Code]ICCV 2011 [Paper] [Code]arXiv 2017 [Paper] [Code]CVPR 2015 [Paper] [Code]ECCV 2020 [Paper] [Code]CVPR 2019 [Paper] [Code]CVPR 2019 [Paper] [Code]CVPR 2019 [Paper] [Code]CVPR 2025 [Paper] [Code]NeurIPS 2024 [Paper] [Code]ECCV 2024 [Paper] [Code]ACMMM 2021 [Paper] [Code]arXiv 2019 [Paper] [Code]NeurIPS 2023 [Paper] [Code]ECCV 2022 [Paper]ICLR 2024 [Paper] [Code]NeurIPS 2018 [Paper] [Code]arXiv 2020 [Paper]CVPR 2024 [Paper] [Code]NeurIPS 2024 [Paper] [Code]NeurIPS 2025 [Paper] [Code]arXiv 2025 [Paper]arXiv 2025 [Paper] [Code]Contributions are very welcome! If you'd like to add a paper, dataset, or correct a leaderboard entry:
Title Venue Year [Paper] [Code]).We aim to keep this list focused on video–language understanding (retrieval, captioning, QA, grounding, temporal localization, and instruction tuning). Pure video-generation, action recognition without language, or text-only NLP papers are typically out of scope.
For questions about the survey itself, feel free to reach out to the authors via the corresponding emails listed in the paper.
Last updated: May 2026 · Maintained by the authors of the ACL 2024 Findings survey · 2025–2026 papers added
19 commits
[ACL’24 Findings] Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives
See the codeThis repository accompanies our ACL 2024 (Findings) survey paper, Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives. It curates leaderboards, datasets, and a structured paper list spanning the evolution of video-language understanding — from early RNN/CNN pipelines through transformer-based pre-training and into the current generation of large video–language models.
The list is actively maintained. Spotted an error or a missing paper? Please open an issue or submit a pull request — see Contributing below.
If our survey is useful for your research, please cite us:
@article{nguyen2024video,
title = {Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives},
author = {Nguyen, Thong and Bin, Yi and Xiao, Junbin and Qu, Leigang and Li, Yicong and
Wu, Jay Zhangjie and Nguyen, Cong-Duy and Ng, See-Kiong and Tuan, Luu Anh},
journal = {arXiv preprint arXiv:2406.05615},
year = {2024}
}
The video-language landscape has shifted decisively toward large video–language models, long-form understanding, and reasoning. Some of the most notable threads from 2025–2026:
See the LLM-augmented, Agentic and streaming Video-LLMs, Reinforcement learning and video reasoning, and Modern Video-LLM evaluation benchmarks sections below for details and references.
Results reported on the MSRVTT 1k-A test split (zero-shot or fine-tuned, following each paper's original protocol). Higher is better for all metrics.
| Method | Architecture | Video Encoder | Text Encoder | R@1 | R@5 | R@10 |
|---|---|---|---|---|---|---|
| VSE-LSTM (NeurIPS 2014) | Pre-TF | ConvNet/OxfordNet | GloVe-LSTM | 3.8 | 12.7 | 17.1 |
| C+LSTM+SA-FC7 (arXiv 2016) | Pre-TF | VGG | GloVe-LSTM | 4.2 | 12.9 | 19.9 |
| EITanque (arXiv 2016) | Pre-TF | VGG | word2vec-LSTM | 4.7 | 16.6 | 24.1 |
| SA-G+SA-FC7 (arXiv 2016) | Pre-TF | VGG | GloVe | 3.1 | 9.0 | 13.4 |
| CT-SAN (CVPR 2017) | Pre-TF | ResNet | word2vec-LSTM | 4.4 | 16.6 | 22.3 |
| JSFusion (ECCV 2018) | Pre-TF | ResNet | GloVe-LSTM | 10.2 | 31.2 | 43.2 |
| DeCEMBERT (NAACL 2021) | Shared TF | ResNet | BERT | 17.5 | 44.3 | 58.6 |
| VLM (ACL 2021) | Shared TF | S3D | BERT | 28.1 | 55.5 | 67.4 |
| All-in-one (CVPR 2023) | Shared TF | Linear | BERT | 37.9 | 68.1 | 77.1 |
| ActBERT (CVPR 2020) | Stacked TF | Faster-RCNN | BERT | 16.3 | 42.8 | 56.9 |
| HERO (EMNLP 2020) | Stacked TF | ResNet + SlowFast | BERT | 16.8 | 43.4 | 57.7 |
| MV-GPT (arXiv 2022) | Stacked TF | ViViT | BERT | 37.3 | 65.5 | 75.1 |
| VIOLET (CVPR 2023) | Stacked TF | VS-TF | BERT | 37.2 | 64.8 | 75.8 |
| VindLU (CVPR 2023) | Stacked TF | ViT | BERT | 48.8 | 72.4 | 82.2 |
| CLIP2TV (ICLR 2023) | Dual TF | ViT | CLIP-text | 32.4 | 58.2 | 68.6 |
| CLIP4Clip (arXiv 2021) | Dual TF | ViT | CLIP-text | 44.5 | 71.4 | 81.6 |
| CLIP-ViP (ICLR 2023) | Dual TF | ViT | CLIP-text | 49.6 | 74.5 | 84.8 |
| InternVideo2 (ECCV 2024) | Dual TF | InternViT | CLIP-text | 55.9 | 78.3 | 85.1 |
Results reported on MSRVTT test split.
| Method | Architecture | Video Encoder | BLEU-4 | METEOR | CIDEr |
|---|---|---|---|---|---|
| TA (ICCV 2015) | Pre-TF | 3D-CNN | 36.5 | 25.7 | – |
| h-RNN (CVPR 2016) | Pre-TF | VGG | 36.8 | 25.9 | – |
| MFATT (arXiv 2016) | Pre-TF | ResNet + C3D | 39.1 | 26.7 | – |
| CAT-TM (arXiv 2016) | Pre-TF | ResNet + C3D | 36.6 | 25.6 | – |
| NFS-TM (arXiv 2016) | Pre-TF | ResNet + C3D | 37.0 | 25.9 | – |
| Fuse-TM (arXiv 2016) | Pre-TF | ResNet + C3D | 37.5 | 25.9 | – |
| MARN (CVPR 2019) | Pre-TF | ResNet | – | – | 46.8 |
| Res-ATT (WWW 2019) | Pre-TF | ResNet | 37.0 | 26.9 | 40.7 |
| DenseLSTM (ACMMM 2019) | Pre-TF | VGG | 38.1 | 27.2 | 42.8 |
| DeCEMBERT (NAACL 2021) | Stacked TF | ResNet | 45.2 | 29.7 | 52.3 |
| UniVL (arXiv 2020) | Stacked TF | S3D | 41.8 | 28.9 | 50.0 |
| CLIP-DCD (PRCV 2022) | Stacked TF | ViT | 48.2 | 30.9 | 64.8 |
| MV-GPT (arXiv 2022) | Stacked TF | ViViT | 48.9 | 38.7 | 60.0 |
| VIOLET (CVPR 2023) | Stacked TF | VS-TF | – | – | 58.0 |
| LAVENDER (arXiv 2023) | Stacked TF | VS-TF | – | – | 57.4 |
| VLAB (arXiv 2023) | Stacked TF | EVA-G | 54.6 | 33.4 | 74.9 |
| mPLUG-2 (ICML 2023) | Stacked TF | ViT | 57.8 | 34.9 | 80.3 |
| Tarsier (arXiv 2024) | LLM-Augmented | CLIP-ViT | – | – | 75.9 |
Accuracy (%) on the MSRVTT-QA and MSVD-QA test splits.
| Method | Architecture | Video Encoder | Text Encoder | MSRVTT-QA | MSVD-QA |
|---|---|---|---|---|---|
| E-MN (ACMMM 2017) | Pre-TF | VGG + C3D | GloVe-LSTM | 30.4 | 26.7 |
| QueST (AAAI 2020) | Pre-TF | ResNet + C3D | GloVe-LSTM | 40.0 | – |
| HME (CVPR 2019) | Pre-TF | ResNet/VGG + C3D | GloVe-GRU | 34.6 | 36.1 |
| HGA (AAAI 2020) | Pre-TF | ResNet/VGG + C3D | GloVe-GRU | 33.0 | 33.7 |
| ST-VQA (IJCV 2019) | Pre-TF | ResNet + C3D | GloVe-LSTM | 35.5 | 34.7 |
| PGAT (ACMMM 2021) | Pre-TF | Faster-RCNN | GloVe-LSTM | 38.1 | 39.0 |
| HCRN (CVPR 2020) | Pre-TF | ResNet | GloVe-LSTM | 38.6 | 41.2 |
| All-in-one (CVPR 2023) | Shared TF | Linear | BERT | 44.3 | 47.9 |
| ClipBERT (CVPR 2021) | Stacked TF | CLIP-text | BERT | 37.4 | – |
| DeCEMBERT (NAACL 2021) | Stacked TF | ResNet | BERT | 37.4 | – |
| LAVENDER (arXiv 2022) | Stacked TF | VS-TF | BERT | 45.0 | 56.6 |
| VIOLET (CVPR 2023) | Stacked TF | VS-TF | BERT | 44.5 | 54.7 |
| VindLU (CVPR 2023) | Stacked TF | ViT | BERT | 44.6 | – |
| VGT (ECCV 2022) | Dual TF | Faster-RCNN | BERT | 39.7 | – |
| CoVGT (TPAMI 2023) | Dual TF | Faster-RCNN | BERT | 40.0 | – |
| Video-ChatGPT (arXiv 2023) | LLM-Augmented | ViT | Vicuna | 49.3 | 64.9 |
| Video-LLaMA (EMNLP 2023) | LLM-Augmented | EVA-CLIP | LLaMA / Vicuna | 49.6 | 51.6 |
| VideoChat2 (CVPR 2024) | LLM-Augmented | UMT-L | Vicuna | 54.1 | 70.0 |
| LLaMA-VID (ECCV 2024) | LLM-Augmented | EVA-G | Vicuna | 58.9 | 70.0 |
| VideoLLaMA 2 (arXiv 2024) | LLM-Augmented | CLIP-L | Mistral | – | 71.7 |
| LLaVA-Video (arXiv 2024) | LLM-Augmented | SigLIP | Qwen2 | – | – |
| Apollo-7B (CVPR 2025) | LLM-Augmented | SigLIP + InternVideo2 | Qwen2 | – | – |
| Qwen2-VL-7B (arXiv 2024) | LLM-Augmented | Dynamic-ViT | Qwen2 | – | – |
| VideoLLaMA 3 (arXiv 2025) | LLM-Augmented | SigLIP-dyn | Qwen2.5 | – | – |
| Qwen2.5-VL-72B (arXiv 2025) | LLM-Augmented | Dynamic-ViT | Qwen2.5 | – | – |
| Tarsier2-7B (arXiv 2025) | LLM-Augmented | CLIP-ViT | Qwen2 | – | – |
| Video-R1-7B (NeurIPS 2025) | LLM-Augmented + RL | Qwen2.5-VL | Qwen2.5 | – | – |
| VideoChat-R1 (NeurIPS 2025) | LLM-Augmented + RL | Qwen2.5-VL | Qwen2.5 | – | – |
💡 The latest LLM-augmented systems (Qwen2.5-VL, LLaVA-Video, VideoLLaMA 2/3, Tarsier2) are increasingly evaluated on long-video benchmarks such as Video-MME, MLVU, LongVideoBench, and MVBench rather than MSRVTT-QA / MSVD-QA. See the table below and Datasets and Benchmarks for the modern evaluation suites.
Accuracy (%) on the modern long-form video-LMM benchmarks. We report representative numbers from each paper; rigorous comparison should consult original protocols (frame count, resolution, prompt). "—" indicates the model did not officially report on that benchmark.
| Method | Backbone LLM | Video-MME (wo subs) | MLVU | LongVideoBench | MVBench |
|---|---|---|---|---|---|
| Video-LLaVA (EMNLP 2024) | Vicuna-7B | 39.9 | 47.3 | 39.1 | 41.0 |
| VideoChat2 (CVPR 2024) | Vicuna-7B | 39.5 | 47.9 | 39.3 | 51.1 |
| LLaVA-NeXT-Video (2024) | Qwen2-7B | 46.5 | – | 43.5 | 46.5 |
| LongVA-7B (arXiv 2024) | Qwen2-7B | 52.6 | 56.3 | – | – |
| VideoLLaMA 2-7B (arXiv 2024) | Mistral-7B | 47.9 | 48.5 | – | 54.6 |
| LLaVA-Video-7B (arXiv 2024) | Qwen2-7B | 63.3 | 70.8 | 58.2 | 58.6 |
| Apollo-3B (CVPR 2025) | Qwen2-2.7B | 58.4 | 68.7 | 55.1 | – |
| Apollo-7B (CVPR 2025) | Qwen2-7B | 61.2 | 70.9 | 58.5 | – |
| VideoLLaMA 3-7B (arXiv 2025) | Qwen2.5-7B | 66.2 | 73.0 | 59.8 | 69.7 |
| Tarsier2-7B (arXiv 2025) | Qwen2-7B | 64.5 | – | – | 67.6 |
| InternVL3-8B (2025) | Qwen2.5-7B | 66.3 | 71.4 | 58.8 | 70.3 |
| Qwen2.5-VL-7B (arXiv 2025) | Qwen2.5-7B | 65.1 | 70.2 | 56.0 | 69.6 |
| Qwen2.5-VL-72B (arXiv 2025) | Qwen2.5-72B | 73.3 | 74.6 | 60.7 | 70.4 |
| Video-R1-7B (NeurIPS 2025) | Qwen2.5-VL-7B | 59.7 | – | – | 63.9 |
| VideoChat-R1 (NeurIPS 2025) | Qwen2.5-VL-7B | 66.0 | – | – | 70.6 |
| Gemini 2.5 Pro (2025) | proprietary | 84.7 | – | 66.4 | – |
Task abbreviations: TVR = text-video retrieval · VC = video captioning · VideoQA = video question answering · VMR = video moment retrieval · AL = action localization · AR = action recognition · AS = action segmentation · VG = video grounding · PT = pre-training.
| Dataset | Links | Video Source | Annotation | Tasks | #Videos/Scenes |
|---|---|---|---|---|---|
MSVD | Paper · Data | YouTube | Manual | TVR, VC, VideoQA | 1.9K |
MSRVTT | Paper · Data | Web | Manual | TVR, VC, VideoQA | 7.2K |
ActivityNet | Paper · Data | YouTube | Manual | AL, TVR, VC, VMR | 5.8K |
DiDeMo | Paper · Data | YFCC100M | Manual | TVR | 11K |
LSMDC | Paper · Data | Movies | Manual | TVR | 72 movies |
VaTeX | Paper · Data | Kinetics-600 | Manual | TVR, VC | 41K |
YouCook2 | Paper · Data | YouTube | Manual | TVR, VC | 2K |
Charades | Paper · Data | Crowd-collected | Manual | AR, VMR, VideoQA | 10K |
How2 | Paper · Data | YouTube | Auto | VC | 13.2K |
| Dataset | Links | Source | Annotation | Tasks | #Videos/Scenes |
|---|---|---|---|---|---|
TGIF-QA | Paper · Data | TGIFs | Manual | VideoQA | 71K |
TGIF-QA-R | Paper · Data | TGIF-QA | Manual, Auto | VideoQA | 71K |
FIBER | Paper · Data | VaTeX | Manual | VC, VideoQA | 28K |
WildQA | Paper · Data | YouTube | Manual | VideoQA | 0.4K |
NExT-QA | Paper · Data | VidOR | Manual | VideoQA | 5.4K |
CausalVid-QA | Paper · Data | Kinetics-700 | Manual | VideoQA | 26K |
How2QA | Paper · Data | HowTo100M | Manual | VideoQA | 22K |
TVQA | Paper · Data | TV shows | Manual | VideoQA | 22K |
Ego-QA | Paper · Data | Egocentric | Manual | VideoQA | 18.5K |
MAD-QA | Paper · Data | Movies | Manual | VideoQA | 19K |
| Dataset | Links | Source | Annotation | Tasks | #Videos/Scenes |
|---|---|---|---|---|---|
TVR | Paper · Data | TVQA | Manual | VMR | 22K |
How2R | Paper · Data | HowTo100M | Manual | VMR | 22K |
TACoS | Paper · Data | MPII Composites | Manual | VMR | 0.1K |
YouTube Highlights | Paper · Data | YouTube | Manual | VMR | 0.6K |
QVHighlights | Paper · Data | YouTube vlogs | Manual | VMR | 10K |
TVSum | Paper · Data | YouTube | Manual | VMR | 50 |
ViTT | Paper · Data | YouTube-8M | Manual | VMR | 5.8K |
VidChapters-7M | Paper · Data | YT-Temporal-180M | Auto | VC, VMR | 817K |
| Dataset | Links | Source | Annotation | Tasks | #Videos/Scenes |
|---|---|---|---|---|---|
HMDB-51 | Paper · Data | Web | Manual | TVR, AR | 6.8K |
Kinetics-400 | Paper · Data | YouTube | Manual | AR | 306K |
Kinetics-600 | Paper · Data | Kinetics-400 | Manual | AR, VG | 480K |
Kinetics-700 | Paper · Data | Kinetics-600 | Manual | AR | 650K |
Moments in Time | Paper · Data | Web | Manual | AR | 1M |
SSV1 | Paper · Data | Crowd | Manual | AR | 108K |
SSV2 | Paper · Data | Crowd | Manual | AR | 221K |
EK-100 | Paper · Data | Egocentric | Manual | AR, AL | 7K |
COIN | Paper · Data | YouTube | Manual | AS | 12K |
CrossTask | Paper · Data | YouTube | Manual | AR | 4.7K |
| Dataset | Links | Source | Annotation | Tasks | #Videos/Scenes |
|---|---|---|---|---|---|
HowTo100M | Paper · Data | YouTube | Auto | PT | 1.2M |
HD-VILA-100M | Paper · Data | YouTube | Auto | PT | 3.3M |
YT-Temporal-180M | Paper · Data | YouTube | Auto | PT | 6M |
VideoCC3M | Paper · Data | Web | Auto | PT | 6.3M |
WebVid-10M | Paper · Data | Web | Auto | PT | 10.7M |
Alivol-10M | Paper | E-commerce | Auto | PT | 10M |
WTS70M | Paper | YouTube | Auto | PT | 70M |
InternVid | Paper · Data | YouTube | Auto | PT | 7.1M |
Panda-70M | Paper · Data | HD-VILA-100M | Auto (multi-teacher) | PT | 70M |
ShareGPT4Video | Paper · Data | Mixed sources | Auto (GPT-4V) | PT, VC | 4.8M |
The shift toward general-purpose video-language models has produced a new wave of benchmarks emphasizing long-form, temporally rich, knowledge-grounded, and reasoning-oriented evaluation.
| Benchmark | Links | Source | Tasks | Notes |
|---|---|---|---|---|
MVBench | Paper · Data | Mixed | VideoQA | 20 temporal-reasoning tasks, 4K QAs (short clips) |
EgoSchema | Paper · Data | Ego4D | VideoQA | 5K MCQs over 3-min egocentric videos |
Perception Test | Paper · Data | Crowd | VideoQA, VMR, AR | Probes memory, abstraction, physics, semantics |
Video-MME | Paper · Data | YouTube | VideoQA | 900 videos / 2.7K MCQs across short, medium, long |
MMBench-Video | Paper · Data | YouTube | VideoQA | Long-form free-form QA, human-annotated taxonomy |
MLVU | Paper · Data | Mixed genres | VideoQA | 1.7K videos (3 min – 2 h), multi-task, multi-level |
LongVideoBench | Paper · Data | Web | VideoQA | Long-context interleaved video-language, referring QA |
VideoVista | Paper · Data | 894 videos | VideoQA | 25K QAs across diverse domains and reasoning types |
CinePile | Paper · Data | Movies | VideoQA | 9.4K videos, 303K QAs for cinematic understanding |
TempCompass | Paper · Data | Mixed | VideoQA | Focused on fine-grained temporal perception |
TemporalBench | Paper · Data | Mixed | VideoQA | Fine-grained temporal understanding, dense action annotations |
CG-Bench | Paper · Data | Long videos | VideoQA | 1.2K videos, 12K QAs with clue-grounded evaluation |
Video-MMMU | Paper · Data | Lecture videos | VideoQA | 300 expert videos, knowledge-acquisition Δ metric |
ApolloBench | Paper · Data | Curated mixed | VideoQA | 41× faster than Video-MME, perception-focused |
OVBench | Paper · Data | Streaming | Online VideoQA | Online/streaming evaluation across temporal scales |
StreamBench | Paper | Streaming | Streaming dialogue | Real-time multi-turn streaming video reasoning |
Video-Holmes | Paper | Movies/TV | Video reasoning | Multi-step deductive reasoning over clips |
VCR-Bench | Paper | Mixed | Video CoT reasoning | Comprehensive video chain-of-thought benchmark |
VR-Bench | Paper | Mixed | Video reasoning | Probes spatiotemporal reasoning with verifier |
MMDuet / MT-Video-Bench | Paper | Mixed | Multi-turn VideoQA | Holistic eval of multi-turn video dialogue |
arXiv 2021 [Paper]ACM Computing Surveys 2022 [Paper] [Code]EMNLP 2022 [Paper] [Code]IJMIR 2023 [Paper]arXiv 2023 [Paper]Mobile Networks and Applications 2021 [Paper]TPAMI 2025 [Paper] [Code]arXiv 2024 [Paper] [Code]OpenReview 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]DMML 2025 [Paper]NeurIPS 2014 [Paper]ICCV 2015 [Paper] [Code]CVPR 2016 [Paper]CVPR 2016 [Paper] [Code]arXiv 2016 [Paper]arXiv 2016 [Paper] [Code]arXiv 2016 [Paper]CVPR 2017 [Paper]SIGIR 2017 [Paper]CVPR 2017 [Paper]ICCV 2017 [Paper]ICCV 2017 [Paper] [Code]AAAI 2017 [Paper]arXiv 2017 [Paper] [Code]IROS 2017 [Paper]arXiv 2017 [Paper]ECCV 2018 [Paper]CVPR 2021 [Paper] [Code]NeurIPS 2021 [Paper] [Code]arXiv 2021 [Paper] [Code]arXiv 2022 [Paper] [Code]CVPR 2023 [Paper] [Code]CVPR 2023 [Paper] [Code]CVPR 2023 [Paper] [Code]EMNLP 2020 [Paper] [Code]arXiv 2020 [Paper] [Code]arXiv 2022 [Paper]PRCV 2022 [Paper] [Code]ICML 2023 [Paper] [Code]arXiv 2023 [Paper]ICCV 2021 [Paper] [Code]arXiv 2021 [Paper] [Code]EMNLP 2021 [Paper] [Code]ECCV 2022 [Paper] [Code]arXiv 2022 [Paper] [Code]ECCV 2022 [Paper] [Code]ICLR 2023 [Paper] [Code]TPAMI 2023 [Paper] [Code]ECCV 2024 [Paper] [Code]arXiv 2023 [Paper] [Code]arXiv 2023 [Paper] [Code]ACL 2024 [Paper] [Code]EMNLP 2023 [Paper] [Code]arXiv 2023 [Paper]CVPR 2024 [Paper] [Code]EMNLP 2024 [Paper] [Code]ECCV 2024 [Paper] [Code]CVPR 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]CVPR 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]CVPR 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper]CVPR 2024 [Paper] [Code]ECCV 2024 [Paper] [Code]ECCV 2024 [Paper] [Code]ICCV 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]ICLR 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]ICCV 2019 [Paper] [Code]arXiv 2019 [Paper]CVPR 2020 [Paper] [Code]arXiv 2021 [Paper]arXiv 2021 [Paper]NAACL 2021 [Paper] [Code]NeurIPS 2021 [Paper] [Code]arXiv 2022 [Paper] [Code]NeurIPS 2023 [Paper] [Code]ICML 2024 [Paper]ICLR 2024 [Paper] [Code]AAAI 2019 [Paper] [Code]NeurIPS 2022 [Paper] [Code]NeurIPS 2022 [Paper] [Code]SIGIR 2018 [Paper]arXiv 2018 [Paper]arXiv 2022 [Paper] [Code]ICLR 2023 [Paper] [Code]ECCV 2022 [Paper] [Code]IJCAI 2018 [Paper]arXiv 2016 [Paper] [Code]AAAI 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]A new paradigm following DeepSeek-R1: rule-based rewards and GRPO are used to elicit explicit chain-of-thought and temporal reasoning in Video-LLMs.
arXiv 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]NeurIPS 2025 [Paper] [Code]NeurIPS 2025 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]ICML 2025 [Paper]arXiv 2026 [Paper]arXiv 2025 [Paper]CVPR 2025 [Paper]arXiv 2026 [Paper]arXiv 2025 [Paper]CVPR 2022 [Paper] [Code]ICCV 2019 [Paper] [Code]ACL 2022 [Paper] [Code]CVPR 2021 [Paper] [Code]arXiv 2017 [Paper] [Code]IJCV 2020 [Paper] [Code]CVPR 2022 [Paper] [Code]TACL 2013 [Paper]AACL-IJCNLP 2020 [Paper] [Code]NeurIPS 2021 [Paper] [Code]ICCV 2019 [Paper] [Code]NeurIPS 2023 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2024 [Paper] [Code]arXiv 2025 [Paper] [Code]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2025 [Paper]arXiv 2026 [Paper]CVPR 2023 [Paper] [Code]CVPR 2022 [Paper]arXiv 2019 [Paper]CVPR 2021 [Paper] [Code]CVPR 2021 [Paper] [Code]ACL 2011 [Paper] [Code]CVPR 2016 [Paper] [Code]CVPR 2017 [Paper] [Code]arXiv 2018 [Paper] [Code]ICCV 2011 [Paper] [Code]arXiv 2017 [Paper] [Code]CVPR 2015 [Paper] [Code]ECCV 2020 [Paper] [Code]CVPR 2019 [Paper] [Code]CVPR 2019 [Paper] [Code]CVPR 2019 [Paper] [Code]CVPR 2025 [Paper] [Code]NeurIPS 2024 [Paper] [Code]ECCV 2024 [Paper] [Code]ACMMM 2021 [Paper] [Code]arXiv 2019 [Paper] [Code]NeurIPS 2023 [Paper] [Code]ECCV 2022 [Paper]ICLR 2024 [Paper] [Code]NeurIPS 2018 [Paper] [Code]arXiv 2020 [Paper]CVPR 2024 [Paper] [Code]NeurIPS 2024 [Paper] [Code]NeurIPS 2025 [Paper] [Code]arXiv 2025 [Paper]arXiv 2025 [Paper] [Code]Contributions are very welcome! If you'd like to add a paper, dataset, or correct a leaderboard entry:
Title Venue Year [Paper] [Code]).We aim to keep this list focused on video–language understanding (retrieval, captioning, QA, grounding, temporal localization, and instruction tuning). Pure video-generation, action recognition without language, or text-only NLP papers are typically out of scope.
For questions about the survey itself, feel free to reach out to the authors via the corresponding emails listed in the paper.
Last updated: May 2026 · Maintained by the authors of the ACL 2024 Findings survey · 2025–2026 papers added
19 commits