A curated list of multimodal LLM benchmarks and papers, with an interactive visualization dashboard.
HTML
9
4 commits
updated Aug 13, 2026
An interactive explorer & paper list for MLLM benchmarks.
🌐 Explore the Interactive Dashboard »
🤗 Sample Data on HuggingFace »
We collect 130+ MLLM benchmarks across 20+ categories (OCR, Math, Video, Agent, Spatial Intelligence, etc.) with rich metadata including GitHub stars, HuggingFace downloads, paper abstracts, model evaluation coverage, and more. Everything is presented through a modern interactive dashboard — you can search, filter, sort, and browse actual benchmark samples directly in the browser.
Clone and serve locally:
git clone https://github.com/lchen1019/awesome-mllm-benchmarks.git
cd awesome-mllm-benchmarks
python serve.py 8080
Then open http://localhost:8080 in your browser.
serve.pystarts a simple HTTP server with no-cache headers. You can also use any other static file server.Sample images live in
samples/and are served locally with the site. A copy also remains on HuggingFace.
Project Structure
awesome-mllm-benchmarks/
├── index.html # Main dashboard page
├── cases.html # Sample viewer page
├── data/
│ ├── benchmarks.json # Benchmark metadata (130+ entries)
│ ├── model-matrix.json # Model × Benchmark coverage data
│ └── cases-manifest.json # Sample viewer config
├── samples/ # Benchmark sample data (images, per-benchmark data)
├── assets/ # Logo, favicon, screenshots
├── serve.py # Dev server with no-cache headers
├── .github/workflows/pages.yml # GitHub Pages deployment
└── .nojekyll # Bypass Jekyll processing
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| TextVQA | Paper · HF | 2019-04 | FAIR |
| DocVQA | Paper · HF | 2020-07 | IIIT Hyderabad |
| ChartQA | Paper · GitHub · HF | 2022-03 | YorkU |
| OCRBench | Paper · GitHub · HF | 2023-05 | HUST |
| DUDE | Paper · GitHub · HF | 2023-05 | EPFL |
| ChartX | Paper · HF | 2024-02 | Shanghai AI Lab |
| CharXiv(RQ) | Paper · GitHub · HF | 2024-06 | Princeton |
| CharXiv(DQ) | Paper · GitHub · HF | 2024-06 | Princeton |
| MMLongBench-Doc | Paper · GitHub · HF | 2024-07 | Tsinghua |
| CC-OCR | Paper · GitHub · HF | 2024-12 | Alibaba |
| OmniDocBench | Paper · GitHub · HF | 2024-12 | Shanghai AI Lab |
| OmniDocBench1.5 | Paper · GitHub · HF | 2024-12 | Shanghai AI Lab |
| LongDocURL | Paper · GitHub · HF | 2024-12 | SJTU |
| OCRBench-v2 | Paper · GitHub · HF | 2024-12 | HUST |
| ChartQAPro | Paper · GitHub · HF | 2025-04 | YorkU |
| MMLongBench | Paper · GitHub · HF | 2025-05 | Edinburgh |
| Real5-OmniDocBench | Paper · HF | 2026-03 | Baidu |
| AI2D_TEST | Paper · HF | - | AI2 |
| InfoVQA | Paper · HF | - | IIIT Hyderabad |
| TableVQA | HF | - | KAIST |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| Nuscene | Paper · GitHub | 2019-03 | nuTonomy |
| Hypersim | Paper · GitHub | 2020-11 | Apple |
| ERQA | Paper · GitHub · HF | 2021-10 | BAAI |
| ARKitScenes | Paper · GitHub | 2021-11 | Apple |
| ODInW13 | Paper · GitHub | 2022-06 | Microsoft |
| LingoQA | Paper · GitHub | 2023-12 | Wayve |
| BLINK | Paper · GitHub · HF | 2024-04 | UPenn |
| DA-2K | Paper · GitHub · HF | 2024-06 | HKU |
| CV-Bench | Paper · HF | 2024-06 | NYU |
| RoboSpatialHome | Paper · GitHub · HF | 2024-11 | OSU |
| VSI-Bench | Paper · GitHub · HF | 2024-12 | NYU |
| All-Angles | Paper · GitHub · HF | 2025-04 | ZJU |
| MMSI-Bench | Paper · GitHub · HF | 2025-05 | Shanghai AI Lab |
| RefSpatialBench | Paper · GitHub · HF | 2025-06 | SJTU |
| TreeBench | Paper · GitHub · HF | 2025-07 | HKU |
| RefCOCO(avg) | Paper · GitHub · HF | - | UNC |
| EmbSpatialBench | Paper · HF | - | BAAI |
| RealWorldQA | HF | - | xAI |
| SUNRGBD | Paper · GitHub · HF | - | Princeton |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| MMBench-V1.1-EN | Paper · GitHub · HF | 2023-07 | Shanghai AI Lab |
| MMBench-V1.1-CN | Paper · GitHub · HF | 2023-07 | Shanghai AI Lab |
| MMVet | Paper · GitHub · HF | 2023-08 | NUS |
| HallusionBench | Paper · GitHub · HF | 2023-10 | UMD |
| MMStar | Paper · GitHub · HF | 2024-03 | CUHK-SZ |
| MTVQA | Paper · GitHub · HF | 2024-05 | ByteDance |
| MUIRBench | Paper · GitHub · HF | 2024-06 | UPenn |
| SimpleVQA | Paper · GitHub · HF | 2025-02 | BUAA |
| ViVerBench | Paper · GitHub · HF | 2025-10 | Tsinghua |
| MME-CC | Paper · GitHub · HF | 2025-11 | NTU |
| WorldVQA | Paper · GitHub · HF | 2026-01 | Moonshot AI |
| VibeEval | Paper · GitHub · HF | - | Reka AI |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| MathVista | Paper · GitHub · HF | 2023-10 | UCLA |
| OlympiadBench | Paper · GitHub · HF | 2024-02 | Tsinghua |
| MathVision | Paper · GitHub · HF | 2024-02 | CUHK |
| DynaMath | Paper · GitHub · HF | 2024-11 | Yale |
| MathVerse | Paper · GitHub · HF | 2024-03 | CUHK |
| We-Math | Paper · GitHub · HF | 2024-07 | BAAI |
| MATH-V | Paper · GitHub · HF | 2024-07 | SJTU |
| CountBench | Paper · HF | 2023-01 | |
| MathCheck-GEO | Paper · GitHub · HF | 2024-07 | NTU |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| ArcAGI1-Image | Paper · GitHub · HF | 2019-11 | - |
| ArcAG2-Image | Paper · GitHub · HF | 2024-12 | Zapier |
| MMMU | Paper · GitHub · HF | 2024-09 | IN.AI |
| LogicVista | Paper · GitHub · HF | 2024-07 | UCLA |
| EMMA | Paper · GitHub · HF | 2025-01 | HUST |
| BabyVision | Paper · HF | 2025-04 | Tsinghua |
| VBench | Paper · GitHub · HF | 2025-05 | ZJU |
| MME-Reasoning | Paper · GitHub · HF | 2025-03 | NJU |
| VisualPuzzles | Paper · GitHub · HF | 2025-04 | Stanford |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| ScienceQA | Paper · GitHub · HF | 2022-09 | UCLA |
| MMMU-Pro | Paper · GitHub · HF | 2024-09 | IN.AI |
| SciFIG | Paper · GitHub · HF | 2024-05 | Adobe |
| HistoryBench | Paper · HF | 2025-02 | CAS |
| MEGA-Bench | Paper · GitHub · HF | 2024-10 | TIGER-Lab |
| NPHardEval4V | Paper · GitHub · HF | 2024-03 | UMich |
| GPQA-Diamond | Paper · HF | 2023-11 | NYU |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| MME | Paper · GitHub · HF | 2023-06 | NJU |
| SEEDBench | Paper · GitHub · HF | 2023-07 | Tencent |
| CRPE | Paper · GitHub · HF | 2024-03 | Tsinghua |
| MME-RealWorld | Paper · GitHub · HF | 2024-08 | NJU |
| WildVision | Paper · GitHub · HF | 2024-06 | AI2 |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| RefCOCO(avg) | Paper · GitHub · HF | - | UNC |
| ScreenSpot | Paper · GitHub · HF | 2025-05 | Shanghai AI Lab |
| ODInW13 | Paper · GitHub | 2022-06 | Microsoft |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| Design2Code | Paper · GitHub · HF | 2024-03 | Stanford |
| ChartMimic | Paper · GitHub · HF | 2024-06 | Tsinghua |
| UniSVG | Paper · HF | 2025-11 | SJTU |
| FronTalk | Paper · HF | 2025-12 | UCLA |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| SLAKE | Paper · HF | 2021-02 | OSU |
| PMC-VQA | Paper · GitHub · HF | 2023-05 | ZJU |
| MedXpertQA-MM | Paper · GitHub · HF | 2025-01 | Tsinghua |
Video / Knowledge
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| MMVU | Paper · GitHub · HF | 2025-01 | Yale |
| VideoMMMU | Paper · GitHub · HF | 2025-01 | NTU |
| VCRBench | Paper · GitHub · HF | 2025-05 | McGill |
| VideoSimpleQA | Paper · GitHub · HF | - | ByteDance |
Video / Reasoning
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| Minera | Paper · GitHub | 2025-05 | DeepMind |
| VideoHolmes | Paper · GitHub · HF | 2025-05 | Tencent ARC |
| VideoReasonBench | Paper · GitHub · HF | 2025-05 | NTU |
| Mores-500 | Paper · GitHub · HF | 2025-06 | HKUST |
Video / Motion
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| Countix | Paper | 2020-06 | |
| ContPhy | Paper · GitHub · HF | 2024-02 | Westlake |
| TempCompass | Paper · GitHub · HF | 2024-03 | NTU |
| TVBench | Paper · GitHub · HF | 2024-10 | USC |
| TOMATO | Paper · HF | 2024-10 | Yale |
| MotionBench | Paper · GitHub · HF | 2025-01 | Tsinghua |
| EgoTempo | Paper · GitHub · HF | 2025-03 | |
| VideoThinkBench | Paper · GitHub · HF | 2025-11 | Fudan |
Video / Long-form
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| VideoMME | Paper · GitHub · HF | 2024-05 | Fudan |
| MLVU | Paper · GitHub · HF | 2024-06 | BAAI |
| LVBench | Paper · GitHub · HF | 2024-06 | Tsinghua |
| LongVideoBench | Paper · GitHub · HF | 2024-07 | Tsinghua |
| VideoEval-Pro | Paper · GitHub · HF | 2025-05 | TIGER-Lab |
| CGBench | Paper · GitHub · HF | 2025-10 | NJU |
Video / Streaming
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| StreamingBench | Paper · GitHub · HF | 2024-11 | Tsinghua |
| OVBench | Paper · GitHub · HF | 2024-12 | NJU |
| OVOBench | Paper · GitHub · HF | 2025-01 | PKU |
| ViSpeak | Paper · GitHub · HF | 2025-03 | Alibaba |
| OminiMMI | Paper · GitHub · HF | 2025-03 | BIGAI |
| ODVBench | Paper · GitHub · HF | 2025-09 | NJU |
| LiveSports-3k | Paper · GitHub · HF | - | NUS |
Video / Multi-task & Multiple
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| MVBench | Paper · GitHub · HF | 2023-11 | Shanghai AI Lab |
| CrossVid | Paper · GitHub · HF | 2025-11 | UCSD |
| GameplayQA | Paper · GitHub · HF | 2026-03 | USC ICT |
Structured Output & Visualization
Agent / General
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| Minedojo Verified | Paper · GitHub | 2022-06 | NVIDIA |
| ScreenSpot Pro | Paper · GitHub · HF | 2025-05 | Shanghai AI Lab |
Agent / Computer
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| OSWorld-Verified | Paper · GitHub · HF | 2024-04 | HKU |
| WindowsAA | Paper · GitHub | 2024-09 | Microsoft |
Agent / Browser
Agent / Mobile
Agent / Visual Search
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| BrowseComp-VL | Paper · GitHub | 2025-08 | Alibaba |
| MM-BrowseComp | Paper · GitHub · HF | 2025-08 | ByteDance |
| HLE-VL | Paper · HF | - | Scale AI |
Contributions are welcome — whether it's adding new benchmarks & data, improving visualizations, or fixing errors. Feel free to open a PR!
If you find this project useful for your research, please consider citing:
@misc{awesome-mllm-benchmarks,
title = {Awesome MLLM Benchmarks: An Interactive Explorer for MLLM Benchmarks},
author = {Chen, Lin},
year = {2026},
howpublished = {\url{https://github.com/lchen1019/awesome-mllm-benchmarks}},
note = {Accessed: 2026}
}
HTML
98.0%
Python
2.0%
A curated list of multimodal LLM benchmarks and papers, with an interactive visualization dashboard.
HTML
9
4 commits
updated Aug 13, 2026
An interactive explorer & paper list for MLLM benchmarks.
🌐 Explore the Interactive Dashboard »
🤗 Sample Data on HuggingFace »
We collect 130+ MLLM benchmarks across 20+ categories (OCR, Math, Video, Agent, Spatial Intelligence, etc.) with rich metadata including GitHub stars, HuggingFace downloads, paper abstracts, model evaluation coverage, and more. Everything is presented through a modern interactive dashboard — you can search, filter, sort, and browse actual benchmark samples directly in the browser.
Clone and serve locally:
git clone https://github.com/lchen1019/awesome-mllm-benchmarks.git
cd awesome-mllm-benchmarks
python serve.py 8080
Then open http://localhost:8080 in your browser.
serve.pystarts a simple HTTP server with no-cache headers. You can also use any other static file server.Sample images live in
samples/and are served locally with the site. A copy also remains on HuggingFace.
Project Structure
awesome-mllm-benchmarks/
├── index.html # Main dashboard page
├── cases.html # Sample viewer page
├── data/
│ ├── benchmarks.json # Benchmark metadata (130+ entries)
│ ├── model-matrix.json # Model × Benchmark coverage data
│ └── cases-manifest.json # Sample viewer config
├── samples/ # Benchmark sample data (images, per-benchmark data)
├── assets/ # Logo, favicon, screenshots
├── serve.py # Dev server with no-cache headers
├── .github/workflows/pages.yml # GitHub Pages deployment
└── .nojekyll # Bypass Jekyll processing
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| TextVQA | Paper · HF | 2019-04 | FAIR |
| DocVQA | Paper · HF | 2020-07 | IIIT Hyderabad |
| ChartQA | Paper · GitHub · HF | 2022-03 | YorkU |
| OCRBench | Paper · GitHub · HF | 2023-05 | HUST |
| DUDE | Paper · GitHub · HF | 2023-05 | EPFL |
| ChartX | Paper · HF | 2024-02 | Shanghai AI Lab |
| CharXiv(RQ) | Paper · GitHub · HF | 2024-06 | Princeton |
| CharXiv(DQ) | Paper · GitHub · HF | 2024-06 | Princeton |
| MMLongBench-Doc | Paper · GitHub · HF | 2024-07 | Tsinghua |
| CC-OCR | Paper · GitHub · HF | 2024-12 | Alibaba |
| OmniDocBench | Paper · GitHub · HF | 2024-12 | Shanghai AI Lab |
| OmniDocBench1.5 | Paper · GitHub · HF | 2024-12 | Shanghai AI Lab |
| LongDocURL | Paper · GitHub · HF | 2024-12 | SJTU |
| OCRBench-v2 | Paper · GitHub · HF | 2024-12 | HUST |
| ChartQAPro | Paper · GitHub · HF | 2025-04 | YorkU |
| MMLongBench | Paper · GitHub · HF | 2025-05 | Edinburgh |
| Real5-OmniDocBench | Paper · HF | 2026-03 | Baidu |
| AI2D_TEST | Paper · HF | - | AI2 |
| InfoVQA | Paper · HF | - | IIIT Hyderabad |
| TableVQA | HF | - | KAIST |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| Nuscene | Paper · GitHub | 2019-03 | nuTonomy |
| Hypersim | Paper · GitHub | 2020-11 | Apple |
| ERQA | Paper · GitHub · HF | 2021-10 | BAAI |
| ARKitScenes | Paper · GitHub | 2021-11 | Apple |
| ODInW13 | Paper · GitHub | 2022-06 | Microsoft |
| LingoQA | Paper · GitHub | 2023-12 | Wayve |
| BLINK | Paper · GitHub · HF | 2024-04 | UPenn |
| DA-2K | Paper · GitHub · HF | 2024-06 | HKU |
| CV-Bench | Paper · HF | 2024-06 | NYU |
| RoboSpatialHome | Paper · GitHub · HF | 2024-11 | OSU |
| VSI-Bench | Paper · GitHub · HF | 2024-12 | NYU |
| All-Angles | Paper · GitHub · HF | 2025-04 | ZJU |
| MMSI-Bench | Paper · GitHub · HF | 2025-05 | Shanghai AI Lab |
| RefSpatialBench | Paper · GitHub · HF | 2025-06 | SJTU |
| TreeBench | Paper · GitHub · HF | 2025-07 | HKU |
| RefCOCO(avg) | Paper · GitHub · HF | - | UNC |
| EmbSpatialBench | Paper · HF | - | BAAI |
| RealWorldQA | HF | - | xAI |
| SUNRGBD | Paper · GitHub · HF | - | Princeton |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| MMBench-V1.1-EN | Paper · GitHub · HF | 2023-07 | Shanghai AI Lab |
| MMBench-V1.1-CN | Paper · GitHub · HF | 2023-07 | Shanghai AI Lab |
| MMVet | Paper · GitHub · HF | 2023-08 | NUS |
| HallusionBench | Paper · GitHub · HF | 2023-10 | UMD |
| MMStar | Paper · GitHub · HF | 2024-03 | CUHK-SZ |
| MTVQA | Paper · GitHub · HF | 2024-05 | ByteDance |
| MUIRBench | Paper · GitHub · HF | 2024-06 | UPenn |
| SimpleVQA | Paper · GitHub · HF | 2025-02 | BUAA |
| ViVerBench | Paper · GitHub · HF | 2025-10 | Tsinghua |
| MME-CC | Paper · GitHub · HF | 2025-11 | NTU |
| WorldVQA | Paper · GitHub · HF | 2026-01 | Moonshot AI |
| VibeEval | Paper · GitHub · HF | - | Reka AI |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| MathVista | Paper · GitHub · HF | 2023-10 | UCLA |
| OlympiadBench | Paper · GitHub · HF | 2024-02 | Tsinghua |
| MathVision | Paper · GitHub · HF | 2024-02 | CUHK |
| DynaMath | Paper · GitHub · HF | 2024-11 | Yale |
| MathVerse | Paper · GitHub · HF | 2024-03 | CUHK |
| We-Math | Paper · GitHub · HF | 2024-07 | BAAI |
| MATH-V | Paper · GitHub · HF | 2024-07 | SJTU |
| CountBench | Paper · HF | 2023-01 | |
| MathCheck-GEO | Paper · GitHub · HF | 2024-07 | NTU |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| ArcAGI1-Image | Paper · GitHub · HF | 2019-11 | - |
| ArcAG2-Image | Paper · GitHub · HF | 2024-12 | Zapier |
| MMMU | Paper · GitHub · HF | 2024-09 | IN.AI |
| LogicVista | Paper · GitHub · HF | 2024-07 | UCLA |
| EMMA | Paper · GitHub · HF | 2025-01 | HUST |
| BabyVision | Paper · HF | 2025-04 | Tsinghua |
| VBench | Paper · GitHub · HF | 2025-05 | ZJU |
| MME-Reasoning | Paper · GitHub · HF | 2025-03 | NJU |
| VisualPuzzles | Paper · GitHub · HF | 2025-04 | Stanford |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| ScienceQA | Paper · GitHub · HF | 2022-09 | UCLA |
| MMMU-Pro | Paper · GitHub · HF | 2024-09 | IN.AI |
| SciFIG | Paper · GitHub · HF | 2024-05 | Adobe |
| HistoryBench | Paper · HF | 2025-02 | CAS |
| MEGA-Bench | Paper · GitHub · HF | 2024-10 | TIGER-Lab |
| NPHardEval4V | Paper · GitHub · HF | 2024-03 | UMich |
| GPQA-Diamond | Paper · HF | 2023-11 | NYU |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| MME | Paper · GitHub · HF | 2023-06 | NJU |
| SEEDBench | Paper · GitHub · HF | 2023-07 | Tencent |
| CRPE | Paper · GitHub · HF | 2024-03 | Tsinghua |
| MME-RealWorld | Paper · GitHub · HF | 2024-08 | NJU |
| WildVision | Paper · GitHub · HF | 2024-06 | AI2 |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| RefCOCO(avg) | Paper · GitHub · HF | - | UNC |
| ScreenSpot | Paper · GitHub · HF | 2025-05 | Shanghai AI Lab |
| ODInW13 | Paper · GitHub | 2022-06 | Microsoft |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| Design2Code | Paper · GitHub · HF | 2024-03 | Stanford |
| ChartMimic | Paper · GitHub · HF | 2024-06 | Tsinghua |
| UniSVG | Paper · HF | 2025-11 | SJTU |
| FronTalk | Paper · HF | 2025-12 | UCLA |
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| SLAKE | Paper · HF | 2021-02 | OSU |
| PMC-VQA | Paper · GitHub · HF | 2023-05 | ZJU |
| MedXpertQA-MM | Paper · GitHub · HF | 2025-01 | Tsinghua |
Video / Knowledge
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| MMVU | Paper · GitHub · HF | 2025-01 | Yale |
| VideoMMMU | Paper · GitHub · HF | 2025-01 | NTU |
| VCRBench | Paper · GitHub · HF | 2025-05 | McGill |
| VideoSimpleQA | Paper · GitHub · HF | - | ByteDance |
Video / Reasoning
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| Minera | Paper · GitHub | 2025-05 | DeepMind |
| VideoHolmes | Paper · GitHub · HF | 2025-05 | Tencent ARC |
| VideoReasonBench | Paper · GitHub · HF | 2025-05 | NTU |
| Mores-500 | Paper · GitHub · HF | 2025-06 | HKUST |
Video / Motion
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| Countix | Paper | 2020-06 | |
| ContPhy | Paper · GitHub · HF | 2024-02 | Westlake |
| TempCompass | Paper · GitHub · HF | 2024-03 | NTU |
| TVBench | Paper · GitHub · HF | 2024-10 | USC |
| TOMATO | Paper · HF | 2024-10 | Yale |
| MotionBench | Paper · GitHub · HF | 2025-01 | Tsinghua |
| EgoTempo | Paper · GitHub · HF | 2025-03 | |
| VideoThinkBench | Paper · GitHub · HF | 2025-11 | Fudan |
Video / Long-form
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| VideoMME | Paper · GitHub · HF | 2024-05 | Fudan |
| MLVU | Paper · GitHub · HF | 2024-06 | BAAI |
| LVBench | Paper · GitHub · HF | 2024-06 | Tsinghua |
| LongVideoBench | Paper · GitHub · HF | 2024-07 | Tsinghua |
| VideoEval-Pro | Paper · GitHub · HF | 2025-05 | TIGER-Lab |
| CGBench | Paper · GitHub · HF | 2025-10 | NJU |
Video / Streaming
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| StreamingBench | Paper · GitHub · HF | 2024-11 | Tsinghua |
| OVBench | Paper · GitHub · HF | 2024-12 | NJU |
| OVOBench | Paper · GitHub · HF | 2025-01 | PKU |
| ViSpeak | Paper · GitHub · HF | 2025-03 | Alibaba |
| OminiMMI | Paper · GitHub · HF | 2025-03 | BIGAI |
| ODVBench | Paper · GitHub · HF | 2025-09 | NJU |
| LiveSports-3k | Paper · GitHub · HF | - | NUS |
Video / Multi-task & Multiple
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| MVBench | Paper · GitHub · HF | 2023-11 | Shanghai AI Lab |
| CrossVid | Paper · GitHub · HF | 2025-11 | UCSD |
| GameplayQA | Paper · GitHub · HF | 2026-03 | USC ICT |
Structured Output & Visualization
Agent / General
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| Minedojo Verified | Paper · GitHub | 2022-06 | NVIDIA |
| ScreenSpot Pro | Paper · GitHub · HF | 2025-05 | Shanghai AI Lab |
Agent / Computer
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| OSWorld-Verified | Paper · GitHub · HF | 2024-04 | HKU |
| WindowsAA | Paper · GitHub | 2024-09 | Microsoft |
Agent / Browser
Agent / Mobile
Agent / Visual Search
| Benchmark | Paper | Date | Organization |
|---|---|---|---|
| BrowseComp-VL | Paper · GitHub | 2025-08 | Alibaba |
| MM-BrowseComp | Paper · GitHub · HF | 2025-08 | ByteDance |
| HLE-VL | Paper · HF | - | Scale AI |
Contributions are welcome — whether it's adding new benchmarks & data, improving visualizations, or fixing errors. Feel free to open a PR!
If you find this project useful for your research, please consider citing:
@misc{awesome-mllm-benchmarks,
title = {Awesome MLLM Benchmarks: An Interactive Explorer for MLLM Benchmarks},
author = {Chen, Lin},
year = {2026},
howpublished = {\url{https://github.com/lchen1019/awesome-mllm-benchmarks}},
note = {Accessed: 2026}
}
HTML
98.0%
Python
2.0%