jinbo0906/Awesome-MLLM-Datasets

This project aims to collect and collate various datasets for multimodal large model training, including but not limited to pre-training data, instruction fine-tuning data, and In-Context learning data.

78

15 commits

updated May 7, 2025

See the code

README

Awesome-MLLM-Datasets

🚀🚀🚀This project aims to collect and collate various datasets for multimodal large model training, including but not limited to pre-training data, instruction fine-tuning data, and In-Context learning data.

💡💡💡The goal of the project is to provide researchers with a comprehensive repository of resources to support their ability to more easily access high-quality datasets when developing and optimizing multimodal AI systems.

Table of Contents

Datasets of Pre-Training

Name#.X#.T#.X-TPaperLinkType
WebLI10B(Images)12B12BPaLI: A Jointly-Scaled Multilingual Language-Image ModelLinkCaptions(109 languages)
LAION-5B5.9B(Images)5.9B5.9BLAION-5B: An open large-scale dataset for training next generation image-text modelsLinkCaptions(Multiple languages)
LAION-en2.3B(Images)2.3B2.3BLAION-5B: An open large-scale dataset for training next generation image-text modelsLinkCaptions(English)
ALIGN1.8B(Images)1.8B1.8BScaling Up Visual and Vision-Language Representation Learning With Noisy Text SupervisionLinkCaptions(English)
DataComp1.4B(Images)1.4B1.4BDATACOMP: In search of the next generation of multimodal datasetsLinkCaptions(English)
COYO747M(Images)747M747MCOYO-700M: Large-scale Image-Text Pair DatasetLinkCaptions(English)
LAION-COCO600M(Images)600M600MLAION COCO: 600M SYNTHETIC CAPTIONS FROM LAION2B-ENLinkCaptions(English)
LAION-400M400M(Images)400M400MLAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text PairsLinkCaptions(English)
Episodic WebLI400M(Images)400M400MPaLI-X: On Scaling up a Multilingual Vision and Language Model-Captions(English)
CLIP400M(Images)400M400MLearning Transferable Visual Models From Natural Language SupervisionLinkCaptions(English)
LTIP312M(Images)312M312MFlamingo: a Visual Language Model for Few-Shot Learning-Captions(English)
FILIP300M(Images)300M300MFILIP: Fine-grained Interactive Language-Image Pre-Training-Captions(English)
LAION-zh142M(Images)142M142MLAION-5B: An open large-scale dataset for training next generation image-text modelsLinkCaptions(Chinese)
Obelics353M(Images)115M141MOBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text DocumentsLinkInterleaved image-text web documents
MMC4571M(Images)43B101.2MMultimodal C4: An Open, Billion-scale Corpus of Images Interleaved With TextLinkInterleaved image-text
Wukong101M(Images)101M101MWuKong:100 Million Large-scale Chinese Cross-modal Pre-training Dataset and A Foundation FrameworkLinkCaptions(Chinese)
M3W185M(Images)182GB43.3MFlamingo: a Visual Language Model for Few-Shot Learning-Captions(English)
WIT11.5M(Images)37.6M37.6MWIT: Wikipedia-based Image Text Dataset for Multimodal Multilingual Machine LearningLinkCaptions(English)
GQA113K(Images)22M22MGQA: A New Dataset for Real-World Visual Reasoning and Compositional Question AnsweringLinkVisual Reasoning and Compositional Question Answering(English)
CC12M12.4M(Images)12.4M12.4MConceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual ConceptsLinkCaptions(English)
Red Caps12M(Images)12M12MRedCaps: Web-curated image-text data created by the people, for the peopleLinkCaptions(English)
Visual Genome108k(Images)4.5M4.5MVisual Genome: Connecting Language and Vision Using Crowdsourced Dense Image AnnotationsLinkAnnotations(English)
ArXivCap6.4M(Images)3.9M3.9MMultimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language ModelsLinkCaptions(English)
DVQA300K(Images)3.5M3.5MDVQA: Understanding Data Visualizations via Question AnsweringLinkQuestion answering(English)
CC3M3.3M(Images)3.3M3.3MConceptual Captions: A Cleaned, Hypernymed, Image Alt-text Dataset For Automatic Image CaptioningLinkCaptions(English)
MS-COCO328k(Images)2.5M2.5MMicrosoft COCO: Common Objects in ContextLinkObject detection,Segmentation,Caption(English)
AI Challenger Captions300K(Images)1.5M1.5MAI Challenger : A Large-scale Dataset for Going Deeper in Image UnderstandingLinkCaptions(English)
VQA v2265K(Images)1.4M1.4MMaking the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question AnsweringLinkVisual question answering(English)
VisDial120K(Images)1.2M1.2MVisual DialogLinkVisual question answering(English)
SBU(Image Caption)1M(Images)1M1MIm2Text: Describing Images Using 1 Million Captioned PhotographsLinkCaptions(English)
OCR-VQA207K(Images)1M1MOCR-VQA: Visual Question Answering by Reading Text in ImagesLinkVisual question answering(English)
COCO Caption164K(Images)1M1MMicrosoft COCO Captions: Data Collection and Evaluation ServerLinkObject detection,Segmentation,Caption(English)
CC595k595K(Images)595K595KVisual Instruction TuningLinkCaptions(English)
Visual-7W47.3K(Images)328K328KVisual7W: Grounded Question Answering in ImagesLinkVisual question answering(English)
Flickr30k31K(Images)158K158KFrom image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptionsLinkVisual Grounding(English)
TextCaps28K(Images)145K145KTextCaps: a Dataset for Image Captioning with Reading ComprehensionLinkCaptions(English)
RefCOCO20K(Images)142K142KReferItGame: Referring to Objects in Photographs of Natural ScenesLinkVisual Grounding(English)
RefCOCO+20K(Images)142K142KModeling Context in Referring ExpressionsLinkVisual Grounding(English)
RefCOCOg26.7K(Images)85.5K85.5KModeling Context in Referring ExpressionsLinkVisual Grounding(English)
TextVQA28.4(Images)45.3K45.3KTowards VQA Models That Can ReadLinkVisual question answering(English)
DocVQA12K(Images)50K50KDocVQA:A Dataset for VQA on Document ImagesLinkDocument VQA(English)
ST-VQA23K(Images)32K32KScene Text Visual Question AnsweringLinkVisual question answering(English)
A-OKVQA23.7K(Images)24.9K24.9KA-OKVQA: A Benchmark for Visual Question Answering using World KnowledgeLinkVisual question answering(English)
ArxivQA32K(Images)16.6K16.6KMultimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language ModelsLinkVisual question answering(English)
OK-VQA14K(Images)14K14KOK-VQA: A Visual Question Answering Benchmark Requiring External KnowledgeLinkVisual question answering(English)
WebVid10M(Video)10M10MFrozen in Time: A Joint Video and Image Encoder for End-to-End RetrievalLinkCaptions(English)
MSRVTT10K(Video)200K200KMSR-VTT: A Large Video Description Dataset for Bridging Video and LanguageLinkCaptions(English)
YFCC100M99.2M(Images), 0.8M(Videos)--YFCC100M: The New Data in Multimedia ResearchLink-
VSDial-CN120K (Image), 1.2M(Audio)120K1.2MVILAS: EXPLORING THE EFFECTS OF VISION AND LANGUAGE CONTEXT IN AUTOMATIC SPEECH RECOGNITION-Visual spoken dialogue
AISHELL-2--1MAISHELL-2: Transforming Mandarin ASR Research Into Industrial ScaleLinkAudio Captions(Chinese)
AISHELL-1--128KAISHELL-1: AN OPEN-SOURCE MANDARIN SPEECH CORPUS AND A SPEECH RECOGNITION BASELINELinkAudio Captions(Chinese)
WavCaps403K(Audio)403K403KWavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal ResearchLinkAudio Captions(English)

Datasets of Multimodal Instruction Tuning

NameI->OMethod#.InstancePaperLink
MiniGPT-4's ITI+T->TAuto5KMiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language ModelsLink
StableLLaVAI+T->TAuto+Manu126KEnhanced Visual Instruction Tuning with Synthesized Image-Dialogue DataLink
LLaVA-Instruct-150KI+T->TAuto158KVisual Instruction TuningLink
SVITI+T->TAuto4.2MSVIT: Scaling up Visual Instruction TuningLink
LLaVAR's ITI+T->TAuto174KLLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image UnderstandingLink
ShareGPT4V's ITI+T->TAuto+Manu102KShareGPT4V: Improving Large Multi-modal Models with Better CaptionsLink
ShareGPT4Video's ITI+T->TAuto+Manu4.84MShareGPT4Video: Improving Video Understanding and Generation with Better CaptionsLink
DRESS's ITI+T->TAuto+Manu193KDRESS : Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language FeedbackLink
SoM-LLaVA's ITI+T->TAuto+Manu695KList Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMsLink
VideoChat's ITV+T->TAuto11KVideoChat : Chat-Centric Video UnderstandingLink
Video-ChatGPT's ITV+T->TInherit100KVideo-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language ModelsLink
Video-LLaMA's ITI/V+T->TAuto171KVideo-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video UnderstandingLink
InstructBLIP's ITI/V+T->TAuto1.6MInstructBLIP: Towards General-purpose Vision-Language Models with Instruction TuningLink
X-InstructBLIP's ITI/V/3D/A+T->TAuto1.8MX-InstructBLIP: A Framework for Aligning Image, 3D, Audio, Video to LLMs and its Emergent Cross-modal ReasoningLink
MIMIC-ITI/V+T->TAuto2.8MMIMIC-IT: Multi-Modal In-Context Instruction TuningLink
PandaGPT's ITI+T->TInherit160KPandaGPT: One Model To Instruction-Follow Them AllLink
MGVLIDI+B+T->TAuto+Manu108KChatSpot: Bootstrapping Multimodal LLMs via Precise Referring Instruction Tuning-
M3ITI/V/B+T->TAuto+Manu2.4MM3IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction TuningLink
LAMM-DatasetI+3D+T->TAuto+Manu196KLAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and BenchmarkLink
BuboGPT's IT(I+A)/A+T->TAuto9KBuboGPT: Enabling Visual Grounding in Multi-Modal LLMsLink
mPLUG-DocOwl's ITI/Tab/Web/+T->TInherit-mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document UnderstandingLink
T2MT->I/V/A+TAuto14.7KNExT-GPT: Any-to-Any Multimodal LLMLink
MosITI+V+A+T->I+V+A+TAuto+Manu5KNExT-GPT: Any-to-Any Multimodal LLMLink
Osprey's ITI+T->TAuto+Manu724KOsprey: Pixel Understanding with Visual Instruction TuningLink
X-LLMI+V+A+T->TManu10KX-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign LanguagesLink
MULTISI+T->TAuto+Manu161.5KChatBridge: Bridging Modalities with Large Language Model as a Language CatalystComing soon
DetGPTI+T->TAuto30KDetGPT: Detect What You Need via ReasoningLink
LVIS-Instruct4VI+T->TAuto220KTo See is to Believe: Prompting GPT-4V for Better Visual Instruction TuningLink
GPT4ToolsI+T->TAuto71KGPT4Tools: Teaching Large Language Model to Use Tools via Self-instructionLink
SparklesDialogueI+T->TAuto6.4K✨Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following ModelsLink
ColonINSTI+T->TAuto450KFrontiers in Intelligent Colonoscopy (medical domain)Link

Datasets of In-Context Learning

NamePaperLinkNotes
MICMMICL: Empowering Vision-language Model with Multi-Modal In-Context LearningLinkA manually constructed instruction tuning dataset including interleaved text-image inputs, inter-related multiple image inputs, and multimodal in-context learning inputs.
MIMIC-ITMIMIC-IT: Multi-Modal In-Context Instruction TuningLinkMultimodal in-context instruction dataset

Datasets of Multimodal Chain-of-Thought

NamePaperLinkNotes
EMERExplainable Multimodal Emotion ReasoningLinkA benchmark dataset for explainable emotion reasoning task
EgoCOTEmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of ThoughtLinkLarge-scale embodied planning dataset
VIPLet’s Think Frame by Frame: Evaluating Video Chain of Thought with Video Infilling and Prediction-An inference-time dataset that can be used to evaluate VideoCOT
ScienceQALearn to Explain: Multimodal Reasoning via Thought Chains for Science Question AnsweringLinkLarge-scale multi-choice dataset, featuring multimodal science questions and diverse domains

Datasets of Multimodal RLHF

Benchmarks for Evaluation

NamePaperLinkNotes
MME-RealWorldMME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?LinkA challenging benchmark that involves real-life scenarios
CharXivCharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMsLinkChart understanding benchmark curated by human experts
Video-MMEVideo-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video AnalysisLinkA comprehensive evaluation benchmark of Multi-modal LLMs in video analysis
VL-ICL BenchVL-ICL Bench: The Devil in the Details of Benchmarking Multimodal In-Context LearningLinkA benchmark for M-ICL evaluation, covering a wide spectrum of tasks
TempCompassTempCompass: Do Video LLMs Really Understand Videos?LinkA benchmark to evaluate the temporal perception ability of Video LLMs
CoBSATCan MLLMs Perform Text-to-Image In-Context Learning?LinkA benchmark for text-to-image ICL
VQAv2-IDKVisually Dehallucinative Instruction Generation: Know What You Don't KnowLinkA benchmark for assessing "I Know" visual hallucination
Math-VisionMeasuring Multimodal Mathematical Reasoning with MATH-Vision DatasetLinkA diverse mathematical reasoning benchmark
CMMMUCMMMU: A Chinese Massive Multi-discipline Multimodal Understanding BenchmarkLinkA Chinese benchmark involving reasoning and knowledge across multiple disciplines
MMCBenchBenchmarking Large Multimodal Models against Common CorruptionsLinkA benchmark for examining self-consistency under common corruptions
MMVPEyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMsLinkA benchmark for assessing visual capabilities
TimeITTimeChat: A Time-sensitive Multimodal Large Language Model for Long Video UnderstandingLinkA video instruction-tuning dataset with timestamp annotations, covering diverse time-sensitive video-understanding tasks.
ViP-BenchMaking Large Multimodal Models Understand Arbitrary Visual PromptsLinkA benchmark for visual prompts
M3DBenchM3DBench: Let's Instruct Large Models with Multi-modal 3D PromptsLinkA 3D-centric benchmark
Video-BenchVideo-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language ModelsLinkA benchmark for video-MLLM evaluation
Charting-New-TerritoriesCharting New Territories: Exploring the Geographic and Geospatial Capabilities of Multimodal LLMsLinkA benchmark for evaluating geographic and geospatial capabilities
MLLM-BenchMLLM-Bench, Evaluating Multi-modal LLMs using GPT-4VLinkGPT-4V evaluation with per-sample criteria
BenchLMMBenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal ModelsLinkA benchmark for assessment of the robustness against different image styles
MMC-BenchmarkMMC: Advancing Multimodal Chart Understanding with Large-scale Instruction TuningLinkA comprehensive human-annotated benchmark with distinct tasks evaluating reasoning capabilities over charts
MVBenchMVBench: A Comprehensive Multi-modal Video Understanding BenchmarkLinkA comprehensive multimodal benchmark for video understanding
BingoHolistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference ChallengesLinkA benchmark for hallucination evaluation that focuses on two common types
MagnifierBenchOtterHD: A High-Resolution Multi-modality ModelLinkA benchmark designed to probe models' ability of fine-grained perception
HallusionBenchHallusionBench: You See What You Think? Or You Think What You See? An Image-Context Reasoning Benchmark Challenging for GPT-4V(ision), LLaVA-1.5, and Other Multi-modality ModelsLinkAn image-context reasoning benchmark for evaluation of hallucination
PCA-EVALTowards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and BeyondLinkA benchmark for evaluating multi-domain embodied decision-making.
MMHal-BenchAligning Large Multimodal Models with Factually Augmented RLHFLinkA benchmark for hallucination evaluation
MathVistaMathVista: Evaluating Math Reasoning in Visual Contexts with GPT-4V, Bard, and Other Large Multimodal ModelsLinkA benchmark that challenges both visual and math reasoning capabilities
SparklesEval✨Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following ModelsLinkA GPT-assisted benchmark for quantitatively assessing a model's conversational competence across multiple images and dialogue turns based on three distinct criteria.
ISEKAILink-Context Learning for Multimodal LLMsLinkA benchmark comprising exclusively of unseen generated image-label pairs designed for link-context learning
M-HalDetectDetecting and Preventing Hallucinations in Large Vision Language ModelsComing soonA dataset used to train and benchmark models for hallucination detection and prevention
I4Empowering Vision-Language Models to Follow Interleaved Vision-Language InstructionsLinkA benchmark to comprehensively evaluate the instruction following ability on complicated interleaved vision-language instructions
SciGraphQASciGraphQA: A Large-Scale Synthetic Multi-Turn Question-Answering Dataset for Scientific GraphsLinkA large-scale chart-visual question-answering dataset
MM-VetMM-Vet: Evaluating Large Multimodal Models for Integrated CapabilitiesLinkAn evaluation benchmark that examines large multimodal models on complicated multimodal tasks
SEED-BenchSEED-Bench: Benchmarking Multimodal LLMs with Generative ComprehensionLinkA benchmark for evaluation of generative comprehension in MLLMs
MMBenchMMBench: Is Your Multi-modal Model an All-around Player?LinkA systematically-designed objective benchmark for robustly evaluating the various abilities of vision-language models
LynxWhat Matters in Training a GPT4-Style Language Model with Multimodal Inputs?LinkA comprehensive evaluation benchmark including both image and video tasks
GAVIEMitigating Hallucination in Large Multi-Modal Models via Robust Instruction TuningLinkA benchmark to evaluate the hallucination and instruction following ability
MMEMME: A Comprehensive Evaluation Benchmark for Multimodal Large Language ModelsLinkA comprehensive MLLM Evaluation benchmark
LVLM-eHubLVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language ModelsLinkAn evaluation platform for MLLMs
LAMM-BenchmarkLAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and BenchmarkLinkA benchmark for evaluating the quantitative performance of MLLMs on various2D/3D vision tasks
M3ExamM3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language ModelsLinkA multilingual, multimodal, multilevel benchmark for evaluating MLLM
OwlEvalmPLUG-Owl: Modularization Empowers Large Language Models with MultimodalityLinkDataset for evaluation on multiple capabilities

Contributors

jinbo0906

14 commits

GewelsJI

1 commits

jinbo0906/Awesome-MLLM-Datasets

This project aims to collect and collate various datasets for multimodal large model training, including but not limited to pre-training data, instruction fine-tuning data, and In-Context learning data.

78

15 commits

updated May 7, 2025

See the code

README

Awesome-MLLM-Datasets

🚀🚀🚀This project aims to collect and collate various datasets for multimodal large model training, including but not limited to pre-training data, instruction fine-tuning data, and In-Context learning data.

💡💡💡The goal of the project is to provide researchers with a comprehensive repository of resources to support their ability to more easily access high-quality datasets when developing and optimizing multimodal AI systems.

Table of Contents

Datasets of Pre-Training

Name#.X#.T#.X-TPaperLinkType
WebLI10B(Images)12B12BPaLI: A Jointly-Scaled Multilingual Language-Image ModelLinkCaptions(109 languages)
LAION-5B5.9B(Images)5.9B5.9BLAION-5B: An open large-scale dataset for training next generation image-text modelsLinkCaptions(Multiple languages)
LAION-en2.3B(Images)2.3B2.3BLAION-5B: An open large-scale dataset for training next generation image-text modelsLinkCaptions(English)
ALIGN1.8B(Images)1.8B1.8BScaling Up Visual and Vision-Language Representation Learning With Noisy Text SupervisionLinkCaptions(English)
DataComp1.4B(Images)1.4B1.4BDATACOMP: In search of the next generation of multimodal datasetsLinkCaptions(English)
COYO747M(Images)747M747MCOYO-700M: Large-scale Image-Text Pair DatasetLinkCaptions(English)
LAION-COCO600M(Images)600M600MLAION COCO: 600M SYNTHETIC CAPTIONS FROM LAION2B-ENLinkCaptions(English)
LAION-400M400M(Images)400M400MLAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text PairsLinkCaptions(English)
Episodic WebLI400M(Images)400M400MPaLI-X: On Scaling up a Multilingual Vision and Language Model-Captions(English)
CLIP400M(Images)400M400MLearning Transferable Visual Models From Natural Language SupervisionLinkCaptions(English)
LTIP312M(Images)312M312MFlamingo: a Visual Language Model for Few-Shot Learning-Captions(English)
FILIP300M(Images)300M300MFILIP: Fine-grained Interactive Language-Image Pre-Training-Captions(English)
LAION-zh142M(Images)142M142MLAION-5B: An open large-scale dataset for training next generation image-text modelsLinkCaptions(Chinese)
Obelics353M(Images)115M141MOBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text DocumentsLinkInterleaved image-text web documents
MMC4571M(Images)43B101.2MMultimodal C4: An Open, Billion-scale Corpus of Images Interleaved With TextLinkInterleaved image-text
Wukong101M(Images)101M101MWuKong:100 Million Large-scale Chinese Cross-modal Pre-training Dataset and A Foundation FrameworkLinkCaptions(Chinese)
M3W185M(Images)182GB43.3MFlamingo: a Visual Language Model for Few-Shot Learning-Captions(English)
WIT11.5M(Images)37.6M37.6MWIT: Wikipedia-based Image Text Dataset for Multimodal Multilingual Machine LearningLinkCaptions(English)
GQA113K(Images)22M22MGQA: A New Dataset for Real-World Visual Reasoning and Compositional Question AnsweringLinkVisual Reasoning and Compositional Question Answering(English)
CC12M12.4M(Images)12.4M12.4MConceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual ConceptsLinkCaptions(English)
Red Caps12M(Images)12M12MRedCaps: Web-curated image-text data created by the people, for the peopleLinkCaptions(English)
Visual Genome108k(Images)4.5M4.5MVisual Genome: Connecting Language and Vision Using Crowdsourced Dense Image AnnotationsLinkAnnotations(English)
ArXivCap6.4M(Images)3.9M3.9MMultimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language ModelsLinkCaptions(English)
DVQA300K(Images)3.5M3.5MDVQA: Understanding Data Visualizations via Question AnsweringLinkQuestion answering(English)
CC3M3.3M(Images)3.3M3.3MConceptual Captions: A Cleaned, Hypernymed, Image Alt-text Dataset For Automatic Image CaptioningLinkCaptions(English)
MS-COCO328k(Images)2.5M2.5MMicrosoft COCO: Common Objects in ContextLinkObject detection,Segmentation,Caption(English)
AI Challenger Captions300K(Images)1.5M1.5MAI Challenger : A Large-scale Dataset for Going Deeper in Image UnderstandingLinkCaptions(English)
VQA v2265K(Images)1.4M1.4MMaking the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question AnsweringLinkVisual question answering(English)
VisDial120K(Images)1.2M1.2MVisual DialogLinkVisual question answering(English)
SBU(Image Caption)1M(Images)1M1MIm2Text: Describing Images Using 1 Million Captioned PhotographsLinkCaptions(English)
OCR-VQA207K(Images)1M1MOCR-VQA: Visual Question Answering by Reading Text in ImagesLinkVisual question answering(English)
COCO Caption164K(Images)1M1MMicrosoft COCO Captions: Data Collection and Evaluation ServerLinkObject detection,Segmentation,Caption(English)
CC595k595K(Images)595K595KVisual Instruction TuningLinkCaptions(English)
Visual-7W47.3K(Images)328K328KVisual7W: Grounded Question Answering in ImagesLinkVisual question answering(English)
Flickr30k31K(Images)158K158KFrom image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptionsLinkVisual Grounding(English)
TextCaps28K(Images)145K145KTextCaps: a Dataset for Image Captioning with Reading ComprehensionLinkCaptions(English)
RefCOCO20K(Images)142K142KReferItGame: Referring to Objects in Photographs of Natural ScenesLinkVisual Grounding(English)
RefCOCO+20K(Images)142K142KModeling Context in Referring ExpressionsLinkVisual Grounding(English)
RefCOCOg26.7K(Images)85.5K85.5KModeling Context in Referring ExpressionsLinkVisual Grounding(English)
TextVQA28.4(Images)45.3K45.3KTowards VQA Models That Can ReadLinkVisual question answering(English)
DocVQA12K(Images)50K50KDocVQA:A Dataset for VQA on Document ImagesLinkDocument VQA(English)
ST-VQA23K(Images)32K32KScene Text Visual Question AnsweringLinkVisual question answering(English)
A-OKVQA23.7K(Images)24.9K24.9KA-OKVQA: A Benchmark for Visual Question Answering using World KnowledgeLinkVisual question answering(English)
ArxivQA32K(Images)16.6K16.6KMultimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language ModelsLinkVisual question answering(English)
OK-VQA14K(Images)14K14KOK-VQA: A Visual Question Answering Benchmark Requiring External KnowledgeLinkVisual question answering(English)
WebVid10M(Video)10M10MFrozen in Time: A Joint Video and Image Encoder for End-to-End RetrievalLinkCaptions(English)
MSRVTT10K(Video)200K200KMSR-VTT: A Large Video Description Dataset for Bridging Video and LanguageLinkCaptions(English)
YFCC100M99.2M(Images), 0.8M(Videos)--YFCC100M: The New Data in Multimedia ResearchLink-
VSDial-CN120K (Image), 1.2M(Audio)120K1.2MVILAS: EXPLORING THE EFFECTS OF VISION AND LANGUAGE CONTEXT IN AUTOMATIC SPEECH RECOGNITION-Visual spoken dialogue
AISHELL-2--1MAISHELL-2: Transforming Mandarin ASR Research Into Industrial ScaleLinkAudio Captions(Chinese)
AISHELL-1--128KAISHELL-1: AN OPEN-SOURCE MANDARIN SPEECH CORPUS AND A SPEECH RECOGNITION BASELINELinkAudio Captions(Chinese)
WavCaps403K(Audio)403K403KWavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal ResearchLinkAudio Captions(English)

Datasets of Multimodal Instruction Tuning

NameI->OMethod#.InstancePaperLink
MiniGPT-4's ITI+T->TAuto5KMiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language ModelsLink
StableLLaVAI+T->TAuto+Manu126KEnhanced Visual Instruction Tuning with Synthesized Image-Dialogue DataLink
LLaVA-Instruct-150KI+T->TAuto158KVisual Instruction TuningLink
SVITI+T->TAuto4.2MSVIT: Scaling up Visual Instruction TuningLink
LLaVAR's ITI+T->TAuto174KLLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image UnderstandingLink
ShareGPT4V's ITI+T->TAuto+Manu102KShareGPT4V: Improving Large Multi-modal Models with Better CaptionsLink
ShareGPT4Video's ITI+T->TAuto+Manu4.84MShareGPT4Video: Improving Video Understanding and Generation with Better CaptionsLink
DRESS's ITI+T->TAuto+Manu193KDRESS : Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language FeedbackLink
SoM-LLaVA's ITI+T->TAuto+Manu695KList Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMsLink
VideoChat's ITV+T->TAuto11KVideoChat : Chat-Centric Video UnderstandingLink
Video-ChatGPT's ITV+T->TInherit100KVideo-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language ModelsLink
Video-LLaMA's ITI/V+T->TAuto171KVideo-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video UnderstandingLink
InstructBLIP's ITI/V+T->TAuto1.6MInstructBLIP: Towards General-purpose Vision-Language Models with Instruction TuningLink
X-InstructBLIP's ITI/V/3D/A+T->TAuto1.8MX-InstructBLIP: A Framework for Aligning Image, 3D, Audio, Video to LLMs and its Emergent Cross-modal ReasoningLink
MIMIC-ITI/V+T->TAuto2.8MMIMIC-IT: Multi-Modal In-Context Instruction TuningLink
PandaGPT's ITI+T->TInherit160KPandaGPT: One Model To Instruction-Follow Them AllLink
MGVLIDI+B+T->TAuto+Manu108KChatSpot: Bootstrapping Multimodal LLMs via Precise Referring Instruction Tuning-
M3ITI/V/B+T->TAuto+Manu2.4MM3IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction TuningLink
LAMM-DatasetI+3D+T->TAuto+Manu196KLAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and BenchmarkLink
BuboGPT's IT(I+A)/A+T->TAuto9KBuboGPT: Enabling Visual Grounding in Multi-Modal LLMsLink
mPLUG-DocOwl's ITI/Tab/Web/+T->TInherit-mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document UnderstandingLink
T2MT->I/V/A+TAuto14.7KNExT-GPT: Any-to-Any Multimodal LLMLink
MosITI+V+A+T->I+V+A+TAuto+Manu5KNExT-GPT: Any-to-Any Multimodal LLMLink
Osprey's ITI+T->TAuto+Manu724KOsprey: Pixel Understanding with Visual Instruction TuningLink
X-LLMI+V+A+T->TManu10KX-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign LanguagesLink
MULTISI+T->TAuto+Manu161.5KChatBridge: Bridging Modalities with Large Language Model as a Language CatalystComing soon
DetGPTI+T->TAuto30KDetGPT: Detect What You Need via ReasoningLink
LVIS-Instruct4VI+T->TAuto220KTo See is to Believe: Prompting GPT-4V for Better Visual Instruction TuningLink
GPT4ToolsI+T->TAuto71KGPT4Tools: Teaching Large Language Model to Use Tools via Self-instructionLink
SparklesDialogueI+T->TAuto6.4K✨Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following ModelsLink
ColonINSTI+T->TAuto450KFrontiers in Intelligent Colonoscopy (medical domain)Link

Datasets of In-Context Learning

NamePaperLinkNotes
MICMMICL: Empowering Vision-language Model with Multi-Modal In-Context LearningLinkA manually constructed instruction tuning dataset including interleaved text-image inputs, inter-related multiple image inputs, and multimodal in-context learning inputs.
MIMIC-ITMIMIC-IT: Multi-Modal In-Context Instruction TuningLinkMultimodal in-context instruction dataset

Datasets of Multimodal Chain-of-Thought

NamePaperLinkNotes
EMERExplainable Multimodal Emotion ReasoningLinkA benchmark dataset for explainable emotion reasoning task
EgoCOTEmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of ThoughtLinkLarge-scale embodied planning dataset
VIPLet’s Think Frame by Frame: Evaluating Video Chain of Thought with Video Infilling and Prediction-An inference-time dataset that can be used to evaluate VideoCOT
ScienceQALearn to Explain: Multimodal Reasoning via Thought Chains for Science Question AnsweringLinkLarge-scale multi-choice dataset, featuring multimodal science questions and diverse domains

Datasets of Multimodal RLHF

Benchmarks for Evaluation

NamePaperLinkNotes
MME-RealWorldMME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?LinkA challenging benchmark that involves real-life scenarios
CharXivCharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMsLinkChart understanding benchmark curated by human experts
Video-MMEVideo-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video AnalysisLinkA comprehensive evaluation benchmark of Multi-modal LLMs in video analysis
VL-ICL BenchVL-ICL Bench: The Devil in the Details of Benchmarking Multimodal In-Context LearningLinkA benchmark for M-ICL evaluation, covering a wide spectrum of tasks
TempCompassTempCompass: Do Video LLMs Really Understand Videos?LinkA benchmark to evaluate the temporal perception ability of Video LLMs
CoBSATCan MLLMs Perform Text-to-Image In-Context Learning?LinkA benchmark for text-to-image ICL
VQAv2-IDKVisually Dehallucinative Instruction Generation: Know What You Don't KnowLinkA benchmark for assessing "I Know" visual hallucination
Math-VisionMeasuring Multimodal Mathematical Reasoning with MATH-Vision DatasetLinkA diverse mathematical reasoning benchmark
CMMMUCMMMU: A Chinese Massive Multi-discipline Multimodal Understanding BenchmarkLinkA Chinese benchmark involving reasoning and knowledge across multiple disciplines
MMCBenchBenchmarking Large Multimodal Models against Common CorruptionsLinkA benchmark for examining self-consistency under common corruptions
MMVPEyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMsLinkA benchmark for assessing visual capabilities
TimeITTimeChat: A Time-sensitive Multimodal Large Language Model for Long Video UnderstandingLinkA video instruction-tuning dataset with timestamp annotations, covering diverse time-sensitive video-understanding tasks.
ViP-BenchMaking Large Multimodal Models Understand Arbitrary Visual PromptsLinkA benchmark for visual prompts
M3DBenchM3DBench: Let's Instruct Large Models with Multi-modal 3D PromptsLinkA 3D-centric benchmark
Video-BenchVideo-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language ModelsLinkA benchmark for video-MLLM evaluation
Charting-New-TerritoriesCharting New Territories: Exploring the Geographic and Geospatial Capabilities of Multimodal LLMsLinkA benchmark for evaluating geographic and geospatial capabilities
MLLM-BenchMLLM-Bench, Evaluating Multi-modal LLMs using GPT-4VLinkGPT-4V evaluation with per-sample criteria
BenchLMMBenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal ModelsLinkA benchmark for assessment of the robustness against different image styles
MMC-BenchmarkMMC: Advancing Multimodal Chart Understanding with Large-scale Instruction TuningLinkA comprehensive human-annotated benchmark with distinct tasks evaluating reasoning capabilities over charts
MVBenchMVBench: A Comprehensive Multi-modal Video Understanding BenchmarkLinkA comprehensive multimodal benchmark for video understanding
BingoHolistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference ChallengesLinkA benchmark for hallucination evaluation that focuses on two common types
MagnifierBenchOtterHD: A High-Resolution Multi-modality ModelLinkA benchmark designed to probe models' ability of fine-grained perception
HallusionBenchHallusionBench: You See What You Think? Or You Think What You See? An Image-Context Reasoning Benchmark Challenging for GPT-4V(ision), LLaVA-1.5, and Other Multi-modality ModelsLinkAn image-context reasoning benchmark for evaluation of hallucination
PCA-EVALTowards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and BeyondLinkA benchmark for evaluating multi-domain embodied decision-making.
MMHal-BenchAligning Large Multimodal Models with Factually Augmented RLHFLinkA benchmark for hallucination evaluation
MathVistaMathVista: Evaluating Math Reasoning in Visual Contexts with GPT-4V, Bard, and Other Large Multimodal ModelsLinkA benchmark that challenges both visual and math reasoning capabilities
SparklesEval✨Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following ModelsLinkA GPT-assisted benchmark for quantitatively assessing a model's conversational competence across multiple images and dialogue turns based on three distinct criteria.
ISEKAILink-Context Learning for Multimodal LLMsLinkA benchmark comprising exclusively of unseen generated image-label pairs designed for link-context learning
M-HalDetectDetecting and Preventing Hallucinations in Large Vision Language ModelsComing soonA dataset used to train and benchmark models for hallucination detection and prevention
I4Empowering Vision-Language Models to Follow Interleaved Vision-Language InstructionsLinkA benchmark to comprehensively evaluate the instruction following ability on complicated interleaved vision-language instructions
SciGraphQASciGraphQA: A Large-Scale Synthetic Multi-Turn Question-Answering Dataset for Scientific GraphsLinkA large-scale chart-visual question-answering dataset
MM-VetMM-Vet: Evaluating Large Multimodal Models for Integrated CapabilitiesLinkAn evaluation benchmark that examines large multimodal models on complicated multimodal tasks
SEED-BenchSEED-Bench: Benchmarking Multimodal LLMs with Generative ComprehensionLinkA benchmark for evaluation of generative comprehension in MLLMs
MMBenchMMBench: Is Your Multi-modal Model an All-around Player?LinkA systematically-designed objective benchmark for robustly evaluating the various abilities of vision-language models
LynxWhat Matters in Training a GPT4-Style Language Model with Multimodal Inputs?LinkA comprehensive evaluation benchmark including both image and video tasks
GAVIEMitigating Hallucination in Large Multi-Modal Models via Robust Instruction TuningLinkA benchmark to evaluate the hallucination and instruction following ability
MMEMME: A Comprehensive Evaluation Benchmark for Multimodal Large Language ModelsLinkA comprehensive MLLM Evaluation benchmark
LVLM-eHubLVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language ModelsLinkAn evaluation platform for MLLMs
LAMM-BenchmarkLAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and BenchmarkLinkA benchmark for evaluating the quantitative performance of MLLMs on various2D/3D vision tasks
M3ExamM3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language ModelsLinkA multilingual, multimodal, multilevel benchmark for evaluating MLLM
OwlEvalmPLUG-Owl: Modularization Empowers Large Language Models with MultimodalityLinkDataset for evaluation on multiple capabilities

Contributors

jinbo0906

14 commits

GewelsJI

1 commits