MMInstruction/M3IT

Dataset

136

stars

251

commits

12

linked in READMEs

Nov 24, 2023

updated

README

Dataset Card for M3IT

Project Page: M3IT

Dataset Description

Languages

English and Chinese. 80 translated version can be found at M3IT-80.

Dataset Statistics

Our dataset compiles diverse tasks of classical vision-language tasks, including captioning, visual question answering~(VQA), visual conditioned generation, reasoning and classification.

Instruction Statistics

Task#Instructions
Image Captioning52
Classification113
Visual Question Answering95
Knowledgeable Visual QA40
Reasoning60
Generation40
Total400

Task Statistics

TaskDescription#Train#Val#Test
Image CaptioningGiven an image, write a description for the image.679,08741,46227,499
ClassificationGiven an image, classify the image into pre-defined categories.238,303100,06921,206
Visual Question AnsweringGiven an image, answer a question relevant to the image.177,63346,31410,828
Knowledgeable Visual QAGiven an image, answer the question requires outside knowledge.39,98111,6825,477
ReasoningGiven an image, conduct reasoning over the images.99,37211,50010,000
GenerationGiven an image, make compositions with certain requirements.145,00011,31517,350
ChineseCAP, CLS, VQA, and GEN tasks in Chinese.192,07677,3064,100
VideoCAP, CLS, and VQA tasks on video-language datasets.20,8687,5429,294
Multi-lingualTranslated tasks in 80 languages0240,000184,000

Detailed Dataset Statistics

TaskDataset#Train#Val#Test
Image Captioningcoco566,74725,01025,010
textcap97,76513,9650
image-paragraph-captioning14,5752,4872,489
Classificationcoco-goi30,0002,0000
coco-text118,31227,5500
imagenet30,00050,0000
coco-itm30,0005,0005,000
snli-ve20,00014,33914,740
mocheg4,991180466
iqa5,0001,0001,000
Visual Question Answeringvqa-v230,00030,0000
shapes13,5681,0241,024
docvqa39,4635,3490
ocr-vqa11,4144,9400
st-vqa26,07404,070
text-vqa27,11305,734
gqa30,0015,0010
Knowledgeable Visual QAokvqa9,0095,0460
a-okvqa17,0561,1450
science-qa12,7264,2414,241
viquae1,1901,2501,236
Reasoningclevr30,0002,0000
nlvr29,3722,0000
vcr25,0005,0005,000
visual-mrc15,0002,5005,000
winoground00800
Generationvist5,0004,3154,350
visual-dialog50,0001,0001,000
multi30k90,0006,00012,000
Chinesefm-iqa164,73575,2060
coco-cn18,3411,0001,000
flickr8k-cn6,0001,0001,000
chinese-food001,100
mmchat3,0001,0001,000
Videoss2,0002,0002,000
ivqa5,9942,0002,000
msvd-qa1,161245504
activitynet-qa3,2001,800800
msrvtt6,5134972,990
msrvtt-qa2,0001,0001,000

Dataset Structure

HuggingFace Login (Optional)

# OR run huggingface-cli login
from huggingface_hub import login

hf_token = "hf_xxx"  # TODO: set a valid HuggingFace access token for loading datasets/models
login(token=hf_token)

Data Loading

from datasets import load_dataset

ds_name = "coco"  # change the dataset name here
dataset = load_dataset("MMInstruction/M3IT", ds_name)

Data Splits

from datasets import load_dataset

ds_name = "coco"  # change the dataset name here
dataset = load_dataset("MMInstruction/M3IT", ds_name)
train_set = dataset["train"]
validation_set = dataset["validation"]
test_set = dataset["test"]

Data Instances

from datasets import load_dataset
from io import BytesIO
from base64 import b64decode
from PIL import Image

ds_name = "coco"  # change the dataset name here
dataset = load_dataset("MMInstruction/M3IT", ds_name)
train_set = dataset["train"]

for train_instance in train_set:
    instruction = train_instance["instruction"]  # str
    inputs = train_instance["inputs"]  # str
    outputs = train_instance["outputs"]  # str
    image_base64_str_list = train_instance["image_base64_str"]  # str (base64)
    image_0 = Image.open(BytesIO(b64decode(image_base64_str_list[0])))

Data Fields

import datasets

features = datasets.Features(
    {
        "instruction": datasets.Value("string"),
        "inputs": datasets.Value("string"),
        "image_base64_str": [datasets.Value("string")],
        "outputs": datasets.Value("string"),
    }
)

Dataset Creation

Curation Rationale

[More Information Needed]

Source Data

TaskDataset [Citation]Source
Image Captioningcoco [1]Source
textcap [2]Source
image-paragraph-captioning [3]Source
Classificationcoco-goi [1]Source
coco-text [4]Source
imagenet [5]Source
coco-itm [1]Source
snli-ve [6]Source
mocheg [7]Source
iqa [8]Source
Visual Question Answeringvqa-v2 [9]Source
shapes [10]Source
docvqa [11]Source
ocr-vqa [12]Source
st-vqa [13]Source
text-vqa [14]Source
gqa [15]Source
Knowledgeable Visual QAokvqa [16]Source
a-okvqa [17]Source
science-qa [18]Source
viquae [19]Source
Reasoningclevr [20]Source
nlvr [21]Source
vcr [22]Source
visual-mrc [23]Source
winoground [24]Source
Generationvist [25]Source
visual-dialog [26]Source
multi30k [27]Source
Chinesefm-iqa [28]Source
coco-cn [29]Source
flickr8k-cn [30]Source
chinese-food [31]Source
mmchat [32]Source
Videoss [33]Source
ivqa [34]Source
msvd-qa [35]Source
activitynet-qa [36]Source
msrvtt [35]Source
msrvtt-qa [37]Source

Annotations

Annotation process

To build high-quality multimodal instruction datasets, we rewrite various datasets into multimodal-to-text dialog format. The annotation process includes four steps:

  • (1) Stage I: Instruction Writing: writing instructions for each task;
  • (2) Stage II: Data Format Unification: structuring images and texts into a unified schema;
  • (3) Stage III: Quality Check: checking the overall dataset quality;
  • (4) Stage IV: Key Datasets Translation: building multilingual sets.

Who are the annotators?

Eight authors of this work are employed as human annotators, each of whom is a graduate student familiar with relevant literature.

Additional Information

Licensing Information

The content of original dataset follows their original license. We suggest that for the task with Unknown/Custom license, the user can check the original project or contact the dataset owner for detailed license information.

Our annotated instruction data is licensed under CC BY 4.0.

Citation Information

@article{li2023m3it,
  title={M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning},
  author={Lei Li and Yuwei Yin and Shicheng Li and Liang Chen and Peiyi Wang and Shuhuai Ren and Mukai Li and Yazheng Yang and Jingjing Xu and Xu Sun and Lingpeng Kong and Qi Liu},
  journal={arXiv preprint arXiv:2306.04387},
  year={2023}
}

Contributions

M3IT is an open-source, large-scale Multi-modal, Multilingual Instruction Tuning dataset, designed to enable the development of general-purpose multi-modal agents.

References

  • [1] Microsoft COCO: Common Objects in Context
  • [2] TextCaps: a dataset for image captioning with reading comprehension
  • [3] A Hierarchical Approach for Generating Descriptive Image Paragraphs
  • [4] COCO-Text: Dataset and benchmark for text detection and recognition in natural images
  • [5] Imagenet large scale visual recognition challenge
  • [6] E-ViL: A Dataset and Benchmark for Natural Language Explanations in Vision-Language Tasks
  • [7] End-to-End Multimodal Fact-Checking and Explanation Generation: A Challenging Dataset and Models
  • [8] Quantifying visual image quality: A Bayesian view
  • [9] Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering
  • [10] Neural Module Networks
  • [11] DocVQA: A dataset for vqa on document images
  • [12] OCR-VQA: Visual Question Answering by Reading Text in Images
  • [13] Scene Text Visual Question Answering
  • [14] Towards VQA Models That Can Read
  • [15] GQA: A new dataset for real-world visual reasoning and compositional question answering
  • [16] OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge
  • [17] A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge
  • [18] Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering
  • [19] ViQuAE: a dataset for knowledge-based visual question answering about named entities
  • [20] CLEVR: A diagnostic dataset for compositional language and elementary visual reasoning
  • [21] A Corpus of Natural Language for Visual Reasoning
  • [22] From recognition to cognition: Visual Commonsense Reasoning
  • [23] VisualMRC: Machine reading comprehension on document images
  • [24] WinoGround: Probing vision and language models for visio-linguistic compositionality
  • [25] Visual Storytelling
  • [26] Visual Dialog
  • [27] Multi30k: Multilingual english-german image descriptions
  • [28] Are You Talking to a Machine? Dataset and Methods for Multilingual Image Question
  • [29] COCO-CN for cross-lingual image tagging, captioning, and retrieval
  • [30] Adding Chinese Captions to Images
  • [31] ChineseFoodNet: A large-scale image dataset for chinese food recognition
  • [32] MMChat: Multi-Modal Chat Dataset on Social Media
  • [33] The "Something Something" Video Database for Learning and Evaluating Visual Common Sense
  • [34] Just Ask: Learning to answer questions from millions of narrated videos
  • [35] Video Question Answering via Gradually Refined Attention over Appearance and Motion
  • [36] ActivityNet-qa: A dataset for understanding complex web videos via question answering
  • [37] MSR-VTT: A large video description dataset for bridging video and language

Contributors

TO
tobiaslee

161 commits

yuweiyin

30 commits

leonardPKU

25 commits

ShuhuaiRen

12 commits

MMInstruction/M3IT

Dataset

136

stars

251

commits

12

linked in READMEs

Nov 24, 2023

updated

README

Dataset Card for M3IT

Project Page: M3IT

Dataset Description

Languages

English and Chinese. 80 translated version can be found at M3IT-80.

Dataset Statistics

Our dataset compiles diverse tasks of classical vision-language tasks, including captioning, visual question answering~(VQA), visual conditioned generation, reasoning and classification.

Instruction Statistics

Task#Instructions
Image Captioning52
Classification113
Visual Question Answering95
Knowledgeable Visual QA40
Reasoning60
Generation40
Total400

Task Statistics

TaskDescription#Train#Val#Test
Image CaptioningGiven an image, write a description for the image.679,08741,46227,499
ClassificationGiven an image, classify the image into pre-defined categories.238,303100,06921,206
Visual Question AnsweringGiven an image, answer a question relevant to the image.177,63346,31410,828
Knowledgeable Visual QAGiven an image, answer the question requires outside knowledge.39,98111,6825,477
ReasoningGiven an image, conduct reasoning over the images.99,37211,50010,000
GenerationGiven an image, make compositions with certain requirements.145,00011,31517,350
ChineseCAP, CLS, VQA, and GEN tasks in Chinese.192,07677,3064,100
VideoCAP, CLS, and VQA tasks on video-language datasets.20,8687,5429,294
Multi-lingualTranslated tasks in 80 languages0240,000184,000

Detailed Dataset Statistics

TaskDataset#Train#Val#Test
Image Captioningcoco566,74725,01025,010
textcap97,76513,9650
image-paragraph-captioning14,5752,4872,489
Classificationcoco-goi30,0002,0000
coco-text118,31227,5500
imagenet30,00050,0000
coco-itm30,0005,0005,000
snli-ve20,00014,33914,740
mocheg4,991180466
iqa5,0001,0001,000
Visual Question Answeringvqa-v230,00030,0000
shapes13,5681,0241,024
docvqa39,4635,3490
ocr-vqa11,4144,9400
st-vqa26,07404,070
text-vqa27,11305,734
gqa30,0015,0010
Knowledgeable Visual QAokvqa9,0095,0460
a-okvqa17,0561,1450
science-qa12,7264,2414,241
viquae1,1901,2501,236
Reasoningclevr30,0002,0000
nlvr29,3722,0000
vcr25,0005,0005,000
visual-mrc15,0002,5005,000
winoground00800
Generationvist5,0004,3154,350
visual-dialog50,0001,0001,000
multi30k90,0006,00012,000
Chinesefm-iqa164,73575,2060
coco-cn18,3411,0001,000
flickr8k-cn6,0001,0001,000
chinese-food001,100
mmchat3,0001,0001,000
Videoss2,0002,0002,000
ivqa5,9942,0002,000
msvd-qa1,161245504
activitynet-qa3,2001,800800
msrvtt6,5134972,990
msrvtt-qa2,0001,0001,000

Dataset Structure

HuggingFace Login (Optional)

# OR run huggingface-cli login
from huggingface_hub import login

hf_token = "hf_xxx"  # TODO: set a valid HuggingFace access token for loading datasets/models
login(token=hf_token)

Data Loading

from datasets import load_dataset

ds_name = "coco"  # change the dataset name here
dataset = load_dataset("MMInstruction/M3IT", ds_name)

Data Splits

from datasets import load_dataset

ds_name = "coco"  # change the dataset name here
dataset = load_dataset("MMInstruction/M3IT", ds_name)
train_set = dataset["train"]
validation_set = dataset["validation"]
test_set = dataset["test"]

Data Instances

from datasets import load_dataset
from io import BytesIO
from base64 import b64decode
from PIL import Image

ds_name = "coco"  # change the dataset name here
dataset = load_dataset("MMInstruction/M3IT", ds_name)
train_set = dataset["train"]

for train_instance in train_set:
    instruction = train_instance["instruction"]  # str
    inputs = train_instance["inputs"]  # str
    outputs = train_instance["outputs"]  # str
    image_base64_str_list = train_instance["image_base64_str"]  # str (base64)
    image_0 = Image.open(BytesIO(b64decode(image_base64_str_list[0])))

Data Fields

import datasets

features = datasets.Features(
    {
        "instruction": datasets.Value("string"),
        "inputs": datasets.Value("string"),
        "image_base64_str": [datasets.Value("string")],
        "outputs": datasets.Value("string"),
    }
)

Dataset Creation

Curation Rationale

[More Information Needed]

Source Data

TaskDataset [Citation]Source
Image Captioningcoco [1]Source
textcap [2]Source
image-paragraph-captioning [3]Source
Classificationcoco-goi [1]Source
coco-text [4]Source
imagenet [5]Source
coco-itm [1]Source
snli-ve [6]Source
mocheg [7]Source
iqa [8]Source
Visual Question Answeringvqa-v2 [9]Source
shapes [10]Source
docvqa [11]Source
ocr-vqa [12]Source
st-vqa [13]Source
text-vqa [14]Source
gqa [15]Source
Knowledgeable Visual QAokvqa [16]Source
a-okvqa [17]Source
science-qa [18]Source
viquae [19]Source
Reasoningclevr [20]Source
nlvr [21]Source
vcr [22]Source
visual-mrc [23]Source
winoground [24]Source
Generationvist [25]Source
visual-dialog [26]Source
multi30k [27]Source
Chinesefm-iqa [28]Source
coco-cn [29]Source
flickr8k-cn [30]Source
chinese-food [31]Source
mmchat [32]Source
Videoss [33]Source
ivqa [34]Source
msvd-qa [35]Source
activitynet-qa [36]Source
msrvtt [35]Source
msrvtt-qa [37]Source

Annotations

Annotation process

To build high-quality multimodal instruction datasets, we rewrite various datasets into multimodal-to-text dialog format. The annotation process includes four steps:

  • (1) Stage I: Instruction Writing: writing instructions for each task;
  • (2) Stage II: Data Format Unification: structuring images and texts into a unified schema;
  • (3) Stage III: Quality Check: checking the overall dataset quality;
  • (4) Stage IV: Key Datasets Translation: building multilingual sets.

Who are the annotators?

Eight authors of this work are employed as human annotators, each of whom is a graduate student familiar with relevant literature.

Additional Information

Licensing Information

The content of original dataset follows their original license. We suggest that for the task with Unknown/Custom license, the user can check the original project or contact the dataset owner for detailed license information.

Our annotated instruction data is licensed under CC BY 4.0.

Citation Information

@article{li2023m3it,
  title={M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning},
  author={Lei Li and Yuwei Yin and Shicheng Li and Liang Chen and Peiyi Wang and Shuhuai Ren and Mukai Li and Yazheng Yang and Jingjing Xu and Xu Sun and Lingpeng Kong and Qi Liu},
  journal={arXiv preprint arXiv:2306.04387},
  year={2023}
}

Contributions

M3IT is an open-source, large-scale Multi-modal, Multilingual Instruction Tuning dataset, designed to enable the development of general-purpose multi-modal agents.

References

  • [1] Microsoft COCO: Common Objects in Context
  • [2] TextCaps: a dataset for image captioning with reading comprehension
  • [3] A Hierarchical Approach for Generating Descriptive Image Paragraphs
  • [4] COCO-Text: Dataset and benchmark for text detection and recognition in natural images
  • [5] Imagenet large scale visual recognition challenge
  • [6] E-ViL: A Dataset and Benchmark for Natural Language Explanations in Vision-Language Tasks
  • [7] End-to-End Multimodal Fact-Checking and Explanation Generation: A Challenging Dataset and Models
  • [8] Quantifying visual image quality: A Bayesian view
  • [9] Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering
  • [10] Neural Module Networks
  • [11] DocVQA: A dataset for vqa on document images
  • [12] OCR-VQA: Visual Question Answering by Reading Text in Images
  • [13] Scene Text Visual Question Answering
  • [14] Towards VQA Models That Can Read
  • [15] GQA: A new dataset for real-world visual reasoning and compositional question answering
  • [16] OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge
  • [17] A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge
  • [18] Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering
  • [19] ViQuAE: a dataset for knowledge-based visual question answering about named entities
  • [20] CLEVR: A diagnostic dataset for compositional language and elementary visual reasoning
  • [21] A Corpus of Natural Language for Visual Reasoning
  • [22] From recognition to cognition: Visual Commonsense Reasoning
  • [23] VisualMRC: Machine reading comprehension on document images
  • [24] WinoGround: Probing vision and language models for visio-linguistic compositionality
  • [25] Visual Storytelling
  • [26] Visual Dialog
  • [27] Multi30k: Multilingual english-german image descriptions
  • [28] Are You Talking to a Machine? Dataset and Methods for Multilingual Image Question
  • [29] COCO-CN for cross-lingual image tagging, captioning, and retrieval
  • [30] Adding Chinese Captions to Images
  • [31] ChineseFoodNet: A large-scale image dataset for chinese food recognition
  • [32] MMChat: Multi-Modal Chat Dataset on Social Media
  • [33] The "Something Something" Video Database for Learning and Evaluating Visual Common Sense
  • [34] Just Ask: Learning to answer questions from millions of narrated videos
  • [35] Video Question Answering via Gradually Refined Attention over Appearance and Motion
  • [36] ActivityNet-qa: A dataset for understanding complex web videos via question answering
  • [37] MSR-VTT: A large video description dataset for bridging video and language

Contributors

TO
tobiaslee

161 commits

yuweiyin

30 commits

leonardPKU

25 commits

ShuhuaiRen

12 commits