THUIAR/MMLA-Datasets

Dataset

Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark

4

106 commits

10 linked in READMEs

updated Aug 13, 2025

See the code

README

Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark

1. Introduction

MMLA is the first comprehensive multimodal language analysis benchmark for evaluating foundation models. It has the following features:

  • Large Scale: 61K+ multimodal samples.
  • Various Sources: 9 datasets.
  • Three Modalities: text, video, and audio
  • Both Acting and Real-world Scenarios: films, TV series, YouTube, Vimeo, Bilibili, TED, improvised scripts, etc.
  • Six Core Dimensions in Multimodal Language Analysis: intent, emotion, sentiment, dialogue act, speaking style, and communication behavior.

We also build baselines with three evaluation methods (i.e., zero-shot inference, supervised fine-tuning, and instruction tuning) on 8 mainstream foundation models (i.e., 5 MLLMs (Qwen2-VL, VideoLLaMA2, LLaVA-Video, LLaVA-OV, MiniCPM-V-2.6), 3 LLMs (InternLM2.5, Qwen2, LLaMA3). More details can refer to our paper.

2. Datasets

2.1 Statistics

Dataset statistics for each dimension in the MMLA benchmark. #C, #U, #Train, #Val, and #Test represent the number of label classes, utterances, training, validation, and testing samples, respectively. avg. and max. refer to the average and maximum lengths.

DimensionsDatasets#C#U#Train#Val#TestVideo HoursSource#Video Length (avg. / max.)#Text Length (avg. / max.)Language
IntentMIntRec202,2241,3344454451.5TV series2.4 / 9.67.6 / 27.0English
MIntRec2.0309,3046,1651,1062,0337.5TV series2.9 / 19.98.5 / 46.0
Dialogue ActMELD129,9896,9929991,9988.8TV series3.2 / 41.18.6 / 72.0English
IEMOCAP129,4166,5909421,88411.7Improvised scripts4.5 / 34.212.4 / 106.0
EmotionMELD713,7089,9891,1092,61012.2TV series3.2 / 305.08.7 / 72.0English
IEMOCAP67,5325,2375211,6229.6Improvised scripts4.6 / 34.212.8 / 106.0
SentimentMOSI22,1991,2842296862.6Youtube4.3 / 52.512.5 / 114.0English
CH-SIMS v2.034,4032,7226471,0344.3TV series, films3.6 / 42.71.8 / 7.0Mandarin
Speaking StyleUR-FUNNY-v229,5867,61298099412.9TED4.8 / 325.716.3 / 126.0English
MUStARD26904141381381.0TV series5.2 / 20.013.1 / 68.0
Communication BehaviorAnno-MI (client)34,7133,1234611,12810.8YouTube & Vimeo8.2 / 600.016.3 / 266.0English
Anno-MI (therapist)44,7733,1614721,13912.19.1 / 1316.117.9 / 205.0

2.2 Collection Timeline

  • MIntRec: Released in 2022/10.
  • MIntRec2.0: Released in 2024/01.
  • MELD: Collected from TV series (released in 2019/05).
  • UR-FUNNY-v2: Collected from publicly available TED talks (released in 2019/11).
  • MUStARD: Collected from TV series (released in 2019/07).
  • MELD-DA: Dialogue act annotations added to MELD in 2020/07. Derived from the EMOTyDA dataset, which re-annotated the original MELD training set videos without collecting new video data.
  • IEMOCAP-DA: Dialogue act annotations added to IEMOCAP (released in 2020/07). Derived from the EMOTyDA dataset, which re-annotated all original IEMOCAP videos without collecting new video data.
  • MOSI: Collected from YouTube opinion videos (released in 2016/06).
  • IEMOCAP: Collected from scripted improvisational acting (released in 2008/12).
  • Anno-MI: Collected from publicly available YouTube and Vimeo videos (released in 2023/03).

2.3 License

This benchmark uses nine datasets, each of which is employed strictly in accordance with its official license and exclusively for academic research purposes. We fully respect the datasets’ copyright policies, license requirements, and ethical standards. For those datasets whose licenses explicitly permit redistribution, we release the original video data (e.g., MIntRec, MIntRec2.0, MELD, UR-FUNNY-v2, MUStARD, MELD-DA, CH-SIMS v2.0, and Anno-MI. For datasets that restrict video redistribution, users should obtain the videos directly from their official repositories (e.g., MOSI, IEMOCAP and IEMOCAP-DA. In compliance with all relevant licenses, we also provide the original textual data unchanged, together with the specific dataset splits used in our experiments. This approach ensures reproducibility and academic transparency while strictly adhering to copyright obligations and protecting the privacy of individuals featured in the videos.

3. LeaderBoard

3.1 Rank of Zero-shot Inference

RANKModelsACCTYPE
🥇GPT-4o52.60MLLM
🥈Qwen2-VL-72B52.55MLLM
🥉LLaVA-OV-72B52.44MLLM
4LLaVA-Video-72B51.64MLLM
5InternLM2.5-7B50.28LLM
6Qwen2-7B48.45LLM
7Qwen2-VL-7B47.12MLLM
8Llama3-8B44.06LLM
9LLaVA-Video-7B43.32MLLM
10VideoLLaMA2-7B42.82MLLM
11LLaVA-OV-7B40.65MLLM
12Qwen2-1.5B40.61LLM
13MiniCPM-V-2.6-8B37.03MLLM
14Qwen2-0.5B22.14LLM

3.2 Rank of Supervised Fine-tuning (SFT) and Instruction Tuning (IT)

RankModelsACCType
🥇Qwen2-VL-72B (SFT)69.18MLLM
🥈MiniCPM-V-2.6-8B (SFT)68.88MLLM
🥉LLaVA-Video-72B (IT)68.87MLLM
4LLaVA-ov-72B (SFT)68.67MLLM
5Qwen2-VL-72B (IT)68.64MLLM
6LLaVA-Video-72B (SFT)68.44MLLM
7VideoLLaMA2-7B (SFT)68.30MLLM
8Qwen2-VL-7B (SFT)67.60MLLM
9LLaVA-ov-7B (SFT)67.54MLLM
10LLaVA-Video-7B (SFT)67.47MLLM
11Qwen2-VL-7B (IT)67.34MLLM
12MiniCPM-V-2.6-8B (IT)67.25MLLM
13Llama-3-8B (SFT)66.18LLM
14Qwen2-7B (SFT)66.15LLM
15Internlm-2.5-7B (SFT)65.72LLM
16Qwen-2-7B (IT)64.58LLM
17Internlm-2.5-7B (IT)64.41LLM
18Llama-3-8B (IT)64.16LLM
19Qwen2-1.5B (SFT)64.00LLM
20Qwen2-0.5B (SFT)62.80LLM

4. Data Integrity

All files included in the MMLA benchmark are verified using SHA-256 checksums. Please ensure the integrity of the files using the following checksums:

File PathSHA256 Hash
/MMLA-Datasets/AnnoMi-client/test.tsvd555c7131bc54cb61424d421c7a3ec117fa5587c1d4027dd8501321a5d1abc09
/MMLA-Datasets/AnnoMi-client/dev.tsv4695dc4e1c360cac53ecd0386b82d10fdda9414ad1d559c0a9491a8981657acd
/MMLA-Datasets/AnnoMi-client/train.tsv8e1104e7d4e42952d0e615c22ee7ea08c03d9b7d07807ba6f4fd4b41d08fed89
/MMLA-Datasets/AnnoMi-client/AnnoMI-client_video.tar.gz597d9b8c1a701a89c3f6b18e4a451c21b6699a670a83225b7bce5212f5abdfe0
/MMLA-Datasets/AnnoMi-therapist/dev.tsvbde3ae0e4f16e2249ac94245802b1e5053df3c9d4864f8a889347fe492364767
/MMLA-Datasets/AnnoMi-therapist/test.tsv0ef6ceeba7dfff9f3201b263aecdb6636b6dd39c5eec220c91a328b5dd23e9d5
/MMLA-Datasets/AnnoMi-therapist/train.tsvfd0a4741bd3fb32014318f0bd0fbc464a87a9e267163fcac9618707fedca12b2
/MMLA-Datasets/AnnoMi-therapist/AnnoMi-therapist_video.tar.gz767ce57ad55078001cdd616d642f78d3b0433d9ebcbc14db1608408a54c9fa10
/MMLA-Datasets/CH-SIMSv2.0/test.tsv40afae5245b1060e8bb5162e8cc4f17f294a43b51a9e01e5bbd64d1f5ebcb6d7
/MMLA-Datasets/CH-SIMSv2.0/dev.tsv47dfac9ca8d77868ed644b8cd9536fa403f9d6f81e26796cd882e39d2cc14608
/MMLA-Datasets/CH-SIMSv2.0/train.tsv96350a9e35d62dc63035256e09f033f84aa670f6bf1c06e38daef85d39bde7d7
/MMLA-Datasets/CH-SIMSv2.0/Ch-simsv2_video.tar.gze2817c4841a74f9e73eed6cf3196442ff0245f999bdfc5f975dcf18e66348f1e
/MMLA-Datasets/IEMOCAP-DA/dev.tsv67d357fee50c9b009f9cdc81738e1f45562e0a7f193f6f100320e1881d2b2c8c
/MMLA-Datasets/IEMOCAP-DA/test.tsv050d27887bec3714f8f0c323594c3c287fa9a5c006f94de0fa09565ba0251773
/MMLA-Datasets/IEMOCAP-DA/train.tsv823b37fa045aa6aad694d94ad134e23b92491cd6c5d742ed6e9d9456b433608b
/MMLA-Datasets/IEMOCAP/dev.tsvb6b0bbe1f49dc1f20c4121ac8f943b2d85722c95bb0988946282a496c0c1094d
/MMLA-Datasets/IEMOCAP/test.tsv7ab10d9c126e037e8c6be1ddf6487d57e9132b2e238286a6a9cccce029760581
/MMLA-Datasets/IEMOCAP/train.tsva0017547086721147ed1191e8b7d5da42f795c4070687cffcff001d8827b81d8
/MMLA-Datasets/MELD-DA/test.tsvb25f4396f30a8d591224ec8074cc4ebfd5727f22fa816ab46cdb455dc22ee854
/MMLA-Datasets/MELD-DA/dev.tsv4fcc28d139ac933df8e8a288f2d17e010d5e013c70722485a834a7b843536351
/MMLA-Datasets/MELD-DA/train.tsv045642a0abaa9d9d9ea5f7ade96a09dd856311c9a375dea1839616688240ec71
/MMLA-Datasets/MELD-DA/MELD-DA_video.tar.gz92154bb5d2cf9d8dc229d5fe7ce65519ee7525487f4f42ca7acdf79e48c69707
/MMLA-Datasets/MELD/dev.tsvce677f8162ce901e0cc26f531f1786620cac40b7507fa34664537dadc407d256
/MMLA-Datasets/MELD/test.tsvee0e0a35a8ae73b522f359039cea34e92d0e13283f5f01c4f29795b439a92a69
/MMLA-Datasets/MELD/train.tsv063ac8accce2e0da3b45e9cdb077c5374a4cf08f6d62db41438e6e0c52981287
/MMLA-Datasets/MELD/MELD_video.tar.gz6ce66e5e0d3054aeaf2f5857106360f3b94c37e099bf2e2b17bc1304ef79361b
/MMLA-Datasets/MIntRec/dev.tsv629ab568ec3e1343c83d76b43d7398f7580361370d09162065a6bb1883f2fe9a
/MMLA-Datasets/MIntRec/test.tsvadffdc8f061878ad560ee0e0046ba32e6bc9e0332d9e09094cfce0b755fcc2a9
/MMLA-Datasets/MIntRec/train.tsvc1bec2ff06712063c7399264d7c06f4cdc125084314e6fa8bdfd94d3f0b42332
/MMLA-Datasets/MIntRec/MIntRec_video.tar.gza756b6ad5f851773b3ae4621e3aa5c33a662bde80b239a6815a8541c30fc6411
/MMLA-Datasets/MIntRec2.0/dev.tsvf2f69111d0bd8c26681db0a613a0112f466c667d56a79949ce17ccadd1e6ae37
/MMLA-Datasets/MIntRec2.0/test.tsv6aa650afbaf40256afdbb546a9f7253511f3fe8d791a9acc7b6829824455a6ed
/MMLA-Datasets/MIntRec2.0/train.tsve8b8767bd9a4de5833475db2438e63390c9674041a7b8ea39183a74fa4b624ef
/MMLA-Datasets/MIntRec2.0/MIntRec2.0_video.tar.gz78bd9ab4a0f9e5768ed2a094524165ecc51926e210a4701a9548d036a68d5e29
/MMLA-Datasets/MOSI/dev.tsvbd8ccded8dacb9cb7d37743f54c7e4c7bef391069b67b55c7e0cf4626fadee5f
/MMLA-Datasets/MOSI/test.tsvc480fc2cb444d215e5ba3433452db546fd8e638d332ee0f03278158b69375eca
/MMLA-Datasets/MOSI/train.tsvf1afe6018ae0b0ab8833da6934c0847f480412ed11c9c22e204a01e8cf75971b
/MMLA-Datasets/MUStARD/MUStARD_video.tar.gz8bd863c7ab4c29a710aa3edc0f560361275830a1e98ec41908d51c43e08647c1
/MMLA-Datasets/MUStARD/dev.tsv45477e0bda84c3d45ff197734b3943fc30e9f89c0d0cb8c272f0c10d31ee5474
/MMLA-Datasets/MUStARD/test.tsvae248884d42d690700b6ce9930bb12827cd0fbcae200c43aace5a90003ad99e5
/MMLA-Datasets/MUStARD/train.tsv4292e07a087978a08552268b6c8405d897ee855af495e7e58ee99863e705eb43
/MMLA-Datasets/UR-FUNNY-v2/dev.tsva82f758ef5d2a65bc41e09e24a616d4654c1565e851cd42c71a575b09282a2d2
/MMLA-Datasets/UR-FUNNY-v2/test.tsv6cb9dee9fd55545f46cd079ecb7541981d4c19a76c0ce79d7d874fe73703b63a
/MMLA-Datasets/UR-FUNNY-v2/train.tsv8eb91657faa19a2d53cc930c810d2fa3abd8e365c49d27fa6feb68cd95f40fb4
/MMLA-Datasets/UR-FUNNY-v2/UR-FUNNYv2_video.tar.gze5a3962985c8ead5f593db69ab77a9d6702895768bb5871fe8764406358f8cae

5. Acknowledgements

For more details, please refer to our Github repo. If our work is helpful to your research, please consider citing the following paper:

@article{zhang2025mmla,
  author={Zhang, Hanlei and Li, Zhuohang and Zhu, Yeshuang and Xu, Hua and Wang, Peiwu and Zhu, Haige and Zhou, Jie and Zhang, Jinchao},
  title={Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark},
  year={2025},
  journal={arXiv preprint arXiv:2504.16427},
}

THUIAR/MMLA-Datasets

Dataset

Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark

4

106 commits

10 linked in READMEs

updated Aug 13, 2025

See the code

README

Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark

1. Introduction

MMLA is the first comprehensive multimodal language analysis benchmark for evaluating foundation models. It has the following features:

  • Large Scale: 61K+ multimodal samples.
  • Various Sources: 9 datasets.
  • Three Modalities: text, video, and audio
  • Both Acting and Real-world Scenarios: films, TV series, YouTube, Vimeo, Bilibili, TED, improvised scripts, etc.
  • Six Core Dimensions in Multimodal Language Analysis: intent, emotion, sentiment, dialogue act, speaking style, and communication behavior.

We also build baselines with three evaluation methods (i.e., zero-shot inference, supervised fine-tuning, and instruction tuning) on 8 mainstream foundation models (i.e., 5 MLLMs (Qwen2-VL, VideoLLaMA2, LLaVA-Video, LLaVA-OV, MiniCPM-V-2.6), 3 LLMs (InternLM2.5, Qwen2, LLaMA3). More details can refer to our paper.

2. Datasets

2.1 Statistics

Dataset statistics for each dimension in the MMLA benchmark. #C, #U, #Train, #Val, and #Test represent the number of label classes, utterances, training, validation, and testing samples, respectively. avg. and max. refer to the average and maximum lengths.

DimensionsDatasets#C#U#Train#Val#TestVideo HoursSource#Video Length (avg. / max.)#Text Length (avg. / max.)Language
IntentMIntRec202,2241,3344454451.5TV series2.4 / 9.67.6 / 27.0English
MIntRec2.0309,3046,1651,1062,0337.5TV series2.9 / 19.98.5 / 46.0
Dialogue ActMELD129,9896,9929991,9988.8TV series3.2 / 41.18.6 / 72.0English
IEMOCAP129,4166,5909421,88411.7Improvised scripts4.5 / 34.212.4 / 106.0
EmotionMELD713,7089,9891,1092,61012.2TV series3.2 / 305.08.7 / 72.0English
IEMOCAP67,5325,2375211,6229.6Improvised scripts4.6 / 34.212.8 / 106.0
SentimentMOSI22,1991,2842296862.6Youtube4.3 / 52.512.5 / 114.0English
CH-SIMS v2.034,4032,7226471,0344.3TV series, films3.6 / 42.71.8 / 7.0Mandarin
Speaking StyleUR-FUNNY-v229,5867,61298099412.9TED4.8 / 325.716.3 / 126.0English
MUStARD26904141381381.0TV series5.2 / 20.013.1 / 68.0
Communication BehaviorAnno-MI (client)34,7133,1234611,12810.8YouTube & Vimeo8.2 / 600.016.3 / 266.0English
Anno-MI (therapist)44,7733,1614721,13912.19.1 / 1316.117.9 / 205.0

2.2 Collection Timeline

  • MIntRec: Released in 2022/10.
  • MIntRec2.0: Released in 2024/01.
  • MELD: Collected from TV series (released in 2019/05).
  • UR-FUNNY-v2: Collected from publicly available TED talks (released in 2019/11).
  • MUStARD: Collected from TV series (released in 2019/07).
  • MELD-DA: Dialogue act annotations added to MELD in 2020/07. Derived from the EMOTyDA dataset, which re-annotated the original MELD training set videos without collecting new video data.
  • IEMOCAP-DA: Dialogue act annotations added to IEMOCAP (released in 2020/07). Derived from the EMOTyDA dataset, which re-annotated all original IEMOCAP videos without collecting new video data.
  • MOSI: Collected from YouTube opinion videos (released in 2016/06).
  • IEMOCAP: Collected from scripted improvisational acting (released in 2008/12).
  • Anno-MI: Collected from publicly available YouTube and Vimeo videos (released in 2023/03).

2.3 License

This benchmark uses nine datasets, each of which is employed strictly in accordance with its official license and exclusively for academic research purposes. We fully respect the datasets’ copyright policies, license requirements, and ethical standards. For those datasets whose licenses explicitly permit redistribution, we release the original video data (e.g., MIntRec, MIntRec2.0, MELD, UR-FUNNY-v2, MUStARD, MELD-DA, CH-SIMS v2.0, and Anno-MI. For datasets that restrict video redistribution, users should obtain the videos directly from their official repositories (e.g., MOSI, IEMOCAP and IEMOCAP-DA. In compliance with all relevant licenses, we also provide the original textual data unchanged, together with the specific dataset splits used in our experiments. This approach ensures reproducibility and academic transparency while strictly adhering to copyright obligations and protecting the privacy of individuals featured in the videos.

3. LeaderBoard

3.1 Rank of Zero-shot Inference

RANKModelsACCTYPE
🥇GPT-4o52.60MLLM
🥈Qwen2-VL-72B52.55MLLM
🥉LLaVA-OV-72B52.44MLLM
4LLaVA-Video-72B51.64MLLM
5InternLM2.5-7B50.28LLM
6Qwen2-7B48.45LLM
7Qwen2-VL-7B47.12MLLM
8Llama3-8B44.06LLM
9LLaVA-Video-7B43.32MLLM
10VideoLLaMA2-7B42.82MLLM
11LLaVA-OV-7B40.65MLLM
12Qwen2-1.5B40.61LLM
13MiniCPM-V-2.6-8B37.03MLLM
14Qwen2-0.5B22.14LLM

3.2 Rank of Supervised Fine-tuning (SFT) and Instruction Tuning (IT)

RankModelsACCType
🥇Qwen2-VL-72B (SFT)69.18MLLM
🥈MiniCPM-V-2.6-8B (SFT)68.88MLLM
🥉LLaVA-Video-72B (IT)68.87MLLM
4LLaVA-ov-72B (SFT)68.67MLLM
5Qwen2-VL-72B (IT)68.64MLLM
6LLaVA-Video-72B (SFT)68.44MLLM
7VideoLLaMA2-7B (SFT)68.30MLLM
8Qwen2-VL-7B (SFT)67.60MLLM
9LLaVA-ov-7B (SFT)67.54MLLM
10LLaVA-Video-7B (SFT)67.47MLLM
11Qwen2-VL-7B (IT)67.34MLLM
12MiniCPM-V-2.6-8B (IT)67.25MLLM
13Llama-3-8B (SFT)66.18LLM
14Qwen2-7B (SFT)66.15LLM
15Internlm-2.5-7B (SFT)65.72LLM
16Qwen-2-7B (IT)64.58LLM
17Internlm-2.5-7B (IT)64.41LLM
18Llama-3-8B (IT)64.16LLM
19Qwen2-1.5B (SFT)64.00LLM
20Qwen2-0.5B (SFT)62.80LLM

4. Data Integrity

All files included in the MMLA benchmark are verified using SHA-256 checksums. Please ensure the integrity of the files using the following checksums:

File PathSHA256 Hash
/MMLA-Datasets/AnnoMi-client/test.tsvd555c7131bc54cb61424d421c7a3ec117fa5587c1d4027dd8501321a5d1abc09
/MMLA-Datasets/AnnoMi-client/dev.tsv4695dc4e1c360cac53ecd0386b82d10fdda9414ad1d559c0a9491a8981657acd
/MMLA-Datasets/AnnoMi-client/train.tsv8e1104e7d4e42952d0e615c22ee7ea08c03d9b7d07807ba6f4fd4b41d08fed89
/MMLA-Datasets/AnnoMi-client/AnnoMI-client_video.tar.gz597d9b8c1a701a89c3f6b18e4a451c21b6699a670a83225b7bce5212f5abdfe0
/MMLA-Datasets/AnnoMi-therapist/dev.tsvbde3ae0e4f16e2249ac94245802b1e5053df3c9d4864f8a889347fe492364767
/MMLA-Datasets/AnnoMi-therapist/test.tsv0ef6ceeba7dfff9f3201b263aecdb6636b6dd39c5eec220c91a328b5dd23e9d5
/MMLA-Datasets/AnnoMi-therapist/train.tsvfd0a4741bd3fb32014318f0bd0fbc464a87a9e267163fcac9618707fedca12b2
/MMLA-Datasets/AnnoMi-therapist/AnnoMi-therapist_video.tar.gz767ce57ad55078001cdd616d642f78d3b0433d9ebcbc14db1608408a54c9fa10
/MMLA-Datasets/CH-SIMSv2.0/test.tsv40afae5245b1060e8bb5162e8cc4f17f294a43b51a9e01e5bbd64d1f5ebcb6d7
/MMLA-Datasets/CH-SIMSv2.0/dev.tsv47dfac9ca8d77868ed644b8cd9536fa403f9d6f81e26796cd882e39d2cc14608
/MMLA-Datasets/CH-SIMSv2.0/train.tsv96350a9e35d62dc63035256e09f033f84aa670f6bf1c06e38daef85d39bde7d7
/MMLA-Datasets/CH-SIMSv2.0/Ch-simsv2_video.tar.gze2817c4841a74f9e73eed6cf3196442ff0245f999bdfc5f975dcf18e66348f1e
/MMLA-Datasets/IEMOCAP-DA/dev.tsv67d357fee50c9b009f9cdc81738e1f45562e0a7f193f6f100320e1881d2b2c8c
/MMLA-Datasets/IEMOCAP-DA/test.tsv050d27887bec3714f8f0c323594c3c287fa9a5c006f94de0fa09565ba0251773
/MMLA-Datasets/IEMOCAP-DA/train.tsv823b37fa045aa6aad694d94ad134e23b92491cd6c5d742ed6e9d9456b433608b
/MMLA-Datasets/IEMOCAP/dev.tsvb6b0bbe1f49dc1f20c4121ac8f943b2d85722c95bb0988946282a496c0c1094d
/MMLA-Datasets/IEMOCAP/test.tsv7ab10d9c126e037e8c6be1ddf6487d57e9132b2e238286a6a9cccce029760581
/MMLA-Datasets/IEMOCAP/train.tsva0017547086721147ed1191e8b7d5da42f795c4070687cffcff001d8827b81d8
/MMLA-Datasets/MELD-DA/test.tsvb25f4396f30a8d591224ec8074cc4ebfd5727f22fa816ab46cdb455dc22ee854
/MMLA-Datasets/MELD-DA/dev.tsv4fcc28d139ac933df8e8a288f2d17e010d5e013c70722485a834a7b843536351
/MMLA-Datasets/MELD-DA/train.tsv045642a0abaa9d9d9ea5f7ade96a09dd856311c9a375dea1839616688240ec71
/MMLA-Datasets/MELD-DA/MELD-DA_video.tar.gz92154bb5d2cf9d8dc229d5fe7ce65519ee7525487f4f42ca7acdf79e48c69707
/MMLA-Datasets/MELD/dev.tsvce677f8162ce901e0cc26f531f1786620cac40b7507fa34664537dadc407d256
/MMLA-Datasets/MELD/test.tsvee0e0a35a8ae73b522f359039cea34e92d0e13283f5f01c4f29795b439a92a69
/MMLA-Datasets/MELD/train.tsv063ac8accce2e0da3b45e9cdb077c5374a4cf08f6d62db41438e6e0c52981287
/MMLA-Datasets/MELD/MELD_video.tar.gz6ce66e5e0d3054aeaf2f5857106360f3b94c37e099bf2e2b17bc1304ef79361b
/MMLA-Datasets/MIntRec/dev.tsv629ab568ec3e1343c83d76b43d7398f7580361370d09162065a6bb1883f2fe9a
/MMLA-Datasets/MIntRec/test.tsvadffdc8f061878ad560ee0e0046ba32e6bc9e0332d9e09094cfce0b755fcc2a9
/MMLA-Datasets/MIntRec/train.tsvc1bec2ff06712063c7399264d7c06f4cdc125084314e6fa8bdfd94d3f0b42332
/MMLA-Datasets/MIntRec/MIntRec_video.tar.gza756b6ad5f851773b3ae4621e3aa5c33a662bde80b239a6815a8541c30fc6411
/MMLA-Datasets/MIntRec2.0/dev.tsvf2f69111d0bd8c26681db0a613a0112f466c667d56a79949ce17ccadd1e6ae37
/MMLA-Datasets/MIntRec2.0/test.tsv6aa650afbaf40256afdbb546a9f7253511f3fe8d791a9acc7b6829824455a6ed
/MMLA-Datasets/MIntRec2.0/train.tsve8b8767bd9a4de5833475db2438e63390c9674041a7b8ea39183a74fa4b624ef
/MMLA-Datasets/MIntRec2.0/MIntRec2.0_video.tar.gz78bd9ab4a0f9e5768ed2a094524165ecc51926e210a4701a9548d036a68d5e29
/MMLA-Datasets/MOSI/dev.tsvbd8ccded8dacb9cb7d37743f54c7e4c7bef391069b67b55c7e0cf4626fadee5f
/MMLA-Datasets/MOSI/test.tsvc480fc2cb444d215e5ba3433452db546fd8e638d332ee0f03278158b69375eca
/MMLA-Datasets/MOSI/train.tsvf1afe6018ae0b0ab8833da6934c0847f480412ed11c9c22e204a01e8cf75971b
/MMLA-Datasets/MUStARD/MUStARD_video.tar.gz8bd863c7ab4c29a710aa3edc0f560361275830a1e98ec41908d51c43e08647c1
/MMLA-Datasets/MUStARD/dev.tsv45477e0bda84c3d45ff197734b3943fc30e9f89c0d0cb8c272f0c10d31ee5474
/MMLA-Datasets/MUStARD/test.tsvae248884d42d690700b6ce9930bb12827cd0fbcae200c43aace5a90003ad99e5
/MMLA-Datasets/MUStARD/train.tsv4292e07a087978a08552268b6c8405d897ee855af495e7e58ee99863e705eb43
/MMLA-Datasets/UR-FUNNY-v2/dev.tsva82f758ef5d2a65bc41e09e24a616d4654c1565e851cd42c71a575b09282a2d2
/MMLA-Datasets/UR-FUNNY-v2/test.tsv6cb9dee9fd55545f46cd079ecb7541981d4c19a76c0ce79d7d874fe73703b63a
/MMLA-Datasets/UR-FUNNY-v2/train.tsv8eb91657faa19a2d53cc930c810d2fa3abd8e365c49d27fa6feb68cd95f40fb4
/MMLA-Datasets/UR-FUNNY-v2/UR-FUNNYv2_video.tar.gze5a3962985c8ead5f593db69ab77a9d6702895768bb5871fe8764406358f8cae

5. Acknowledgements

For more details, please refer to our Github repo. If our work is helpful to your research, please consider citing the following paper:

@article{zhang2025mmla,
  author={Zhang, Hanlei and Li, Zhuohang and Zhu, Yeshuang and Xu, Hua and Wang, Peiwu and Zhu, Haige and Zhou, Jie and Zhang, Jinchao},
  title={Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark},
  year={2025},
  journal={arXiv preprint arXiv:2504.16427},
}