๐ผ WikiMT-X: Multimodal Music Benchmark Dataset
3
25 commits
1 linked in READMEs
updated Feb 25, 2025
WikiMT-X (WikiMusicText-eXtended) is the first multimodal MIR benchmark dataset that combines text, sheet music, and audio recordings with 1,000 carefully curated triplets, primarily from 20th-century Western music. It is designed to evaluate text-to-music generation, music captioning, music information retrieval (MIR), and music classification across multiple modalities, providing a rich and diverse resource for advancing music AI research. ๐
The original WikiMT dataset had several limitations:
โ Limited text diversity โ Text came from Wikipedia, mostly background-only, lacking variety.
โ No audio data โ The absence of audio recordings restricted multimodal evaluation.
โ Low-quality genre labels โ Labels were automatically assigned using keyword matching, leading to inaccuracies.
WikiMT-X introduces major enhancements, making it a robust multimodal benchmark:
๐น Rich text annotations โ Using llama-3.1-sonar-large-128k-online (Perplexity AI), we generated diverse textual descriptions from sheet music metadata.
๐น Four distinct textual perspectives:
๐น Aligned sheet music with audio โ We manually matched sheet music with corresponding audio recordings from YouTube and removed duplicates.
๐น Refined genre annotations โ We restructured genre categories and manually re-annotated the dataset for improved accuracy.
WikiMT-X serves as a benchmark for four major multimodal music tasks:
WikiMT-X consists of 1,000 multimodal triplets, making it an ideal benchmark for multimodal MIR research:
โ
Text-to-music generation with structured text conditioning.
โ
Music captioning using diverse textual perspectives.
โ
Cross-modal MIR for retrieval tasks.
โ
Music classification across multiple modalities.
This dataset enables comprehensive evaluation of multimodal music models. ๐๐ถ
If you find WikiMT-X useful in your work, please consider citing our paper:
@misc{wu2025clamp3universalmusic,
title={CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages},
author={Shangda Wu and Zhancheng Guo and Ruibin Yuan and Junyan Jiang and Seungheon Doh and Gus Xia and Juhan Nam and Xiaobing Li and Feng Yu and Maosong Sun},
year={2025},
eprint={2502.10362},
archivePrefix={arXiv},
primaryClass={cs.SD},
url={https://arxiv.org/abs/2502.10362}
}
๐ผ WikiMT-X: Multimodal Music Benchmark Dataset
3
25 commits
1 linked in READMEs
updated Feb 25, 2025
WikiMT-X (WikiMusicText-eXtended) is the first multimodal MIR benchmark dataset that combines text, sheet music, and audio recordings with 1,000 carefully curated triplets, primarily from 20th-century Western music. It is designed to evaluate text-to-music generation, music captioning, music information retrieval (MIR), and music classification across multiple modalities, providing a rich and diverse resource for advancing music AI research. ๐
The original WikiMT dataset had several limitations:
โ Limited text diversity โ Text came from Wikipedia, mostly background-only, lacking variety.
โ No audio data โ The absence of audio recordings restricted multimodal evaluation.
โ Low-quality genre labels โ Labels were automatically assigned using keyword matching, leading to inaccuracies.
WikiMT-X introduces major enhancements, making it a robust multimodal benchmark:
๐น Rich text annotations โ Using llama-3.1-sonar-large-128k-online (Perplexity AI), we generated diverse textual descriptions from sheet music metadata.
๐น Four distinct textual perspectives:
๐น Aligned sheet music with audio โ We manually matched sheet music with corresponding audio recordings from YouTube and removed duplicates.
๐น Refined genre annotations โ We restructured genre categories and manually re-annotated the dataset for improved accuracy.
WikiMT-X serves as a benchmark for four major multimodal music tasks:
WikiMT-X consists of 1,000 multimodal triplets, making it an ideal benchmark for multimodal MIR research:
โ
Text-to-music generation with structured text conditioning.
โ
Music captioning using diverse textual perspectives.
โ
Cross-modal MIR for retrieval tasks.
โ
Music classification across multiple modalities.
This dataset enables comprehensive evaluation of multimodal music models. ๐๐ถ
If you find WikiMT-X useful in your work, please consider citing our paper:
@misc{wu2025clamp3universalmusic,
title={CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages},
author={Shangda Wu and Zhancheng Guo and Ruibin Yuan and Junyan Jiang and Seungheon Doh and Gus Xia and Juhan Nam and Xiaobing Li and Feng Yu and Maosong Sun},
year={2025},
eprint={2502.10362},
archivePrefix={arXiv},
primaryClass={cs.SD},
url={https://arxiv.org/abs/2502.10362}
}