Multilingual Speech Recognition Datasets

10 repos

Multilingual and cross-lingual speech recognition datasets and benchmarks for training and evaluating automatic speech recognition (ASR) systems across many languages. The cluster includes foundational datasets like Common Voice and FLEURS alongside robustness benchmarks and evaluation frameworks, reflecting a focus on expanding ASR coverage beyond English and stress-testing models across diverse acoustic conditions, dialects, and languages. These resources are essential infrastructure for building practical speech systems that work reliably across the world's linguistic diversity.

speech-recognition ·464