Multilingual benchmark datasets

11 repos

Translated and localized versions of the MMLU (Massive Multitask Language Understanding) benchmark across multiple languages including French, Chinese, Hindi, Italian, German, and Korean. These repositories provide standardized evaluation datasets for assessing large language models' knowledge and reasoning capabilities in non-English languages, supporting research in multilingual AI and cross-lingual transfer learning.