Paper Title: Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)
Website Demo Instructions: https://github.com/jiarui-liu/MultilingualAITerminology
GIST is a large-scale, high-quality multilingual AI terminology dataset developed to support global inclusivity in AI research. It consists of around 5,000 English AI-specific terms, each translated into Arabic, Chinese, French, Japanese, and Russian.
Terms are sourced from award-winning papers across 18 top-tier AI conferences (2000β2023). The dataset was created using a hybrid pipeline that combines:
If you use this dataset, please cite:
@article{liu2024towards,
title={Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset},
author={Liu, Jiarui and Ouzzani, Iman and Li, Wenkai and Zhang, Lechen and Ou, Tianyue and Bouamor, Houda and Jin, Zhijing and Diab, Mona},
journal={arXiv preprint arXiv:2412.18367},
year={2024}
}
8 commits
Paper Title: Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)
Website Demo Instructions: https://github.com/jiarui-liu/MultilingualAITerminology
GIST is a large-scale, high-quality multilingual AI terminology dataset developed to support global inclusivity in AI research. It consists of around 5,000 English AI-specific terms, each translated into Arabic, Chinese, French, Japanese, and Russian.
Terms are sourced from award-winning papers across 18 top-tier AI conferences (2000β2023). The dataset was created using a hybrid pipeline that combines:
If you use this dataset, please cite:
@article{liu2024towards,
title={Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset},
author={Liu, Jiarui and Ouzzani, Iman and Li, Wenkai and Zhang, Lechen and Ou, Tianyue and Bouamor, Houda and Jin, Zhijing and Diab, Mona},
journal={arXiv preprint arXiv:2412.18367},
year={2024}
}
8 commits