Jerry999/multilingual-terminology

Dataset

1

stars

8

commits

1

linked in READMEs

May 31, 2025

updated

ai
multilingual
nlp
scientific-text
terminology
translation

README

πŸ“š GIST: Glossary of Multilingual AI Scientific Terminology

Paper Title: Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)

Website Demo Instructions: https://github.com/jiarui-liu/MultilingualAITerminology

Dataset Summary

GIST is a large-scale, high-quality multilingual AI terminology dataset developed to support global inclusivity in AI research. It consists of around 5,000 English AI-specific terms, each translated into Arabic, Chinese, French, Japanese, and Russian.

Terms are sourced from award-winning papers across 18 top-tier AI conferences (2000–2023). The dataset was created using a hybrid pipeline that combines:

  • LLM-based term extraction and filtering
  • Expert human translation via crowdsourcing
  • GPT-4o-based validation and refinement

Citation

If you use this dataset, please cite:

@article{liu2024towards,
  title={Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset},
  author={Liu, Jiarui and Ouzzani, Iman and Li, Wenkai and Zhang, Lechen and Ou, Tianyue and Bouamor, Houda and Jin, Zhijing and Diab, Mona},
  journal={arXiv preprint arXiv:2412.18367},
  year={2024}
}

Contributors

Jerry999

8 commits

Jerry999/multilingual-terminology

Dataset

1

stars

8

commits

1

linked in READMEs

May 31, 2025

updated

ai
multilingual
nlp
scientific-text
terminology
translation

README

πŸ“š GIST: Glossary of Multilingual AI Scientific Terminology

Paper Title: Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)

Website Demo Instructions: https://github.com/jiarui-liu/MultilingualAITerminology

Dataset Summary

GIST is a large-scale, high-quality multilingual AI terminology dataset developed to support global inclusivity in AI research. It consists of around 5,000 English AI-specific terms, each translated into Arabic, Chinese, French, Japanese, and Russian.

Terms are sourced from award-winning papers across 18 top-tier AI conferences (2000–2023). The dataset was created using a hybrid pipeline that combines:

  • LLM-based term extraction and filtering
  • Expert human translation via crowdsourcing
  • GPT-4o-based validation and refinement

Citation

If you use this dataset, please cite:

@article{liu2024towards,
  title={Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset},
  author={Liu, Jiarui and Ouzzani, Iman and Li, Wenkai and Zhang, Lechen and Ou, Tianyue and Bouamor, Houda and Jin, Zhijing and Diab, Mona},
  journal={arXiv preprint arXiv:2412.18367},
  year={2024}
}

Contributors

Jerry999

8 commits