12 repos
Localized versions of ShareGPT, a dataset of conversational exchanges typically used for training and fine-tuning language models across different languages and cultural contexts. The cluster centers on Chinese, French, Indonesian, Korean, Arabic, and Japanese variants, representing efforts to create diverse, non-English training data for instruction-following and chat models. Repositories here serve as resources for researchers and practitioners building multilingual AI systems.