Kazakh text generation model fine-tuned from google/mt5-base.
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
model_name = "Darmm/darmm-text-generation-kazakh"
model = AutoModelForSeq2SeqLM.from_pretrained(model_name)
text = "Жауап бер: Кешкі Алматы туралы шағын әңгіме жаз."
inputs = AutoTokenizer.from_pretrained(model_name)(text, return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=128)
print(AutoTokenizer.from_pretrained(model_name).decode(outputs[0], skip_special_tokens=True))
Kazakh text generation model fine-tuned from google/mt5-base on the Darmm/darmm-text-generation-kazakh dataset.
google/mt5-base{
"eval_loss": 0.08725570142269135,
"eval_exact_match": 0.5547445255474452,
"eval_rouge1": 0.10948905109489052,
"eval_rouge2": 0.10583941605839416,
"eval_rougeL": 0.10948905109489052,
"epoch": 3.0
}
We present a new open-source dataset and a fine-tuned mT5 model designed for Kazakh text generation tasks. The dataset, Darmm/darmm-text-generation-kazakh, consists of 5,488 prompt-completion pairs covering 15 diverse domains, including Education, Technology, and Health. Our model, based on google/mt5-base, achieves an Exact Match score of 55.47% and a Validation Loss of 0.087, establishing a strong baseline for monolingual Kazakh generative tasks. All resources, including the dataset, model, and training scripts, are publicly available to foster further research in low-resource language processing.
Kazakh, a Turkic language spoken by millions, remains a low-resource language in the field of Natural Language Processing (NLP). While multilingual models like mBERT and mT5 support Kazakh, their performance on specific generative tasks can be limited without targeted fine-tuning data. This project addresses this gap by providing a high-quality, curated dataset and a specialized model for Kazakh text generation, specifically focusing on instruction following and informational responses.
The dataset comprises 5,488 pairs of prompts and completions. Each entry includes:
The dataset spans 15 distinct domains to ensure lexical diversity:
To expand the dataset size and variety, we employed a template-based synthetic data generation strategy.
The data pipeline ensures quality through:
We utilize google/mt5-base, a multilingual variant of the T5 (Text-to-Text Transfer Transformer) model. T5 treats every NLP problem as a text generation task, making it highly suitable for our prompt-completion objective.
The model was fine-tuned using the Hugging Face Transformers library with the following hyperparameters:
Training was conducted on a standard GPU setup. We evaluated the model's performance on the held-out validation set after 3 epochs.
We report the following metrics:
The high Exact Match score indicates that the model frequently produces the precise expected output, which is promising for instruction-following tasks where specific formats or answers are required. The ROUGE scores reflect the overlap in generated text, typical for short, structured responses.
The model and dataset are available on Hugging Face.
Darmm/darmm-text-generation-kazakhDarmm/mt5-base-kazakh-generation (example path)from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
tokenizer = AutoTokenizer.from_pretrained("Darmm/mt5-base-kazakh-generation")
model = AutoModelForSeq2SeqLM.from_pretrained("Darmm/mt5-base-kazakh-generation")
input_text = "Жауап бер: Қазақстанның астанасы қай қала?"
input_ids = tokenizer(input_text, return_tensors="pt").input_ids
outputs = model.generate(input_ids, max_length=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
This work contributes a foundational dataset and model for Kazakh text generation. Future work will focus on expanding the dataset size with more organic (human-written) text, increasing domain diversity, and experimenting with larger model architectures.
If you use this dataset or model, please cite:
@misc{darmm2026kazakh,
author = {Darmm Lab},
title = {Darmm Text Generation Kazakh},
year = {2026},
publisher = {Hugging Face},
journal = {Hugging Face Repository},
howpublished = {\url{https://huggingface.co/datasets/Darmm/darmm-text-generation-kazakh}}
}
Біз қазақ тіліндегі мәтінді генерациялау тапсырмаларына арналған жаңа ашық деректер жиынтығын және арнайы оқытылған mT5 моделін ұсынамыз. Darmm/darmm-text-generation-kazakh деректер жиынтығы 15 түрлі доменді (соның ішінде Білім беру, Технология және Денсаулық) қамтитын 5 488 "сұрау-жауап" жұбынан тұрады. google/mt5-base негізіндегі біздің моделіміз 55,47% Exact Match көрсеткішіне және 0,087 Validation Loss мәніне қол жеткізіп, қазақ тіліндегі генеративті тапсырмалар үшін сенімді базалық деңгейді қалыптастырады. Деректер жиынтығын, модельді және оқыту скрипттерін қоса алғанда, барлық ресурстар аз зерттелген тілдерді өңдеу саласындағы зерттеулерді дамыту үшін көпшілікке қолжетімді.
Миллиондаған адам сөйлейтін қазақ тілі табиғи тілді өңдеу (NLP) саласында әлі де ресурстары аз тіл болып қалуда. mBERT және mT5 сияқты көптілді модельдер қазақ тілін қолдағанымен, арнайы оқыту деректерінсіз нақты генеративті тапсырмаларда олардың тиімділігі шектеулі болуы мүмкін. Бұл жоба қазақ тілінде мәтін генерациялау үшін сапалы, сұрыпталған деректер жиынтығын және мамандандырылған модельді ұсыну арқылы осы олқылықтың орнын толтырады, әсіресе нұсқауларды орындау және ақпараттық жауаптарға назар аударады.
Деректер жиынтығы 5 488 сұрау және жауап жұбын қамтиды. Әрбір жазба мыналарды қамтиды:
Деректер жиынтығы лексикалық әртүрлілікті қамтамасыз ету үшін 15 түрлі доменді қамтиды:
Деректер жиынтығының көлемі мен әртүрлілігін арттыру үшін біз шаблонға негізделген синтетикалық деректерді генерациялау стратегиясын қолдандық.
Деректерді өңдеу процесі сапаны келесі жолдармен қамтамасыз етеді:
Біз T5 (Text-to-Text Transfer Transformer) моделінің көптілді нұсқасы болып табылатын google/mt5-base қолданамыз. T5 кез келген NLP есебін мәтінді генерациялау тапсырмасы ретінде қарастырады, бұл біздің мақсатымызға өте қолайлы.
Модель Hugging Face Transformers кітапханасын қолдану арқылы келесі гиперпараметрлермен оқытылды:
Оқыту стандартты GPU құрылғысында жүргізілді. Біз модельдің өнімділігін 3 эпохадан кейін валидация жиынтығында бағаладық.
Біз келесі метрикаларды ұсынамыз:
Жоғары Exact Match көрсеткіші модельдің күтілетін нәтижені жиі дәл қайталайтынын көрсетеді, бұл нақты форматтар немесе жауаптар қажет болатын нұсқауларды орындау тапсырмалары үшін үлкен жетістік. ROUGE көрсеткіштері генерацияланған мәтіннің ұқсастығын көрсетеді, бұл қысқа, құрылымдалған жауаптарға тән.
Модель мен деректер жиынтығы Hugging Face платформасында қолжетімді.
Darmm/darmm-text-generation-kazakhDarmm/mt5-base-kazakh-generation (мысал жолы)from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
tokenizer = AutoTokenizer.from_pretrained("Darmm/mt5-base-kazakh-generation")
model = AutoModelForSeq2SeqLM.from_pretrained("Darmm/mt5-base-kazakh-generation")
input_text = "Жауап бер: Қазақстанның астанасы қай қала?"
input_ids = tokenizer(input_text, return_tensors="pt").input_ids
outputs = model.generate(input_ids, max_length=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Бұл жұмыс қазақ тіліндегі мәтінді генерациялауға арналған іргелі деректер жиынтығы мен модельді ұсынады. Болашақ жұмыстар деректер жиынтығының көлемін табиғи (адам жазған) мәтіндермен ұлғайтуға, домендердің әртүрлілігін кеңейтуге және үлкенірек модель архитектураларымен тәжірибе жасауға бағытталатын болады.
Егер сіз осы деректер жиынтығын немесе модельді қолдансаңыз, келесідей сілтеме жасауыңызды сұраймыз:
@misc{darmm2026kazakh,
author = {Darmm Lab},
title = {Darmm Text Generation Kazakh},
year = {2026},
publisher = {Hugging Face},
journal = {Hugging Face Repository},
howpublished = {\url{https://huggingface.co/datasets/Darmm/darmm-text-generation-kazakh}}
}
Мы представляем новый открытый набор данных и дообученную модель mT5 для задач генерации текста на казахском языке. Набор данных Darmm/darmm-text-generation-kazakh состоит из 5 488 пар «промпт-завершение», охватывающих 15 различных доменов, включая Образование, Технологии и Здоровье. Наша модель, основанная на google/mt5-base, достигает показателя Exact Match 55,47% и Validation Loss 0,087, устанавливая надежный базовый уровень для задач генерации на казахском языке. Все ресурсы, включая набор данных, модель и скрипты обучения, находятся в открытом доступе для содействия дальнейшим исследованиям в области обработки малоресурсных языков.
Казахский язык, на котором говорят миллионы людей, остается малоресурсным языком в области обработки естественного языка (NLP). Хотя мультиязычные модели, такие как mBERT и mT5, поддерживают казахский язык, их производительность в конкретных генеративных задачах может быть ограничена без целевых данных для дообучения. Этот проект восполняет этот пробел, предоставляя качественный, курируемый набор данных и специализированную модель для генерации казахского текста, уделяя особое внимание следованию инструкциям и информационным ответам.
Набор данных включает 5 488 пар промптов и завершений. Каждая запись содержит:
Набор данных охватывает 15 различных доменов для обеспечения лексического разнообразия:
Для увеличения объема и разнообразия набора данных мы использовали стратегию генерации синтетических данных на основе шаблонов.
Конвейер обработки данных обеспечивает качество за счет:
Мы используем google/mt5-base, мультиязычный вариант модели T5 (Text-to-Text Transfer Transformer). T5 рассматривает любую задачу NLP как задачу генерации текста, что делает ее идеально подходящей для нашей цели.
Модель была дообучена с использованием библиотеки Hugging Face Transformers со следующими гиперпараметрами:
Обучение проводилось на стандартном оборудовании с GPU. Мы оценивали производительность модели на отложенной валидационной выборке после 3 эпох.
Мы приводим следующие метрики:
Высокий показатель Exact Match указывает на то, что модель часто выдает точно ожидаемый результат, что многообещающе для задач следования инструкциям, где требуются конкретные форматы или ответы. Оценки ROUGE отражают перекрытие в сгенерированном тексте, что типично для коротких структурированных ответов.
Модель и набор данных доступны на Hugging Face.
Darmm/darmm-text-generation-kazakhDarmm/mt5-base-kazakh-generation (пример пути)from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
tokenizer = AutoTokenizer.from_pretrained("Darmm/mt5-base-kazakh-generation")
model = AutoModelForSeq2SeqLM.from_pretrained("Darmm/mt5-base-kazakh-generation")
input_text = "Жауап бер: Қазақстанның астанасы қай қала?"
input_ids = tokenizer(input_text, return_tensors="pt").input_ids
outputs = model.generate(input_ids, max_length=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Эта работа вносит вклад в виде фундаментального набора данных и модели для генерации текста на казахском языке. Дальнейшая работа будет сосредоточена на увеличении объема набора данных за счет более органичного (написанного человеком) текста, расширении разнообразия доменов и экспериментах с более крупными архитектурами моделей.
Если вы используете этот набор данных или модель, пожалуйста, цитируйте:
@misc{darmm2026kazakh,
author = {Darmm Lab},
title = {Darmm Text Generation Kazakh},
year = {2026},
publisher = {Hugging Face},
journal = {Hugging Face Repository},
howpublished = {\url{https://huggingface.co/datasets/Darmm/darmm-text-generation-kazakh}}
}
Kazakh text generation model fine-tuned from google/mt5-base.
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
model_name = "Darmm/darmm-text-generation-kazakh"
model = AutoModelForSeq2SeqLM.from_pretrained(model_name)
text = "Жауап бер: Кешкі Алматы туралы шағын әңгіме жаз."
inputs = AutoTokenizer.from_pretrained(model_name)(text, return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=128)
print(AutoTokenizer.from_pretrained(model_name).decode(outputs[0], skip_special_tokens=True))
Kazakh text generation model fine-tuned from google/mt5-base on the Darmm/darmm-text-generation-kazakh dataset.
google/mt5-base{
"eval_loss": 0.08725570142269135,
"eval_exact_match": 0.5547445255474452,
"eval_rouge1": 0.10948905109489052,
"eval_rouge2": 0.10583941605839416,
"eval_rougeL": 0.10948905109489052,
"epoch": 3.0
}
We present a new open-source dataset and a fine-tuned mT5 model designed for Kazakh text generation tasks. The dataset, Darmm/darmm-text-generation-kazakh, consists of 5,488 prompt-completion pairs covering 15 diverse domains, including Education, Technology, and Health. Our model, based on google/mt5-base, achieves an Exact Match score of 55.47% and a Validation Loss of 0.087, establishing a strong baseline for monolingual Kazakh generative tasks. All resources, including the dataset, model, and training scripts, are publicly available to foster further research in low-resource language processing.
Kazakh, a Turkic language spoken by millions, remains a low-resource language in the field of Natural Language Processing (NLP). While multilingual models like mBERT and mT5 support Kazakh, their performance on specific generative tasks can be limited without targeted fine-tuning data. This project addresses this gap by providing a high-quality, curated dataset and a specialized model for Kazakh text generation, specifically focusing on instruction following and informational responses.
The dataset comprises 5,488 pairs of prompts and completions. Each entry includes:
The dataset spans 15 distinct domains to ensure lexical diversity:
To expand the dataset size and variety, we employed a template-based synthetic data generation strategy.
The data pipeline ensures quality through:
We utilize google/mt5-base, a multilingual variant of the T5 (Text-to-Text Transfer Transformer) model. T5 treats every NLP problem as a text generation task, making it highly suitable for our prompt-completion objective.
The model was fine-tuned using the Hugging Face Transformers library with the following hyperparameters:
Training was conducted on a standard GPU setup. We evaluated the model's performance on the held-out validation set after 3 epochs.
We report the following metrics:
The high Exact Match score indicates that the model frequently produces the precise expected output, which is promising for instruction-following tasks where specific formats or answers are required. The ROUGE scores reflect the overlap in generated text, typical for short, structured responses.
The model and dataset are available on Hugging Face.
Darmm/darmm-text-generation-kazakhDarmm/mt5-base-kazakh-generation (example path)from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
tokenizer = AutoTokenizer.from_pretrained("Darmm/mt5-base-kazakh-generation")
model = AutoModelForSeq2SeqLM.from_pretrained("Darmm/mt5-base-kazakh-generation")
input_text = "Жауап бер: Қазақстанның астанасы қай қала?"
input_ids = tokenizer(input_text, return_tensors="pt").input_ids
outputs = model.generate(input_ids, max_length=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
This work contributes a foundational dataset and model for Kazakh text generation. Future work will focus on expanding the dataset size with more organic (human-written) text, increasing domain diversity, and experimenting with larger model architectures.
If you use this dataset or model, please cite:
@misc{darmm2026kazakh,
author = {Darmm Lab},
title = {Darmm Text Generation Kazakh},
year = {2026},
publisher = {Hugging Face},
journal = {Hugging Face Repository},
howpublished = {\url{https://huggingface.co/datasets/Darmm/darmm-text-generation-kazakh}}
}
Біз қазақ тіліндегі мәтінді генерациялау тапсырмаларына арналған жаңа ашық деректер жиынтығын және арнайы оқытылған mT5 моделін ұсынамыз. Darmm/darmm-text-generation-kazakh деректер жиынтығы 15 түрлі доменді (соның ішінде Білім беру, Технология және Денсаулық) қамтитын 5 488 "сұрау-жауап" жұбынан тұрады. google/mt5-base негізіндегі біздің моделіміз 55,47% Exact Match көрсеткішіне және 0,087 Validation Loss мәніне қол жеткізіп, қазақ тіліндегі генеративті тапсырмалар үшін сенімді базалық деңгейді қалыптастырады. Деректер жиынтығын, модельді және оқыту скрипттерін қоса алғанда, барлық ресурстар аз зерттелген тілдерді өңдеу саласындағы зерттеулерді дамыту үшін көпшілікке қолжетімді.
Миллиондаған адам сөйлейтін қазақ тілі табиғи тілді өңдеу (NLP) саласында әлі де ресурстары аз тіл болып қалуда. mBERT және mT5 сияқты көптілді модельдер қазақ тілін қолдағанымен, арнайы оқыту деректерінсіз нақты генеративті тапсырмаларда олардың тиімділігі шектеулі болуы мүмкін. Бұл жоба қазақ тілінде мәтін генерациялау үшін сапалы, сұрыпталған деректер жиынтығын және мамандандырылған модельді ұсыну арқылы осы олқылықтың орнын толтырады, әсіресе нұсқауларды орындау және ақпараттық жауаптарға назар аударады.
Деректер жиынтығы 5 488 сұрау және жауап жұбын қамтиды. Әрбір жазба мыналарды қамтиды:
Деректер жиынтығы лексикалық әртүрлілікті қамтамасыз ету үшін 15 түрлі доменді қамтиды:
Деректер жиынтығының көлемі мен әртүрлілігін арттыру үшін біз шаблонға негізделген синтетикалық деректерді генерациялау стратегиясын қолдандық.
Деректерді өңдеу процесі сапаны келесі жолдармен қамтамасыз етеді:
Біз T5 (Text-to-Text Transfer Transformer) моделінің көптілді нұсқасы болып табылатын google/mt5-base қолданамыз. T5 кез келген NLP есебін мәтінді генерациялау тапсырмасы ретінде қарастырады, бұл біздің мақсатымызға өте қолайлы.
Модель Hugging Face Transformers кітапханасын қолдану арқылы келесі гиперпараметрлермен оқытылды:
Оқыту стандартты GPU құрылғысында жүргізілді. Біз модельдің өнімділігін 3 эпохадан кейін валидация жиынтығында бағаладық.
Біз келесі метрикаларды ұсынамыз:
Жоғары Exact Match көрсеткіші модельдің күтілетін нәтижені жиі дәл қайталайтынын көрсетеді, бұл нақты форматтар немесе жауаптар қажет болатын нұсқауларды орындау тапсырмалары үшін үлкен жетістік. ROUGE көрсеткіштері генерацияланған мәтіннің ұқсастығын көрсетеді, бұл қысқа, құрылымдалған жауаптарға тән.
Модель мен деректер жиынтығы Hugging Face платформасында қолжетімді.
Darmm/darmm-text-generation-kazakhDarmm/mt5-base-kazakh-generation (мысал жолы)from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
tokenizer = AutoTokenizer.from_pretrained("Darmm/mt5-base-kazakh-generation")
model = AutoModelForSeq2SeqLM.from_pretrained("Darmm/mt5-base-kazakh-generation")
input_text = "Жауап бер: Қазақстанның астанасы қай қала?"
input_ids = tokenizer(input_text, return_tensors="pt").input_ids
outputs = model.generate(input_ids, max_length=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Бұл жұмыс қазақ тіліндегі мәтінді генерациялауға арналған іргелі деректер жиынтығы мен модельді ұсынады. Болашақ жұмыстар деректер жиынтығының көлемін табиғи (адам жазған) мәтіндермен ұлғайтуға, домендердің әртүрлілігін кеңейтуге және үлкенірек модель архитектураларымен тәжірибе жасауға бағытталатын болады.
Егер сіз осы деректер жиынтығын немесе модельді қолдансаңыз, келесідей сілтеме жасауыңызды сұраймыз:
@misc{darmm2026kazakh,
author = {Darmm Lab},
title = {Darmm Text Generation Kazakh},
year = {2026},
publisher = {Hugging Face},
journal = {Hugging Face Repository},
howpublished = {\url{https://huggingface.co/datasets/Darmm/darmm-text-generation-kazakh}}
}
Мы представляем новый открытый набор данных и дообученную модель mT5 для задач генерации текста на казахском языке. Набор данных Darmm/darmm-text-generation-kazakh состоит из 5 488 пар «промпт-завершение», охватывающих 15 различных доменов, включая Образование, Технологии и Здоровье. Наша модель, основанная на google/mt5-base, достигает показателя Exact Match 55,47% и Validation Loss 0,087, устанавливая надежный базовый уровень для задач генерации на казахском языке. Все ресурсы, включая набор данных, модель и скрипты обучения, находятся в открытом доступе для содействия дальнейшим исследованиям в области обработки малоресурсных языков.
Казахский язык, на котором говорят миллионы людей, остается малоресурсным языком в области обработки естественного языка (NLP). Хотя мультиязычные модели, такие как mBERT и mT5, поддерживают казахский язык, их производительность в конкретных генеративных задачах может быть ограничена без целевых данных для дообучения. Этот проект восполняет этот пробел, предоставляя качественный, курируемый набор данных и специализированную модель для генерации казахского текста, уделяя особое внимание следованию инструкциям и информационным ответам.
Набор данных включает 5 488 пар промптов и завершений. Каждая запись содержит:
Набор данных охватывает 15 различных доменов для обеспечения лексического разнообразия:
Для увеличения объема и разнообразия набора данных мы использовали стратегию генерации синтетических данных на основе шаблонов.
Конвейер обработки данных обеспечивает качество за счет:
Мы используем google/mt5-base, мультиязычный вариант модели T5 (Text-to-Text Transfer Transformer). T5 рассматривает любую задачу NLP как задачу генерации текста, что делает ее идеально подходящей для нашей цели.
Модель была дообучена с использованием библиотеки Hugging Face Transformers со следующими гиперпараметрами:
Обучение проводилось на стандартном оборудовании с GPU. Мы оценивали производительность модели на отложенной валидационной выборке после 3 эпох.
Мы приводим следующие метрики:
Высокий показатель Exact Match указывает на то, что модель часто выдает точно ожидаемый результат, что многообещающе для задач следования инструкциям, где требуются конкретные форматы или ответы. Оценки ROUGE отражают перекрытие в сгенерированном тексте, что типично для коротких структурированных ответов.
Модель и набор данных доступны на Hugging Face.
Darmm/darmm-text-generation-kazakhDarmm/mt5-base-kazakh-generation (пример пути)from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
tokenizer = AutoTokenizer.from_pretrained("Darmm/mt5-base-kazakh-generation")
model = AutoModelForSeq2SeqLM.from_pretrained("Darmm/mt5-base-kazakh-generation")
input_text = "Жауап бер: Қазақстанның астанасы қай қала?"
input_ids = tokenizer(input_text, return_tensors="pt").input_ids
outputs = model.generate(input_ids, max_length=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Эта работа вносит вклад в виде фундаментального набора данных и модели для генерации текста на казахском языке. Дальнейшая работа будет сосредоточена на увеличении объема набора данных за счет более органичного (написанного человеком) текста, расширении разнообразия доменов и экспериментах с более крупными архитектурами моделей.
Если вы используете этот набор данных или модель, пожалуйста, цитируйте:
@misc{darmm2026kazakh,
author = {Darmm Lab},
title = {Darmm Text Generation Kazakh},
year = {2026},
publisher = {Hugging Face},
journal = {Hugging Face Repository},
howpublished = {\url{https://huggingface.co/datasets/Darmm/darmm-text-generation-kazakh}}
}