English · Türkçe
3,451 hours of 48 kHz Turkish speech in 2,051,810 clips, spoken by 2,752 designed voices plus one-off voices, each clip paired with the written sentence, its spoken form and a plain-English description of the voice. Every clip is AI-generated: no real person's voice is in this dataset.
We made it while building Alania-2, the Turkish text-to-speech model behind speech.patientdesk.ai. Openly licensed Turkish speech for TTS is scarce: the largest sets are a few hundred hours of read or crowd-sourced audio (Common Voice Turkish has about 130 validated hours). We are releasing the part of our synthetic corpus that carries no one else's voice or rights, so others building Turkish voice technology can use it.
| Config | Text | Licence | Clips | Hours |
|---|---|---|---|---|
cc-by (default) | our voice-agent sentences (Alania Turkish Domain Text) and FineWeb-2 Turkish | CC BY 4.0 | 1,671,085 | 2,592 |
cc-by-sa | Turkish Wikipedia | CC BY-SA 4.0 | 380,725 | 859 |
voices | reference clip, transcript and description of each designed voice | CC BY 4.0 | 2,752 voices |
reference (the designed voice reading plainly), reference+instruction (the same
voice following a style instruction such as "Speak like a calm, reassuring nurse, slowly and softly"), and
voice-design (a new voice made from the description alone).text is the sentence as written;
text_spoken is what was read, after our Turkish normaliser wrote numbers and abbreviations out as spoken.audio_channel: the same clip passed through a
simulated room, microphone (headset, lapel, laptop or phone), background noise and level drift, with a caption of
those conditions in English and Turkish. audio is always the clean version.Every clip passed automatic checks; failing clips were removed:
qc_cer);qc_utmos); voice consistency: ECAPA similarity to the voice's reference
(qc_speaker_sim); gender of designed voices checked against their pitch (qc_f0_median);postfilter: resclip) that removes a faint high-frequency "whistle" the generator adds in the
7–12 kHz band.Medians over the release: CER 0.0, UTMOS 3.59.
from datasets import load_dataset
ds = load_dataset("cloud0day3/alania-synthetic-speech-tr", "cc-by", split="train", streaming=True)
row = next(iter(ds))
print(row["text"], row["voice_description"], row["audio"]["sampling_rate"])
cc-by and voices: CC BY 4.0. The FineWeb-2 text is used under
ODC-By 1.0 and remains subject to Common Crawl's terms of use; text_doc_id keeps its source id.cc-by-sa: CC BY-SA 4.0, because it reads Turkish Wikipedia.
text_source_url links every clip to its article; derivatives must keep the same licence.You may use it for any purpose, including commercial use and training models, as long as you credit PatientDesk AI:
Alania Turkish Synthetic Speech by PatientDesk AI (https://huggingface.co/datasets/cloud0day3/alania-synthetic-speech-tr), licensed under CC BY 4.0 / CC BY-SA 4.0.
@misc{patientdesk2026alaniasyntheticspeech,
title = {Alania Turkish Synthetic Speech},
author = {{PatientDesk AI}},
year = {2026},
howpublished = {\url{https://huggingface.co/datasets/cloud0day3/alania-synthetic-speech-tr}},
note = {3,451 h of AI-generated Turkish speech, CC BY 4.0 / CC BY-SA 4.0}
}
English · Türkçe
2.752 tasarlanmış ses ve tek seferlik seslerle okunmuş, 48 kHz, 3.451 saatlik (2.051.810 kayıt) Türkçe konuşma. Her kayıtta yazılı cümle, okunduğu hâli ve sesin sade bir İngilizce tarifi bulunur. Kayıtların tamamı yapay zekâ ile üretilmiştir: veri setinde hiçbir gerçek kişinin sesi yoktur.
Bu veri setini, speech.patientdesk.ai arkasındaki Türkçe metinden sese modelimiz Alania-2'yi geliştirirken hazırladık. Açık lisanslı Türkçe TTS verisi çok az; en büyük setler birkaç yüz saatlik okuma ya da gönüllü kayıtlardan oluşuyor. Sentetik derlemimizin kimsenin sesini ya da hakkını taşımayan kısmını, Türkçe ses teknolojisi geliştiren herkes kullanabilsin diye yayımlıyoruz.
| Yapılandırma | Metin | Lisans | Kayıt | Saat |
|---|---|---|---|---|
cc-by (varsayılan) | sesli asistan cümlelerimiz ve FineWeb-2 Türkçe | CC BY 4.0 | 1.671.085 | 2.592 |
cc-by-sa | Türkçe Vikipedi | CC BY-SA 4.0 | 380.725 | 859 |
voices | her tasarlanmış sesin referans kaydı, metni ve tarifi | CC BY 4.0 | 2.752 ses |
reference (tasarlanmış sesin düz okuması), reference+instruction (aynı sesin
"Sakin, güven veren bir hemşire gibi, yavaş ve yumuşak konuş" gibi bir üslup yönergesine uyması) ve voice-design
(yalnızca tariften yeni bir ses).text yazıldığı hâli,
text_spoken Türkçe normalleştiricimizin sayı ve kısaltmaları söylendiği gibi yazdığı, okunan hâlidir.audio_channel da vardır: aynı kaydın benzetilmiş
bir oda, mikrofon (kulaklık, yaka, dizüstü ya da telefon), arka plan gürültüsü ve seviye dalgalanmasından geçmiş
hâli ve bu koşulların İngilizce ve Türkçe açıklaması. audio her zaman temiz sürümdür.Her kayıt otomatik denetimlerden geçti; geçemeyenler çıkarıldı: Whisper large-v3 (turbo) ile karakter hata oranı en fazla %5 ya da tek düzeltme, UTMOS22 en az 2,5, referans sese ECAPA benzerliği, tasarlanmış seslerde perdeyle cinsiyet denetimi, saniyede 7–25 karakter konuşma hızı ve üreticinin 7–12 kHz bandında eklediği hafif "ıslık" sesini gideren bir son filtre. Ortancalar: CER 0,0, UTMOS 3,59.
cc-by ve voices CC BY 4.0, cc-by-sa ise Türkçe Vikipedi'yi
okuduğu için CC BY-SA 4.0 lisanslıdır; text_source_url her
kaydı maddesine bağlar. FineWeb-2 metni ODC-By 1.0 ile kullanılmıştır ve Common Crawl kullanım koşullarına tabidir.
Ticari kullanım ve model eğitimi dahil her amaçla kullanabilirsiniz; yeter ki PatientDesk AI'a atıf yapın:
Alania Turkish Synthetic Speech, PatientDesk AI (https://huggingface.co/datasets/cloud0day3/alania-synthetic-speech-tr), CC BY 4.0 / CC BY-SA 4.0 lisansıyla.
Üretici model openbmb/VoxCPM2 (Apache-2.0), 32279eff sürümü, Nano-vLLM-VoxCPM ile, 10 difüzyon adımı ve 2,0 yönlendirme katsayısıyla, Eylül 2026. Üretim ayarları ve tohum değerleri her satırda yer alır. Kenar sessizlikleri 0,1 saniyeye kırpıldı, konuşma -20 dBFS'e, tepe seviyesi en fazla -1 dBFS'e ayarlandı.
İletişim: sezgin@patientdesk.ai
English · Türkçe
3,451 hours of 48 kHz Turkish speech in 2,051,810 clips, spoken by 2,752 designed voices plus one-off voices, each clip paired with the written sentence, its spoken form and a plain-English description of the voice. Every clip is AI-generated: no real person's voice is in this dataset.
We made it while building Alania-2, the Turkish text-to-speech model behind speech.patientdesk.ai. Openly licensed Turkish speech for TTS is scarce: the largest sets are a few hundred hours of read or crowd-sourced audio (Common Voice Turkish has about 130 validated hours). We are releasing the part of our synthetic corpus that carries no one else's voice or rights, so others building Turkish voice technology can use it.
| Config | Text | Licence | Clips | Hours |
|---|---|---|---|---|
cc-by (default) | our voice-agent sentences (Alania Turkish Domain Text) and FineWeb-2 Turkish | CC BY 4.0 | 1,671,085 | 2,592 |
cc-by-sa | Turkish Wikipedia | CC BY-SA 4.0 | 380,725 | 859 |
voices | reference clip, transcript and description of each designed voice | CC BY 4.0 | 2,752 voices |
reference (the designed voice reading plainly), reference+instruction (the same
voice following a style instruction such as "Speak like a calm, reassuring nurse, slowly and softly"), and
voice-design (a new voice made from the description alone).text is the sentence as written;
text_spoken is what was read, after our Turkish normaliser wrote numbers and abbreviations out as spoken.audio_channel: the same clip passed through a
simulated room, microphone (headset, lapel, laptop or phone), background noise and level drift, with a caption of
those conditions in English and Turkish. audio is always the clean version.Every clip passed automatic checks; failing clips were removed:
qc_cer);qc_utmos); voice consistency: ECAPA similarity to the voice's reference
(qc_speaker_sim); gender of designed voices checked against their pitch (qc_f0_median);postfilter: resclip) that removes a faint high-frequency "whistle" the generator adds in the
7–12 kHz band.Medians over the release: CER 0.0, UTMOS 3.59.
from datasets import load_dataset
ds = load_dataset("cloud0day3/alania-synthetic-speech-tr", "cc-by", split="train", streaming=True)
row = next(iter(ds))
print(row["text"], row["voice_description"], row["audio"]["sampling_rate"])
cc-by and voices: CC BY 4.0. The FineWeb-2 text is used under
ODC-By 1.0 and remains subject to Common Crawl's terms of use; text_doc_id keeps its source id.cc-by-sa: CC BY-SA 4.0, because it reads Turkish Wikipedia.
text_source_url links every clip to its article; derivatives must keep the same licence.You may use it for any purpose, including commercial use and training models, as long as you credit PatientDesk AI:
Alania Turkish Synthetic Speech by PatientDesk AI (https://huggingface.co/datasets/cloud0day3/alania-synthetic-speech-tr), licensed under CC BY 4.0 / CC BY-SA 4.0.
@misc{patientdesk2026alaniasyntheticspeech,
title = {Alania Turkish Synthetic Speech},
author = {{PatientDesk AI}},
year = {2026},
howpublished = {\url{https://huggingface.co/datasets/cloud0day3/alania-synthetic-speech-tr}},
note = {3,451 h of AI-generated Turkish speech, CC BY 4.0 / CC BY-SA 4.0}
}
English · Türkçe
2.752 tasarlanmış ses ve tek seferlik seslerle okunmuş, 48 kHz, 3.451 saatlik (2.051.810 kayıt) Türkçe konuşma. Her kayıtta yazılı cümle, okunduğu hâli ve sesin sade bir İngilizce tarifi bulunur. Kayıtların tamamı yapay zekâ ile üretilmiştir: veri setinde hiçbir gerçek kişinin sesi yoktur.
Bu veri setini, speech.patientdesk.ai arkasındaki Türkçe metinden sese modelimiz Alania-2'yi geliştirirken hazırladık. Açık lisanslı Türkçe TTS verisi çok az; en büyük setler birkaç yüz saatlik okuma ya da gönüllü kayıtlardan oluşuyor. Sentetik derlemimizin kimsenin sesini ya da hakkını taşımayan kısmını, Türkçe ses teknolojisi geliştiren herkes kullanabilsin diye yayımlıyoruz.
| Yapılandırma | Metin | Lisans | Kayıt | Saat |
|---|---|---|---|---|
cc-by (varsayılan) | sesli asistan cümlelerimiz ve FineWeb-2 Türkçe | CC BY 4.0 | 1.671.085 | 2.592 |
cc-by-sa | Türkçe Vikipedi | CC BY-SA 4.0 | 380.725 | 859 |
voices | her tasarlanmış sesin referans kaydı, metni ve tarifi | CC BY 4.0 | 2.752 ses |
reference (tasarlanmış sesin düz okuması), reference+instruction (aynı sesin
"Sakin, güven veren bir hemşire gibi, yavaş ve yumuşak konuş" gibi bir üslup yönergesine uyması) ve voice-design
(yalnızca tariften yeni bir ses).text yazıldığı hâli,
text_spoken Türkçe normalleştiricimizin sayı ve kısaltmaları söylendiği gibi yazdığı, okunan hâlidir.audio_channel da vardır: aynı kaydın benzetilmiş
bir oda, mikrofon (kulaklık, yaka, dizüstü ya da telefon), arka plan gürültüsü ve seviye dalgalanmasından geçmiş
hâli ve bu koşulların İngilizce ve Türkçe açıklaması. audio her zaman temiz sürümdür.Her kayıt otomatik denetimlerden geçti; geçemeyenler çıkarıldı: Whisper large-v3 (turbo) ile karakter hata oranı en fazla %5 ya da tek düzeltme, UTMOS22 en az 2,5, referans sese ECAPA benzerliği, tasarlanmış seslerde perdeyle cinsiyet denetimi, saniyede 7–25 karakter konuşma hızı ve üreticinin 7–12 kHz bandında eklediği hafif "ıslık" sesini gideren bir son filtre. Ortancalar: CER 0,0, UTMOS 3,59.
cc-by ve voices CC BY 4.0, cc-by-sa ise Türkçe Vikipedi'yi
okuduğu için CC BY-SA 4.0 lisanslıdır; text_source_url her
kaydı maddesine bağlar. FineWeb-2 metni ODC-By 1.0 ile kullanılmıştır ve Common Crawl kullanım koşullarına tabidir.
Ticari kullanım ve model eğitimi dahil her amaçla kullanabilirsiniz; yeter ki PatientDesk AI'a atıf yapın:
Alania Turkish Synthetic Speech, PatientDesk AI (https://huggingface.co/datasets/cloud0day3/alania-synthetic-speech-tr), CC BY 4.0 / CC BY-SA 4.0 lisansıyla.
Üretici model openbmb/VoxCPM2 (Apache-2.0), 32279eff sürümü, Nano-vLLM-VoxCPM ile, 10 difüzyon adımı ve 2,0 yönlendirme katsayısıyla, Eylül 2026. Üretim ayarları ve tohum değerleri her satırda yer alır. Kenar sessizlikleri 0,1 saniyeye kırpıldı, konuşma -20 dBFS'e, tepe seviyesi en fazla -1 dBFS'e ayarlandı.
İletişim: sezgin@patientdesk.ai