Demo for phasefield-audio/Irodori-TTS-v4.1-Anime, a ~766M-parameter Japanese text-to-speech model fine-tuned from Aratako/Irodori-TTS-v4.1-Small on anime-style speech data.
The architecture is a Rectified Flow Diffusion Transformer (RF-DiT) that generates continuous Semantic-DACVAE-Japanese-32dim latents, decoded to 48 kHz audio.
Irodori-TTS-v4.1-Small.Model by phasefield-audio.
Inference code (irodori_tts/) vendored from
Aratako/Irodori-TTS (MIT).
MIT, subject to the base model's ethical restrictions regarding impersonation and misinformation.
4 commits
Demo for phasefield-audio/Irodori-TTS-v4.1-Anime, a ~766M-parameter Japanese text-to-speech model fine-tuned from Aratako/Irodori-TTS-v4.1-Small on anime-style speech data.
The architecture is a Rectified Flow Diffusion Transformer (RF-DiT) that generates continuous Semantic-DACVAE-Japanese-32dim latents, decoded to 48 kHz audio.
Irodori-TTS-v4.1-Small.Model by phasefield-audio.
Inference code (irodori_tts/) vendored from
Aratako/Irodori-TTS (MIT).
MIT, subject to the base model's ethical restrictions regarding impersonation and misinformation.
4 commits