Text-to-Audio & Audio Generation via Diffusion

14 repos

Generative models and frameworks for synthesizing audio from text descriptions, built primarily on diffusion model architectures. The cluster spans multiple implementations and variations of this core capability—from Stable Audio models to specialized systems like Auffusion and Audio-Omni—with a focus on practical, trainable systems and inference pipelines. Researchers and practitioners exploring this area will find model checkpoints, reference implementations, and diffusion-based audio synthesis techniques.

Python · 7
Jupyter Notebook · 2
text-to-audio ·4,216
diffusion-models ·2,933
audio-generation ·2,852
diffusion ·2,198
large-language-models ·1,828
language-models ·1,238
safetensors ·735
latent-diffusion ·668
latent-space ·668
video-to-audio ·668