11 repos
This cluster focuses on neural models and frameworks for generating audio from text descriptions. The repositories contain implementations of diffusion-based and transformer-based text-to-audio systems, with a strong emphasis on model adaptation, fine-tuning, and inference optimization. Visitors will find research implementations, pre-trained model variants, and endpoints for practical audio generation applications.