Curated list for papers, codes and resources related to Text-to-Audio (TTA) Generation
77
20 commits
updated Jul 20, 2026
This is a repository organizing papers, codes and other resources related to Text-to-Audio Generation (TTA), where audio denotes primarily ambient sound or music.
Welcome to PR if you want to add some resources !
Woosh: Sound Effect Generative Models [arXiv 2026] Paper / Code
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction [ICML 2025] Paper
Fugatto 1: Foundational Generative Audio Transformer Opus 1 [ICLR 2025] Paper
AudioX: Diffusion Transformer for Anything-to-Audio Generation [arXiv 2025] Paper
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization [arXiv 2025] Paper / Code
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions [arXiv 2025] Paper
ETTA: Elucidating the Design Space of Text-to-Audio Models [arXiv 2024] Paper
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens [ICASSP 2025] Paper
MambaFoley: Foley Sound Generation using Selective State-Space Models [ICASSP 2025] Paper
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer [arXiv 2024] Paper / Code
GenAU: Taming Data and Transformers for Audio Generation [arXiv 2024] Paper / Code
Stable-Audio 2: Long-form music generation with latent diffusion [arXiv 2024] Paper
Stable Audio 1: Fast Timing-Conditioned Latent Audio Diffusion [ICML 2024] Paper
Masked Audio Generation using a Single Non-Autoregressive Transformer [ICLR 2024] Paper / Code
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond [arXiv 2024] Paper
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation [arXiv 2024] Paper
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining [TASLP 2024] Paper / Code
LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation [Interspeech 2024] Paper / Code
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation [arXiv 2024] Paper / Code
AudioGen: Textually Guided Audio Generation [ICLR 2023] Paper
Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation [arXiv 2023] Paper / Code
Tango: Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model [ACM MM 2023] Paper / Code
Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models [ICML 2023] Paper / Code
AudioLDM: Text-to-Audio Generation with Latent Diffusion Models [ICML 2023] Paper / Code
Diffsound: Discrete Diffusion Model for Text-to-sound Generation [TASLP 2022] Paper / Code
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling [arXiv 2025] Paper
PicoAudio 2: Temporal Controllable Text-to-Audio Generation with Natural Language Description [arXiv 2025] Paper
DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer [arXiv 2025] Paper
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generatio [ACM MM 2025] Paper
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations [ICASSP 2025] Paper
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions [ICASSP 2025] Paper / Code
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation [ICASSP 2025] Paper / Code
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation [arXiv 2024] Paper
RiTTA: Modeling Event Relations in Text-to-Audio Generation [arXiv 2024] Paper
Controllable Text-to-Audio Generation with Training-Free Temporal Guidance Diffusion [ICME 2024] Paper
Audio Generation with Multiple Conditional Diffusion Model [AAAI 2024] Paper / Code
T-FOLEY: A Controllable Waveform-Domain Diffusion Model for Temporal-Event-Guided Foley Sound Synthesis [ICASSP 2024] Paper / Code
Continuous descriptor-based control for deep audio synthesis [ICASSP 2023] / Code
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows [arXiv 2025] Paper
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion [Interspeech 2025] Paper
Stable-Audio-Small: Fast Text-to-Audio Generation with Adversarial Post-Training [arXiv 2025] Paper / Code
SoundCTM: Uniting Score-based and Consistency Models for Text-to-Sound Generation [ICLR 2025] Paper
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation [arXiv 2024] Paper
ConsistencyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency Distillation [Interspeech 2024] Paper / Code
AudioLCM: Text-to-Audio Generation with Latent Consistency Models [ACM MM 2024] Paper / Code
Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models [Interspeech 2026] Paper
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models [Interspeech 2026] Paper
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback [ACL 2025] Paper
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization [arXiv 2025] Paper / Code
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization [ACM MM 2024] Paper / Code
BATON: Aligning Text-to-Audio Model with Human Preference Feedback [IJCAI 2024] Paper / Code
SonicRAG : High Fidelity Sound Effects Synthesis Based on Retrival Augmented Generation [arXiv 2025] Paper
Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation [arXiv 2024] Paper
Retrieval-Augmented Text-to-Audio Generation [ICASSP 2024] Paper
OmniAudio: Generating Spatial Audio from 360-Degree Video [ICML 2025] Paper / Code
ImmerseDiffusion: A Generative Spatial Audio Latent Diffusion Model [ICASSP 2025] Paper
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation [ICLR 2025] Paper / Code
AudioSpa: Spatializing Sound Events with Text [arXiv 2025] Paper
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering [arXiv 2026] Paper
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models [AAAI 2026] Paper Code
AUDIOEVAL: AUTOMATIC DUAL-PERSPECTIVE AND MULTI-DIMENSIONAL EVALUATION OF TEXT-TO-AUDIO-GENERATION [arXiv 2025] Paper
RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio [Interspeech 2025] Paper
Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data [ICLR 2025] Paper
Mind the Prompt: Prompting Strategies in Audio Generations for Improving Sound Classification [ICASSP 2025 Workshop] Paper
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling? [Interspeech 2024] Paper
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model [arXiv 2026] Paper
RFM-Editing: Rectified flow matching for text-guided audio editing [arXiv 2025] Paper
SAO-Instruct: Free-form Audio Editing using Natural Language Instructions [NeurIPS 2025] Paper / Code
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework [ICASSP 2025] Paper
AUDIT: Audio Editing by Following Instructions with Latent Diffusion Models [NeurIPS 2023] Paper
Audio Editing with Non-Rigid Text Prompts [Interspeech 2024] Paper
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset [ICASSP 2025] Paper / Code
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions [ICASSP 2025] Paper / Code
Improving Text-To-Audio Models with Synthetic Captions [Interspeech 2024] Paper
TODO
TODO
12 commits
8 commits
Curated list for papers, codes and resources related to Text-to-Audio (TTA) Generation
77
20 commits
updated Jul 20, 2026
This is a repository organizing papers, codes and other resources related to Text-to-Audio Generation (TTA), where audio denotes primarily ambient sound or music.
Welcome to PR if you want to add some resources !
Woosh: Sound Effect Generative Models [arXiv 2026] Paper / Code
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction [ICML 2025] Paper
Fugatto 1: Foundational Generative Audio Transformer Opus 1 [ICLR 2025] Paper
AudioX: Diffusion Transformer for Anything-to-Audio Generation [arXiv 2025] Paper
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization [arXiv 2025] Paper / Code
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions [arXiv 2025] Paper
ETTA: Elucidating the Design Space of Text-to-Audio Models [arXiv 2024] Paper
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens [ICASSP 2025] Paper
MambaFoley: Foley Sound Generation using Selective State-Space Models [ICASSP 2025] Paper
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer [arXiv 2024] Paper / Code
GenAU: Taming Data and Transformers for Audio Generation [arXiv 2024] Paper / Code
Stable-Audio 2: Long-form music generation with latent diffusion [arXiv 2024] Paper
Stable Audio 1: Fast Timing-Conditioned Latent Audio Diffusion [ICML 2024] Paper
Masked Audio Generation using a Single Non-Autoregressive Transformer [ICLR 2024] Paper / Code
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond [arXiv 2024] Paper
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation [arXiv 2024] Paper
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining [TASLP 2024] Paper / Code
LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation [Interspeech 2024] Paper / Code
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation [arXiv 2024] Paper / Code
AudioGen: Textually Guided Audio Generation [ICLR 2023] Paper
Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation [arXiv 2023] Paper / Code
Tango: Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model [ACM MM 2023] Paper / Code
Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models [ICML 2023] Paper / Code
AudioLDM: Text-to-Audio Generation with Latent Diffusion Models [ICML 2023] Paper / Code
Diffsound: Discrete Diffusion Model for Text-to-sound Generation [TASLP 2022] Paper / Code
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling [arXiv 2025] Paper
PicoAudio 2: Temporal Controllable Text-to-Audio Generation with Natural Language Description [arXiv 2025] Paper
DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer [arXiv 2025] Paper
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generatio [ACM MM 2025] Paper
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations [ICASSP 2025] Paper
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions [ICASSP 2025] Paper / Code
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation [ICASSP 2025] Paper / Code
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation [arXiv 2024] Paper
RiTTA: Modeling Event Relations in Text-to-Audio Generation [arXiv 2024] Paper
Controllable Text-to-Audio Generation with Training-Free Temporal Guidance Diffusion [ICME 2024] Paper
Audio Generation with Multiple Conditional Diffusion Model [AAAI 2024] Paper / Code
T-FOLEY: A Controllable Waveform-Domain Diffusion Model for Temporal-Event-Guided Foley Sound Synthesis [ICASSP 2024] Paper / Code
Continuous descriptor-based control for deep audio synthesis [ICASSP 2023] / Code
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows [arXiv 2025] Paper
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion [Interspeech 2025] Paper
Stable-Audio-Small: Fast Text-to-Audio Generation with Adversarial Post-Training [arXiv 2025] Paper / Code
SoundCTM: Uniting Score-based and Consistency Models for Text-to-Sound Generation [ICLR 2025] Paper
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation [arXiv 2024] Paper
ConsistencyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency Distillation [Interspeech 2024] Paper / Code
AudioLCM: Text-to-Audio Generation with Latent Consistency Models [ACM MM 2024] Paper / Code
Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models [Interspeech 2026] Paper
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models [Interspeech 2026] Paper
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback [ACL 2025] Paper
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization [arXiv 2025] Paper / Code
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization [ACM MM 2024] Paper / Code
BATON: Aligning Text-to-Audio Model with Human Preference Feedback [IJCAI 2024] Paper / Code
SonicRAG : High Fidelity Sound Effects Synthesis Based on Retrival Augmented Generation [arXiv 2025] Paper
Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation [arXiv 2024] Paper
Retrieval-Augmented Text-to-Audio Generation [ICASSP 2024] Paper
OmniAudio: Generating Spatial Audio from 360-Degree Video [ICML 2025] Paper / Code
ImmerseDiffusion: A Generative Spatial Audio Latent Diffusion Model [ICASSP 2025] Paper
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation [ICLR 2025] Paper / Code
AudioSpa: Spatializing Sound Events with Text [arXiv 2025] Paper
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering [arXiv 2026] Paper
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models [AAAI 2026] Paper Code
AUDIOEVAL: AUTOMATIC DUAL-PERSPECTIVE AND MULTI-DIMENSIONAL EVALUATION OF TEXT-TO-AUDIO-GENERATION [arXiv 2025] Paper
RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio [Interspeech 2025] Paper
Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data [ICLR 2025] Paper
Mind the Prompt: Prompting Strategies in Audio Generations for Improving Sound Classification [ICASSP 2025 Workshop] Paper
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling? [Interspeech 2024] Paper
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model [arXiv 2026] Paper
RFM-Editing: Rectified flow matching for text-guided audio editing [arXiv 2025] Paper
SAO-Instruct: Free-form Audio Editing using Natural Language Instructions [NeurIPS 2025] Paper / Code
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework [ICASSP 2025] Paper
AUDIT: Audio Editing by Following Instructions with Latent Diffusion Models [NeurIPS 2023] Paper
Audio Editing with Non-Rigid Text Prompts [Interspeech 2024] Paper
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset [ICASSP 2025] Paper / Code
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions [ICASSP 2025] Paper / Code
Improving Text-To-Audio Models with Synthetic Captions [Interspeech 2024] Paper
TODO
TODO
12 commits
8 commits