Ruiqi-Yan/Awesome-Audio-Editing

A curated list of models, benchmarks, tools and guides for audio editing

46

39 commits

updated Sep 19, 2026

See the code

README

Awesome-Audio-Editing Awesome

A curated list of models, benchmarks, tools and guides for audio editing
Welcome to PR if you want to add some resources.

Table of Contents

Challenges

    Date    TitleRelevant Resources
2027Audio-Editing-Challenge (ICASSP 2027)GitHub/Challenge Website

Benchmarks

General-Purpose Audio Editing

    Date    TitleRelevant Resources
2026-06MMAE: A Massive Multitask Audio Editing BenchmarkarXiv/Github/HuggingFace

Speech Editing

    Date    TitleRelevant Resources
2026-06SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech EditingarXiv/Github/HuggingFace
2025-11Ming-Freeform-Audio-EditarXiv/Github/HuggingFace
2025-11Step-Audio-Edit-BenchmarkarXiv/Github
2025-09ISSE: An Instruction-Guided Speech Style Editing Dataset and BenchmarkarXiv/HuggingFace/Demo

Music Editing

    Date    TitleRelevant Resources
2026-03LyricEditBench: The First Benchmark for Melody-Preserving Lyric Modification EvaluationarXiv/Github/HuggingFace
2025-12Evaluating Music Context Preservation: A Multi-facet Framework for Music Editing SystemsarXiv/Github

Models

Speech Editing

    Date    TitleRelevant Resources
2026-09AuK Technical Report: An Open-Source Foundational Model for Speech Generation and EditingarXiv/Github/HuggingFace/ModelScope/Demo
2026-08FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and GenerationarXiv/Github/HuggingFace/ModelScope/Demo
2026-08FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech RepresentationsarXiv/Github/HuggingFace/Demo
2026-08VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data AugmentationarXiv/Demo
2026-08Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and EditingarXiv
2026-08dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive ModelarXiv/Demo
2026-06UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram ModellingarXiv/Demo
2026-05CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTSarXiv/Demo
2026-01CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech ModelsarXiv/Github/HuggingFace/Demo
2025-12MiMo-Audio: Audio Language Models are Few-Shot LearnersarXiv/Github/HuggingFace
2025-11Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified RepresentationarXiv/Github/HuggingFace/Demo
2025-11Step-Audio-EditX Technical ReportarXiv/Github/HuggingFace/Demo
2025-11VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech EditingarXiv/Github
2024-09SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and SynthesisarXiv/Github/HuggingFace
2024-07Speech Editing – a SummaryarXiv
2024-05InstructSpeech: Following Speech Editing Instructions via Large Language ModelsPaper/Demo
2024-03VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the WildarXiv/Github/Demo
2023-05FluentSpeech: Stutter-Oriented Automatic Speech Editing with Context-Aware Diffusion ModelsarXiv/Github

Audio Editing

    Date    TitleRelevant Resources
2026-09One-Stage Multi-Task Instruction-Guided 3D Spatial Audio EditingarXiv/Github/Demo
2026-06Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-CaptionarXiv/Github/Demo
2026-06DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction ContrastarXiv/Demo
2026-05UNISON: A Unified Sound Generation and Editing Framework via Deep LLM FusionarXiv/Github/Demo
2026-05SpongeBob: Sync-Aware Harmonious Audio-Visual Generative EditingarXiv/Github/Demo
2026-04Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and EditingarXiv/Github/HuggingFace/Demo
2026-04VoiceToInstrument: Convert voice to instrumental tracks using AIHomePage/Blog
2026-02Bagpiper: Solving Open-Ended Audio Tasks via Rich CaptionsarXiv/Demo
2026-02AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion ForcingarXiv/Demo
2025-12MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language ModelarXiv/Github/HuggingFace/Demo
2025-10SAO-Instruct: Free-form Audio Editing using Natural Language InstructionsarXiv/Github/Demo
2025-10UALM: Unified Audio Language Model for Understanding, Generation and ReasoningarXiv
2025-09Guiding Audio Editing with Audio Language ModelarXiv/Github
2025-09Recomposer: Event-roll-guided generative audio editingarXiv
2025-06ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and EditingarXiv/Github/Demo
2025-05AudioMorphix: Training-free audio editing with diffusion probabilistic modelsarXiv/Github/Demo
2024-09AudioEditor: A Training-Free Diffusion-Based Audio Editing FrameworkarXiv/Github/Demo
2024-06Prompt-guided Precise Audio Editing with Diffusion ModelsarXiv
2024-03WavCraft: Audio Editing and Generation with Large Language ModelsarXiv/Github/Demo
2024-02Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM InversionarXiv/Github/Demo
2023-04AUDIT: Audio Editing by Following Instructions with Latent Diffusion ModelsarXiv/Demo

Music Editing

    Date    TitleRelevant Resources
2026-09AURA: Unified Multimodal Framework for Conversational Music EditingarXiv/Github/HuggingFace/Demo
2026-08CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice SynthesisarXiv/Demo
2026-08P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and EditingarXiv/Github/Demo
2026-07RIME: Enabling Large-Scale Agentic Music Post-ProductionarXiv
2026-02ACE-Step 1.5: Pushing the Boundaries of Open-Source Music GenerationarXiv/Demo
2025-11Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion ModelsarXiv
2025-11MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion TransformersarXiv
2025-06ACE-Step: A Step Towards Music Generation Foundation ModelarXiv/Github/HuggingFace
2025-04SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music EditingarXiv/Github/Demo
2024-12SongEditor: Adapting Zero-Shot Song Generation Language Model as a Multi-Task EditorarXiv/Demo
2024-07High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching (MelodyFlow)arXiv/Demo/HuggingFace
2024-05Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction TuningarXiv/Github/Demo
2024-05DITTO-2: Distilled Diffusion Inference-Time T-Optimization for Music GenerationarXiv/Demo
2024-02MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion ModelsarXiv/Github/Demo
2024-01DITTO: Diffusion Inference-Time T-Optimization for Music GenerationarXiv/Demo
2023-10Loop Copilot: Conducting AI Ensembles for Music Generation and Iterative EditingarXiv/Github

Tools

    Date    TitleRelevant Resources
2025-12SAM Audio: Segment Anything in AudioarXiv/Github
2026-08Remove Background Noise (web app)Website
audio-editing
awesome-list

Contributors

Ruiqi-Yan

23 commits

danjuan-77

11 commits

ZhikangNiu

3 commits

claude

1 commits

Ruiqi-Yan/Awesome-Audio-Editing

A curated list of models, benchmarks, tools and guides for audio editing

46

39 commits

updated Sep 19, 2026

See the code

README

Awesome-Audio-Editing Awesome

A curated list of models, benchmarks, tools and guides for audio editing
Welcome to PR if you want to add some resources.

Table of Contents

Challenges

    Date    TitleRelevant Resources
2027Audio-Editing-Challenge (ICASSP 2027)GitHub/Challenge Website

Benchmarks

General-Purpose Audio Editing

    Date    TitleRelevant Resources
2026-06MMAE: A Massive Multitask Audio Editing BenchmarkarXiv/Github/HuggingFace

Speech Editing

    Date    TitleRelevant Resources
2026-06SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech EditingarXiv/Github/HuggingFace
2025-11Ming-Freeform-Audio-EditarXiv/Github/HuggingFace
2025-11Step-Audio-Edit-BenchmarkarXiv/Github
2025-09ISSE: An Instruction-Guided Speech Style Editing Dataset and BenchmarkarXiv/HuggingFace/Demo

Music Editing

    Date    TitleRelevant Resources
2026-03LyricEditBench: The First Benchmark for Melody-Preserving Lyric Modification EvaluationarXiv/Github/HuggingFace
2025-12Evaluating Music Context Preservation: A Multi-facet Framework for Music Editing SystemsarXiv/Github

Models

Speech Editing

    Date    TitleRelevant Resources
2026-09AuK Technical Report: An Open-Source Foundational Model for Speech Generation and EditingarXiv/Github/HuggingFace/ModelScope/Demo
2026-08FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and GenerationarXiv/Github/HuggingFace/ModelScope/Demo
2026-08FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech RepresentationsarXiv/Github/HuggingFace/Demo
2026-08VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data AugmentationarXiv/Demo
2026-08Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and EditingarXiv
2026-08dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive ModelarXiv/Demo
2026-06UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram ModellingarXiv/Demo
2026-05CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTSarXiv/Demo
2026-01CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech ModelsarXiv/Github/HuggingFace/Demo
2025-12MiMo-Audio: Audio Language Models are Few-Shot LearnersarXiv/Github/HuggingFace
2025-11Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified RepresentationarXiv/Github/HuggingFace/Demo
2025-11Step-Audio-EditX Technical ReportarXiv/Github/HuggingFace/Demo
2025-11VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech EditingarXiv/Github
2024-09SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and SynthesisarXiv/Github/HuggingFace
2024-07Speech Editing – a SummaryarXiv
2024-05InstructSpeech: Following Speech Editing Instructions via Large Language ModelsPaper/Demo
2024-03VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the WildarXiv/Github/Demo
2023-05FluentSpeech: Stutter-Oriented Automatic Speech Editing with Context-Aware Diffusion ModelsarXiv/Github

Audio Editing

    Date    TitleRelevant Resources
2026-09One-Stage Multi-Task Instruction-Guided 3D Spatial Audio EditingarXiv/Github/Demo
2026-06Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-CaptionarXiv/Github/Demo
2026-06DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction ContrastarXiv/Demo
2026-05UNISON: A Unified Sound Generation and Editing Framework via Deep LLM FusionarXiv/Github/Demo
2026-05SpongeBob: Sync-Aware Harmonious Audio-Visual Generative EditingarXiv/Github/Demo
2026-04Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and EditingarXiv/Github/HuggingFace/Demo
2026-04VoiceToInstrument: Convert voice to instrumental tracks using AIHomePage/Blog
2026-02Bagpiper: Solving Open-Ended Audio Tasks via Rich CaptionsarXiv/Demo
2026-02AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion ForcingarXiv/Demo
2025-12MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language ModelarXiv/Github/HuggingFace/Demo
2025-10SAO-Instruct: Free-form Audio Editing using Natural Language InstructionsarXiv/Github/Demo
2025-10UALM: Unified Audio Language Model for Understanding, Generation and ReasoningarXiv
2025-09Guiding Audio Editing with Audio Language ModelarXiv/Github
2025-09Recomposer: Event-roll-guided generative audio editingarXiv
2025-06ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and EditingarXiv/Github/Demo
2025-05AudioMorphix: Training-free audio editing with diffusion probabilistic modelsarXiv/Github/Demo
2024-09AudioEditor: A Training-Free Diffusion-Based Audio Editing FrameworkarXiv/Github/Demo
2024-06Prompt-guided Precise Audio Editing with Diffusion ModelsarXiv
2024-03WavCraft: Audio Editing and Generation with Large Language ModelsarXiv/Github/Demo
2024-02Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM InversionarXiv/Github/Demo
2023-04AUDIT: Audio Editing by Following Instructions with Latent Diffusion ModelsarXiv/Demo

Music Editing

    Date    TitleRelevant Resources
2026-09AURA: Unified Multimodal Framework for Conversational Music EditingarXiv/Github/HuggingFace/Demo
2026-08CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice SynthesisarXiv/Demo
2026-08P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and EditingarXiv/Github/Demo
2026-07RIME: Enabling Large-Scale Agentic Music Post-ProductionarXiv
2026-02ACE-Step 1.5: Pushing the Boundaries of Open-Source Music GenerationarXiv/Demo
2025-11Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion ModelsarXiv
2025-11MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion TransformersarXiv
2025-06ACE-Step: A Step Towards Music Generation Foundation ModelarXiv/Github/HuggingFace
2025-04SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music EditingarXiv/Github/Demo
2024-12SongEditor: Adapting Zero-Shot Song Generation Language Model as a Multi-Task EditorarXiv/Demo
2024-07High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching (MelodyFlow)arXiv/Demo/HuggingFace
2024-05Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction TuningarXiv/Github/Demo
2024-05DITTO-2: Distilled Diffusion Inference-Time T-Optimization for Music GenerationarXiv/Demo
2024-02MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion ModelsarXiv/Github/Demo
2024-01DITTO: Diffusion Inference-Time T-Optimization for Music GenerationarXiv/Demo
2023-10Loop Copilot: Conducting AI Ensembles for Music Generation and Iterative EditingarXiv/Github

Tools

    Date    TitleRelevant Resources
2025-12SAM Audio: Segment Anything in AudioarXiv/Github
2026-08Remove Background Noise (web app)Website
audio-editing
awesome-list

Contributors

Ruiqi-Yan

23 commits

danjuan-77

11 commits

ZhikangNiu

3 commits

claude

1 commits