WWWWxp/awesome-continuous-audio-vae

A curated catalog of continuous audio VAEs and autoencoders for audio, music, singing, and speech.

8

0 commits

updated Sep 4, 2026

See the code

README

🎧 Awesome Continuous Audio VAE

A curated catalog of continuous audio VAEs and autoencoders for audio, music, singing, and speech.

58 models 40 with weights Updated 2026-09-04

Audio / Sound · Music · Singing · Speech

Papers, official implementations, pretrained weights, latent frame rates, dimensions, encoder/decoder architectures, and model I/O in one place.

🔊 Audio / Sound

General audio, environmental sound, Foley, and multi-domain reconstruction. 27 models · 18 with weights.

Model and resourcesYear–MonthSample rateFrame rateDimFeatureArchitecture
MiniMax H3 AudioVAE
Code · Weights
2026-0732 kHz40 Hz32stereo waveformCNN + Transformer
OmniVAE audio-only
Paper · Code · Weights
2026-0748 kHz50 Hz128waveformCNN
Qwen-Audio-3 Shared VAE
Paper
2026-0748 kHz25 Hz128stereo waveformCNN
Qwen-Audio-VAE
Paper
2026-0724 kHz12.5 Hz128waveformCNN + Transformer
STFT-VAE
Code · Weights
2026-0724 kHz3.125 Hz128complex STFTTransformer
AudioCALM Audio VAE
Paper
2026-0644.1 kHz≈10.75 Hz64stereo waveformCNN + Transformer
KVAE-Audio
Code · Weights
2026-0648 kHz50 Hz64waveformCNN
STAR-VAE
Paper
2026-06N/RN/RN/RwaveformN/R
UniSonate Mel-VAE
Paper
2026-0444.1 kHz43 Hz40mel spectrogramCNN
GenAE
Paper
2026-0244.1 kHz13.125 HzN/Rmultichannel waveformCNN + Transformer
Ming-omni-tts continuous tokenizer
Code · Weights
2026-0244.1 kHz12.5 Hz64waveformTransformer
LTX-2 Audio VAE
Code · Weights
2026-0116 kHz25 Hz128mel spectrogramCNN
Omni2Sound OOB/Wav VAE
Paper · Code · Weights
2026-0116 kHz25 Hz64waveformCNN
HunyuanVideo-Foley Audio VAE
Paper · Code · Weights
2025-0848 kHz50 Hz128waveformCNN
Kling-Foley Mel-VAE
Paper
2025-0644.1 kHz43 Hz40mel spectrogramCNN
MMAudio VAE 16 kHz
Paper · Code · Weights
2024-1216 kHz31.25 Hz20mel spectrogramCNN
MMAudio VAE 44.1 kHz
Paper · Code · Weights
2024-1244.1 kHz43.07 Hz40mel spectrogramCNN
MultiFoley DAC-VAE
Paper
2024-1148 kHz40 Hz64waveformCNN
DACVAE / Movie Gen Audio Autoencoder
Paper · Code · Weights
2024-1048 kHz25 Hz128waveformCNN
EzAudio 1-D VAE
Paper · Code · Weights
2024-0924 kHz50 Hz128waveformCNN
StableAudio1.0 / Stable Audio Open VAE
Paper · Code · Weights
2024-0744.1 kHz21.5 Hz64waveformCNN
Wave-VAE (Stability AI)
Code
2024-0744.1 kHz21 Hz64waveformN/R
Auffusion VAE
Paper · Code · Weights
2024-0116 kHz12.5 Hz128mel-spectrogram imageCNN
AudioLDM 2 VAE
Paper · Code · Weights
2023-0816 kHz25 Hz128mel spectrogramCNN
Make-An-Audio 2 Audio VAE
Paper · Code · Weights
2023-0516 kHz31.25 Hz20mel spectrogramCNN + Transformer
AudioLDM VAE
Paper · Code · Weights
2023-0116 kHz25 Hz128mel spectrogramCNN
Make-An-Audio VAE
Paper · Code · Weights
2023-0116 kHz7.8 Hz40mel spectrogramCNN

↑ Back to top

🎵 Music

Autoencoders designed for music generation and representation. 13 models · 10 with weights.

Model and resourcesYear–MonthSample rateFrame rateDimFeatureArchitecture
SAME-L
Paper · Code · Weights
2026-0544.1 kHz10.77 Hz256waveformTransformer
SAME-S
Paper · Code · Weights
2026-0544.1 kHz10.77 Hz256waveformTransformer
ACE-Step 1.5 VAE
Paper · Code · Weights
2026-0248 kHz25 Hz64waveformCNN
DiffRhythm 2 Music VAE
Paper · Code
2025-1024 kHz5 Hz64waveformCNN + Transformer
CoDiCodec continuous branch
Paper · Code · Weights
2025-0944.1 kHz10.77 Hz64complex STFTCNN + Transformer
epsilonar-VAE
Paper · Code
2025-0944.1 kHz43 HzN/Rstereo waveformCNN + Transformer
ACE-Step DCAE
Paper · Code · Weights
2025-0632 kHz10.77 Hz128mel spectrogramCNN
DiffRhythm VAE
Paper · Code · Weights
2025-0344.1 kHz21.53 Hz64waveformCNN
Music2Latent
Paper · Code · Weights
2024-0844.1 kHz10.77 Hz64complex STFTCNN + Transformer
Descript Audio VAE (community)
Code · Weights
2024-0144.1 kHz86.13 Hz128waveformCNN
Moûsai Diffusion Autoencoder
Paper · Code
2023-0148 kHzN/R32magnitude spectrogramCNN
Musika autoencoder
Paper · Code · Weights
2022-0822.05 kHz11.89 / 23.78 Hz32 / 64magnitude spectrogramCNN
RAVE v2 (MusicNet)
Paper · Code · Weights
2021-1144.1 kHz21.53 Hz16waveformCNN

↑ Back to top

🎤 Singing

Singing reconstruction, singing voice synthesis, and voice conversion. 5 models · 1 with weights.

Model and resourcesYear–MonthSample rateFrame rateDimFeatureArchitecture
FM-Singer
Paper · Code · Weights
2026-0144.1 kHz86.13 Hz192score/lyrics + waveformCNN
CSSinger
Paper
2024-1244.1 kHz86.13 Hz192score/lyrics + waveformCNN
UniSyn
Paper
2022-1224 kHz80 HzN/Rscore/lyrics + waveformCNN
VISinger 2
Paper
2022-1144.1 kHzN/R192score/lyrics + waveformCNN
VISinger
Paper
2021-1024 kHzN/RN/Rscore/lyrics + waveformCNN

↑ Back to top

🗣️ Speech

Speech reconstruction and conditional text-to-speech VAEs. 13 models · 11 with weights.

Model and resourcesYear–MonthSample rateFrame rateDimFeatureArchitecture
RedAE (FireRedAudio)
Paper · Code · Weights
2026-0824 kHz25 Hz64waveformTransformer + iSTFT
dots.tts AudioVAE
Paper · Code · Weights
2026-0648 kHz25 Hz128waveformCNN
VoxCPM2 AudioVAE
Paper · Code · Weights
2026-0616 kHz25 Hz64waveformCNN
HoliTok
Paper · Code · Weights
2026-0548 kHz25 Hz128waveformCNN
LongCat Wav-VAE
Paper · Code · Weights
2026-0324 kHz11.72 Hz64waveformCNN
MingTok-Audio
Paper · Code · Weights
2025-1116 kHz50 Hz64waveformTransformer
SALAD-VAE
Paper
2025-10N/R7.8 Hz64 / 128complex STFTCNN
Semantic-VAE
Paper · Code · Weights
2025-0916 kHz40 Hz64condition + waveformCNN
Semantic-VAE-600k
Paper · Code
2025-0916 kHz40 Hz64condition + waveformCNN
Semantic-VAE-A16
Paper · Code · Weights
2025-0916 kHz40 Hz16condition + waveformCNN
Semantic-VAE-A64
Paper · Code · Weights
2025-0916 kHz40 Hz64condition + waveformCNN
VoxCPM AudioVAE
Paper · Code · Weights
2025-0916 kHz25 Hz64waveformCNN
VibeVoice Acoustic Tokenizer
Paper · Code · Weights
2025-0824 kHz7.5 Hz64waveformCNN

↑ Back to top

WWWWxp/awesome-continuous-audio-vae

A curated catalog of continuous audio VAEs and autoencoders for audio, music, singing, and speech.

8

0 commits

updated Sep 4, 2026

See the code

README

🎧 Awesome Continuous Audio VAE

A curated catalog of continuous audio VAEs and autoencoders for audio, music, singing, and speech.

58 models 40 with weights Updated 2026-09-04

Audio / Sound · Music · Singing · Speech

Papers, official implementations, pretrained weights, latent frame rates, dimensions, encoder/decoder architectures, and model I/O in one place.

🔊 Audio / Sound

General audio, environmental sound, Foley, and multi-domain reconstruction. 27 models · 18 with weights.

Model and resourcesYear–MonthSample rateFrame rateDimFeatureArchitecture
MiniMax H3 AudioVAE
Code · Weights
2026-0732 kHz40 Hz32stereo waveformCNN + Transformer
OmniVAE audio-only
Paper · Code · Weights
2026-0748 kHz50 Hz128waveformCNN
Qwen-Audio-3 Shared VAE
Paper
2026-0748 kHz25 Hz128stereo waveformCNN
Qwen-Audio-VAE
Paper
2026-0724 kHz12.5 Hz128waveformCNN + Transformer
STFT-VAE
Code · Weights
2026-0724 kHz3.125 Hz128complex STFTTransformer
AudioCALM Audio VAE
Paper
2026-0644.1 kHz≈10.75 Hz64stereo waveformCNN + Transformer
KVAE-Audio
Code · Weights
2026-0648 kHz50 Hz64waveformCNN
STAR-VAE
Paper
2026-06N/RN/RN/RwaveformN/R
UniSonate Mel-VAE
Paper
2026-0444.1 kHz43 Hz40mel spectrogramCNN
GenAE
Paper
2026-0244.1 kHz13.125 HzN/Rmultichannel waveformCNN + Transformer
Ming-omni-tts continuous tokenizer
Code · Weights
2026-0244.1 kHz12.5 Hz64waveformTransformer
LTX-2 Audio VAE
Code · Weights
2026-0116 kHz25 Hz128mel spectrogramCNN
Omni2Sound OOB/Wav VAE
Paper · Code · Weights
2026-0116 kHz25 Hz64waveformCNN
HunyuanVideo-Foley Audio VAE
Paper · Code · Weights
2025-0848 kHz50 Hz128waveformCNN
Kling-Foley Mel-VAE
Paper
2025-0644.1 kHz43 Hz40mel spectrogramCNN
MMAudio VAE 16 kHz
Paper · Code · Weights
2024-1216 kHz31.25 Hz20mel spectrogramCNN
MMAudio VAE 44.1 kHz
Paper · Code · Weights
2024-1244.1 kHz43.07 Hz40mel spectrogramCNN
MultiFoley DAC-VAE
Paper
2024-1148 kHz40 Hz64waveformCNN
DACVAE / Movie Gen Audio Autoencoder
Paper · Code · Weights
2024-1048 kHz25 Hz128waveformCNN
EzAudio 1-D VAE
Paper · Code · Weights
2024-0924 kHz50 Hz128waveformCNN
StableAudio1.0 / Stable Audio Open VAE
Paper · Code · Weights
2024-0744.1 kHz21.5 Hz64waveformCNN
Wave-VAE (Stability AI)
Code
2024-0744.1 kHz21 Hz64waveformN/R
Auffusion VAE
Paper · Code · Weights
2024-0116 kHz12.5 Hz128mel-spectrogram imageCNN
AudioLDM 2 VAE
Paper · Code · Weights
2023-0816 kHz25 Hz128mel spectrogramCNN
Make-An-Audio 2 Audio VAE
Paper · Code · Weights
2023-0516 kHz31.25 Hz20mel spectrogramCNN + Transformer
AudioLDM VAE
Paper · Code · Weights
2023-0116 kHz25 Hz128mel spectrogramCNN
Make-An-Audio VAE
Paper · Code · Weights
2023-0116 kHz7.8 Hz40mel spectrogramCNN

↑ Back to top

🎵 Music

Autoencoders designed for music generation and representation. 13 models · 10 with weights.

Model and resourcesYear–MonthSample rateFrame rateDimFeatureArchitecture
SAME-L
Paper · Code · Weights
2026-0544.1 kHz10.77 Hz256waveformTransformer
SAME-S
Paper · Code · Weights
2026-0544.1 kHz10.77 Hz256waveformTransformer
ACE-Step 1.5 VAE
Paper · Code · Weights
2026-0248 kHz25 Hz64waveformCNN
DiffRhythm 2 Music VAE
Paper · Code
2025-1024 kHz5 Hz64waveformCNN + Transformer
CoDiCodec continuous branch
Paper · Code · Weights
2025-0944.1 kHz10.77 Hz64complex STFTCNN + Transformer
epsilonar-VAE
Paper · Code
2025-0944.1 kHz43 HzN/Rstereo waveformCNN + Transformer
ACE-Step DCAE
Paper · Code · Weights
2025-0632 kHz10.77 Hz128mel spectrogramCNN
DiffRhythm VAE
Paper · Code · Weights
2025-0344.1 kHz21.53 Hz64waveformCNN
Music2Latent
Paper · Code · Weights
2024-0844.1 kHz10.77 Hz64complex STFTCNN + Transformer
Descript Audio VAE (community)
Code · Weights
2024-0144.1 kHz86.13 Hz128waveformCNN
Moûsai Diffusion Autoencoder
Paper · Code
2023-0148 kHzN/R32magnitude spectrogramCNN
Musika autoencoder
Paper · Code · Weights
2022-0822.05 kHz11.89 / 23.78 Hz32 / 64magnitude spectrogramCNN
RAVE v2 (MusicNet)
Paper · Code · Weights
2021-1144.1 kHz21.53 Hz16waveformCNN

↑ Back to top

🎤 Singing

Singing reconstruction, singing voice synthesis, and voice conversion. 5 models · 1 with weights.

Model and resourcesYear–MonthSample rateFrame rateDimFeatureArchitecture
FM-Singer
Paper · Code · Weights
2026-0144.1 kHz86.13 Hz192score/lyrics + waveformCNN
CSSinger
Paper
2024-1244.1 kHz86.13 Hz192score/lyrics + waveformCNN
UniSyn
Paper
2022-1224 kHz80 HzN/Rscore/lyrics + waveformCNN
VISinger 2
Paper
2022-1144.1 kHzN/R192score/lyrics + waveformCNN
VISinger
Paper
2021-1024 kHzN/RN/Rscore/lyrics + waveformCNN

↑ Back to top

🗣️ Speech

Speech reconstruction and conditional text-to-speech VAEs. 13 models · 11 with weights.

Model and resourcesYear–MonthSample rateFrame rateDimFeatureArchitecture
RedAE (FireRedAudio)
Paper · Code · Weights
2026-0824 kHz25 Hz64waveformTransformer + iSTFT
dots.tts AudioVAE
Paper · Code · Weights
2026-0648 kHz25 Hz128waveformCNN
VoxCPM2 AudioVAE
Paper · Code · Weights
2026-0616 kHz25 Hz64waveformCNN
HoliTok
Paper · Code · Weights
2026-0548 kHz25 Hz128waveformCNN
LongCat Wav-VAE
Paper · Code · Weights
2026-0324 kHz11.72 Hz64waveformCNN
MingTok-Audio
Paper · Code · Weights
2025-1116 kHz50 Hz64waveformTransformer
SALAD-VAE
Paper
2025-10N/R7.8 Hz64 / 128complex STFTCNN
Semantic-VAE
Paper · Code · Weights
2025-0916 kHz40 Hz64condition + waveformCNN
Semantic-VAE-600k
Paper · Code
2025-0916 kHz40 Hz64condition + waveformCNN
Semantic-VAE-A16
Paper · Code · Weights
2025-0916 kHz40 Hz16condition + waveformCNN
Semantic-VAE-A64
Paper · Code · Weights
2025-0916 kHz40 Hz64condition + waveformCNN
VoxCPM AudioVAE
Paper · Code · Weights
2025-0916 kHz25 Hz64waveformCNN
VibeVoice Acoustic Tokenizer
Paper · Code · Weights
2025-0824 kHz7.5 Hz64waveformCNN

↑ Back to top