kandinskylab/KVAE-Audio

Model

KVAE-Audio is a continuous, full-band (48 kHz) audio autoencoder. It compresses raw waveforms into compact continuous latents and reconstructs them with high fidelity across speech, music, and general sound. The model is designed not only for faithful reconstruction, but as a _latent space for generative models_ — in our internal text-to-audio pipeline, swapping the autoencoder for KVAE-Audio improves generation quality under a fixed generator.

58

20 commits

3 linked in READMEs

updated Aug 10, 2026

See the code

README

KVAE-Audio

KVAE-Audio is a continuous, full-band (48 kHz) audio autoencoder. It compresses raw waveforms into compact continuous latents and reconstructs them with high fidelity across speech, music, and general sound. The model is designed not only for faithful reconstruction, but as a latent space for generative models — in our internal text-to-audio pipeline, swapping the autoencoder for KVAE-Audio improves generation quality under a fixed generator.

Evaluation results

Evaluation of latent space qualities for generation

Generative quality is established under a fixed generator — same DiT architecture, training data, and number of steps — varying only the autoencoder. We report objective generation metrics and blind human side-by-side below.

AudioCaps test set

Model# ParamsLatent dimCLAP↑CE↑PQ↑FAD (PANNs)↓FAD (PASST)↓FAD (VGGIsh)↓
MMAudio 44.1kHz427.6M400,3363,9096,19217,873195,9101,364
DACVAE MovieGen107.7M1280,3133,7726,16720,558234,3121,700
SAME-L852.1M2560,3223,5885,75618,446240,6351,325
KVAE-Audio166.9M640,3443,9826,24215,381193,7601,210

Song Describer

Model# ParamsLatent dimCLAP↑CE↑PQ↑FAD (PANNs)↓FAD (PASST)↓FAD (VGGIsh)↓
MMAudio 44.1kHz427.6M400,3567,1367,7075,412158,5990,356
DACVAE MovieGen107.7M1280,3126,9537,53810,194214,0091,046
SAME-L852.1M2560,3457,0767,4658,442250,6680,987
KVAE-Audio166.9M640,3397,2167,9297,971189,4270,599

LibriSpeech test-clean

Model# ParamsLatent dimCLAP↑CE↑PQ↑FAD (PANNs)↓FAD (PASST)↓FAD (VGGIsh)↓WER↓CER↓
MMAudio 44.1kHz427.6M400,3685,7046,6298,305105,9312,0010,2570,593
DACVAE MovieGen107.7M1280,4135,4827,0525,008210,4781,5010,9111,048
SAME-L852.1M2560,3794,6175,02410,257301,5082,7210,3490,629
KVAE-Audio166.9M640,3895,9066,9404,677185,6092,1380,2440,576

Reconstructions

Reconstruction is evaluated on open datasets across domains (the released weights directly substantiate these numbers). Baselines: MMAudio 44.1 kHz VAE, DACVAE from MovieGen Audio, SAME-L (Stable Audio 3 VAE).

AudioSet eval

Model# ParamsLatent dimMEL↓STFT↓Waveform↓SI-SDR↑SDR↑SNR↑
MMAudio 44.1kHz427.6M400,6361,9380,106-32,080-2,682-2,686
DACVAE MovieGen107.7M1280,6692,2750,0298,3849,4219,416
SAME-L852.1M2560,9862,7260,0279,58610,34710,339
KVAE-Audio166.9M640,5371,7700,0279,0659,9209,933

MUSDB18-HQ

Model# ParamsLatent dimMEL↓STFT↓Waveform↓SI-SDR↑SDR↑SNR↑
MMAudio 44.1kHz427.6M400,6811,8650,114-40,204-3,274-3,273
DACVAE MovieGen107.7M1280,5191,7620,0249,68810,04610,047
SAME-L852.1M2560,6681,7860,02310,27810,64810,648
KVAE-Audio166.9M640,5161,7250,02210,39010,67510,677

EARS

Model# ParamsLatent dimMEL↓STFT↓Waveform↓SI-SDR↑SDR↑SNR↑PESQ↑
MMAudio 44.1kHz427.6M400,6161,3950,030-29,947-2,728-2,6972,424
DACVAE MovieGen107.7M1280,4531,3100,00610,26410,68010,6814,246
SAME-L852.1M2560,7741,5750,0079,93910,37410,3762,982
KVAE-Audio166.9M640,4631,3140,0069,95210,37710,3844,266
audio
audio-to-audio
diffusers
kvae-audio
KVAE-Audio
safetensors

Contributors

funnylittleman

11 commits

ivnvalex

7 commits

nielsr

1 commits

svaleryk

1 commits

kandinskylab/KVAE-Audio

Model

KVAE-Audio is a continuous, full-band (48 kHz) audio autoencoder. It compresses raw waveforms into compact continuous latents and reconstructs them with high fidelity across speech, music, and general sound. The model is designed not only for faithful reconstruction, but as a _latent space for generative models_ — in our internal text-to-audio pipeline, swapping the autoencoder for KVAE-Audio improves generation quality under a fixed generator.

58

20 commits

3 linked in READMEs

updated Aug 10, 2026

See the code

README

KVAE-Audio

KVAE-Audio is a continuous, full-band (48 kHz) audio autoencoder. It compresses raw waveforms into compact continuous latents and reconstructs them with high fidelity across speech, music, and general sound. The model is designed not only for faithful reconstruction, but as a latent space for generative models — in our internal text-to-audio pipeline, swapping the autoencoder for KVAE-Audio improves generation quality under a fixed generator.

Evaluation results

Evaluation of latent space qualities for generation

Generative quality is established under a fixed generator — same DiT architecture, training data, and number of steps — varying only the autoencoder. We report objective generation metrics and blind human side-by-side below.

AudioCaps test set

Model# ParamsLatent dimCLAP↑CE↑PQ↑FAD (PANNs)↓FAD (PASST)↓FAD (VGGIsh)↓
MMAudio 44.1kHz427.6M400,3363,9096,19217,873195,9101,364
DACVAE MovieGen107.7M1280,3133,7726,16720,558234,3121,700
SAME-L852.1M2560,3223,5885,75618,446240,6351,325
KVAE-Audio166.9M640,3443,9826,24215,381193,7601,210

Song Describer

Model# ParamsLatent dimCLAP↑CE↑PQ↑FAD (PANNs)↓FAD (PASST)↓FAD (VGGIsh)↓
MMAudio 44.1kHz427.6M400,3567,1367,7075,412158,5990,356
DACVAE MovieGen107.7M1280,3126,9537,53810,194214,0091,046
SAME-L852.1M2560,3457,0767,4658,442250,6680,987
KVAE-Audio166.9M640,3397,2167,9297,971189,4270,599

LibriSpeech test-clean

Model# ParamsLatent dimCLAP↑CE↑PQ↑FAD (PANNs)↓FAD (PASST)↓FAD (VGGIsh)↓WER↓CER↓
MMAudio 44.1kHz427.6M400,3685,7046,6298,305105,9312,0010,2570,593
DACVAE MovieGen107.7M1280,4135,4827,0525,008210,4781,5010,9111,048
SAME-L852.1M2560,3794,6175,02410,257301,5082,7210,3490,629
KVAE-Audio166.9M640,3895,9066,9404,677185,6092,1380,2440,576

Reconstructions

Reconstruction is evaluated on open datasets across domains (the released weights directly substantiate these numbers). Baselines: MMAudio 44.1 kHz VAE, DACVAE from MovieGen Audio, SAME-L (Stable Audio 3 VAE).

AudioSet eval

Model# ParamsLatent dimMEL↓STFT↓Waveform↓SI-SDR↑SDR↑SNR↑
MMAudio 44.1kHz427.6M400,6361,9380,106-32,080-2,682-2,686
DACVAE MovieGen107.7M1280,6692,2750,0298,3849,4219,416
SAME-L852.1M2560,9862,7260,0279,58610,34710,339
KVAE-Audio166.9M640,5371,7700,0279,0659,9209,933

MUSDB18-HQ

Model# ParamsLatent dimMEL↓STFT↓Waveform↓SI-SDR↑SDR↑SNR↑
MMAudio 44.1kHz427.6M400,6811,8650,114-40,204-3,274-3,273
DACVAE MovieGen107.7M1280,5191,7620,0249,68810,04610,047
SAME-L852.1M2560,6681,7860,02310,27810,64810,648
KVAE-Audio166.9M640,5161,7250,02210,39010,67510,677

EARS

Model# ParamsLatent dimMEL↓STFT↓Waveform↓SI-SDR↑SDR↑SNR↑PESQ↑
MMAudio 44.1kHz427.6M400,6161,3950,030-29,947-2,728-2,6972,424
DACVAE MovieGen107.7M1280,4531,3100,00610,26410,68010,6814,246
SAME-L852.1M2560,7741,5750,0079,93910,37410,3762,982
KVAE-Audio166.9M640,4631,3140,0069,95210,37710,3844,266
audio
audio-to-audio
diffusers
kvae-audio
KVAE-Audio
safetensors

Contributors

funnylittleman

11 commits

ivnvalex

7 commits

nielsr

1 commits

svaleryk

1 commits