Paper, Code and Statistics for Self-Supervised Learning and Pre-Training on Speech.
214
47 commits
updated Jan 18, 2024
Table of Contents generated with DocToc
Papers, Resources, and Statistics for Self-Supervised Learning and Pre-Training on Speech.
π represents important papers.
arXiv 2018INTERSPEECH 2019INTERSPEECH 2019arXiv 2019, ICLR 2020arXiv 2019INTERSPEECH 2019EMNLP 2020ACL 2020ICASSP 2020ICASSP 2020ICASSP 2020ICASSP 2020INTERSPEECH 2020NeurIPS 2020arXiv 2020arXiv 2020, ICASSP 2021arXiv 2020, ICASSP 2021arXiv 2020, NeurIPS Workshop 2020ACL 2021TASLP 2021INTERSPEECH 2021arXiv 2021NeurIPS 2021TASLP 2021INTERSPEECH 2021EMNLP 2021ICASSP 2021arXiv 2021, JSTSP 2022arXiv 2021, JSTSP 2022arXiv 2021, ACL 2022ICML 2022ICML 2022ACL 2022SLT 2022ICASSP 2022INTERSPEECH 2022ICLR 2022arXiv 2022, ICASSP 2023INTERSPEECH 2022INTERSPEECH 2022arXiv 2022arXiv 2022, INTERSPEECH 2023arXiv 2022, INTERSPEECH 2023ICASSP 2023ICASSP 2023INTERSPEECH 2023INTERSPEECH 2023ICASSP 2021arXiv 2021arXiv 2022INTERSPEECH 2022ACL 2022AAAI 2022INTERSPEECH 2022EMNLP 2022arXiv 2022arXiv 2022ICASSP 2023IJCNN 2021NeurIPS 2022INTERSPEECH 2022ICML 2023arXiv 2023arXiv 2024INTERSPEECH 2019INTERSPEECH 2020NAACL 2022ICASSP 2022INTERSPEECH 2022INTERSPEECH 2022INTERSPEECH 2022arXiv 2022ASRU 2023Speech processing Universal PERformance Benchmark (SUPERB)
Self-Supervised Speech Pre-training and Representation Learning (S3PRL)
Statistics on speech pretraining.
| Size | Transformer | Samples | Batch Size | Train Time |
|---|---|---|---|---|
| BASE | 12 blocks, model dimension 768, FFN 3072, 8 heads | 1.4m(cropped)/GPU | 1.6h | 400k updates, 64 V100 * 1.6d |
| LARGE | 24 blocks, model dimension 1024, FFN 4096, 16 heads | 1.2m(cropped)/GPU | 2.7h | 250k updates, 128 V100 * 2.3d(Librispeech) 600k updates, 128 V100 * 5.2d(LibriVox) |
| Method | Feature Extractor | Batch Size | Train Time |
|---|---|---|---|
| wav2vec-U | wav2vec 2.0 LARGE | 160 unlabeled audio + 160 text samples | 150k steps, single V100 * 12h |
| wav2vec-U + self training | wav2vec 2.0 LARGE | / | 80k updates, 8 V100(Librispeech) 13k updates, 4V100(TIMIT) |
| Size | Feature Extractor | Batch Size | Stage | Train Time |
|---|---|---|---|---|
| BASE | wav2vec 2.0 BASE(95M) | 87.5s | 1: MFCC 250k steps 2: 6-th transformer layer 400k steps | 9.5h/100k steps, 32GPUs(Librispeech-960) |
| LARGE | wav2vec 2.0 LARGE(317M) | 56.25s | 3: 9-th transformer layer from BASE HuBERT 400k steps | 9.5h/100k steps, 128GPUs(Libri-light-60k) |
| X-LARGE | Conformer XXL(964M) | 22.5s | 3: 9-th transformer layer from BASE HuBERT 400k steps | 9.5h/100k steps, 256GPUs(Libri-light-60k) |
45 commits
2 commits
Paper, Code and Statistics for Self-Supervised Learning and Pre-Training on Speech.
214
47 commits
updated Jan 18, 2024
Table of Contents generated with DocToc
Papers, Resources, and Statistics for Self-Supervised Learning and Pre-Training on Speech.
π represents important papers.
arXiv 2018INTERSPEECH 2019INTERSPEECH 2019arXiv 2019, ICLR 2020arXiv 2019INTERSPEECH 2019EMNLP 2020ACL 2020ICASSP 2020ICASSP 2020ICASSP 2020ICASSP 2020INTERSPEECH 2020NeurIPS 2020arXiv 2020arXiv 2020, ICASSP 2021arXiv 2020, ICASSP 2021arXiv 2020, NeurIPS Workshop 2020ACL 2021TASLP 2021INTERSPEECH 2021arXiv 2021NeurIPS 2021TASLP 2021INTERSPEECH 2021EMNLP 2021ICASSP 2021arXiv 2021, JSTSP 2022arXiv 2021, JSTSP 2022arXiv 2021, ACL 2022ICML 2022ICML 2022ACL 2022SLT 2022ICASSP 2022INTERSPEECH 2022ICLR 2022arXiv 2022, ICASSP 2023INTERSPEECH 2022INTERSPEECH 2022arXiv 2022arXiv 2022, INTERSPEECH 2023arXiv 2022, INTERSPEECH 2023ICASSP 2023ICASSP 2023INTERSPEECH 2023INTERSPEECH 2023ICASSP 2021arXiv 2021arXiv 2022INTERSPEECH 2022ACL 2022AAAI 2022INTERSPEECH 2022EMNLP 2022arXiv 2022arXiv 2022ICASSP 2023IJCNN 2021NeurIPS 2022INTERSPEECH 2022ICML 2023arXiv 2023arXiv 2024INTERSPEECH 2019INTERSPEECH 2020NAACL 2022ICASSP 2022INTERSPEECH 2022INTERSPEECH 2022INTERSPEECH 2022arXiv 2022ASRU 2023Speech processing Universal PERformance Benchmark (SUPERB)
Self-Supervised Speech Pre-training and Representation Learning (S3PRL)
Statistics on speech pretraining.
| Size | Transformer | Samples | Batch Size | Train Time |
|---|---|---|---|---|
| BASE | 12 blocks, model dimension 768, FFN 3072, 8 heads | 1.4m(cropped)/GPU | 1.6h | 400k updates, 64 V100 * 1.6d |
| LARGE | 24 blocks, model dimension 1024, FFN 4096, 16 heads | 1.2m(cropped)/GPU | 2.7h | 250k updates, 128 V100 * 2.3d(Librispeech) 600k updates, 128 V100 * 5.2d(LibriVox) |
| Method | Feature Extractor | Batch Size | Train Time |
|---|---|---|---|
| wav2vec-U | wav2vec 2.0 LARGE | 160 unlabeled audio + 160 text samples | 150k steps, single V100 * 12h |
| wav2vec-U + self training | wav2vec 2.0 LARGE | / | 80k updates, 8 V100(Librispeech) 13k updates, 4V100(TIMIT) |
| Size | Feature Extractor | Batch Size | Stage | Train Time |
|---|---|---|---|---|
| BASE | wav2vec 2.0 BASE(95M) | 87.5s | 1: MFCC 250k steps 2: 6-th transformer layer 400k steps | 9.5h/100k steps, 32GPUs(Librispeech-960) |
| LARGE | wav2vec 2.0 LARGE(317M) | 56.25s | 3: 9-th transformer layer from BASE HuBERT 400k steps | 9.5h/100k steps, 128GPUs(Libri-light-60k) |
| X-LARGE | Conformer XXL(964M) | 22.5s | 3: 9-th transformer layer from BASE HuBERT 400k steps | 9.5h/100k steps, 256GPUs(Libri-light-60k) |
45 commits
2 commits