Riconoscimento fonetico IPA da audio con architettura Ensemble (WavLM + XLS-R)
Sistema di Automatic Phoneme Recognition (APR) e Pronunciation Scoring per speaker non-nativi, basato su ensemble di modelli WavLM e XLS-R con Late Fusion.
La documentazione completa del progetto Γ¨ disponibile nella cartella docs/:
| Modello | Params | Mode | VRAM | Status | Script |
|---|---|---|---|---|---|
| HuBERT Large | 317M | Fine-tuning | ~12GB | π Best PER: 8.84% | train_hubert.py |
| WavLM Weighted | 317M | Fine-tuning | ~12GB | π Best AUC: 0.8523 | train_weighted.py |
| Late Fusion | 634M | Inference | ~16GB | π NEW | evaluate_hubert_fusion.py |
| Early Fusion | 634M | Frozen+CTC | ~20GB | π NEW | train_early_fusion.py |
| WavLM Large | 317M | Fine-tuning | ~12GB | β | train_wavlm.py |
| XLS-R 300M | 300M | Fine-tuning | ~10GB | β | train_xlsr.py |
| Whisper (Encoder) | 244M | Last 4 layers | ~8GB | β | train_whisper_encoder.py |
| Baseline MLP | 2M | Linear Probe | ~4GB | β | train_baseline_mlp.py |
Dettagli completi: docs/MODEL_ZOO.md
git clone https://github.com/maurocarlu/DeepLearning-Phoneme.git
cd DeepLearning-Phoneme
pip install -r requirements.txt
# Valutazione modelli standard (WavLM, HuBERT, XLS-R)
python scripts/evaluation/evaluate_speechocean.py --model-path outputs/final_model
# Valutazione SpeechTokenizer (Discrete)
python scripts/evaluation/evaluate_speechtokenizer.py --model-path outputs/speechtokenizer
Vedi il notebook unificato per addestrare qualsiasi modello:
notebooks/unified_trainer.ipynb
DeepLearning-Phoneme/
βββ docs/ # π DOCUMENTAZIONE COMPLETA
β βββ MODEL_ZOO.md # Dettagli modelli
β βββ ARCHITECTURE_DETAILS.md # Dettagli tecnici
β βββ BENCHMARK_GUIDE.md # Guida valutazione
βββ notebooks/ # Jupyter notebooks
βββ scripts/ # Script Python
β βββ training/ # Script di training
β βββ evaluation/ # Script di valutazione
β βββ data/ # Processing dati
βββ src/ # Moduli sorgente
βββ EXPERIMENTS.md # Log risultati
Progetto universitario - Deep Learning, Magistrale Anno 2
141 commits
Python
77.6%
Jupyter Notebook
21.8%
Riconoscimento fonetico IPA da audio con architettura Ensemble (WavLM + XLS-R)
Sistema di Automatic Phoneme Recognition (APR) e Pronunciation Scoring per speaker non-nativi, basato su ensemble di modelli WavLM e XLS-R con Late Fusion.
La documentazione completa del progetto Γ¨ disponibile nella cartella docs/:
| Modello | Params | Mode | VRAM | Status | Script |
|---|---|---|---|---|---|
| HuBERT Large | 317M | Fine-tuning | ~12GB | π Best PER: 8.84% | train_hubert.py |
| WavLM Weighted | 317M | Fine-tuning | ~12GB | π Best AUC: 0.8523 | train_weighted.py |
| Late Fusion | 634M | Inference | ~16GB | π NEW | evaluate_hubert_fusion.py |
| Early Fusion | 634M | Frozen+CTC | ~20GB | π NEW | train_early_fusion.py |
| WavLM Large | 317M | Fine-tuning | ~12GB | β | train_wavlm.py |
| XLS-R 300M | 300M | Fine-tuning | ~10GB | β | train_xlsr.py |
| Whisper (Encoder) | 244M | Last 4 layers | ~8GB | β | train_whisper_encoder.py |
| Baseline MLP | 2M | Linear Probe | ~4GB | β | train_baseline_mlp.py |
Dettagli completi: docs/MODEL_ZOO.md
git clone https://github.com/maurocarlu/DeepLearning-Phoneme.git
cd DeepLearning-Phoneme
pip install -r requirements.txt
# Valutazione modelli standard (WavLM, HuBERT, XLS-R)
python scripts/evaluation/evaluate_speechocean.py --model-path outputs/final_model
# Valutazione SpeechTokenizer (Discrete)
python scripts/evaluation/evaluate_speechtokenizer.py --model-path outputs/speechtokenizer
Vedi il notebook unificato per addestrare qualsiasi modello:
notebooks/unified_trainer.ipynb
DeepLearning-Phoneme/
βββ docs/ # π DOCUMENTAZIONE COMPLETA
β βββ MODEL_ZOO.md # Dettagli modelli
β βββ ARCHITECTURE_DETAILS.md # Dettagli tecnici
β βββ BENCHMARK_GUIDE.md # Guida valutazione
βββ notebooks/ # Jupyter notebooks
βββ scripts/ # Script Python
β βββ training/ # Script di training
β βββ evaluation/ # Script di valutazione
β βββ data/ # Processing dati
βββ src/ # Moduli sorgente
βββ EXPERIMENTS.md # Log risultati
Progetto universitario - Deep Learning, Magistrale Anno 2
141 commits
Python
77.6%
Jupyter Notebook
21.8%