BUT-FIT/Dixtral

Model

0

stars

5

commits

1

repos using this model

3

linked in READMEs

Jun 9, 2026

updated

automatic-speech-recognition
BUT-FIT
custom_code
DiCoW
Dixtral
feature-extraction
meeting-transcription
multi-talker
safetensors
speaker-diarization
speech
speech-language-model
target-speaker-asr
transformers
voxtral
Voxtral

README

🧠 Dixtral β€” BUT-FIT Diarization-Conditioned Voxtral for Target-Speaker ASR

This repository hosts Dixtral, developed by BUT Speech@FIT. Dixtral couples the Voxtral-Mini-3B spoken-language model with the DiCoW diarization-conditioned encoder, giving the LLM target-speaker awareness in multi-talker audio.

This checkpoint is tuned for target-speaker / multi-talker transcription (TS-ASR) of conversational and meeting recordings. For spoken question answering, use Dixtral_QA instead.

πŸ› οΈ Model Usage

from transformers import AutoModel, AutoProcessor

MODEL_NAME = "BUT-FIT/Dixtral"
model = AutoModel.from_pretrained(MODEL_NAME, trust_remote_code=True)
processor = AutoProcessor.from_pretrained(MODEL_NAME)

➑️ For full inference pipelines (diarization β†’ FDDT masks β†’ generation), see the Dixtral GitHub repository.


πŸ“¦ Model Details


πŸ“¬ Contact

πŸ“§ Email: ipoloka@fit.vut.cz 🏒 Affiliation: BUT Speech@FIT, Brno University of Technology πŸ”— GitHub: BUTSpeechFIT

Contributors

Lakoc

5 commits

BUT-FIT/Dixtral

Model

0

stars

5

commits

1

repos using this model

3

linked in READMEs

Jun 9, 2026

updated

automatic-speech-recognition
BUT-FIT
custom_code
DiCoW
Dixtral
feature-extraction
meeting-transcription
multi-talker
safetensors
speaker-diarization
speech
speech-language-model
target-speaker-asr
transformers
voxtral
Voxtral

README

🧠 Dixtral β€” BUT-FIT Diarization-Conditioned Voxtral for Target-Speaker ASR

This repository hosts Dixtral, developed by BUT Speech@FIT. Dixtral couples the Voxtral-Mini-3B spoken-language model with the DiCoW diarization-conditioned encoder, giving the LLM target-speaker awareness in multi-talker audio.

This checkpoint is tuned for target-speaker / multi-talker transcription (TS-ASR) of conversational and meeting recordings. For spoken question answering, use Dixtral_QA instead.

πŸ› οΈ Model Usage

from transformers import AutoModel, AutoProcessor

MODEL_NAME = "BUT-FIT/Dixtral"
model = AutoModel.from_pretrained(MODEL_NAME, trust_remote_code=True)
processor = AutoProcessor.from_pretrained(MODEL_NAME)

➑️ For full inference pipelines (diarization β†’ FDDT masks β†’ generation), see the Dixtral GitHub repository.


πŸ“¦ Model Details


πŸ“¬ Contact

πŸ“§ Email: ipoloka@fit.vut.cz 🏒 Affiliation: BUT Speech@FIT, Brno University of Technology πŸ”— GitHub: BUTSpeechFIT

Contributors

Lakoc

5 commits