0
stars
2
commits
5
linked in READMEs
Feb 10, 2026
updated
This model was converted to MLX format from nvidia/diar_sortformer_4spk-v1 using mlx-audio version 0.3.2.
Refer to the original model card for more details on the model.
pip install -U mlx-audio
from mlx_audio.vad import load
model = load("mlx-community/diar_sortformer_4spk-v1-fp32")
result = model.generate("meeting.wav", threshold=0.5, verbose=True)
print(result.text)
for seg in result.segments:
print(f"Speaker {seg.speaker}: {seg.start:.2f}s - {seg.end:.2f}s")
from mlx_audio.vad import load
model = load("mlx-community/diar_sortformer_4spk-v1-fp32")
for result in model.generate_stream("meeting.wav", chunk_duration=5.0):
for seg in result.segments:
print(f"Speaker {seg.speaker}: {seg.start:.2f}s - {seg.end:.2f}s")
from mlx_audio.vad import load
model = load("mlx-community/diar_sortformer_4spk-v1-fp32")
state = model.init_streaming_state()
for chunk in mic_stream(): # your audio source
result, state = model.feed(chunk, state, sample_rate=16000)
for seg in result.segments:
print(f"Speaker {seg.speaker}: {seg.start:.2f}s - {seg.end:.2f}s")
Ported from NVIDIA NeMo SortformerEncLabelModel.
2 commits
0
stars
2
commits
5
linked in READMEs
Feb 10, 2026
updated
This model was converted to MLX format from nvidia/diar_sortformer_4spk-v1 using mlx-audio version 0.3.2.
Refer to the original model card for more details on the model.
pip install -U mlx-audio
from mlx_audio.vad import load
model = load("mlx-community/diar_sortformer_4spk-v1-fp32")
result = model.generate("meeting.wav", threshold=0.5, verbose=True)
print(result.text)
for seg in result.segments:
print(f"Speaker {seg.speaker}: {seg.start:.2f}s - {seg.end:.2f}s")
from mlx_audio.vad import load
model = load("mlx-community/diar_sortformer_4spk-v1-fp32")
for result in model.generate_stream("meeting.wav", chunk_duration=5.0):
for seg in result.segments:
print(f"Speaker {seg.speaker}: {seg.start:.2f}s - {seg.end:.2f}s")
from mlx_audio.vad import load
model = load("mlx-community/diar_sortformer_4spk-v1-fp32")
state = model.init_streaming_state()
for chunk in mic_stream(): # your audio source
result, state = model.feed(chunk, state, sample_rate=16000)
for seg in result.segments:
print(f"Speaker {seg.speaker}: {seg.start:.2f}s - {seg.end:.2f}s")
Ported from NVIDIA NeMo SortformerEncLabelModel.
2 commits