mudler/parakeet-cpp-gguf

Model

66

stars

57

commits

1

repos using this model

1

linked in READMEs

Jun 6, 2026

updated

asr
automatic-speech-recognition
cpp-inference
ggml
gguf
nemo
parakeet
parakeet.cpp

README

Parakeet GGUF — models for parakeet.cpp

GGUF-format weights for parakeet.cpp, a C++/ggml port of NVIDIA NeMo Parakeet that matches the upstream PyTorch models on CPU. This single repo collects every supported model × quantization as a flat set of .gguf files — download just the one you need.

F16 is the recommended default — same accuracy as F32, ~1.7× smaller, and typically the fastest on modern CPUs via ggml's F32×F16 matmul fast path.

Models

tdt_ctc-110m

Source: nvidia/parakeet-tdt_ctc-110m · Hybrid TDT+CTC (FastConformer) · heads: TDT + CTC

FileVariantSizeWER vs NeMo
tdt_ctc-110m-f16.ggufrecommendedF16267.5 MB0.0000
tdt_ctc-110m-q8_0.ggufQ8_0177.8 MB0.0000
tdt_ctc-110m-q6_k.ggufQ6_K155.9 MBnot measured
tdt_ctc-110m-q5_k.ggufQ5_K143.3 MBnot measured
tdt_ctc-110m-q4_k.ggufQ4_K131.4 MB0.0000

realtime_eou_120m-v1

Source: nvidia/parakeet_realtime_eou_120m-v1 · Cache-aware streaming RNNT (FastConformer, EOU/EOB) · heads: RNNT (streaming)

FileVariantSizeWER vs NeMo
realtime_eou_120m-v1-f16.ggufrecommendedF16266.5 MBnot measured
realtime_eou_120m-v1-q8_0.ggufQ8_0176.0 MBnot measured
realtime_eou_120m-v1-q6_k.ggufQ6_K153.9 MBnot measured
realtime_eou_120m-v1-q5_k.ggufQ5_K141.2 MBnot measured
realtime_eou_120m-v1-q4_k.ggufQ4_K129.1 MBnot measured

ctc-0.6b

Source: nvidia/parakeet-ctc-0.6b · CTC (FastConformer) · heads: CTC

FileVariantSizeWER vs NeMo
ctc-0.6b-f16.ggufrecommendedF161373.4 MB0.0000
ctc-0.6b-q8_0.ggufQ8_0875.4 MB0.0000
ctc-0.6b-q6_k.ggufQ6_K746.8 MBnot measured
ctc-0.6b-q5_k.ggufQ5_K676.3 MBnot measured
ctc-0.6b-q4_k.ggufQ4_K609.9 MBnot measured

rnnt-0.6b

Source: nvidia/parakeet-rnnt-0.6b · RNNT transducer (FastConformer) · heads: RNNT

FileVariantSizeWER vs NeMo
rnnt-0.6b-f16.ggufrecommendedF161402.8 MB0.0000
rnnt-0.6b-q8_0.ggufQ8_0903.9 MB0.0000
rnnt-0.6b-q6_k.ggufQ6_K776.3 MBnot measured
rnnt-0.6b-q5_k.ggufQ5_K705.7 MBnot measured
rnnt-0.6b-q4_k.ggufQ4_K639.2 MBnot measured

tdt-0.6b-v2

Source: nvidia/parakeet-tdt-0.6b-v2 · TDT transducer (FastConformer) · heads: TDT

FileVariantSizeWER vs NeMo
tdt-0.6b-v2-f16.ggufrecommendedF161404.2 MB0.0000
tdt-0.6b-v2-q8_0.ggufQ8_0903.8 MB0.0000
tdt-0.6b-v2-q6_k.ggufQ6_K775.9 MBnot measured
tdt-0.6b-v2-q5_k.ggufQ5_K705.0 MBnot measured
tdt-0.6b-v2-q4_k.ggufQ4_K638.4 MBnot measured

tdt-0.6b-v3

Source: nvidia/parakeet-tdt-0.6b-v3 · TDT transducer (FastConformer) · heads: TDT

FileVariantSizeWER vs NeMo
tdt-0.6b-v3-f16.ggufrecommendedF161441.0 MB0.0000
tdt-0.6b-v3-q8_0.ggufQ8_0940.7 MB0.0000
tdt-0.6b-v3-q6_k.ggufQ6_K812.7 MBnot measured
tdt-0.6b-v3-q5_k.ggufQ5_K741.9 MBnot measured
tdt-0.6b-v3-q4_k.ggufQ4_K675.2 MBnot measured

ctc-1.1b

Source: nvidia/parakeet-ctc-1.1b · CTC (FastConformer) · heads: CTC

FileVariantSizeWER vs NeMo
ctc-1.1b-f16.ggufrecommendedF162395.8 MB0.0000
ctc-1.1b-q8_0.ggufQ8_01526.3 MB0.0000
ctc-1.1b-q6_k.ggufQ6_K1301.7 MBnot measured
ctc-1.1b-q5_k.ggufQ5_K1178.5 MBnot measured
ctc-1.1b-q4_k.ggufQ4_K1062.6 MBnot measured

rnnt-1.1b

Source: nvidia/parakeet-rnnt-1.1b · RNNT transducer (FastConformer) · heads: RNNT

FileVariantSizeWER vs NeMo
rnnt-1.1b-f16.ggufrecommendedF162425.2 MB0.0000
rnnt-1.1b-q8_0.ggufQ8_01554.7 MB0.0000
rnnt-1.1b-q6_k.ggufQ6_K1331.2 MBnot measured
rnnt-1.1b-q5_k.ggufQ5_K1207.9 MBnot measured
rnnt-1.1b-q4_k.ggufQ4_K1091.9 MBnot measured

tdt-1.1b

Source: nvidia/parakeet-tdt-1.1b · TDT transducer (FastConformer) · heads: TDT

FileVariantSizeWER vs NeMo
tdt-1.1b-f16.ggufrecommendedF162425.3 MB0.0000
tdt-1.1b-q8_0.ggufQ8_01554.8 MB0.0000
tdt-1.1b-q6_k.ggufQ6_K1331.2 MBnot measured
tdt-1.1b-q5_k.ggufQ5_K1207.9 MBnot measured
tdt-1.1b-q4_k.ggufQ4_K1091.9 MBnot measured

tdt_ctc-1.1b

Source: nvidia/parakeet-tdt_ctc-1.1b · Hybrid TDT+CTC (FastConformer) · heads: TDT + CTC

FileVariantSizeWER vs NeMo
tdt_ctc-1.1b-f16.ggufrecommendedF162429.5 MB0.0000
tdt_ctc-1.1b-q8_0.ggufQ8_01559.0 MB0.0000
tdt_ctc-1.1b-q6_k.ggufQ6_K1335.4 MBnot measured
tdt_ctc-1.1b-q5_k.ggufQ5_K1212.1 MBnot measured
tdt_ctc-1.1b-q4_k.ggufQ4_K1096.1 MBnot measured

WER (word error rate) is computed against the upstream NeMo reference on tests/fixtures/speech.wav (LibriSpeech 2086-149220-0033, ~7.4 s, English). 0.0 = byte-for-byte identical transcript. See parity.md and quantization.md.

Quantization notes

Quantization is applied only to the large linear weights fed directly into ggml_mul_mat (encoder FFN + attention projections, subsampling output projection, joint enc/pred projections). All other tensors (mel filterbank, LSTM prediction net, conv kernels, batch_norm stats, norms, biases, embeddings) stay F32.

Usage

# 1. Clone + build parakeet.cpp
git clone https://github.com/mudler/parakeet.cpp
cd parakeet.cpp
cmake -B build -DPARAKEET_BUILD_CLI=ON && cmake --build build -j

# 2. Download one quant (F16 recommended)
huggingface-cli download mudler/parakeet-cpp-gguf tdt_ctc-110m-f16.gguf --local-dir models/

# 3. Transcribe
build/examples/cli/parakeet-cli transcribe \
    --model models/tdt_ctc-110m-f16.gguf \
    --input audio.wav

License

The GGUF weights are derived from the NVIDIA NeMo Parakeet checkpoints, released under the CC-BY-4.0 license. The parakeet.cpp runtime is MIT-licensed.

Contributors

mudler

57 commits

mudler/parakeet-cpp-gguf

Model

66

stars

57

commits

1

repos using this model

1

linked in READMEs

Jun 6, 2026

updated

asr
automatic-speech-recognition
cpp-inference
ggml
gguf
nemo
parakeet
parakeet.cpp

README

Parakeet GGUF — models for parakeet.cpp

GGUF-format weights for parakeet.cpp, a C++/ggml port of NVIDIA NeMo Parakeet that matches the upstream PyTorch models on CPU. This single repo collects every supported model × quantization as a flat set of .gguf files — download just the one you need.

F16 is the recommended default — same accuracy as F32, ~1.7× smaller, and typically the fastest on modern CPUs via ggml's F32×F16 matmul fast path.

Models

tdt_ctc-110m

Source: nvidia/parakeet-tdt_ctc-110m · Hybrid TDT+CTC (FastConformer) · heads: TDT + CTC

FileVariantSizeWER vs NeMo
tdt_ctc-110m-f16.ggufrecommendedF16267.5 MB0.0000
tdt_ctc-110m-q8_0.ggufQ8_0177.8 MB0.0000
tdt_ctc-110m-q6_k.ggufQ6_K155.9 MBnot measured
tdt_ctc-110m-q5_k.ggufQ5_K143.3 MBnot measured
tdt_ctc-110m-q4_k.ggufQ4_K131.4 MB0.0000

realtime_eou_120m-v1

Source: nvidia/parakeet_realtime_eou_120m-v1 · Cache-aware streaming RNNT (FastConformer, EOU/EOB) · heads: RNNT (streaming)

FileVariantSizeWER vs NeMo
realtime_eou_120m-v1-f16.ggufrecommendedF16266.5 MBnot measured
realtime_eou_120m-v1-q8_0.ggufQ8_0176.0 MBnot measured
realtime_eou_120m-v1-q6_k.ggufQ6_K153.9 MBnot measured
realtime_eou_120m-v1-q5_k.ggufQ5_K141.2 MBnot measured
realtime_eou_120m-v1-q4_k.ggufQ4_K129.1 MBnot measured

ctc-0.6b

Source: nvidia/parakeet-ctc-0.6b · CTC (FastConformer) · heads: CTC

FileVariantSizeWER vs NeMo
ctc-0.6b-f16.ggufrecommendedF161373.4 MB0.0000
ctc-0.6b-q8_0.ggufQ8_0875.4 MB0.0000
ctc-0.6b-q6_k.ggufQ6_K746.8 MBnot measured
ctc-0.6b-q5_k.ggufQ5_K676.3 MBnot measured
ctc-0.6b-q4_k.ggufQ4_K609.9 MBnot measured

rnnt-0.6b

Source: nvidia/parakeet-rnnt-0.6b · RNNT transducer (FastConformer) · heads: RNNT

FileVariantSizeWER vs NeMo
rnnt-0.6b-f16.ggufrecommendedF161402.8 MB0.0000
rnnt-0.6b-q8_0.ggufQ8_0903.9 MB0.0000
rnnt-0.6b-q6_k.ggufQ6_K776.3 MBnot measured
rnnt-0.6b-q5_k.ggufQ5_K705.7 MBnot measured
rnnt-0.6b-q4_k.ggufQ4_K639.2 MBnot measured

tdt-0.6b-v2

Source: nvidia/parakeet-tdt-0.6b-v2 · TDT transducer (FastConformer) · heads: TDT

FileVariantSizeWER vs NeMo
tdt-0.6b-v2-f16.ggufrecommendedF161404.2 MB0.0000
tdt-0.6b-v2-q8_0.ggufQ8_0903.8 MB0.0000
tdt-0.6b-v2-q6_k.ggufQ6_K775.9 MBnot measured
tdt-0.6b-v2-q5_k.ggufQ5_K705.0 MBnot measured
tdt-0.6b-v2-q4_k.ggufQ4_K638.4 MBnot measured

tdt-0.6b-v3

Source: nvidia/parakeet-tdt-0.6b-v3 · TDT transducer (FastConformer) · heads: TDT

FileVariantSizeWER vs NeMo
tdt-0.6b-v3-f16.ggufrecommendedF161441.0 MB0.0000
tdt-0.6b-v3-q8_0.ggufQ8_0940.7 MB0.0000
tdt-0.6b-v3-q6_k.ggufQ6_K812.7 MBnot measured
tdt-0.6b-v3-q5_k.ggufQ5_K741.9 MBnot measured
tdt-0.6b-v3-q4_k.ggufQ4_K675.2 MBnot measured

ctc-1.1b

Source: nvidia/parakeet-ctc-1.1b · CTC (FastConformer) · heads: CTC

FileVariantSizeWER vs NeMo
ctc-1.1b-f16.ggufrecommendedF162395.8 MB0.0000
ctc-1.1b-q8_0.ggufQ8_01526.3 MB0.0000
ctc-1.1b-q6_k.ggufQ6_K1301.7 MBnot measured
ctc-1.1b-q5_k.ggufQ5_K1178.5 MBnot measured
ctc-1.1b-q4_k.ggufQ4_K1062.6 MBnot measured

rnnt-1.1b

Source: nvidia/parakeet-rnnt-1.1b · RNNT transducer (FastConformer) · heads: RNNT

FileVariantSizeWER vs NeMo
rnnt-1.1b-f16.ggufrecommendedF162425.2 MB0.0000
rnnt-1.1b-q8_0.ggufQ8_01554.7 MB0.0000
rnnt-1.1b-q6_k.ggufQ6_K1331.2 MBnot measured
rnnt-1.1b-q5_k.ggufQ5_K1207.9 MBnot measured
rnnt-1.1b-q4_k.ggufQ4_K1091.9 MBnot measured

tdt-1.1b

Source: nvidia/parakeet-tdt-1.1b · TDT transducer (FastConformer) · heads: TDT

FileVariantSizeWER vs NeMo
tdt-1.1b-f16.ggufrecommendedF162425.3 MB0.0000
tdt-1.1b-q8_0.ggufQ8_01554.8 MB0.0000
tdt-1.1b-q6_k.ggufQ6_K1331.2 MBnot measured
tdt-1.1b-q5_k.ggufQ5_K1207.9 MBnot measured
tdt-1.1b-q4_k.ggufQ4_K1091.9 MBnot measured

tdt_ctc-1.1b

Source: nvidia/parakeet-tdt_ctc-1.1b · Hybrid TDT+CTC (FastConformer) · heads: TDT + CTC

FileVariantSizeWER vs NeMo
tdt_ctc-1.1b-f16.ggufrecommendedF162429.5 MB0.0000
tdt_ctc-1.1b-q8_0.ggufQ8_01559.0 MB0.0000
tdt_ctc-1.1b-q6_k.ggufQ6_K1335.4 MBnot measured
tdt_ctc-1.1b-q5_k.ggufQ5_K1212.1 MBnot measured
tdt_ctc-1.1b-q4_k.ggufQ4_K1096.1 MBnot measured

WER (word error rate) is computed against the upstream NeMo reference on tests/fixtures/speech.wav (LibriSpeech 2086-149220-0033, ~7.4 s, English). 0.0 = byte-for-byte identical transcript. See parity.md and quantization.md.

Quantization notes

Quantization is applied only to the large linear weights fed directly into ggml_mul_mat (encoder FFN + attention projections, subsampling output projection, joint enc/pred projections). All other tensors (mel filterbank, LSTM prediction net, conv kernels, batch_norm stats, norms, biases, embeddings) stay F32.

Usage

# 1. Clone + build parakeet.cpp
git clone https://github.com/mudler/parakeet.cpp
cd parakeet.cpp
cmake -B build -DPARAKEET_BUILD_CLI=ON && cmake --build build -j

# 2. Download one quant (F16 recommended)
huggingface-cli download mudler/parakeet-cpp-gguf tdt_ctc-110m-f16.gguf --local-dir models/

# 3. Transcribe
build/examples/cli/parakeet-cli transcribe \
    --model models/tdt_ctc-110m-f16.gguf \
    --input audio.wav

License

The GGUF weights are derived from the NVIDIA NeMo Parakeet checkpoints, released under the CC-BY-4.0 license. The parakeet.cpp runtime is MIT-licensed.

Contributors

mudler

57 commits