nileq/kazakh-omni-asr-ctc

Model

Kazakh ASR — Wav2Vec2 CTC (OmniASR fine-tuned)

0

3 commits

2 linked in READMEs

updated Jun 29, 2026

See the code

README

Kazakh ASR — Wav2Vec2 CTC (OmniASR fine-tuned)

Казак тіліндегі автоматты дыбыс тану моделі (ASR) — OmniASR wav2vec2 негізінде CTC loss-пен fine-tuned.

Model Details

  • База: omnilingual-asr / wav2vec2.5 large
  • Фреймворк: fairseq2
  • Архитектура: Wav2Vec2ForCTC (24 encoder layers, 1024 hidden, 16 heads)
  • Vocab size: 9812 (SentencePiece)
  • Training steps: 20,000
  • Best training loss: -21.70
  • Sampling rate: 16kHz mono

Usage

from transformers import AutoModelForCTC, AutoProcessor
import torch

model = AutoModelForCTC.from_pretrained("nileq/kazakh-omni-asr-ctc")
processor = AutoProcessor.from_pretrained("nileq/kazakh-omni-asr-ctc")

# 16kHz аудио
import soundfile as sf
speech, _ = sf.read("kazakh_audio.wav")

inputs = processor(speech, sampling_rate=16000, return_tensors="pt", padding=True)
with torch.no_grad():
    logits = model(inputs.input_values).logits

predicted_ids = torch.argmax(logits, dim=-1)
transcription = processor.batch_decode(predicted_ids)
print(transcription[0])

Citation

Если используете модель в работе:

@misc{nurislam2025kazahasr,
  title={Kazakh ASR — Wav2Vec2 CTC (OmniASR fine-tuned)},
  author={Nurislam},
  year={2025},
  howpublished={\url{https://huggingface.co/nileq/kazakh-omni-asr-ctc}}
}
automatic-speech-recognition
kazakh
omniasr
safetensors
speech-to-text
wav2vec2

nileq/kazakh-omni-asr-ctc

Model

Kazakh ASR — Wav2Vec2 CTC (OmniASR fine-tuned)

0

3 commits

2 linked in READMEs

updated Jun 29, 2026

See the code

README

Kazakh ASR — Wav2Vec2 CTC (OmniASR fine-tuned)

Казак тіліндегі автоматты дыбыс тану моделі (ASR) — OmniASR wav2vec2 негізінде CTC loss-пен fine-tuned.

Model Details

  • База: omnilingual-asr / wav2vec2.5 large
  • Фреймворк: fairseq2
  • Архитектура: Wav2Vec2ForCTC (24 encoder layers, 1024 hidden, 16 heads)
  • Vocab size: 9812 (SentencePiece)
  • Training steps: 20,000
  • Best training loss: -21.70
  • Sampling rate: 16kHz mono

Usage

from transformers import AutoModelForCTC, AutoProcessor
import torch

model = AutoModelForCTC.from_pretrained("nileq/kazakh-omni-asr-ctc")
processor = AutoProcessor.from_pretrained("nileq/kazakh-omni-asr-ctc")

# 16kHz аудио
import soundfile as sf
speech, _ = sf.read("kazakh_audio.wav")

inputs = processor(speech, sampling_rate=16000, return_tensors="pt", padding=True)
with torch.no_grad():
    logits = model(inputs.input_values).logits

predicted_ids = torch.argmax(logits, dim=-1)
transcription = processor.batch_decode(predicted_ids)
print(transcription[0])

Citation

Если используете модель в работе:

@misc{nurislam2025kazahasr,
  title={Kazakh ASR — Wav2Vec2 CTC (OmniASR fine-tuned)},
  author={Nurislam},
  year={2025},
  howpublished={\url{https://huggingface.co/nileq/kazakh-omni-asr-ctc}}
}
automatic-speech-recognition
kazakh
omniasr
safetensors
speech-to-text
wav2vec2