AudenAI/auden-asr-zh-en

Model

1

stars

10

commits

3

linked in READMEs

Jan 27, 2026

updated

asr
automatic-speech-recognition
chinese
english
safetensors
speech

README

auden-asr-zh-en: Chinese-English ASR

This model card describes AudenAI/auden-asr-zh-en, a bilingual ASR model for Chinese and English speech. It is a pruned RNN-T ASR system with a Zipformer encoder and is designed for non-streaming transcription only. It is a small model (~170M parameters) designed for fast training and inference. Training uses 245,815 hours of Chinese, English, and code-switching data summarized below, and the model targets robust accuracy across common Chinese and English benchmarks.

πŸ” What Can This Model Do?

  • πŸŽ™οΈ Chinese ASR (Mandarin transcription)
  • 🌍 English ASR (English transcription)
  • 🧩 Robust performance across mixed Chinese/English data

Quick Start

Non-streaming Usage

from auden.auto.auto_model import AutoModel

# 1) Load a model checkpoint directory (contains config.json + weights)
model_dir = "AudenAI/auden-asr-zh-en"  # HF repo id or exported directory
model = AutoModel.from_pretrained(model_dir)
model = model.to("cuda")
model.eval()

# 2) Prepare input features (x, x_lens). If you have raw audio, you can use
#    model.speech_encoder.extract_feature(wav) to get (x, x_lens).
x, x_lens = ...  # Tensor shapes: (B, T, F), (B,)

inputs = (x, x_lens)
# Alternatively, you can pass WAV inputs directly:
# - List of WAV paths (str):
#   inputs = ["/abs/a.wav", "/abs/b.wav"]
# - List of mono waveforms (Tensor/ndarray), 16 kHz:
#   inputs = [torch.randn(16000*5), torch.randn(16000*3)]

# 3) ASR (greedy)
hyp = model.generate(inputs)

πŸ“Œ Model Characteristics

  • Model ID: AudenAI/auden-asr-zh-en
  • Input: Raw audio waveform (16 kHz recommended)
  • Output: Chinese and English transcription
  • Decoding: Greedy search (non-streaming)
  • Task: transcribe

πŸ“š Training Data Composition

This model is trained using Chinese, English, and code-switching data only:

LanguageData SourceTypeHoursTotal Hours
Chinese (Zh)WenetSpeechOpen Source10,005129,265
AISHELL-2Open Source1,000
AISHELL-1Open Source150
Common VoiceOpen Source237
YodasOpen Source222
In-house DataIn-house117,651
English (En)LibriheavyOpen Source45,751107,626
Multilingual LibriSpeech (MLS)Open Source44,659
GigaSpeechOpen Source10,000
YodasOpen Source3,426
Common VoiceOpen Source1,778
LibriSpeechOpen Source960
VoxPopuliOpen Source522
TED-LIUMOpen Source453
AMI CorpusOpen Source77
Code-SwitchTALCSOpen Source5558,924
In-house DataIn-house8,369

πŸ“Š Evaluation

DatasetWER
librispeech-test-clean1.81
librispeech-test-other3.63
fleurs-en7.41
commonvoice20-en10.33
fleurs-zh-CN6.35
commonvoice20-zh-CN6.63
aishell1.51
aishell22.60
wenet_test_meeting5.19
wenet_test_net5.51
kespeech9.72
talcs9.86
speechio_02.15
speechio_10.80
speechio_23.10
speechio_31.36
speechio_42.36
speechio_51.70
speechio_65.83
speechio_74.89
speechio_84.73
speechio_93.56
speechio_103.72
speechio_111.65
speechio_121.98
speechio_133.84
speechio_144.51
speechio_156.03
speechio_163.76
speechio_172.77
speechio_182.29
speechio_192.72
speechio_203.19
speechio_213.33
speechio_223.94
speechio_233.72
speechio_245.25
speechio_253.99
speechio_263.84

⚠️ Limitations

  • Performance depends on audio quality and recording conditions.
  • Not designed for safety-critical applications.

Contributors

yshao18

10 commits

AudenAI/auden-asr-zh-en

Model

1

stars

10

commits

3

linked in READMEs

Jan 27, 2026

updated

asr
automatic-speech-recognition
chinese
english
safetensors
speech

README

auden-asr-zh-en: Chinese-English ASR

This model card describes AudenAI/auden-asr-zh-en, a bilingual ASR model for Chinese and English speech. It is a pruned RNN-T ASR system with a Zipformer encoder and is designed for non-streaming transcription only. It is a small model (~170M parameters) designed for fast training and inference. Training uses 245,815 hours of Chinese, English, and code-switching data summarized below, and the model targets robust accuracy across common Chinese and English benchmarks.

πŸ” What Can This Model Do?

  • πŸŽ™οΈ Chinese ASR (Mandarin transcription)
  • 🌍 English ASR (English transcription)
  • 🧩 Robust performance across mixed Chinese/English data

Quick Start

Non-streaming Usage

from auden.auto.auto_model import AutoModel

# 1) Load a model checkpoint directory (contains config.json + weights)
model_dir = "AudenAI/auden-asr-zh-en"  # HF repo id or exported directory
model = AutoModel.from_pretrained(model_dir)
model = model.to("cuda")
model.eval()

# 2) Prepare input features (x, x_lens). If you have raw audio, you can use
#    model.speech_encoder.extract_feature(wav) to get (x, x_lens).
x, x_lens = ...  # Tensor shapes: (B, T, F), (B,)

inputs = (x, x_lens)
# Alternatively, you can pass WAV inputs directly:
# - List of WAV paths (str):
#   inputs = ["/abs/a.wav", "/abs/b.wav"]
# - List of mono waveforms (Tensor/ndarray), 16 kHz:
#   inputs = [torch.randn(16000*5), torch.randn(16000*3)]

# 3) ASR (greedy)
hyp = model.generate(inputs)

πŸ“Œ Model Characteristics

  • Model ID: AudenAI/auden-asr-zh-en
  • Input: Raw audio waveform (16 kHz recommended)
  • Output: Chinese and English transcription
  • Decoding: Greedy search (non-streaming)
  • Task: transcribe

πŸ“š Training Data Composition

This model is trained using Chinese, English, and code-switching data only:

LanguageData SourceTypeHoursTotal Hours
Chinese (Zh)WenetSpeechOpen Source10,005129,265
AISHELL-2Open Source1,000
AISHELL-1Open Source150
Common VoiceOpen Source237
YodasOpen Source222
In-house DataIn-house117,651
English (En)LibriheavyOpen Source45,751107,626
Multilingual LibriSpeech (MLS)Open Source44,659
GigaSpeechOpen Source10,000
YodasOpen Source3,426
Common VoiceOpen Source1,778
LibriSpeechOpen Source960
VoxPopuliOpen Source522
TED-LIUMOpen Source453
AMI CorpusOpen Source77
Code-SwitchTALCSOpen Source5558,924
In-house DataIn-house8,369

πŸ“Š Evaluation

DatasetWER
librispeech-test-clean1.81
librispeech-test-other3.63
fleurs-en7.41
commonvoice20-en10.33
fleurs-zh-CN6.35
commonvoice20-zh-CN6.63
aishell1.51
aishell22.60
wenet_test_meeting5.19
wenet_test_net5.51
kespeech9.72
talcs9.86
speechio_02.15
speechio_10.80
speechio_23.10
speechio_31.36
speechio_42.36
speechio_51.70
speechio_65.83
speechio_74.89
speechio_84.73
speechio_93.56
speechio_103.72
speechio_111.65
speechio_121.98
speechio_133.84
speechio_144.51
speechio_156.03
speechio_163.76
speechio_172.77
speechio_182.29
speechio_192.72
speechio_203.19
speechio_213.33
speechio_223.94
speechio_233.72
speechio_245.25
speechio_253.99
speechio_263.84

⚠️ Limitations

  • Performance depends on audio quality and recording conditions.
  • Not designed for safety-critical applications.

Contributors

yshao18

10 commits