Audio Understanding and Speech Models

5 repos

Multimodal audio-language models and speech recognition systems, primarily implemented in Python. This cluster contains various foundation models (MiMo-Audio, Kimi-Audio, Tar series) designed to understand and process audio alongside text, using safetensors for efficient model serialization. The repositories represent different scales and instruction-tuning approaches for building systems that can transcribe, comprehend, and reason about audio content.

Python · 2
safetensors ·264
Audio-Text-to-Text ·224
Audio-to-Audio ·224
Audio-to-Text ·224
qwen2 ·224
Text-to-Audio ·224
any-to-any ·224
Text-to-Text ·224