4 repos
Tools and models for converting continuous speech and audio signals into discrete token sequences, enabling downstream processing by language models and other discrete-input systems. The cluster includes reference implementations like Kanade (at multiple frame rates) and SpeechTokenizer, along with supporting infrastructure for tokenization pipelines and ONNX model export. This represents a key preprocessing step in multimodal AI systems that need to bridge between continuous audio data and discrete token-based architectures.