This dataset is a synthetic code-switching evaluation set built from the google/fleurs corpus.
Each sample is a single long-form audio sequence (minimum 5 minutes by default) composed by concatenating short utterances from multiple languages.
The goal is to provide a controlled benchmark for testing ASR robustness when language switches happen frequently inside one recording.
google/fleurs Parquet files loaded per language/split (default split: test).en, fr, es, de, ru, it, pt, nl.--target-sr, default 16kHz) and converted to mono when needed.id: unique sample index.audio: concatenated waveform and sampling rate.transcription: plain concatenation of chunk transcripts.transcription_tagged: transcript with inline language and timing markers for each chunk, formatted as<lang><start:SS.ss>text<end:SS.ss>.duration_sec: final sample duration in seconds.languages: languages selected for that sample.seed: per-sample random seed.This dataset is a synthetic code-switching evaluation set built from the google/fleurs corpus.
Each sample is a single long-form audio sequence (minimum 5 minutes by default) composed by concatenating short utterances from multiple languages.
The goal is to provide a controlled benchmark for testing ASR robustness when language switches happen frequently inside one recording.
google/fleurs Parquet files loaded per language/split (default split: test).en, fr, es, de, ru, it, pt, nl.--target-sr, default 16kHz) and converted to mono when needed.id: unique sample index.audio: concatenated waveform and sampling rate.transcription: plain concatenation of chunk transcripts.transcription_tagged: transcript with inline language and timing markers for each chunk, formatted as<lang><start:SS.ss>text<end:SS.ss>.duration_sec: final sample duration in seconds.languages: languages selected for that sample.seed: per-sample random seed.