Небольшой CLI-эксперимент для генерации речи через HumeAI TADA.
Скрипт берет:
и сохраняет результат в WAV.
TADA из README проекта ставится как hume-tada, но практически важно и окружение:
3.11 или 3.12;cuda, на cpu будет очень медленно;tada-стека нужен доступ к gated-модели meta-llama/Llama-3.2-1B и локальный huggingface-cli login или HF_TOKEN.Если используешь uv:
uv sync
Если локально сейчас стоит Python 3.13, создай окружение на 3.11/3.12 и потом запусти uv sync.
uv run python main.py \
--text "Привет. Это тест синтеза речи через TADA." \
--reference-audio /path/to/voice.wav \
--output output.wav
Для неанглийского prompt-аудио лучше добавить transcript и aligner:
uv run python main.py \
--text "今日はとても良い天気ですね。" \
--reference-audio /path/to/ja-voice.wav \
--reference-text "このムキムキのお兄さんがいるし バーだし少し高そうだと思いますよね" \
--language ja \
--output output.wav
--text: текст для синтеза.--reference-audio: путь к голосовому prompt-аудио. Для TADA это обязательный вход.--reference-text: транскрипт prompt-аудио. Необязателен, но полезен; для non-English обычно стоит передавать.--language: multilingual aligner (ar, ch, de, es, fr, it, ja, pl, pt).--device: auto, cuda, mps, cpu.--dtype: auto, float16, bfloat16, float32.--num-extra-steps: продолжение после исходного текста.--output-sample-rate: sample rate итогового WAV, по умолчанию 24000.TADA в текущем API не делает "чистый text-only TTS": ему нужен audio prompt, из которого encoder строит prompt для model.generate().24000 для сохранения WAV выбрано как безопасный дефолт для voice codec; если в твоей версии модели ожидается другой sample rate, его можно переопределить через --output-sample-rate.tada-3b-ml тяжелая модель, на CPU/MPS запуск может быть ограниченно практичным.MPS backend out of memory уже на загрузке модели; в таком случае самый безопасный fallback это --device cpu.Python
100.0%
Небольшой CLI-эксперимент для генерации речи через HumeAI TADA.
Скрипт берет:
и сохраняет результат в WAV.
TADA из README проекта ставится как hume-tada, но практически важно и окружение:
3.11 или 3.12;cuda, на cpu будет очень медленно;tada-стека нужен доступ к gated-модели meta-llama/Llama-3.2-1B и локальный huggingface-cli login или HF_TOKEN.Если используешь uv:
uv sync
Если локально сейчас стоит Python 3.13, создай окружение на 3.11/3.12 и потом запусти uv sync.
uv run python main.py \
--text "Привет. Это тест синтеза речи через TADA." \
--reference-audio /path/to/voice.wav \
--output output.wav
Для неанглийского prompt-аудио лучше добавить transcript и aligner:
uv run python main.py \
--text "今日はとても良い天気ですね。" \
--reference-audio /path/to/ja-voice.wav \
--reference-text "このムキムキのお兄さんがいるし バーだし少し高そうだと思いますよね" \
--language ja \
--output output.wav
--text: текст для синтеза.--reference-audio: путь к голосовому prompt-аудио. Для TADA это обязательный вход.--reference-text: транскрипт prompt-аудио. Необязателен, но полезен; для non-English обычно стоит передавать.--language: multilingual aligner (ar, ch, de, es, fr, it, ja, pl, pt).--device: auto, cuda, mps, cpu.--dtype: auto, float16, bfloat16, float32.--num-extra-steps: продолжение после исходного текста.--output-sample-rate: sample rate итогового WAV, по умолчанию 24000.TADA в текущем API не делает "чистый text-only TTS": ему нужен audio prompt, из которого encoder строит prompt для model.generate().24000 для сохранения WAV выбрано как безопасный дефолт для voice codec; если в твоей версии модели ожидается другой sample rate, его можно переопределить через --output-sample-rate.tada-3b-ml тяжелая модель, на CPU/MPS запуск может быть ограниченно практичным.MPS backend out of memory уже на загрузке модели; в таком случае самый безопасный fallback это --device cpu.Python
100.0%