chudinovAI/TADA_tuned

0

stars

0

commits

Python

primary language

Mar 31, 2026

updated

README

TADA TTS test

Небольшой CLI-эксперимент для генерации речи через HumeAI TADA.

Что делает

Скрипт берет:

  • текст для синтеза;
  • голосовой prompt-аудиофайл;
  • опционально транскрипт этого prompt-аудио;

и сохраняет результат в WAV.

Подготовка

TADA из README проекта ставится как hume-tada, но практически важно и окружение:

  • нужен Python 3.11 или 3.12;
  • для нормальной скорости желательно cuda, на cpu будет очень медленно;
  • веса модели подтянутся из Hugging Face при первом запуске.
  • для текущего tada-стека нужен доступ к gated-модели meta-llama/Llama-3.2-1B и локальный huggingface-cli login или HF_TOKEN.

Если используешь uv:

uv sync

Если локально сейчас стоит Python 3.13, создай окружение на 3.11/3.12 и потом запусти uv sync.

Запуск

uv run python main.py \
  --text "Привет. Это тест синтеза речи через TADA." \
  --reference-audio /path/to/voice.wav \
  --output output.wav

Для неанглийского prompt-аудио лучше добавить transcript и aligner:

uv run python main.py \
  --text "今日はとても良い天気ですね。" \
  --reference-audio /path/to/ja-voice.wav \
  --reference-text "このムキムキのお兄さんがいるし バーだし少し高そうだと思いますよね" \
  --language ja \
  --output output.wav

Аргументы

  • --text: текст для синтеза.
  • --reference-audio: путь к голосовому prompt-аудио. Для TADA это обязательный вход.
  • --reference-text: транскрипт prompt-аудио. Необязателен, но полезен; для non-English обычно стоит передавать.
  • --language: multilingual aligner (ar, ch, de, es, fr, it, ja, pl, pt).
  • --device: auto, cuda, mps, cpu.
  • --dtype: auto, float16, bfloat16, float32.
  • --num-extra-steps: продолжение после исходного текста.
  • --output-sample-rate: sample rate итогового WAV, по умолчанию 24000.

Ограничения

  • TADA в текущем API не делает "чистый text-only TTS": ему нужен audio prompt, из которого encoder строит prompt для model.generate().
  • Значение 24000 для сохранения WAV выбрано как безопасный дефолт для voice codec; если в твоей версии модели ожидается другой sample rate, его можно переопределить через --output-sample-rate.
  • Скрипт не прячет стоимость по памяти: tada-3b-ml тяжелая модель, на CPU/MPS запуск может быть ограниченно практичным.
  • На Apple Silicon возможен MPS backend out of memory уже на загрузке модели; в таком случае самый безопасный fallback это --device cpu.

chudinovAI/TADA_tuned

0

stars

0

commits

Python

primary language

Mar 31, 2026

updated

README

TADA TTS test

Небольшой CLI-эксперимент для генерации речи через HumeAI TADA.

Что делает

Скрипт берет:

  • текст для синтеза;
  • голосовой prompt-аудиофайл;
  • опционально транскрипт этого prompt-аудио;

и сохраняет результат в WAV.

Подготовка

TADA из README проекта ставится как hume-tada, но практически важно и окружение:

  • нужен Python 3.11 или 3.12;
  • для нормальной скорости желательно cuda, на cpu будет очень медленно;
  • веса модели подтянутся из Hugging Face при первом запуске.
  • для текущего tada-стека нужен доступ к gated-модели meta-llama/Llama-3.2-1B и локальный huggingface-cli login или HF_TOKEN.

Если используешь uv:

uv sync

Если локально сейчас стоит Python 3.13, создай окружение на 3.11/3.12 и потом запусти uv sync.

Запуск

uv run python main.py \
  --text "Привет. Это тест синтеза речи через TADA." \
  --reference-audio /path/to/voice.wav \
  --output output.wav

Для неанглийского prompt-аудио лучше добавить transcript и aligner:

uv run python main.py \
  --text "今日はとても良い天気ですね。" \
  --reference-audio /path/to/ja-voice.wav \
  --reference-text "このムキムキのお兄さんがいるし バーだし少し高そうだと思いますよね" \
  --language ja \
  --output output.wav

Аргументы

  • --text: текст для синтеза.
  • --reference-audio: путь к голосовому prompt-аудио. Для TADA это обязательный вход.
  • --reference-text: транскрипт prompt-аудио. Необязателен, но полезен; для non-English обычно стоит передавать.
  • --language: multilingual aligner (ar, ch, de, es, fr, it, ja, pl, pt).
  • --device: auto, cuda, mps, cpu.
  • --dtype: auto, float16, bfloat16, float32.
  • --num-extra-steps: продолжение после исходного текста.
  • --output-sample-rate: sample rate итогового WAV, по умолчанию 24000.

Ограничения

  • TADA в текущем API не делает "чистый text-only TTS": ему нужен audio prompt, из которого encoder строит prompt для model.generate().
  • Значение 24000 для сохранения WAV выбрано как безопасный дефолт для voice codec; если в твоей версии модели ожидается другой sample rate, его можно переопределить через --output-sample-rate.
  • Скрипт не прячет стоимость по памяти: tada-3b-ml тяжелая модель, на CPU/MPS запуск может быть ограниченно практичным.
  • На Apple Silicon возможен MPS backend out of memory уже на загрузке модели; в таком случае самый безопасный fallback это --device cpu.

Languages

Python

100.0%