Anime Whisper は、特に日本語のアニメ調演技セリフドメインに特化した日本語音声認識モデルです。
このモデルは kotoba-whisper-v2.0 をベースモデルとして、約5,300時間373万ファイルのアニメ調の音声・台本データセット Galgame_Speech_ASR_16kHz でファインチューニングしたものです。 特にアニメ演技音声ドメインに特化していますが、それ以外の音声でも、他のモデルにはない特徴や高い性能を持っています。
気軽にお試しできるデモはこちらから: https://huggingface.co/spaces/litagin/anime-whisper-demo
このGitHubリポジトリは、モデル本体とは直接関係がない情報(学習コードや評価詳細や考察等)を随時更新しながら公開するためのものです(🤗モデルリポジトリを更新するとそのたびにモデルの再ダウンロードが起きる可能性があるため隔離)。
以下だいたいモデルカードからコピペ:
Anime Whisperは、他モデルに比べて一般的に次のような傾向があります。
import torch
from transformers import pipeline
pipe = pipeline(
"automatic-speech-recognition",
model="litagin/anime-whisper",
device="cuda",
torch_dtype=torch.float16,
chunk_length_s=30.0,
batch_size=64,
)
audio_path = "test.wav"
result = pipe(audio_path)
print(result["text"])
複数ファイルを一気に推論する場合は pipe に単にファイルパスのリストを渡せばよいです。
evaluation.md を参照してください。
ああああーーーーこらーっ!!!! なにそれ!?!?!?!?…… (日本語表記としては2個用いる …… が正しいが、ほぼ常に1個のみ … で出力される)からだ → 身体 等や、その他固有名詞等)examples.md を参照してください。
詳しい学習手順やハイパーパラメータや学習コードはそのうちここで公開予定です。
2 commits
Anime Whisper は、特に日本語のアニメ調演技セリフドメインに特化した日本語音声認識モデルです。
このモデルは kotoba-whisper-v2.0 をベースモデルとして、約5,300時間373万ファイルのアニメ調の音声・台本データセット Galgame_Speech_ASR_16kHz でファインチューニングしたものです。 特にアニメ演技音声ドメインに特化していますが、それ以外の音声でも、他のモデルにはない特徴や高い性能を持っています。
気軽にお試しできるデモはこちらから: https://huggingface.co/spaces/litagin/anime-whisper-demo
このGitHubリポジトリは、モデル本体とは直接関係がない情報(学習コードや評価詳細や考察等)を随時更新しながら公開するためのものです(🤗モデルリポジトリを更新するとそのたびにモデルの再ダウンロードが起きる可能性があるため隔離)。
以下だいたいモデルカードからコピペ:
Anime Whisperは、他モデルに比べて一般的に次のような傾向があります。
import torch
from transformers import pipeline
pipe = pipeline(
"automatic-speech-recognition",
model="litagin/anime-whisper",
device="cuda",
torch_dtype=torch.float16,
chunk_length_s=30.0,
batch_size=64,
)
audio_path = "test.wav"
result = pipe(audio_path)
print(result["text"])
複数ファイルを一気に推論する場合は pipe に単にファイルパスのリストを渡せばよいです。
evaluation.md を参照してください。
ああああーーーーこらーっ!!!! なにそれ!?!?!?!?…… (日本語表記としては2個用いる …… が正しいが、ほぼ常に1個のみ … で出力される)からだ → 身体 等や、その他固有名詞等)examples.md を参照してください。
詳しい学習手順やハイパーパラメータや学習コードはそのうちここで公開予定です。
2 commits