A Karaoke Lyrics Tool Based on Lyrics Text and Vocal Audio
Python
68
38 commits
updated Aug 14, 2026
一个基于注音歌词文本和人声音频的自动打轴工具,主要参考了yohane、Forced-Alignment-For-NicoKara。
建议使用此工具处理日语歌曲,但底层模型实际上不限语种。
配置好Python环境后,准备以下两个文件(可参考示例):
i.wavi.txt[3σ|srisigma](这部分工作甚至可以用大模型完成);一行歌词不能同时出现中文和日文;文本尽可能与音频内容保持一致将音频、歌词和各个.py文件放在同一目录,运行指令:
python main.py
若运行成功,该目录下会生成三个文件:
o.ass: 可在Aegisub中灵活编辑o_rlf.lrc: 可在RhythmicaLyrics中灵活编辑o_ruby.lrc: 可直接在NicoKaraMaker3使用,默认提前150ms运行指令时还可以添加参数。例如基座模型效果不理想,要使用微调模型,你可以使用如下指令:
python main.py -hf 'D:\你的本地模型路径'
方便起见,建议从Hugging Face官网或镜像站手动下载模型到本地。
更多选项请用-h查看。
参考requirements.txt,请根据实际情况调整。
如果你从未接触过Python,可按照如下步骤配置环境:
pip install janome librosa nltk pykakasi pyphen pypinyin transformers;主要使用librosa进行音频预处理,结合Janome、pykakasi、NLTK、Pyphen、PyPinyin标注歌词文本读音,输入基于PyTorch的MMS_FA进行推理。
目前的效果尚不尽如人意,欢迎交流。
FA-Kara/
├── align.py # 核心对齐引擎(基座 MMS_FA)
├── align_yohane.py # 核心对齐引擎(yohane 微调模型)
├── ass2lrc.py # 已弃用,ass转RL特定格式
├── haruraw2norm.py # 歌词注音与解析,并转成标准结构
├── lrcfmt.py # 非春日向け格式歌词处理
├── main.py # 主程序入口,解析参数并执行对齐流程
├── norm2ass.py # 已打轴的标准结构转ass
├── norm2lrc.py # 已打轴的标准结构转lrc
├── utils_audio.py # 音频辅助函数(librosa 工具)
├── utils_basic.py # 基础辅助函数(时间格式转换等简单文本处理)
├── requirements.txt # Python 依赖列表参考
├── i.txt # 示例:输入歌词文本文件
└── i.wav # 示例:输入人声音频文件
38 commits
Python
100.0%
A Karaoke Lyrics Tool Based on Lyrics Text and Vocal Audio
Python
68
38 commits
updated Aug 14, 2026
一个基于注音歌词文本和人声音频的自动打轴工具,主要参考了yohane、Forced-Alignment-For-NicoKara。
建议使用此工具处理日语歌曲,但底层模型实际上不限语种。
配置好Python环境后,准备以下两个文件(可参考示例):
i.wavi.txt[3σ|srisigma](这部分工作甚至可以用大模型完成);一行歌词不能同时出现中文和日文;文本尽可能与音频内容保持一致将音频、歌词和各个.py文件放在同一目录,运行指令:
python main.py
若运行成功,该目录下会生成三个文件:
o.ass: 可在Aegisub中灵活编辑o_rlf.lrc: 可在RhythmicaLyrics中灵活编辑o_ruby.lrc: 可直接在NicoKaraMaker3使用,默认提前150ms运行指令时还可以添加参数。例如基座模型效果不理想,要使用微调模型,你可以使用如下指令:
python main.py -hf 'D:\你的本地模型路径'
方便起见,建议从Hugging Face官网或镜像站手动下载模型到本地。
更多选项请用-h查看。
参考requirements.txt,请根据实际情况调整。
如果你从未接触过Python,可按照如下步骤配置环境:
pip install janome librosa nltk pykakasi pyphen pypinyin transformers;主要使用librosa进行音频预处理,结合Janome、pykakasi、NLTK、Pyphen、PyPinyin标注歌词文本读音,输入基于PyTorch的MMS_FA进行推理。
目前的效果尚不尽如人意,欢迎交流。
FA-Kara/
├── align.py # 核心对齐引擎(基座 MMS_FA)
├── align_yohane.py # 核心对齐引擎(yohane 微调模型)
├── ass2lrc.py # 已弃用,ass转RL特定格式
├── haruraw2norm.py # 歌词注音与解析,并转成标准结构
├── lrcfmt.py # 非春日向け格式歌词处理
├── main.py # 主程序入口,解析参数并执行对齐流程
├── norm2ass.py # 已打轴的标准结构转ass
├── norm2lrc.py # 已打轴的标准结构转lrc
├── utils_audio.py # 音频辅助函数(librosa 工具)
├── utils_basic.py # 基础辅助函数(时间格式转换等简单文本处理)
├── requirements.txt # Python 依赖列表参考
├── i.txt # 示例:输入歌词文本文件
└── i.wav # 示例:输入人声音频文件
38 commits
Python
100.0%