VoiceLab là một ứng dụng Web tích hợp (Full-stack) được thiết kế cho việc tổng hợp, so sánh hiệu năng và nhân bản giọng nói tiếng Việt tức thì (Zero-shot Voice Cloning) bằng cách sử dụng các mô hình học sâu (Deep Learning) hiện đại nhất.
Dưới đây là danh sách thành viên thực hiện đồ án:
| Họ và tên | MSSV | Phân công công việc |
|---|---|---|
| Phạm Như Thái Tuấn | 23120186 | Thiết kế pipeline dữ liệu, tải audio YouTube, chuẩn hóa metadata và kiểm soát chất lượng dữ liệu. |
| Lê Trung Tín | 23120371 | Xây dựng quy trình nhận dạng lời nói, diarization, phân tích dữ liệu và chia Train/Validation/Test. |
| Phan Khắc Trường | 23120386 | Fine-tune VieNeu-v2 bằng LoRA, tối ưu hyperparameters, theo dõi loss và xử lý lỗi huấn luyện. |
| Phạm Ngọc Duy | 23122025 | Thiết kế pipeline inference, đánh giá WER/CER, Speaker Similarity và phân tích các cấu hình adapter. |
| Nguyễn Thị Mỹ Kim | 23122040 | Tổng hợp báo cáo, trực quan hóa kết quả, xây dựng kịch bản triển khai ứng dụng và kiểm thử cuối. |
Ứng dụng hỗ trợ cả hai phương thức triển khai: Cài đặt thủ công (Local) và Đóng gói Container (Docker/VPS).
Yêu cầu máy chủ đã cài đặt Docker và Docker Compose. Phương thức này tự động vá lỗi execstack của onnxruntime trên Linux và chạy kiểm thử tự động (Smoke Test) khi build.
Chuẩn bị cấu hình:
Tạo file .env ở thư mục gốc và điền các khóa API của bạn (tham khảo .env.example):
GEMINI_API_KEY=YOUR_GEMINI_API_KEY
GROQ_API_KEY=YOUR_GROQ_API_KEY
HF_TOKEN=YOUR_HUGGING_FACE_READ_TOKEN
Chạy ứng dụng: Thực hiện build và khởi chạy container dưới chế độ nền (background):
docker-compose up -d --build
Truy cập ứng dụng: Ứng dụng sẽ chạy tại địa chỉ: http://<IP_VPS_CỦA_BẠN>:8000
Yêu cầu Python 3.10+, Node.js 18+ và công cụ ffmpeg được cài đặt trong biến môi trường (PATH) hệ thống.
Thiết lập Backend:
# Tạo môi trường ảo
python -m venv venv
source venv/bin/activate # Trên Windows dùng: venv\Scripts\activate
# Cài đặt thư viện phụ thuộc
pip install -r web_app/requirements.txt
Thiết lập Frontend:
cd web_app/frontend
npm install
cd ../..
Cấu hình môi trường:
Tạo file .env ở thư mục gốc:
GEMINI_API_KEY=YOUR_GEMINI_API_KEY
GROQ_API_KEY=YOUR_GROQ_API_KEY
HF_TOKEN=YOUR_HUGGING_FACE_READ_TOKEN
Khởi tạo tài nguyên mẫu (Giọng mồi và video meme):
python -m web_app.backend.setup_assets
Chạy ứng dụng:
python run_app.py
Ứng dụng sẽ khởi chạy tại địa chỉ: http://localhost:8000
Tất cả các tài liệu nghiên cứu, tiền xử lý và huấn luyện được lưu trữ trong thư mục notebooks/:
datawhisperx.ipynb:
evaltts (1).ipynb:
tts_finetuning_lora.ipynb:
58 commits
JavaScript
44.5%
Python
38.4%
Jupyter Notebook
12.8%
CSS
2.7%
Dockerfile
1.3%
VoiceLab là một ứng dụng Web tích hợp (Full-stack) được thiết kế cho việc tổng hợp, so sánh hiệu năng và nhân bản giọng nói tiếng Việt tức thì (Zero-shot Voice Cloning) bằng cách sử dụng các mô hình học sâu (Deep Learning) hiện đại nhất.
Dưới đây là danh sách thành viên thực hiện đồ án:
| Họ và tên | MSSV | Phân công công việc |
|---|---|---|
| Phạm Như Thái Tuấn | 23120186 | Thiết kế pipeline dữ liệu, tải audio YouTube, chuẩn hóa metadata và kiểm soát chất lượng dữ liệu. |
| Lê Trung Tín | 23120371 | Xây dựng quy trình nhận dạng lời nói, diarization, phân tích dữ liệu và chia Train/Validation/Test. |
| Phan Khắc Trường | 23120386 | Fine-tune VieNeu-v2 bằng LoRA, tối ưu hyperparameters, theo dõi loss và xử lý lỗi huấn luyện. |
| Phạm Ngọc Duy | 23122025 | Thiết kế pipeline inference, đánh giá WER/CER, Speaker Similarity và phân tích các cấu hình adapter. |
| Nguyễn Thị Mỹ Kim | 23122040 | Tổng hợp báo cáo, trực quan hóa kết quả, xây dựng kịch bản triển khai ứng dụng và kiểm thử cuối. |
Ứng dụng hỗ trợ cả hai phương thức triển khai: Cài đặt thủ công (Local) và Đóng gói Container (Docker/VPS).
Yêu cầu máy chủ đã cài đặt Docker và Docker Compose. Phương thức này tự động vá lỗi execstack của onnxruntime trên Linux và chạy kiểm thử tự động (Smoke Test) khi build.
Chuẩn bị cấu hình:
Tạo file .env ở thư mục gốc và điền các khóa API của bạn (tham khảo .env.example):
GEMINI_API_KEY=YOUR_GEMINI_API_KEY
GROQ_API_KEY=YOUR_GROQ_API_KEY
HF_TOKEN=YOUR_HUGGING_FACE_READ_TOKEN
Chạy ứng dụng: Thực hiện build và khởi chạy container dưới chế độ nền (background):
docker-compose up -d --build
Truy cập ứng dụng: Ứng dụng sẽ chạy tại địa chỉ: http://<IP_VPS_CỦA_BẠN>:8000
Yêu cầu Python 3.10+, Node.js 18+ và công cụ ffmpeg được cài đặt trong biến môi trường (PATH) hệ thống.
Thiết lập Backend:
# Tạo môi trường ảo
python -m venv venv
source venv/bin/activate # Trên Windows dùng: venv\Scripts\activate
# Cài đặt thư viện phụ thuộc
pip install -r web_app/requirements.txt
Thiết lập Frontend:
cd web_app/frontend
npm install
cd ../..
Cấu hình môi trường:
Tạo file .env ở thư mục gốc:
GEMINI_API_KEY=YOUR_GEMINI_API_KEY
GROQ_API_KEY=YOUR_GROQ_API_KEY
HF_TOKEN=YOUR_HUGGING_FACE_READ_TOKEN
Khởi tạo tài nguyên mẫu (Giọng mồi và video meme):
python -m web_app.backend.setup_assets
Chạy ứng dụng:
python run_app.py
Ứng dụng sẽ khởi chạy tại địa chỉ: http://localhost:8000
Tất cả các tài liệu nghiên cứu, tiền xử lý và huấn luyện được lưu trữ trong thư mục notebooks/:
datawhisperx.ipynb:
evaltts (1).ipynb:
tts_finetuning_lora.ipynb:
58 commits
JavaScript
44.5%
Python
38.4%
Jupyter Notebook
12.8%
CSS
2.7%
Dockerfile
1.3%