Dự án bao gồm: 1. Xây dựng bộ dữ Instructions Vietnamese (chất lượng, nhiều, và đa dạng). 2.LLM Training, Finetuning, Evaluating & Testing trên Open-source mô hình ngôn ngữ: Bloomz,T5, UL2, LLaMA (1&2), OpenLLaMA, GPT-J pythia etc. 3. Ứng dụng và Giao diện Người dùng (UI)
287
stars
65
commits
Python
primary language
Sep 1, 2025
updated
We provide a number of model checkpoints that we trained. Please find them on Hugging Face here. Here are some quick links to the checkpoints that are finetuned from LLaMa 2:
| Model | Link |
|---|---|
| Vietnamese-LLaMa2 v1.0 13B 8K Context Length | 🤗 Vietnamese_LLama2_13B_8K_SFT_General_Domain_Knowledge |
| Vietnamese-LLaMa2 v1.0 7B 8K Context Length | 🤗 Vietnamese_llama2_7B_8K_SFT_General_domain |
| Vietnamese-LLaMa v1.0 30B 2K Context Length | 🤗 Vietnamese_llama_30B_SFT |
| Vietnamese-BLOOMZ v1.0 7B 2K Context Length | 🤗 Vietnamese_bloomz_7b |
Here are some quick links to the datasets that we used to train the models:
| Dataset | Link | Note |
|---|---|---|
| 200K Mix Instruction-tuning | Vietnamese200k Mix Instructions | |
| Vietnamese 52K Alpaca | Vietnamese Alpaca 52k | Translated using GPT-3.5 |
| Vietnamese Lima 1K | Vietnamese Lima 1K | Translated by GPT-4 |
| Vietnamese Dolly | Vietnamese Dolly | Translated by GPT-4 |
| Vietnamese Instruction of How | Vietnamese Instruction How Step by Step | Extracted from Vietnamese WikiHow |
Chào bạn đến với dự án Cộng đồng LLMs Việt Nam! Dự án với mục tiêu tạo ra bộ dữ liệu Vietnamese instruction và thực hiện Supervised instruction fine-tuning trên các Open-source mô hình ngôn ngữ Bloom, OpenLLaMA, GPT-J, MPT, Pythia và nhiều mô hình khác.
Dưới đây là cấu trúc của dự án, mô tả các phần quan trọng và chức năng chính của chúng:
Thư mục /Generate_and_Translate_Dataset chứa các bộ dữ liệu và công cụ liên quan đến việc tạo và dịch các instruction dataset.
Phần Dịch (Translation Dataset)
Using_OpenAI_Translate_API.py: Sử dụng OpenAI GPT-3.5 và GPT-4 để dịch các bộ dữ liệu. Đây là một phương pháp cho kết quả tốt.
Using_NLLB_MetaAI_Translate.py: Sử dụng NLLB làm mô hình cho việc dịch. Bạn có thể sử dụng 54B model để đạt được kết quả tương đối.
Phần Tạo Instruction Dataset
Chi tiết kỹ thuật dùng tạo Instruction dataset từ Slide 8 tới slide 14
Generation_instruction_OpenAI_api.py: Sử dụng Stanford Alpaca template để tạo các instruction dataset. Gồm hơn 175 instruction tasks được tạo bởi con người.
Cập Nhập Sớm trong Tương Lai: Phần này dự kiến sẽ được cập nhật với thông tin về cách tạo thêm Instruction dataset từ các nguồn khác.
Thư mục /LLMs chứa các tệp tin và công cụ để training và fine-tune các mô hình ngôn ngữ (Language Models).
Phần Fine-tuning dựa trên các Open-Source Based LLMs (BLOOMZ, Open-LLaMA, v.v.)
Finetune_llm_LoRA.py: Cung cấp công cụ để fine-tune các mô hình LLMs dựa trên các mã nguồn mở như BLOOMZ, Open-LLaMA, v.v.
Finetune_llm_QLoRA.py: Đây là một công cụ khác để fine-tune các mô hình LLMs dựa trên các mã nguồn mở.
Thư mục /WebUI chứa các tệp tin và công cụ liên quan đến giao diện người dùng qua Web.
Hiện tại, để nhanh chóng và thuận tiện cho việc demo và kiểm thử, chúng tôi sử dụng Gradio để phát triển giao diện.
assistant_gradio.py: Đây là ứng dụng đã được phát triển dựa trên Gradio, cho phép trải nghiệm trực quan và trò chuyện với trợ lý thông qua giao diện Web.Hy vọng Với cấu trúc này, dự án có thể được quản lý một cách cụ thể và dễ đàng để cập nhập mọi người có thể góp ý để có một cấu trúc tốt hơn
Xây dựng trợ lý thông minh tiếng Việt của tương lai, vượt trội và linh hoạt hơn bao giờ hết!
Chúng ta sẽ tạo ra một mô hình LLMs (Language Models) tiên tiến có khả năng xử lý tốt các tác vụ tiếng Việt. Mục tiêu của phát triển mạnh các LLMs ứng dụng khác trong Giáo dục, Y tế, Tài chính và Công nghiệp.
Điều đặc biệt là chúng ta muốn tạo ra mô hình trợ lý có khả năng tương tác nâng cao trên tiếng Việt. Hơn thế nữa chúng ta cũng đặt mục tiêu làm cho mô hình này nhỏ gọn và hiệu quả, để có thể chạy trên các người dùng cá nhân máy tính với các GPUs thế hệ thấp với ít memory.
Dự án này chúng ta mong muốn nhận được sự đóng góp và hỗ trợ cộng đồng. Hãy cùng nhau xây dựng một trợ lý thông minh nói riêng và mô hình ngôn ngữa thuần tiếng Việt nói chung và góp phần tạo ra những đóng góp ý nghĩa cho cộng đồng Việt Nam 🇻🇳.
Hãy nhớ rằng các bước này đại diện cho quy trình chung và có thể được điều chỉnh và bổ sung theo yêu cầu cụ thể của dự án.
Chúng ta có thể cùng nhau đóng góp tri thức và công nghệ của mình để mang lại lợi ích cho cộng đồng Việt Nam.
bạn có thể cùng xây dựng dự án: Hãy xem hướng dẫn Đóng Góp Cho Dự Án để bắt đầu chung tay xây dựng dự án này.
Bạn có thể hổ trợ về tài nguyên như máy chủ server hoặc các tài nguyên khác.
@misc{vietnameseLLM,
author={Tran Nhiem},
title={Vietnamese Instruction Data Corpus for Large-Scale Finetuning of Language Models},
year={2023},
url={https://github.com/VietnamAIHub/Vietnamese_LLMs},
}
Python
100.0%
Dự án bao gồm: 1. Xây dựng bộ dữ Instructions Vietnamese (chất lượng, nhiều, và đa dạng). 2.LLM Training, Finetuning, Evaluating & Testing trên Open-source mô hình ngôn ngữ: Bloomz,T5, UL2, LLaMA (1&2), OpenLLaMA, GPT-J pythia etc. 3. Ứng dụng và Giao diện Người dùng (UI)
287
stars
65
commits
Python
primary language
Sep 1, 2025
updated
We provide a number of model checkpoints that we trained. Please find them on Hugging Face here. Here are some quick links to the checkpoints that are finetuned from LLaMa 2:
| Model | Link |
|---|---|
| Vietnamese-LLaMa2 v1.0 13B 8K Context Length | 🤗 Vietnamese_LLama2_13B_8K_SFT_General_Domain_Knowledge |
| Vietnamese-LLaMa2 v1.0 7B 8K Context Length | 🤗 Vietnamese_llama2_7B_8K_SFT_General_domain |
| Vietnamese-LLaMa v1.0 30B 2K Context Length | 🤗 Vietnamese_llama_30B_SFT |
| Vietnamese-BLOOMZ v1.0 7B 2K Context Length | 🤗 Vietnamese_bloomz_7b |
Here are some quick links to the datasets that we used to train the models:
| Dataset | Link | Note |
|---|---|---|
| 200K Mix Instruction-tuning | Vietnamese200k Mix Instructions | |
| Vietnamese 52K Alpaca | Vietnamese Alpaca 52k | Translated using GPT-3.5 |
| Vietnamese Lima 1K | Vietnamese Lima 1K | Translated by GPT-4 |
| Vietnamese Dolly | Vietnamese Dolly | Translated by GPT-4 |
| Vietnamese Instruction of How | Vietnamese Instruction How Step by Step | Extracted from Vietnamese WikiHow |
Chào bạn đến với dự án Cộng đồng LLMs Việt Nam! Dự án với mục tiêu tạo ra bộ dữ liệu Vietnamese instruction và thực hiện Supervised instruction fine-tuning trên các Open-source mô hình ngôn ngữ Bloom, OpenLLaMA, GPT-J, MPT, Pythia và nhiều mô hình khác.
Dưới đây là cấu trúc của dự án, mô tả các phần quan trọng và chức năng chính của chúng:
Thư mục /Generate_and_Translate_Dataset chứa các bộ dữ liệu và công cụ liên quan đến việc tạo và dịch các instruction dataset.
Phần Dịch (Translation Dataset)
Using_OpenAI_Translate_API.py: Sử dụng OpenAI GPT-3.5 và GPT-4 để dịch các bộ dữ liệu. Đây là một phương pháp cho kết quả tốt.
Using_NLLB_MetaAI_Translate.py: Sử dụng NLLB làm mô hình cho việc dịch. Bạn có thể sử dụng 54B model để đạt được kết quả tương đối.
Phần Tạo Instruction Dataset
Chi tiết kỹ thuật dùng tạo Instruction dataset từ Slide 8 tới slide 14
Generation_instruction_OpenAI_api.py: Sử dụng Stanford Alpaca template để tạo các instruction dataset. Gồm hơn 175 instruction tasks được tạo bởi con người.
Cập Nhập Sớm trong Tương Lai: Phần này dự kiến sẽ được cập nhật với thông tin về cách tạo thêm Instruction dataset từ các nguồn khác.
Thư mục /LLMs chứa các tệp tin và công cụ để training và fine-tune các mô hình ngôn ngữ (Language Models).
Phần Fine-tuning dựa trên các Open-Source Based LLMs (BLOOMZ, Open-LLaMA, v.v.)
Finetune_llm_LoRA.py: Cung cấp công cụ để fine-tune các mô hình LLMs dựa trên các mã nguồn mở như BLOOMZ, Open-LLaMA, v.v.
Finetune_llm_QLoRA.py: Đây là một công cụ khác để fine-tune các mô hình LLMs dựa trên các mã nguồn mở.
Thư mục /WebUI chứa các tệp tin và công cụ liên quan đến giao diện người dùng qua Web.
Hiện tại, để nhanh chóng và thuận tiện cho việc demo và kiểm thử, chúng tôi sử dụng Gradio để phát triển giao diện.
assistant_gradio.py: Đây là ứng dụng đã được phát triển dựa trên Gradio, cho phép trải nghiệm trực quan và trò chuyện với trợ lý thông qua giao diện Web.Hy vọng Với cấu trúc này, dự án có thể được quản lý một cách cụ thể và dễ đàng để cập nhập mọi người có thể góp ý để có một cấu trúc tốt hơn
Xây dựng trợ lý thông minh tiếng Việt của tương lai, vượt trội và linh hoạt hơn bao giờ hết!
Chúng ta sẽ tạo ra một mô hình LLMs (Language Models) tiên tiến có khả năng xử lý tốt các tác vụ tiếng Việt. Mục tiêu của phát triển mạnh các LLMs ứng dụng khác trong Giáo dục, Y tế, Tài chính và Công nghiệp.
Điều đặc biệt là chúng ta muốn tạo ra mô hình trợ lý có khả năng tương tác nâng cao trên tiếng Việt. Hơn thế nữa chúng ta cũng đặt mục tiêu làm cho mô hình này nhỏ gọn và hiệu quả, để có thể chạy trên các người dùng cá nhân máy tính với các GPUs thế hệ thấp với ít memory.
Dự án này chúng ta mong muốn nhận được sự đóng góp và hỗ trợ cộng đồng. Hãy cùng nhau xây dựng một trợ lý thông minh nói riêng và mô hình ngôn ngữa thuần tiếng Việt nói chung và góp phần tạo ra những đóng góp ý nghĩa cho cộng đồng Việt Nam 🇻🇳.
Hãy nhớ rằng các bước này đại diện cho quy trình chung và có thể được điều chỉnh và bổ sung theo yêu cầu cụ thể của dự án.
Chúng ta có thể cùng nhau đóng góp tri thức và công nghệ của mình để mang lại lợi ích cho cộng đồng Việt Nam.
bạn có thể cùng xây dựng dự án: Hãy xem hướng dẫn Đóng Góp Cho Dự Án để bắt đầu chung tay xây dựng dự án này.
Bạn có thể hổ trợ về tài nguyên như máy chủ server hoặc các tài nguyên khác.
@misc{vietnameseLLM,
author={Tran Nhiem},
title={Vietnamese Instruction Data Corpus for Large-Scale Finetuning of Language Models},
year={2023},
url={https://github.com/VietnamAIHub/Vietnamese_LLMs},
}
Python
100.0%