Проєкт для створення та оцінки системи запитань-відповідей, фільтрації відповідей і експериментів із різними мовними моделями.
Репозиторій містить інструменти для генерації QA‑відповідей (скрипти на основі ChatGPT/інших моделей), фільтрації датасетів, запуску навчання/інференсу та набори даних/збережені моделі.
QA-SLM/
├─ ChatGPT/
│ ├─ gen_qa_GPT.py
│ ├─ filter_GPT.py
│ ├─ paraphrase_GPT.py
│ ├─ irrelevant_GPT.py
│ └─ utils.py
├─ OpenChat/
│ ├─ common.py
│ └─ gen_base_OpenChat.py
├─ config/
│ └─ config.py
├─ datasets/
├─ filtered_tinystories/
├─ models/
├─ notebooks/
├─ input/
│ ├─ Instructions/
│ └─ Words/
├─ eval_selection/
├─ results/
├─ presentation/
├─ run_train.slurm
├─ run_full.slurm
├─ requirements.txt
└─ README2.md
| Клас / Файл | Призначення |
|---|---|
ChatGPT/gen_qa_GPT.py | Генерація QA-пар через GPT API. |
ChatGPT/filter_GPT.py | Фільтрація пар, відсів нерелевантних або шумових прикладів. |
ChatGPT/paraphrase_GPT.py | Перефразування питань і відповідей. |
ChatGPT/irrelevant_GPT.py | Генерація нерелевантних прикладів для експериментів. |
ChatGPT/gen_tiny_fridge_GPT.py | Допоміжна генерація даних для окремих експериментів. |
OpenChat/gen_base_OpenChat.py | Генерація даних з використанням OpenChat. |
OpenChat/filter_OpenChat.py | Фільтрація результатів, згенерованих OpenChat. |
OpenChat/gen_style_OpenChat.py | Генерація даних у стилі OpenChat. |
OpenChat/extractive_dataset_generate.py | Формування екстрактивного датасету. |
ChatGPT/utils.py | Допоміжні утиліти для GPT-скриптів. |
OpenChat/common.py | Спільні функції для OpenChat-скриптів. |
config/config.py | Налаштування проєкту. |
input/Instructions/ | Вхідні інструкції для генерації даних. |
input/Words/ | Списки слів і статистика для датасетів. |
eval_selection/ | Інструменти для оцінки вибірки. |
requirements.txt.git clone https://github.com/MirMax13/QA-SLM.git
cd QA-SLM
python -m venv venv
# Windows
venv\Scripts\activate
# Linux / macOS
source venv/bin/activate
pip install -r requirements.txt
python ChatGPT/gen_qa_GPT.py
python ChatGPT/filter_GPT.py
python ChatGPT/paraphrase_GPT.py
python OpenChat/gen_base_OpenChat.py
python OpenChat/filter_OpenChat.py
python OpenChat/gen_style_OpenChat.py
sbatch run_train.slurm
sbatch run_full.slurm
results/; потрібні файли я вручну переношу туди після виконання;datasets/, filtered_tinystories/, input/;notebooks/.input/.ChatGPT/ або OpenChat/.datasets/ та filtered_tinystories/.notebooks/ або подивіться графіки в presentation/.datasets/.requirements.txt — список залежностей Python.run_train.slurm, run_full.slurm — приклади запусків для кластера.README_sample.md — шаблон з прикладами.



270 commits
Jupyter Notebook
85.0%
Python
14.9%
Проєкт для створення та оцінки системи запитань-відповідей, фільтрації відповідей і експериментів із різними мовними моделями.
Репозиторій містить інструменти для генерації QA‑відповідей (скрипти на основі ChatGPT/інших моделей), фільтрації датасетів, запуску навчання/інференсу та набори даних/збережені моделі.
QA-SLM/
├─ ChatGPT/
│ ├─ gen_qa_GPT.py
│ ├─ filter_GPT.py
│ ├─ paraphrase_GPT.py
│ ├─ irrelevant_GPT.py
│ └─ utils.py
├─ OpenChat/
│ ├─ common.py
│ └─ gen_base_OpenChat.py
├─ config/
│ └─ config.py
├─ datasets/
├─ filtered_tinystories/
├─ models/
├─ notebooks/
├─ input/
│ ├─ Instructions/
│ └─ Words/
├─ eval_selection/
├─ results/
├─ presentation/
├─ run_train.slurm
├─ run_full.slurm
├─ requirements.txt
└─ README2.md
| Клас / Файл | Призначення |
|---|---|
ChatGPT/gen_qa_GPT.py | Генерація QA-пар через GPT API. |
ChatGPT/filter_GPT.py | Фільтрація пар, відсів нерелевантних або шумових прикладів. |
ChatGPT/paraphrase_GPT.py | Перефразування питань і відповідей. |
ChatGPT/irrelevant_GPT.py | Генерація нерелевантних прикладів для експериментів. |
ChatGPT/gen_tiny_fridge_GPT.py | Допоміжна генерація даних для окремих експериментів. |
OpenChat/gen_base_OpenChat.py | Генерація даних з використанням OpenChat. |
OpenChat/filter_OpenChat.py | Фільтрація результатів, згенерованих OpenChat. |
OpenChat/gen_style_OpenChat.py | Генерація даних у стилі OpenChat. |
OpenChat/extractive_dataset_generate.py | Формування екстрактивного датасету. |
ChatGPT/utils.py | Допоміжні утиліти для GPT-скриптів. |
OpenChat/common.py | Спільні функції для OpenChat-скриптів. |
config/config.py | Налаштування проєкту. |
input/Instructions/ | Вхідні інструкції для генерації даних. |
input/Words/ | Списки слів і статистика для датасетів. |
eval_selection/ | Інструменти для оцінки вибірки. |
requirements.txt.git clone https://github.com/MirMax13/QA-SLM.git
cd QA-SLM
python -m venv venv
# Windows
venv\Scripts\activate
# Linux / macOS
source venv/bin/activate
pip install -r requirements.txt
python ChatGPT/gen_qa_GPT.py
python ChatGPT/filter_GPT.py
python ChatGPT/paraphrase_GPT.py
python OpenChat/gen_base_OpenChat.py
python OpenChat/filter_OpenChat.py
python OpenChat/gen_style_OpenChat.py
sbatch run_train.slurm
sbatch run_full.slurm
results/; потрібні файли я вручну переношу туди після виконання;datasets/, filtered_tinystories/, input/;notebooks/.input/.ChatGPT/ або OpenChat/.datasets/ та filtered_tinystories/.notebooks/ або подивіться графіки в presentation/.datasets/.requirements.txt — список залежностей Python.run_train.slurm, run_full.slurm — приклади запусків для кластера.README_sample.md — шаблон з прикладами.



270 commits
Jupyter Notebook
85.0%
Python
14.9%