Thực nghiệm lại phương pháp nén prompt IterCOMP (Yun & Kim, ACL 2026) và mở rộng đánh giá sang tiếng Việt trên bộ VimQA. Môn Xử lý Ngôn ngữ Tự nhiên Nâng cao, VNU-HCM University of Science.
Bài báo gốc không công bố mã nguồn và prompt (chỉ công bố siêu tham số, Mục 5.1). Prompt answerability và follow-up do nhóm tự thiết kế; kết quả nhằm kiểm chứng xu hướng tương đối giữa các phương pháp, không so tuyệt đối với paper.
| Yêu cầu | Vị trí |
|---|---|
| Báo cáo PDF (ACL short paper) | report.pdf — §1–9 chiếm 5 trang, References từ trang 6, 6 phụ lục (A–F), tổng 12 trang |
| Mã nguồn | src/ — itercomp/ (cài đặt), scripts/, requirements.txt, run.sh |
| Jupyter Notebook (Colab/Kaggle) | notebooks/ — colab_reproduce.ipynb (nộp) + kernel GPU từng thí nghiệm |
| README cách chạy | tệp này (Mục 3) |
| Đường dẫn tải dữ liệu | DATASET_LINKS.txt — tự tải từ HuggingFace, không kèm data 116 MB |
| Mô hình / đường dẫn | MODEL_LINKS.txt — training-free, không có mô hình huấn luyện; mọi mô hình tải tự động từ HuggingFace |
Báo cáo dùng định dạng ACL chính thức (acl-org/acl-style-files).
.
├── README.md · MODEL_LINKS.txt · DATASET_LINKS.txt · report.pdf
├── src/
│ ├── itercomp/ Cài đặt IterCOMP (core, scorer, reader, metrics, …)
│ ├── scripts/ run_eval.py (bảng chính), ablation, EXP-1/2, …
│ ├── results/ Kết quả JSON backing mọi con số trong báo cáo
│ ├── requirements.txt · run.sh
├── notebooks/
│ ├── colab_reproduce.ipynb notebook nộp (đủ 8 phần, Colab/Kaggle)
│ └── kaggle/ 15 kernel GPU của từng thí nghiệm
Notebook notebooks/colab_reproduce.ipynb tự tải mã nguồn, dữ liệu, mô hình —
không phụ thuộc đường dẫn cục bộ, đủ 8 phần (cài đặt → tải dữ liệu → EDA →
cấu hình mô hình → đánh giá → so mô hình cơ sở → phân tích lỗi → demo dữ liệu
tiếng Việt mới). Đây là cách khuyến nghị.
notebooks/colab_reproduce.ipynb.GPU T4 x2 và Internet: On.colab_reproduce.ipynb.Cần GPU cho mô hình đọc (Qwen2.5-7B, 4-bit). Phần CPU (fertility, damage) chạy được không cần GPU.
cd src && ./run.sh # tạo .venv, cài thư viện, tải dữ liệu, chạy đánh giá, sinh bảng
# kiểm thử luồng (không tốn tài nguyên, không cần GPU):
python src/scripts/run_eval.py --dataset vimqa --limit 5 --reader mock --itercomp-llm mock
run.sh là bash; trên Windows chạy thủ công (PowerShell):
python -m venv .venv
.venv\Scripts\Activate.ps1
pip install -r src\requirements.txt
# tải dữ liệu: xem DATASET_LINKS.txt (hoặc chạy các lệnh curl trong đó)
# kiểm thử luồng:
python src\scripts\run_eval.py --dataset vimqa --limit 5 --reader mock --itercomp-llm mock
# chạy thật (cần GPU): thay --reader mock bằng --reader hf --reader-model Qwen/Qwen2.5-7B-Instruct --load-4bit
Notebook ghim
transformers==4.45.2(Colab/Kaggle nay ship 5.0.0 xung đột cứng vớillmlingua 0.2.2), cũng là phiên bản sinh ra mọi số trong báo cáo.
DATASET_LINKS.txt:
VimQA (tiếng Việt), HotpotQA, 2WikiMultiHopQA, MuSiQue-Ans.MODEL_LINKS.txt. IterCOMP training-free:
encoder bge-m3, compressor LLMLingua-2, reader Qwen2.5 đều tải từ HuggingFace.F1$^*$ (chuẩn hoá boolean), reader Qwen2.5-7B 4-bit — bảng đầy đủ ở §6 báo cáo:
| VimQA (vi) | MuSiQue | 2Wiki | HotpotQA | |
|---|---|---|---|---|
| n=1003 | n=500 | n=1500 | n=1500 | |
| Oracle | 61.03 | 49.84 | 57.65 | 71.40 |
| Raw | 46.87 | 23.43 | 35.72 | 59.24 |
| IterCOMP | 51.29 | 26.74 | 36.72 | 54.58 |
| LLMLingua-2 | 35.31 | 15.14 | 19.24 | 36.00 |
| IterCOMP − Raw | +4.42† | +3.31 | +1.00 | −4.66† |
| IterCOMP − LLMLingua-2 | +15.98† | +11.60† | +17.48† | +18.58† |
† khoảng tin cậy 95% (paired bootstrap) không chứa 0.
src/results/ (JSON đầy đủ per-row).notebooks/kaggle/.7 commits
Jupyter Notebook
53.6%
Python
45.1%
Shell
1.4%
Thực nghiệm lại phương pháp nén prompt IterCOMP (Yun & Kim, ACL 2026) và mở rộng đánh giá sang tiếng Việt trên bộ VimQA. Môn Xử lý Ngôn ngữ Tự nhiên Nâng cao, VNU-HCM University of Science.
Bài báo gốc không công bố mã nguồn và prompt (chỉ công bố siêu tham số, Mục 5.1). Prompt answerability và follow-up do nhóm tự thiết kế; kết quả nhằm kiểm chứng xu hướng tương đối giữa các phương pháp, không so tuyệt đối với paper.
| Yêu cầu | Vị trí |
|---|---|
| Báo cáo PDF (ACL short paper) | report.pdf — §1–9 chiếm 5 trang, References từ trang 6, 6 phụ lục (A–F), tổng 12 trang |
| Mã nguồn | src/ — itercomp/ (cài đặt), scripts/, requirements.txt, run.sh |
| Jupyter Notebook (Colab/Kaggle) | notebooks/ — colab_reproduce.ipynb (nộp) + kernel GPU từng thí nghiệm |
| README cách chạy | tệp này (Mục 3) |
| Đường dẫn tải dữ liệu | DATASET_LINKS.txt — tự tải từ HuggingFace, không kèm data 116 MB |
| Mô hình / đường dẫn | MODEL_LINKS.txt — training-free, không có mô hình huấn luyện; mọi mô hình tải tự động từ HuggingFace |
Báo cáo dùng định dạng ACL chính thức (acl-org/acl-style-files).
.
├── README.md · MODEL_LINKS.txt · DATASET_LINKS.txt · report.pdf
├── src/
│ ├── itercomp/ Cài đặt IterCOMP (core, scorer, reader, metrics, …)
│ ├── scripts/ run_eval.py (bảng chính), ablation, EXP-1/2, …
│ ├── results/ Kết quả JSON backing mọi con số trong báo cáo
│ ├── requirements.txt · run.sh
├── notebooks/
│ ├── colab_reproduce.ipynb notebook nộp (đủ 8 phần, Colab/Kaggle)
│ └── kaggle/ 15 kernel GPU của từng thí nghiệm
Notebook notebooks/colab_reproduce.ipynb tự tải mã nguồn, dữ liệu, mô hình —
không phụ thuộc đường dẫn cục bộ, đủ 8 phần (cài đặt → tải dữ liệu → EDA →
cấu hình mô hình → đánh giá → so mô hình cơ sở → phân tích lỗi → demo dữ liệu
tiếng Việt mới). Đây là cách khuyến nghị.
notebooks/colab_reproduce.ipynb.GPU T4 x2 và Internet: On.colab_reproduce.ipynb.Cần GPU cho mô hình đọc (Qwen2.5-7B, 4-bit). Phần CPU (fertility, damage) chạy được không cần GPU.
cd src && ./run.sh # tạo .venv, cài thư viện, tải dữ liệu, chạy đánh giá, sinh bảng
# kiểm thử luồng (không tốn tài nguyên, không cần GPU):
python src/scripts/run_eval.py --dataset vimqa --limit 5 --reader mock --itercomp-llm mock
run.sh là bash; trên Windows chạy thủ công (PowerShell):
python -m venv .venv
.venv\Scripts\Activate.ps1
pip install -r src\requirements.txt
# tải dữ liệu: xem DATASET_LINKS.txt (hoặc chạy các lệnh curl trong đó)
# kiểm thử luồng:
python src\scripts\run_eval.py --dataset vimqa --limit 5 --reader mock --itercomp-llm mock
# chạy thật (cần GPU): thay --reader mock bằng --reader hf --reader-model Qwen/Qwen2.5-7B-Instruct --load-4bit
Notebook ghim
transformers==4.45.2(Colab/Kaggle nay ship 5.0.0 xung đột cứng vớillmlingua 0.2.2), cũng là phiên bản sinh ra mọi số trong báo cáo.
DATASET_LINKS.txt:
VimQA (tiếng Việt), HotpotQA, 2WikiMultiHopQA, MuSiQue-Ans.MODEL_LINKS.txt. IterCOMP training-free:
encoder bge-m3, compressor LLMLingua-2, reader Qwen2.5 đều tải từ HuggingFace.F1$^*$ (chuẩn hoá boolean), reader Qwen2.5-7B 4-bit — bảng đầy đủ ở §6 báo cáo:
| VimQA (vi) | MuSiQue | 2Wiki | HotpotQA | |
|---|---|---|---|---|
| n=1003 | n=500 | n=1500 | n=1500 | |
| Oracle | 61.03 | 49.84 | 57.65 | 71.40 |
| Raw | 46.87 | 23.43 | 35.72 | 59.24 |
| IterCOMP | 51.29 | 26.74 | 36.72 | 54.58 |
| LLMLingua-2 | 35.31 | 15.14 | 19.24 | 36.00 |
| IterCOMP − Raw | +4.42† | +3.31 | +1.00 | −4.66† |
| IterCOMP − LLMLingua-2 | +15.98† | +11.60† | +17.48† | +18.58† |
† khoảng tin cậy 95% (paired bootstrap) không chứa 0.
src/results/ (JSON đầy đủ per-row).notebooks/kaggle/.7 commits
Jupyter Notebook
53.6%
Python
45.1%
Shell
1.4%