원본 프로젝트: KHUDA 8기 NLP 말평의 추가 실험 레포지토리입니다.
말평 2024 국회 회의록 요약 태스크에 대한 추가 실험을 진행했습니다. 원본 프로젝트에서 베이스라인을 구축한 후, 다양한 조건에서 대조 실험을 통해 성능 향상 요인을 분석했습니다.
| 시나리오 | 설명 | 주요 발견 |
|---|---|---|
| S1 | 베이스라인 (KoBART) | 91% 실패율, 입력 잘림이 치명적 |
| S2 | 전처리 방식 비교 (v0/v1/v2) | 의례발언 제거가 BERT-Score 향상 (+2.7%) |
| S3 | Long-context 비교 | 현재 모델 전부 truncation, 16K+ 모델 필요 |
| S4 | 프롬프트 비교 | structured 프롬프트가 66% 향상 |
| S5 | 피벗 번역 (한→영→한) | 직접 요약 대비 47% 향상 |
| S6 | 모델 규모 비교 | 124M이 2.7B보다 3.7배 좋음 |
| 모델 | 파라미터 | ROUGE-1 | 추론시간 | 효율성 |
|---|---|---|---|---|
| KoBART | 124M | 0.0879 | 1.00초 | 46배 |
| phi-2 | 2.7B | 0.0236 | 12.91초 | 1배 |
결론: 22배 큰 모델이 3.7배 나쁨. 언어+태스크 특화가 규모보다 중요.
| 전처리 | ROUGE-1 | BERT-Score F1 |
|---|---|---|
| v0 (원본) | 0.1154 | 0.6363 |
| v2 (의례제거) | 0.0879 | 0.6535 |
결론: ROUGE는 낮아졌지만 BERT-Score는 향상. 의미적으로는 더 정확.
├── src/
│ ├── preprocess/ # 전처리 파이프라인 (v0, v1, v2)
│ ├── infer/ # 추론 (Seq2Seq, CausalLM, LongContext)
│ ├── eval/ # 평가 (ROUGE, BERT-Score, BLEU)
│ ├── scenarios/ # 실험 시나리오 (S1~S6)
│ └── utils/ # 유틸리티
├── slurm/ # Slurm sbatch 스크립트
├── scripts/ # 실행 스크립트
├── configs/ # 설정 파일
└── results_from_server/ # 실험 결과
├── logs/ # Slurm 로그
└── outputs/ # 메트릭 및 예측 결과
| 디렉토리 | 설명 |
|---|---|
| src/ | 소스 코드 |
| src/scenarios/ | 실험 시나리오 코드 (S1~S6) |
| src/preprocess/ | 전처리 파이프라인 |
| src/infer/ | 추론 코드 |
| src/eval/ | 평가 메트릭 |
| slurm/ | Slurm sbatch 스크립트 |
| scripts/ | 환경 설정 스크립트 |
| configs/ | 설정 파일 |
| results_from_server/ | 실험 결과 |
| results_from_server/logs/ | Slurm 실행 로그 |
| results_from_server/outputs/ | 메트릭 및 예측 결과 |
| 시나리오 | 결과 |
|---|---|
| S1 베이스라인 | metrics.json |
| S2 전처리 비교 | metrics.json |
| S3 Long-context | metrics.json |
| S5 피벗 번역 | metrics.json |
| S6 모델 규모 | metrics.json |
conda create -n nams python=3.10 -y
conda activate nams
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
pip install transformers datasets accelerate
pip install rouge-score bert-score sacrebleu
pip install pandas numpy scikit-learn tqdm pyyaml
# 시나리오 1: 베이스라인
sbatch slurm/02_scenario1_baseline.sbatch
# 시나리오 2: 전처리 비교
sbatch slurm/03_scenario2_preprocess.sbatch
# 시나리오 3: Long-context
sbatch slurm/04_scenario3_longcontext.sbatch
# 시나리오 4: 프롬프트 비교
sbatch slurm/05_scenario4_prompt.sbatch
# 시나리오 5: 피벗 번역
sbatch slurm/06_scenario5_pivot.sbatch
# 시나리오 6: 모델 규모
sbatch slurm/07_scenario6_scale.sbatch
4 commits
Python
78.5%
Shell
21.5%
원본 프로젝트: KHUDA 8기 NLP 말평의 추가 실험 레포지토리입니다.
말평 2024 국회 회의록 요약 태스크에 대한 추가 실험을 진행했습니다. 원본 프로젝트에서 베이스라인을 구축한 후, 다양한 조건에서 대조 실험을 통해 성능 향상 요인을 분석했습니다.
| 시나리오 | 설명 | 주요 발견 |
|---|---|---|
| S1 | 베이스라인 (KoBART) | 91% 실패율, 입력 잘림이 치명적 |
| S2 | 전처리 방식 비교 (v0/v1/v2) | 의례발언 제거가 BERT-Score 향상 (+2.7%) |
| S3 | Long-context 비교 | 현재 모델 전부 truncation, 16K+ 모델 필요 |
| S4 | 프롬프트 비교 | structured 프롬프트가 66% 향상 |
| S5 | 피벗 번역 (한→영→한) | 직접 요약 대비 47% 향상 |
| S6 | 모델 규모 비교 | 124M이 2.7B보다 3.7배 좋음 |
| 모델 | 파라미터 | ROUGE-1 | 추론시간 | 효율성 |
|---|---|---|---|---|
| KoBART | 124M | 0.0879 | 1.00초 | 46배 |
| phi-2 | 2.7B | 0.0236 | 12.91초 | 1배 |
결론: 22배 큰 모델이 3.7배 나쁨. 언어+태스크 특화가 규모보다 중요.
| 전처리 | ROUGE-1 | BERT-Score F1 |
|---|---|---|
| v0 (원본) | 0.1154 | 0.6363 |
| v2 (의례제거) | 0.0879 | 0.6535 |
결론: ROUGE는 낮아졌지만 BERT-Score는 향상. 의미적으로는 더 정확.
├── src/
│ ├── preprocess/ # 전처리 파이프라인 (v0, v1, v2)
│ ├── infer/ # 추론 (Seq2Seq, CausalLM, LongContext)
│ ├── eval/ # 평가 (ROUGE, BERT-Score, BLEU)
│ ├── scenarios/ # 실험 시나리오 (S1~S6)
│ └── utils/ # 유틸리티
├── slurm/ # Slurm sbatch 스크립트
├── scripts/ # 실행 스크립트
├── configs/ # 설정 파일
└── results_from_server/ # 실험 결과
├── logs/ # Slurm 로그
└── outputs/ # 메트릭 및 예측 결과
| 디렉토리 | 설명 |
|---|---|
| src/ | 소스 코드 |
| src/scenarios/ | 실험 시나리오 코드 (S1~S6) |
| src/preprocess/ | 전처리 파이프라인 |
| src/infer/ | 추론 코드 |
| src/eval/ | 평가 메트릭 |
| slurm/ | Slurm sbatch 스크립트 |
| scripts/ | 환경 설정 스크립트 |
| configs/ | 설정 파일 |
| results_from_server/ | 실험 결과 |
| results_from_server/logs/ | Slurm 실행 로그 |
| results_from_server/outputs/ | 메트릭 및 예측 결과 |
| 시나리오 | 결과 |
|---|---|
| S1 베이스라인 | metrics.json |
| S2 전처리 비교 | metrics.json |
| S3 Long-context | metrics.json |
| S5 피벗 번역 | metrics.json |
| S6 모델 규모 | metrics.json |
conda create -n nams python=3.10 -y
conda activate nams
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
pip install transformers datasets accelerate
pip install rouge-score bert-score sacrebleu
pip install pandas numpy scikit-learn tqdm pyyaml
# 시나리오 1: 베이스라인
sbatch slurm/02_scenario1_baseline.sbatch
# 시나리오 2: 전처리 비교
sbatch slurm/03_scenario2_preprocess.sbatch
# 시나리오 3: Long-context
sbatch slurm/04_scenario3_longcontext.sbatch
# 시나리오 4: 프롬프트 비교
sbatch slurm/05_scenario4_prompt.sbatch
# 시나리오 5: 피벗 번역
sbatch slurm/06_scenario5_pivot.sbatch
# 시나리오 6: 모델 규모
sbatch slurm/07_scenario6_scale.sbatch
4 commits
Python
78.5%
Shell
21.5%