YuujInJeong/8th-malpyeong-additional

0

stars

4

commits

Python

primary language

Jan 19, 2026

updated

README

국회 회의록 요약 - 추가 실험

원본 프로젝트: KHUDA 8기 NLP 말평의 추가 실험 레포지토리입니다.


프로젝트 개요

말평 2024 국회 회의록 요약 태스크에 대한 추가 실험을 진행했습니다. 원본 프로젝트에서 베이스라인을 구축한 후, 다양한 조건에서 대조 실험을 통해 성능 향상 요인을 분석했습니다.

실험 환경

  • 서버: KHU Aurora HPC (Slurm)
  • GPU: NVIDIA GPU with 20GB memory
  • 모델: KoBART, phi-2
  • 데이터: 말평 2024 국회회의록안건별요약 (train 1339개, dev/test 167개)

실험 시나리오

시나리오설명주요 발견
S1베이스라인 (KoBART)91% 실패율, 입력 잘림이 치명적
S2전처리 방식 비교 (v0/v1/v2)의례발언 제거가 BERT-Score 향상 (+2.7%)
S3Long-context 비교현재 모델 전부 truncation, 16K+ 모델 필요
S4프롬프트 비교structured 프롬프트가 66% 향상
S5피벗 번역 (한→영→한)직접 요약 대비 47% 향상
S6모델 규모 비교124M이 2.7B보다 3.7배 좋음

핵심 결과

모델 규모 vs 언어 특화

모델파라미터ROUGE-1추론시간효율성
KoBART124M0.08791.00초46배
phi-22.7B0.023612.91초1배

결론: 22배 큰 모델이 3.7배 나쁨. 언어+태스크 특화가 규모보다 중요.

전처리 효과

전처리ROUGE-1BERT-Score F1
v0 (원본)0.11540.6363
v2 (의례제거)0.08790.6535

결론: ROUGE는 낮아졌지만 BERT-Score는 향상. 의미적으로는 더 정확.


프로젝트 구조

├── src/
│   ├── preprocess/     # 전처리 파이프라인 (v0, v1, v2)
│   ├── infer/          # 추론 (Seq2Seq, CausalLM, LongContext)
│   ├── eval/           # 평가 (ROUGE, BERT-Score, BLEU)
│   ├── scenarios/      # 실험 시나리오 (S1~S6)
│   └── utils/          # 유틸리티
├── slurm/              # Slurm sbatch 스크립트
├── scripts/            # 실행 스크립트
├── configs/            # 설정 파일
└── results_from_server/  # 실험 결과
    ├── logs/           # Slurm 로그
    └── outputs/        # 메트릭 및 예측 결과

디렉토리 링크

디렉토리설명
src/소스 코드
src/scenarios/실험 시나리오 코드 (S1~S6)
src/preprocess/전처리 파이프라인
src/infer/추론 코드
src/eval/평가 메트릭
slurm/Slurm sbatch 스크립트
scripts/환경 설정 스크립트
configs/설정 파일
results_from_server/실험 결과
results_from_server/logs/Slurm 실행 로그
results_from_server/outputs/메트릭 및 예측 결과

실험 결과 바로가기

시나리오결과
S1 베이스라인metrics.json
S2 전처리 비교metrics.json
S3 Long-contextmetrics.json
S5 피벗 번역metrics.json
S6 모델 규모metrics.json

실행 방법

환경 설정

conda create -n nams python=3.10 -y
conda activate nams

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
pip install transformers datasets accelerate
pip install rouge-score bert-score sacrebleu
pip install pandas numpy scikit-learn tqdm pyyaml

실험 실행 (Slurm)

# 시나리오 1: 베이스라인
sbatch slurm/02_scenario1_baseline.sbatch

# 시나리오 2: 전처리 비교
sbatch slurm/03_scenario2_preprocess.sbatch

# 시나리오 3: Long-context
sbatch slurm/04_scenario3_longcontext.sbatch

# 시나리오 4: 프롬프트 비교
sbatch slurm/05_scenario4_prompt.sbatch

# 시나리오 5: 피벗 번역
sbatch slurm/06_scenario5_pivot.sbatch

# 시나리오 6: 모델 규모
sbatch slurm/07_scenario6_scale.sbatch

핵심 교훈

  1. 입력 길이 문제가 가장 크다 - long-context 모델 필요
  2. 언어 특화 모델이 범용 LLM보다 낫다 - 작은 한국어 모델 > 큰 영어 모델
  3. 프롬프트 엔지니어링은 한계가 있다 - 모델이 한국어 못하면 의미없음
  4. 피벗 번역은 효과적인 대안 - 추론 시간 3배지만 품질 47% 향상

다음 실험 방향

  • 진짜 Long-context 모델 테스트 (LongChat-7B-16K, Yarn-Mistral-7B-128K)
  • 한국어 LLM 테스트 (KoAlpaca, Polyglot-Ko)
  • KoBART 도메인 파인튜닝

참고

Contributors

YuujInJeong

4 commits

YuujInJeong/8th-malpyeong-additional

0

stars

4

commits

Python

primary language

Jan 19, 2026

updated

README

국회 회의록 요약 - 추가 실험

원본 프로젝트: KHUDA 8기 NLP 말평의 추가 실험 레포지토리입니다.


프로젝트 개요

말평 2024 국회 회의록 요약 태스크에 대한 추가 실험을 진행했습니다. 원본 프로젝트에서 베이스라인을 구축한 후, 다양한 조건에서 대조 실험을 통해 성능 향상 요인을 분석했습니다.

실험 환경

  • 서버: KHU Aurora HPC (Slurm)
  • GPU: NVIDIA GPU with 20GB memory
  • 모델: KoBART, phi-2
  • 데이터: 말평 2024 국회회의록안건별요약 (train 1339개, dev/test 167개)

실험 시나리오

시나리오설명주요 발견
S1베이스라인 (KoBART)91% 실패율, 입력 잘림이 치명적
S2전처리 방식 비교 (v0/v1/v2)의례발언 제거가 BERT-Score 향상 (+2.7%)
S3Long-context 비교현재 모델 전부 truncation, 16K+ 모델 필요
S4프롬프트 비교structured 프롬프트가 66% 향상
S5피벗 번역 (한→영→한)직접 요약 대비 47% 향상
S6모델 규모 비교124M이 2.7B보다 3.7배 좋음

핵심 결과

모델 규모 vs 언어 특화

모델파라미터ROUGE-1추론시간효율성
KoBART124M0.08791.00초46배
phi-22.7B0.023612.91초1배

결론: 22배 큰 모델이 3.7배 나쁨. 언어+태스크 특화가 규모보다 중요.

전처리 효과

전처리ROUGE-1BERT-Score F1
v0 (원본)0.11540.6363
v2 (의례제거)0.08790.6535

결론: ROUGE는 낮아졌지만 BERT-Score는 향상. 의미적으로는 더 정확.


프로젝트 구조

├── src/
│   ├── preprocess/     # 전처리 파이프라인 (v0, v1, v2)
│   ├── infer/          # 추론 (Seq2Seq, CausalLM, LongContext)
│   ├── eval/           # 평가 (ROUGE, BERT-Score, BLEU)
│   ├── scenarios/      # 실험 시나리오 (S1~S6)
│   └── utils/          # 유틸리티
├── slurm/              # Slurm sbatch 스크립트
├── scripts/            # 실행 스크립트
├── configs/            # 설정 파일
└── results_from_server/  # 실험 결과
    ├── logs/           # Slurm 로그
    └── outputs/        # 메트릭 및 예측 결과

디렉토리 링크

디렉토리설명
src/소스 코드
src/scenarios/실험 시나리오 코드 (S1~S6)
src/preprocess/전처리 파이프라인
src/infer/추론 코드
src/eval/평가 메트릭
slurm/Slurm sbatch 스크립트
scripts/환경 설정 스크립트
configs/설정 파일
results_from_server/실험 결과
results_from_server/logs/Slurm 실행 로그
results_from_server/outputs/메트릭 및 예측 결과

실험 결과 바로가기

시나리오결과
S1 베이스라인metrics.json
S2 전처리 비교metrics.json
S3 Long-contextmetrics.json
S5 피벗 번역metrics.json
S6 모델 규모metrics.json

실행 방법

환경 설정

conda create -n nams python=3.10 -y
conda activate nams

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
pip install transformers datasets accelerate
pip install rouge-score bert-score sacrebleu
pip install pandas numpy scikit-learn tqdm pyyaml

실험 실행 (Slurm)

# 시나리오 1: 베이스라인
sbatch slurm/02_scenario1_baseline.sbatch

# 시나리오 2: 전처리 비교
sbatch slurm/03_scenario2_preprocess.sbatch

# 시나리오 3: Long-context
sbatch slurm/04_scenario3_longcontext.sbatch

# 시나리오 4: 프롬프트 비교
sbatch slurm/05_scenario4_prompt.sbatch

# 시나리오 5: 피벗 번역
sbatch slurm/06_scenario5_pivot.sbatch

# 시나리오 6: 모델 규모
sbatch slurm/07_scenario6_scale.sbatch

핵심 교훈

  1. 입력 길이 문제가 가장 크다 - long-context 모델 필요
  2. 언어 특화 모델이 범용 LLM보다 낫다 - 작은 한국어 모델 > 큰 영어 모델
  3. 프롬프트 엔지니어링은 한계가 있다 - 모델이 한국어 못하면 의미없음
  4. 피벗 번역은 효과적인 대안 - 추론 시간 3배지만 품질 47% 향상

다음 실험 방향

  • 진짜 Long-context 모델 테스트 (LongChat-7B-16K, Yarn-Mistral-7B-128K)
  • 한국어 LLM 테스트 (KoAlpaca, Polyglot-Ko)
  • KoBART 도메인 파인튜닝

참고

Contributors

YuujInJeong

4 commits

Languages

Python

78.5%

Shell

21.5%