paust/pko-t5-base

Model

20

stars

12

commits

6

repos using this model

5

linked in READMEs

Sep 14, 2022

updated

endpoints_compatible
pytorch
t5
text2text-generation
text-generation-inference
transformers

README

pko-t5-base

Source Code

pko-t5 는 한국어 전용 데이터로 학습한 t5 v1.1 모델입니다.

한국어를 tokenize 하기 위해서 sentencepiece 대신 OOV 가 없는 BBPE 를 사용했으며 한국어 데이터 (나무위키, 위키피디아, 모두의말뭉치 등..) 를 T5 의 span corruption task 를 사용해서 unsupervised learning 만 적용하여 학습을 진행했습니다.

pko-t5 를 사용하실 때는 대상 task 에 파인튜닝하여 사용하시기 바랍니다.

Usage

transformers 의 API 를 사용하여 접근 가능합니다. tokenizer 를 사용할때는 T5Tokenizer 가 아니라 T5TokenizerFast 를 사용해주십시오. model 은 T5ForConditionalGeneration 를 그대로 활용하시면 됩니다.

Example

from transformers import T5TokenizerFast, T5ForConditionalGeneration

tokenizer = T5TokenizerFast.from_pretrained('paust/pko-t5-base')
model = T5ForConditionalGeneration.from_pretrained('paust/pko-t5-base')

input_ids = tokenizer(["qa question: 당신의 이름은 무엇인가요?"]).input_ids
labels = tokenizer(["T5 입니다."]).input_ids
outputs = model(input_ids=input_ids, labels=labels)

print(f"loss={outputs.loss} logits={outputs.logits}")

Klue 평가 (dev)

Modelynat (macro F1)sts (pearsonr/F1)nli (acc)ner (entity-level F1)re (micro F1)dp (LAS)mrc (EM/F1)
Baseline87.3093.20/86.1389.5086.0671.0687.9375.26/-
FTpko-t5-small (77M)86.2177.99/77.0169.2082.6066.4693.1543.81/46.58
FTpko-t5-base (250M)87.2990.25/83.4379.7387.8067.2397.2861.53/64.74
FTpko-t5-large (800M)87.1292.05/85.2484.9688.1875.1797.6068.01/71.44
MTpko-t5-small84.5468.50/72/0251.1674.6966.1180.4043.60/46.28
MTpko-t5-base86.8983.96/80.3072.0385.2766.5995.0561.11/63.94
MTpko-t5-large87.5791.93/86.2983.6387.4171.3496.9970.70/73.72
  • FT: 싱글태스크 파인튜닝 / MT: 멀티태스크 파인튜닝
  • Baseline: KLUE 논문에서 소개된 dev set 에 대한 SOTA 점수

License

PAUST에서 만든 pko-t5는 MIT license 하에 공개되어 있습니다.

Contributors

dennispark

11 commits

edanlee

1 commits

paust/pko-t5-base

Model

20

stars

12

commits

6

repos using this model

5

linked in READMEs

Sep 14, 2022

updated

endpoints_compatible
pytorch
t5
text2text-generation
text-generation-inference
transformers

README

pko-t5-base

Source Code

pko-t5 는 한국어 전용 데이터로 학습한 t5 v1.1 모델입니다.

한국어를 tokenize 하기 위해서 sentencepiece 대신 OOV 가 없는 BBPE 를 사용했으며 한국어 데이터 (나무위키, 위키피디아, 모두의말뭉치 등..) 를 T5 의 span corruption task 를 사용해서 unsupervised learning 만 적용하여 학습을 진행했습니다.

pko-t5 를 사용하실 때는 대상 task 에 파인튜닝하여 사용하시기 바랍니다.

Usage

transformers 의 API 를 사용하여 접근 가능합니다. tokenizer 를 사용할때는 T5Tokenizer 가 아니라 T5TokenizerFast 를 사용해주십시오. model 은 T5ForConditionalGeneration 를 그대로 활용하시면 됩니다.

Example

from transformers import T5TokenizerFast, T5ForConditionalGeneration

tokenizer = T5TokenizerFast.from_pretrained('paust/pko-t5-base')
model = T5ForConditionalGeneration.from_pretrained('paust/pko-t5-base')

input_ids = tokenizer(["qa question: 당신의 이름은 무엇인가요?"]).input_ids
labels = tokenizer(["T5 입니다."]).input_ids
outputs = model(input_ids=input_ids, labels=labels)

print(f"loss={outputs.loss} logits={outputs.logits}")

Klue 평가 (dev)

Modelynat (macro F1)sts (pearsonr/F1)nli (acc)ner (entity-level F1)re (micro F1)dp (LAS)mrc (EM/F1)
Baseline87.3093.20/86.1389.5086.0671.0687.9375.26/-
FTpko-t5-small (77M)86.2177.99/77.0169.2082.6066.4693.1543.81/46.58
FTpko-t5-base (250M)87.2990.25/83.4379.7387.8067.2397.2861.53/64.74
FTpko-t5-large (800M)87.1292.05/85.2484.9688.1875.1797.6068.01/71.44
MTpko-t5-small84.5468.50/72/0251.1674.6966.1180.4043.60/46.28
MTpko-t5-base86.8983.96/80.3072.0385.2766.5995.0561.11/63.94
MTpko-t5-large87.5791.93/86.2983.6387.4171.3496.9970.70/73.72
  • FT: 싱글태스크 파인튜닝 / MT: 멀티태스크 파인튜닝
  • Baseline: KLUE 논문에서 소개된 dev set 에 대한 SOTA 점수

License

PAUST에서 만든 pko-t5는 MIT license 하에 공개되어 있습니다.

Contributors

dennispark

11 commits

edanlee

1 commits