team-lucid/deberta-v3-base-korean

Model

deberta-v3-base-korean

16

7 commits

3 linked in READMEs

updated Sep 16, 2024

See the code

README

deberta-v3-base-korean

Model Details

DeBERTa는 Disentangled Attention과 Enhanced Masked Language Model을 통해 BERT의 성능을 향상시킨 모델입니다. 그중 DeBERTa V3은 ELECTRA-Style Pre-Training에 Gradient-Disentangled Embedding Sharing을 적용하여 DeBERTA를 개선했습니다.

이 연구는 구글의 TPU Research Cloud(TRC)를 통해 지원받은 Cloud TPU로 학습되었습니다.

How to Get Started with the Model

from transformers import AutoTokenizer, DebertaV2ForSequenceClassification

tokenizer = AutoTokenizer.from_pretrained("team-lucid/deberta-v3-base-korean")
model = DebertaV2ForSequenceClassification.from_pretrained("team-lucid/deberta-v3-base-korean")

inputs = tokenizer("안녕, 세상!", return_tensors="pt")
outputs = model(**inputs)

Evaluation

Backbone
Parameters(M)
NSMC
(acc)
PAWS
(acc)
KorNLI
(acc)
KorSTS
(spearman)
Question Pair
(acc)
DistilKoBERT22M88.4162.5570.5573.2192.48
KoBERT85M89.6380.6579.0079.6493.93
XLM-Roberta-Base85M89.4982.9579.9279.0993.53
KcBERT-Base85M89.6266.9574.8575.5793.93
KcBERT-Large302M90.6870.1576.9977.4994.06
KoELECTRA-Small-v39.4M89.3677.4578.6080.7994.85
KoELECTRA-Base-v385M90.6384.4582.2485.5395.25
Ours
DeBERTa-xsmall22M91.2184.4082.1383.9095.38
DeBERTa-small43M91.3483.9081.6182.9794.98
DeBERTa-base86M91.2285.582.8184.4695.77

* 다른 모델의 결과는 KcBERT-Finetune 과 KoELECTRA를 참고했으며, Hyperparameter 역시 다른 모델과 유사하게 설정습니다.

Model Memory Requirements

dtypeLargest Layer or Residual GroupTotal SizeTraining using Adam
float32187.79 MB513.77 MB2.01 GB
float16/bfloat1693.9 MB256.88 MB1.0 GB
int846.95 MB128.44 MB513.77 MB
int423.47 MB64.22 MB256.88 MB
deberta-v2
deberta-v3
endpoints_compatible
pytorch
rust
safetensors
transformers

team-lucid/deberta-v3-base-korean

Model

deberta-v3-base-korean

16

7 commits

3 linked in READMEs

updated Sep 16, 2024

See the code

README

deberta-v3-base-korean

Model Details

DeBERTa는 Disentangled Attention과 Enhanced Masked Language Model을 통해 BERT의 성능을 향상시킨 모델입니다. 그중 DeBERTa V3은 ELECTRA-Style Pre-Training에 Gradient-Disentangled Embedding Sharing을 적용하여 DeBERTA를 개선했습니다.

이 연구는 구글의 TPU Research Cloud(TRC)를 통해 지원받은 Cloud TPU로 학습되었습니다.

How to Get Started with the Model

from transformers import AutoTokenizer, DebertaV2ForSequenceClassification

tokenizer = AutoTokenizer.from_pretrained("team-lucid/deberta-v3-base-korean")
model = DebertaV2ForSequenceClassification.from_pretrained("team-lucid/deberta-v3-base-korean")

inputs = tokenizer("안녕, 세상!", return_tensors="pt")
outputs = model(**inputs)

Evaluation

Backbone
Parameters(M)
NSMC
(acc)
PAWS
(acc)
KorNLI
(acc)
KorSTS
(spearman)
Question Pair
(acc)
DistilKoBERT22M88.4162.5570.5573.2192.48
KoBERT85M89.6380.6579.0079.6493.93
XLM-Roberta-Base85M89.4982.9579.9279.0993.53
KcBERT-Base85M89.6266.9574.8575.5793.93
KcBERT-Large302M90.6870.1576.9977.4994.06
KoELECTRA-Small-v39.4M89.3677.4578.6080.7994.85
KoELECTRA-Base-v385M90.6384.4582.2485.5395.25
Ours
DeBERTa-xsmall22M91.2184.4082.1383.9095.38
DeBERTa-small43M91.3483.9081.6182.9794.98
DeBERTa-base86M91.2285.582.8184.4695.77

* 다른 모델의 결과는 KcBERT-Finetune 과 KoELECTRA를 참고했으며, Hyperparameter 역시 다른 모델과 유사하게 설정습니다.

Model Memory Requirements

dtypeLargest Layer or Residual GroupTotal SizeTraining using Adam
float32187.79 MB513.77 MB2.01 GB
float16/bfloat1693.9 MB256.88 MB1.0 GB
int846.95 MB128.44 MB513.77 MB
int423.47 MB64.22 MB256.88 MB
deberta-v2
deberta-v3
endpoints_compatible
pytorch
rust
safetensors
transformers