Marker-Inc-Korea/Korean-OpenOrca

OpenOrca-KO dataset을 활용하여 llama2를 fine-tuning한 Korean-OpenOrca

18

stars

29

commits

Nov 1, 2023

updated

README

🐳Korean-OpenOrca🐳

Korean-OpenOrca

Korean-Open-platypus 데이터셋을 활용하여 llama-2-ko를 fine-tuning한 Korean-Platypus model

🐳KoR-Orca-Platypus-13B🥮: Hugging Face
🐳Korean-OpenOrca-13B: Hugging Face

🐳OpenOrca-KO: Hugging Face
🐳KOR-OpenOrca-Platypus: Hugging Face
본 연구는 (주)마커와 (주)미디어그룹사람과숲의 오픈소스 LLM 연구 컨소시엄에서 진행되었습니다.


Model BenchMark(KO-LLM; will update new version)

ModelAverageKo-ARCKo-HellaSwagKo-MMLUKo-TruthfulQAKo-CommonGen V2DatasetBase_model
🐳KoR-Orca-Platypus-13B50.1342.0653.9542.2843.5568.78KOR-OpenOrca-Platypusko-en-llama2-13b
🐳Korean-OpenOrca-13B47.8543.0954.1340.2445.2256.57🐳OpenOrca-KOko-en-llama2-13b
KoT-Platypus2-13B49.5543.6953.0542.2943.3465.38KoCoTKO-platypus2-13B
KO-platypus2-13B47.9044.2054.3142.4744.4154.11KOpen-platyusko-en-llama2-13b

News

Quick start

### KO-Platypus
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

repo = "kyujinpy/Korean-OpenOrca-13B"
OpenOrca = AutoModelForCausalLM.from_pretrained(
        repo,
        return_dict=True,
        torch_dtype=torch.float16,
        device_map='auto'
)
OpenOrca_tokenizer = AutoTokenizer.from_pretrained(repo)

Datasets

from datasets import load_dataset

# dataset testing
dataset = load_dataset("kyujinpy/OpenOrca-KO") # But currently, private repo. Please wait!

🐳OpenOrca-KO: Hugging Face

It is public state!

References

🐳OpenOrca
Kopen-Platypus🥮
🐳OpenOrca-KO
Platypus
llama-2-ko
ko-en-llama2
🐳Korean-OpenOrca-13B

TODO

  • Make KOR-OpenOrca
  • Share huggingface repo
  • Combined platypus+OpenOrca datasets
  • Make KOR-OpenOrca-Platypus
  • Share evaluation results
  • Share datasets

Contributors

KyujinHan

29 commits

Marker-Inc-Korea/Korean-OpenOrca

OpenOrca-KO dataset을 활용하여 llama2를 fine-tuning한 Korean-OpenOrca

18

stars

29

commits

Nov 1, 2023

updated

README

🐳Korean-OpenOrca🐳

Korean-OpenOrca

Korean-Open-platypus 데이터셋을 활용하여 llama-2-ko를 fine-tuning한 Korean-Platypus model

🐳KoR-Orca-Platypus-13B🥮: Hugging Face
🐳Korean-OpenOrca-13B: Hugging Face

🐳OpenOrca-KO: Hugging Face
🐳KOR-OpenOrca-Platypus: Hugging Face
본 연구는 (주)마커와 (주)미디어그룹사람과숲의 오픈소스 LLM 연구 컨소시엄에서 진행되었습니다.


Model BenchMark(KO-LLM; will update new version)

ModelAverageKo-ARCKo-HellaSwagKo-MMLUKo-TruthfulQAKo-CommonGen V2DatasetBase_model
🐳KoR-Orca-Platypus-13B50.1342.0653.9542.2843.5568.78KOR-OpenOrca-Platypusko-en-llama2-13b
🐳Korean-OpenOrca-13B47.8543.0954.1340.2445.2256.57🐳OpenOrca-KOko-en-llama2-13b
KoT-Platypus2-13B49.5543.6953.0542.2943.3465.38KoCoTKO-platypus2-13B
KO-platypus2-13B47.9044.2054.3142.4744.4154.11KOpen-platyusko-en-llama2-13b

News

Quick start

### KO-Platypus
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

repo = "kyujinpy/Korean-OpenOrca-13B"
OpenOrca = AutoModelForCausalLM.from_pretrained(
        repo,
        return_dict=True,
        torch_dtype=torch.float16,
        device_map='auto'
)
OpenOrca_tokenizer = AutoTokenizer.from_pretrained(repo)

Datasets

from datasets import load_dataset

# dataset testing
dataset = load_dataset("kyujinpy/OpenOrca-KO") # But currently, private repo. Please wait!

🐳OpenOrca-KO: Hugging Face

It is public state!

References

🐳OpenOrca
Kopen-Platypus🥮
🐳OpenOrca-KO
Platypus
llama-2-ko
ko-en-llama2
🐳Korean-OpenOrca-13B

TODO

  • Make KOR-OpenOrca
  • Share huggingface repo
  • Combined platypus+OpenOrca datasets
  • Make KOR-OpenOrca-Platypus
  • Share evaluation results
  • Share datasets

Contributors

KyujinHan

29 commits