LLM構築用の日本語チャットデータセット
DatasetはHugging Faceでも公開しています.
主に,英語で構築されたLLMモデルなどに対して,チャット(Instruction)応答タスクに関してLoRAなどでチューニングするために使用できます.
データの詳細は,以下の論文を参照してください.
なお,Citationには,よろしければ,以下をご利用ください.
@preprint{Hirano2023-llmj,
title={{llm-japanese-dataset v0: Construction of Japanese Chat Dataset for Large Language Models and its Methodology}},
author={Masanori HIRANO and Masahiro SUZUKI and Hiroki SAKAJI},
doi={10.48550/arXiv.2305.12720},
archivePrefix={arXiv},
arxivId={2305.12720},
year={2023}
}
などを歓迎します.もし,ご相談等がございましたら,下記メールアドレスまでお知らせください.
datasetsフォルダー内に,データの生成形式ごとにフォルダーを作成します.
各フォルダー内には,以下を含める必要があります.
data/000000.json: json形式のデータ.複数入れることができます.6桁の数字で,0から順に番号を振りますが,欠番は許容されます.この内容の詳細については下記で述べますREADME.md: データの説明書です.作成方法や,ライセンスなどを記載してください.それ以外については制約がありません.
"instruction""input""output""index": データセット内でのナンバリングを0から行います.なお,string形式にしてください.(e.g. "1")"category": データセット内でも,カテゴリー分けしていると後で便利な場合があります.# {データセット名}
## 作成方法
{ここに作成方法を記述.どこかから取得したのであればその旨記載}
## ライセンス
{ここにライセンスを記載.あればURLを追加.}
原則として,再頒布可能なもののみを含むようにしてください. そうでないものについては,組み込む前に要相談.
ただし,コピーレフトについては,許容しません.(作成したモデル自体もライセンス制約がついてしまうので) また,商用不可も原則として不可
datasets に組み込み可能なライセンスdatasets-cc-by-sa に組み込み可能なライセンス75 commits
9 commits
Python
95.6%
Shell
4.4%
LLM構築用の日本語チャットデータセット
DatasetはHugging Faceでも公開しています.
主に,英語で構築されたLLMモデルなどに対して,チャット(Instruction)応答タスクに関してLoRAなどでチューニングするために使用できます.
データの詳細は,以下の論文を参照してください.
なお,Citationには,よろしければ,以下をご利用ください.
@preprint{Hirano2023-llmj,
title={{llm-japanese-dataset v0: Construction of Japanese Chat Dataset for Large Language Models and its Methodology}},
author={Masanori HIRANO and Masahiro SUZUKI and Hiroki SAKAJI},
doi={10.48550/arXiv.2305.12720},
archivePrefix={arXiv},
arxivId={2305.12720},
year={2023}
}
などを歓迎します.もし,ご相談等がございましたら,下記メールアドレスまでお知らせください.
datasetsフォルダー内に,データの生成形式ごとにフォルダーを作成します.
各フォルダー内には,以下を含める必要があります.
data/000000.json: json形式のデータ.複数入れることができます.6桁の数字で,0から順に番号を振りますが,欠番は許容されます.この内容の詳細については下記で述べますREADME.md: データの説明書です.作成方法や,ライセンスなどを記載してください.それ以外については制約がありません.
"instruction""input""output""index": データセット内でのナンバリングを0から行います.なお,string形式にしてください.(e.g. "1")"category": データセット内でも,カテゴリー分けしていると後で便利な場合があります.# {データセット名}
## 作成方法
{ここに作成方法を記述.どこかから取得したのであればその旨記載}
## ライセンス
{ここにライセンスを記載.あればURLを追加.}
原則として,再頒布可能なもののみを含むようにしてください. そうでないものについては,組み込む前に要相談.
ただし,コピーレフトについては,許容しません.(作成したモデル自体もライセンス制約がついてしまうので) また,商用不可も原則として不可
datasets に組み込み可能なライセンスdatasets-cc-by-sa に組み込み可能なライセンス75 commits
9 commits
Python
95.6%
Shell
4.4%