YeungNLP/firefly-pretrain-dataset

Dataset

42

stars

10

commits

2

linked in READMEs

Oct 21, 2023

updated

README

Firefly中文Llama2增量预训练数据

欢迎加入Firefly大模型技术交流群,关注我们的公众号。

数据简介

技术文章:QLoRA增量预训练与指令微调,及汉化Llama2的实践

该数据应为Firefly-LLaMA2-Chinese项目的增量预训练数据,一共约22GB文本,主要包含CLUE、ThucNews、CNews、COIG、维基百科等开源数据集,以及我们收集的古诗词、散文、文言文等,数据分布如下图。

模型列表 & 数据列表

我们开源了7B和13B的Base与Chat模型。Base模型是基于LLaMA2扩充中文词表后增量预训练得到的模型,Chat模型是在Base模型的基础上进行多轮对话指令微调。

为了探究基座模型对指令微调的影响,我们也微调了baichuan2-base模型,获得firefly-baichuan2-13b,具有不错的效果。更多中文微调,可查看Firefly项目

模型类型训练任务训练长度
🤗Firefly-LLaMA2-7B-Base基座模型CLM1024
🤗Firefly-LLaMA2-13B-Base基座模型CLM1024
🤗Firefly-LLaMA2-7B-Chat指令模型多轮指令微调1024
🤗Firefly-LLaMA2-13B-Chat指令模型多轮指令微调1024
🤗Firefly-Baichuan2-13B指令模型多轮指令微调1024
🤗Firefly-LLaMA2-7B-Chat-QLoRA指令模型多轮指令微调1024
🤗Firefly-LLaMA2-13B-Chat-QLoRA指令模型多轮指令微调1024

模型评测

我们在CMMLU和Open LLM Leaderboard上分别对模型的中文和英文能力进行了客观评测,并且在我们构建的人工评测集上进行了人工评测。 Open LLM Leaderboard和CMMLU榜单倾向于评测大模型的做题能力,不够全面,所以我们进一步进行了人工评测。

Open LLM Leaderboard

模型AverageARCHellaSwagMMLUTruthfulQA
chinese-alpaca-2-13b60.9458.779.7455.150.22
openbuddy-llama2-13b-v8.160.4755.9779.7954.9551.16
flagalpha-llama2-13b-chat60.4155.9782.0554.7448.9
llama-2-13b-chat59.9359.0481.9454.6444.12
vicuna-13b-v1.159.2252.7380.1351.9452.08
guanaco-13b59.1857.8583.8448.2846.73
firefly-llama2-13b-chat59.0557.5177.9452.5648.18
llama-2-7b-chat56.3452.978.5548.3245.57
flagalpha-llama2-7b-chat56.1352.3977.5247.7246.87
yayi-7b-llama254.4555.0377.8440.9244.02
chinese-alpaca-2-7b54.3349.5772.6246.548.63
firefly-llama2-7b-chat54.1951.1973.3245.4746.78
yayi-13b-llama251.0648.5574.8238.6842.19
linly-llama2-7b49.0648.0473.2535.0439.92
linly-llama2-13b38.2233.6239.5933.9745.71
ziya-llama-13b*--76.950.3-

*表示分数来源于OpenCompass官方,而非Open LLM Leaderboard官方数据

Conclusion:我们的模型保留了llama2模型优秀的英文能力,在Open LLM Leaderboard上,与llama2-chat、vicuna-v1.1、guanaco等模型的表现及其接近。

CMMLU榜单

模型CMMLU训练细节
firefly-baichuan2-13b56.834*V100,QLoRA,指令微调
chinese-alpaca-2-13b45.1748*A40,LoRA,词表扩充 + 增量预训练 + 指令微调
openbuddy-llama2-13b-v8.141.66全量参数训练,词表扩充 + 指令微调
chinese-alpaca-2-7b40.8648*A40,LoRA,词表扩充 + 增量预训练 + 指令微调
ziya-llama-13b*39.9160*A100,全量参数训练,词表扩充 + 增量预训练 + 指令微调 + RLHF
chinese-alpaca-plus-13b*39.948*A40,LoRA,词表扩充 + 增量预训练 + 指令微调
firefly-llama2-13b-chat39.474*V100,QLoRA,词表扩充 + 增量预训练 + 指令微调
flagalpha-llama2-13b-chat39.20LoRA,指令微调
llama-2-13b-chat38.65全量参数训练,预训练 + 指令微调 + RLHF(全流程为英文)
firefly-llama2-7b-chat34.034*V100,QLoRA,词表扩充 + 增量预训练 + 指令微调
llama-2-7b-chat33.76全量参数训练,预训练 + 指令微调 + RLHF(全流程为英文)
flagalpha-llama2-7b-chat32.61LoRA,指令微调
chinese-alpaca-plus-7b*32.648*A40,LoRA,词表扩充 + 增量预训练 + 指令微调
yayi-13b-llama230.73指令微调
yayi-7b-llama230.47指令微调
linly-llama2-7b28.6832*A100,全量参数训练,词表扩充 + 混合训练
linly-llama2-13b26.3232*A100,全量参数训练,词表扩充 + 混合训练

我们统一采用OpenCompass工具来离线评测CMMLU,其中*表示结果来源于OpenCompass官方榜单或者由模型作者自测的分数。

Conclusions:

  • 与llama-2-chat相比,我们的模型在中文方面的能力具有一定的提升。
  • 对于中文词表扩充模型而言,我们的模型大幅领先全量训练的linly,与全量训练的ziya、chinese-alpaca-1及其接近。
  • firefly-baichuan2-13b一骑绝尘,并且在OpenCompass的CMMLU榜单,该分数可排第8,小幅落后于百川官方模型,进一步验证了基座模型的重要性。
  • 我们的模型在CMMLU上的指标与chinese-alpaca-2也存在一定的差距。这一现象很大程度与增量预训练数据量和数据分布相关,我们的增量预训练数据仅为22GB(未充分使用,详情见训练细节),增量预训练不够充分,且大部分为新闻语料,对于CMMLU能力的提升有限。

人工评测

我们构建了评测集,其中包含13种评测任务,评测数据详见data/firefly-eval.xlsx。大部分数据从Belle数据中进行采样和优化。 每种任务包含10条数据,一共130条数据。13种任务包含:头脑风暴、分类、Close QA、代码生成、 信息抽取、开放式生成、有害性检验、数学题、阅读理解、Open QA、Rewrite、Summarization、翻译。

评测标准如下:

  • 对于同一道题目,对两两模型的生成结果进行比较,存在胜负平三种关系。
  • 对于客观题,如果两个模型均回答正确,或均回答错误,则为平局。
  • 对于主观题,回答更加详细、真实、细节更丰富,则为获胜。当两者内容正确,并且详细程度非常接近时,或者各有千秋时,可视为平局。
  • 对于中文题目,如果目标回复为中文,但模型却回复英文,则判为错误。

详细的评测结果可参考:人工评测结果。在评测中,我们遵守设定的评测标准,但依旧难以完全避免主观因素的影响, 本着公开透明的原则,我们公开了评测细节,大家可比较模型效果。

同为基于LLaMA2进行汉化的模型,我们对Firefly-LLaMA2-13B-Chat和Linly-LLaMA2-13B进行了人工测评,从评测结果来看,我们的模型存在非常大的优势。 并且我们与Llama2-Chat-13B也进行了人工评测,也存在非常大的优势。

模型获胜平局失败
Firefly-LLaMA2-13B-Chat VS Linly-LLaMA2-13B43(33.08%)79(60.77%)8(6.15%)
Firefly-LLaMA2-13B-Chat VS Llama2-Chat-13B86(66.15%)40(30.77%)4(3.08%)

Contributors

YeungNLP

10 commits

YeungNLP/firefly-pretrain-dataset

Dataset

42

stars

10

commits

2

linked in READMEs

Oct 21, 2023

updated

README

Firefly中文Llama2增量预训练数据

欢迎加入Firefly大模型技术交流群,关注我们的公众号。

数据简介

技术文章:QLoRA增量预训练与指令微调,及汉化Llama2的实践

该数据应为Firefly-LLaMA2-Chinese项目的增量预训练数据,一共约22GB文本,主要包含CLUE、ThucNews、CNews、COIG、维基百科等开源数据集,以及我们收集的古诗词、散文、文言文等,数据分布如下图。

模型列表 & 数据列表

我们开源了7B和13B的Base与Chat模型。Base模型是基于LLaMA2扩充中文词表后增量预训练得到的模型,Chat模型是在Base模型的基础上进行多轮对话指令微调。

为了探究基座模型对指令微调的影响,我们也微调了baichuan2-base模型,获得firefly-baichuan2-13b,具有不错的效果。更多中文微调,可查看Firefly项目

模型类型训练任务训练长度
🤗Firefly-LLaMA2-7B-Base基座模型CLM1024
🤗Firefly-LLaMA2-13B-Base基座模型CLM1024
🤗Firefly-LLaMA2-7B-Chat指令模型多轮指令微调1024
🤗Firefly-LLaMA2-13B-Chat指令模型多轮指令微调1024
🤗Firefly-Baichuan2-13B指令模型多轮指令微调1024
🤗Firefly-LLaMA2-7B-Chat-QLoRA指令模型多轮指令微调1024
🤗Firefly-LLaMA2-13B-Chat-QLoRA指令模型多轮指令微调1024

模型评测

我们在CMMLU和Open LLM Leaderboard上分别对模型的中文和英文能力进行了客观评测,并且在我们构建的人工评测集上进行了人工评测。 Open LLM Leaderboard和CMMLU榜单倾向于评测大模型的做题能力,不够全面,所以我们进一步进行了人工评测。

Open LLM Leaderboard

模型AverageARCHellaSwagMMLUTruthfulQA
chinese-alpaca-2-13b60.9458.779.7455.150.22
openbuddy-llama2-13b-v8.160.4755.9779.7954.9551.16
flagalpha-llama2-13b-chat60.4155.9782.0554.7448.9
llama-2-13b-chat59.9359.0481.9454.6444.12
vicuna-13b-v1.159.2252.7380.1351.9452.08
guanaco-13b59.1857.8583.8448.2846.73
firefly-llama2-13b-chat59.0557.5177.9452.5648.18
llama-2-7b-chat56.3452.978.5548.3245.57
flagalpha-llama2-7b-chat56.1352.3977.5247.7246.87
yayi-7b-llama254.4555.0377.8440.9244.02
chinese-alpaca-2-7b54.3349.5772.6246.548.63
firefly-llama2-7b-chat54.1951.1973.3245.4746.78
yayi-13b-llama251.0648.5574.8238.6842.19
linly-llama2-7b49.0648.0473.2535.0439.92
linly-llama2-13b38.2233.6239.5933.9745.71
ziya-llama-13b*--76.950.3-

*表示分数来源于OpenCompass官方,而非Open LLM Leaderboard官方数据

Conclusion:我们的模型保留了llama2模型优秀的英文能力,在Open LLM Leaderboard上,与llama2-chat、vicuna-v1.1、guanaco等模型的表现及其接近。

CMMLU榜单

模型CMMLU训练细节
firefly-baichuan2-13b56.834*V100,QLoRA,指令微调
chinese-alpaca-2-13b45.1748*A40,LoRA,词表扩充 + 增量预训练 + 指令微调
openbuddy-llama2-13b-v8.141.66全量参数训练,词表扩充 + 指令微调
chinese-alpaca-2-7b40.8648*A40,LoRA,词表扩充 + 增量预训练 + 指令微调
ziya-llama-13b*39.9160*A100,全量参数训练,词表扩充 + 增量预训练 + 指令微调 + RLHF
chinese-alpaca-plus-13b*39.948*A40,LoRA,词表扩充 + 增量预训练 + 指令微调
firefly-llama2-13b-chat39.474*V100,QLoRA,词表扩充 + 增量预训练 + 指令微调
flagalpha-llama2-13b-chat39.20LoRA,指令微调
llama-2-13b-chat38.65全量参数训练,预训练 + 指令微调 + RLHF(全流程为英文)
firefly-llama2-7b-chat34.034*V100,QLoRA,词表扩充 + 增量预训练 + 指令微调
llama-2-7b-chat33.76全量参数训练,预训练 + 指令微调 + RLHF(全流程为英文)
flagalpha-llama2-7b-chat32.61LoRA,指令微调
chinese-alpaca-plus-7b*32.648*A40,LoRA,词表扩充 + 增量预训练 + 指令微调
yayi-13b-llama230.73指令微调
yayi-7b-llama230.47指令微调
linly-llama2-7b28.6832*A100,全量参数训练,词表扩充 + 混合训练
linly-llama2-13b26.3232*A100,全量参数训练,词表扩充 + 混合训练

我们统一采用OpenCompass工具来离线评测CMMLU,其中*表示结果来源于OpenCompass官方榜单或者由模型作者自测的分数。

Conclusions:

  • 与llama-2-chat相比,我们的模型在中文方面的能力具有一定的提升。
  • 对于中文词表扩充模型而言,我们的模型大幅领先全量训练的linly,与全量训练的ziya、chinese-alpaca-1及其接近。
  • firefly-baichuan2-13b一骑绝尘,并且在OpenCompass的CMMLU榜单,该分数可排第8,小幅落后于百川官方模型,进一步验证了基座模型的重要性。
  • 我们的模型在CMMLU上的指标与chinese-alpaca-2也存在一定的差距。这一现象很大程度与增量预训练数据量和数据分布相关,我们的增量预训练数据仅为22GB(未充分使用,详情见训练细节),增量预训练不够充分,且大部分为新闻语料,对于CMMLU能力的提升有限。

人工评测

我们构建了评测集,其中包含13种评测任务,评测数据详见data/firefly-eval.xlsx。大部分数据从Belle数据中进行采样和优化。 每种任务包含10条数据,一共130条数据。13种任务包含:头脑风暴、分类、Close QA、代码生成、 信息抽取、开放式生成、有害性检验、数学题、阅读理解、Open QA、Rewrite、Summarization、翻译。

评测标准如下:

  • 对于同一道题目,对两两模型的生成结果进行比较,存在胜负平三种关系。
  • 对于客观题,如果两个模型均回答正确,或均回答错误,则为平局。
  • 对于主观题,回答更加详细、真实、细节更丰富,则为获胜。当两者内容正确,并且详细程度非常接近时,或者各有千秋时,可视为平局。
  • 对于中文题目,如果目标回复为中文,但模型却回复英文,则判为错误。

详细的评测结果可参考:人工评测结果。在评测中,我们遵守设定的评测标准,但依旧难以完全避免主观因素的影响, 本着公开透明的原则,我们公开了评测细节,大家可比较模型效果。

同为基于LLaMA2进行汉化的模型,我们对Firefly-LLaMA2-13B-Chat和Linly-LLaMA2-13B进行了人工测评,从评测结果来看,我们的模型存在非常大的优势。 并且我们与Llama2-Chat-13B也进行了人工评测,也存在非常大的优势。

模型获胜平局失败
Firefly-LLaMA2-13B-Chat VS Linly-LLaMA2-13B43(33.08%)79(60.77%)8(6.15%)
Firefly-LLaMA2-13B-Chat VS Llama2-Chat-13B86(66.15%)40(30.77%)4(3.08%)

Contributors

YeungNLP

10 commits