Macropodus/csc_eval_public

Dataset

3

stars

8

commits

1

linked in READMEs

Feb 4, 2026

updated

cgec
correct
csc
eval
Browse cluster: Chinese Spelling Error Correction

README

csc_eval_public

一、测评数据说明

1.1 测评数据来源

1.gen_de3.json(5545): '的地得'纠错, 由人民日报/学习强国/chinese-poetry等高质量数据人工生成;
2.lemon_v2.tet.json(1053): relm论文提出的数据, 多领域拼写纠错数据集(7个领域), ; 包括game(GAM), encyclopedia (ENC), contract (COT), medical care(MEC), car (CAR), novel (NOV), and news (NEW)等领域;
3.acc_rmrb.tet.json(4636): 来自NER-199801(人民日报高质量语料);
4.acc_xxqg.tet.json(5000): 来自学习强国网站的高质量语料;
5.gen_passage.tet.json(10000): 源数据为qwen生成的好词好句, 由几乎所有的开源数据汇总的混淆词典生成;
6.textproof.tet.json(1447): NLP竞赛数据, TextProofreadingCompetition;
7.gen_xxqg.tet.json(5000): 源数据为学习强国网站的高质量语料, 由几乎所有的开源数据汇总的混淆词典生成;
8.faspell.dev.json(1000): 视频字幕通过OCR后获取的数据集; 来自爱奇艺的论文faspell;
9.lomo_tet.json(5000): 主要为音似中文拼写纠错数据集; 来自腾讯; 人工标注的数据集CSCD-NS;
10.mcsc_tet.5000.json(5000): 医学拼写纠错; 来自腾讯医典APP的真实历史日志; 注意论文说该数据集只关注医学实体的纠错, 常用字等的纠错并不关注;
11.ecspell.dev.json(1500): 来自ECSpell论文, 包括(law/med/gov)等三个领域;
12.sighan2013.dev.json(1000): 来自sighan13会议;
13.sighan2014.dev.json(1062): 来自sighan14会议;
14.sighan2015.dev.json(1100): 来自sighan15会议;
15.wenyanwen_and_poetry.tet.json(5000), 来自课本古诗和通用文言文;

1.2 测评数据预处理

测评数据都经过 全角转半角,繁简转化,标点符号标准化等操作;

1.3 其他说明

1.指标带common_的为宽松指标, 同开源项目pycorrector的评估指标;
2.指标带strict_的为严格指标, 同开源项目[wangwang110/CSC](https://github.com/wangwang110/CSC);
3.macbert4mdcspell_v1模型为训练使用mdcspell架构+bert的mlm-loss, 但是推理的时候只用bert-mlm;
4.acc_rmrb/acc_xxqg数据集没有错误, 用于评估模型的误纠率(过度纠错);
5.qwen25_15_b的模型为shibing624/chinese-text-correction-1.5b, 其训练数据包括了lemon_v2/mcsc_tet/ecspell的验证集和测试集, 其他的bert类模型的训练不包括验证集和测试集;

二、重要指标

2.1 F1(common_cor_f1)

model/common_cor_f1avggen_de3lemon_v2gen_passagetext_proofgen_xxqgfaspelllomo_tetmcsc_tetecspellsighan2013sighan2014sighan2015
macbert4csc_pycorrector45.842.4442.8931.4946.3126.0632.744.8327.9355.5170.8961.7266.81
macbert4csc_v168.5596.6765.6348.475.6538.4351.7670.1180.6385.5581.3857.6370.7
macbert4csc_v268.696.7466.0248.2675.7838.8451.9170.1780.7185.6180.9758.2269.95
macbert4mdcspell_v171.196.4270.0652.5579.6143.3753.8570.982.3887.4684.261.0871.32
qwen25_1.5_b45.1127.2989.4814.6183.913.8418.236.7196.2988.236.4115.6420.73

2.2 acc(common_cor_acc)

model/common_cor_accavggen_de3lemon_v2gen_passagetext_proofgen_xxqgfaspelllomo_tetmcsc_tetecspellsighan2013sighan2014sighan2015
macbert4csc_pycorrector48.2626.9628.6834.1655.2928.3822.260.9657.1667.7355.968.9372.73
macbert4csc_v165.3493.5649.7644.9874.6436.137.073.083.686.8769.262.6272.73
macbert4csc_v265.2293.6950.1444.9274.6436.2637.072.7283.6686.9368.562.4371.73
macbert4mdcspell_v167.1593.0954.847.7178.0939.5238.871.9284.7888.2773.263.2872.36
qwen25_1.5_b46.0915.8281.2922.9682.1719.0412.850.296.489.1322.827.8732.55

2.3 acc(acc_true, thr=0.75)

model/accavgacc_rmrbacc_xxqg
macbert4csc_pycorrector99.2499.2299.26
bertbase4csc_v198.7198.3699.06
macbert4csc_v197.7296.7298.72
macbert4csc_v297.8996.9898.8
macbert4mdcspell_v197.7596.5198.98
qwen25_1.5_b82.077.1486.86

数据集_古诗-文言文数据集测评

model/common_cor_f1detcor
shibing624/macbert4csc-base-chinese44.127.48
macbert4mdcspell_v158.9812.43
macbert4mdcspell_v250.6110.40
macbert4mdcspell_v373.2447.41

三、结果分析

1.macbert4csc_v1/macbert4csc_v2/macbert4mdcspell_v1等模型使用多种领域数据训练, 比较均衡, 也适合作为第一步的预训练模型, 可用于专有领域数据的继续微调;
2.比较macbert4csc_shibing624/bertbase4csc_v1/macbert4csc_v2/macbert4mdcspell_v1, 观察表2.3, 可以发现训练数据越多, 准确率提升的同时, 误纠率也会稍微高一些;
3.MFT(Mask-Correct)依旧有效, 不过对于数据量足够的情形提升不明显, 可能也是误纠率升高的一个重要原因;

Contributors

Macropodus

8 commits

Macropodus/csc_eval_public

Dataset

3

stars

8

commits

1

linked in READMEs

Feb 4, 2026

updated

cgec
correct
csc
eval
Browse cluster: Chinese Spelling Error Correction

README

csc_eval_public

一、测评数据说明

1.1 测评数据来源

1.gen_de3.json(5545): '的地得'纠错, 由人民日报/学习强国/chinese-poetry等高质量数据人工生成;
2.lemon_v2.tet.json(1053): relm论文提出的数据, 多领域拼写纠错数据集(7个领域), ; 包括game(GAM), encyclopedia (ENC), contract (COT), medical care(MEC), car (CAR), novel (NOV), and news (NEW)等领域;
3.acc_rmrb.tet.json(4636): 来自NER-199801(人民日报高质量语料);
4.acc_xxqg.tet.json(5000): 来自学习强国网站的高质量语料;
5.gen_passage.tet.json(10000): 源数据为qwen生成的好词好句, 由几乎所有的开源数据汇总的混淆词典生成;
6.textproof.tet.json(1447): NLP竞赛数据, TextProofreadingCompetition;
7.gen_xxqg.tet.json(5000): 源数据为学习强国网站的高质量语料, 由几乎所有的开源数据汇总的混淆词典生成;
8.faspell.dev.json(1000): 视频字幕通过OCR后获取的数据集; 来自爱奇艺的论文faspell;
9.lomo_tet.json(5000): 主要为音似中文拼写纠错数据集; 来自腾讯; 人工标注的数据集CSCD-NS;
10.mcsc_tet.5000.json(5000): 医学拼写纠错; 来自腾讯医典APP的真实历史日志; 注意论文说该数据集只关注医学实体的纠错, 常用字等的纠错并不关注;
11.ecspell.dev.json(1500): 来自ECSpell论文, 包括(law/med/gov)等三个领域;
12.sighan2013.dev.json(1000): 来自sighan13会议;
13.sighan2014.dev.json(1062): 来自sighan14会议;
14.sighan2015.dev.json(1100): 来自sighan15会议;
15.wenyanwen_and_poetry.tet.json(5000), 来自课本古诗和通用文言文;

1.2 测评数据预处理

测评数据都经过 全角转半角,繁简转化,标点符号标准化等操作;

1.3 其他说明

1.指标带common_的为宽松指标, 同开源项目pycorrector的评估指标;
2.指标带strict_的为严格指标, 同开源项目[wangwang110/CSC](https://github.com/wangwang110/CSC);
3.macbert4mdcspell_v1模型为训练使用mdcspell架构+bert的mlm-loss, 但是推理的时候只用bert-mlm;
4.acc_rmrb/acc_xxqg数据集没有错误, 用于评估模型的误纠率(过度纠错);
5.qwen25_15_b的模型为shibing624/chinese-text-correction-1.5b, 其训练数据包括了lemon_v2/mcsc_tet/ecspell的验证集和测试集, 其他的bert类模型的训练不包括验证集和测试集;

二、重要指标

2.1 F1(common_cor_f1)

model/common_cor_f1avggen_de3lemon_v2gen_passagetext_proofgen_xxqgfaspelllomo_tetmcsc_tetecspellsighan2013sighan2014sighan2015
macbert4csc_pycorrector45.842.4442.8931.4946.3126.0632.744.8327.9355.5170.8961.7266.81
macbert4csc_v168.5596.6765.6348.475.6538.4351.7670.1180.6385.5581.3857.6370.7
macbert4csc_v268.696.7466.0248.2675.7838.8451.9170.1780.7185.6180.9758.2269.95
macbert4mdcspell_v171.196.4270.0652.5579.6143.3753.8570.982.3887.4684.261.0871.32
qwen25_1.5_b45.1127.2989.4814.6183.913.8418.236.7196.2988.236.4115.6420.73

2.2 acc(common_cor_acc)

model/common_cor_accavggen_de3lemon_v2gen_passagetext_proofgen_xxqgfaspelllomo_tetmcsc_tetecspellsighan2013sighan2014sighan2015
macbert4csc_pycorrector48.2626.9628.6834.1655.2928.3822.260.9657.1667.7355.968.9372.73
macbert4csc_v165.3493.5649.7644.9874.6436.137.073.083.686.8769.262.6272.73
macbert4csc_v265.2293.6950.1444.9274.6436.2637.072.7283.6686.9368.562.4371.73
macbert4mdcspell_v167.1593.0954.847.7178.0939.5238.871.9284.7888.2773.263.2872.36
qwen25_1.5_b46.0915.8281.2922.9682.1719.0412.850.296.489.1322.827.8732.55

2.3 acc(acc_true, thr=0.75)

model/accavgacc_rmrbacc_xxqg
macbert4csc_pycorrector99.2499.2299.26
bertbase4csc_v198.7198.3699.06
macbert4csc_v197.7296.7298.72
macbert4csc_v297.8996.9898.8
macbert4mdcspell_v197.7596.5198.98
qwen25_1.5_b82.077.1486.86

数据集_古诗-文言文数据集测评

model/common_cor_f1detcor
shibing624/macbert4csc-base-chinese44.127.48
macbert4mdcspell_v158.9812.43
macbert4mdcspell_v250.6110.40
macbert4mdcspell_v373.2447.41

三、结果分析

1.macbert4csc_v1/macbert4csc_v2/macbert4mdcspell_v1等模型使用多种领域数据训练, 比较均衡, 也适合作为第一步的预训练模型, 可用于专有领域数据的继续微调;
2.比较macbert4csc_shibing624/bertbase4csc_v1/macbert4csc_v2/macbert4mdcspell_v1, 观察表2.3, 可以发现训练数据越多, 准确率提升的同时, 误纠率也会稍微高一些;
3.MFT(Mask-Correct)依旧有效, 不过对于数据量足够的情形提升不明显, 可能也是误纠率升高的一个重要原因;

Contributors

Macropodus

8 commits