CCL25-Eval-ZhengMing(争鸣)
CCL(China National Conference on Computational Linguistics)为中国计算语言学大会,会议组织单位为中国中文信息学会。CCL是全国最权威、最具影响力、规模最大的NLP会议之一,它聚焦于中国境内各类语言的智能计算和信息处理,为研讨和传播计算语言学最新学术和技术成果提供了广泛的高层次交流平台。第二十四届中国计算语言学大会CCL2025将于2025年8月在山东济南举行,会议由齐鲁工业大学(山东省科学院)承办。CCL25-Eval评测研讨会,旨在为中文信息处理研究者提供测试相关技术、算法和系统的平台。
[2025/05/16] 论文或技术报告提交入口开放时间为5月20日,提交入口关闭时间为6月1日。
[2025/05/16] 论文录用最迟通知为2025年6月15日。
[2025/04/26] 🚀 CCL25-Eval-Zhenming(争鸣)已经上线阿里云天池AI大模型比赛任务7-争鸣,进行实时排名。 根据压缩文件阿里云天池-CCL25Eval-ZhengMing.rar中的评测脚本文件(若压缩文件无法使用请在这里下载),会自动回传排名结果。我们会在截止时间取排名前6的队伍进行复现。
[2025/04/17] 应CCL评测组委会要求,测试集结果提交截止时间由2025年5月31日提前至2025年5月20日。并且各参赛队伍需要在2025年5月20日之前在openreview提交一份技术报告或论文(技术报告正文至少两页,参考文献不计;中文论文正文4-6页页,英文4页,参考文献和附录不计),格式见CCL2025。
[2025/04/17] 论文录用最迟通知为2025年6月1日。
[2025/03/09] 🔥 报名截至时间由3月9号延迟至4月30日。
中国文学语言理解评测-争鸣(ZhengMing),是一个“通用可扩展”的评测框架,本框架可用于评测文学领域任务在转向自然语言处理(NLP)中的文本分类、文本生成、自动问答、关系抽取、机器翻译等所有任务,特别是在词法、句法和语法的文学语言理解能力方面。
大语言模型(LLMs)已经成为自然语言处理领域中不可或缺的工具,尤其在文本生成、命名实体识别、机器翻译等任务中取得了显著进展,推动了人工智能研究和应用的发展。然而,在面向中国语言文学研究的应用中,现有的大模型仍面临诸多挑战,特别是在处理复杂的文学任务时,表现尚未达到理想效果。为了让这些模型更好地服务于中文文学领域,亟需构建专门针对中国文学研究的评估基准,以推动模型在该领域的深度理解与精准分析。
中文文学,特别是古典汉语文本,由于其语言的复杂性、多义性及浓厚的文化背景,给大语言模型带来了巨大的挑战。除了语言层面的难度,文学文本本身的高度专业性要求模型能够有效理解文学语言及其背后的深层次概念。例如,分析现代文学批评的倾向、理解古代文学知识、预测文学作品风格、进行文学语言风格转换等任务,都需要更加丰富和多样化的语料库。这些任务的实现依赖于大语言模型对文学语言细节的精准把握,从而提升其在复杂文学任务中的表现。
新一代的大语言模型(如Llama-2/3、Qwen1.5/2/2.5和InternLM-2)在中文通用领域的自然语言理解任务中表现出色,但在处理文学领域的复杂任务时,它们仍然面临较大挑战。数据稀缺性和标注困难使得这些模型在文学任务中多依赖自然语言指令,往往只能完成相对简单的任务,难以深入挖掘文学作品的深层次含义。此外,大部分现有的语言模型并非专为中文文学领域设计的,缺乏相应的微调指令集和性能评估基准,导致无法全面、准确地评估和比较它们在文学任务中的表现。这一短板不仅限制了相关研究的深入发展,也成为了学术研究中的重要瓶颈。
为了进一步提升大模型在中国文学语言分析方面的能力,并增强其在细粒度评估上的表现,我们精心构建了七个高质量的数据集。这些数据集不仅覆盖了丰富的文学文本类型,还涉及了多种语言理解任务,旨在推动大模型对中国文学语言的深度理解与精准分析。通过这些数据集的引入,我们期望能够在语言结构、文化内涵和文学风格等方面实现模型的全面提升,从而为中文自然语言处理领域的文学发展作出贡献。
ZhengMing(百家争鸣,争鸣)评测基准提供的七个任务(包括现代文学批评倾向、现代文学批评挖掘、古代文学知识理解、文学阅读理解、文学命名实体识别、文学作品风格预测和文学语言风格转换)涵盖了不同类型和风格的中国文学数据。这些任务从现代文学批评到古代文学知识,构成了一个多维度的评测框架,为大模型在文学领域的评估提供了诸多优势。首先,这些任务丰富了模型的训练和测试内容,涵盖了中国文学的独特文化背景和语言结构,进而使得大模型在评估过程中能够获得更加精准的结果,尤其在语言细节分析和风格迁移方面具有显著优势。其次,通过包含文言文等语言结构复杂的语料,以及市面上从未出现的现代文学批评史料,这些数据集能够有效测试大模型在处理未见文学任务上的泛化能力。数据集的基本信息以及数据分布信息如表1和表2所示。
数据集介绍:
| 数据集名称 | 文学任务 | 文体类型 | 语句类型 | 版权 | 来源 | 构建方式 |
|---|---|---|---|---|---|---|
| CritBias | 现代文学批评倾向 | 现代文 | 篇章 | Apache | [1] | 人工录入 |
| CritPred | 现代文学批评挖掘 | 现代文 | 篇章 | Apache | [1] | 人工录入 |
| ACLUE | 古代文学知识理解 | 古文 | 语句 | MIT | [2] | 提示校对 |
| ReadCom | 文学阅读理解 | 现代文 | 段落 | CC-BY-SA-4.0 | [3] | 提示校对 |
| LitNRE | 文学命名实体识别 | 现代文 | 语句 | Public | [4] | 提示校对 |
| AuthIDE | 文学作品风格预测 | 现代文 | 语句 | Public | [5] | 提示校对 |
| ClaTrans | 文学语言风格转换 | 古文 | 语句 | MIT | [6] | 提示校对 |
数据集统计:
| 数据集名称 | 原始大小 | 指令集 | 测试集 | 平均长度 | 长度范围 | *提示个数 | 用途 |
|---|---|---|---|---|---|---|---|
| CritBias | 1,014 | - | 141 | 2,572 | 227-17,432 | 10 | 域外测试 |
| CritPred | 1,014 | - | 829 | 1,970 | 16-16,275 | 10 | 域外测试 |
| ACLUE | 49,660 | 49,660 | 2,000 | 136 | 27-2,146 | 10 | 模型微调 |
| ReadCom | 29,013 | 29,013 | 2,000 | 315 | 65-955 | 10 | 模型微调 |
| LitNRE | 28,894 | 27,864 | 2,750 | 45 | 2-2,007 | 10 | 模型微调 |
| AuthIDE | 30,324 | 30,324 | 2,000 | 32 | 2-621 | 10 | 模型微调 |
| ClaTrans | 972,467 | 972,467 | 2,000 | 20 | 1-1,452 | 10 | 模型微调 |
*注:所有任务的提示(Prompt)都经过严格的人工评估,以确保提示适应不同的模型。提示的评估小组由8名研究生和2名本科生组成,成员具备文学专业的背景,通过ChatALL平台使用不同LLM对3-4个问题(共10轮)进行评分,评估准确性、自然性和信息量,保留平均得分超过2的提示,确保其广泛适用和公平性。
[1] 陈思广 (2021).中国现代长篇小说编年史(1922—1949), 武汉出版社.
[2] Zhang, Y., & Li, H. (2023). Can large language model comprehend ancient chinese? a preliminary test on aclue. arXiv preprint arXiv:2310.09550.
[3] Cui, Y., Liu, T., Chen, Z., Wang, S., & Hu, G. (2016). Consensus attention-based neural networks for Chinese reading comprehension. arXiv preprint arXiv:1607.02250.
[4] Xu, J., Wen, J., Sun, X., & Su, Q. (2017). A discourse-level named entity recognition and relation extraction dataset for chinese literature text. arXiv preprint arXiv:1711.07010.
[5] https://gitee.com/zhang-chen-peng/Chinese-Authorship-Identification-Dataset
[6] https://github.com/NiuTrans/Classical-Modern
该任务的内容来源于现代报刊中的文学评论文章(纸质原稿来源于“近代报纸数据库”、“全国报刊索引数据库”、“大公报”、“申报”、“大成故纸堆数据库”、“民国图书数据库”等珍贵的馆藏资源数据库),由四川大学陈思广教授团队于2004年开始历经20余年精心标注而成。首先,从民国时期的多个主流报刊中挑选了涵盖不同文学流派、风格的作品的批评文献,以确保数据的多样性和代表性。所涉及的文学作品包括经典名著、当代畅销书籍以及重要文学事件的评论,广泛覆盖了各类文学作品。因为民国时期的报刊中存在竖向排版、繁体和污损的情况,数据采集团队对每个评论文章进行了手动录入、校对和整理 (见如下图示),确保每条数据的准确性。所有摘录的评价都经过精确标注,并进行了必要的格式化处理,以便后续研究使用。通过这一精细的采集和整理过程,先期根据批评文章的节选内容构建了部分语料并出版了《中国现代长篇小说编年史(1922-1949)》,最终构建了一个系统且富有深度的中国现当代文学批评史料-中国现代长篇小说批评文献数据库,共计400万余字。 “中国现代长篇小说批评文献数据库”详细考察了中国现代长篇小说的流变特质,深入探究了中国现代长篇小说在不同历史时段的创作风貌与接受样态,为现当代文学评论的实证研究提供了宝贵的数字资源。

随着战争的历史进程,批评话语的变迁是否与战争史同步?随着历史语境的不断变化,批评话语呈现出怎样的演进轨迹?面向现代文学实证研究的需要,我们基于中国现代长篇小说批评文献数据库构建了两个文学评价数据集:现代文学批评倾向(CritBias)和现代文学批评挖掘(CritPred)。对于现代文学批评倾向和现代文学批评挖掘这两个任务,ZhengMing只提供了测试集作为此次任务集的域外数据集,用来评估模型在新任务中的准确性、鲁棒性和泛化能力。
该数据集专注于现代文学批评中的情感分析任务,是一个判断文学评价中的情感倾向是积极、中性还是消极的过程。主要以20世纪早期的文学评论为内容,涵盖了多个文学作品的评论实例。其中每条数据都包含一个id(数据标识符)、text(输入文本)、query(任务提示及输入文本)、answer(正确答案)、choices(分类标签“积极”、“中性”、“消极”)及gold(正确答案在标签中的索引)。通过该数据集,研究人员可以对文学批评文本进行情感倾向的自动识别,推动中文文学评论的情感分析技术发展。数据集的标注确保了每条评论的情感分类准确,为文学批评情感分析、情感分类等领域的研究提供了丰富的素材和支持。
现代文学批评倾向评测任务提供了一个JSON格式的数据集。以下为相应的数据样例:
id:数据唯一标识符query:由两个部分组成,任务提示(prompt)以及输入文本(text),其中任务提示(prompt)是由人工编写的一种输入指令,用于引导大型语言模型生成特定的输出,帮助模型理解用户需求并产生相关的文本回应。answer:正确答案gold:正确答案在情感标签中的索引text:输入文本(现代文学批评文本)对于现代文学批评倾向的评测任务,我们采用了 准确率 (ACC)、Weighted F1-score、Macro F1 和 MCC((Matthews Correlation Coefficient)来全面评估模型的表现。以下是对这些指标的详细说明:
准确率 (ACC) 通过计算预测正确的样本占总样本的比率来测量模型的文本分类效果 计算公式如下:
$$ \text{ACC} = \frac{\text{TP} + \text{TN}}{\text{TP} + \text{TN} + \text{FP} + \text{FN}} $$
公式符号解释
评价指标的说明:
Weighted F1-score 是精确率 (Precision) 和召回率 (Recall) 的加权调和平均,常用于评估模型在多类别分类问题中的整体性能,尤其适用于类别不平衡的情感分析任务。它通过考虑每个类别的支持度(即类别中的样本数),来平衡各类别对总体评价的影响。
F1-score 计算公式如下:
$$ F1 = 2 \times \frac{\text{Precision} \times \text{Recall}}{\text{Precision} + \text{Recall}} $$
公式符号解释
$$ \text{Precision} = \frac{\text{TP}}{\text{TP} + \text{FP}} $$
$$ \text{Recall} = \frac{\text{TP}}{\text{TP} + \text{FN}} $$
其中:
Weighted F1-score 计算过程: 在多类别情感分析中,Weighted F1-score 是根据每个类别的 F1-score 和该类别的支持度(样本数量)加权平均得到的:
$$ \text{Weighted F1-score} = \frac{\sum_{i=1}^N (F1_i×Support_i)}{\sum_{i=1}^N (Support_i} $$
公式符号解释
评价指标的说明:
Macro F1 是将各情感类别的 F1 值平均,用来衡量模型在不同情感类别上的一致性。Macro F1值能有效反映多类别情感分析任务中模型的均衡表现,尤其在类别比例不均衡的情感数据中,Macro F1尤为重要。
Macro F1 计算公式为:
$$ \text{Macro F1} = \frac{1}{N} \sum_{i=1}^N F1_i $$
公式符号解释
在现代文学批评向任务中,Macro F1用于观察模型在各类情感(如积极、消极、中性)上的表现是否均衡。
评价指标的说明:
MCC 是一种全面的分类指标,在情感分析中适合处理类别不均衡的数据,尤其适用于区分明显的正面与负面情感的任务。
MCC 计算公式如下:
$$ \text{MCC} = \frac{ \sum_{i=1}^{K} \sum_{j=1}^{K} C_{ij} \cdot \left( \delta_{i,j} - \frac{C_{i+} \cdot C_{+j}}{N^2} \right) } {\sqrt{ \sum_{i=1}^{K} \sum_{j=1}^{K} (C_{i+} \cdot C_{+j}) \cdot \left( \sum_{i=1}^{K} \sum_{j=1}^{K} (C_{i+} \cdot C_{+j}) \right)}} $$
公式符号解释
在情感倾向分析中,MCC 评估模型对各情感类别的平衡性。相比其他指标,MCC 能更有效地反映模型在复杂情感分析任务中的稳定性和整体适应性。
评价指标的说明:
现代文学批评挖掘任务旨在从评论文本中提取被评论的出版物名称。该数据集基于文学评价数据集“中国现代长篇小说批评文献数据库”构建,主要涵盖20世纪早期的文学评论,包含多个评论实例,每条数据包括id(标识符)、text(评论文本)、prompt(任务提示和评论文本)以及answer(正确答案)。该数据集的标注涵盖了评论文本中涉及的作品名称,为中文文本的自动信息提取与分析提供了重要的资源。
现代文学批评挖掘评测任务提供了一个JSON格式的数据集。以下为相应的数据样例:
id:数据唯一标识符query:由两个部分组成,prompt(任务提示)以及输入文本(text)answer:正确答案text:输入文本(现代文学评价文本)在本任务中,使用EM(Exact Match)来衡量模型在从评论文本中正确识别和提取被评论的出版物名称的能力。EM要求模型的预测结果与真实标签完全一致,因此它更严格,常用于文本生成、问答任务等领域。
EM的计算公式如下所示:
$$ EM = \frac{预测完全匹配的样本数}{总样本数} $$
古代文学知识理解,旨在通过选择题的形式,评估模型对古代文学作品、诗词和名言的理解与判断能力。
本任务是基于古汉语语言理解评估基准数据集而构建。该任务包含了一系列古文文学问题,主要用于评估模型主要用于评估模型在古文文学背景下文化背景理解、情感分析与情绪识别以及知识整合与跨领域理解的能力。每个问题提供了一个上下文和四个选项(“A”、“B”、“C”、“D”),模型需根据上下文进行判断,选出正确的答案。问题涵盖了古诗词中前后文连贯性、古文解析、诗词理解和文化背景等多个方面,适合用于中文文学教学或考试评估。该任务旨在评估模型对古代文学知识的理解能力。
该任务提供了一个JSON格式的数据集,其中每条数据都包含一个id(数据标识符)、text(问题及ABCD四个选项的内容)、query(任务提示及输入文本)、answer(正确答案)、choices(答案标签“A”、“B”、“C”、“D”)及gold(正确答案在标签中的索引)。以下为相应的数据样例:
该任务采用准确率 (ACC)、Weighted F1-score、Macro F1 和 MCC((Matthews Correlation Coefficient)来评估模型的表现。
机器智能的目标之一是实现对人类语言的深度阅读与理解。在众多机器阅读理解任务中,完形填空式阅读理解因其独特的挑战性吸引了大量研究者的关注。此类任务旨在让模型理解给定的上下文或文档,并通过分析语句的逻辑与语义,填补特定缺失的信息。任务要求模型能够从文本中精准提取适当的词语或字,以完成填空。该任务全面考察了模型在复杂语境中的理解能力,包括上下文的逻辑一致性及信息提取的准确性。它不仅是自然语言处理(NLP)领域中的关键能力指标,还在文学相关任务中具有重要意义。通过模拟真实的语言使用场景(如教育类阅读填空题),此任务为大语言模型在生成式任务的训练和评估提供了重要基准数据。这项任务还有助于提升模型在教育应用中的智能化表现,并增强其在文学分析、文本摘要等领域的实用性,为相关研究和实际应用场景提供了强有力的技术支撑。
本任务是基于Chinese-Cloze-RC数据集而构建,要求模型根据给定的文学文本,进行阅读理解和关键信息提取来填补缺失的信息(如空格处的XXXXX)。
该任务提供了一个JSON格式的数据集,其中每个条目都包含一个id(数据标识符)、text(输入文本)、query(任务提示及输入文本)、answer(正确答案)。以下为相应的数据样例:
该任务采用EM(Exact Match)来评估模型的表现。
文学命名实体识别是一项旨在通过自然语言处理技术(NLP)来分析和理解文学文本的任务。它关注模型对文学作品中复杂语境、语义关系及隐喻表达的理解能力,需要模型生成高质量的语义输出。通过这些任务,模型能够应对文学文本中语境复杂性和多义性的问题。文学命名实体识别在教育、文化和技术领域具有广泛应用价值,例如支持智能教学、促进文学分析,同时也为语言模型的通用性和细致性提供了高标准的评估基准。这使其成为人工智能与人文科学结合的重要方向之一。
我们基于Chinese-Literature-NER-RE-Dataset数据集构建了文学命名实体识别任务,该任务需要模型准确识别文学文本中的命名实体(Named Entities),并对其进行分类。识别的实体包括时间、人物、机构、事物、出版物名、数量词和地点,并输出其名称及对应类型。这类任务不仅关注基本实体的识别,还要求对上下文进行精细化理解以分类实体属性。文学文本通常语言表达丰富,包含隐喻、象征等复杂语义结构,对实体识别提出了更高的要求。模型需要深入分析句子中的语境、句法以及角色关系。
该任务提供了一个JSON格式的数据集,其中每条数据都包含一个id(数据标识符)、text(文学文本)、query(任务提示及输入文本)、answer(正确答案)及label(每个单词或短语分配的标签,用来标识其类别或类型。)。以下为相应的数据样例:
该任务采用Entity F1来评估模型的表现。Entity F1 是评估命名实体识别(NER)任务中模型性能的重要指标之一。它结合了 精确率(Precision)和召回率(Recall)的权衡,反映了模型在识别实体方面的综合能力。该指标特别适合评估实体边界和分类是否正确。
Entity Weighted F1-score:
$$ \text{Entity F1} = 2 \cdot \frac{P \cdot R}{P + R} $$
其中:
文学作品风格预测任务旨在通过分析文本的语言特征、句法结构和主题内容,判断其所属的作者或文体风格。这一任务聚焦于文本内部的风格差异,包括语言表达、句式选择、情感倾向以及语境背景等要素。任务中的作者或文学文本来自不同时代,语言风格和文化背景差异显著,为模型的判断能力提供了挑战。
我们基于中文作者身份识别数据集构建了文学作品风格预测任务,该任务需要模型准确识别出给定的文学文本中的文体风格,并判断给定的文本的作者是谁。这一数据集通过在文学作品间设计风格辨别任务,有助于更全面地评估模型的自然语言理解能力以及风格归因能力并且不同时代和文化背景的作家使用的语言表达方式存在较大差异,通过识别作者风格,可以测试模型是否能够适应多样化的语境。
该任务提供了一个JSON格式的数据集,其中每条数据都包含一个id(数据标识符)、text(文学文本)、query(任务提示及输入文本)、answer(正确答案)、choices(作者标签“鲁迅”、“莫言”)及gold(正确答案在标签中的索引)。以下为相应的数据样例:
该任务采用准确率 (ACC)、Weighted F1-score、Macro F1 和 MCC((Matthews Correlation Coefficient)来评估模型的表现。
文学语言转换是自然语言处理(NLP)领域的一项任务,旨在让模型实现一种文学语言形式向另一种文学语言形式的有效转换。这种任务的关键在于对源文本风格、语境、修辞手法以及情感表达的深刻理解,并在目标语言或形式中予以恰当保留或重现。
我们基于Classical-Modern构建了文学语言风格转换任务,该任务专注于文言文翻译任务,其内容包含多个文言文句子及其现代汉语翻译对。这些数据示例涵盖了中国古代语言的多样性,涉及历史、哲学、文学等领域,充分体现了文言文的精炼特点和文化背景。数据集中的句子经过标准化,既保留了文言文的典型表达方式,又确保翻译的现代汉语通俗易懂。文言文的语法结构与现代汉语差异显著,翻译任务可以锻炼模型对复杂语言形式的解析和理解能力,有助于提升模型的跨语言迁移能力并且中文言文的表达方式具有高度的语言压缩和多义性,可以有效提升模型对多义句和复杂上下文的处理能力,促进模型在低资源语言场景中的适应能力。
该任务提供了一个JSON格式的数据集,其中每个条目都包含一个id(数据标识符)、text(古代汉语文本)、query(任务提示及输入文本)、answer(正确答案)。以下为相应的数据样例:
该任务采用BERTScore-F1和BARTScore两个指标来评估模型的表现。
BERTScore 是基于 BERT 模型的文本相似度评估指标,BERTScore-F1 值是基于 精确度(Precision) 和 召回率(Recall) 的调和平均。
$$ \text{F1} = 2 \cdot \frac{\text{Precision} \cdot \text{Recall}}{\text{Precision} + \text{Recall}} $$
其中: 精确度(Precision) 和 召回率(Recall) 是基于 BERT 特征表示计算的:
BARTScore 是基于预训练的 BART 模型来评估生成文本质量的指标。BARTScore 通过计算生成文本与参考文本之间的文本重构误差来评估模型的生成质量。
$$ \text{BARTScore} = \frac{1}{N} \sum_{i=1}^{N} \text{BART}(\text{参考文本}_i, \text{生成文本}_i) $$
其中:
各任务使用的评价指标如下表所示:
| Task | Data | Test | Metrics |
|---|---|---|---|
| 现代文学批评倾向 | CritBias | 829 | ACC, Weighted F1-score, Macro F1, MCC |
| 现代文学批评挖掘 | CritPred | 141 | EM |
| 古代文学知识理解 | ACLUE | 2,000 | ACC, Weighted F1-score, Macro F1, mcc |
| 文学阅读理解 | ReadCom | 2,000 | EM |
| 文学命名实体识别 | LitNRE | 2,750 | Entity F1 |
| 文学作品风格预测 | AuthIDE | 6,064 | ACC, Weighted F1-score, Macro F1, MCC |
| 文学语言风格转换 | ClaTrans | 2,000 | BERTScore-F1, BARTScore |
各指标详细计算过程详情请看第二章任务介绍。
各任务的baseline
| 现代文学批评倾向 | ACC | Weighted F1-score | Macro F1 | MCC | Average |
|---|---|---|---|---|---|
| CritBias | 0.390 | 0.475 | 0.397 | 0.216 | 0.370 |
| 现代文学批评挖掘 | EM |
|---|---|
| CritPred | 0.735 |
| 古代文学知识理解 | ACC | Weighted F1-score | Macro F1 | MCC | Average |
|---|---|---|---|---|---|
| ACLUE | 0.475 | 0.467 | 0.468 | 0.317 | 0.432 |
| 文学阅读理解 | EM |
|---|---|
| ReadCom | 0.019 |
| 文学命名实体识别 | Entity F1 |
|---|---|
| LitNRE | 0.028 |
| 文学作品风格预测 | ACC | Weighted F1-score | Macro F1 | MCC | Average |
|---|---|---|---|---|---|
| AuthIDE | 0.794 | 0.802 | 0.802 | 0.612 | 0.753 |
| 文学语言风格转换 | BERTScore-F1 | BARTScore | Average |
|---|---|---|---|
| ClaTrans | 0.700 | -5.588 | -2.444 |
git clone https://github.com/isShayulajiao/CCL25-Eval-ZhengMing.git
cd CCL25-Eval-ZhengMing
pip install -r requirements.txt
cd src/literature-evaluation
pip install -e .[multilingual]
在评估之前,请下载BART模型到'src/metrics/BARTScore/bart_score.pth'。
BART模型是一个用来评测文学语言风格转换任务的预训练模型。对于自动化评测,请观看以下操作提示:
导入HuggingFace上模型(建议国内采用镜像https://hf-mirror.com/)
若要评估托管在 HuggingFace Hub 上的模型(例如,Baichuan2-7B-Base),请使用以下命令:
python src/eval.py \
--model hf-causal-vllm \
--tasks ZM_critbias \
--model_args use_accelerate=True,pretrained=baichuan-inc/Baichuan2-7B-Base,tokenizer=baichuan-inc/Baichuan2-7B-Base,max_gen_toks=1024,use_fast=False,dtype=float16,trust_remote_code=True
pretrained和tokenizer应该填写模型存放在本地的地址。max_gen_toks设置成20;评测现代文学批评挖掘、文学阅读理解和文学命名实体识别这三个任务时,max_gen_toks设置成200。常见模型使用的model参数如下表所示(一般hf-causal-vllm都能支持):
| 模型名称 | model参数 | 模型名称 | model参数 |
|---|---|---|---|
| bloomz_7b1 | hf-causal-vllm | Baichuan-7B | hf-causal-llama |
| Llama-2-7b-hf | hf-causal-llama | Baichuan2-7B-Base | hf-causal-vllm |
| Qwen-7B | hf-causal-vllm | Xunzi-Qwen1.5-7B | hf-causal-vllm |
| Qwen1.5-7B | hf-causal-vllm | internlm2-7b | hf-causal-vllm |
| Llama-3-8B | hf-causal-vllm | Qwen2-7B | hf-causal-vllm |
export OPENAI_API_SECRET_KEY=YOUR_KEY_HERE
python eval.py \
--model gpt-3.5-turbo \
--tasks ZM_aclue,ZM_authide,ZM_critpred
2025年1月19日:评测任务报名开始;
2025年3月10 日:报名截至;
2025年3月-5月:各报名参赛队开展技术评测;
2025年5月31日:测试集结果提交截止;
2025年6月5日:评测任务结束,公布参赛队伍的成绩和排名;
2025年6月10日:提交中文或英文技术报告;
2025年6月20日:评测论文审稿 & 录用通知;
2025年6月25日:评测论文Camera-ready版提交
2025年7月1日:评测论文纠错排版 & 提交ACL/CCL Anthology收录;
2025年8月:CCL 2025技术评测研讨会
论文可由中文或英文撰写,最多6页正文,参考文献页数不限。
采用双盲审稿,不可出现作者姓名和单位的信息,不符合要求会被拒稿
报告应至少包含以下四个部分:模型介绍、评测结果、结果分析与讨论和参考文献。
参赛队伍在测试集上参与评测,结果集使用ZhengMing评测框架最终生成的数据格式。
提交的压缩包命名为队伍名称+result.zip,其中包含七个任务的预测文件以及两个excel指标文件。
result.zip
CritBias.json
CritPred.json
ACLUE.json
ReadCom.json
LitNRE.json
AuthIDE.json
ClaTrans.json
metrics.xlsx
metrics_Avg.xlsx
$$\text{最终得分} = \frac{\sum_{i=1}^{7} \text{任务得分}_i}{7}$$
其中,任务得分 的取值为该任务所有评估指标的平均值。具体地,对于每个任务:
$$\text{任务得分} = \frac{\sum_{j=1}^{m} \text{指标得分}_j}{m}$$
其中:
趋动科技(VirtAITech)作为软件定义AI算力技术的领导厂商,专注于为全球用户提供国际领先的数据中心级AI算力虚拟化和资源池化软件及解决方案。
龙文(LoongTex)是为科研人员设计的全新 LaTeX 平台,集白板、笔记、论文写作于一体,支持云端协作,利用多模态 AI全程参与学术润色提升科研效率。
点击报名链接填写报名表 https://f.wps.cn/g/BYw3bQEo/ 进行报名,我们会发送邮件确认您已经参赛。本次评测提供的ZhengMing评测基准的语料以及代码均放置在驱动云AI训练平台上。
参赛队伍联系负责人需填写本次评测语料的使用权协议,并签署使用权协议不可用于商业用途,扫描后通过邮件发送至评测联系人王康(wangkang1@stu.ynu.edu.cn)。
本次评测将设置一、二、三等奖,中国中文信息学会计算语言学专委会(CIPS-CL)为获奖队伍提供荣誉证书。
1、陈思广 著《中国现代长篇小说编年史》 [J]. 新文学史料, 2022, (02): 199.
2、中国现代长篇小说研究的集大成之作 [J]. 现代中国文化与文学, 2022, (03): 417-418.
3、Xu L, Hu H, Zhang X, et al. CLUE: A Chinese language understanding evaluation benchmark[J]. arXiv preprint arXiv:2004.05986, 2020.
4、Wang A, Singh A, Michael J, et al. GLUE: a multi-task benchmark and analysis platform for natural language understanding. arXiv preprint arXiv:1804.07461, 2018.
5、Huang J, Zhu H, Xu C, et al. AuditWen: An Open-Source Large Language Model for Audit[J]. arXiv preprint arXiv:2410.10873, 2024.
6、Zhang X, Li B, Yang Q. CGCE: A Chinese Generative Chat Evaluation Benchmark for General and Financial Domains[J]. arXiv preprint arXiv:2305.14471, 2023.
7、Hu G, et al. No language is an island: Unifying Chinese and English in financial large language models, instruction data, and benchmarks[J]. arXiv preprint arXiv:2403.06249, 2024.
8、Bandarkar L, Liang D, Muller B, et al. The belebele benchmark: a parallel reading comprehension dataset in 122 language variants[J]. arXiv preprint arXiv:2308.16884, 2023.
9、Fei Z, Shen X, Zhu D, et al. Lawbench: Benchmarking legal knowledge of large language models[J]. arXiv preprint arXiv:2309.16289, 2023.
10、Cao J, Shi Y, Peng D, et al. C $^{3} $ Bench: A Comprehensive Classical Chinese Understanding Benchmark for Large Language Models[J]. arXiv preprint arXiv:2405.17732, 2024.
10 commits
3 commits
Python
83.6%
Perl
14.0%
Jupyter Notebook
1.8%
CCL25-Eval-ZhengMing(争鸣)
CCL(China National Conference on Computational Linguistics)为中国计算语言学大会,会议组织单位为中国中文信息学会。CCL是全国最权威、最具影响力、规模最大的NLP会议之一,它聚焦于中国境内各类语言的智能计算和信息处理,为研讨和传播计算语言学最新学术和技术成果提供了广泛的高层次交流平台。第二十四届中国计算语言学大会CCL2025将于2025年8月在山东济南举行,会议由齐鲁工业大学(山东省科学院)承办。CCL25-Eval评测研讨会,旨在为中文信息处理研究者提供测试相关技术、算法和系统的平台。
[2025/05/16] 论文或技术报告提交入口开放时间为5月20日,提交入口关闭时间为6月1日。
[2025/05/16] 论文录用最迟通知为2025年6月15日。
[2025/04/26] 🚀 CCL25-Eval-Zhenming(争鸣)已经上线阿里云天池AI大模型比赛任务7-争鸣,进行实时排名。 根据压缩文件阿里云天池-CCL25Eval-ZhengMing.rar中的评测脚本文件(若压缩文件无法使用请在这里下载),会自动回传排名结果。我们会在截止时间取排名前6的队伍进行复现。
[2025/04/17] 应CCL评测组委会要求,测试集结果提交截止时间由2025年5月31日提前至2025年5月20日。并且各参赛队伍需要在2025年5月20日之前在openreview提交一份技术报告或论文(技术报告正文至少两页,参考文献不计;中文论文正文4-6页页,英文4页,参考文献和附录不计),格式见CCL2025。
[2025/04/17] 论文录用最迟通知为2025年6月1日。
[2025/03/09] 🔥 报名截至时间由3月9号延迟至4月30日。
中国文学语言理解评测-争鸣(ZhengMing),是一个“通用可扩展”的评测框架,本框架可用于评测文学领域任务在转向自然语言处理(NLP)中的文本分类、文本生成、自动问答、关系抽取、机器翻译等所有任务,特别是在词法、句法和语法的文学语言理解能力方面。
大语言模型(LLMs)已经成为自然语言处理领域中不可或缺的工具,尤其在文本生成、命名实体识别、机器翻译等任务中取得了显著进展,推动了人工智能研究和应用的发展。然而,在面向中国语言文学研究的应用中,现有的大模型仍面临诸多挑战,特别是在处理复杂的文学任务时,表现尚未达到理想效果。为了让这些模型更好地服务于中文文学领域,亟需构建专门针对中国文学研究的评估基准,以推动模型在该领域的深度理解与精准分析。
中文文学,特别是古典汉语文本,由于其语言的复杂性、多义性及浓厚的文化背景,给大语言模型带来了巨大的挑战。除了语言层面的难度,文学文本本身的高度专业性要求模型能够有效理解文学语言及其背后的深层次概念。例如,分析现代文学批评的倾向、理解古代文学知识、预测文学作品风格、进行文学语言风格转换等任务,都需要更加丰富和多样化的语料库。这些任务的实现依赖于大语言模型对文学语言细节的精准把握,从而提升其在复杂文学任务中的表现。
新一代的大语言模型(如Llama-2/3、Qwen1.5/2/2.5和InternLM-2)在中文通用领域的自然语言理解任务中表现出色,但在处理文学领域的复杂任务时,它们仍然面临较大挑战。数据稀缺性和标注困难使得这些模型在文学任务中多依赖自然语言指令,往往只能完成相对简单的任务,难以深入挖掘文学作品的深层次含义。此外,大部分现有的语言模型并非专为中文文学领域设计的,缺乏相应的微调指令集和性能评估基准,导致无法全面、准确地评估和比较它们在文学任务中的表现。这一短板不仅限制了相关研究的深入发展,也成为了学术研究中的重要瓶颈。
为了进一步提升大模型在中国文学语言分析方面的能力,并增强其在细粒度评估上的表现,我们精心构建了七个高质量的数据集。这些数据集不仅覆盖了丰富的文学文本类型,还涉及了多种语言理解任务,旨在推动大模型对中国文学语言的深度理解与精准分析。通过这些数据集的引入,我们期望能够在语言结构、文化内涵和文学风格等方面实现模型的全面提升,从而为中文自然语言处理领域的文学发展作出贡献。
ZhengMing(百家争鸣,争鸣)评测基准提供的七个任务(包括现代文学批评倾向、现代文学批评挖掘、古代文学知识理解、文学阅读理解、文学命名实体识别、文学作品风格预测和文学语言风格转换)涵盖了不同类型和风格的中国文学数据。这些任务从现代文学批评到古代文学知识,构成了一个多维度的评测框架,为大模型在文学领域的评估提供了诸多优势。首先,这些任务丰富了模型的训练和测试内容,涵盖了中国文学的独特文化背景和语言结构,进而使得大模型在评估过程中能够获得更加精准的结果,尤其在语言细节分析和风格迁移方面具有显著优势。其次,通过包含文言文等语言结构复杂的语料,以及市面上从未出现的现代文学批评史料,这些数据集能够有效测试大模型在处理未见文学任务上的泛化能力。数据集的基本信息以及数据分布信息如表1和表2所示。
数据集介绍:
| 数据集名称 | 文学任务 | 文体类型 | 语句类型 | 版权 | 来源 | 构建方式 |
|---|---|---|---|---|---|---|
| CritBias | 现代文学批评倾向 | 现代文 | 篇章 | Apache | [1] | 人工录入 |
| CritPred | 现代文学批评挖掘 | 现代文 | 篇章 | Apache | [1] | 人工录入 |
| ACLUE | 古代文学知识理解 | 古文 | 语句 | MIT | [2] | 提示校对 |
| ReadCom | 文学阅读理解 | 现代文 | 段落 | CC-BY-SA-4.0 | [3] | 提示校对 |
| LitNRE | 文学命名实体识别 | 现代文 | 语句 | Public | [4] | 提示校对 |
| AuthIDE | 文学作品风格预测 | 现代文 | 语句 | Public | [5] | 提示校对 |
| ClaTrans | 文学语言风格转换 | 古文 | 语句 | MIT | [6] | 提示校对 |
数据集统计:
| 数据集名称 | 原始大小 | 指令集 | 测试集 | 平均长度 | 长度范围 | *提示个数 | 用途 |
|---|---|---|---|---|---|---|---|
| CritBias | 1,014 | - | 141 | 2,572 | 227-17,432 | 10 | 域外测试 |
| CritPred | 1,014 | - | 829 | 1,970 | 16-16,275 | 10 | 域外测试 |
| ACLUE | 49,660 | 49,660 | 2,000 | 136 | 27-2,146 | 10 | 模型微调 |
| ReadCom | 29,013 | 29,013 | 2,000 | 315 | 65-955 | 10 | 模型微调 |
| LitNRE | 28,894 | 27,864 | 2,750 | 45 | 2-2,007 | 10 | 模型微调 |
| AuthIDE | 30,324 | 30,324 | 2,000 | 32 | 2-621 | 10 | 模型微调 |
| ClaTrans | 972,467 | 972,467 | 2,000 | 20 | 1-1,452 | 10 | 模型微调 |
*注:所有任务的提示(Prompt)都经过严格的人工评估,以确保提示适应不同的模型。提示的评估小组由8名研究生和2名本科生组成,成员具备文学专业的背景,通过ChatALL平台使用不同LLM对3-4个问题(共10轮)进行评分,评估准确性、自然性和信息量,保留平均得分超过2的提示,确保其广泛适用和公平性。
[1] 陈思广 (2021).中国现代长篇小说编年史(1922—1949), 武汉出版社.
[2] Zhang, Y., & Li, H. (2023). Can large language model comprehend ancient chinese? a preliminary test on aclue. arXiv preprint arXiv:2310.09550.
[3] Cui, Y., Liu, T., Chen, Z., Wang, S., & Hu, G. (2016). Consensus attention-based neural networks for Chinese reading comprehension. arXiv preprint arXiv:1607.02250.
[4] Xu, J., Wen, J., Sun, X., & Su, Q. (2017). A discourse-level named entity recognition and relation extraction dataset for chinese literature text. arXiv preprint arXiv:1711.07010.
[5] https://gitee.com/zhang-chen-peng/Chinese-Authorship-Identification-Dataset
[6] https://github.com/NiuTrans/Classical-Modern
该任务的内容来源于现代报刊中的文学评论文章(纸质原稿来源于“近代报纸数据库”、“全国报刊索引数据库”、“大公报”、“申报”、“大成故纸堆数据库”、“民国图书数据库”等珍贵的馆藏资源数据库),由四川大学陈思广教授团队于2004年开始历经20余年精心标注而成。首先,从民国时期的多个主流报刊中挑选了涵盖不同文学流派、风格的作品的批评文献,以确保数据的多样性和代表性。所涉及的文学作品包括经典名著、当代畅销书籍以及重要文学事件的评论,广泛覆盖了各类文学作品。因为民国时期的报刊中存在竖向排版、繁体和污损的情况,数据采集团队对每个评论文章进行了手动录入、校对和整理 (见如下图示),确保每条数据的准确性。所有摘录的评价都经过精确标注,并进行了必要的格式化处理,以便后续研究使用。通过这一精细的采集和整理过程,先期根据批评文章的节选内容构建了部分语料并出版了《中国现代长篇小说编年史(1922-1949)》,最终构建了一个系统且富有深度的中国现当代文学批评史料-中国现代长篇小说批评文献数据库,共计400万余字。 “中国现代长篇小说批评文献数据库”详细考察了中国现代长篇小说的流变特质,深入探究了中国现代长篇小说在不同历史时段的创作风貌与接受样态,为现当代文学评论的实证研究提供了宝贵的数字资源。

随着战争的历史进程,批评话语的变迁是否与战争史同步?随着历史语境的不断变化,批评话语呈现出怎样的演进轨迹?面向现代文学实证研究的需要,我们基于中国现代长篇小说批评文献数据库构建了两个文学评价数据集:现代文学批评倾向(CritBias)和现代文学批评挖掘(CritPred)。对于现代文学批评倾向和现代文学批评挖掘这两个任务,ZhengMing只提供了测试集作为此次任务集的域外数据集,用来评估模型在新任务中的准确性、鲁棒性和泛化能力。
该数据集专注于现代文学批评中的情感分析任务,是一个判断文学评价中的情感倾向是积极、中性还是消极的过程。主要以20世纪早期的文学评论为内容,涵盖了多个文学作品的评论实例。其中每条数据都包含一个id(数据标识符)、text(输入文本)、query(任务提示及输入文本)、answer(正确答案)、choices(分类标签“积极”、“中性”、“消极”)及gold(正确答案在标签中的索引)。通过该数据集,研究人员可以对文学批评文本进行情感倾向的自动识别,推动中文文学评论的情感分析技术发展。数据集的标注确保了每条评论的情感分类准确,为文学批评情感分析、情感分类等领域的研究提供了丰富的素材和支持。
现代文学批评倾向评测任务提供了一个JSON格式的数据集。以下为相应的数据样例:
id:数据唯一标识符query:由两个部分组成,任务提示(prompt)以及输入文本(text),其中任务提示(prompt)是由人工编写的一种输入指令,用于引导大型语言模型生成特定的输出,帮助模型理解用户需求并产生相关的文本回应。answer:正确答案gold:正确答案在情感标签中的索引text:输入文本(现代文学批评文本)对于现代文学批评倾向的评测任务,我们采用了 准确率 (ACC)、Weighted F1-score、Macro F1 和 MCC((Matthews Correlation Coefficient)来全面评估模型的表现。以下是对这些指标的详细说明:
准确率 (ACC) 通过计算预测正确的样本占总样本的比率来测量模型的文本分类效果 计算公式如下:
$$ \text{ACC} = \frac{\text{TP} + \text{TN}}{\text{TP} + \text{TN} + \text{FP} + \text{FN}} $$
公式符号解释
评价指标的说明:
Weighted F1-score 是精确率 (Precision) 和召回率 (Recall) 的加权调和平均,常用于评估模型在多类别分类问题中的整体性能,尤其适用于类别不平衡的情感分析任务。它通过考虑每个类别的支持度(即类别中的样本数),来平衡各类别对总体评价的影响。
F1-score 计算公式如下:
$$ F1 = 2 \times \frac{\text{Precision} \times \text{Recall}}{\text{Precision} + \text{Recall}} $$
公式符号解释
$$ \text{Precision} = \frac{\text{TP}}{\text{TP} + \text{FP}} $$
$$ \text{Recall} = \frac{\text{TP}}{\text{TP} + \text{FN}} $$
其中:
Weighted F1-score 计算过程: 在多类别情感分析中,Weighted F1-score 是根据每个类别的 F1-score 和该类别的支持度(样本数量)加权平均得到的:
$$ \text{Weighted F1-score} = \frac{\sum_{i=1}^N (F1_i×Support_i)}{\sum_{i=1}^N (Support_i} $$
公式符号解释
评价指标的说明:
Macro F1 是将各情感类别的 F1 值平均,用来衡量模型在不同情感类别上的一致性。Macro F1值能有效反映多类别情感分析任务中模型的均衡表现,尤其在类别比例不均衡的情感数据中,Macro F1尤为重要。
Macro F1 计算公式为:
$$ \text{Macro F1} = \frac{1}{N} \sum_{i=1}^N F1_i $$
公式符号解释
在现代文学批评向任务中,Macro F1用于观察模型在各类情感(如积极、消极、中性)上的表现是否均衡。
评价指标的说明:
MCC 是一种全面的分类指标,在情感分析中适合处理类别不均衡的数据,尤其适用于区分明显的正面与负面情感的任务。
MCC 计算公式如下:
$$ \text{MCC} = \frac{ \sum_{i=1}^{K} \sum_{j=1}^{K} C_{ij} \cdot \left( \delta_{i,j} - \frac{C_{i+} \cdot C_{+j}}{N^2} \right) } {\sqrt{ \sum_{i=1}^{K} \sum_{j=1}^{K} (C_{i+} \cdot C_{+j}) \cdot \left( \sum_{i=1}^{K} \sum_{j=1}^{K} (C_{i+} \cdot C_{+j}) \right)}} $$
公式符号解释
在情感倾向分析中,MCC 评估模型对各情感类别的平衡性。相比其他指标,MCC 能更有效地反映模型在复杂情感分析任务中的稳定性和整体适应性。
评价指标的说明:
现代文学批评挖掘任务旨在从评论文本中提取被评论的出版物名称。该数据集基于文学评价数据集“中国现代长篇小说批评文献数据库”构建,主要涵盖20世纪早期的文学评论,包含多个评论实例,每条数据包括id(标识符)、text(评论文本)、prompt(任务提示和评论文本)以及answer(正确答案)。该数据集的标注涵盖了评论文本中涉及的作品名称,为中文文本的自动信息提取与分析提供了重要的资源。
现代文学批评挖掘评测任务提供了一个JSON格式的数据集。以下为相应的数据样例:
id:数据唯一标识符query:由两个部分组成,prompt(任务提示)以及输入文本(text)answer:正确答案text:输入文本(现代文学评价文本)在本任务中,使用EM(Exact Match)来衡量模型在从评论文本中正确识别和提取被评论的出版物名称的能力。EM要求模型的预测结果与真实标签完全一致,因此它更严格,常用于文本生成、问答任务等领域。
EM的计算公式如下所示:
$$ EM = \frac{预测完全匹配的样本数}{总样本数} $$
古代文学知识理解,旨在通过选择题的形式,评估模型对古代文学作品、诗词和名言的理解与判断能力。
本任务是基于古汉语语言理解评估基准数据集而构建。该任务包含了一系列古文文学问题,主要用于评估模型主要用于评估模型在古文文学背景下文化背景理解、情感分析与情绪识别以及知识整合与跨领域理解的能力。每个问题提供了一个上下文和四个选项(“A”、“B”、“C”、“D”),模型需根据上下文进行判断,选出正确的答案。问题涵盖了古诗词中前后文连贯性、古文解析、诗词理解和文化背景等多个方面,适合用于中文文学教学或考试评估。该任务旨在评估模型对古代文学知识的理解能力。
该任务提供了一个JSON格式的数据集,其中每条数据都包含一个id(数据标识符)、text(问题及ABCD四个选项的内容)、query(任务提示及输入文本)、answer(正确答案)、choices(答案标签“A”、“B”、“C”、“D”)及gold(正确答案在标签中的索引)。以下为相应的数据样例:
该任务采用准确率 (ACC)、Weighted F1-score、Macro F1 和 MCC((Matthews Correlation Coefficient)来评估模型的表现。
机器智能的目标之一是实现对人类语言的深度阅读与理解。在众多机器阅读理解任务中,完形填空式阅读理解因其独特的挑战性吸引了大量研究者的关注。此类任务旨在让模型理解给定的上下文或文档,并通过分析语句的逻辑与语义,填补特定缺失的信息。任务要求模型能够从文本中精准提取适当的词语或字,以完成填空。该任务全面考察了模型在复杂语境中的理解能力,包括上下文的逻辑一致性及信息提取的准确性。它不仅是自然语言处理(NLP)领域中的关键能力指标,还在文学相关任务中具有重要意义。通过模拟真实的语言使用场景(如教育类阅读填空题),此任务为大语言模型在生成式任务的训练和评估提供了重要基准数据。这项任务还有助于提升模型在教育应用中的智能化表现,并增强其在文学分析、文本摘要等领域的实用性,为相关研究和实际应用场景提供了强有力的技术支撑。
本任务是基于Chinese-Cloze-RC数据集而构建,要求模型根据给定的文学文本,进行阅读理解和关键信息提取来填补缺失的信息(如空格处的XXXXX)。
该任务提供了一个JSON格式的数据集,其中每个条目都包含一个id(数据标识符)、text(输入文本)、query(任务提示及输入文本)、answer(正确答案)。以下为相应的数据样例:
该任务采用EM(Exact Match)来评估模型的表现。
文学命名实体识别是一项旨在通过自然语言处理技术(NLP)来分析和理解文学文本的任务。它关注模型对文学作品中复杂语境、语义关系及隐喻表达的理解能力,需要模型生成高质量的语义输出。通过这些任务,模型能够应对文学文本中语境复杂性和多义性的问题。文学命名实体识别在教育、文化和技术领域具有广泛应用价值,例如支持智能教学、促进文学分析,同时也为语言模型的通用性和细致性提供了高标准的评估基准。这使其成为人工智能与人文科学结合的重要方向之一。
我们基于Chinese-Literature-NER-RE-Dataset数据集构建了文学命名实体识别任务,该任务需要模型准确识别文学文本中的命名实体(Named Entities),并对其进行分类。识别的实体包括时间、人物、机构、事物、出版物名、数量词和地点,并输出其名称及对应类型。这类任务不仅关注基本实体的识别,还要求对上下文进行精细化理解以分类实体属性。文学文本通常语言表达丰富,包含隐喻、象征等复杂语义结构,对实体识别提出了更高的要求。模型需要深入分析句子中的语境、句法以及角色关系。
该任务提供了一个JSON格式的数据集,其中每条数据都包含一个id(数据标识符)、text(文学文本)、query(任务提示及输入文本)、answer(正确答案)及label(每个单词或短语分配的标签,用来标识其类别或类型。)。以下为相应的数据样例:
该任务采用Entity F1来评估模型的表现。Entity F1 是评估命名实体识别(NER)任务中模型性能的重要指标之一。它结合了 精确率(Precision)和召回率(Recall)的权衡,反映了模型在识别实体方面的综合能力。该指标特别适合评估实体边界和分类是否正确。
Entity Weighted F1-score:
$$ \text{Entity F1} = 2 \cdot \frac{P \cdot R}{P + R} $$
其中:
文学作品风格预测任务旨在通过分析文本的语言特征、句法结构和主题内容,判断其所属的作者或文体风格。这一任务聚焦于文本内部的风格差异,包括语言表达、句式选择、情感倾向以及语境背景等要素。任务中的作者或文学文本来自不同时代,语言风格和文化背景差异显著,为模型的判断能力提供了挑战。
我们基于中文作者身份识别数据集构建了文学作品风格预测任务,该任务需要模型准确识别出给定的文学文本中的文体风格,并判断给定的文本的作者是谁。这一数据集通过在文学作品间设计风格辨别任务,有助于更全面地评估模型的自然语言理解能力以及风格归因能力并且不同时代和文化背景的作家使用的语言表达方式存在较大差异,通过识别作者风格,可以测试模型是否能够适应多样化的语境。
该任务提供了一个JSON格式的数据集,其中每条数据都包含一个id(数据标识符)、text(文学文本)、query(任务提示及输入文本)、answer(正确答案)、choices(作者标签“鲁迅”、“莫言”)及gold(正确答案在标签中的索引)。以下为相应的数据样例:
该任务采用准确率 (ACC)、Weighted F1-score、Macro F1 和 MCC((Matthews Correlation Coefficient)来评估模型的表现。
文学语言转换是自然语言处理(NLP)领域的一项任务,旨在让模型实现一种文学语言形式向另一种文学语言形式的有效转换。这种任务的关键在于对源文本风格、语境、修辞手法以及情感表达的深刻理解,并在目标语言或形式中予以恰当保留或重现。
我们基于Classical-Modern构建了文学语言风格转换任务,该任务专注于文言文翻译任务,其内容包含多个文言文句子及其现代汉语翻译对。这些数据示例涵盖了中国古代语言的多样性,涉及历史、哲学、文学等领域,充分体现了文言文的精炼特点和文化背景。数据集中的句子经过标准化,既保留了文言文的典型表达方式,又确保翻译的现代汉语通俗易懂。文言文的语法结构与现代汉语差异显著,翻译任务可以锻炼模型对复杂语言形式的解析和理解能力,有助于提升模型的跨语言迁移能力并且中文言文的表达方式具有高度的语言压缩和多义性,可以有效提升模型对多义句和复杂上下文的处理能力,促进模型在低资源语言场景中的适应能力。
该任务提供了一个JSON格式的数据集,其中每个条目都包含一个id(数据标识符)、text(古代汉语文本)、query(任务提示及输入文本)、answer(正确答案)。以下为相应的数据样例:
该任务采用BERTScore-F1和BARTScore两个指标来评估模型的表现。
BERTScore 是基于 BERT 模型的文本相似度评估指标,BERTScore-F1 值是基于 精确度(Precision) 和 召回率(Recall) 的调和平均。
$$ \text{F1} = 2 \cdot \frac{\text{Precision} \cdot \text{Recall}}{\text{Precision} + \text{Recall}} $$
其中: 精确度(Precision) 和 召回率(Recall) 是基于 BERT 特征表示计算的:
BARTScore 是基于预训练的 BART 模型来评估生成文本质量的指标。BARTScore 通过计算生成文本与参考文本之间的文本重构误差来评估模型的生成质量。
$$ \text{BARTScore} = \frac{1}{N} \sum_{i=1}^{N} \text{BART}(\text{参考文本}_i, \text{生成文本}_i) $$
其中:
各任务使用的评价指标如下表所示:
| Task | Data | Test | Metrics |
|---|---|---|---|
| 现代文学批评倾向 | CritBias | 829 | ACC, Weighted F1-score, Macro F1, MCC |
| 现代文学批评挖掘 | CritPred | 141 | EM |
| 古代文学知识理解 | ACLUE | 2,000 | ACC, Weighted F1-score, Macro F1, mcc |
| 文学阅读理解 | ReadCom | 2,000 | EM |
| 文学命名实体识别 | LitNRE | 2,750 | Entity F1 |
| 文学作品风格预测 | AuthIDE | 6,064 | ACC, Weighted F1-score, Macro F1, MCC |
| 文学语言风格转换 | ClaTrans | 2,000 | BERTScore-F1, BARTScore |
各指标详细计算过程详情请看第二章任务介绍。
各任务的baseline
| 现代文学批评倾向 | ACC | Weighted F1-score | Macro F1 | MCC | Average |
|---|---|---|---|---|---|
| CritBias | 0.390 | 0.475 | 0.397 | 0.216 | 0.370 |
| 现代文学批评挖掘 | EM |
|---|---|
| CritPred | 0.735 |
| 古代文学知识理解 | ACC | Weighted F1-score | Macro F1 | MCC | Average |
|---|---|---|---|---|---|
| ACLUE | 0.475 | 0.467 | 0.468 | 0.317 | 0.432 |
| 文学阅读理解 | EM |
|---|---|
| ReadCom | 0.019 |
| 文学命名实体识别 | Entity F1 |
|---|---|
| LitNRE | 0.028 |
| 文学作品风格预测 | ACC | Weighted F1-score | Macro F1 | MCC | Average |
|---|---|---|---|---|---|
| AuthIDE | 0.794 | 0.802 | 0.802 | 0.612 | 0.753 |
| 文学语言风格转换 | BERTScore-F1 | BARTScore | Average |
|---|---|---|---|
| ClaTrans | 0.700 | -5.588 | -2.444 |
git clone https://github.com/isShayulajiao/CCL25-Eval-ZhengMing.git
cd CCL25-Eval-ZhengMing
pip install -r requirements.txt
cd src/literature-evaluation
pip install -e .[multilingual]
在评估之前,请下载BART模型到'src/metrics/BARTScore/bart_score.pth'。
BART模型是一个用来评测文学语言风格转换任务的预训练模型。对于自动化评测,请观看以下操作提示:
导入HuggingFace上模型(建议国内采用镜像https://hf-mirror.com/)
若要评估托管在 HuggingFace Hub 上的模型(例如,Baichuan2-7B-Base),请使用以下命令:
python src/eval.py \
--model hf-causal-vllm \
--tasks ZM_critbias \
--model_args use_accelerate=True,pretrained=baichuan-inc/Baichuan2-7B-Base,tokenizer=baichuan-inc/Baichuan2-7B-Base,max_gen_toks=1024,use_fast=False,dtype=float16,trust_remote_code=True
pretrained和tokenizer应该填写模型存放在本地的地址。max_gen_toks设置成20;评测现代文学批评挖掘、文学阅读理解和文学命名实体识别这三个任务时,max_gen_toks设置成200。常见模型使用的model参数如下表所示(一般hf-causal-vllm都能支持):
| 模型名称 | model参数 | 模型名称 | model参数 |
|---|---|---|---|
| bloomz_7b1 | hf-causal-vllm | Baichuan-7B | hf-causal-llama |
| Llama-2-7b-hf | hf-causal-llama | Baichuan2-7B-Base | hf-causal-vllm |
| Qwen-7B | hf-causal-vllm | Xunzi-Qwen1.5-7B | hf-causal-vllm |
| Qwen1.5-7B | hf-causal-vllm | internlm2-7b | hf-causal-vllm |
| Llama-3-8B | hf-causal-vllm | Qwen2-7B | hf-causal-vllm |
export OPENAI_API_SECRET_KEY=YOUR_KEY_HERE
python eval.py \
--model gpt-3.5-turbo \
--tasks ZM_aclue,ZM_authide,ZM_critpred
2025年1月19日:评测任务报名开始;
2025年3月10 日:报名截至;
2025年3月-5月:各报名参赛队开展技术评测;
2025年5月31日:测试集结果提交截止;
2025年6月5日:评测任务结束,公布参赛队伍的成绩和排名;
2025年6月10日:提交中文或英文技术报告;
2025年6月20日:评测论文审稿 & 录用通知;
2025年6月25日:评测论文Camera-ready版提交
2025年7月1日:评测论文纠错排版 & 提交ACL/CCL Anthology收录;
2025年8月:CCL 2025技术评测研讨会
论文可由中文或英文撰写,最多6页正文,参考文献页数不限。
采用双盲审稿,不可出现作者姓名和单位的信息,不符合要求会被拒稿
报告应至少包含以下四个部分:模型介绍、评测结果、结果分析与讨论和参考文献。
参赛队伍在测试集上参与评测,结果集使用ZhengMing评测框架最终生成的数据格式。
提交的压缩包命名为队伍名称+result.zip,其中包含七个任务的预测文件以及两个excel指标文件。
result.zip
CritBias.json
CritPred.json
ACLUE.json
ReadCom.json
LitNRE.json
AuthIDE.json
ClaTrans.json
metrics.xlsx
metrics_Avg.xlsx
$$\text{最终得分} = \frac{\sum_{i=1}^{7} \text{任务得分}_i}{7}$$
其中,任务得分 的取值为该任务所有评估指标的平均值。具体地,对于每个任务:
$$\text{任务得分} = \frac{\sum_{j=1}^{m} \text{指标得分}_j}{m}$$
其中:
趋动科技(VirtAITech)作为软件定义AI算力技术的领导厂商,专注于为全球用户提供国际领先的数据中心级AI算力虚拟化和资源池化软件及解决方案。
龙文(LoongTex)是为科研人员设计的全新 LaTeX 平台,集白板、笔记、论文写作于一体,支持云端协作,利用多模态 AI全程参与学术润色提升科研效率。
点击报名链接填写报名表 https://f.wps.cn/g/BYw3bQEo/ 进行报名,我们会发送邮件确认您已经参赛。本次评测提供的ZhengMing评测基准的语料以及代码均放置在驱动云AI训练平台上。
参赛队伍联系负责人需填写本次评测语料的使用权协议,并签署使用权协议不可用于商业用途,扫描后通过邮件发送至评测联系人王康(wangkang1@stu.ynu.edu.cn)。
本次评测将设置一、二、三等奖,中国中文信息学会计算语言学专委会(CIPS-CL)为获奖队伍提供荣誉证书。
1、陈思广 著《中国现代长篇小说编年史》 [J]. 新文学史料, 2022, (02): 199.
2、中国现代长篇小说研究的集大成之作 [J]. 现代中国文化与文学, 2022, (03): 417-418.
3、Xu L, Hu H, Zhang X, et al. CLUE: A Chinese language understanding evaluation benchmark[J]. arXiv preprint arXiv:2004.05986, 2020.
4、Wang A, Singh A, Michael J, et al. GLUE: a multi-task benchmark and analysis platform for natural language understanding. arXiv preprint arXiv:1804.07461, 2018.
5、Huang J, Zhu H, Xu C, et al. AuditWen: An Open-Source Large Language Model for Audit[J]. arXiv preprint arXiv:2410.10873, 2024.
6、Zhang X, Li B, Yang Q. CGCE: A Chinese Generative Chat Evaluation Benchmark for General and Financial Domains[J]. arXiv preprint arXiv:2305.14471, 2023.
7、Hu G, et al. No language is an island: Unifying Chinese and English in financial large language models, instruction data, and benchmarks[J]. arXiv preprint arXiv:2403.06249, 2024.
8、Bandarkar L, Liang D, Muller B, et al. The belebele benchmark: a parallel reading comprehension dataset in 122 language variants[J]. arXiv preprint arXiv:2308.16884, 2023.
9、Fei Z, Shen X, Zhu D, et al. Lawbench: Benchmarking legal knowledge of large language models[J]. arXiv preprint arXiv:2309.16289, 2023.
10、Cao J, Shi Y, Peng D, et al. C $^{3} $ Bench: A Comprehensive Classical Chinese Understanding Benchmark for Large Language Models[J]. arXiv preprint arXiv:2405.17732, 2024.
10 commits
3 commits
Python
83.6%
Perl
14.0%
Jupyter Notebook
1.8%