edahanoam/Awesome-Summarization-Datasets

Updating collection of summarization datasets in 100+ languages, based on our paper "The State and Fate of Summarization Datasets: A Survey".

32

44 commits

updated Apr 29, 2025

See the code

README

Awesome-Summarization-Datasets

The collection and ontology is a result of our paper The State and Fate of Summarization Datasets: A Survey (NAACL 2025).

plot

Citing

If our survey contributes to your research, please reference the following paper in your work:

@inproceedings{dahan-stanovsky-2025-state,
    title = "The State and Fate of Summarization Datasets: A Survey",
    author = "Dahan, Noam  and
      Stanovsky, Gabriel",
    editor = "Chiruzzo, Luis  and
      Ritter, Alan  and
      Wang, Lu",
    booktitle = "Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers)",
    month = apr,
    year = "2025",
    address = "Albuquerque, New Mexico",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2025.naacl-long.372/",
    pages = "7259--7278",
    ISBN = "979-8-89176-189-6"
}

Data Card

For standardization, we recommend using the Summarization Data Card, which follows findings from our survey.

📋 Click here to copy the LaTeX code
\begin{table}[tb!]
\resizebox{\columnwidth}{!}{%
\begin{tabular}{|p{7.5cm}|}

\hline
\textbf{Summarization Data Card}                                                                                      \\ \hline
\textbf{\underline{Sample information:}}      
\\
\textbf{Languages:} 
\newline
\textit{List all supported languages}                                                                               \\
\textbf{Summary Shape:}
\newline
\textit{Paragraph/One Sentence/Highlights/Span}                                                                \\
\textbf{Domain:} 
\newline
\textit{Example: News/Scientific/Dialogues/etc.}                                                                       \\
\textbf{Size:}
\newline
\textit{Number of document-summary pairs}                                                                                \\ \hline
\textbf{\underline{Annotation information:}}                                                                                      \\
\begin{tabular}[|p{7.5cm}|]{@{}l@{}}\textbf{Annotation efforts:} \\ \textit{Automatic, Human annotations, Semi-automatic}\end{tabular}   \\
\begin{tabular}[|p{7.5cm}|]{@{}l@{}}\textbf{Source of supervision:}\\ \textit{Natural} (summaries created organically)/ \\ \textit{Distant} (annotations are proxies of summaries)/\\ \textit{Dedicated} (annotations created by researchers)\end{tabular} \\
\begin{tabular}[|p{7.5cm}|]{@{}l@{}}\textbf{Brief description of the summaries' source:} \\ \textit{Example:
digests of legal documents}\end{tabular} \\ \hline
\textbf{\underline{Data quality assessment:}}                                                                                     \\
\begin{tabular}[|p{7.5cm}|]{@{}l@{}}\textbf{Abstraction level:} \\ \textit{1-to-4-gram ratios} \end{tabular} \\
\textbf{Compression rate:}  
$ \frac{\text{doc length (\#words)}}{\text{summary length (\#words)}}$                                                                                                    \\
\textbf{Human evaluation:} \textit{Yes/No}                                                                                              \\ \hline
\textbf{\underline{Availability details:}}                                                                                        \\
\begin{tabular}[|p{7.5cm}|]{@{}l@{}}\textbf{How is the data made accessible:} \\ \textit{Publicly Available} / \\
\textit{URL-based Reconstruction} / \\ \textit{Upon Request}\end{tabular}    \\
\begin{tabular}[c]{@{}l@{}}\textbf{Copyrights information:} \\ \textit{License}\end{tabular}                                            \\ \hline
\end{tabular}%
}
\caption{Template for a summarization data card.}
\label{tab:datacard}

\end{table}

                                                                                                                                                                                                               

plot

Explore Interactively

Use our platform to easily explore and search for datasets by category. Please note that it only features the datasets included in the survey.

Datasets

If you'd like to contribute a dataset, please submit a pull request.

Paragraph

These datasets contain output texts composed of one or more paragraphs of coherent free text.

Dataset NamePaperLanguagesLanguage ModalityDomainSupervisionAnnotation EffortsAvailabilitySub-Task#SamplesHuman Eval On Data
DUC 2001-2007The Document Understanding Conference (DUC)EnglishMonolingualNewsDedicatedHumanUpon RequestMultidocument, Query-focused45-
MultiLing 2013Multi-document multilingual summarization and evaluation tracks in ACL 2013 MultiLing WorkshopArabic, Czech, English, French, Modern Greek, Hebrew, Hindi, Chinese, Romanian, SpanishMultilingualNewsNaturallyAutomaticUpon RequestMultidocument150-
MultiLing 2015, 2017MultiLing 2017 OverviewAfrikaans, Arabic, Azerbaijani, Bulgarian, Bosnian, Catalan, Czech, German, Modern Greek, English, Esperanto, Spanish, Basque, Persian, Finnish, French, Croatian, Indonesian, Italian, Japanese, Javanese, Georgian, Korean, Limburgish, Latvian, Marathi, Malay, Dutch, Norwegian, Polish, Portuguese, Romanian, Russian, Slovak, Thai, Turkish, Tagalog, Ukrainian, ChineseMultilingualEncyclopediaDistantAutomaticUpon Request-38-
New York Times CorpusThe New York Times Annotated CorpusEnglishMonolingualNewsDedicatedHumanNot Sure It Is Still Availiable-650,000-
NEWSROOMNewsroom: A Dataset of 1.3 Million Summaries with Diverse Extractive StrategiesEnglishMonolingualNewsDistantAutomaticURL-based reconstruction-1,321,995-
DaNewsroomDaNewsroom: A Large-scale Danish Summarisation DatasetDanishMonolingualNewsDistantAutomaticURL-based reconstruction-1,132,734-
Multi-NewsMulti-News: a Large-Scale Multi-Document Summarization Dataset and Abstractive Hierarchical ModelEnglishMonolingualNewsNaturallyAutomaticPublicly Available (License)Multidocument Summarization250,000-
DACSADACSA: A large-scale Dataset for Automatic summarization of Catalan and Spanish newspaper ArticlesCatalan, SpanishMultilingualNewsNaturallyAutomaticUpon Request-2,845,833-
MENSASelect and Summarize: Scene Saliency for Movie Script SummarizationEnglishMonolingualDialogueNaturallySemi-AutomaticPublicly Available-100-
PoemSumUnveiling the Essence of Poetry: Introducing a Comprehensive Dataset and Benchmark for Poem SummarizationEnglishMonolingualLitratureNaturallyAutomaticPublicly AvailablePoem3011-
MILDSumMILDSum: A Novel Benchmark Dataset for Multilingual Summarization of Indian Legal Case JudgmentsEnglish, HindiMultilingualLegalNaturallyAutomaticPublicly Available-3,122-
LR-SumLR-Sum: Summarization for Less-Resourced LanguagesAlbanian, Amharic, Armenian, Azerbaijani, Bengali, Bosnian, Burmese, Dari, English, French, Georgian, Modern Greek, Haitian, Hausa, Indonesian, Central Khmer, Kinyarwanda, Korean, Kurdish, Lao, Macedonian, Chinese, North Ndebele, Pashto, Persian, Portuguese, Russian, Serbian, Shona, Somali, Spanish, Swahili, Thai, Tibetan, Tigrinya, Turkish, Ukrainian, Urdu, Uzbek, VietnameseMultilingualNewsDistantAutomaticPublicly Available (License)-315,530-
MLSUMMLSUM: The Multilingual Summarization CorpusFrench, German, Spanish, Russian, TurkishMultilingualNewsDistantAutomaticURL-based reconstruction-1571041-
WikisumWikisum: Coherent Summarization Dataset for Efficient Human-EvaluationEnglishMonolingualInstructionalNaturallyAutomaticPublicly Available (License)-39,775-
FanpageTwo New Datasets for Italian-Language Abstractive Text SummarizationItalianMonolingualNewsDistantAutomaticPublicly Available-84,308-
IlPostTwo New Datasets for Italian-Language Abstractive Text SummarizationItalianMonolingualNewsDistantAutomaticPublicly Available-44,025-
GOVREPORTEfficient Attentions for Long Document SummarizationEnglishMonolingualGovNaturallyAutomaticPublicly AvailableLong Document19,466-
VCSUMVCSUM: A Versatile Chinese Meeting Summarization DatasetChineseMonolingualDialogueDedicatedHumanPublicly AvailableMeeting239-
MassiveSummMassiveSumm: a very large-scale, very multilingual, newswire summarisation datasetSwahili, Hausa, Somali, Afrikaans, Kinyarwanda, Amharic, North Ndebele, Shona, Rundi, Tigrinya, Oromo, Malagasy, Xhosa, Bambara, Yoruba, Igbo, Lingala, Fulah, Russian, Spanish, Ukrainian, Persian, Arabic, Chinese, German, Urdu, Hindi, French, Polish, Vietnamese, Bulgarian, Tamil, Hungarian, Lithuanian, Armenian, Kannada, Italian, Albanian, Malayalam, Czech, Slovak, Marathi, Gujarati, Oriya, Modern Greek, Turkish, Portuguese, Latvian, Azerbaijani, Bosnian, Pashto, Thai, Nepali, Macedonian, Panjabi, Icelandic, Bengali, Japanese, Telugu, English, Georgian, Slovenian, Burmese, Welsh, Tajik, Kurdish, Serbian, Uzbek, Hebrew, Central Khmer, Lao, Dari, Croatian, Assamese, Tibetan, Romanian, Sinhala, Kirghiz, Scottish Gaelic, Dutch, Irish, Catalan, Mongolian, Swedish, Danish, Esperanto, Haitian, Indonesian, Filipino, Tetum, Bislama, AymaraMultilingualNewsDistantAutomaticURL-based reconstruction-28879290-
BigPatentBIGPATENT: A Large-Scale Dataset for Abstractive and Coherent SummarizationEnglishMonolingualPatentDistantAutomaticPublicly Available-1,341,362-
Global VoicesGlobal Voices: Crossing Borders in Automatic News SummarizationEnglish, Spanish, Malagasy, Bengali, French, Portuguese, Russian, Arabic, Italian, Macedonian, Modern Greek, German, Japanese, Swahili, DutchMultilingualNewsDistantAutomaticUpon Request-41,939-
Global Voices (human annotated)Global Voices: Crossing Borders in Automatic News SummarizationEnglish, Spanish, Malagasy, Bengali, French, Portuguese, Russian, Arabic, Italian, Macedonian, Modern Greek, German, Japanese, Swahili, DutchMultilingualNewsDedicatedHumanUpon Request-3,437-
TeSumTeSum: Human-Generated Abstractive Summarization Corpus for TeluguTeluguMonolingualNewsDedicatedHumanURL-based reconstruction-20329yes
BillSumBillSum: A Corpus for Automatic Summarization of US LegislationEnglishMonolingualLegalNaturallyAutomaticPublicly Available-22218-
OpinosisOpinosis: A Graph-Based Approach to Abstractive Summarization of Highly RedundaEnglishMonolingualOpinions/
Arguments
DedicatedHumanPublicly AvailableOpinionated Texts51-
PubMed,arXivA discourse-aware attention model for abstractive summarization of long documentsEnglishMonolingualScientificDistantAutomaticPublicly Available (License)longer-form documents348000-
Reddit TIFUAbstractive Summarization of Reddit Posts with Multi-level Memory NetworksEnglishMonolingualSocial MediaNaturallyAutomaticPublicly Available (License)Tldr Of Posts Or Their Title, Written By The User Who Wrote The Reddit Post122933-
SamsumSamsum corpus: A human-annotated dialogue dataset for abstractive summarization.EnglishMonolingualDialogueDedicatedHumanPublicly Available-16369yes
MediaSumMediaSum: A Large-scale Media Interview Dataset for Dialogue SummarizationEnglishMonolingualDialogueDistantAutomaticPublicly Available-463596-
CLIDSUMClidSum: A Benchmark Dataset for Cross-Lingual Dialogue SummarizationEnglish, Chinese, GermanCrosslingualDialogueDedicatedHumanPublicly Available-56,369-
ScisummnetScisummNet: A Large Annotated Corpus and Content-Impact Models for Scientific Paper Summarization with Citation NetworksEnglishMonolingualScientificDedicatedSemi-AutomaticPublicly Available (License)-1000yes
TGSumBuild tweet guided multi-document summarization dataset.EnglishMonolingualNewsDedicatedAutomaticPublicly Availablemultidocument summarization, news-tweets coupling204yes
UrduMASDUrduMASD: A Multimodal Abstractive Summarization Dataset for UrduUrduMonolingualNewsDistantAutomaticUpon Request, Research OnlyMultimodal15,374-
KurdSumKurdSum: A new benchmark dataset for the Kurdish text summarizationKurdishMonolingualNewsDedicatedHumanPublicly Available-40,000-
AsomiyaPratidinAn abstractive text summarization using deep learning in AssameseAssameseMonolingualNewsDistantAutomaticUnknown-10,000-
BanglaCHQ-SummBanglaCHQ-Summ: An Abstractive Summarization Dataset for Medical Queries in Bangla Conversational SpeechBengaliMonolingualMedicalDedicatedHumanPublicly Available (License)Chq Summarization2,350yes
CSTNewsCSTNews - A Discourse-Annotated Corpus for Single and Multi-Document Summarization of News Texts in Brazilian PortuguesePortugueseMonolingualNewsDedicatedHumanPublicly AvailableMultidocument Summarization140-
RecognaSummRecognaSumm: A Novel Brazilian Summarization DatasetPortugueseMonolingualNewsDistantAutomaticPublicly Available (License)-135,272-
MiRANewsMiRANews: Dataset and Benchmarks for Multi-Resource-Assisted News SummarizationEnglishMonolingualNewsNaturallyAutomaticPublicly Available"Generate A Summary For The Corresponding Document With The Support Of Related Assisting Documents."147838-
WikinewsTowards Automatic Construction of News Overview Articles by News SynthesisEnglishMonolingualNewsNaturallyAutomaticPublicly Available"Automatically Constructing An Overview Article From A Given Set Of News Articles About A News Event"18,121-
WCEPA Large-Scale Multi-Document Summarization Dataset from the Wikipedia Current Events PortalEnglishMonolingualNewsDistantAutomaticPublicly Available (License)multidocument summarization, news-tweets coupling10,200-
TLDR9+TLDR9+: A Large Scale Resource for Extreme Summarization of Social Media PostsEnglishMonolingualSocial MediaNaturallyAutomaticPublicly Available (License)extreme summarization - but it is not though9227437yes
SlovakSumSlovakSum: A Large Scale Slovak Summarization DatasetSlovakMonolingualNewsDistantAutomaticPublicly Available (License)-208,519-
SMESumA Summarization Dataset of Slovak News ArticlesSlovakMonolingualNewsDistantAutomaticURL-based reconstruction-80,003-
WikiAspWikiAsp: A Dataset for Multi-domain Aspect-based SummarizationEnglishMonolingualEncyclopediaDistantAutomaticPublicly AvailableAspect-based summarization320,272-
CLTSCLTS: A New Chinese Long Text Summarization DatasetChineseMonolingualNewsDistantAutomaticPublicly AvailableLong Texts185,397-
CLTS+CLTS+: A New Chinese Long Text Summarization Dataset with Abstractive SummariesChineseMonolingualNewsDistantAutomaticPublicly AvailableLong Texts181,401yes
SumTitlesSumTitles: a Summarization Dataset with Low ExtractivenessEnglishMonolingualDialogueNaturallyAutomaticURL-based reconstruction-131,864-
NEWSFARMNEWSFARM: A Large-Scale Chinese Corpus of Long News SummarizationChineseMonolingualNewsDistantAutomaticPublicly AvailableLong Texts224,480yes
CLESA large-scale chinese long-text extractive summarization corpusChineseMonolingualNewsDistantAutomaticPublicly Available-103,839yes
LANSLANS: Large-scale Arabic News Summarization CorpusArabicMonolingualNewsDistantAutomaticUpon Request-8,443,484yes
ANTAn Arabic Multi-source News Corpus: Experimenting on Single-document Extractive SummarizationArabicMonolingualNewsDistantAutomaticPublicly Available-31,798-
Hromadske.uaAbstractive Summarization for the Ukrainian Language: Multi-Task Learning with Hromadske.ua News DatasetUkrainianMonolingualNewsDistantAutomaticPublicly Available-36,488-
GazetaDataset for Automatic Summarization of Russian NewsRussianMonolingualNewsDistantAutomaticPublicly Available (License)-63,435-
BigSurvey (CAST)Generating a Structured Summary of Numerous Academic Papers: Dataset and MethodEnglishMonolingualScientificNaturallyAutomaticPublicly Available (License)Multidocument4,478-
WikiMultiWikiMulti: a Corpus for Cross-Lingual SummarizationWikiMulti: a Corpus for Cross-Lingual SummarizationEnglish, French, Spanish, Italian, Russian, German, Portuguese, Japanese, Polish, Chinese, Swedish, Dutch, Arabic, Ukrainian, VietnameseCrosslingualEncyclopediaDistantAutomaticPublicly Available-22061-
XWikisModels and datasets for cross-lingual summarisationCzech, English, French, GermanCrosslingualEncyclopediaDistantAutomaticPublicly Available (License)-213,911yes
W-MS (Spektrum)A Novel Wikipedia based Dataset for Monolingual and Cross-Lingual SummarizationEnglishMonolingualEncyclopediaDistantAutomaticPublicly Available (License)-46,180-
W-CLS (Spektrum)A Novel Wikipedia based Dataset for Monolingual and Cross-Lingual SummarizationEnglish, GermanCrosslingualEncyclopediaDistantAutomaticPublicly Available (License)-5,132-
S-CLS (Spektrum)A Novel Wikipedia based Dataset for Monolingual and Cross-Lingual SummarizationEnglish, GermanCrosslingualEncyclopediaNaturallySemi-AutomaticPublicly Available (License)-1,510-
AMIThe AMI Meeting CorpusEnglishMonolingualDialogueDedicatedHumanPublicly Available (License)-100-
Webis-TLDR-17TL;DR: Mining Reddit to learn au- ¨ tomatic summarization.EnglishMonolingualSocial MediaNaturallyAutomaticPublicly Available-4044501-
DialogSumDialogSum: A Real-Life Scenario Dialogue Summarization DatasetEnglishMonolingualDialogueDedicatedHumanPublicly Available-13,460-
SumPubMedSumPubMed: Summarization Dataset of PubMed Scientific ArticlesEnglishMonolingualScientificDistantAutomaticPublicly Available (License)-33,772yes
BOOKSUMBookSum: A Collection of Datasets for Long-form Narrative SummarizationEnglishMonolingualLitratureDistantAutomaticURL-based reconstructionNarrative Summarization405-
NovelChaptersExploring Content Selection in Summarization of Novel ChaptersEnglishMonolingualLitratureNaturallyAutomaticURL-based reconstruction-8,088-
S2ORC extendedWhat’s New? Summarizing Contributions in Scientific LiteratureEnglishMonolingualScientificDedicatedAutomaticPublicly Available (License)-895523yes (on usefuleness)
GameWikiSumGameWikiSum: a Novel Large Multi-Document Summarization DatasetEnglishMonolingualOpinions/
Arguments
DistantAutomaticPublicly Available (License)multi-document14652-
SQuALITYSQuALITY: Building a Long-Document Summarization Dataset the Hard WaEnglishMonolingualLitratureDedicatedHumanPublicly Available (License)Question-focused summarization (QFS)625-
Liputan6Liputan6: A Large-scale Indonesian Dataset for Text SummarizationIndonesianMonolingualNewsNaturallyAutomaticURL-based reconstruction-215827-
TWEETSUMMTWEETSUMM - A Dialog Summarization Dataset for Customer ServiceEnglishMonolingualDialogueDedicatedHumanPublicly Available (License)-1100yes
SumeCzechSumeCzech: Large Czech News-Based Summarization DatasetCzechMonolingualNewsDistantAutomaticURL-based reconstruction-1001593-
IndosumIndosum: A New Benchmark Dataset for Indonesian Text SummarizationIndonesianMonolingualNewsNaturallyAutomaticPublicly Available (License)-18774-
VNDSVNDS: A Vietnamese Dataset for SummarizationVietnameseMonolingualNewsDistantAutomaticPublicly Available-150704-
ViMsViMs: a high-quality Vietnamese dataset for abstractive multi-document summarizationVietnameseMonolingualNewsDedicatedHumanPublicly Availablemulti-document300-
Multi-XScienceMulti-XScience: A Large-scale Dataset for Extreme Multi-document Summarization of Scientific ArticlesEnglishMonolingualScientificDistantAutomaticPublicly Available (License)multi-document, writing the related-work section given the abstract and the abstract of the cited papers40528yes
SummScreenSummScreen: A Dataset for Abstractive Screenplay SummarizationEnglishMonolingualDialogueNaturallyAutomaticPublicly Available-26851-
FacetSumBringing Structure into Summaries: a Faceted Summarization Dataset for Long Scientific DocumentsEnglishMonolingualScientificNaturallyAutomaticPublicly Available (License)Faceted Summarization60,024-
ForumSumForumSum: A Multi-Speaker Conversation Summarization DatasetEnglishMonolingualDialogueDedicatedHumanPublicly Available-4058-
QMSumQMSum: A New Benchmark for Query-based Multi-domain Meeting SummarizationEnglishMonolingualDialogueDedicatedHumanPublicly Available (License)query based, Multi-domain1,808yes
Ubuntu/NYCSummarizing Online Forum Discussions – Can Dialog Acts of Individual Messages Help?EnglishMonolingualDialogueDedicatedHumanPublicly Available (Research Purposes)Dialogue100-
BC3A Publicly Available Annotated Corpus for Supervised Email SummarizationEnglishMonolingualEmailsDedicatedHumanPublicly Available (Research Purposes)-90-
MMSMulti-modal Summarization for Asynchronous Collection of Text, Image, Audio and VideoEnglish, ChineseMultilingualNewsDedicatedHumanPublicly AvailableMulti-document, multimodal50-
CSDSCSDS: A Fine-Grained Chinese Dataset for Customer Service Dialogue SummarizationChineseMonolingualDialogueDedicatedHumanPublicly Availabletopic-based structural (kind of like faced)10,701-
HeSumHeSum: a Novel Dataset for Abstractive Text Summarization in HebrewHebrewMonolingualNewsDistantAutomaticPublicly Available-10000-
HunSum-2From News to Summaries: Building a Hungarian Corpus for Extractive and Abstractive SummarizationHungarianMonolingualNewsDistantAutomaticPublicly Available-1817850-
OrangeSumBARThez: a Skilled Pretrained French Sequence-to-Sequence ModelFrenchMonolingualNewsDistantAutomaticPublicly Available (License)-33600-
pn-summaryLeveraging parsbert and pretrained mt5 for persian abstractive text summarizationPersianMonolingualNewsDistantAutomaticPublicly Available (License)-93,207-
ScriptBaseMovie Script Summarization as Graph-based Scene ExtractionEnglishMonolingualDialogueNaturallyAutomaticPublicly Available-1,276-
How2How2: a large-scale dataset for multimodal language understanding‏English, PortugueseMultilingualInstructionalDistantAutomaticURL-based reconstructionMultimodal79,114-
MLGSumContrastive aligned joint learning for multilingual summarization.German, English, Russian, French, Chinese, Hindi, Spanish, Indonesian, Turkish, Vietnamese, Ukrainian, PortugueseMultilingualNewsDistantAutomaticURL-based reconstruction-1,168,276-
Auto-hMDSAutomatic Construction of a Large Heterogeneous Multilingual MultiDocument Summarization CorpusGerman, EnglishMultilingualDiverseDistantAutomaticURL-based reconstructionmulti-document7,316-
hMDSThe Next Step for Multi-Document Summarization : A Heterogeneous Multi-Genre Corpus Built with a Novel Construction ApproachEnglishMonolingualDiverseDistantOthersURL-based reconstructionmulti-document1,265-
ACL TA-DAACL TA-DA: A Dataset for Text Summarization and GenerationEnglishMonolingualScientificDistantAutomaticPublicly Available-22,315-
OPENASPOPENASP: A Benchmark for Multi-document Open Aspect-based SummarizationEnglishMonolingualNewsDedicatedHumanPublicly Available (License)Multi-document, Open Aspect1,310yes

Single-sentence summary

The summaries in these datasets range from a few words (like titles) to a lengthy sentence, composed of several dozen words. This format is sometimes referred to as "extreme summarization" or "headline generation".

Dataset NamePaperLanguagesLanguage ModalityDomainSupervisionAnnotation EffortsAvailabilitySub-Task#SamplesHuman Eval On Data
LCSTSLCSTS: A Large Scale Chinese Short Text Summarization DatasetChineseMonolingualSocial MediaNaturallyAutomaticUpon RequestMeadure2,400,591yes
xlsumXL-Sum: Large-Scale Multilingual Abstractive Summarization for 44 LanguagesAmharic, Arabic, Azerbaijani, Bengali, Burmese, Chinese, Chinese, English, French, Gujarati, Hausa, Hindi, Igbo, Indonesian, Japanese, Rundi, Korean, Kirghiz, Marathi, Nepali, Oromo, Pashto, Persian, West African Pidgin English, Portuguese, Panjabi, Russian, Scottish Gaelic, Scottish Gaelic, Serbian, Serbian, Sinhala, Somali, Spanish, Swahili, Tamil, Telugu, Thai, Tigrinya, Turkish, Ukrainian, Urdu, Uzbek, Vietnamese, Welsh, YorubaMultilingualNewsDistantAutomaticPublicly Available (License)-1,300,000yes
ilsumFIRE 2022 ILSUM Track: Indian Language SummarizationHindi, Gujarati, EnglishMultilingualNewsNaturallyAutomaticAvailiable-28978-
X-SCITLDRCross-lingual extreme summarization of scholarly documentsEnglish, German, Italian, ChineseCrosslingualScientificNaturallySemi-AutomaticPublicly Available (License)-3,229-
X-SCITLDRCross-lingual extreme summarization of scholarly documentsEnglish, JapaneseCrosslingualScientificNaturallyAutomaticPublicly Available (License)-2,004-
SCITLDRTLDR: Extreme Summarization of Scientific DocumentsEnglishMonolingualScientificNaturallyAutomaticPublicly Available-3,935-
SCITLDR (test set)TLDR: Extreme Summarization of Scientific DocumentsEnglishMonolingualScientificDedicatedSemi-AutomaticPublicly Available-1,237-
ACLSumACLSum: A New Dataset for Aspect-based Summarization of Scientific PublicationsEnglishMonolingualScientificDedicatedHumanPublicly AvailableMultiaspect Summarization250yes
CCSumCCSum: A Large-Scale and High-Quality Dataset for Abstractive News SummarizationEnglishMonolingualNewsDistantAutomaticPublicly Available (License)-1,369,911yes
PMIndiaSumPMIndiaSum: Multilingual and Cross-lingual Headline Summarization for Languages in IndiaKannada, Malayalam, Tamil, Telugu, Assamese, Bengali, Gujarati, Hindi, Marathi, Oriya, Panjabi, Urdu, English, ManipuriMultilingualNewsNaturallyAutomaticPublicly Available (License)-76,680-
CrossSumCrossSum: Beyond English-Centric Cross-Lingual Summarization for 1,500+ Language PairsAmharic, Arabic, Azerbaijani, Bengali, Burmese, Chinese, Chinese, English, French, Gujarati, Hausa, Indi, Igbo, Indonesian, Japanese, Rundi, Korean, Kirghiz, Marathi, Nepali, Oromo, Pashto, Persian, West African Pidgin English, Portuguese, Panjabi, Russian, Scottish Gaelic, Serbian, Serbian, Sinhala, Somali, Spanish, Swahili, Tamil, Telugu, Thai, Tigrinya, Turkish, Ukrainian, Urdu, Uzbek, Vietnamese, Welsh, YorubaCrosslingualNewsNaturallyAutomaticPublicly Available (License)-1680000yes (for the allignment)
MM-CLSMCLS: A Large-Scale Multimodal Cross-Lingual Summarization DatasetAmharic, Arabic, Azerbaijani, Bengali, Burmese, Chinese, Chinese, English, French, Gujarati, Hausa, Indi, Igbo, Indonesian, Japanese, Rundi, Korean, Kirghiz, Marathi, Nepali, Oromo, Pashto, Persian, West African Pidgin English, Portuguese, Panjabi, Russian, Scottish Gaelic, Serbian, Serbian, Sinhala, Somali, Spanish, Swahili, Tamil, Telugu, Thai, Tigrinya, Turkish, Ukrainian, Urdu, Uzbek, Vietnamese, Welsh, YorubaCrosslingualNewsNaturallyAutomatic????Multimodal Summarization, Cl1,100,000-
GigawordAnnotated GigawordEnglishMonolingualNewsDistantAutomaticPublicly Availablesentence-level summarization.4000000-
emailThis Email Could Save Your Life: Introducing the Task of Email Subject Line GenerationEnglishMonolingualEmailsDedicatedHumanPublicly Available (License)Email Subject Line Generation18302-
Rotten TomatoesNeural network-based abstract generation for opinions and arguments.EnglishMonolingualOpinions/
Arguments
NaturallyAutomaticPublicly AvailableClaim Generation3,731-
IdebateNeural network-based abstract generation for opinions and arguments.EnglishMonolingualOpinions/
Arguments
NaturallyAutomaticPublicly AvailableClaim Generation17359-
Reddit TIFU (extreme)Abstractive Summarization of Reddit Posts with Multi-level Memory NetworksEnglishMonolingualSocial MediaNaturallyAutomaticPublicly Available (License)Tldr Od Posts Or Their Title, Written By The User Who Wrote The Reddit Post122933-
XSumDon’t give me the details, just the summary! topic-aware convolutional neural networks for extreme summarization.EnglishMonolingualNewsDistantAutomaticPublicly Available-226711-
MeQSumOn the Summarization of Consumer Health QuestionsEnglishMonolingualMedicalDedicatedHumanPublicly Available (License)Chq Summarization1,000-
CHQ-SummCHQ-Summ: A DATASET FOR CONSUMER HEALTHCARE QUESTION SUMMARIZATIONEnglishMonolingualMedicalDedicatedHumanURL-based reconstructionChq Summarization1,507-
WikiDesWikiDes: A Wikipedia-Based Dataset for Generating Short Descriptions from ParagraphsEnglishMonolingualEncyclopediaDistantAutomaticPublicly Available (License)-81419-
SumeCzech (extreme )SumeCzech: Large Czech News-Based Summarization DatasetCzechMonolingualNewsDistantAutomaticURL-based reconstruction-1001593-
MMSSMulti-modal Sentence Summarization with Modality Attention and Image FilteringEnglishMonolingualNewsDistantAutomaticPublicly AvailableMultimodal66,000-
MM-SumSummary-Oriented Vision Modeling for Multimodal Abstractive SummarizationAmharic, Arabic, Azerbaijani, Bengali, Burmese, Chinese, Chinese, English, French, Gujarati, Hausa, Hindi, Igbo, Indonesian, Japanese, Rundi, Korean, Kirghiz, Marathi, Nepali, Oromo, Pashto, Persian, West African Pidgin English, Portuguese, Panjabi, Russian, Scottish Gaelic, Scottish Gaelic, Serbian, Serbian, Sinhala, Somali, Spanish, Swahili, Tamil, Telugu, Thai, Tigrinya, Turkish, Ukrainian, Urdu, Uzbek, Vietnamese, Welsh, YorubaMultilingualNewsDistantAutomaticPublicly AvailableMultimodal1,078,215-
MultiSummMultiSumm: Towards a Unified Model for Multi-Lingual Abstractive SummarizationBosnian, CroatianMultilingualNewsDistantAutomaticPublicly Available-382154-
OrangeSumBARThez: a Skilled Pretrained French Sequence-to-Sequence ModelFrenchMonolingualNewsDistantAutomaticPublicly Available (License)-33600-
M3LSLarge Scale Multi-Lingual Multi-Modal Summarization DatasetEnglish, Chinese, Spanish, Russian, French, Ukrainian, Portuguese, Japanese, Tamil, Hindi, Marathi, Gujarati, Bengali, Sinhala, Urdu, Pashto, Indonesian, Telugu, Panjabi, NepaliMultilingualNewsDistantAutomaticPublicly Available (License)Multimodal1,100,000yes
VMSMOVmsmo: Learning to generate multimodal summary for video-based news articlesChineseMonolingualNewsNaturallyAutomaticPublicly AvailableMultimodal184,920-

Highlights

The summaries in these datasets are constructed from a few, possibly independent sentences. For example, they could be bullet points (e.g., from news articles).

Dataset NamePaperLanguagesLanguage ModalityDomainSupervisionAnnotation EffortsAvailabilitySub-Task#SamplesHuman Eval On Data
CNN/daily mailNeural Summarization by Extracting Sentences and WordsEnglishMonolingualNewsNaturallyAutomaticPublicly Available (License)-312085-
EUR-Lex-Sum (English)Summarizing Legal Regulatory Documents using TransformersEnglishMonolingualLegalNaturallyAutomaticPublicly Available-4,595-
EUR-Lex-Sum (Multilingual)EUR-Lex-Sum: A Multi- and Cross-lingual Dataset for Long-form Summarization in the Legal DomainEnglish, German, Italian, Portuguese, Dutch, Danish, Modern Greek, Finnish, Swedish, Romanian, Hungarian, Czech, Polish, Bulgarian, Latvian, Slovenian, Estonian, Lithuanian, Slovak, Maltese, Croatian, IrishMultilingualLegalNaturallyAutomaticPublicly Available-1,500-
WikiLinguaWikiLingua: A New Benchmark Dataset for Cross-Lingual Abstractive SummarizationEnglish, Spanish, Portuguese, French, German, Russian, Italian, Indonesian, Dutch, Arabic, Chinese, Vietnamese, Thai, Japanese, Korean, Hindi, Czech, TurkishCrosslingualInstructionalDistantAutomaticPublicly Available (License)-141,457-
WikiHowWikiHow: A Large Scale Text Summarization DatasetEnglishMonolingualInstructionalDistantAutomaticPublicly Available (License)-204, 004-
WG/USAToday-CNNUtilizing microblogs for automatic news highlights extraction.EnglishMonolingualNewsDistantAutomaticPublicly Availablenews-tweets coupling,news highlights production121-
NCLSNCLS: Neural Cross-Lingual SummarizationEnglish, ChineseCrosslingualNewsNaturallyAutomaticPublicly Available-2,070,400-
MSMOMSMO: Multimodal Summarization with Multimodal OutputEnglishMonolingualNewsNaturallyAutomaticPublicly AvailableMultimodal Input And Output314581-
E-DailyMailAbstractive Text-Image Summarization Using Multi-Modal Attentional Hierarchical RNNEnglishMonolingualNewsNaturallyAutomatic?????Multimodal219100-
20 Minuten (bigger)20 Minuten: A Multi-task News Summarisation Dataset for GermanGermanMonolingualNewsNaturallyAutomaticPublicly Available (License)-51,357-
CSPubSumA supervised approach to extractive summarisation of scientific papers.EnglishMonolingualScientificNaturallyAutomaticURL-based reconstruction-10148-

Span Summarries

These datasets use spans of text directly taken from the document as summaries.

Dataset NamePaperLanguagesLanguage ModalityDomainSupervisionAnnotation EffortsAvailabilitySub-Task#SamplesHuman Eval On Data
EASCUsing Mechanical Turk to Create a Corpus of Arabic SummariesArabicMonolingualDiverseDedicatedHumanPublicly Available-765-
ACLSum (extractive)ACLSum: A New Dataset for Aspect-based Summarization of Scientific PublicationsEnglishMonolingualScientificDedicatedHumanPublicly AvailableMultiaspect Summarization250yes
VCSUM (extractive)VCSUM: A Versatile Chinese Meeting Summarization DatasetChineseMonolingualDialogueDedicatedHumanPublicly AvailableMeeting239-
CASTBuilding better corpora for summarisationEnglishMonolingualDiverseDedicatedHumanPublicly Available (License)-163-
The CNN-CorpusThe CNN-Corpus: A Large Textual Corpus for Single-Document Extractive SummarizationEnglishMonolingualNewsDedicatedSemi-AutomaticPublicly Available (License)-3000-
KALIMATKALIMAT a Multipurpose Arabic CorpusArabicMonolingualNewsDedicatedAutomaticPublicly AvailableMultidocument Summarization (Small Part Of 2057 Articles)20,291-
Webis-EditorialSum-2020News Editorials: Towards Summarizing Long Argumentative TextsEnglishMonolingualOpinions/
Arguments
DedicatedHumanPublicly AvailableOpinionated Texts266yes
QBSUMQBSUM: a Large-Scale Query-Based Document Summarization Dataset from Real-world ApplicationsChineseMonolingualNewsDedicatedHumanPublicly AvailableQuery-Based49,535-
AMIThe AMI Meeting CorpusEnglishMonolingualDialogueDedicatedHumanPublicly Available (License)-100-
TWEETSUMM (extractive )TWEETSUMM - A Dialog Summarization Dataset for Customer ServiceEnglishMonolingualDialogueDedicatedHumanPublicly Available (License)-1100yes
DebateSumDebateSum: A large-scale argument mining and summarization datasetEnglishMonolingualOpinions/
Arguments
NaturallyAutomatic

Truncated — view the full README on GitHub.

edahanoam/Awesome-Summarization-Datasets

Updating collection of summarization datasets in 100+ languages, based on our paper "The State and Fate of Summarization Datasets: A Survey".

32

44 commits

updated Apr 29, 2025

See the code

README

Awesome-Summarization-Datasets

The collection and ontology is a result of our paper The State and Fate of Summarization Datasets: A Survey (NAACL 2025).

plot

Citing

If our survey contributes to your research, please reference the following paper in your work:

@inproceedings{dahan-stanovsky-2025-state,
    title = "The State and Fate of Summarization Datasets: A Survey",
    author = "Dahan, Noam  and
      Stanovsky, Gabriel",
    editor = "Chiruzzo, Luis  and
      Ritter, Alan  and
      Wang, Lu",
    booktitle = "Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers)",
    month = apr,
    year = "2025",
    address = "Albuquerque, New Mexico",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2025.naacl-long.372/",
    pages = "7259--7278",
    ISBN = "979-8-89176-189-6"
}

Data Card

For standardization, we recommend using the Summarization Data Card, which follows findings from our survey.

📋 Click here to copy the LaTeX code
\begin{table}[tb!]
\resizebox{\columnwidth}{!}{%
\begin{tabular}{|p{7.5cm}|}

\hline
\textbf{Summarization Data Card}                                                                                      \\ \hline
\textbf{\underline{Sample information:}}      
\\
\textbf{Languages:} 
\newline
\textit{List all supported languages}                                                                               \\
\textbf{Summary Shape:}
\newline
\textit{Paragraph/One Sentence/Highlights/Span}                                                                \\
\textbf{Domain:} 
\newline
\textit{Example: News/Scientific/Dialogues/etc.}                                                                       \\
\textbf{Size:}
\newline
\textit{Number of document-summary pairs}                                                                                \\ \hline
\textbf{\underline{Annotation information:}}                                                                                      \\
\begin{tabular}[|p{7.5cm}|]{@{}l@{}}\textbf{Annotation efforts:} \\ \textit{Automatic, Human annotations, Semi-automatic}\end{tabular}   \\
\begin{tabular}[|p{7.5cm}|]{@{}l@{}}\textbf{Source of supervision:}\\ \textit{Natural} (summaries created organically)/ \\ \textit{Distant} (annotations are proxies of summaries)/\\ \textit{Dedicated} (annotations created by researchers)\end{tabular} \\
\begin{tabular}[|p{7.5cm}|]{@{}l@{}}\textbf{Brief description of the summaries' source:} \\ \textit{Example:
digests of legal documents}\end{tabular} \\ \hline
\textbf{\underline{Data quality assessment:}}                                                                                     \\
\begin{tabular}[|p{7.5cm}|]{@{}l@{}}\textbf{Abstraction level:} \\ \textit{1-to-4-gram ratios} \end{tabular} \\
\textbf{Compression rate:}  
$ \frac{\text{doc length (\#words)}}{\text{summary length (\#words)}}$                                                                                                    \\
\textbf{Human evaluation:} \textit{Yes/No}                                                                                              \\ \hline
\textbf{\underline{Availability details:}}                                                                                        \\
\begin{tabular}[|p{7.5cm}|]{@{}l@{}}\textbf{How is the data made accessible:} \\ \textit{Publicly Available} / \\
\textit{URL-based Reconstruction} / \\ \textit{Upon Request}\end{tabular}    \\
\begin{tabular}[c]{@{}l@{}}\textbf{Copyrights information:} \\ \textit{License}\end{tabular}                                            \\ \hline
\end{tabular}%
}
\caption{Template for a summarization data card.}
\label{tab:datacard}

\end{table}

                                                                                                                                                                                                               

plot

Explore Interactively

Use our platform to easily explore and search for datasets by category. Please note that it only features the datasets included in the survey.

Datasets

If you'd like to contribute a dataset, please submit a pull request.

Paragraph

These datasets contain output texts composed of one or more paragraphs of coherent free text.

Dataset NamePaperLanguagesLanguage ModalityDomainSupervisionAnnotation EffortsAvailabilitySub-Task#SamplesHuman Eval On Data
DUC 2001-2007The Document Understanding Conference (DUC)EnglishMonolingualNewsDedicatedHumanUpon RequestMultidocument, Query-focused45-
MultiLing 2013Multi-document multilingual summarization and evaluation tracks in ACL 2013 MultiLing WorkshopArabic, Czech, English, French, Modern Greek, Hebrew, Hindi, Chinese, Romanian, SpanishMultilingualNewsNaturallyAutomaticUpon RequestMultidocument150-
MultiLing 2015, 2017MultiLing 2017 OverviewAfrikaans, Arabic, Azerbaijani, Bulgarian, Bosnian, Catalan, Czech, German, Modern Greek, English, Esperanto, Spanish, Basque, Persian, Finnish, French, Croatian, Indonesian, Italian, Japanese, Javanese, Georgian, Korean, Limburgish, Latvian, Marathi, Malay, Dutch, Norwegian, Polish, Portuguese, Romanian, Russian, Slovak, Thai, Turkish, Tagalog, Ukrainian, ChineseMultilingualEncyclopediaDistantAutomaticUpon Request-38-
New York Times CorpusThe New York Times Annotated CorpusEnglishMonolingualNewsDedicatedHumanNot Sure It Is Still Availiable-650,000-
NEWSROOMNewsroom: A Dataset of 1.3 Million Summaries with Diverse Extractive StrategiesEnglishMonolingualNewsDistantAutomaticURL-based reconstruction-1,321,995-
DaNewsroomDaNewsroom: A Large-scale Danish Summarisation DatasetDanishMonolingualNewsDistantAutomaticURL-based reconstruction-1,132,734-
Multi-NewsMulti-News: a Large-Scale Multi-Document Summarization Dataset and Abstractive Hierarchical ModelEnglishMonolingualNewsNaturallyAutomaticPublicly Available (License)Multidocument Summarization250,000-
DACSADACSA: A large-scale Dataset for Automatic summarization of Catalan and Spanish newspaper ArticlesCatalan, SpanishMultilingualNewsNaturallyAutomaticUpon Request-2,845,833-
MENSASelect and Summarize: Scene Saliency for Movie Script SummarizationEnglishMonolingualDialogueNaturallySemi-AutomaticPublicly Available-100-
PoemSumUnveiling the Essence of Poetry: Introducing a Comprehensive Dataset and Benchmark for Poem SummarizationEnglishMonolingualLitratureNaturallyAutomaticPublicly AvailablePoem3011-
MILDSumMILDSum: A Novel Benchmark Dataset for Multilingual Summarization of Indian Legal Case JudgmentsEnglish, HindiMultilingualLegalNaturallyAutomaticPublicly Available-3,122-
LR-SumLR-Sum: Summarization for Less-Resourced LanguagesAlbanian, Amharic, Armenian, Azerbaijani, Bengali, Bosnian, Burmese, Dari, English, French, Georgian, Modern Greek, Haitian, Hausa, Indonesian, Central Khmer, Kinyarwanda, Korean, Kurdish, Lao, Macedonian, Chinese, North Ndebele, Pashto, Persian, Portuguese, Russian, Serbian, Shona, Somali, Spanish, Swahili, Thai, Tibetan, Tigrinya, Turkish, Ukrainian, Urdu, Uzbek, VietnameseMultilingualNewsDistantAutomaticPublicly Available (License)-315,530-
MLSUMMLSUM: The Multilingual Summarization CorpusFrench, German, Spanish, Russian, TurkishMultilingualNewsDistantAutomaticURL-based reconstruction-1571041-
WikisumWikisum: Coherent Summarization Dataset for Efficient Human-EvaluationEnglishMonolingualInstructionalNaturallyAutomaticPublicly Available (License)-39,775-
FanpageTwo New Datasets for Italian-Language Abstractive Text SummarizationItalianMonolingualNewsDistantAutomaticPublicly Available-84,308-
IlPostTwo New Datasets for Italian-Language Abstractive Text SummarizationItalianMonolingualNewsDistantAutomaticPublicly Available-44,025-
GOVREPORTEfficient Attentions for Long Document SummarizationEnglishMonolingualGovNaturallyAutomaticPublicly AvailableLong Document19,466-
VCSUMVCSUM: A Versatile Chinese Meeting Summarization DatasetChineseMonolingualDialogueDedicatedHumanPublicly AvailableMeeting239-
MassiveSummMassiveSumm: a very large-scale, very multilingual, newswire summarisation datasetSwahili, Hausa, Somali, Afrikaans, Kinyarwanda, Amharic, North Ndebele, Shona, Rundi, Tigrinya, Oromo, Malagasy, Xhosa, Bambara, Yoruba, Igbo, Lingala, Fulah, Russian, Spanish, Ukrainian, Persian, Arabic, Chinese, German, Urdu, Hindi, French, Polish, Vietnamese, Bulgarian, Tamil, Hungarian, Lithuanian, Armenian, Kannada, Italian, Albanian, Malayalam, Czech, Slovak, Marathi, Gujarati, Oriya, Modern Greek, Turkish, Portuguese, Latvian, Azerbaijani, Bosnian, Pashto, Thai, Nepali, Macedonian, Panjabi, Icelandic, Bengali, Japanese, Telugu, English, Georgian, Slovenian, Burmese, Welsh, Tajik, Kurdish, Serbian, Uzbek, Hebrew, Central Khmer, Lao, Dari, Croatian, Assamese, Tibetan, Romanian, Sinhala, Kirghiz, Scottish Gaelic, Dutch, Irish, Catalan, Mongolian, Swedish, Danish, Esperanto, Haitian, Indonesian, Filipino, Tetum, Bislama, AymaraMultilingualNewsDistantAutomaticURL-based reconstruction-28879290-
BigPatentBIGPATENT: A Large-Scale Dataset for Abstractive and Coherent SummarizationEnglishMonolingualPatentDistantAutomaticPublicly Available-1,341,362-
Global VoicesGlobal Voices: Crossing Borders in Automatic News SummarizationEnglish, Spanish, Malagasy, Bengali, French, Portuguese, Russian, Arabic, Italian, Macedonian, Modern Greek, German, Japanese, Swahili, DutchMultilingualNewsDistantAutomaticUpon Request-41,939-
Global Voices (human annotated)Global Voices: Crossing Borders in Automatic News SummarizationEnglish, Spanish, Malagasy, Bengali, French, Portuguese, Russian, Arabic, Italian, Macedonian, Modern Greek, German, Japanese, Swahili, DutchMultilingualNewsDedicatedHumanUpon Request-3,437-
TeSumTeSum: Human-Generated Abstractive Summarization Corpus for TeluguTeluguMonolingualNewsDedicatedHumanURL-based reconstruction-20329yes
BillSumBillSum: A Corpus for Automatic Summarization of US LegislationEnglishMonolingualLegalNaturallyAutomaticPublicly Available-22218-
OpinosisOpinosis: A Graph-Based Approach to Abstractive Summarization of Highly RedundaEnglishMonolingualOpinions/
Arguments
DedicatedHumanPublicly AvailableOpinionated Texts51-
PubMed,arXivA discourse-aware attention model for abstractive summarization of long documentsEnglishMonolingualScientificDistantAutomaticPublicly Available (License)longer-form documents348000-
Reddit TIFUAbstractive Summarization of Reddit Posts with Multi-level Memory NetworksEnglishMonolingualSocial MediaNaturallyAutomaticPublicly Available (License)Tldr Of Posts Or Their Title, Written By The User Who Wrote The Reddit Post122933-
SamsumSamsum corpus: A human-annotated dialogue dataset for abstractive summarization.EnglishMonolingualDialogueDedicatedHumanPublicly Available-16369yes
MediaSumMediaSum: A Large-scale Media Interview Dataset for Dialogue SummarizationEnglishMonolingualDialogueDistantAutomaticPublicly Available-463596-
CLIDSUMClidSum: A Benchmark Dataset for Cross-Lingual Dialogue SummarizationEnglish, Chinese, GermanCrosslingualDialogueDedicatedHumanPublicly Available-56,369-
ScisummnetScisummNet: A Large Annotated Corpus and Content-Impact Models for Scientific Paper Summarization with Citation NetworksEnglishMonolingualScientificDedicatedSemi-AutomaticPublicly Available (License)-1000yes
TGSumBuild tweet guided multi-document summarization dataset.EnglishMonolingualNewsDedicatedAutomaticPublicly Availablemultidocument summarization, news-tweets coupling204yes
UrduMASDUrduMASD: A Multimodal Abstractive Summarization Dataset for UrduUrduMonolingualNewsDistantAutomaticUpon Request, Research OnlyMultimodal15,374-
KurdSumKurdSum: A new benchmark dataset for the Kurdish text summarizationKurdishMonolingualNewsDedicatedHumanPublicly Available-40,000-
AsomiyaPratidinAn abstractive text summarization using deep learning in AssameseAssameseMonolingualNewsDistantAutomaticUnknown-10,000-
BanglaCHQ-SummBanglaCHQ-Summ: An Abstractive Summarization Dataset for Medical Queries in Bangla Conversational SpeechBengaliMonolingualMedicalDedicatedHumanPublicly Available (License)Chq Summarization2,350yes
CSTNewsCSTNews - A Discourse-Annotated Corpus for Single and Multi-Document Summarization of News Texts in Brazilian PortuguesePortugueseMonolingualNewsDedicatedHumanPublicly AvailableMultidocument Summarization140-
RecognaSummRecognaSumm: A Novel Brazilian Summarization DatasetPortugueseMonolingualNewsDistantAutomaticPublicly Available (License)-135,272-
MiRANewsMiRANews: Dataset and Benchmarks for Multi-Resource-Assisted News SummarizationEnglishMonolingualNewsNaturallyAutomaticPublicly Available"Generate A Summary For The Corresponding Document With The Support Of Related Assisting Documents."147838-
WikinewsTowards Automatic Construction of News Overview Articles by News SynthesisEnglishMonolingualNewsNaturallyAutomaticPublicly Available"Automatically Constructing An Overview Article From A Given Set Of News Articles About A News Event"18,121-
WCEPA Large-Scale Multi-Document Summarization Dataset from the Wikipedia Current Events PortalEnglishMonolingualNewsDistantAutomaticPublicly Available (License)multidocument summarization, news-tweets coupling10,200-
TLDR9+TLDR9+: A Large Scale Resource for Extreme Summarization of Social Media PostsEnglishMonolingualSocial MediaNaturallyAutomaticPublicly Available (License)extreme summarization - but it is not though9227437yes
SlovakSumSlovakSum: A Large Scale Slovak Summarization DatasetSlovakMonolingualNewsDistantAutomaticPublicly Available (License)-208,519-
SMESumA Summarization Dataset of Slovak News ArticlesSlovakMonolingualNewsDistantAutomaticURL-based reconstruction-80,003-
WikiAspWikiAsp: A Dataset for Multi-domain Aspect-based SummarizationEnglishMonolingualEncyclopediaDistantAutomaticPublicly AvailableAspect-based summarization320,272-
CLTSCLTS: A New Chinese Long Text Summarization DatasetChineseMonolingualNewsDistantAutomaticPublicly AvailableLong Texts185,397-
CLTS+CLTS+: A New Chinese Long Text Summarization Dataset with Abstractive SummariesChineseMonolingualNewsDistantAutomaticPublicly AvailableLong Texts181,401yes
SumTitlesSumTitles: a Summarization Dataset with Low ExtractivenessEnglishMonolingualDialogueNaturallyAutomaticURL-based reconstruction-131,864-
NEWSFARMNEWSFARM: A Large-Scale Chinese Corpus of Long News SummarizationChineseMonolingualNewsDistantAutomaticPublicly AvailableLong Texts224,480yes
CLESA large-scale chinese long-text extractive summarization corpusChineseMonolingualNewsDistantAutomaticPublicly Available-103,839yes
LANSLANS: Large-scale Arabic News Summarization CorpusArabicMonolingualNewsDistantAutomaticUpon Request-8,443,484yes
ANTAn Arabic Multi-source News Corpus: Experimenting on Single-document Extractive SummarizationArabicMonolingualNewsDistantAutomaticPublicly Available-31,798-
Hromadske.uaAbstractive Summarization for the Ukrainian Language: Multi-Task Learning with Hromadske.ua News DatasetUkrainianMonolingualNewsDistantAutomaticPublicly Available-36,488-
GazetaDataset for Automatic Summarization of Russian NewsRussianMonolingualNewsDistantAutomaticPublicly Available (License)-63,435-
BigSurvey (CAST)Generating a Structured Summary of Numerous Academic Papers: Dataset and MethodEnglishMonolingualScientificNaturallyAutomaticPublicly Available (License)Multidocument4,478-
WikiMultiWikiMulti: a Corpus for Cross-Lingual SummarizationWikiMulti: a Corpus for Cross-Lingual SummarizationEnglish, French, Spanish, Italian, Russian, German, Portuguese, Japanese, Polish, Chinese, Swedish, Dutch, Arabic, Ukrainian, VietnameseCrosslingualEncyclopediaDistantAutomaticPublicly Available-22061-
XWikisModels and datasets for cross-lingual summarisationCzech, English, French, GermanCrosslingualEncyclopediaDistantAutomaticPublicly Available (License)-213,911yes
W-MS (Spektrum)A Novel Wikipedia based Dataset for Monolingual and Cross-Lingual SummarizationEnglishMonolingualEncyclopediaDistantAutomaticPublicly Available (License)-46,180-
W-CLS (Spektrum)A Novel Wikipedia based Dataset for Monolingual and Cross-Lingual SummarizationEnglish, GermanCrosslingualEncyclopediaDistantAutomaticPublicly Available (License)-5,132-
S-CLS (Spektrum)A Novel Wikipedia based Dataset for Monolingual and Cross-Lingual SummarizationEnglish, GermanCrosslingualEncyclopediaNaturallySemi-AutomaticPublicly Available (License)-1,510-
AMIThe AMI Meeting CorpusEnglishMonolingualDialogueDedicatedHumanPublicly Available (License)-100-
Webis-TLDR-17TL;DR: Mining Reddit to learn au- ¨ tomatic summarization.EnglishMonolingualSocial MediaNaturallyAutomaticPublicly Available-4044501-
DialogSumDialogSum: A Real-Life Scenario Dialogue Summarization DatasetEnglishMonolingualDialogueDedicatedHumanPublicly Available-13,460-
SumPubMedSumPubMed: Summarization Dataset of PubMed Scientific ArticlesEnglishMonolingualScientificDistantAutomaticPublicly Available (License)-33,772yes
BOOKSUMBookSum: A Collection of Datasets for Long-form Narrative SummarizationEnglishMonolingualLitratureDistantAutomaticURL-based reconstructionNarrative Summarization405-
NovelChaptersExploring Content Selection in Summarization of Novel ChaptersEnglishMonolingualLitratureNaturallyAutomaticURL-based reconstruction-8,088-
S2ORC extendedWhat’s New? Summarizing Contributions in Scientific LiteratureEnglishMonolingualScientificDedicatedAutomaticPublicly Available (License)-895523yes (on usefuleness)
GameWikiSumGameWikiSum: a Novel Large Multi-Document Summarization DatasetEnglishMonolingualOpinions/
Arguments
DistantAutomaticPublicly Available (License)multi-document14652-
SQuALITYSQuALITY: Building a Long-Document Summarization Dataset the Hard WaEnglishMonolingualLitratureDedicatedHumanPublicly Available (License)Question-focused summarization (QFS)625-
Liputan6Liputan6: A Large-scale Indonesian Dataset for Text SummarizationIndonesianMonolingualNewsNaturallyAutomaticURL-based reconstruction-215827-
TWEETSUMMTWEETSUMM - A Dialog Summarization Dataset for Customer ServiceEnglishMonolingualDialogueDedicatedHumanPublicly Available (License)-1100yes
SumeCzechSumeCzech: Large Czech News-Based Summarization DatasetCzechMonolingualNewsDistantAutomaticURL-based reconstruction-1001593-
IndosumIndosum: A New Benchmark Dataset for Indonesian Text SummarizationIndonesianMonolingualNewsNaturallyAutomaticPublicly Available (License)-18774-
VNDSVNDS: A Vietnamese Dataset for SummarizationVietnameseMonolingualNewsDistantAutomaticPublicly Available-150704-
ViMsViMs: a high-quality Vietnamese dataset for abstractive multi-document summarizationVietnameseMonolingualNewsDedicatedHumanPublicly Availablemulti-document300-
Multi-XScienceMulti-XScience: A Large-scale Dataset for Extreme Multi-document Summarization of Scientific ArticlesEnglishMonolingualScientificDistantAutomaticPublicly Available (License)multi-document, writing the related-work section given the abstract and the abstract of the cited papers40528yes
SummScreenSummScreen: A Dataset for Abstractive Screenplay SummarizationEnglishMonolingualDialogueNaturallyAutomaticPublicly Available-26851-
FacetSumBringing Structure into Summaries: a Faceted Summarization Dataset for Long Scientific DocumentsEnglishMonolingualScientificNaturallyAutomaticPublicly Available (License)Faceted Summarization60,024-
ForumSumForumSum: A Multi-Speaker Conversation Summarization DatasetEnglishMonolingualDialogueDedicatedHumanPublicly Available-4058-
QMSumQMSum: A New Benchmark for Query-based Multi-domain Meeting SummarizationEnglishMonolingualDialogueDedicatedHumanPublicly Available (License)query based, Multi-domain1,808yes
Ubuntu/NYCSummarizing Online Forum Discussions – Can Dialog Acts of Individual Messages Help?EnglishMonolingualDialogueDedicatedHumanPublicly Available (Research Purposes)Dialogue100-
BC3A Publicly Available Annotated Corpus for Supervised Email SummarizationEnglishMonolingualEmailsDedicatedHumanPublicly Available (Research Purposes)-90-
MMSMulti-modal Summarization for Asynchronous Collection of Text, Image, Audio and VideoEnglish, ChineseMultilingualNewsDedicatedHumanPublicly AvailableMulti-document, multimodal50-
CSDSCSDS: A Fine-Grained Chinese Dataset for Customer Service Dialogue SummarizationChineseMonolingualDialogueDedicatedHumanPublicly Availabletopic-based structural (kind of like faced)10,701-
HeSumHeSum: a Novel Dataset for Abstractive Text Summarization in HebrewHebrewMonolingualNewsDistantAutomaticPublicly Available-10000-
HunSum-2From News to Summaries: Building a Hungarian Corpus for Extractive and Abstractive SummarizationHungarianMonolingualNewsDistantAutomaticPublicly Available-1817850-
OrangeSumBARThez: a Skilled Pretrained French Sequence-to-Sequence ModelFrenchMonolingualNewsDistantAutomaticPublicly Available (License)-33600-
pn-summaryLeveraging parsbert and pretrained mt5 for persian abstractive text summarizationPersianMonolingualNewsDistantAutomaticPublicly Available (License)-93,207-
ScriptBaseMovie Script Summarization as Graph-based Scene ExtractionEnglishMonolingualDialogueNaturallyAutomaticPublicly Available-1,276-
How2How2: a large-scale dataset for multimodal language understanding‏English, PortugueseMultilingualInstructionalDistantAutomaticURL-based reconstructionMultimodal79,114-
MLGSumContrastive aligned joint learning for multilingual summarization.German, English, Russian, French, Chinese, Hindi, Spanish, Indonesian, Turkish, Vietnamese, Ukrainian, PortugueseMultilingualNewsDistantAutomaticURL-based reconstruction-1,168,276-
Auto-hMDSAutomatic Construction of a Large Heterogeneous Multilingual MultiDocument Summarization CorpusGerman, EnglishMultilingualDiverseDistantAutomaticURL-based reconstructionmulti-document7,316-
hMDSThe Next Step for Multi-Document Summarization : A Heterogeneous Multi-Genre Corpus Built with a Novel Construction ApproachEnglishMonolingualDiverseDistantOthersURL-based reconstructionmulti-document1,265-
ACL TA-DAACL TA-DA: A Dataset for Text Summarization and GenerationEnglishMonolingualScientificDistantAutomaticPublicly Available-22,315-
OPENASPOPENASP: A Benchmark for Multi-document Open Aspect-based SummarizationEnglishMonolingualNewsDedicatedHumanPublicly Available (License)Multi-document, Open Aspect1,310yes

Single-sentence summary

The summaries in these datasets range from a few words (like titles) to a lengthy sentence, composed of several dozen words. This format is sometimes referred to as "extreme summarization" or "headline generation".

Dataset NamePaperLanguagesLanguage ModalityDomainSupervisionAnnotation EffortsAvailabilitySub-Task#SamplesHuman Eval On Data
LCSTSLCSTS: A Large Scale Chinese Short Text Summarization DatasetChineseMonolingualSocial MediaNaturallyAutomaticUpon RequestMeadure2,400,591yes
xlsumXL-Sum: Large-Scale Multilingual Abstractive Summarization for 44 LanguagesAmharic, Arabic, Azerbaijani, Bengali, Burmese, Chinese, Chinese, English, French, Gujarati, Hausa, Hindi, Igbo, Indonesian, Japanese, Rundi, Korean, Kirghiz, Marathi, Nepali, Oromo, Pashto, Persian, West African Pidgin English, Portuguese, Panjabi, Russian, Scottish Gaelic, Scottish Gaelic, Serbian, Serbian, Sinhala, Somali, Spanish, Swahili, Tamil, Telugu, Thai, Tigrinya, Turkish, Ukrainian, Urdu, Uzbek, Vietnamese, Welsh, YorubaMultilingualNewsDistantAutomaticPublicly Available (License)-1,300,000yes
ilsumFIRE 2022 ILSUM Track: Indian Language SummarizationHindi, Gujarati, EnglishMultilingualNewsNaturallyAutomaticAvailiable-28978-
X-SCITLDRCross-lingual extreme summarization of scholarly documentsEnglish, German, Italian, ChineseCrosslingualScientificNaturallySemi-AutomaticPublicly Available (License)-3,229-
X-SCITLDRCross-lingual extreme summarization of scholarly documentsEnglish, JapaneseCrosslingualScientificNaturallyAutomaticPublicly Available (License)-2,004-
SCITLDRTLDR: Extreme Summarization of Scientific DocumentsEnglishMonolingualScientificNaturallyAutomaticPublicly Available-3,935-
SCITLDR (test set)TLDR: Extreme Summarization of Scientific DocumentsEnglishMonolingualScientificDedicatedSemi-AutomaticPublicly Available-1,237-
ACLSumACLSum: A New Dataset for Aspect-based Summarization of Scientific PublicationsEnglishMonolingualScientificDedicatedHumanPublicly AvailableMultiaspect Summarization250yes
CCSumCCSum: A Large-Scale and High-Quality Dataset for Abstractive News SummarizationEnglishMonolingualNewsDistantAutomaticPublicly Available (License)-1,369,911yes
PMIndiaSumPMIndiaSum: Multilingual and Cross-lingual Headline Summarization for Languages in IndiaKannada, Malayalam, Tamil, Telugu, Assamese, Bengali, Gujarati, Hindi, Marathi, Oriya, Panjabi, Urdu, English, ManipuriMultilingualNewsNaturallyAutomaticPublicly Available (License)-76,680-
CrossSumCrossSum: Beyond English-Centric Cross-Lingual Summarization for 1,500+ Language PairsAmharic, Arabic, Azerbaijani, Bengali, Burmese, Chinese, Chinese, English, French, Gujarati, Hausa, Indi, Igbo, Indonesian, Japanese, Rundi, Korean, Kirghiz, Marathi, Nepali, Oromo, Pashto, Persian, West African Pidgin English, Portuguese, Panjabi, Russian, Scottish Gaelic, Serbian, Serbian, Sinhala, Somali, Spanish, Swahili, Tamil, Telugu, Thai, Tigrinya, Turkish, Ukrainian, Urdu, Uzbek, Vietnamese, Welsh, YorubaCrosslingualNewsNaturallyAutomaticPublicly Available (License)-1680000yes (for the allignment)
MM-CLSMCLS: A Large-Scale Multimodal Cross-Lingual Summarization DatasetAmharic, Arabic, Azerbaijani, Bengali, Burmese, Chinese, Chinese, English, French, Gujarati, Hausa, Indi, Igbo, Indonesian, Japanese, Rundi, Korean, Kirghiz, Marathi, Nepali, Oromo, Pashto, Persian, West African Pidgin English, Portuguese, Panjabi, Russian, Scottish Gaelic, Serbian, Serbian, Sinhala, Somali, Spanish, Swahili, Tamil, Telugu, Thai, Tigrinya, Turkish, Ukrainian, Urdu, Uzbek, Vietnamese, Welsh, YorubaCrosslingualNewsNaturallyAutomatic????Multimodal Summarization, Cl1,100,000-
GigawordAnnotated GigawordEnglishMonolingualNewsDistantAutomaticPublicly Availablesentence-level summarization.4000000-
emailThis Email Could Save Your Life: Introducing the Task of Email Subject Line GenerationEnglishMonolingualEmailsDedicatedHumanPublicly Available (License)Email Subject Line Generation18302-
Rotten TomatoesNeural network-based abstract generation for opinions and arguments.EnglishMonolingualOpinions/
Arguments
NaturallyAutomaticPublicly AvailableClaim Generation3,731-
IdebateNeural network-based abstract generation for opinions and arguments.EnglishMonolingualOpinions/
Arguments
NaturallyAutomaticPublicly AvailableClaim Generation17359-
Reddit TIFU (extreme)Abstractive Summarization of Reddit Posts with Multi-level Memory NetworksEnglishMonolingualSocial MediaNaturallyAutomaticPublicly Available (License)Tldr Od Posts Or Their Title, Written By The User Who Wrote The Reddit Post122933-
XSumDon’t give me the details, just the summary! topic-aware convolutional neural networks for extreme summarization.EnglishMonolingualNewsDistantAutomaticPublicly Available-226711-
MeQSumOn the Summarization of Consumer Health QuestionsEnglishMonolingualMedicalDedicatedHumanPublicly Available (License)Chq Summarization1,000-
CHQ-SummCHQ-Summ: A DATASET FOR CONSUMER HEALTHCARE QUESTION SUMMARIZATIONEnglishMonolingualMedicalDedicatedHumanURL-based reconstructionChq Summarization1,507-
WikiDesWikiDes: A Wikipedia-Based Dataset for Generating Short Descriptions from ParagraphsEnglishMonolingualEncyclopediaDistantAutomaticPublicly Available (License)-81419-
SumeCzech (extreme )SumeCzech: Large Czech News-Based Summarization DatasetCzechMonolingualNewsDistantAutomaticURL-based reconstruction-1001593-
MMSSMulti-modal Sentence Summarization with Modality Attention and Image FilteringEnglishMonolingualNewsDistantAutomaticPublicly AvailableMultimodal66,000-
MM-SumSummary-Oriented Vision Modeling for Multimodal Abstractive SummarizationAmharic, Arabic, Azerbaijani, Bengali, Burmese, Chinese, Chinese, English, French, Gujarati, Hausa, Hindi, Igbo, Indonesian, Japanese, Rundi, Korean, Kirghiz, Marathi, Nepali, Oromo, Pashto, Persian, West African Pidgin English, Portuguese, Panjabi, Russian, Scottish Gaelic, Scottish Gaelic, Serbian, Serbian, Sinhala, Somali, Spanish, Swahili, Tamil, Telugu, Thai, Tigrinya, Turkish, Ukrainian, Urdu, Uzbek, Vietnamese, Welsh, YorubaMultilingualNewsDistantAutomaticPublicly AvailableMultimodal1,078,215-
MultiSummMultiSumm: Towards a Unified Model for Multi-Lingual Abstractive SummarizationBosnian, CroatianMultilingualNewsDistantAutomaticPublicly Available-382154-
OrangeSumBARThez: a Skilled Pretrained French Sequence-to-Sequence ModelFrenchMonolingualNewsDistantAutomaticPublicly Available (License)-33600-
M3LSLarge Scale Multi-Lingual Multi-Modal Summarization DatasetEnglish, Chinese, Spanish, Russian, French, Ukrainian, Portuguese, Japanese, Tamil, Hindi, Marathi, Gujarati, Bengali, Sinhala, Urdu, Pashto, Indonesian, Telugu, Panjabi, NepaliMultilingualNewsDistantAutomaticPublicly Available (License)Multimodal1,100,000yes
VMSMOVmsmo: Learning to generate multimodal summary for video-based news articlesChineseMonolingualNewsNaturallyAutomaticPublicly AvailableMultimodal184,920-

Highlights

The summaries in these datasets are constructed from a few, possibly independent sentences. For example, they could be bullet points (e.g., from news articles).

Dataset NamePaperLanguagesLanguage ModalityDomainSupervisionAnnotation EffortsAvailabilitySub-Task#SamplesHuman Eval On Data
CNN/daily mailNeural Summarization by Extracting Sentences and WordsEnglishMonolingualNewsNaturallyAutomaticPublicly Available (License)-312085-
EUR-Lex-Sum (English)Summarizing Legal Regulatory Documents using TransformersEnglishMonolingualLegalNaturallyAutomaticPublicly Available-4,595-
EUR-Lex-Sum (Multilingual)EUR-Lex-Sum: A Multi- and Cross-lingual Dataset for Long-form Summarization in the Legal DomainEnglish, German, Italian, Portuguese, Dutch, Danish, Modern Greek, Finnish, Swedish, Romanian, Hungarian, Czech, Polish, Bulgarian, Latvian, Slovenian, Estonian, Lithuanian, Slovak, Maltese, Croatian, IrishMultilingualLegalNaturallyAutomaticPublicly Available-1,500-
WikiLinguaWikiLingua: A New Benchmark Dataset for Cross-Lingual Abstractive SummarizationEnglish, Spanish, Portuguese, French, German, Russian, Italian, Indonesian, Dutch, Arabic, Chinese, Vietnamese, Thai, Japanese, Korean, Hindi, Czech, TurkishCrosslingualInstructionalDistantAutomaticPublicly Available (License)-141,457-
WikiHowWikiHow: A Large Scale Text Summarization DatasetEnglishMonolingualInstructionalDistantAutomaticPublicly Available (License)-204, 004-
WG/USAToday-CNNUtilizing microblogs for automatic news highlights extraction.EnglishMonolingualNewsDistantAutomaticPublicly Availablenews-tweets coupling,news highlights production121-
NCLSNCLS: Neural Cross-Lingual SummarizationEnglish, ChineseCrosslingualNewsNaturallyAutomaticPublicly Available-2,070,400-
MSMOMSMO: Multimodal Summarization with Multimodal OutputEnglishMonolingualNewsNaturallyAutomaticPublicly AvailableMultimodal Input And Output314581-
E-DailyMailAbstractive Text-Image Summarization Using Multi-Modal Attentional Hierarchical RNNEnglishMonolingualNewsNaturallyAutomatic?????Multimodal219100-
20 Minuten (bigger)20 Minuten: A Multi-task News Summarisation Dataset for GermanGermanMonolingualNewsNaturallyAutomaticPublicly Available (License)-51,357-
CSPubSumA supervised approach to extractive summarisation of scientific papers.EnglishMonolingualScientificNaturallyAutomaticURL-based reconstruction-10148-

Span Summarries

These datasets use spans of text directly taken from the document as summaries.

Dataset NamePaperLanguagesLanguage ModalityDomainSupervisionAnnotation EffortsAvailabilitySub-Task#SamplesHuman Eval On Data
EASCUsing Mechanical Turk to Create a Corpus of Arabic SummariesArabicMonolingualDiverseDedicatedHumanPublicly Available-765-
ACLSum (extractive)ACLSum: A New Dataset for Aspect-based Summarization of Scientific PublicationsEnglishMonolingualScientificDedicatedHumanPublicly AvailableMultiaspect Summarization250yes
VCSUM (extractive)VCSUM: A Versatile Chinese Meeting Summarization DatasetChineseMonolingualDialogueDedicatedHumanPublicly AvailableMeeting239-
CASTBuilding better corpora for summarisationEnglishMonolingualDiverseDedicatedHumanPublicly Available (License)-163-
The CNN-CorpusThe CNN-Corpus: A Large Textual Corpus for Single-Document Extractive SummarizationEnglishMonolingualNewsDedicatedSemi-AutomaticPublicly Available (License)-3000-
KALIMATKALIMAT a Multipurpose Arabic CorpusArabicMonolingualNewsDedicatedAutomaticPublicly AvailableMultidocument Summarization (Small Part Of 2057 Articles)20,291-
Webis-EditorialSum-2020News Editorials: Towards Summarizing Long Argumentative TextsEnglishMonolingualOpinions/
Arguments
DedicatedHumanPublicly AvailableOpinionated Texts266yes
QBSUMQBSUM: a Large-Scale Query-Based Document Summarization Dataset from Real-world ApplicationsChineseMonolingualNewsDedicatedHumanPublicly AvailableQuery-Based49,535-
AMIThe AMI Meeting CorpusEnglishMonolingualDialogueDedicatedHumanPublicly Available (License)-100-
TWEETSUMM (extractive )TWEETSUMM - A Dialog Summarization Dataset for Customer ServiceEnglishMonolingualDialogueDedicatedHumanPublicly Available (License)-1100yes
DebateSumDebateSum: A large-scale argument mining and summarization datasetEnglishMonolingualOpinions/
Arguments
NaturallyAutomatic

Truncated — view the full README on GitHub.