jhu-clsp/ettin-pretraining-data

Dataset

10

stars

501

commits

3

linked in READMEs

Jul 18, 2025

updated

decoder
encoder
foundation-model
language-modeling
pretraining
transformer
Browse cluster: Compression and encoding libraries β†’

README

Ettin Pre-training Data

License: MIT Paper Models GitHub

Phase 1 of 3: Diverse pre-training data mixture (1.7T tokens) used to train the Ettin model suite.

This dataset contains the pre-training phase data used to train all Ettin encoder and decoder models. The data is provided in MDS format ready for use with Composer and the ModernBERT training repository.

πŸ“Š Data Composition

Data SourceTokens (B)PercentageDescription
DCLM837.249.1%High-quality web crawl data
CC Head356.620.9%Common Crawl head documents
Starcoder263.915.5%Code repositories and files
Reddit80.34.7%Social discussion threads
PeS2o57.33.4%Scientific papers
Arxiv28.01.6%Academic preprints
StackExchange19.61.2%Q&A forums
Tulu Flan16.61.0%Instruction-following data
Open-Web-Math12.70.7%Mathematical content
Algebraic StackExchange12.60.7%Math Q&A
CC News7.30.4%News articles
Wikipedia7.30.4%Encyclopedia articles
Total1,704.7100.0%Diverse mixture for foundation training

πŸš€ Usage

For pre-training, see the ModernBERT repo: https://github.com/AnswerDotAI/ModernBERT

Direct Access

from streaming import StreamingDataset

# Load the streaming dataset
dataset = StreamingDataset(
    remote='https://huggingface.co/datasets/jhu-clsp/ettin-pretraining-data',
    local='/tmp/ettin-pretraining-data',
    shuffle=True
)

# Access samples
for sample in dataset:
    text = sample['text']
    # Process your data...

πŸ“ Structure

Each folder contains one data source in MDS (Mosaic Data Shard) format:

  • arxiv/ - Academic papers from ArXiv
  • books/ - Literature and reference books
  • cc_head/ - High-quality Common Crawl documents
  • cc_news/ - News articles from Common Crawl
  • dclm/ - DataComp-LM filtered web data
  • open_web_math/ - Mathematical web content
  • algebraic_stackexchange/ - Math Q&A from StackExchange
  • pes2o/ - Scientific papers (PeS2o dataset)
  • reddit/ - Reddit discussion threads
  • stackexchange/ - General StackExchange Q&A
  • starcoder/ - Code from GitHub repositories
  • tulu_flan/ - Instruction-following examples
  • wikipedia/ - Wikipedia articles

Citation

@misc{weller2025seqvsseqopen,
      title={Seq vs Seq: An Open Suite of Paired Encoders and Decoders}, 
      author={Orion Weller and Kathryn Ricci and Marc Marone and Antoine Chaffin and Dawn Lawrie and Benjamin Van Durme},
      year={2025},
      eprint={2507.11412},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2507.11412}, 
}

Contributors

orionweller

500 commits

nielsr

1 commits

jhu-clsp/ettin-pretraining-data

Dataset

10

stars

501

commits

3

linked in READMEs

Jul 18, 2025

updated

decoder
encoder
foundation-model
language-modeling
pretraining
transformer
Browse cluster: Compression and encoding libraries β†’

README

Ettin Pre-training Data

License: MIT Paper Models GitHub

Phase 1 of 3: Diverse pre-training data mixture (1.7T tokens) used to train the Ettin model suite.

This dataset contains the pre-training phase data used to train all Ettin encoder and decoder models. The data is provided in MDS format ready for use with Composer and the ModernBERT training repository.

πŸ“Š Data Composition

Data SourceTokens (B)PercentageDescription
DCLM837.249.1%High-quality web crawl data
CC Head356.620.9%Common Crawl head documents
Starcoder263.915.5%Code repositories and files
Reddit80.34.7%Social discussion threads
PeS2o57.33.4%Scientific papers
Arxiv28.01.6%Academic preprints
StackExchange19.61.2%Q&A forums
Tulu Flan16.61.0%Instruction-following data
Open-Web-Math12.70.7%Mathematical content
Algebraic StackExchange12.60.7%Math Q&A
CC News7.30.4%News articles
Wikipedia7.30.4%Encyclopedia articles
Total1,704.7100.0%Diverse mixture for foundation training

πŸš€ Usage

For pre-training, see the ModernBERT repo: https://github.com/AnswerDotAI/ModernBERT

Direct Access

from streaming import StreamingDataset

# Load the streaming dataset
dataset = StreamingDataset(
    remote='https://huggingface.co/datasets/jhu-clsp/ettin-pretraining-data',
    local='/tmp/ettin-pretraining-data',
    shuffle=True
)

# Access samples
for sample in dataset:
    text = sample['text']
    # Process your data...

πŸ“ Structure

Each folder contains one data source in MDS (Mosaic Data Shard) format:

  • arxiv/ - Academic papers from ArXiv
  • books/ - Literature and reference books
  • cc_head/ - High-quality Common Crawl documents
  • cc_news/ - News articles from Common Crawl
  • dclm/ - DataComp-LM filtered web data
  • open_web_math/ - Mathematical web content
  • algebraic_stackexchange/ - Math Q&A from StackExchange
  • pes2o/ - Scientific papers (PeS2o dataset)
  • reddit/ - Reddit discussion threads
  • stackexchange/ - General StackExchange Q&A
  • starcoder/ - Code from GitHub repositories
  • tulu_flan/ - Instruction-following examples
  • wikipedia/ - Wikipedia articles

Citation

@misc{weller2025seqvsseqopen,
      title={Seq vs Seq: An Open Suite of Paired Encoders and Decoders}, 
      author={Orion Weller and Kathryn Ricci and Marc Marone and Antoine Chaffin and Dawn Lawrie and Benjamin Van Durme},
      year={2025},
      eprint={2507.11412},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2507.11412}, 
}

Contributors

orionweller

500 commits

nielsr

1 commits