CH

chonkie-ai/cocha

Dataset

0

stars

8

commits

2

linked in READMEs

Jan 21, 2026

updated

README

💻 Cocha: Code Chunking Assessment

Multilingual Code Files for Evaluating Chunking Algorithms

Cocha is a dataset of source code files from popular GitHub repositories across multiple programming languages, designed to evaluate how well chunking algorithms handle code with its unique structure and syntax.

Dataset Description

  • Documents: 1,000 code files
  • Questions: 2,372 question-answer pairs
  • Domain: Source Code
  • Languages: Python, JavaScript, TypeScript, Go, Rust, Java, C++, and more

Key Challenges

This dataset tests chunking algorithms on:

  • Code syntax and indentation
  • Function and class boundaries
  • Import statements and dependencies
  • Comments and docstrings
  • Multiple programming languages
  • Nested structures (loops, conditionals, classes)

Dataset Structure

Corpus Config

FieldDescription
idUnique identifier
textFull source code content
langProgramming language
pathFile path in repository
repository_nameSource repository

Questions Config

FieldDescription
doc_idReference to corpus document
pathFile path
langProgramming language
repository_nameSource repository
questionQuestion about the code
answerAnswer to the question
chunk-must-containCode passage that must be in the retrieved chunk

Usage

from datasets import load_dataset

# Load corpus
corpus = load_dataset("chonkie-ai/cocha", "corpus", split="train")

# Load questions
questions = load_dataset("chonkie-ai/cocha", "questions", split="train")

Part of MTCB

Cocha is part of the Massive Text Chunking Benchmark (MTCB), a comprehensive benchmark for evaluating RAG chunking strategies.

License

CC-BY-4.0

Contributors

bhavnicksm

8 commits

CH

chonkie-ai/cocha

Dataset

0

stars

8

commits

2

linked in READMEs

Jan 21, 2026

updated

README

💻 Cocha: Code Chunking Assessment

Multilingual Code Files for Evaluating Chunking Algorithms

Cocha is a dataset of source code files from popular GitHub repositories across multiple programming languages, designed to evaluate how well chunking algorithms handle code with its unique structure and syntax.

Dataset Description

  • Documents: 1,000 code files
  • Questions: 2,372 question-answer pairs
  • Domain: Source Code
  • Languages: Python, JavaScript, TypeScript, Go, Rust, Java, C++, and more

Key Challenges

This dataset tests chunking algorithms on:

  • Code syntax and indentation
  • Function and class boundaries
  • Import statements and dependencies
  • Comments and docstrings
  • Multiple programming languages
  • Nested structures (loops, conditionals, classes)

Dataset Structure

Corpus Config

FieldDescription
idUnique identifier
textFull source code content
langProgramming language
pathFile path in repository
repository_nameSource repository

Questions Config

FieldDescription
doc_idReference to corpus document
pathFile path
langProgramming language
repository_nameSource repository
questionQuestion about the code
answerAnswer to the question
chunk-must-containCode passage that must be in the retrieved chunk

Usage

from datasets import load_dataset

# Load corpus
corpus = load_dataset("chonkie-ai/cocha", "corpus", split="train")

# Load questions
questions = load_dataset("chonkie-ai/cocha", "questions", split="train")

Part of MTCB

Cocha is part of the Massive Text Chunking Benchmark (MTCB), a comprehensive benchmark for evaluating RAG chunking strategies.

License

CC-BY-4.0

Contributors

bhavnicksm

8 commits