CH

chonkie-ai/ficha

Dataset

0

stars

10

commits

2

linked in READMEs

Jan 21, 2026

updated

README

💼 Ficha: Financial Chunking Assessment

SEC 10-K Filings for Evaluating Chunking Algorithms

Ficha is a dataset of SEC 10-K financial filings designed to evaluate how well chunking algorithms handle formal business documents with complex financial terminology, tables, and structured sections.

Dataset Description

  • Documents: 88 SEC 10-K filings from major US companies
  • Questions: 1,331 question-answer pairs
  • Domain: Financial/Business
  • Source: SEC EDGAR database

Key Challenges

This dataset tests chunking algorithms on:

  • Financial tables and numerical data
  • Legal/regulatory language
  • Structured sections (Risk Factors, MD&A, Financial Statements)
  • Cross-references between sections
  • Technical accounting terminology

Dataset Structure

Corpus Config

FieldDescription
tickerStock ticker symbol
companyCompany name
filing_typeType of SEC filing
filing_dateDate of filing
textFull text of the filing

Questions Config

FieldDescription
tickerStock ticker symbol
companyCompany name
questionQuestion about the filing
answerAnswer to the question
chunk-must-containText passage that must be in the retrieved chunk

Usage

from datasets import load_dataset

# Load corpus
corpus = load_dataset("chonkie-ai/ficha", "corpus", split="train")

# Load questions
questions = load_dataset("chonkie-ai/ficha", "questions", split="train")

Part of MTCB

Ficha is part of the Massive Text Chunking Benchmark (MTCB), a comprehensive benchmark for evaluating RAG chunking strategies.

License

CC-BY-4.0

Contributors

bhavnicksm

10 commits

CH

chonkie-ai/ficha

Dataset

0

stars

10

commits

2

linked in READMEs

Jan 21, 2026

updated

README

💼 Ficha: Financial Chunking Assessment

SEC 10-K Filings for Evaluating Chunking Algorithms

Ficha is a dataset of SEC 10-K financial filings designed to evaluate how well chunking algorithms handle formal business documents with complex financial terminology, tables, and structured sections.

Dataset Description

  • Documents: 88 SEC 10-K filings from major US companies
  • Questions: 1,331 question-answer pairs
  • Domain: Financial/Business
  • Source: SEC EDGAR database

Key Challenges

This dataset tests chunking algorithms on:

  • Financial tables and numerical data
  • Legal/regulatory language
  • Structured sections (Risk Factors, MD&A, Financial Statements)
  • Cross-references between sections
  • Technical accounting terminology

Dataset Structure

Corpus Config

FieldDescription
tickerStock ticker symbol
companyCompany name
filing_typeType of SEC filing
filing_dateDate of filing
textFull text of the filing

Questions Config

FieldDescription
tickerStock ticker symbol
companyCompany name
questionQuestion about the filing
answerAnswer to the question
chunk-must-containText passage that must be in the retrieved chunk

Usage

from datasets import load_dataset

# Load corpus
corpus = load_dataset("chonkie-ai/ficha", "corpus", split="train")

# Load questions
questions = load_dataset("chonkie-ai/ficha", "questions", split="train")

Part of MTCB

Ficha is part of the Massive Text Chunking Benchmark (MTCB), a comprehensive benchmark for evaluating RAG chunking strategies.

License

CC-BY-4.0

Contributors

bhavnicksm

10 commits