Hojicha (HOldings JudIcial CHAllenges) is a benchmark dataset for evaluating text chunking algorithms on legal contracts. It is part of MTCB (Make That Chunker Better).
Hojicha tests how well chunking algorithms handle formal legal language, including:
Derived from CUAD (Contract Understanding Atticus Dataset), which contains commercial contracts annotated by legal experts.
| Split | Count |
|---|---|
| Contracts | 479 |
| Questions | 1,982 |
| Question Types | 41 |
The dataset covers 41 types of contract clauses, including:
| Category | Examples |
|---|---|
| Identification | Document Name, Parties, Agreement Date, Effective Date |
| Term & Termination | Expiration Date, Renewal Term, Termination for Convenience |
| Liability | Cap on Liability, Uncapped Liability, Liquidated Damages |
| IP & Licensing | License Grant, IP Ownership, Non-Transferable License |
| Restrictions | Non-Compete, Exclusivity, Non-Solicitation, Anti-Assignment |
| Financial | Revenue/Profit Sharing, Minimum Commitment, Price Restrictions |
| Other | Governing Law, Insurance, Audit Rights, Change of Control |
from mtcb import HojichaEvaluator
from chonkie import RecursiveChunker
evaluator = HojichaEvaluator(
chunker=RecursiveChunker(chunk_size=512),
embedding_model="voyage-3-large",
)
result = evaluator.evaluate(k=[1, 3, 5, 10])
print(result)
from datasets import load_dataset
# Load corpus (479 contracts)
corpus = load_dataset("chonkie-ai/hojicha", "corpus", split="train")
# Load questions (1,982 questions)
questions = load_dataset("chonkie-ai/hojicha", "questions", split="train")
Each document contains:
title: Contract identifier (e.g., "COMPANY_DATE-EX-10-AGREEMENT TYPE")text: Full contract textEach question contains:
question: The question text (asking about a specific clause type)document_title: Reference to the source contractchunk-must-contain: The passage that must appear in retrieved chunksquestion_type: Category of the clause (e.g., "Governing Law", "Cap On Liability")For each question:
chunk-must-contain passageThis dataset is released under CC-BY-4.0, following the original CUAD license.
@dataset{hojicha2025,
title={Hojicha: Legal Contract Chunking Benchmark},
author={Chonkie Team},
year={2025},
publisher={Hugging Face},
url={https://huggingface.co/datasets/chonkie-ai/hojicha}
}
@inproceedings{cuad2021,
title={CUAD: An Expert-Annotated NLP Dataset for Legal Contract Review},
author={Hendrycks, Dan and Burns, Collin and Chen, Anya and Ball, Spencer},
booktitle={NeurIPS},
year={2021}
}
10 commits
Hojicha (HOldings JudIcial CHAllenges) is a benchmark dataset for evaluating text chunking algorithms on legal contracts. It is part of MTCB (Make That Chunker Better).
Hojicha tests how well chunking algorithms handle formal legal language, including:
Derived from CUAD (Contract Understanding Atticus Dataset), which contains commercial contracts annotated by legal experts.
| Split | Count |
|---|---|
| Contracts | 479 |
| Questions | 1,982 |
| Question Types | 41 |
The dataset covers 41 types of contract clauses, including:
| Category | Examples |
|---|---|
| Identification | Document Name, Parties, Agreement Date, Effective Date |
| Term & Termination | Expiration Date, Renewal Term, Termination for Convenience |
| Liability | Cap on Liability, Uncapped Liability, Liquidated Damages |
| IP & Licensing | License Grant, IP Ownership, Non-Transferable License |
| Restrictions | Non-Compete, Exclusivity, Non-Solicitation, Anti-Assignment |
| Financial | Revenue/Profit Sharing, Minimum Commitment, Price Restrictions |
| Other | Governing Law, Insurance, Audit Rights, Change of Control |
from mtcb import HojichaEvaluator
from chonkie import RecursiveChunker
evaluator = HojichaEvaluator(
chunker=RecursiveChunker(chunk_size=512),
embedding_model="voyage-3-large",
)
result = evaluator.evaluate(k=[1, 3, 5, 10])
print(result)
from datasets import load_dataset
# Load corpus (479 contracts)
corpus = load_dataset("chonkie-ai/hojicha", "corpus", split="train")
# Load questions (1,982 questions)
questions = load_dataset("chonkie-ai/hojicha", "questions", split="train")
Each document contains:
title: Contract identifier (e.g., "COMPANY_DATE-EX-10-AGREEMENT TYPE")text: Full contract textEach question contains:
question: The question text (asking about a specific clause type)document_title: Reference to the source contractchunk-must-contain: The passage that must appear in retrieved chunksquestion_type: Category of the clause (e.g., "Governing Law", "Cap On Liability")For each question:
chunk-must-contain passageThis dataset is released under CC-BY-4.0, following the original CUAD license.
@dataset{hojicha2025,
title={Hojicha: Legal Contract Chunking Benchmark},
author={Chonkie Team},
year={2025},
publisher={Hugging Face},
url={https://huggingface.co/datasets/chonkie-ai/hojicha}
}
@inproceedings{cuad2021,
title={CUAD: An Expert-Annotated NLP Dataset for Legal Contract Review},
author={Hendrycks, Dan and Burns, Collin and Chen, Anya and Ball, Spencer},
booktitle={NeurIPS},
year={2021}
}
10 commits