This repository hosts the MultiConIR dataset in four domains/configs:
BooksLegal DocumentMedical CaseMoviesPeopleEach config contains three splits:
corpus: candidate documents (JSONL)queries: queries (JSONL)qrels: relevance judgements (JSONL)corpus.jsonl: one document per line (e.g., docid, text, optional metadata)queries.jsonl: one query per line (e.g., qid, text, optional metadata)qrels.jsonl: one relevance entry per line (e.g., qid, docid, rel)(Exact fields follow the original exported format in this repo.)
from datasets import load_dataset
# Load the "queries" split of Books
ds = load_dataset("Lux1997/MultiConIR_v2", "Books", split="queries")
# Load corpus / qrels
corpus = load_dataset("Lux1997/MultiConIR_v2", "Books", split="corpus")
qrels = load_dataset("Lux1997/MultiConIR_v2", "Books", split="qrels")
4 commits
This repository hosts the MultiConIR dataset in four domains/configs:
BooksLegal DocumentMedical CaseMoviesPeopleEach config contains three splits:
corpus: candidate documents (JSONL)queries: queries (JSONL)qrels: relevance judgements (JSONL)corpus.jsonl: one document per line (e.g., docid, text, optional metadata)queries.jsonl: one query per line (e.g., qid, text, optional metadata)qrels.jsonl: one relevance entry per line (e.g., qid, docid, rel)(Exact fields follow the original exported format in this repo.)
from datasets import load_dataset
# Load the "queries" split of Books
ds = load_dataset("Lux1997/MultiConIR_v2", "Books", split="queries")
# Load corpus / qrels
corpus = load_dataset("Lux1997/MultiConIR_v2", "Books", split="corpus")
qrels = load_dataset("Lux1997/MultiConIR_v2", "Books", split="qrels")
4 commits