kaistdata/ViMDoc

Dataset

4

stars

27

commits

1

linked in READMEs

Apr 21, 2026

updated

README

ViMDoc: Visually-rich Long Multi-Document Retrieval Benchmark

Paper GitHub

ViMDoc is a benchmark for evaluating visual document retrieval in both multi-document and long document settings, proposed in our paper Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy (ACL 2026 Findings).

πŸš€ Quick Start

(1) Load Queries

from datasets import load_dataset
dataset = load_dataset("kaistdata/ViMDoc", split="ViMDoc")

(2) Download Document Pages (Images)

# Option 1 β€” wget
wget https://huggingface.co/datasets/kaistdata/ViMDoc/resolve/main/ViMDoc_pages.tar.gz
tar -xzf ViMDoc_pages.tar.gz

# Option 2 β€” HuggingFace CLI
huggingface-cli download kaistdata/ViMDoc ViMDoc_pages.tar.gz \
    --repo-type dataset \
    --local-dir ./
tar -xzf ViMDoc_pages.tar.gz

Data Structure

Each query follows this format:

{
    "id": "<query_id>",
    "query": "<query_text>",
    "doc_ids": ["<document_id>"]
}

Statistics

DocumentsPages (Images)Queries
ViMDoc1,37976,34710,904

Citation

If you use ViMDoc in your research, please cite our paper:

@article{kim2025hybrid,
  title={Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy},
  author={Kim, Juyeon and Lee, Geon and Choi, Dongwon and Kim, Taeuk and Shin, Kijung},
  journal={arXiv preprint arXiv:2510.22215},
  year={2025}
}

Contributors

Juyeonnn

27 commits

kaistdata/ViMDoc

Dataset

4

stars

27

commits

1

linked in READMEs

Apr 21, 2026

updated

README

ViMDoc: Visually-rich Long Multi-Document Retrieval Benchmark

Paper GitHub

ViMDoc is a benchmark for evaluating visual document retrieval in both multi-document and long document settings, proposed in our paper Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy (ACL 2026 Findings).

πŸš€ Quick Start

(1) Load Queries

from datasets import load_dataset
dataset = load_dataset("kaistdata/ViMDoc", split="ViMDoc")

(2) Download Document Pages (Images)

# Option 1 β€” wget
wget https://huggingface.co/datasets/kaistdata/ViMDoc/resolve/main/ViMDoc_pages.tar.gz
tar -xzf ViMDoc_pages.tar.gz

# Option 2 β€” HuggingFace CLI
huggingface-cli download kaistdata/ViMDoc ViMDoc_pages.tar.gz \
    --repo-type dataset \
    --local-dir ./
tar -xzf ViMDoc_pages.tar.gz

Data Structure

Each query follows this format:

{
    "id": "<query_id>",
    "query": "<query_text>",
    "doc_ids": ["<document_id>"]
}

Statistics

DocumentsPages (Images)Queries
ViMDoc1,37976,34710,904

Citation

If you use ViMDoc in your research, please cite our paper:

@article{kim2025hybrid,
  title={Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy},
  author={Kim, Juyeon and Lee, Geon and Choi, Dongwon and Kim, Taeuk and Shin, Kijung},
  journal={arXiv preprint arXiv:2510.22215},
  year={2025}
}

Contributors

Juyeonnn

27 commits