DECKBench (Academic Paper → Slide Deck Benchmark)
1
12 commits
2 linked in READMEs
updated Feb 17, 2026
DECKBench is a benchmark for academic paper–to–slide generation and multi-turn slide editing.
For Task 2 (Multi-Turn Slide Editing), this dataset provides initial generated slide decks in HTML format, along with their associated slide images and the source academic paper in Markdown form.
These artifacts serve as inputs to the DECKBench evaluation codebase, enabling systems to perform iterative slide edits driven by natural-language instructions.
Associated code and evaluation scripts are available here:
https://github.com/morgan-heisler/DeckBench
For each example, the dataset provides:
Important notes:
To evaluate a generated slide deck using the benchmark scripts, you can run the following command from the repository:
python generation_evaluation.py \
--data_path.gt_slides_root /root/data/ref_slides \
--data_path.papers_root /root/data/papers \
--data_path.deck_list_path /root/data/gen_pdf_slides \
--output_folder /root/data/gen_eval_output \
--config evaluation_config.yaml \
--save_analysis_output
For more details on simulation and multi-turn evaluation, please refer to the official GitHub repository.
DECKBench is intended for research on:
PDFs are provided for research purposes only. Users must comply with the original paper licenses, as decks are derived from academic papers. License: MIT (for repository code and provided PDFs). Original papers retain their own licenses.
Evaluation metrics can be found in the GitHub repository.
Example metrics include:
@misc{jang2026deckbenchbenchmarkingmultiagentframeworks,
title={DECKBench: Benchmarking Multi-Agent Frameworks for Academic Slide Generation and Editing},
author={Daesik Jang and Morgan Lindsay Heisler and Linzi Xing and Yifei Li and Edward Wang and Ying Xiong and Yong Zhang and Zhenan Fan},
year={2026},
eprint={2602.13318},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2602.13318},
}
12 commits
DECKBench (Academic Paper → Slide Deck Benchmark)
1
12 commits
2 linked in READMEs
updated Feb 17, 2026
DECKBench is a benchmark for academic paper–to–slide generation and multi-turn slide editing.
For Task 2 (Multi-Turn Slide Editing), this dataset provides initial generated slide decks in HTML format, along with their associated slide images and the source academic paper in Markdown form.
These artifacts serve as inputs to the DECKBench evaluation codebase, enabling systems to perform iterative slide edits driven by natural-language instructions.
Associated code and evaluation scripts are available here:
https://github.com/morgan-heisler/DeckBench
For each example, the dataset provides:
Important notes:
To evaluate a generated slide deck using the benchmark scripts, you can run the following command from the repository:
python generation_evaluation.py \
--data_path.gt_slides_root /root/data/ref_slides \
--data_path.papers_root /root/data/papers \
--data_path.deck_list_path /root/data/gen_pdf_slides \
--output_folder /root/data/gen_eval_output \
--config evaluation_config.yaml \
--save_analysis_output
For more details on simulation and multi-turn evaluation, please refer to the official GitHub repository.
DECKBench is intended for research on:
PDFs are provided for research purposes only. Users must comply with the original paper licenses, as decks are derived from academic papers. License: MIT (for repository code and provided PDFs). Original papers retain their own licenses.
Evaluation metrics can be found in the GitHub repository.
Example metrics include:
@misc{jang2026deckbenchbenchmarkingmultiagentframeworks,
title={DECKBench: Benchmarking Multi-Agent Frameworks for Academic Slide Generation and Editing},
author={Daesik Jang and Morgan Lindsay Heisler and Linzi Xing and Yifei Li and Edward Wang and Ying Xiong and Yong Zhang and Zhenan Fan},
year={2026},
eprint={2602.13318},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2602.13318},
}
12 commits