cx-cmu/GEO-Bench

Dataset

GEO-Bench Dataset (AutoGEO)

2

2 commits

1 linked in READMEs

updated Dec 17, 2025

See the code

README

GEO-Bench Dataset (AutoGEO)

This is a research-domain dataset released with AutoGEO for Generative Engine Optimization (GEO) research.

📄 Paper: "What Generative Search Engines Like and How to Optimize Web Content Cooperatively"
👥 Authors: Yujiang Wu*, Shanshan Zhong*, Yubin Kim, Chenyan Xiong (*Equal contribution)
🚀 Code: AutoGEO on GitHub

Dataset Configurations

  • main: Primary train/test data for GEO training and evaluation (~8k train / ~1k test)

  • rule_candidate: Data for content preference rule extraction (~8k samples)

  • cold_start: Supervised fine-tuning data for AutoGEO Mini (~3.5k samples)

  • inference: Inference-only data (~1k samples)

  • grpo_input: Input data for GRPO training (~8k samples)

  • grpo_eval: Evaluation data for GRPO-trained models (~8k samples)

Use the configuration selector above to view different subsets.

Citation

@article{wu2025generative,
  title={What Generative Search Engines Like and How to Optimize Web Content Cooperatively},
  author={Wu, Yujiang and Zhong, Shanshan and Kim, Yubin and Xiong, Chenyan},
  journal={arXiv preprint arXiv:2510.11438},
  year={2025}
}
autogeo
e-commerce
generative-search
reinforcement-learning

cx-cmu/GEO-Bench

Dataset

GEO-Bench Dataset (AutoGEO)

2

2 commits

1 linked in READMEs

updated Dec 17, 2025

See the code

README

GEO-Bench Dataset (AutoGEO)

This is a research-domain dataset released with AutoGEO for Generative Engine Optimization (GEO) research.

📄 Paper: "What Generative Search Engines Like and How to Optimize Web Content Cooperatively"
👥 Authors: Yujiang Wu*, Shanshan Zhong*, Yubin Kim, Chenyan Xiong (*Equal contribution)
🚀 Code: AutoGEO on GitHub

Dataset Configurations

  • main: Primary train/test data for GEO training and evaluation (~8k train / ~1k test)

  • rule_candidate: Data for content preference rule extraction (~8k samples)

  • cold_start: Supervised fine-tuning data for AutoGEO Mini (~3.5k samples)

  • inference: Inference-only data (~1k samples)

  • grpo_input: Input data for GRPO training (~8k samples)

  • grpo_eval: Evaluation data for GRPO-trained models (~8k samples)

Use the configuration selector above to view different subsets.

Citation

@article{wu2025generative,
  title={What Generative Search Engines Like and How to Optimize Web Content Cooperatively},
  author={Wu, Yujiang and Zhong, Shanshan and Kim, Yubin and Xiong, Chenyan},
  journal={arXiv preprint arXiv:2510.11438},
  year={2025}
}
autogeo
e-commerce
generative-search
reinforcement-learning