AgPerry/EditReward-Data-100

Dataset

EditReward Curated 100

1

stars

10

commits

1

linked in READMEs

Mar 1, 2026

updated

benchmark
evaluation
image-editing
preference

README

EditReward Curated 100

100 high-quality, richly annotated image editing preference examples curated from TIGER-Lab/EditReward-Data.

Each example contains a source image, two edited outputs (left/right) from different models, human preference labels, and detailed multi-dimensional annotations.

Quick Start

from datasets import load_dataset

ds = load_dataset("AgPerry/EditReward-Data-100", split="train")

# Access an example
example = ds[0]
print(f"Instruction: {example['instruction']}")
print(f"Human preference: {example['vote_type']}")
print(f"Category: {example['category']}")

# View images
example['source_image'].show()  # Original image
example['left_image'].show()    # Edit A
example['right_image'].show()   # Edit B

Dataset Summary

PropertyValue
Total examples100
Quality tiersGold 75, Silver 25
Vote distributionLeft 48, Tie 3, Right 49
Edit categories11 types
Unique instructions46
Annotation dimensions10 per example
Cross-model verifiedYes (4 independent models, ~2,500 API calls)
SourceTIGER-Lab/EditReward-Data (170K+ pairs)

Data Fields

Images (3 per example)

  • source_image — Original source image
  • left_image — Edit A (left output)
  • right_image — Edit B (right output)

Metadata & Annotations

FieldTypeDescription
dev_idstringUnique identifier
instructionstringEditing instruction given to both models
categorystringEdit category (11 types)
left_model / right_modelstringModels that produced each edit
left_overall_score / right_overall_scorefloatHuman overall quality scores (1-8 scale)
left_instruction_following_score / right_instruction_following_scorefloatInstruction following score (1-4 scale)
left_quality_aesthetic_score / right_quality_aesthetic_scorefloatVisual quality & aesthetics score (1-4 scale)
vote_typestringHuman preference: leftvote / rightvote / tie
reasoning_chain_A / reasoning_chain_BstringStep-by-step quality analysis per edit
failure_modes_A / failure_modes_Blist[string]Identified failure modes (11-type taxonomy)
difficultystringeasy / medium / hard
preference_justificationstringReasoning behind human preference
useful_toolslist[string]Recommended analysis tools for this edit type
key_evaluation_insightstringDecisive quality difference
quality_tierstringgold / silver

Category Distribution

CategoryCount
other21
color_texture20
object_replacement15
object_removal8
object_addition7
attribute_modification7
text_editing5
style_transfer5
weather_lighting_season4
action_pose4
background4

License

MIT License. Source data from TIGER-Lab/EditReward-Data.

Contributors

AgPerry

10 commits

AgPerry/EditReward-Data-100

Dataset

EditReward Curated 100

1

stars

10

commits

1

linked in READMEs

Mar 1, 2026

updated

benchmark
evaluation
image-editing
preference

README

EditReward Curated 100

100 high-quality, richly annotated image editing preference examples curated from TIGER-Lab/EditReward-Data.

Each example contains a source image, two edited outputs (left/right) from different models, human preference labels, and detailed multi-dimensional annotations.

Quick Start

from datasets import load_dataset

ds = load_dataset("AgPerry/EditReward-Data-100", split="train")

# Access an example
example = ds[0]
print(f"Instruction: {example['instruction']}")
print(f"Human preference: {example['vote_type']}")
print(f"Category: {example['category']}")

# View images
example['source_image'].show()  # Original image
example['left_image'].show()    # Edit A
example['right_image'].show()   # Edit B

Dataset Summary

PropertyValue
Total examples100
Quality tiersGold 75, Silver 25
Vote distributionLeft 48, Tie 3, Right 49
Edit categories11 types
Unique instructions46
Annotation dimensions10 per example
Cross-model verifiedYes (4 independent models, ~2,500 API calls)
SourceTIGER-Lab/EditReward-Data (170K+ pairs)

Data Fields

Images (3 per example)

  • source_image — Original source image
  • left_image — Edit A (left output)
  • right_image — Edit B (right output)

Metadata & Annotations

FieldTypeDescription
dev_idstringUnique identifier
instructionstringEditing instruction given to both models
categorystringEdit category (11 types)
left_model / right_modelstringModels that produced each edit
left_overall_score / right_overall_scorefloatHuman overall quality scores (1-8 scale)
left_instruction_following_score / right_instruction_following_scorefloatInstruction following score (1-4 scale)
left_quality_aesthetic_score / right_quality_aesthetic_scorefloatVisual quality & aesthetics score (1-4 scale)
vote_typestringHuman preference: leftvote / rightvote / tie
reasoning_chain_A / reasoning_chain_BstringStep-by-step quality analysis per edit
failure_modes_A / failure_modes_Blist[string]Identified failure modes (11-type taxonomy)
difficultystringeasy / medium / hard
preference_justificationstringReasoning behind human preference
useful_toolslist[string]Recommended analysis tools for this edit type
key_evaluation_insightstringDecisive quality difference
quality_tierstringgold / silver

Category Distribution

CategoryCount
other21
color_texture20
object_replacement15
object_removal8
object_addition7
attribute_modification7
text_editing5
style_transfer5
weather_lighting_season4
action_pose4
background4

License

MIT License. Source data from TIGER-Lab/EditReward-Data.

Contributors

AgPerry

10 commits