tamlhp/awesome-instructional-editing

Awesome Instruction Editing. Image and Media Editing with Human Instructions. Instruction-Guided Image and Media Editing.

118

2,043 commits

updated May 6, 2026

See the code

README

Awesome Instructional Editing

A Survey of Instruction-Guided Image and Media Editing in LLM Era

Awesome arXiv GitHub stars visitors Contrib

A collection of academic articles, published methodology, and datasets on the subject of Instruction-Guided Image and Media Editing.

A sortable version is available here: https://awesome-instruction-editing.github.io/

Please read and cite our paper: ACM

Nguyen, Thanh Tam, Zhao Ren, Trinh Pham, Phi Le Nguyen, Quoc Viet Hung Nguyen, and Hongzhi Yin. "A review of instruction-guided image editing." Engineering Applications of Artificial Intelligence 163 (2026): 112953. https://doi.org/10.1016/j.engappai.2025.112953

πŸ”– News!!!

πŸ“Œ We are actively tracking the latest research and welcome contributions to our repository and survey paper. If your studies are relevant, please feel free to create an issue or a pull request.

πŸ“° 2026-02-28: Our website is live at https://awesome-instruction-editing.github.io/. Thanks a lot for your citations.

πŸ“° 2025-10-30: Our work has been published in Engineering Applications of Artificial Intelligence. Thanks a lot for your continuous supports.

πŸ“° 2024-11-15: Our paper Instruction-Guided Editing Controls for Images and Multimedia: A Survey in LLM era has been revised into version 1 with new methods and dicussions.

πŸ” Citation

If you find this work helpful in your research, welcome to cite the paper and give a ⭐.

@article{nguyen2026review,
  title={A review of instruction-guided image editing},
  author={Nguyen, Thanh Tam and Ren, Zhao and Pham, Trinh and Le Nguyen, Phi and Nguyen, Quoc Viet Hung and Yin, Hongzhi},
  journal={Engineering Applications of Artificial Intelligence},
  volume={163},
  pages={112953},
  year={2026},
  publisher={Elsevier}
}
@article{nguyen2024instruction,
  title={Instruction-Guided Editing Controls for Images and Multimedia: A Survey in LLM era},
  author={Thanh Tam Nguyen and Zhao Ren and Trinh Pham and Thanh Trung Huynh and Phi Le Nguyen and Hongzhi Yin and Quoc Viet Hung Nguyen},
  journal={arXiv preprint arXiv:2411.09955},
  year={2024}
}

Existing Surveys


Pipeline

pipeline


Approaches for Image Editing

TitleYearVenueCategoryCode
Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing2026ICLRMLLM-guided, Diffusion, chain-of-thought, datasetCode
Dragging with Geometry: From Pixels to Geometry-Guided Image Editing2026ICMLinteractive point-based image editing, geometry-guided dragging, 3D cuesCode
Follow-Your-Shape: Shape-Aware Image Editing via Trajectory-Guided Region Control2026ICLRshape-aware image editingCode
UTDesign: A Unified Framework for Stylized Text Editing and Generation in Graphic Design Images2025SIGGRAPH Asiastylized text editing and generationCode
EditInfinity: Image Editing with Binary-Quantized Generative Models2025NeurIPStext-driven image editing, binary-quantized generative modelsCode
Prompt-Softbox-Prompt: A Free-Text Embedding Control for Image Editing2025MMfree-text embedding controlCode
Exploring Optimal Latent Trajetory for Zero-shot Image Editing2025arXivzero-shot image editing
FramePainter: Endowing Interactive Image Editing with Video Diffusion Priors2025arXivinteractive image editing
Energy-Guided Optimization for Personalized Image Editing with Pretrained Text-to-Image Diffusion Models2025arXivpersonalized image editing
Early Timestep Zero-Shot Candidate Selection for Instruction-Guided Image Editing2025arXivinstruction-guided image editing
PartEdit: Fine-Grained Image Editing using Pre-Trained Diffusion Models2025arXivFine-Grained Image Editing
S2Edit: Text-Guided Image Editing with Precise Semantic and Spatial Control2025arXivtext guided image editing
REED-VAE: RE-Encode Decode Training for Iterative Image Editing with Diffusion Models2025arXiviterative image editing
Towards Efficient Exemplar Based Image Editing with Multimodal VLMs2025arXivexemplar-based image editing
ReFlex: Text-Guided Editing of Real Images in Rectified Flow via Mid-Step Feature Extraction and Attention Adaptation2025arXivtext-guided image editing
LUSD: Localized Update Score Distillation for Text-Guided Image Editing2025arXivtext-guided image editing
Guiding Instruction-based Image Editing via Multimodal Large Language Models2024ICLRLLM-guided, Diffusion, Concise instruction loss, Supervised fine-tuningCode
Hive: Harnessing human feedback for instructional visual editing2024CVPRRLHF, Diffusion, Data augmentationCode
InstructBrush: Learning Attention-based Instruction Optimization for Image Editing2024arXivDiffusion, Attention-basedCode
FlexEdit: Flexible and Controllable Diffusion-based Object-centric Image Editing2024arXivControllable diffusionCode
Pix2Pix-OnTheFly: Leveraging LLMs for Instruction-Guided Image Editing2024arXivon-the-fly, tuning-free, training-freeCode
EffiVED:Efficient Video Editing via Text-instruction Diffusion Models2024arXivVideo editing, decoupled classifier-freeCode
Grounded-Instruct-Pix2Pix: Improving Instruction Based Image Editing with Automatic Target Grounding2024ICASSPDiffusion, mask generation image editingCode
TexFit: Text-Driven Fashion Image Editing with Diffusion Models2024AAAIFashion editing, region locaation, diffusionCode
InstructGIE: Towards Generalizable Image Editing2024arXivDiffusion, context matchingCode
An Item is Worth a Prompt: Versatile Image Editing with Disentangled Control2024arXivFreestyle, Diffusion, Group attentionCode
Text-Driven Image Editing via Learnable Regions2024CVPRRegion generation, diffusion, mask-freeCode
ChartReformer: Natural Language-Driven Chart Image Editing2024ICDARchart editingCode
GANTASTIC: GAN-based Transfer of Interpretable Directions for Disentangled Image Editing in Text-to-Image Diffusion Models2024arXivHybrid, direction transferCode
StyleBooth: Image Style Editing with Multimodal Instruction2024arXivstyle editing, diffusionCode
ZONE: Zero-Shot Instruction-Guided Local Editing2024CVPRLocal editing, localisationCode
Inversion-Free Image Editing with Natural Language2024CVPRConsistent models, unified attentionCode
Focus on Your Instruction: Fine-grained and Multi-instruction Image Editing by Attention Modulation2024CVPRDiffusion, multi-instructionCode
MoEController: Instruction-based Arbitrary Image Manipulation with Mixture-of-Expert Controllers2024arXivMoE, LLM-poweredCode
InstructCV: Instruction-Tuned Text-to-Image Diffusion Models as Vision Generalists2024ICLRDiffusion, LLM-based, classifier-freeCode
Iterative Multi-Granular Image Editing Using Diffusion Models2024WACVDiffusion, Iterative editing
Dynamic Prompt Learning: Addressing Cross-Attention Leakage for Text-Based Image Editing2024NeurIPSDiffusion, dynamic promptCode
Object-Aware Inversion and Reassembly for Image Editing2024ICLRDiffusion, multi-objectCode
Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models2024arXivvideo editing, zero-shotCode
Video-P2P: Video Editing with Cross-attention Control2024CVPRDecoupled-guidance attention control, video editingCode
NeRF-Insert: 3D Local Editing with Multimodal Control Signals2024arXiv3D Editing
BlenderAlchemy: Editing 3D Graphics with Vision-Language Models2024arXiv3D EditingCode
AudioScenic: Audio-Driven Video Scene Editing2024arXivaudio-based instruction
LocInv: Localization-aware Inversion for Text-Guided Image Editing2024CVPR-AI4CCLocalization-aware inversionCode
SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models2024arXivAudio-drivenCode
Exploring Text-Guided Single Image Editing for Remote Sensing Images2024arXivRemote sensing imagesCode
GaussianVTON: 3D Human Virtual Try-ON via Multi-Stage Gaussian Splatting Editing with Image Prompting2024arXivFashion editingCode
TIE: Revolutionizing Text-based Image Editing for Complex-Prompt Following and High-Fidelity Editing2024arXivChain of thought
Unified Editing of Panorama, 3D Scenes, and Videos Through Disentangled Self-Attention Injection2024arXivDiffusion, Self-attention InjectionCode
Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning2024arXivMusic editing, diffusionCode
Text Guided Image Editing with Automatic Concept Locating and Forgetting2024arXivDiffusion, concept forgetting
FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction2024arXivDiffusion, instruction-driven editingCode
Revealing Directions for Text-guided 3D Face Editing2024arXivText-guided 3D face editing
Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing2024arXivText-to-image, editing, diffusion
Hyper-parameter tuning for text guided image editing2024arXivText EditingCode
Add-it: Training-Free Object Insertion in Images With Pretrained Diffusion Models2024arXivText-guided Object InsertionCode
GenMix: Effective Data Augmentation with Generative Diffusion Model Image Editing2024arXivDiffusion image augmentation
SwiftEdit: Lightning Fast Text-Guided Image Editing via One-Step Diffusion2024arXivText-Guided Image Editing
FireFlow: Fast Inversion of Rectified Flow for Image Semantic Editing2024arXivsemantic image editing
FluxSpace: Disentangled Semantic Editing in Rectified Flow Transformers2024arXivdisentangled semantic editing
UIP2P: Unsupervised Instruction-based Image Editing via Cycle Edit Consistency2024arXivInstruction-based image editing
CA-Edit: Causality-Aware Condition Adapter for High-Fidelity Local Facial Attribute Editing2024arXivfacial attribute editing
Unsupervised Region-Based Image Editing of Denoising Diffusion Models2024arXivregion-based image editing
Edicho: Consistent Image Editing in the Wild2024arXivconsistent image editing
UIP2P: Unsupervised Instruction-based Image Editing via Edit Reversibility Constraint2024arXivinstruction-based image editing
InstructPix2Pix: Learning To Follow Image Editing Instruction2023CVPRCore paper, DiffusionCode
Visual Instruction Inversion: Image Editing via Image Prompting2023NeurIPSDiffusion, visual instructionCode
Instruct-NeRF2NeRF: Editing 3D Scenes with Instructions2023ICCV3D scene editingCode
Instruct 3D-to-3D: Text Instruction Guided 3D-to-3D conversion2023arXiv3D editing, Dynamic scalingCode
InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models2023arXivMusic editing, diffusionCode
EditShield: Protecting Unauthorized Image Editing by Instruction-guided Diffusion Models2023arXivauthorized editing, diffusionCode
Fairy: Fast Parallelized Instruction-Guided Video-to-Video Synthesis2023arXivVideo editing, cross-time attentionCode
AUDIT: Audio Editing by Following Instructions with Latent Diffusion Models2023NeurIPSAudio, DiffusionCode
InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following2023arXivRefinement prior, instrucitonal tuningCode
Learning to Follow Object-Centric Image Editing Instructions Faithfully2023EMNLPDiffusion, additional supervisionCode
StableVideo: Text-driven Consistency-aware Diffusion Video Editing2023ICCVDiffusion, VideoCode
Vox-E: Text-Guided Voxel Editing of 3D Objects2023ICCVDiffusion, 3DCode
Unitune: Text-driven image editing by fine tuning a diffusion model on a single image2023TOGDiffusion, fine-tuningCode
Dreamix: Video Diffusion Models are General Video Editors2023arXivCascaded diffusion, videoCode
Dialogpaint: A dialog-based image editing model2023arXivDialog-based
iEdit: Localised Text-guided Image Editing with Weak Supervision2023arXivLocalized diffusion
ImageBrush: Learning Visual In-Context Instructions for Exemplar-Based Image Manipulation2023NeurIPSExample-based instruction
NULL-Text Inversion for Editing Real Images Using Guided Diffusion Models2023CVPRnull-tex embedding, Diffusion, CLIPCode
Imagic: Text-based real image editing with diffusion models2023CVPRDiffusion, embedding interpolationCode
PhotoVerse: Tuning-Free Image Customization with Text-to-Image Diffusion Models2023arXivDiffusion, dual-branch conceptCode
InstructEdit: Improving Automatic Masks for Diffusion-based Image Editing With User Instructions2023arXivDiffusion, LLM-poweredCode
Instructdiffusion: A generalist modeling interface for vision tasks2023arXivMulti-task, multi-turn, Diffusion, LLMCode
Emu Edit: Precise Image Editing via Recognition and Generation Tasks2023arXivDiffusion, multi-task, multi-turnCode
SmartEdit: Exploring Complex Instruction-based Image Editing with Multimodal Large Language Models2023arXivMLLM, DiffusionCode
ChatFace: Chat-Guided Real Face Editing via Diffusion Latent Space Manipulation2023arXivLLM, DiffusionCode
Prompt-to-Prompt Image Editing with Cross Attention Control2023ICLRDiffusion, Cross AttentionCode
Target-Free Text-Guided Image Manipulation2023AAAI3D EditingCode
Paint by example: Exemplar-based image editing with diffusion models2023CVPRDiffusion, example-basedCode
De-net: Dynamic text-guided image editing adversarial networks2023AAAIGAN, multi-taskCode
Imagen editor and editbench: Advancing and evaluating text-guided image inpainting2023CVPRDiffusion, benchmark, CLIPCode
Plug-and-Play Diffusion Features for Text-Driven Image-to-Image Translation2023CVPRDiffusion, feature injectionCode
MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and Editing2023ICCVDiffusion, mutual self-attentionCode
LIME: Localized Image Editing via Attention Regularization in Diffusion Models2023arXivLocalized image editing
LDEdit: Towards Generalized Text Guided Image Manipulation via Latent Diffusion Models2022BMVClatent diffusion
StyleMC: Multi-Channel Based Fast Text-Guided Image Generation and Manipulation2022WACVGAN, CLIPCode
Blended Diffusion for Text-Driven Editing of Natural Images2022CVPRDiffusion, CLIP, BlendCode
VQGAN-CLIP: Open Domain Image Generation and Editing with Natural Language Guidance2022ECCVGAN, CLIPCode
StyleGAN-NADA: CLIP-guided domain adaptation of image generators2022TOGGAN, CLIPCode
DiffusionCLIP: Text-Guided Diffusion Models for Robust Image Manipulation2022CVPRDiffusion, CLIP, Noise combinationCode
GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models2022ICMLDiffusion, CLIP, Classifier-free guidanceCode
DiffEdit: Diffusion-based semantic image editing with mask guidance2022ICLRDiffusion, DDIM, Mask generationCode
Text2mesh: Text-driven neural stylization for meshes2022CVPR3D EditingCode
Manitrans: Entity-level text-guided image manipulation via token-wise semantic alignment and generation2022CVPRGAN, multi-entitiesCode
Text2live: Text-driven layered image and video editing2022ECCVGAN, CLIP, Video editingCode
SPEECHPAINTER: TEXT-CONDITIONED SPEECH INPAINTING2022InterspeechSpeech editingCode
Talk-to-Edit: Fine-Grained Facial Editing via Dialog2021ICCVGAN, dialog, semantic fieldCode
Manigan: Text-guided image manipulation2020CVPRGAN, affine combinationCode
SSCR: Iterative Language-Based Image Editing via Self-Supervised Counterfactual Reasoning2020EMNLPGAN, Cross-task consistencyCode
Open-Edit: Open-Domain Image Manipulation with Open-Vocabulary Instructions2020ECCVGANCode
Sequential Attention GAN for Interactive Image Editing2020MMGAN, Dialog, Sequential Attention
Lightweight generative adversarial networks for text-guided image manipulation2020NeurIPSLight-weight GANCode
Tell, Draw, and Repeat: Generating and Modifying Images Based on Continual Linguistic Instruction2019ICCVGANCode
Language-Based Image Editing With Recurrent Attentive Models2018CVPRGAN, Recurrent AttentionCode
Text-Adaptive Generative Adversarial Networks: Manipulating Images with Natural Language2018NeurIPSGAN, simpleCode

Approaches for Media Editing

TitleYearVenueCategoryCode
Dreamcrafter: Immersive Editing of 3D Radiance Fields Through Flexible, Generative Inputs and Outputs2025CHI3D Radiance Field editingProject
SVG-Head: Hybrid Surface-Volumetric Gaussians for High-Fidelity Head Reconstruction and Real-Time Editing2025ICCVhead reconstruction and real-time editingCode
IP-FaceDiff: Identity-Preserving Facial Video Editing with Diffusion2025WACV Workshopfacial video editing, diffusion, identity preservationCode
Edit as You See: Image-guided Video Editing via Masked Motion Modeling2025arXivimage-guided video editing
CAD-Editor: A Locate-then-Infill Framework with Automated Training Data Synthesis for Text-Based CAD Editing2025arXivText-Based CAD Editing
MRHaD: Mixed Reality-based Hand-Drawn Map Editing Interface for Mobile Robot Navigation2025arXivmixed reality map editing
ScanEdit: Hierarchically-Guided Functional 3D Scan Editing2025arXiv3D Scan Editing
Vidi: Large Multimodal Models for Video Understanding and Editing2025arXivvideo understanding and editing
Rethinking Score Distilling Sampling for 3D Editing and Generation2025arXiv3D editing and generation
BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing2025arXiv3D visual editing
EditIQ: Automated Cinematic Editing of Static Wide-Angle Videos via Dialogue Interpretation and Saliency Cues2025arXivAutomated cinematic editing
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing2025arXivmulti-grained video editing
VEU-Bench: Towards Comprehensive Understanding of Video Editing2025arXivvideo editing benchmark
Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence2025arXivpedestrian video editing
TexGS-VolVis: Expressive Scene Editing for Volume Visualization via Textured Gaussian Splatting2025arXivVolume Scene Editing
SGEdit: Bridging LLM with Text2Image Generative Model for Scene Graph-based Image Editing2024SIGGRAPH AsiaDiffusion, scene graph, image-editingCode
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition2024arXivText-to-Audio, Multimodal
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework2024arXivDiffusion-based text-to-audioCode
Enabling Local Editing in Diffusion Models by Joint and Individual Component Analysis2024BMVCDiffusion-based local image manipulationCode
Steer-by-prior Editing of Symbolic Music Loops2024MMLMasked Language Modelling, music instrumentsCode
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning2024ISMIRDiffusion-based text-to-audioCode
GroupDiff: Diffusion-based Group Portrait Editing2024ECCVDiffusion-based image editingCode
RegionDrag: Fast Region-Based Image Editing with Diffusion Models2024ECCVDiffusion-based image editingCode
SyncNoise: Geometrically Consistent Noise Prediction for Text-based 3D Scene Editing2024arXivMulti-view consistency
DreamCatalyst: Fast and High-Quality 3D Editing via Controlling Editability and Identity Preservation2024arXivDiffusion-based editingCode
MEDIC: Zero-shot Music Editing with Disentangled Inversion Control2024arXivAudio editing
3DEgo: 3D Editing on the Go!2024ECCVMonocular 3D Scene SynthesisCode
MedEdit: Counterfactual Diffusion-based Image Editing on Brain MRI2024SASHIMIBiomedical editing
FlexiEdit: Frequency-Aware Latent Refinement for Enhanced Non-Rigid Editing2024ECCVImage editing
LEMON: Localized Editing with Mesh Optimization and Neural Shaders2024arXivMesh editing
Diffusion Brush: A Latent Diffusion Model-based Editing Tool for AI-generated Images2024arXivImage editing
Streamlining Image Editing with Layered Diffusion Brushes2024arXivImage editing
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing2024arXivImage Editing DatasetCode
Environment Maps Editing using Inverse Rendering and Adversarial Implicit Functions2024arXivInverse rendering, HDR editing
HairDiffusion: Vivid Multi-Colored Hair Editing via Latent Diffusion2024arXivHair editing, Diffusion models
DiffuMask-Editor: A Novel Paradigm of Integration Between the Segmentation Diffusion Model and Image Editing to Improve Segmentation Ability2024arXivSynthetic Data Generation
Taming Rectified Flow for Inversion and Editing2024arXivImage InversionCode
Pathways on the Image Manifold: Image Editing via Video Generation2024arXivvideo-based editing, Frame2Frame, Temporal Editing Caption
PrEditor3D: Fast and Precise 3D Shape Editing2024arXiv3D shape editing
Diffusion-Based Attention Warping for Consistent 3D Scene Editing2024arXiv3D scene editing
MIVE: New Design and Benchmark for Multi-Instance Video Editing2024arXivMulti-Instance Video Editing
DriveEditor: A Unified 3D Information-Guided Framework for Controllable Object Editing in Driving Scenes2024arXiv3D object editing
MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation2024arXivMulti-Attribute Video Editing
EditSplat: Multi-View Fusion and Attention-Guided Optimization for View-Consistent 3D Scene Editing with 3D Gaussian Splatting2024arXiv3D scene editing

Datasets

Type: General

Dataset#Items#Papers UsedLink
DIM14M+1Link
Reason-Edit12.4M+1Link
MagicBrush10K1Link
InstructPix2Pix500K1Link
ICE-Bench6.5K1Link
GalaxyEdit800K1Link
EditBench2401Link

Type: Image Captioning

Type: ClipArt

Dataset#Items#Papers UsedLink
CoDraw58K+1Link

Type: VQA

Dataset#Items#Papers UsedLink
i-CLEVR70K+1Link

Type: Semantic Segmentation

Dataset#Items#Papers UsedLink
ADE20K27K+1Link

Type: Object Classification

Dataset#Items#Papers UsedLink
Oxford-III-Pets7K+1Link

Type: Depth Estimation

Dataset#Items#Papers UsedLink
NYUv2408K+1Link

Type: Aesthetic-Based Editing

Dataset#Items#Papers UsedLink
Laion-Aesthetics V22.4B+1Link

Type: Dialog-Based Editing

Dataset#Items#Papers UsedLink
CelebA-Dialog202K+1Link
Flickr-Faces-HQ70K2Link

Evaluation Metrics

TitleYearVenueCategoryCode
SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing2025WACV Workshopvideo editing evaluation metricsCode
CategoryEvaluation MetricsFormulaUsage
Perceptual QualityLearned Perceptual Image Patch Similarity (LPIPS)$\text{LPIPS}(x, x') = \sum_l ||\phi_l(x) - \phi_l(x')||^2$Measures perceptual similarity between images, with lower scores indicating higher similarity.
Structural Similarity Index (SSIM)$\text{SSIM}(x, x') = \frac{(2\mu_x\mu_{x'} + C_1)(2\sigma_{xx'} + C_2)}{(\mu_x^2 + \mu_{x'}^2 + C_1)(\sigma_x^2 + \sigma_{x'}^2 + C_2)}$Measures visual similarity based on luminance, contrast, and structure.
FrΓ©chet Inception Distance (FID)$\text{FID} = ||\mu_r - \mu_g||^2 + \text{Tr}(\Sigma_r + \Sigma_g - 2(\Sigma_r \Sigma_g)^{1/2})$Measures the distance between the real and generated image feature distributions.
Inception Score (IS)$\text{IS} = \exp(E_x D_{KL}(p(y|x) || p(y)))$Evaluates image quality and diversity based on label distribution consistency.
Structural IntegrityPeak Signal-to-Noise Ratio (PSNR)$\text{PSNR} = 10 \log_{10} \left( \frac{\text{MAX}^2}{\text{MSE}} \right)$Measures image quality based on pixel-wise errors, with higher values indicating better quality.
Mean Intersection over Union (mIoU)$\text{mIoU} = \frac{1}{N} \sum_{i=1}^{N} \frac{|A_i \cap B_i|}{|A_i \cup B_i|}$Assesses segmentation accuracy by comparing predicted and ground truth masks.
Mask Accuracy$\text{Accuracy} = \frac{\text{TP} + \text{TN}}{\text{TP} + \text{FP} + \text{FN} + \text{TN}}$Evaluates the accuracy of generated masks.
Boundary Adherence$\text{BA} = \frac{|B_{\text{edit}} \cap B_{\text{target}}|}{|B_{\text{target}}|}$Measures how well edits preserve object boundaries.
Semantic AlignmentEdit Consistency$\text{EC} = \frac{1}{N} \sum_{i=1}^{N} 1{E_i = E_{\text{ref}}}$Measures the consistency of edits across similar prompts.
Target Grounding Accuracy$\text{TGA} = \frac{\text{Correct Targets}}{\text{Total Targets}}$Evaluates how well edits align with specified targets in the prompt.
Embedding Space Similarity$\text{CosSim}(v_x, v_{x'}) = \frac{v_x \cdot v_{x'}}{||v_x|| , ||v_{x'}||}$Measures similarity between the edited and reference images in feature space.
Decomposed Requirements Following Ratio (DRFR)$\text{DRFR} = \frac{1}{N} \sum_{i=1}^{N} \frac{\text{Requirements Followed}}{\text{Total Requirements}}$Assesses how closely the model follows decomposed instructions.
User-Based MetricsUser Study RatingsCaptures user feedback through ratings of image quality.
Human Visual Turing Test (HVTT)$\text{HVTT} = \frac{\text{Real Judgements}}{\text{Total Judgements}}$Measures the ability of users to distinguish between real and generated images.
Click-through Rate (CTR)$\text{CTR} = \frac{\text{Clicks}}{\text{Total Impressions}}$Tracks user engagement by measuring image clicks.
Diversity and FidelityEdit Diversity$\text{Diversity} = \frac{1}{N} \sum_{i=1}^{N} D_{KL}(p_i || p_{\text{mean}})$Measures the variability of generated images.
GAN Discriminator Score$\text{GDS} = \frac{1}{N} \sum_{i=1}^N D_{\text{GAN}}(x_i)$Assesses the authenticity of generated images using a GAN discriminator.
Reconstruction Error$\text{RE} = ||x - \hat{x}||$Measures the error between the original and generated images.
Edit Success Rate$\text{ESR} = \frac{\text{Successful Edits}}{\text{Total Edits}}$Quantifies the success of applied edits.
Consistency and CohesionScene Consistency$\text{SC} = \frac{1}{N} \sum_{i=1}^{N} \text{Sim}(I_{\text{edit}}, I_{\text{orig}})$Measures how edits maintain overall scene structure.
Color Consistency$\text{CC} = \frac{1}{N} \sum_{i=1}^{N} \frac{|C_{\text{edit}} \cap C_{\text{orig}}|}{|C_{\text{orig}}|}$Measures color preservation between edited and original regions.
Shape Consistency$\text{ShapeSim} = \frac{1}{N} \sum_{i=1}^{N} \text{IoU}(S_{\text{edit}}, S_{\text{orig}})$Quantifies how well shapes are preserved during edits.
Pose Matching Score$\text{PMS} = \frac{1}{N} \sum_{i=1}^{N} \text{Sim}(\theta_{\text{edit}}, \theta_{\text{orig}})$Assesses pose consistency between original and edited images.
RobustnessNoise Robustness$\text{NR} = \frac{1}{N} \sum_{i=1}^{N} ||x_i - x_{i,\text{noisy}}||$Evaluates model robustness to noise.
Perceptual Quality$\text{PQ} = \frac{1}{N} \sum_{i=1}^{N} \text{Score}(x_i)$A subjective quality metric based on human judgment.

Benchmark Results

Benchmark DatasetCLIP↑FID↓LPIPS↓PSNR↑MSEΓ—104↓SSIM/SSIM-M (edit)↑
Reason-EditSwiftEdit (68.52%)
FramePainter (67.21%)
EmuEdit (63.14%)
MasaCtrl (98.71%)
DiffEdit (115.32%)
Fairy (150.22%)
EmuEdit (1.21%)
StyleCLIP (1.45%)
InstructPix2Pix (9.80%)
GLIDE (25.53%)
SwiftEdit (23.81%)
Video-P2P (20.09%)
GANTASTIC (65.4%)
GLIDE (80.1%)
DiffEdit (160.9%)
Fairy (83.14%)
MasaCtrl (81.55%)
FramePainter (75.21%)
MagicBrushGLIDE (26.51%)
StyleCLIP (25.83%)
TediGAN (24.92%)
SwiftEdit (21.49%)
InstructPix2Pix (42.15%)
DiffEdit (152.01%)
FramePainter (0.35%)
GANTASTIC (0.41%)
FramePainter (48.23%)
MasaCtrl (29.81%)
Fairy (29.14%)
EmuEdit (23.11%)
TediGAN (6.01%)
MasaCtrl (25.5%)
StyleCLIP (33.0%)
DiffEdit (87.23%)
SwiftEdit (86.52%)
InstructPix2Pix (81.11%)
EditBenchInstructPix2Pix (78.21%)
Video-P2P (77.10%)
GLIDE (75.03%)
TediGAN (6.92%)
SwiftEdit (7.07%)
EmuEdit (8.51%)
GLIDE (0.51%)
DiffEdit (0.53%)
FramePainter (0.61%)
MasaCtrl (26.83%)
InstructPix2Pix (26.17%)
SwiftEdit (25.12%)
Fairy (150.1%)
GANTASTIC (156.2%)
StyleCLIP (165.8%)
EmuEdit (87.51%)
TediGAN (86.20%)
Video-P2P (84.32%)
Flickr-Faces-HQDiffEdit (87.51%)
TediGAN (86.90%)
GLIDE (85.23%)
Video-P2P (17.53%)
SwiftEdit (18.10%)
StyleCLIP (19.82%)
MasaCtrl (0.070%)
FramePainter (0.073%)
GANTASTIC (0.081%)
GLIDE (20.14%)
DiffEdit (19.46%)
TediGAN (18.91%)
EmuEdit (230.1%)
Fairy (238.3%)
SwiftEdit (245.7%)
GANTASTIC (81.53%)
MasaCtrl (80.33%)
InstructPix2Pix (78.91%)
Fashion200kStyleCLIP (82.14%)
EmuEdit (81.59%)
FramePainter (80.41%)
SwiftEdit (150.11%)
Fairy (152.70%)
TediGAN (158.33%)
FramePainter (26.92%)
DiffEdit (27.50%)
Video-P2P (28.41%)
InstructPix2Pix (26.34%)
SwiftEdit (25.89%)
EmuEdit (25.11%)
Video-P2P (280.5%)
StyleCLIP (286.0%)
GLIDE (291.3%)
TediGAN (76.21%)
GANTASTIC (74.97%)
Fairy (73.84%)
ReferItEmuEdit (43.51%)
TediGAN (42.90%)
StyleCLIP (41.83%)
InstructPix2Pix (45.13%)
FramePainter (46.40%)
DiffEdit (48.91%)
StyleCLIP (0.090%)
GANTASTIC (0.095%)
SwiftEdit (0.105%)
Video-P2P (19.94%)
MasaCtrl (19.13%)
Fairy (18.51%)
DiffEdit (81.2%)
EmuEdit (84.0%)
TediGAN (89.6%)
SwiftEdit (83.41%)
InstructPix2Pix (82.11%)
GANTASTIC (80.92%)
Fashion-IQFramePainter (84.03%)
Video-P2P (83.10%)
GANTASTIC (82.51%)
GANTASTIC (68.24%)
TediGAN (69.60%)
StyleCLIP (72.43%)
MasaCtrl (9.81%)
InstructPix2Pix (10.03%)
Fairy (10.52%)
EmuEdit (21.52%)
FramePainter (20.99%)
TediGAN (20.31%)
Fairy (260.1%)
GLIDE (268.3%)
Video-P2P (275.4%)
StyleCLIP (83.04%)
MasaCtrl (82.26%)
DiffEdit (81.63%)
MIT-StatesGLIDE (43.12%)
EmuEdit (42.00%)
TediGAN (40.91%)
Fairy (128.91%)
FramePainter (130.30%)
Video-P2P (135.62%)
SwiftEdit (0.170%)
DiffEdit (0.179%)
EmuEdit (0.191%)
InstructPix2Pix (20.24%)
StyleCLIP (19.83%)
Fairy (19.21%)
MasaCtrl (109.8%)
GLIDE (112.4%)
GANTASTIC (118.3%)
Video-P2P (87.12%)
SwiftEdit (86.40%)
DiffEdit (85.53%)
ADE20KFramePainter (60.23%)
MasaCtrl (59.50%)
Video-P2P (58.31%)
Video-P2P (8.11%)
GANTASTIC (8.30%)
InstructPix2Piz (9.13%)
TediGAN (39.82%)
DiffEdit (40.11%)
MasaCtrl (41.53%)
SwiftEdit (27.13%)
FramePainter (26.69%)
Fairy (26.04%)
StyleCLIP (68.5%)
EmuEdit (70.3%)
DiffEdit (74.8%)
InstructPix2Pix (75.92%)
TediGAN (74.80%)
GLIDE (73.54%)
DeepFashionTediGAN (42.51%)
Video-P2P (41.60%)
InstructPix2Pix (40.73%)
EmuEdit (174.31%)
SwiftEdit (176.10%)
Fairy (179.82%)
InstructPix2Pix (0.161%)
FramePainter (0.165%)
GANTASTIC (0.172%)
GANTASTIC (18.52%)
TediGAN (18.00%)
GLIDE (17.61%)
Fairy (265.4%)
MasaCtrl (270.0%)
Video-P2P (276.9%)
MasaCtrl (82.53%)
DiffEdit (81.71%)
SwiftEdit (80.92%)

Notes:

  • Scaling caveats: iEdit reports CLIPScore (%) and SSIM-M (% on edited/background regions). PIE-Bench reports β€œCLIP Semantics” (whole/edited) as un-normalized cosine-like scores (~20–26). LOCATEdit shows SSIM as Γ—10Β² and LPIPS unscaled (values ~39–42). Forgedit’s CLIPScore is cosine (0–1).
  • [a] RegionDrag reports LPIPSΓ—100; we divide by 100 (thus 9.9β†’0.099, 9.2β†’0.092).

Experiment Configuration

pip install --upgrade diffusers transformers accelerate safetensors torch torchvision
import torch, PIL.Image as Image
from diffusers import (
    StableDiffusionInstructPix2PixPipeline,
    StableDiffusionDiffEditPipeline,
    PaintByExamplePipeline,
    DDIMScheduler, DDIMInverseScheduler,
)

DEVICE = "cuda" if torch.cuda.is_available() else "cpu"

# 1) InstructPix2Pix β€” text-guided global/local edits
def run_ip2p(input_path, instruction, out_path="out_ip2p.png", steps=30):
    pipe = StableDiffusionInstructPix2PixPipeline.from_pretrained(
        "timbrooks/instruct-pix2pix", torch_dtype=torch.float16 if DEVICE=="cuda" else torch.float32
    ).to(DEVICE)
    image = Image.open(input_path).convert("RGB")
    result = pipe(prompt=instruction, image=image,
                  num_inference_steps=steps, guidance_scale=7.5, image_guidance_scale=1.5).images[0]
    result.save(out_path); return out_path

# 2) DiffEdit β€” automatic mask + latent inversion for targeted edits
def run_diffedit(input_path, source_prompt, target_prompt, out_path="out_diffedit.png", steps=50):
    init_img = Image.open(input_path).convert("RGB")
    pipe = StableDiffusionDiffEditPipeline.from_pretrained(
        "runwayml/stable-diffusion-v1-5",
        torch_dtype=torch.float16 if DEVICE=="cuda" else torch.float32
    ).to(DEVICE)
    pipe.scheduler = DDIMScheduler.from_config(pipe.scheduler.config)
    pipe.inverse_scheduler = DDIMInverseScheduler.from_config(pipe.scheduler.config)

    mask = pipe.generate_mask(image=init_img, source_prompt=source_prompt, target_prompt=target_prompt,
                              num_inference_steps=steps)[0]
    inv = pipe.invert(prompt=source_prompt, image=init_img, num_inference_steps=steps)
    edited = pipe(prompt=target_prompt, negative_prompt=source_prompt,
                  image=init_img, mask_image=mask, latents=inv.latents,
                  num_inference_steps=steps).images[0]
    edited.save(out_path); return out_path

# 3) Paint-by-Example β€” exemplar-guided local replacement
def run_pbe(input_path, mask_path, example_path, out_path="out_pbe.png", steps=50):
    pipe = PaintByExamplePipeline.from_pretrained(
        "Fantasy-Studio/Paint-by-Example",
        torch_dtype=torch.float16 if DEVICE=="cuda" else torch.float32
    ).to(DEVICE)
    image = Image.open(input_path).convert("RGB")
    mask  = Image.open(mask_path).convert("L")         # white = repaint
    ex    = Image.open(example_path).convert("RGB")
    edited = pipe(image=image, mask_image=mask, example_image=ex,
                  num_inference_steps=steps, guidance_scale=5.0).images[0]
    edited.save(out_path); return out_path

# Example usage (where input.jpg, fruit.jpg, etc. are your input data)
run_ip2p("input.jpg", "make the sky pink at sunset")
run_diffedit("fruit.jpg", "a bowl of apples", "a bowl of pears")
run_pbe("room.jpg", "room_mask.png", "new_chair.jpg")

Repo-based Configuration

Add-it (training-free insertion)

Click to open
git clone https://github.com/NVlabs/addit && cd addit
conda env create -f environment.yml && conda activate addit
# real image insertion:
python run_CLI_addit_real.py \
  --source_image "images/bed_dark_room.jpg" \
  --prompt_source "A photo of a bed in a dark room" \
  --prompt_target "A photo of a dog lying on a bed in a dark room" \
  --subject_token "dog"

FreeEdit (mask-free, reference-based)

Click to open
git clone https://github.com/hrz2000/FreeEdit && cd FreeEdit
pip install -r requirements.txt
# check README / demo notebook for single-command inference

Grounded-Instruct-Pix2Pix (auto target grounding)

Click to open
git clone https://github.com/arthur-71/Grounded-Instruct-Pix2Pix && cd Grounded-Instruct-Pix2Pix
pip install -r requirements.txt && python -m spacy download en_core_web_sm
# install GroundingDINO (per README), then open the provided notebook:
# jupyter notebook grounded-instruct-pix2pix.ipynb

RegionDrag (fast region edits/UI)

Click to open
git clone https://github.com/Visual-AI/RegionDrag && cd RegionDrag
pip install -r requirements.txt
# see UI_GUIDE.md for the GUI runner; a minimal script is included in the repo

ZONE (localized editing)

Click to open
git clone https://github.com/lsl001006/ZONE && cd ZONE
pip install -r requirements.txt
python demo.py --input your.jpg --prompt "make the mug red" --mask path/to/mask.png

D-Edit (freestyle mask-conditioned)

Click to open
git clone https://github.com/collovlab/d-edit && cd d-edit
pip install -r requirements.txt
python app.py --input your.jpg --mask mask.png --prompt "replace the sofa with a blue one"

Pix2Pix-Zero / On-the-Fly (training-free, edit direction)

Click to open
git clone https://github.com/pix2pixzero/pix2pix-zero && cd pix2pix-zero
pip install -r requirements.txt
# see README + HF demo link for quick usage

Eedit the synthetic images generated by Stable Diffusion with the following command.

python src/edit_synthetic.py \
    --results_folder "output/synth_editing" \
    --prompt_str "a high resolution painting of a cat in the style of van gogh" \
    --task "cat2dog"

Disclaimer

Feel free to contact us if you have any queries or exciting news. In addition, we welcome all researchers to contribute to this repository and further contribute to the knowledge of this field.

If you have some other related references, please feel free to create a Github issue with the paper information. We will glady update the repos according to your suggestions. (You can also create pull requests, but it might take some time for us to do the merge)


Backup Statistics

Hits HitCount

Visitor Count

Visitors

audio-editing
image-edit
image-editing
instructional-edit
instructional-editing
instruction-editing
instruction-following
instruction-guided
instruction-learning
instruction-tuning
media-editing
music-editing
text-guidance
text-guided
text-guided-image-editing
video-editing

Contributors

github-actions[bot]

1,976 commits

tamlhp

45 commits

phkhanhtrinh23

22 commits

tamlhp/awesome-instructional-editing

Awesome Instruction Editing. Image and Media Editing with Human Instructions. Instruction-Guided Image and Media Editing.

118

2,043 commits

updated May 6, 2026

See the code

README

Awesome Instructional Editing

A Survey of Instruction-Guided Image and Media Editing in LLM Era

Awesome arXiv GitHub stars visitors Contrib

A collection of academic articles, published methodology, and datasets on the subject of Instruction-Guided Image and Media Editing.

A sortable version is available here: https://awesome-instruction-editing.github.io/

Please read and cite our paper: ACM

Nguyen, Thanh Tam, Zhao Ren, Trinh Pham, Phi Le Nguyen, Quoc Viet Hung Nguyen, and Hongzhi Yin. "A review of instruction-guided image editing." Engineering Applications of Artificial Intelligence 163 (2026): 112953. https://doi.org/10.1016/j.engappai.2025.112953

πŸ”– News!!!

πŸ“Œ We are actively tracking the latest research and welcome contributions to our repository and survey paper. If your studies are relevant, please feel free to create an issue or a pull request.

πŸ“° 2026-02-28: Our website is live at https://awesome-instruction-editing.github.io/. Thanks a lot for your citations.

πŸ“° 2025-10-30: Our work has been published in Engineering Applications of Artificial Intelligence. Thanks a lot for your continuous supports.

πŸ“° 2024-11-15: Our paper Instruction-Guided Editing Controls for Images and Multimedia: A Survey in LLM era has been revised into version 1 with new methods and dicussions.

πŸ” Citation

If you find this work helpful in your research, welcome to cite the paper and give a ⭐.

@article{nguyen2026review,
  title={A review of instruction-guided image editing},
  author={Nguyen, Thanh Tam and Ren, Zhao and Pham, Trinh and Le Nguyen, Phi and Nguyen, Quoc Viet Hung and Yin, Hongzhi},
  journal={Engineering Applications of Artificial Intelligence},
  volume={163},
  pages={112953},
  year={2026},
  publisher={Elsevier}
}
@article{nguyen2024instruction,
  title={Instruction-Guided Editing Controls for Images and Multimedia: A Survey in LLM era},
  author={Thanh Tam Nguyen and Zhao Ren and Trinh Pham and Thanh Trung Huynh and Phi Le Nguyen and Hongzhi Yin and Quoc Viet Hung Nguyen},
  journal={arXiv preprint arXiv:2411.09955},
  year={2024}
}

Existing Surveys


Pipeline

pipeline


Approaches for Image Editing

TitleYearVenueCategoryCode
Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing2026ICLRMLLM-guided, Diffusion, chain-of-thought, datasetCode
Dragging with Geometry: From Pixels to Geometry-Guided Image Editing2026ICMLinteractive point-based image editing, geometry-guided dragging, 3D cuesCode
Follow-Your-Shape: Shape-Aware Image Editing via Trajectory-Guided Region Control2026ICLRshape-aware image editingCode
UTDesign: A Unified Framework for Stylized Text Editing and Generation in Graphic Design Images2025SIGGRAPH Asiastylized text editing and generationCode
EditInfinity: Image Editing with Binary-Quantized Generative Models2025NeurIPStext-driven image editing, binary-quantized generative modelsCode
Prompt-Softbox-Prompt: A Free-Text Embedding Control for Image Editing2025MMfree-text embedding controlCode
Exploring Optimal Latent Trajetory for Zero-shot Image Editing2025arXivzero-shot image editing
FramePainter: Endowing Interactive Image Editing with Video Diffusion Priors2025arXivinteractive image editing
Energy-Guided Optimization for Personalized Image Editing with Pretrained Text-to-Image Diffusion Models2025arXivpersonalized image editing
Early Timestep Zero-Shot Candidate Selection for Instruction-Guided Image Editing2025arXivinstruction-guided image editing
PartEdit: Fine-Grained Image Editing using Pre-Trained Diffusion Models2025arXivFine-Grained Image Editing
S2Edit: Text-Guided Image Editing with Precise Semantic and Spatial Control2025arXivtext guided image editing
REED-VAE: RE-Encode Decode Training for Iterative Image Editing with Diffusion Models2025arXiviterative image editing
Towards Efficient Exemplar Based Image Editing with Multimodal VLMs2025arXivexemplar-based image editing
ReFlex: Text-Guided Editing of Real Images in Rectified Flow via Mid-Step Feature Extraction and Attention Adaptation2025arXivtext-guided image editing
LUSD: Localized Update Score Distillation for Text-Guided Image Editing2025arXivtext-guided image editing
Guiding Instruction-based Image Editing via Multimodal Large Language Models2024ICLRLLM-guided, Diffusion, Concise instruction loss, Supervised fine-tuningCode
Hive: Harnessing human feedback for instructional visual editing2024CVPRRLHF, Diffusion, Data augmentationCode
InstructBrush: Learning Attention-based Instruction Optimization for Image Editing2024arXivDiffusion, Attention-basedCode
FlexEdit: Flexible and Controllable Diffusion-based Object-centric Image Editing2024arXivControllable diffusionCode
Pix2Pix-OnTheFly: Leveraging LLMs for Instruction-Guided Image Editing2024arXivon-the-fly, tuning-free, training-freeCode
EffiVED:Efficient Video Editing via Text-instruction Diffusion Models2024arXivVideo editing, decoupled classifier-freeCode
Grounded-Instruct-Pix2Pix: Improving Instruction Based Image Editing with Automatic Target Grounding2024ICASSPDiffusion, mask generation image editingCode
TexFit: Text-Driven Fashion Image Editing with Diffusion Models2024AAAIFashion editing, region locaation, diffusionCode
InstructGIE: Towards Generalizable Image Editing2024arXivDiffusion, context matchingCode
An Item is Worth a Prompt: Versatile Image Editing with Disentangled Control2024arXivFreestyle, Diffusion, Group attentionCode
Text-Driven Image Editing via Learnable Regions2024CVPRRegion generation, diffusion, mask-freeCode
ChartReformer: Natural Language-Driven Chart Image Editing2024ICDARchart editingCode
GANTASTIC: GAN-based Transfer of Interpretable Directions for Disentangled Image Editing in Text-to-Image Diffusion Models2024arXivHybrid, direction transferCode
StyleBooth: Image Style Editing with Multimodal Instruction2024arXivstyle editing, diffusionCode
ZONE: Zero-Shot Instruction-Guided Local Editing2024CVPRLocal editing, localisationCode
Inversion-Free Image Editing with Natural Language2024CVPRConsistent models, unified attentionCode
Focus on Your Instruction: Fine-grained and Multi-instruction Image Editing by Attention Modulation2024CVPRDiffusion, multi-instructionCode
MoEController: Instruction-based Arbitrary Image Manipulation with Mixture-of-Expert Controllers2024arXivMoE, LLM-poweredCode
InstructCV: Instruction-Tuned Text-to-Image Diffusion Models as Vision Generalists2024ICLRDiffusion, LLM-based, classifier-freeCode
Iterative Multi-Granular Image Editing Using Diffusion Models2024WACVDiffusion, Iterative editing
Dynamic Prompt Learning: Addressing Cross-Attention Leakage for Text-Based Image Editing2024NeurIPSDiffusion, dynamic promptCode
Object-Aware Inversion and Reassembly for Image Editing2024ICLRDiffusion, multi-objectCode
Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models2024arXivvideo editing, zero-shotCode
Video-P2P: Video Editing with Cross-attention Control2024CVPRDecoupled-guidance attention control, video editingCode
NeRF-Insert: 3D Local Editing with Multimodal Control Signals2024arXiv3D Editing
BlenderAlchemy: Editing 3D Graphics with Vision-Language Models2024arXiv3D EditingCode
AudioScenic: Audio-Driven Video Scene Editing2024arXivaudio-based instruction
LocInv: Localization-aware Inversion for Text-Guided Image Editing2024CVPR-AI4CCLocalization-aware inversionCode
SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models2024arXivAudio-drivenCode
Exploring Text-Guided Single Image Editing for Remote Sensing Images2024arXivRemote sensing imagesCode
GaussianVTON: 3D Human Virtual Try-ON via Multi-Stage Gaussian Splatting Editing with Image Prompting2024arXivFashion editingCode
TIE: Revolutionizing Text-based Image Editing for Complex-Prompt Following and High-Fidelity Editing2024arXivChain of thought
Unified Editing of Panorama, 3D Scenes, and Videos Through Disentangled Self-Attention Injection2024arXivDiffusion, Self-attention InjectionCode
Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning2024arXivMusic editing, diffusionCode
Text Guided Image Editing with Automatic Concept Locating and Forgetting2024arXivDiffusion, concept forgetting
FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction2024arXivDiffusion, instruction-driven editingCode
Revealing Directions for Text-guided 3D Face Editing2024arXivText-guided 3D face editing
Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing2024arXivText-to-image, editing, diffusion
Hyper-parameter tuning for text guided image editing2024arXivText EditingCode
Add-it: Training-Free Object Insertion in Images With Pretrained Diffusion Models2024arXivText-guided Object InsertionCode
GenMix: Effective Data Augmentation with Generative Diffusion Model Image Editing2024arXivDiffusion image augmentation
SwiftEdit: Lightning Fast Text-Guided Image Editing via One-Step Diffusion2024arXivText-Guided Image Editing
FireFlow: Fast Inversion of Rectified Flow for Image Semantic Editing2024arXivsemantic image editing
FluxSpace: Disentangled Semantic Editing in Rectified Flow Transformers2024arXivdisentangled semantic editing
UIP2P: Unsupervised Instruction-based Image Editing via Cycle Edit Consistency2024arXivInstruction-based image editing
CA-Edit: Causality-Aware Condition Adapter for High-Fidelity Local Facial Attribute Editing2024arXivfacial attribute editing
Unsupervised Region-Based Image Editing of Denoising Diffusion Models2024arXivregion-based image editing
Edicho: Consistent Image Editing in the Wild2024arXivconsistent image editing
UIP2P: Unsupervised Instruction-based Image Editing via Edit Reversibility Constraint2024arXivinstruction-based image editing
InstructPix2Pix: Learning To Follow Image Editing Instruction2023CVPRCore paper, DiffusionCode
Visual Instruction Inversion: Image Editing via Image Prompting2023NeurIPSDiffusion, visual instructionCode
Instruct-NeRF2NeRF: Editing 3D Scenes with Instructions2023ICCV3D scene editingCode
Instruct 3D-to-3D: Text Instruction Guided 3D-to-3D conversion2023arXiv3D editing, Dynamic scalingCode
InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models2023arXivMusic editing, diffusionCode
EditShield: Protecting Unauthorized Image Editing by Instruction-guided Diffusion Models2023arXivauthorized editing, diffusionCode
Fairy: Fast Parallelized Instruction-Guided Video-to-Video Synthesis2023arXivVideo editing, cross-time attentionCode
AUDIT: Audio Editing by Following Instructions with Latent Diffusion Models2023NeurIPSAudio, DiffusionCode
InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following2023arXivRefinement prior, instrucitonal tuningCode
Learning to Follow Object-Centric Image Editing Instructions Faithfully2023EMNLPDiffusion, additional supervisionCode
StableVideo: Text-driven Consistency-aware Diffusion Video Editing2023ICCVDiffusion, VideoCode
Vox-E: Text-Guided Voxel Editing of 3D Objects2023ICCVDiffusion, 3DCode
Unitune: Text-driven image editing by fine tuning a diffusion model on a single image2023TOGDiffusion, fine-tuningCode
Dreamix: Video Diffusion Models are General Video Editors2023arXivCascaded diffusion, videoCode
Dialogpaint: A dialog-based image editing model2023arXivDialog-based
iEdit: Localised Text-guided Image Editing with Weak Supervision2023arXivLocalized diffusion
ImageBrush: Learning Visual In-Context Instructions for Exemplar-Based Image Manipulation2023NeurIPSExample-based instruction
NULL-Text Inversion for Editing Real Images Using Guided Diffusion Models2023CVPRnull-tex embedding, Diffusion, CLIPCode
Imagic: Text-based real image editing with diffusion models2023CVPRDiffusion, embedding interpolationCode
PhotoVerse: Tuning-Free Image Customization with Text-to-Image Diffusion Models2023arXivDiffusion, dual-branch conceptCode
InstructEdit: Improving Automatic Masks for Diffusion-based Image Editing With User Instructions2023arXivDiffusion, LLM-poweredCode
Instructdiffusion: A generalist modeling interface for vision tasks2023arXivMulti-task, multi-turn, Diffusion, LLMCode
Emu Edit: Precise Image Editing via Recognition and Generation Tasks2023arXivDiffusion, multi-task, multi-turnCode
SmartEdit: Exploring Complex Instruction-based Image Editing with Multimodal Large Language Models2023arXivMLLM, DiffusionCode
ChatFace: Chat-Guided Real Face Editing via Diffusion Latent Space Manipulation2023arXivLLM, DiffusionCode
Prompt-to-Prompt Image Editing with Cross Attention Control2023ICLRDiffusion, Cross AttentionCode
Target-Free Text-Guided Image Manipulation2023AAAI3D EditingCode
Paint by example: Exemplar-based image editing with diffusion models2023CVPRDiffusion, example-basedCode
De-net: Dynamic text-guided image editing adversarial networks2023AAAIGAN, multi-taskCode
Imagen editor and editbench: Advancing and evaluating text-guided image inpainting2023CVPRDiffusion, benchmark, CLIPCode
Plug-and-Play Diffusion Features for Text-Driven Image-to-Image Translation2023CVPRDiffusion, feature injectionCode
MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and Editing2023ICCVDiffusion, mutual self-attentionCode
LIME: Localized Image Editing via Attention Regularization in Diffusion Models2023arXivLocalized image editing
LDEdit: Towards Generalized Text Guided Image Manipulation via Latent Diffusion Models2022BMVClatent diffusion
StyleMC: Multi-Channel Based Fast Text-Guided Image Generation and Manipulation2022WACVGAN, CLIPCode
Blended Diffusion for Text-Driven Editing of Natural Images2022CVPRDiffusion, CLIP, BlendCode
VQGAN-CLIP: Open Domain Image Generation and Editing with Natural Language Guidance2022ECCVGAN, CLIPCode
StyleGAN-NADA: CLIP-guided domain adaptation of image generators2022TOGGAN, CLIPCode
DiffusionCLIP: Text-Guided Diffusion Models for Robust Image Manipulation2022CVPRDiffusion, CLIP, Noise combinationCode
GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models2022ICMLDiffusion, CLIP, Classifier-free guidanceCode
DiffEdit: Diffusion-based semantic image editing with mask guidance2022ICLRDiffusion, DDIM, Mask generationCode
Text2mesh: Text-driven neural stylization for meshes2022CVPR3D EditingCode
Manitrans: Entity-level text-guided image manipulation via token-wise semantic alignment and generation2022CVPRGAN, multi-entitiesCode
Text2live: Text-driven layered image and video editing2022ECCVGAN, CLIP, Video editingCode
SPEECHPAINTER: TEXT-CONDITIONED SPEECH INPAINTING2022InterspeechSpeech editingCode
Talk-to-Edit: Fine-Grained Facial Editing via Dialog2021ICCVGAN, dialog, semantic fieldCode
Manigan: Text-guided image manipulation2020CVPRGAN, affine combinationCode
SSCR: Iterative Language-Based Image Editing via Self-Supervised Counterfactual Reasoning2020EMNLPGAN, Cross-task consistencyCode
Open-Edit: Open-Domain Image Manipulation with Open-Vocabulary Instructions2020ECCVGANCode
Sequential Attention GAN for Interactive Image Editing2020MMGAN, Dialog, Sequential Attention
Lightweight generative adversarial networks for text-guided image manipulation2020NeurIPSLight-weight GANCode
Tell, Draw, and Repeat: Generating and Modifying Images Based on Continual Linguistic Instruction2019ICCVGANCode
Language-Based Image Editing With Recurrent Attentive Models2018CVPRGAN, Recurrent AttentionCode
Text-Adaptive Generative Adversarial Networks: Manipulating Images with Natural Language2018NeurIPSGAN, simpleCode

Approaches for Media Editing

TitleYearVenueCategoryCode
Dreamcrafter: Immersive Editing of 3D Radiance Fields Through Flexible, Generative Inputs and Outputs2025CHI3D Radiance Field editingProject
SVG-Head: Hybrid Surface-Volumetric Gaussians for High-Fidelity Head Reconstruction and Real-Time Editing2025ICCVhead reconstruction and real-time editingCode
IP-FaceDiff: Identity-Preserving Facial Video Editing with Diffusion2025WACV Workshopfacial video editing, diffusion, identity preservationCode
Edit as You See: Image-guided Video Editing via Masked Motion Modeling2025arXivimage-guided video editing
CAD-Editor: A Locate-then-Infill Framework with Automated Training Data Synthesis for Text-Based CAD Editing2025arXivText-Based CAD Editing
MRHaD: Mixed Reality-based Hand-Drawn Map Editing Interface for Mobile Robot Navigation2025arXivmixed reality map editing
ScanEdit: Hierarchically-Guided Functional 3D Scan Editing2025arXiv3D Scan Editing
Vidi: Large Multimodal Models for Video Understanding and Editing2025arXivvideo understanding and editing
Rethinking Score Distilling Sampling for 3D Editing and Generation2025arXiv3D editing and generation
BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing2025arXiv3D visual editing
EditIQ: Automated Cinematic Editing of Static Wide-Angle Videos via Dialogue Interpretation and Saliency Cues2025arXivAutomated cinematic editing
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing2025arXivmulti-grained video editing
VEU-Bench: Towards Comprehensive Understanding of Video Editing2025arXivvideo editing benchmark
Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence2025arXivpedestrian video editing
TexGS-VolVis: Expressive Scene Editing for Volume Visualization via Textured Gaussian Splatting2025arXivVolume Scene Editing
SGEdit: Bridging LLM with Text2Image Generative Model for Scene Graph-based Image Editing2024SIGGRAPH AsiaDiffusion, scene graph, image-editingCode
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition2024arXivText-to-Audio, Multimodal
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework2024arXivDiffusion-based text-to-audioCode
Enabling Local Editing in Diffusion Models by Joint and Individual Component Analysis2024BMVCDiffusion-based local image manipulationCode
Steer-by-prior Editing of Symbolic Music Loops2024MMLMasked Language Modelling, music instrumentsCode
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning2024ISMIRDiffusion-based text-to-audioCode
GroupDiff: Diffusion-based Group Portrait Editing2024ECCVDiffusion-based image editingCode
RegionDrag: Fast Region-Based Image Editing with Diffusion Models2024ECCVDiffusion-based image editingCode
SyncNoise: Geometrically Consistent Noise Prediction for Text-based 3D Scene Editing2024arXivMulti-view consistency
DreamCatalyst: Fast and High-Quality 3D Editing via Controlling Editability and Identity Preservation2024arXivDiffusion-based editingCode
MEDIC: Zero-shot Music Editing with Disentangled Inversion Control2024arXivAudio editing
3DEgo: 3D Editing on the Go!2024ECCVMonocular 3D Scene SynthesisCode
MedEdit: Counterfactual Diffusion-based Image Editing on Brain MRI2024SASHIMIBiomedical editing
FlexiEdit: Frequency-Aware Latent Refinement for Enhanced Non-Rigid Editing2024ECCVImage editing
LEMON: Localized Editing with Mesh Optimization and Neural Shaders2024arXivMesh editing
Diffusion Brush: A Latent Diffusion Model-based Editing Tool for AI-generated Images2024arXivImage editing
Streamlining Image Editing with Layered Diffusion Brushes2024arXivImage editing
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing2024arXivImage Editing DatasetCode
Environment Maps Editing using Inverse Rendering and Adversarial Implicit Functions2024arXivInverse rendering, HDR editing
HairDiffusion: Vivid Multi-Colored Hair Editing via Latent Diffusion2024arXivHair editing, Diffusion models
DiffuMask-Editor: A Novel Paradigm of Integration Between the Segmentation Diffusion Model and Image Editing to Improve Segmentation Ability2024arXivSynthetic Data Generation
Taming Rectified Flow for Inversion and Editing2024arXivImage InversionCode
Pathways on the Image Manifold: Image Editing via Video Generation2024arXivvideo-based editing, Frame2Frame, Temporal Editing Caption
PrEditor3D: Fast and Precise 3D Shape Editing2024arXiv3D shape editing
Diffusion-Based Attention Warping for Consistent 3D Scene Editing2024arXiv3D scene editing
MIVE: New Design and Benchmark for Multi-Instance Video Editing2024arXivMulti-Instance Video Editing
DriveEditor: A Unified 3D Information-Guided Framework for Controllable Object Editing in Driving Scenes2024arXiv3D object editing
MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation2024arXivMulti-Attribute Video Editing
EditSplat: Multi-View Fusion and Attention-Guided Optimization for View-Consistent 3D Scene Editing with 3D Gaussian Splatting2024arXiv3D scene editing

Datasets

Type: General

Dataset#Items#Papers UsedLink
DIM14M+1Link
Reason-Edit12.4M+1Link
MagicBrush10K1Link
InstructPix2Pix500K1Link
ICE-Bench6.5K1Link
GalaxyEdit800K1Link
EditBench2401Link

Type: Image Captioning

Type: ClipArt

Dataset#Items#Papers UsedLink
CoDraw58K+1Link

Type: VQA

Dataset#Items#Papers UsedLink
i-CLEVR70K+1Link

Type: Semantic Segmentation

Dataset#Items#Papers UsedLink
ADE20K27K+1Link

Type: Object Classification

Dataset#Items#Papers UsedLink
Oxford-III-Pets7K+1Link

Type: Depth Estimation

Dataset#Items#Papers UsedLink
NYUv2408K+1Link

Type: Aesthetic-Based Editing

Dataset#Items#Papers UsedLink
Laion-Aesthetics V22.4B+1Link

Type: Dialog-Based Editing

Dataset#Items#Papers UsedLink
CelebA-Dialog202K+1Link
Flickr-Faces-HQ70K2Link

Evaluation Metrics

TitleYearVenueCategoryCode
SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing2025WACV Workshopvideo editing evaluation metricsCode
CategoryEvaluation MetricsFormulaUsage
Perceptual QualityLearned Perceptual Image Patch Similarity (LPIPS)$\text{LPIPS}(x, x') = \sum_l ||\phi_l(x) - \phi_l(x')||^2$Measures perceptual similarity between images, with lower scores indicating higher similarity.
Structural Similarity Index (SSIM)$\text{SSIM}(x, x') = \frac{(2\mu_x\mu_{x'} + C_1)(2\sigma_{xx'} + C_2)}{(\mu_x^2 + \mu_{x'}^2 + C_1)(\sigma_x^2 + \sigma_{x'}^2 + C_2)}$Measures visual similarity based on luminance, contrast, and structure.
FrΓ©chet Inception Distance (FID)$\text{FID} = ||\mu_r - \mu_g||^2 + \text{Tr}(\Sigma_r + \Sigma_g - 2(\Sigma_r \Sigma_g)^{1/2})$Measures the distance between the real and generated image feature distributions.
Inception Score (IS)$\text{IS} = \exp(E_x D_{KL}(p(y|x) || p(y)))$Evaluates image quality and diversity based on label distribution consistency.
Structural IntegrityPeak Signal-to-Noise Ratio (PSNR)$\text{PSNR} = 10 \log_{10} \left( \frac{\text{MAX}^2}{\text{MSE}} \right)$Measures image quality based on pixel-wise errors, with higher values indicating better quality.
Mean Intersection over Union (mIoU)$\text{mIoU} = \frac{1}{N} \sum_{i=1}^{N} \frac{|A_i \cap B_i|}{|A_i \cup B_i|}$Assesses segmentation accuracy by comparing predicted and ground truth masks.
Mask Accuracy$\text{Accuracy} = \frac{\text{TP} + \text{TN}}{\text{TP} + \text{FP} + \text{FN} + \text{TN}}$Evaluates the accuracy of generated masks.
Boundary Adherence$\text{BA} = \frac{|B_{\text{edit}} \cap B_{\text{target}}|}{|B_{\text{target}}|}$Measures how well edits preserve object boundaries.
Semantic AlignmentEdit Consistency$\text{EC} = \frac{1}{N} \sum_{i=1}^{N} 1{E_i = E_{\text{ref}}}$Measures the consistency of edits across similar prompts.
Target Grounding Accuracy$\text{TGA} = \frac{\text{Correct Targets}}{\text{Total Targets}}$Evaluates how well edits align with specified targets in the prompt.
Embedding Space Similarity$\text{CosSim}(v_x, v_{x'}) = \frac{v_x \cdot v_{x'}}{||v_x|| , ||v_{x'}||}$Measures similarity between the edited and reference images in feature space.
Decomposed Requirements Following Ratio (DRFR)$\text{DRFR} = \frac{1}{N} \sum_{i=1}^{N} \frac{\text{Requirements Followed}}{\text{Total Requirements}}$Assesses how closely the model follows decomposed instructions.
User-Based MetricsUser Study RatingsCaptures user feedback through ratings of image quality.
Human Visual Turing Test (HVTT)$\text{HVTT} = \frac{\text{Real Judgements}}{\text{Total Judgements}}$Measures the ability of users to distinguish between real and generated images.
Click-through Rate (CTR)$\text{CTR} = \frac{\text{Clicks}}{\text{Total Impressions}}$Tracks user engagement by measuring image clicks.
Diversity and FidelityEdit Diversity$\text{Diversity} = \frac{1}{N} \sum_{i=1}^{N} D_{KL}(p_i || p_{\text{mean}})$Measures the variability of generated images.
GAN Discriminator Score$\text{GDS} = \frac{1}{N} \sum_{i=1}^N D_{\text{GAN}}(x_i)$Assesses the authenticity of generated images using a GAN discriminator.
Reconstruction Error$\text{RE} = ||x - \hat{x}||$Measures the error between the original and generated images.
Edit Success Rate$\text{ESR} = \frac{\text{Successful Edits}}{\text{Total Edits}}$Quantifies the success of applied edits.
Consistency and CohesionScene Consistency$\text{SC} = \frac{1}{N} \sum_{i=1}^{N} \text{Sim}(I_{\text{edit}}, I_{\text{orig}})$Measures how edits maintain overall scene structure.
Color Consistency$\text{CC} = \frac{1}{N} \sum_{i=1}^{N} \frac{|C_{\text{edit}} \cap C_{\text{orig}}|}{|C_{\text{orig}}|}$Measures color preservation between edited and original regions.
Shape Consistency$\text{ShapeSim} = \frac{1}{N} \sum_{i=1}^{N} \text{IoU}(S_{\text{edit}}, S_{\text{orig}})$Quantifies how well shapes are preserved during edits.
Pose Matching Score$\text{PMS} = \frac{1}{N} \sum_{i=1}^{N} \text{Sim}(\theta_{\text{edit}}, \theta_{\text{orig}})$Assesses pose consistency between original and edited images.
RobustnessNoise Robustness$\text{NR} = \frac{1}{N} \sum_{i=1}^{N} ||x_i - x_{i,\text{noisy}}||$Evaluates model robustness to noise.
Perceptual Quality$\text{PQ} = \frac{1}{N} \sum_{i=1}^{N} \text{Score}(x_i)$A subjective quality metric based on human judgment.

Benchmark Results

Benchmark DatasetCLIP↑FID↓LPIPS↓PSNR↑MSEΓ—104↓SSIM/SSIM-M (edit)↑
Reason-EditSwiftEdit (68.52%)
FramePainter (67.21%)
EmuEdit (63.14%)
MasaCtrl (98.71%)
DiffEdit (115.32%)
Fairy (150.22%)
EmuEdit (1.21%)
StyleCLIP (1.45%)
InstructPix2Pix (9.80%)
GLIDE (25.53%)
SwiftEdit (23.81%)
Video-P2P (20.09%)
GANTASTIC (65.4%)
GLIDE (80.1%)
DiffEdit (160.9%)
Fairy (83.14%)
MasaCtrl (81.55%)
FramePainter (75.21%)
MagicBrushGLIDE (26.51%)
StyleCLIP (25.83%)
TediGAN (24.92%)
SwiftEdit (21.49%)
InstructPix2Pix (42.15%)
DiffEdit (152.01%)
FramePainter (0.35%)
GANTASTIC (0.41%)
FramePainter (48.23%)
MasaCtrl (29.81%)
Fairy (29.14%)
EmuEdit (23.11%)
TediGAN (6.01%)
MasaCtrl (25.5%)
StyleCLIP (33.0%)
DiffEdit (87.23%)
SwiftEdit (86.52%)
InstructPix2Pix (81.11%)
EditBenchInstructPix2Pix (78.21%)
Video-P2P (77.10%)
GLIDE (75.03%)
TediGAN (6.92%)
SwiftEdit (7.07%)
EmuEdit (8.51%)
GLIDE (0.51%)
DiffEdit (0.53%)
FramePainter (0.61%)
MasaCtrl (26.83%)
InstructPix2Pix (26.17%)
SwiftEdit (25.12%)
Fairy (150.1%)
GANTASTIC (156.2%)
StyleCLIP (165.8%)
EmuEdit (87.51%)
TediGAN (86.20%)
Video-P2P (84.32%)
Flickr-Faces-HQDiffEdit (87.51%)
TediGAN (86.90%)
GLIDE (85.23%)
Video-P2P (17.53%)
SwiftEdit (18.10%)
StyleCLIP (19.82%)
MasaCtrl (0.070%)
FramePainter (0.073%)
GANTASTIC (0.081%)
GLIDE (20.14%)
DiffEdit (19.46%)
TediGAN (18.91%)
EmuEdit (230.1%)
Fairy (238.3%)
SwiftEdit (245.7%)
GANTASTIC (81.53%)
MasaCtrl (80.33%)
InstructPix2Pix (78.91%)
Fashion200kStyleCLIP (82.14%)
EmuEdit (81.59%)
FramePainter (80.41%)
SwiftEdit (150.11%)
Fairy (152.70%)
TediGAN (158.33%)
FramePainter (26.92%)
DiffEdit (27.50%)
Video-P2P (28.41%)
InstructPix2Pix (26.34%)
SwiftEdit (25.89%)
EmuEdit (25.11%)
Video-P2P (280.5%)
StyleCLIP (286.0%)
GLIDE (291.3%)
TediGAN (76.21%)
GANTASTIC (74.97%)
Fairy (73.84%)
ReferItEmuEdit (43.51%)
TediGAN (42.90%)
StyleCLIP (41.83%)
InstructPix2Pix (45.13%)
FramePainter (46.40%)
DiffEdit (48.91%)
StyleCLIP (0.090%)
GANTASTIC (0.095%)
SwiftEdit (0.105%)
Video-P2P (19.94%)
MasaCtrl (19.13%)
Fairy (18.51%)
DiffEdit (81.2%)
EmuEdit (84.0%)
TediGAN (89.6%)
SwiftEdit (83.41%)
InstructPix2Pix (82.11%)
GANTASTIC (80.92%)
Fashion-IQFramePainter (84.03%)
Video-P2P (83.10%)
GANTASTIC (82.51%)
GANTASTIC (68.24%)
TediGAN (69.60%)
StyleCLIP (72.43%)
MasaCtrl (9.81%)
InstructPix2Pix (10.03%)
Fairy (10.52%)
EmuEdit (21.52%)
FramePainter (20.99%)
TediGAN (20.31%)
Fairy (260.1%)
GLIDE (268.3%)
Video-P2P (275.4%)
StyleCLIP (83.04%)
MasaCtrl (82.26%)
DiffEdit (81.63%)
MIT-StatesGLIDE (43.12%)
EmuEdit (42.00%)
TediGAN (40.91%)
Fairy (128.91%)
FramePainter (130.30%)
Video-P2P (135.62%)
SwiftEdit (0.170%)
DiffEdit (0.179%)
EmuEdit (0.191%)
InstructPix2Pix (20.24%)
StyleCLIP (19.83%)
Fairy (19.21%)
MasaCtrl (109.8%)
GLIDE (112.4%)
GANTASTIC (118.3%)
Video-P2P (87.12%)
SwiftEdit (86.40%)
DiffEdit (85.53%)
ADE20KFramePainter (60.23%)
MasaCtrl (59.50%)
Video-P2P (58.31%)
Video-P2P (8.11%)
GANTASTIC (8.30%)
InstructPix2Piz (9.13%)
TediGAN (39.82%)
DiffEdit (40.11%)
MasaCtrl (41.53%)
SwiftEdit (27.13%)
FramePainter (26.69%)
Fairy (26.04%)
StyleCLIP (68.5%)
EmuEdit (70.3%)
DiffEdit (74.8%)
InstructPix2Pix (75.92%)
TediGAN (74.80%)
GLIDE (73.54%)
DeepFashionTediGAN (42.51%)
Video-P2P (41.60%)
InstructPix2Pix (40.73%)
EmuEdit (174.31%)
SwiftEdit (176.10%)
Fairy (179.82%)
InstructPix2Pix (0.161%)
FramePainter (0.165%)
GANTASTIC (0.172%)
GANTASTIC (18.52%)
TediGAN (18.00%)
GLIDE (17.61%)
Fairy (265.4%)
MasaCtrl (270.0%)
Video-P2P (276.9%)
MasaCtrl (82.53%)
DiffEdit (81.71%)
SwiftEdit (80.92%)

Notes:

  • Scaling caveats: iEdit reports CLIPScore (%) and SSIM-M (% on edited/background regions). PIE-Bench reports β€œCLIP Semantics” (whole/edited) as un-normalized cosine-like scores (~20–26). LOCATEdit shows SSIM as Γ—10Β² and LPIPS unscaled (values ~39–42). Forgedit’s CLIPScore is cosine (0–1).
  • [a] RegionDrag reports LPIPSΓ—100; we divide by 100 (thus 9.9β†’0.099, 9.2β†’0.092).

Experiment Configuration

pip install --upgrade diffusers transformers accelerate safetensors torch torchvision
import torch, PIL.Image as Image
from diffusers import (
    StableDiffusionInstructPix2PixPipeline,
    StableDiffusionDiffEditPipeline,
    PaintByExamplePipeline,
    DDIMScheduler, DDIMInverseScheduler,
)

DEVICE = "cuda" if torch.cuda.is_available() else "cpu"

# 1) InstructPix2Pix β€” text-guided global/local edits
def run_ip2p(input_path, instruction, out_path="out_ip2p.png", steps=30):
    pipe = StableDiffusionInstructPix2PixPipeline.from_pretrained(
        "timbrooks/instruct-pix2pix", torch_dtype=torch.float16 if DEVICE=="cuda" else torch.float32
    ).to(DEVICE)
    image = Image.open(input_path).convert("RGB")
    result = pipe(prompt=instruction, image=image,
                  num_inference_steps=steps, guidance_scale=7.5, image_guidance_scale=1.5).images[0]
    result.save(out_path); return out_path

# 2) DiffEdit β€” automatic mask + latent inversion for targeted edits
def run_diffedit(input_path, source_prompt, target_prompt, out_path="out_diffedit.png", steps=50):
    init_img = Image.open(input_path).convert("RGB")
    pipe = StableDiffusionDiffEditPipeline.from_pretrained(
        "runwayml/stable-diffusion-v1-5",
        torch_dtype=torch.float16 if DEVICE=="cuda" else torch.float32
    ).to(DEVICE)
    pipe.scheduler = DDIMScheduler.from_config(pipe.scheduler.config)
    pipe.inverse_scheduler = DDIMInverseScheduler.from_config(pipe.scheduler.config)

    mask = pipe.generate_mask(image=init_img, source_prompt=source_prompt, target_prompt=target_prompt,
                              num_inference_steps=steps)[0]
    inv = pipe.invert(prompt=source_prompt, image=init_img, num_inference_steps=steps)
    edited = pipe(prompt=target_prompt, negative_prompt=source_prompt,
                  image=init_img, mask_image=mask, latents=inv.latents,
                  num_inference_steps=steps).images[0]
    edited.save(out_path); return out_path

# 3) Paint-by-Example β€” exemplar-guided local replacement
def run_pbe(input_path, mask_path, example_path, out_path="out_pbe.png", steps=50):
    pipe = PaintByExamplePipeline.from_pretrained(
        "Fantasy-Studio/Paint-by-Example",
        torch_dtype=torch.float16 if DEVICE=="cuda" else torch.float32
    ).to(DEVICE)
    image = Image.open(input_path).convert("RGB")
    mask  = Image.open(mask_path).convert("L")         # white = repaint
    ex    = Image.open(example_path).convert("RGB")
    edited = pipe(image=image, mask_image=mask, example_image=ex,
                  num_inference_steps=steps, guidance_scale=5.0).images[0]
    edited.save(out_path); return out_path

# Example usage (where input.jpg, fruit.jpg, etc. are your input data)
run_ip2p("input.jpg", "make the sky pink at sunset")
run_diffedit("fruit.jpg", "a bowl of apples", "a bowl of pears")
run_pbe("room.jpg", "room_mask.png", "new_chair.jpg")

Repo-based Configuration

Add-it (training-free insertion)

Click to open
git clone https://github.com/NVlabs/addit && cd addit
conda env create -f environment.yml && conda activate addit
# real image insertion:
python run_CLI_addit_real.py \
  --source_image "images/bed_dark_room.jpg" \
  --prompt_source "A photo of a bed in a dark room" \
  --prompt_target "A photo of a dog lying on a bed in a dark room" \
  --subject_token "dog"

FreeEdit (mask-free, reference-based)

Click to open
git clone https://github.com/hrz2000/FreeEdit && cd FreeEdit
pip install -r requirements.txt
# check README / demo notebook for single-command inference

Grounded-Instruct-Pix2Pix (auto target grounding)

Click to open
git clone https://github.com/arthur-71/Grounded-Instruct-Pix2Pix && cd Grounded-Instruct-Pix2Pix
pip install -r requirements.txt && python -m spacy download en_core_web_sm
# install GroundingDINO (per README), then open the provided notebook:
# jupyter notebook grounded-instruct-pix2pix.ipynb

RegionDrag (fast region edits/UI)

Click to open
git clone https://github.com/Visual-AI/RegionDrag && cd RegionDrag
pip install -r requirements.txt
# see UI_GUIDE.md for the GUI runner; a minimal script is included in the repo

ZONE (localized editing)

Click to open
git clone https://github.com/lsl001006/ZONE && cd ZONE
pip install -r requirements.txt
python demo.py --input your.jpg --prompt "make the mug red" --mask path/to/mask.png

D-Edit (freestyle mask-conditioned)

Click to open
git clone https://github.com/collovlab/d-edit && cd d-edit
pip install -r requirements.txt
python app.py --input your.jpg --mask mask.png --prompt "replace the sofa with a blue one"

Pix2Pix-Zero / On-the-Fly (training-free, edit direction)

Click to open
git clone https://github.com/pix2pixzero/pix2pix-zero && cd pix2pix-zero
pip install -r requirements.txt
# see README + HF demo link for quick usage

Eedit the synthetic images generated by Stable Diffusion with the following command.

python src/edit_synthetic.py \
    --results_folder "output/synth_editing" \
    --prompt_str "a high resolution painting of a cat in the style of van gogh" \
    --task "cat2dog"

Disclaimer

Feel free to contact us if you have any queries or exciting news. In addition, we welcome all researchers to contribute to this repository and further contribute to the knowledge of this field.

If you have some other related references, please feel free to create a Github issue with the paper information. We will glady update the repos according to your suggestions. (You can also create pull requests, but it might take some time for us to do the merge)


Backup Statistics

Hits HitCount

Visitor Count

Visitors

audio-editing
image-edit
image-editing
instructional-edit
instructional-editing
instruction-editing
instruction-following
instruction-guided
instruction-learning
instruction-tuning
media-editing
music-editing
text-guidance
text-guided
text-guided-image-editing
video-editing

Contributors

github-actions[bot]

1,976 commits

tamlhp

45 commits

phkhanhtrinh23

22 commits