ChunmingHe/awesome-multimodal-large-language-models-in-low-level-vision

73

39 commits

updated Jul 1, 2026

See the code

README

Awesome Multimodal Large Language Models In Low-level VisionAwesome

🔥A curated list of awesome Multimodal Large Language Models(MLLMs) & Vision-Language Models(VLMs) in low-level vision.🔥

Please feel free to offer your suggestions in the Issues and pull requests to add links.

[ Last updated at 2026/07/01 ]

Contents

Diffusion Models in Low-Level Vision: A Survey
Chunming He, Yuqi Shen, Chengyu Fang, Fengyang Xiao, Longxiang Tang, Yulun Zhang, Wangmeng Zuo, Zhenhua Guo, Xiu Li
TPAMI. [Paper]

Reti-Diff: Illumination Degradation Image Restoration with Retinex-based Latent Diffusion Model
Chunming He, Chengyu Fang, Yulun Zhang, Kai Li, Longxiang Tang, Chenyu You, Fengyang Xiao, Zhenhua Guo, Xiu Li
ICLR 2025, Spotlight. [Paper] [Github]
Jan. 2025

Awesome Papers

1. Direct VLM Adaptation for Low-Level Vision

1.1 Visual Encoder Adaptation: Handling Details

1.1.1 Resolution Scaling
1.1.2 Feature Fusion

1.2 Language Branch Adaptation: Bridging Modalities

1.2.1 Prompt Learning Strategies
1.2.2 Instruction Tuning for Restoration

1.3 Output Head Adaptation: From Tokens to Pixels

1.3.1 Tokenizer–Decoder Framework

1.4 Parameter-Efficient Fine-Tuning in Restoration

1.4.1 LoRA & Adapter Integration
1.4.2 Freezing Strategies

2. VLM as Auxiliary for Low-Level Vision

2.1 VLM as Semantic Provider: Text-Guided Restoration

2.1.1 Text-Conditioned Injection
TitleVenueDateCode
Star
TextIR: A Simple Framework for Text-based Editable Image Restoration
TVCG2023-02Github
Star
Pixel-Aware Stable Diffusion for Realistic Image Super-Resolution and Personalized Stylization
ECCV2023-08Github
Star
SeeSR: Towards Semantics-Aware Real-World Image Super-Resolution
CVPR2023-11Github
Star
Textual Prompt Guided Image Restoration
EAAI2023-12Github
Star
Low-light Image Enhancement via CLIP-Fourier Guided Wavelet Diffusion
TOMM2024-01Github
Star
Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration In the Wild
CVPR2024-01Github
Star
Image Fusion via Vision-Language Model
ICML2024-02Github
Star
Boosting Image Restoration via Priors from Pre-trained Models
CVPR2024-03Github
Star
MMGInpainting: Multi-Modality Guided Image Inpainting Based on Diffusion Models
TMM2024-03Github
Star
Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion
CVPR2024-03Github
Star
XPSR: Cross-modal Priors for Diffusion-based Image Super-Resolution
ECCV2024-03Github
Star
Photo-Realistic Image Restoration in the Wild with Controlled Vision-Language Models
CVPRW2024-04Github
Unsupervised Image Prior via Prompt Learning and CLIP Semantic Guidance for Low-Light Image Enhancement
CVPRW2024-05-
Star
SSP-IR: Semantic and Structure Priors for Diffusion-based Realistic Image Restoration
TCSVT2024-07Github
Beyond Pixels: Text Enhances Generalization in Real-World Image Restoration
arXiv2024-12-
Star
CLIP-SR: Collaborative Linguistic and Image Processing for Super-Resolution
TMM2024-12Github
MGFusion: a multimodal large language model-guided information perception for infrared and visible image fusion
Front. Neurorobot.2024-12-
Star
Textual-Visual Interaction for Enhanced Single Image Deraining using Adapter-Tuned VLMs
arXiv2024-12Github
Star
Unified Image Restoration and Enhancement: Degradation Calibrated Cycle Reconstruction Diffusion Model
arXiv2024-12Github
Star
Multi-Text Guidance Is Important: Multi-Modality Image Fusion via Large Generative Vision-Language Model
IJCV2025-02Github
Star
MegaSR: Mining Customized Semantics and Expressive Guidance for Image Super-Resolution
arXiv2025-03Github
The Power of Context: How Multimodality Improves Image Super-Resolution
CVPR2025-03-
Coarse-to-fine text injecting for realistic image super-resolution
Neurocom2025-02-
Star
DeepSPG: Exploring Deep Semantic Prior Guidance for Low-light Image Enhancement with Multimodal Learning
arXiv2025-04Github
CTD-inpainting: Towards the Coherence of Text-driven Inpainting with Blended Diffusion
Information Fusion2025-04-
Star
Exploiting Diffusion Prior for Real-World Image Dehazing with Unpaired Training
AAAI2025-03Github
Star
A Preliminary Study for GPT-4o on Image Restoration
arXiv2025-05Github
Star
Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment
NeurIPS2025-05Github
Star
Text-Aware Image Restoration with Diffusion Models
arXiv2025-06Github
Star
LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling
ICCV2025-07Github
LLaVA-based semantic feature modulation diffusion model for underwater image enhancement
InfFus2025-07-
Star
Harnessing Diffusion-Yielded Score Priors for Image Restoration
SIGGRAPH Asia2025-07Github
Star
Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement
arXiv2025-07Github
Star
HVI-CIDNet+: Beyond Extreme Darkness for Low-Light Image Enhancement
arXiv2025-07Github
Star
ModalFormer: Multimodal Transformer for Low-Light Image Enhancement
arXiv2025-07Github
Star
AWM-Fuse: Multi-Modality Image Fusion for Adverse Weather via Global and Local Text Perception
arXiv2025-08Github
MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks
arXiv2025-08-
Star
LucidFlux: Caption-Free Universal Image Restoration via a Large-Scale Diffusion Transformer
arXiv2025-09Github
Vision-Language Model Guided Image Restoration
arXiv2025-12-
Zero-Shot Image Super-Resolution Using Prompt-Driven Vision-Language Foundation Models Without Task-Specific Fine-Tuning
arXiv2025-09-
Extreme Blind Image Restoration via Prompt-Conditioned Information Bottleneck
arXiv2025-10-
Star
A structural information-guided cross-modal method for damaged inscription inpainting via vision-language models
npj Heritage Science2025-09Github
GLYPH-SR: Can We Achieve Both High-Quality Image Super-Resolution and High-Fidelity Text Recovery via VLM-Guided Latent Diffusion Model?
arXiv2025-10-
Star
Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration
arXiv2025-12Github
SCENE: Semantic-aware Codec Enhancement with Neural Embeddings
ICASSP2026-01-
Star
DACESR: Degradation-Aware Conditional Embedding for Real-World Image Super-Resolution
TIP2026-02Github
QUSR: Quality-Aware and Uncertainty-Guided Image Super-Resolution Diffusion Model
ICASSP2026-03Github
Enhancing Single-Image Facial Demorphing using Multimodal Large Language Models
arXiv2026-05-
Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts
arXiv2026-05-
2.1.2 Language-Driven Manipulation
TitleVenueDateCode
Star
InstructPix2Pix: Learning to Follow Image Editing Instructions
CVPR2022-11Github
Star
StylerDALLE: Language-Guided Style Transfer Using a Vector-Quantized Tokenizer of a Large-Scale Generative Model
ICCV2023-03Github
Star
L-CAD: Language-based Colorization with Any-level Descriptions using Diffusion Priors
NeurIPS2023-05Github
Star
L-CoIns: Language-Based Colorization With Instance Awareness
CVPR2023-06Github
Star
DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior
ECCV2023-08Github
Star
LLMGA: Multimodal Large Language Model based Generation Assistant
ECCV2023-11Github
SPIRE: Semantic Prompt-Driven Image Restoration
ECCV2023-12-
Star
InstructIR: High-Quality Image Restoration Following Human Instructions
ECCV2024-01Github
Star
Text-guided Explorable Image Super-resolution
CVPR2024-03Github
Star
Paint by Inpaint: Learning to Add Image Objects by Removing Them First
CVPR2024-04Github
Brush2Prompt: Contextual Prompt Generator for Object Inpainting
CVPR2024-06-
Range-Null Latent Prior-guided Consistency Model for Low Light Image Enhancement
arXiv2024-09-
PainterNet: Adaptive Image Inpainting with Actual-Token Attention and Diverse Mask Control
arXiv2024-12-
Star
Instruct-CLIP: Improving Instruction-Guided Image Editing with Automated Data Refinement Using Contrastive Learning
CVPR2025-03Github
Instruct2See: Learning to Remove Any Obstructions Across Distributions
ICML2025-05Project
MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection
arXiv2025-05-
Star
Fidelity-Preserving Enhancement of Ptychography with Foundational Text-to-Image Models
arXiv2025-09Github
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
NeurIPS2025-06-
LaTo: Landmark-Tokenized Diffusion Transformer for Fine-Grained Human Face Editing
arXiv2025-09-
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
arXiv2025-09-
Star
Visual Autoregressive Modeling for Instruction-Guided Image Editing
arXiv2025-08Github
Star
Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing
arXiv2025-10Github
Star
Region in Context: Text-Conditioned Image Editing with Human-Like Semantic Reasoning
arXiv2025-10Github
UniSER: A Foundation Model for Unified Soft Effects Removal
arXiv2025-11-
Star
PhotoFramer: Multi-modal Image Composition Instruction
CVPR2025-11Github
Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
arXiv2025-12-
How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing
arXiv2026-02Github
MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance
AAAI2026-02-
EditCaption: Human-Aligned Instruction Synthesis for Image Editing via Supervised Fine-Tuning and Direct Preference Optimization
arXiv2026-04-
ScribbleEdit: Synthetic Data for Image Editing with Scribbles and Text
arXiv2026-05-
Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation
arXiv2026-06-
Star
SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing
arXiv2026-06Github
Star
TeleStyle V2: Beyond Content-Preserving Style Transfer with Self-Distillation and Distribution-Matching-Distillation
arXiv2026-06Github
When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing
arXiv2026-06-
2.1.3 Subject-Aware Restoration

2.2 VLM as Degradation Interpreter: Visual-Prompting & Context

2.2.1 Degradation Classification
TitleVenueDateCode
Exploring the Application of Large-Scale Pre-Trained Models on Adverse Weather Removal
TIP2023-06-
Star
LDP: Language-driven Dual-Pixel Image Defocus Deblurring Network
CVPR2023-07Github
Star
AutoDIR: Automatic All-in-One Image Restoration with Latent Diffusion
ECCV2023-10Github
Star
Unifying Image Processing as Visual Prompting Question Answering
ICML2023-10Github
Star
Controlling Vision-Language Models for Multi-Task Image Restoration
ICLR2024-02Github
Star
DaLPSR: Leverage Degradation-Aligned Language Prompt for Real-World Image Super-Resolution
arXiv2024-06Github
DAP-LED: Learning Degradation-Aware Priors with CLIP for Joint Low-light Enhancement and Deblurring
ICRA2024-09-
Multi-modal degradation feature learning for unified image restoration based on contrastive learning
Neurocomputing2024-11-
All-in-one Weather-degraded Image Restoration via Adaptive Degradation-aware Self-prompting Model
TMM2024-11-
AllRestorer: All-in-One Transformer for Image Restoration under Composite Degradations
arXiv2024-11-
LMHaze: Intensity-aware Image Dehazing with a Large-scale Multi-intensity Real Haze Dataset
MMAsia2024-12-
Star
Adaptive Fuzzy Degradation Perception Based on CLIP Prior for All-in-One Image Restoration
TFS2024-12Github
Star
Vision-Language Gradient Descent-driven All-in-One Deep Unfolding Networks
CVPR2025-03Github
DA2Diff: Exploring Degradation-aware Adaptive Diffusion Priors for All-in-One Weather Restoration
arXiv2025-04-
VL-UR: Vision-Language-guided Universal Restoration of Images Degraded by Adverse Weather Conditions
ICME2025-04-
Controlling vision-language model for enhancing image restoration
IVC2025-04-
CLIP-driven rain perception: Adaptive deraining with pattern-aware network routing and mask-guided cross-attention
PR2025-06-
Degradation-Aware Image Enhancement via Vision-Language Classification
arXiv2025-06-
Star
M2Restore: Mixture-of-Experts-based Mamba-CNN Fusion Framework for All-in-One Image Restoration
TIP2025-06Github
Real-world super-resolution with VLM-based degradation prior learning
Sci Rep2025-08-
Mixture of Ranks with Degradation-Aware Routing for One-Step Real-World Image Super-Resolution
arXiv2025-11-
Star
Zero-Reference Joint Low-Light Enhancement and Deblurring via Visual Autoregressive Modeling with VLM-Derived Modulation
AAAI2025-11Github
CLIP-Guided Unsupervised Semantic-Aware Exposure Correction
ICASSP2026-01-
Detecting Deepfakes with Multivariate Soft Blending and CLIP-based Image-Text Alignment
arXiv2026-02-
Star
TextShield-R1: Reinforced Reasoning for Tampered Text Detection
AAAI2026-02Github
Understanding Degradation with Vision Language Model
arXiv2026-02-
Generalizable Detection of AI Generated Images with Large Models and Fuzzy Decision Tree
arXiv2026-03-
DistortBench: Benchmarking Vision Language Models on Image Distortion Identification
arXiv2026-04-
2.2.2 Description-based Restoration
TitleVenueDateCode
Star
Image Super-Resolution with Text Prompt Diffusion
arXiv2023-11Github
Star
Language-driven All-in-one Adverse Weather Removal
CVPR2023-12Github
LLMRA: Multi-modal Large Language Model based Restoration Assistant
arXiv2024-01-
Star
Diff-Restorer: Unleashing Visual Prompts for Diffusion-based Universal Image Restoration
arXiv2024-07Github
Training-Free Large Model Priors for Multiple-in-One Image Restoration
arXiv2024-07-
Star
UniProcessor: A Text-induced Unified Low-level Image Processor
ECCV2024-07Github
Star
AWRaCLe: All-Weather Image Restoration using Visual In-Context Learning
AAAI2024-08Github
Star
DreamClear: High-Capacity Real-World Image Restoration with Privacy-Safe Dataset Curation
NeurIPS2024-10Github
Leveraging vision-language prompts for real-world image restoration and enhancement
CVIU2024-11-
Star
Leveraging Content and Context Cues for Low-Light Image Enhancement
TMM2024-12Github
RamIR: Reasoning and action prompting with Mamba for all-in-one image restoration
-2025-01-
Star
ControlFusion: A Controllable Image Fusion Network with Language-Vision Degradation Prompts
arXiv2025-03Github
Star
Prompt to Restore, Restore to Prompt: Cyclic Prompting for Universal Adverse Weather Removal
TIP2025-03Github
UniCoRN: Latent Diffusion-based Unified Controllable Image Restoration Network across Multiple Degradations
WACV2025-03Project
Star
CLIP-RestoreX: Restore Image Structure and Perception in Exposure Correction
AAAI2025-04Github
Star
Dual Prompting Image Restoration with Diffusion Transformers
CVPR2025-04Github
Star
A single image deraining algorithm guided by text generation based on depth information conditions
ASOC2025-07Github
Star
Adaptive multi-modal prompting for universal image restoration amidst diverse degradations
TVC2025-05Github
RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution
arXiv2025-08-
Dual-Domain Perspective on Degradation-Aware Fusion: A VLM-Guided Robust Infrared and Visible Image Fusion Framework
arXiv2025-09-
Real-world super-resolution with VLM-based degradation prior learning
Scientific Reports2025-08-
Star
Coupled Degradation Modeling and Fusion: A VLM-Guided Degradation-Coupled Network for Degradation-Aware Infrared and Visible Image Fusion
arXiv2025-10Github
Star
Coupled Degradation Modeling and Fusion: A VLM-Guided Degradation-Coupled Network for Degradation-Aware Infrared and Visible Image Fusion
arXiv2025-10Github
Star
MdaIF: Robust One-Stop Multi-Degradation-Aware Image Fusion with Language-Driven Semantics
AAAI2025-11Github
Star
Multimodal image fusion network with prior-guided dynamic degradation removal for extreme environment perception
Sci Rep2025-10Github
Nested Unfolding Network for Real-World Concealed Object Segmentation
arXiv2025-11-
VL-UR: Vision-Language-guided Universal Restoration of Images Degraded by Adverse Weather Conditions
arXiv2025-04-
VLM-Augmented Degradation Modeling for Image Restoration Under Adverse Weather Conditions
arXiv2025-11-

2.3 VLM as Quality Evaluator: Perception and Assessment

2.3.1 No-Reference Quality Assessment
TitleVenueDateCode
Star
Exploring CLIP for Assessing the Look and Feel of Images
AAAI2022-07Github
Star
Blind Image Quality Assessment via Vision-Language Correspondence: A Multitask Learning Perspective
CVPR2023-03Github
Star
VILA: Learning Image Aesthetics from User Comments with Vision-Language Pretraining
CVPR2023-03Github
Star
DegAE: A New Pretraining Paradigm for Low-Level Vision
CVPR2023-06Github
Star
Depicting Beyond Scores: Advancing Image Quality Assessment through Multi-modal Language Models
ECCV2023-12Github
Star
Quality-Aware Image-Text Alignment for Opinion-Unaware Image Quality Assessment (QualiCLIP)
arXiv2024-03Github
Star
Descriptive Image Quality Assessment in the Wild
arXiv2024-05Github
Star
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
arXiv2024-06Github
Star
CLIP-AGIQA: Boosting the Performance of AI-Generated Image Quality Assessment with CLIP
ICPR2024-08Github
Star
Dog-IQA: Standard-guided Zero-shot MLLM for Mix-grained Image Quality Assessment
arXiv2024-10Github
Star
Large Language Models for Lossless Image Compression: Next-Pixel Prediction in Language Space is All You Need
NeurIPS2024-11Github
Star
Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
AAAI2024-11Github
Star
Low-Light Image Enhancement via Generative Perceptual Priors
AAAI2024-12Github
Star
Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution
CVPR2025-01Github
Star
CLIP-DQA: Blindly Evaluating Dehazed Images from Global and Local Perspectives Using CLIP
ISCAS2025-02Github
DVLTA-VQA: Decoupled Vision-Language Modeling with Text-Guided Adaptation for Blind Video Quality Assessment
arXiv2025-04-
Star
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
arXiv2025-04Github
Star
Perceive-IR: Learning to Perceive Degradation Better for All-in-One Image Restoration
TIP2024-08Github
Star
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
arXiv2025-05Github
Star
ImgEdit: A Unified Image Editing Dataset and Benchmark
NeurIPS2025-05Github
Star
What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models
ICCV2025-05Github
BPCLIP: A Bottom-up Image Quality Assessment from Distortion to Semantics Based on CLIP
ICME2025-06-
Star
Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment
arXiv2025-06Github
Leveraging Vision-Language Models to Select Trustworthy Super-Resolution Samples Generated by Diffusion Models
TCSVT2025-06-
VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning
arXiv2025-06-
DehazeMamba: large multi-modal model guided single image dehazing via mamba
VisIntell2025-07-
Hallucination Score: Towards Mitigating Hallucinations in Generative Image Super-Resolution
arXiv2025-07-
Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation
arXiv2025-08-
Star
Fine-grained Image Quality Assessment for Perceptual Image Restoration
AAAI2025-08Github
Star
Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
AAAI2025-08Github
Segmenting and Understanding: Region-aware Semantic Attention for Fine-grained Image Quality Assessment with Large Language Models
arXiv2025-08-
AgenticIQA: An Agentic Framework for Adaptive and Interpretable Image Quality Assessment
arXiv2025-09-
Star
Describe-to-Score: Text-Guided Efficient Image Complexity Assessment
arXiv2025-09Github
Star
Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA
arXiv2025-09Github
Revisiting Vision–Language Foundations for No-Reference Image Quality Assessment
WACV2025-09-
Star
From Filters to VLMs: Benchmarking Defogging Methods through Object Detection and Segmentation Performance
arXiv2025-10Github
Star
Revisiting MLLM Based Image Quality Assessment: Errors and Remedy
AAAI2025-11Github
Star
ClearAIR: A Human-Visual-Perception-Inspired All-in-One Image Restoration
AAAI2026-01Github
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
arXiv2026-01-
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
arXiv2026-01Github
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
arXiv2026-01-
Star
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
arXiv2026-01Github
Q-Hawkeye: Reliable Visual Policy Optimization for Image Quality Assessment
arXiv2026-01-
ELIQ: A Label-Free Framework for Quality Assessment of Evolving AI-Generated Images
arXiv2026-02-
Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis
arXiv2026-02Github
Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues
arXiv2026-02Github
Star
CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions
arXiv2026-03Github
Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach
arXiv2026-03-
ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking
arXiv2026-03-
Q-Tacit: Image Quality Assessment via Latent Visual Reasoning
arXiv2026-03Github
R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessment
CVPR2026-03Github
Vision-Language Models vs Human: Perceptual Image Quality Assessment
arXiv2026-03-
Star
EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment
TPAMI2026-04Github
Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
arXiv2026-04-
Star
NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)
CVPRW2026-04Github
Redefining Quality Criteria and Distance-Aware Score Modeling for Image Editing Assessment
arXiv2026-04-
Star
UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs
arXiv2026-04Github
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
arXiv2026-05-
Star
Employing Vision-Language Models for Face Image Quality Assessment
FG2026-05Github
Star
UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs
arXiv2026-04Github
DAL-PCQA: Enabling Distortion-Level and Language-Driven Reasoning for Point Cloud Quality Assessment
arXiv2026-06Github
Star
Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment
arXiv2026-06Github
Star
LEIQ-Assessor: Multi-dimensional Quality Assessment of Low-light Enhanced Images via Multi-task Learning
arXiv2026-06Github
Star
LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models
arXiv2026-06Github
Star
Tool-IQA: Augmenting Image Quality Assessment with Simple Tools
arXiv2026-06Github
2.3.2 Semantic Consistency Loss
2.3.3 Feedback Loops
TitleVenueDateCode
Star
HazeCLIP: Towards Language Guided Real-World Image Dehazing
ICASSP2024-07Github
Star
Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models
ECCV2024-09Github
DSPO: Direct Semantic Preference Optimization for Real-World Image Super-Resolution
arXiv2025-04-
Star
SnowMaster: Comprehensive Real-world Image Desnowing via MLLM with Multi-Model Feedback Optimization
CVPR2025-06Github
Star
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
arXiv2025-09Github
Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
arXiv2025-09-
Learning an Image Editing Model without Image Editing Pairs
arXiv2025-10-
Star
Test-Time Preference Optimization for Image Restoration
AAAI2025-11Github
Star
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
arXiv2025-11Github
Star
UARE: Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
arXiv2025-12Github
Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning
arXiv2026-01-
Star
CoCoEdit: Content-Consistent Image Editing via Region Regularized Reinforcement Learning
IJCAI2026-02Github
Star
EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing
arXiv2026-03Github
HP-Edit: A Human-Preference Post-Training Framework for Image Editing
CVPR2026-04-
Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement
arXiv2026-04-
Star
GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration
arXiv2026-05Github
Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning
arXiv2026-05Project
Star
White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation
CVPR2026-05Github

2.4 VLM as Intelligent Controller: Agent-Based Frameworks

2.4.1 Motivation as Intelligent Controller
2.4.2 Tool Usage & Orchestration
TitleVenueDateCode
Star
LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing
arXiv2023-11Github
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
IJCAI2024-01-
Star
Image Inpainting Models are Effective Tools for Instruction-guided Image Editing
CVPRW2024-07Github
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
NeurIPS2024-07-
Star
VITRON: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
NeurIPS2024-10Github
LLMCO4MR: LLMs-Aided Neural Combinatorial Optimization for Ancient Manuscript Restoration from Fragments with Case Studies on Dunhuang
ECCV2024-11-
Star
I Dream My Painting: Connecting MLLMs and Diffusion Models via Prompt Generation for Text-Guided Multi-Mask Inpainting
WACV2024-11Github
Star
BrushEdit: All-In-One Image Inpainting and Editing
NeurIPS2024-12Github
Hybrid Agents for Image Restoration
arXiv2025-03-
Multi-Agent Image RestorationarXiv2025-03-
Star
JarvisIR: Elevating Autonomous Driving Perception with Intelligent Image Restoration
CVPR2025-04Github
Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model
arXiv2025-04-
Star
LEGO: LLM-enhanced genetic optimization for underwater robot image restoration
PR2025-05Github
Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models
arXiv2025-05-
Star
MonetGPT: Solving Puzzles Enhances MLLMs' Image Retouching Skills
TOG2025-05Github
PhotoArtAgent: Intelligent Photo Retouching with Language Model-Based Artist Agents
arXiv2025-05-
Star
JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent
NeurIPS2025-06Github
Star
EdiVal-Agent: An Object-Centric Framework for Automated, Scalable, Fine-Grained Evaluation of Multi-Turn Editing
arXiv2025-09Github
InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On
arXiv2025-09-
Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation
arXiv2025-09-
Star
MoA-VR: A Mixture-of-Agents System Towards All-in-One Video Restoration
JSTSP2025-10Github
Star
From Pixels to Paths: A Multi-Agent Framework for Editable Scientific Illustration
arXiv2025-10Github
Image-POSER: Reflective RL for Multi-Expert Image Generation and Editing
arXiv2025-11-
T2T-VICL: Unlocking the Boundaries of Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs
arXiv2025-11-
Star
RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
arXiv2025-12Github
ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization
arXiv2026-02Project
Interaction-Consistent Object Removal via MLLM-Based Reasoning
arXiv2026-02-
MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing
arXiv2026-03-
PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning
arXiv2026-03Project
TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration
arXiv2026-03-
Star
GenSmoke-GS: A Multi-Stage Method for Novel View Synthesis from Smoke-Degraded Images Using a Generative Model
CVPRW2026-04Github
DiTTo: Scalable Order-aware All-in-One Image Restoration Agent
arXiv2026-05Project
From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing
arXiv2026-05Project
Star
IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment
CVPR2026-06Github
Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution
arXiv2026-06-
2.4.3 Iterative Refinement

3. Extended Applications

3.1 Medical Image Processing

3.1.1 Biomedical VLMs
3.1.2 CT and MRI

3.2 Remote Sensing Data Processing

3.2.1 Spatial-domain Tasks
3.2.2 Spectral-domain Tasks

3.3 Other Extended Applications

3.3.1 CAD
3.3.2 Video Processing Tasks
3.3.3 3D Processing Tasks

Datasets

TaskDatasetSizeRepo / DownloadDescription
SRDIV2K900/100DownloadHigh-resolution natural images for super-resolution with synthetic degradations.
SRRealSR595RepoReal-captured paired low-resolution and high-resolution images using focal-length changes.
SRDRealSR2,507RepoReal-world super-resolution pairs collected across indoor and outdoor scenes.
LLIELOLv1585/15DownloadPaired low-light and normal-light real images for low-light enhancement.
LLIEMIT-Adobe FiveK25,000DownloadExpert-retouched photo pairs for illumination and tone related enhancement tasks.
LLIELOLv21,589/200RepoCombined real and synthetic paired data for low-light enhancement.
DehazeRESIDE13,000/990RepoDehazing benchmark including synthetic and real-world subsets.
DehazeNH-Haze55DownloadReal paired outdoor images with non-homogeneous haze.
DehazeHaze-4K4,000RepoSynthetic 4K dehazing pairs with auxiliary physical annotations.
InpaintingCelebA200,000DownloadLarge-scale face dataset used for face-centric restoration and inpainting.
InpaintingCelebA-HQ30,000RepoHigh-quality face images derived from CelebA for high-fidelity restoration.
Inpainting, DerainMSCOCO328,124DownloadLarge-scale natural images with segmentation annotations for generic restoration and editing.
DerainRain100H1,800/100DownloadSynthetic heavy-rain streak pairs for supervised deraining.
DerainRainDrop861/239RepoReal paired images with adherent raindrops for deraining and restoration.
DeblurGoPro2,103/1,111DownloadMotion blur benchmark synthesized from high-frame-rate video frames.
DeblurRealBlur3,758/980RepoReal paired short-exposure and long-exposure images for motion deblurring.
DeblurHIDE8,422RepoHuman-centered motion deblurring dataset with complex dynamic motion.
CT denoising2016 NIH-AAPM-Mayo5,936DownloadLow-dose CT dataset used for dose reduction and denoising research.
CT denoisingMayo-20164,800/1,136DownloadChallenge dataset used for low-dose CT denoising and reconstruction.
CT denoisingMayo-20202,400/580DownloadPreprocessed low-dose CT dataset for training and evaluation.

TitleVenueDateCodeNote
Star
Diffusion Models in Low-Level Vision: A Survey
TPAMI2024-06RepoDiffusion-based methods for low-level vision, including task formulations, architectures, and training design patterns.
Star
A Survey on All-in-One Image Restoration: Taxonomy, Methods, and Future Directions
arXiv2024-10RepoAll-in-one image restoration models covering multi-task, multi-degradation, unified training, and evaluation protocols.
Star
Instruction Guided Editing Controls for Images and Multimedia: A Survey in the Era of Large Language Models
arXiv2024-11RepoInstruction-driven image and multimedia editing, covering control types, model families, and evaluation for edit fidelity and consistency.
Star
Vision-Language Models for Vision Tasks: A Survey
TPAMI2023-04RepoVLM methodology for vision tasks, including pretraining, transfer learning, distillation, datasets, and benchmarks.
Star
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges
CVPRW2025-01RepoLVLM design and evaluation, focusing on alignment, benchmark suites, failure modes, and measurement practices.
Star
A Survey on Multimodal Large Language Models
NSR2023-06RepoCore MLLM architectures, training data, instruction tuning, evaluation, and common issues such as hallucination.
Vision Language Models: A Survey of 26K Papers
arXiv2025-10-Trend analysis and taxonomy at scale, summarizing research directions from a large paper collection.
Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions
arXiv2024-02-Broad overview of VLM model families, training paradigms, and benchmarks, with an emphasis on capabilities and limitations.
Vision Encoders in Vision-Language Models: A Survey
Tech Report2025-12-Vision encoder design choices for VLMs, including architecture families, scaling trends, and practical tradeoffs.

Other Awesome VLM Papers

TitleVenueDateCode
Star
MMAIF: Multi-task and Multi-degradation All-in-One for Image Fusion with Language Guidance
arXiv2025-03Github
Star
Adding Conditional Control to Text-to-Image Diffusion Models
ICCV2023-02Github
Star
GridFormer: Residual Dense Transformer with Grid Structure for Image Restoration in Adverse Weather Conditions
IJCV2023-05Github
Star
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
CVPR2023-11Github
Star
IMProv: Inpainting-based Multimodal Prompting for Computer Vision Tasks
TMLR2023-12Github
Star
Generative Multi-Modal Knowledge Retrieval with Large Language Models
AAAI2024-01Github
Star
CoLLaVO: Crayon Large Language and Vision mOdel
arXiv2024-02Github
Star
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
ACL2024-02Github
Star
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning
NeurIPSW2024-05Github
Star
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
NeurIPS2024-06Github
Star
Multi-Expert Adaptive Selection: Task-Balancing for All-in-One Image Restoration
arXiv2024-07Github
Star
Vision Language Models Are Blind: Failing to Translate Detailed Visual Features into Words
ACCV2024-07Github
Star
Learning A Low-Level Vision Generalist via Visual Task Prompt
ACM MM2024-08Github
Star
On Domain-Adaptive Post-Training for Multimodal Large Language Models
EMNLP2024-11Github
ForgeryGPT: Multimodal Large Language Model For Explainable Image Forgery Detection and Localization
arXiv2024-10-
Scene Text Detection in Foggy Weather Utilizing Knowledge Distillation of Diffusion Models
SPL2025-02-
Star
Generator-Assistant Stepwise Rollback Framework for Large Language Model Agent
arXiv2025-03Github
Why Compress What You Can Generate? When GPT-4o Generation Ushers in Image Compression Fields
ICCVW2025-04-
Star
OmniFuse: Composite Degradation-Robust Image Fusion with Language-Driven Semantics
TPAMI2025-05Github
Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model
arXiv2025-05-
Vision-Language Model Priors-Driven State Space Model for Infrared-Visible Image Fusion
SPL2025-06-
UniLDiff: Unlocking the Power of Diffusion Priors for All-in-One Image Restoration
arXiv2025-07-
Follow-Your-Instruction: A Comprehensive MLLM Agent for World Data Synthesis
arXiv2025-08-
Star
Dataset Distillation for Super-Resolution without Class Labels and Pre-trained Models
arXiv2025-09Github
Evaluating Robustness of Vision-Language Models Under Noisy Conditions
arXiv2025-09-
VLM-Guided Inpainting for Anomaly Detection
Journal of Multimedia Information System2025-09-
Clear Roads, Clear Vision: Advancements in Multi-Weather Restoration for Smart Transportation
arXiv2025-10Github
Star
Generative Image Restoration and Super-Resolution using Physics-Informed Synthetic Data for Scanning Tunneling Microscopy
arXiv2025-10Github
DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection
arXiv2025-11HuggingFace
FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model
ICASSP2026-02-
Universal Anti-forensics Attack against Image Forgery Detection via Multi-modal Guidance
arXiv2026-02-
Generalizable Detection of AI Generated Images with Large Models and Fuzzy Decision Tree
arXiv2026-03-
When Detectors Forget Forensics: Blocking Semantic Shortcuts for Generalizable AI-Generated Image Detection
arXiv2026-03-

Contributors

CodeRikka

19 commits

cookiebear-816

10 commits

ChunmingHe

5 commits

paopol

5 commits

ChunmingHe/awesome-multimodal-large-language-models-in-low-level-vision

73

39 commits

updated Jul 1, 2026

See the code

README

Awesome Multimodal Large Language Models In Low-level VisionAwesome

🔥A curated list of awesome Multimodal Large Language Models(MLLMs) & Vision-Language Models(VLMs) in low-level vision.🔥

Please feel free to offer your suggestions in the Issues and pull requests to add links.

[ Last updated at 2026/07/01 ]

Contents

Diffusion Models in Low-Level Vision: A Survey
Chunming He, Yuqi Shen, Chengyu Fang, Fengyang Xiao, Longxiang Tang, Yulun Zhang, Wangmeng Zuo, Zhenhua Guo, Xiu Li
TPAMI. [Paper]

Reti-Diff: Illumination Degradation Image Restoration with Retinex-based Latent Diffusion Model
Chunming He, Chengyu Fang, Yulun Zhang, Kai Li, Longxiang Tang, Chenyu You, Fengyang Xiao, Zhenhua Guo, Xiu Li
ICLR 2025, Spotlight. [Paper] [Github]
Jan. 2025

Awesome Papers

1. Direct VLM Adaptation for Low-Level Vision

1.1 Visual Encoder Adaptation: Handling Details

1.1.1 Resolution Scaling
1.1.2 Feature Fusion

1.2 Language Branch Adaptation: Bridging Modalities

1.2.1 Prompt Learning Strategies
1.2.2 Instruction Tuning for Restoration

1.3 Output Head Adaptation: From Tokens to Pixels

1.3.1 Tokenizer–Decoder Framework

1.4 Parameter-Efficient Fine-Tuning in Restoration

1.4.1 LoRA & Adapter Integration
1.4.2 Freezing Strategies

2. VLM as Auxiliary for Low-Level Vision

2.1 VLM as Semantic Provider: Text-Guided Restoration

2.1.1 Text-Conditioned Injection
TitleVenueDateCode
Star
TextIR: A Simple Framework for Text-based Editable Image Restoration
TVCG2023-02Github
Star
Pixel-Aware Stable Diffusion for Realistic Image Super-Resolution and Personalized Stylization
ECCV2023-08Github
Star
SeeSR: Towards Semantics-Aware Real-World Image Super-Resolution
CVPR2023-11Github
Star
Textual Prompt Guided Image Restoration
EAAI2023-12Github
Star
Low-light Image Enhancement via CLIP-Fourier Guided Wavelet Diffusion
TOMM2024-01Github
Star
Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration In the Wild
CVPR2024-01Github
Star
Image Fusion via Vision-Language Model
ICML2024-02Github
Star
Boosting Image Restoration via Priors from Pre-trained Models
CVPR2024-03Github
Star
MMGInpainting: Multi-Modality Guided Image Inpainting Based on Diffusion Models
TMM2024-03Github
Star
Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion
CVPR2024-03Github
Star
XPSR: Cross-modal Priors for Diffusion-based Image Super-Resolution
ECCV2024-03Github
Star
Photo-Realistic Image Restoration in the Wild with Controlled Vision-Language Models
CVPRW2024-04Github
Unsupervised Image Prior via Prompt Learning and CLIP Semantic Guidance for Low-Light Image Enhancement
CVPRW2024-05-
Star
SSP-IR: Semantic and Structure Priors for Diffusion-based Realistic Image Restoration
TCSVT2024-07Github
Beyond Pixels: Text Enhances Generalization in Real-World Image Restoration
arXiv2024-12-
Star
CLIP-SR: Collaborative Linguistic and Image Processing for Super-Resolution
TMM2024-12Github
MGFusion: a multimodal large language model-guided information perception for infrared and visible image fusion
Front. Neurorobot.2024-12-
Star
Textual-Visual Interaction for Enhanced Single Image Deraining using Adapter-Tuned VLMs
arXiv2024-12Github
Star
Unified Image Restoration and Enhancement: Degradation Calibrated Cycle Reconstruction Diffusion Model
arXiv2024-12Github
Star
Multi-Text Guidance Is Important: Multi-Modality Image Fusion via Large Generative Vision-Language Model
IJCV2025-02Github
Star
MegaSR: Mining Customized Semantics and Expressive Guidance for Image Super-Resolution
arXiv2025-03Github
The Power of Context: How Multimodality Improves Image Super-Resolution
CVPR2025-03-
Coarse-to-fine text injecting for realistic image super-resolution
Neurocom2025-02-
Star
DeepSPG: Exploring Deep Semantic Prior Guidance for Low-light Image Enhancement with Multimodal Learning
arXiv2025-04Github
CTD-inpainting: Towards the Coherence of Text-driven Inpainting with Blended Diffusion
Information Fusion2025-04-
Star
Exploiting Diffusion Prior for Real-World Image Dehazing with Unpaired Training
AAAI2025-03Github
Star
A Preliminary Study for GPT-4o on Image Restoration
arXiv2025-05Github
Star
Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment
NeurIPS2025-05Github
Star
Text-Aware Image Restoration with Diffusion Models
arXiv2025-06Github
Star
LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling
ICCV2025-07Github
LLaVA-based semantic feature modulation diffusion model for underwater image enhancement
InfFus2025-07-
Star
Harnessing Diffusion-Yielded Score Priors for Image Restoration
SIGGRAPH Asia2025-07Github
Star
Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement
arXiv2025-07Github
Star
HVI-CIDNet+: Beyond Extreme Darkness for Low-Light Image Enhancement
arXiv2025-07Github
Star
ModalFormer: Multimodal Transformer for Low-Light Image Enhancement
arXiv2025-07Github
Star
AWM-Fuse: Multi-Modality Image Fusion for Adverse Weather via Global and Local Text Perception
arXiv2025-08Github
MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks
arXiv2025-08-
Star
LucidFlux: Caption-Free Universal Image Restoration via a Large-Scale Diffusion Transformer
arXiv2025-09Github
Vision-Language Model Guided Image Restoration
arXiv2025-12-
Zero-Shot Image Super-Resolution Using Prompt-Driven Vision-Language Foundation Models Without Task-Specific Fine-Tuning
arXiv2025-09-
Extreme Blind Image Restoration via Prompt-Conditioned Information Bottleneck
arXiv2025-10-
Star
A structural information-guided cross-modal method for damaged inscription inpainting via vision-language models
npj Heritage Science2025-09Github
GLYPH-SR: Can We Achieve Both High-Quality Image Super-Resolution and High-Fidelity Text Recovery via VLM-Guided Latent Diffusion Model?
arXiv2025-10-
Star
Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration
arXiv2025-12Github
SCENE: Semantic-aware Codec Enhancement with Neural Embeddings
ICASSP2026-01-
Star
DACESR: Degradation-Aware Conditional Embedding for Real-World Image Super-Resolution
TIP2026-02Github
QUSR: Quality-Aware and Uncertainty-Guided Image Super-Resolution Diffusion Model
ICASSP2026-03Github
Enhancing Single-Image Facial Demorphing using Multimodal Large Language Models
arXiv2026-05-
Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts
arXiv2026-05-
2.1.2 Language-Driven Manipulation
TitleVenueDateCode
Star
InstructPix2Pix: Learning to Follow Image Editing Instructions
CVPR2022-11Github
Star
StylerDALLE: Language-Guided Style Transfer Using a Vector-Quantized Tokenizer of a Large-Scale Generative Model
ICCV2023-03Github
Star
L-CAD: Language-based Colorization with Any-level Descriptions using Diffusion Priors
NeurIPS2023-05Github
Star
L-CoIns: Language-Based Colorization With Instance Awareness
CVPR2023-06Github
Star
DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior
ECCV2023-08Github
Star
LLMGA: Multimodal Large Language Model based Generation Assistant
ECCV2023-11Github
SPIRE: Semantic Prompt-Driven Image Restoration
ECCV2023-12-
Star
InstructIR: High-Quality Image Restoration Following Human Instructions
ECCV2024-01Github
Star
Text-guided Explorable Image Super-resolution
CVPR2024-03Github
Star
Paint by Inpaint: Learning to Add Image Objects by Removing Them First
CVPR2024-04Github
Brush2Prompt: Contextual Prompt Generator for Object Inpainting
CVPR2024-06-
Range-Null Latent Prior-guided Consistency Model for Low Light Image Enhancement
arXiv2024-09-
PainterNet: Adaptive Image Inpainting with Actual-Token Attention and Diverse Mask Control
arXiv2024-12-
Star
Instruct-CLIP: Improving Instruction-Guided Image Editing with Automated Data Refinement Using Contrastive Learning
CVPR2025-03Github
Instruct2See: Learning to Remove Any Obstructions Across Distributions
ICML2025-05Project
MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection
arXiv2025-05-
Star
Fidelity-Preserving Enhancement of Ptychography with Foundational Text-to-Image Models
arXiv2025-09Github
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
NeurIPS2025-06-
LaTo: Landmark-Tokenized Diffusion Transformer for Fine-Grained Human Face Editing
arXiv2025-09-
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
arXiv2025-09-
Star
Visual Autoregressive Modeling for Instruction-Guided Image Editing
arXiv2025-08Github
Star
Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing
arXiv2025-10Github
Star
Region in Context: Text-Conditioned Image Editing with Human-Like Semantic Reasoning
arXiv2025-10Github
UniSER: A Foundation Model for Unified Soft Effects Removal
arXiv2025-11-
Star
PhotoFramer: Multi-modal Image Composition Instruction
CVPR2025-11Github
Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
arXiv2025-12-
How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing
arXiv2026-02Github
MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance
AAAI2026-02-
EditCaption: Human-Aligned Instruction Synthesis for Image Editing via Supervised Fine-Tuning and Direct Preference Optimization
arXiv2026-04-
ScribbleEdit: Synthetic Data for Image Editing with Scribbles and Text
arXiv2026-05-
Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation
arXiv2026-06-
Star
SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing
arXiv2026-06Github
Star
TeleStyle V2: Beyond Content-Preserving Style Transfer with Self-Distillation and Distribution-Matching-Distillation
arXiv2026-06Github
When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing
arXiv2026-06-
2.1.3 Subject-Aware Restoration

2.2 VLM as Degradation Interpreter: Visual-Prompting & Context

2.2.1 Degradation Classification
TitleVenueDateCode
Exploring the Application of Large-Scale Pre-Trained Models on Adverse Weather Removal
TIP2023-06-
Star
LDP: Language-driven Dual-Pixel Image Defocus Deblurring Network
CVPR2023-07Github
Star
AutoDIR: Automatic All-in-One Image Restoration with Latent Diffusion
ECCV2023-10Github
Star
Unifying Image Processing as Visual Prompting Question Answering
ICML2023-10Github
Star
Controlling Vision-Language Models for Multi-Task Image Restoration
ICLR2024-02Github
Star
DaLPSR: Leverage Degradation-Aligned Language Prompt for Real-World Image Super-Resolution
arXiv2024-06Github
DAP-LED: Learning Degradation-Aware Priors with CLIP for Joint Low-light Enhancement and Deblurring
ICRA2024-09-
Multi-modal degradation feature learning for unified image restoration based on contrastive learning
Neurocomputing2024-11-
All-in-one Weather-degraded Image Restoration via Adaptive Degradation-aware Self-prompting Model
TMM2024-11-
AllRestorer: All-in-One Transformer for Image Restoration under Composite Degradations
arXiv2024-11-
LMHaze: Intensity-aware Image Dehazing with a Large-scale Multi-intensity Real Haze Dataset
MMAsia2024-12-
Star
Adaptive Fuzzy Degradation Perception Based on CLIP Prior for All-in-One Image Restoration
TFS2024-12Github
Star
Vision-Language Gradient Descent-driven All-in-One Deep Unfolding Networks
CVPR2025-03Github
DA2Diff: Exploring Degradation-aware Adaptive Diffusion Priors for All-in-One Weather Restoration
arXiv2025-04-
VL-UR: Vision-Language-guided Universal Restoration of Images Degraded by Adverse Weather Conditions
ICME2025-04-
Controlling vision-language model for enhancing image restoration
IVC2025-04-
CLIP-driven rain perception: Adaptive deraining with pattern-aware network routing and mask-guided cross-attention
PR2025-06-
Degradation-Aware Image Enhancement via Vision-Language Classification
arXiv2025-06-
Star
M2Restore: Mixture-of-Experts-based Mamba-CNN Fusion Framework for All-in-One Image Restoration
TIP2025-06Github
Real-world super-resolution with VLM-based degradation prior learning
Sci Rep2025-08-
Mixture of Ranks with Degradation-Aware Routing for One-Step Real-World Image Super-Resolution
arXiv2025-11-
Star
Zero-Reference Joint Low-Light Enhancement and Deblurring via Visual Autoregressive Modeling with VLM-Derived Modulation
AAAI2025-11Github
CLIP-Guided Unsupervised Semantic-Aware Exposure Correction
ICASSP2026-01-
Detecting Deepfakes with Multivariate Soft Blending and CLIP-based Image-Text Alignment
arXiv2026-02-
Star
TextShield-R1: Reinforced Reasoning for Tampered Text Detection
AAAI2026-02Github
Understanding Degradation with Vision Language Model
arXiv2026-02-
Generalizable Detection of AI Generated Images with Large Models and Fuzzy Decision Tree
arXiv2026-03-
DistortBench: Benchmarking Vision Language Models on Image Distortion Identification
arXiv2026-04-
2.2.2 Description-based Restoration
TitleVenueDateCode
Star
Image Super-Resolution with Text Prompt Diffusion
arXiv2023-11Github
Star
Language-driven All-in-one Adverse Weather Removal
CVPR2023-12Github
LLMRA: Multi-modal Large Language Model based Restoration Assistant
arXiv2024-01-
Star
Diff-Restorer: Unleashing Visual Prompts for Diffusion-based Universal Image Restoration
arXiv2024-07Github
Training-Free Large Model Priors for Multiple-in-One Image Restoration
arXiv2024-07-
Star
UniProcessor: A Text-induced Unified Low-level Image Processor
ECCV2024-07Github
Star
AWRaCLe: All-Weather Image Restoration using Visual In-Context Learning
AAAI2024-08Github
Star
DreamClear: High-Capacity Real-World Image Restoration with Privacy-Safe Dataset Curation
NeurIPS2024-10Github
Leveraging vision-language prompts for real-world image restoration and enhancement
CVIU2024-11-
Star
Leveraging Content and Context Cues for Low-Light Image Enhancement
TMM2024-12Github
RamIR: Reasoning and action prompting with Mamba for all-in-one image restoration
-2025-01-
Star
ControlFusion: A Controllable Image Fusion Network with Language-Vision Degradation Prompts
arXiv2025-03Github
Star
Prompt to Restore, Restore to Prompt: Cyclic Prompting for Universal Adverse Weather Removal
TIP2025-03Github
UniCoRN: Latent Diffusion-based Unified Controllable Image Restoration Network across Multiple Degradations
WACV2025-03Project
Star
CLIP-RestoreX: Restore Image Structure and Perception in Exposure Correction
AAAI2025-04Github
Star
Dual Prompting Image Restoration with Diffusion Transformers
CVPR2025-04Github
Star
A single image deraining algorithm guided by text generation based on depth information conditions
ASOC2025-07Github
Star
Adaptive multi-modal prompting for universal image restoration amidst diverse degradations
TVC2025-05Github
RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution
arXiv2025-08-
Dual-Domain Perspective on Degradation-Aware Fusion: A VLM-Guided Robust Infrared and Visible Image Fusion Framework
arXiv2025-09-
Real-world super-resolution with VLM-based degradation prior learning
Scientific Reports2025-08-
Star
Coupled Degradation Modeling and Fusion: A VLM-Guided Degradation-Coupled Network for Degradation-Aware Infrared and Visible Image Fusion
arXiv2025-10Github
Star
Coupled Degradation Modeling and Fusion: A VLM-Guided Degradation-Coupled Network for Degradation-Aware Infrared and Visible Image Fusion
arXiv2025-10Github
Star
MdaIF: Robust One-Stop Multi-Degradation-Aware Image Fusion with Language-Driven Semantics
AAAI2025-11Github
Star
Multimodal image fusion network with prior-guided dynamic degradation removal for extreme environment perception
Sci Rep2025-10Github
Nested Unfolding Network for Real-World Concealed Object Segmentation
arXiv2025-11-
VL-UR: Vision-Language-guided Universal Restoration of Images Degraded by Adverse Weather Conditions
arXiv2025-04-
VLM-Augmented Degradation Modeling for Image Restoration Under Adverse Weather Conditions
arXiv2025-11-

2.3 VLM as Quality Evaluator: Perception and Assessment

2.3.1 No-Reference Quality Assessment
TitleVenueDateCode
Star
Exploring CLIP for Assessing the Look and Feel of Images
AAAI2022-07Github
Star
Blind Image Quality Assessment via Vision-Language Correspondence: A Multitask Learning Perspective
CVPR2023-03Github
Star
VILA: Learning Image Aesthetics from User Comments with Vision-Language Pretraining
CVPR2023-03Github
Star
DegAE: A New Pretraining Paradigm for Low-Level Vision
CVPR2023-06Github
Star
Depicting Beyond Scores: Advancing Image Quality Assessment through Multi-modal Language Models
ECCV2023-12Github
Star
Quality-Aware Image-Text Alignment for Opinion-Unaware Image Quality Assessment (QualiCLIP)
arXiv2024-03Github
Star
Descriptive Image Quality Assessment in the Wild
arXiv2024-05Github
Star
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
arXiv2024-06Github
Star
CLIP-AGIQA: Boosting the Performance of AI-Generated Image Quality Assessment with CLIP
ICPR2024-08Github
Star
Dog-IQA: Standard-guided Zero-shot MLLM for Mix-grained Image Quality Assessment
arXiv2024-10Github
Star
Large Language Models for Lossless Image Compression: Next-Pixel Prediction in Language Space is All You Need
NeurIPS2024-11Github
Star
Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
AAAI2024-11Github
Star
Low-Light Image Enhancement via Generative Perceptual Priors
AAAI2024-12Github
Star
Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution
CVPR2025-01Github
Star
CLIP-DQA: Blindly Evaluating Dehazed Images from Global and Local Perspectives Using CLIP
ISCAS2025-02Github
DVLTA-VQA: Decoupled Vision-Language Modeling with Text-Guided Adaptation for Blind Video Quality Assessment
arXiv2025-04-
Star
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
arXiv2025-04Github
Star
Perceive-IR: Learning to Perceive Degradation Better for All-in-One Image Restoration
TIP2024-08Github
Star
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
arXiv2025-05Github
Star
ImgEdit: A Unified Image Editing Dataset and Benchmark
NeurIPS2025-05Github
Star
What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models
ICCV2025-05Github
BPCLIP: A Bottom-up Image Quality Assessment from Distortion to Semantics Based on CLIP
ICME2025-06-
Star
Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment
arXiv2025-06Github
Leveraging Vision-Language Models to Select Trustworthy Super-Resolution Samples Generated by Diffusion Models
TCSVT2025-06-
VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning
arXiv2025-06-
DehazeMamba: large multi-modal model guided single image dehazing via mamba
VisIntell2025-07-
Hallucination Score: Towards Mitigating Hallucinations in Generative Image Super-Resolution
arXiv2025-07-
Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation
arXiv2025-08-
Star
Fine-grained Image Quality Assessment for Perceptual Image Restoration
AAAI2025-08Github
Star
Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
AAAI2025-08Github
Segmenting and Understanding: Region-aware Semantic Attention for Fine-grained Image Quality Assessment with Large Language Models
arXiv2025-08-
AgenticIQA: An Agentic Framework for Adaptive and Interpretable Image Quality Assessment
arXiv2025-09-
Star
Describe-to-Score: Text-Guided Efficient Image Complexity Assessment
arXiv2025-09Github
Star
Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA
arXiv2025-09Github
Revisiting Vision–Language Foundations for No-Reference Image Quality Assessment
WACV2025-09-
Star
From Filters to VLMs: Benchmarking Defogging Methods through Object Detection and Segmentation Performance
arXiv2025-10Github
Star
Revisiting MLLM Based Image Quality Assessment: Errors and Remedy
AAAI2025-11Github
Star
ClearAIR: A Human-Visual-Perception-Inspired All-in-One Image Restoration
AAAI2026-01Github
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
arXiv2026-01-
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
arXiv2026-01Github
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
arXiv2026-01-
Star
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
arXiv2026-01Github
Q-Hawkeye: Reliable Visual Policy Optimization for Image Quality Assessment
arXiv2026-01-
ELIQ: A Label-Free Framework for Quality Assessment of Evolving AI-Generated Images
arXiv2026-02-
Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis
arXiv2026-02Github
Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues
arXiv2026-02Github
Star
CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions
arXiv2026-03Github
Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach
arXiv2026-03-
ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking
arXiv2026-03-
Q-Tacit: Image Quality Assessment via Latent Visual Reasoning
arXiv2026-03Github
R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessment
CVPR2026-03Github
Vision-Language Models vs Human: Perceptual Image Quality Assessment
arXiv2026-03-
Star
EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment
TPAMI2026-04Github
Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
arXiv2026-04-
Star
NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)
CVPRW2026-04Github
Redefining Quality Criteria and Distance-Aware Score Modeling for Image Editing Assessment
arXiv2026-04-
Star
UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs
arXiv2026-04Github
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
arXiv2026-05-
Star
Employing Vision-Language Models for Face Image Quality Assessment
FG2026-05Github
Star
UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs
arXiv2026-04Github
DAL-PCQA: Enabling Distortion-Level and Language-Driven Reasoning for Point Cloud Quality Assessment
arXiv2026-06Github
Star
Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment
arXiv2026-06Github
Star
LEIQ-Assessor: Multi-dimensional Quality Assessment of Low-light Enhanced Images via Multi-task Learning
arXiv2026-06Github
Star
LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models
arXiv2026-06Github
Star
Tool-IQA: Augmenting Image Quality Assessment with Simple Tools
arXiv2026-06Github
2.3.2 Semantic Consistency Loss
2.3.3 Feedback Loops
TitleVenueDateCode
Star
HazeCLIP: Towards Language Guided Real-World Image Dehazing
ICASSP2024-07Github
Star
Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models
ECCV2024-09Github
DSPO: Direct Semantic Preference Optimization for Real-World Image Super-Resolution
arXiv2025-04-
Star
SnowMaster: Comprehensive Real-world Image Desnowing via MLLM with Multi-Model Feedback Optimization
CVPR2025-06Github
Star
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
arXiv2025-09Github
Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
arXiv2025-09-
Learning an Image Editing Model without Image Editing Pairs
arXiv2025-10-
Star
Test-Time Preference Optimization for Image Restoration
AAAI2025-11Github
Star
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
arXiv2025-11Github
Star
UARE: Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
arXiv2025-12Github
Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning
arXiv2026-01-
Star
CoCoEdit: Content-Consistent Image Editing via Region Regularized Reinforcement Learning
IJCAI2026-02Github
Star
EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing
arXiv2026-03Github
HP-Edit: A Human-Preference Post-Training Framework for Image Editing
CVPR2026-04-
Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement
arXiv2026-04-
Star
GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration
arXiv2026-05Github
Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning
arXiv2026-05Project
Star
White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation
CVPR2026-05Github

2.4 VLM as Intelligent Controller: Agent-Based Frameworks

2.4.1 Motivation as Intelligent Controller
2.4.2 Tool Usage & Orchestration
TitleVenueDateCode
Star
LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing
arXiv2023-11Github
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
IJCAI2024-01-
Star
Image Inpainting Models are Effective Tools for Instruction-guided Image Editing
CVPRW2024-07Github
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
NeurIPS2024-07-
Star
VITRON: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
NeurIPS2024-10Github
LLMCO4MR: LLMs-Aided Neural Combinatorial Optimization for Ancient Manuscript Restoration from Fragments with Case Studies on Dunhuang
ECCV2024-11-
Star
I Dream My Painting: Connecting MLLMs and Diffusion Models via Prompt Generation for Text-Guided Multi-Mask Inpainting
WACV2024-11Github
Star
BrushEdit: All-In-One Image Inpainting and Editing
NeurIPS2024-12Github
Hybrid Agents for Image Restoration
arXiv2025-03-
Multi-Agent Image RestorationarXiv2025-03-
Star
JarvisIR: Elevating Autonomous Driving Perception with Intelligent Image Restoration
CVPR2025-04Github
Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model
arXiv2025-04-
Star
LEGO: LLM-enhanced genetic optimization for underwater robot image restoration
PR2025-05Github
Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models
arXiv2025-05-
Star
MonetGPT: Solving Puzzles Enhances MLLMs' Image Retouching Skills
TOG2025-05Github
PhotoArtAgent: Intelligent Photo Retouching with Language Model-Based Artist Agents
arXiv2025-05-
Star
JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent
NeurIPS2025-06Github
Star
EdiVal-Agent: An Object-Centric Framework for Automated, Scalable, Fine-Grained Evaluation of Multi-Turn Editing
arXiv2025-09Github
InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On
arXiv2025-09-
Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation
arXiv2025-09-
Star
MoA-VR: A Mixture-of-Agents System Towards All-in-One Video Restoration
JSTSP2025-10Github
Star
From Pixels to Paths: A Multi-Agent Framework for Editable Scientific Illustration
arXiv2025-10Github
Image-POSER: Reflective RL for Multi-Expert Image Generation and Editing
arXiv2025-11-
T2T-VICL: Unlocking the Boundaries of Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs
arXiv2025-11-
Star
RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
arXiv2025-12Github
ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization
arXiv2026-02Project
Interaction-Consistent Object Removal via MLLM-Based Reasoning
arXiv2026-02-
MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing
arXiv2026-03-
PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning
arXiv2026-03Project
TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration
arXiv2026-03-
Star
GenSmoke-GS: A Multi-Stage Method for Novel View Synthesis from Smoke-Degraded Images Using a Generative Model
CVPRW2026-04Github
DiTTo: Scalable Order-aware All-in-One Image Restoration Agent
arXiv2026-05Project
From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing
arXiv2026-05Project
Star
IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment
CVPR2026-06Github
Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution
arXiv2026-06-
2.4.3 Iterative Refinement

3. Extended Applications

3.1 Medical Image Processing

3.1.1 Biomedical VLMs
3.1.2 CT and MRI

3.2 Remote Sensing Data Processing

3.2.1 Spatial-domain Tasks
3.2.2 Spectral-domain Tasks

3.3 Other Extended Applications

3.3.1 CAD
3.3.2 Video Processing Tasks
3.3.3 3D Processing Tasks

Datasets

TaskDatasetSizeRepo / DownloadDescription
SRDIV2K900/100DownloadHigh-resolution natural images for super-resolution with synthetic degradations.
SRRealSR595RepoReal-captured paired low-resolution and high-resolution images using focal-length changes.
SRDRealSR2,507RepoReal-world super-resolution pairs collected across indoor and outdoor scenes.
LLIELOLv1585/15DownloadPaired low-light and normal-light real images for low-light enhancement.
LLIEMIT-Adobe FiveK25,000DownloadExpert-retouched photo pairs for illumination and tone related enhancement tasks.
LLIELOLv21,589/200RepoCombined real and synthetic paired data for low-light enhancement.
DehazeRESIDE13,000/990RepoDehazing benchmark including synthetic and real-world subsets.
DehazeNH-Haze55DownloadReal paired outdoor images with non-homogeneous haze.
DehazeHaze-4K4,000RepoSynthetic 4K dehazing pairs with auxiliary physical annotations.
InpaintingCelebA200,000DownloadLarge-scale face dataset used for face-centric restoration and inpainting.
InpaintingCelebA-HQ30,000RepoHigh-quality face images derived from CelebA for high-fidelity restoration.
Inpainting, DerainMSCOCO328,124DownloadLarge-scale natural images with segmentation annotations for generic restoration and editing.
DerainRain100H1,800/100DownloadSynthetic heavy-rain streak pairs for supervised deraining.
DerainRainDrop861/239RepoReal paired images with adherent raindrops for deraining and restoration.
DeblurGoPro2,103/1,111DownloadMotion blur benchmark synthesized from high-frame-rate video frames.
DeblurRealBlur3,758/980RepoReal paired short-exposure and long-exposure images for motion deblurring.
DeblurHIDE8,422RepoHuman-centered motion deblurring dataset with complex dynamic motion.
CT denoising2016 NIH-AAPM-Mayo5,936DownloadLow-dose CT dataset used for dose reduction and denoising research.
CT denoisingMayo-20164,800/1,136DownloadChallenge dataset used for low-dose CT denoising and reconstruction.
CT denoisingMayo-20202,400/580DownloadPreprocessed low-dose CT dataset for training and evaluation.

TitleVenueDateCodeNote
Star
Diffusion Models in Low-Level Vision: A Survey
TPAMI2024-06RepoDiffusion-based methods for low-level vision, including task formulations, architectures, and training design patterns.
Star
A Survey on All-in-One Image Restoration: Taxonomy, Methods, and Future Directions
arXiv2024-10RepoAll-in-one image restoration models covering multi-task, multi-degradation, unified training, and evaluation protocols.
Star
Instruction Guided Editing Controls for Images and Multimedia: A Survey in the Era of Large Language Models
arXiv2024-11RepoInstruction-driven image and multimedia editing, covering control types, model families, and evaluation for edit fidelity and consistency.
Star
Vision-Language Models for Vision Tasks: A Survey
TPAMI2023-04RepoVLM methodology for vision tasks, including pretraining, transfer learning, distillation, datasets, and benchmarks.
Star
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges
CVPRW2025-01RepoLVLM design and evaluation, focusing on alignment, benchmark suites, failure modes, and measurement practices.
Star
A Survey on Multimodal Large Language Models
NSR2023-06RepoCore MLLM architectures, training data, instruction tuning, evaluation, and common issues such as hallucination.
Vision Language Models: A Survey of 26K Papers
arXiv2025-10-Trend analysis and taxonomy at scale, summarizing research directions from a large paper collection.
Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions
arXiv2024-02-Broad overview of VLM model families, training paradigms, and benchmarks, with an emphasis on capabilities and limitations.
Vision Encoders in Vision-Language Models: A Survey
Tech Report2025-12-Vision encoder design choices for VLMs, including architecture families, scaling trends, and practical tradeoffs.

Other Awesome VLM Papers

TitleVenueDateCode
Star
MMAIF: Multi-task and Multi-degradation All-in-One for Image Fusion with Language Guidance
arXiv2025-03Github
Star
Adding Conditional Control to Text-to-Image Diffusion Models
ICCV2023-02Github
Star
GridFormer: Residual Dense Transformer with Grid Structure for Image Restoration in Adverse Weather Conditions
IJCV2023-05Github
Star
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
CVPR2023-11Github
Star
IMProv: Inpainting-based Multimodal Prompting for Computer Vision Tasks
TMLR2023-12Github
Star
Generative Multi-Modal Knowledge Retrieval with Large Language Models
AAAI2024-01Github
Star
CoLLaVO: Crayon Large Language and Vision mOdel
arXiv2024-02Github
Star
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
ACL2024-02Github
Star
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning
NeurIPSW2024-05Github
Star
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
NeurIPS2024-06Github
Star
Multi-Expert Adaptive Selection: Task-Balancing for All-in-One Image Restoration
arXiv2024-07Github
Star
Vision Language Models Are Blind: Failing to Translate Detailed Visual Features into Words
ACCV2024-07Github
Star
Learning A Low-Level Vision Generalist via Visual Task Prompt
ACM MM2024-08Github
Star
On Domain-Adaptive Post-Training for Multimodal Large Language Models
EMNLP2024-11Github
ForgeryGPT: Multimodal Large Language Model For Explainable Image Forgery Detection and Localization
arXiv2024-10-
Scene Text Detection in Foggy Weather Utilizing Knowledge Distillation of Diffusion Models
SPL2025-02-
Star
Generator-Assistant Stepwise Rollback Framework for Large Language Model Agent
arXiv2025-03Github
Why Compress What You Can Generate? When GPT-4o Generation Ushers in Image Compression Fields
ICCVW2025-04-
Star
OmniFuse: Composite Degradation-Robust Image Fusion with Language-Driven Semantics
TPAMI2025-05Github
Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model
arXiv2025-05-
Vision-Language Model Priors-Driven State Space Model for Infrared-Visible Image Fusion
SPL2025-06-
UniLDiff: Unlocking the Power of Diffusion Priors for All-in-One Image Restoration
arXiv2025-07-
Follow-Your-Instruction: A Comprehensive MLLM Agent for World Data Synthesis
arXiv2025-08-
Star
Dataset Distillation for Super-Resolution without Class Labels and Pre-trained Models
arXiv2025-09Github
Evaluating Robustness of Vision-Language Models Under Noisy Conditions
arXiv2025-09-
VLM-Guided Inpainting for Anomaly Detection
Journal of Multimedia Information System2025-09-
Clear Roads, Clear Vision: Advancements in Multi-Weather Restoration for Smart Transportation
arXiv2025-10Github
Star
Generative Image Restoration and Super-Resolution using Physics-Informed Synthetic Data for Scanning Tunneling Microscopy
arXiv2025-10Github
DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection
arXiv2025-11HuggingFace
FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model
ICASSP2026-02-
Universal Anti-forensics Attack against Image Forgery Detection via Multi-modal Guidance
arXiv2026-02-
Generalizable Detection of AI Generated Images with Large Models and Fuzzy Decision Tree
arXiv2026-03-
When Detectors Forget Forensics: Blocking Semantic Shortcuts for Generalizable AI-Generated Image Detection
arXiv2026-03-

Contributors

CodeRikka

19 commits

cookiebear-816

10 commits

ChunmingHe

5 commits

paopol

5 commits