Robin-WZQ/Awesome-Backdoor-on-LMMs

Awesome-Backdoor-on-LMMs is a collection of state-of-the-art, novel, exciting backdoor methods on LMMs (VLPs, TDMs, VLMs, and Agents).

See the code

README

🤗 Awesome-Backdoor-on-LMMs 🤗

Curated list of backdoor attacks and defenses on Large Multimodal Models (LMMs), aligned with our work:
Backdoor Attacks and Defenses on Large Multimodal Models: A Survey

arXiv Badge Awesome Badge visitors License Badge GitHub stars

Any additional things regarding backdoor, PRs, issues are welcome. Any problems, please contact wangzhongqi23s@ict.ac.cn. If you find this repository useful to your research or work, it is really appreciated to star this repository and cite our papers here. :sparkles:

📜 Table of Contents

👑 Awesome Papers

Vision Language Pretrained Models

Backdoor Attack

TimeTitleVenuePaperCode
2021.06POISONING AND BACKDOORING CONTRASTIVE LEARNINGarXivlink-
2021.07BadEncoder: Backdoor Attacks to Pre-trained Encoders in Self-Supervised LearningSSP'22linkcode
2022.09Data Poisoning Attacks Against Multimodal EncodersICML'23linkcode
2023.10GhostEncoder: Stealthy backdoor attacks with dynamic triggers to pre-trained encoders in self-supervised learningCS'24link-
2023.11BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive LearningCVPR'24linkcode
2024.05Distribution Preserving Backdoor Attack in Self-supervised LearningSSP'24link-
2024.08BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt LearningMICCAI'24linkcode
2025.03MP-Nav: Enhancing Data Poisoning Attacks against Multimodal LearningICML'25link-
2025.03Backdooring CLIP through Concept ConfusionarXivlink-
2025.10Invisible Backdoor Attack against Self-supervised LearningCVPR'25linkcode
2025.11Backdoor in Seconds: Unlocking Vulnerabilities in Large Pre-trained Models via Model EditingCIKM'25linkcode
2025.11ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-trainingNeurIPS'25linkcode
2026.01Backdoor Attacks on Multi-modal Contrastive LearningarXivlink-
2026.01Stealthy Backdoor Carriers: The Threat of Visual Prompts to CLIPIOTJlinkcode
2026.02BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive LearningarXivlink-
2026.03Dormant Backdoor: Weaponizing Model Finetuning for Feasible Backdoor Attacks against Pretrained ModelsAAAI'26linkcode
2026.04TEALTHY AND ADJUSTABLE TEXT-GUIDED BACKDOOR ATTACKS ON MULTIMODAL PRETRAINED MODELSarXivlinkcode
2026.05Rapid Switchable Backdoor Attack on Any CLIP Model with Multiple Target ClassesTMM'25link=
2026.06BadPromptFL: Parameters-Free Backdoor Attack on Vision-Language Federated LearningTCSVT'26link-
2026.08Backdoor Attacks on CLIP via Prompt LearningTPAMI'26linkcode

Backdoor Defense

TimeTitleVenuePaperCode
2023.02ASSET: Robust Backdoor Data Detection Across a Multiplicity of Deep Learning ParadigmsUSENIX'23linkcode
2023.03CleanCLIP: Mitigating Data Poisoning Attacks in Multimodal Contrastive LearningICCV'23linkcode
2023.03Robust Contrastive Language-Image Pre-training against Data Poisoning and Backdoor AttacksNeurIPS'23link-
2023.03Detecting Backdoors in Pre-trained EncodersCVPR'23linkcode
2023.10Better Safe than Sorry: Pre-training CLIP against Targeted Data Poisoning and Backdoor AttacksICML'24linkcode
2023.11Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training ObjectiveTMLR'25link-
2024.03Unlearning Backdoor Threats: Enhancing Backdoor Defense in Multimodal Contrastive Learning via Local Token UnlearningCVPRW'24link-
2024.09Adversarial Backdoor Defense in CLIParXivlink-
2024.09CleanerCLIP: Fine-grained Counterfactual Semantic Augmentation for BackdoorarXivlink-
2024.11Semantic Shield: Defending Vision-Language Models Against Backdooring and Poisoning via Fine-grained Knowledge AlignmentCVPR'24linkcode
2024.11DeDe: Detecting Backdoor Samples for SSL Encoders via DecodersCVPR'25linkcode
2024.12Defending Multimodal Backdoored Models by Repulsive Visual Prompt TuningarXivlink-
2024.12DETECTING BACKDOOR SAMPLES IN CONTRASTIVE LANGUAGE IMAGE PRETRAININGICLR'25linkcode
2024.12Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIParXivlinkcode
2025.02A Closer Look at Backdoor Attacks on CLIPICML'25link-
2025.02Neural Antidote: Class-Wise Prompt Tuning for Purifying Backdoors in CLIParXivlink-
2025.12Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained ModelsarXivlinkcode
2026.01Robust defense strategies for multimodal contrastive learning: efficient fine-tuning against backdoor attacksMultimedia Tools and Applicationslink-
2026.02InverTune: A Backdoor Defense Method for Multimodal Contrastive Learning via Backdoor-Adversarial Correlation AnalysisNDSS'26link-
2026.03DIFT: Protecting Contrastive Learning Against Data Poisoning Backdoor AttacksAAAI'26link-
2026.03BackdoorIDS: Zero-shot Backdoor Detection for Pretrained Vision EncoderarXivlinkcode
2026.04CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger InversionarXivlink-
2026.06Beyond Native Success: Auditing Deployment-Interface Exposure of CLIP BackdoorsarXivlink-
2026.06Region-Level Black-Box Defense Against Stealthy Embedding-Space Backdoors in CLIPPAKDD'26linkcode
2026.08When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive LearningarXivlink-

Text Conditioned Diffusion Models

Backdoor Attack

TimeTitleVenuePaperCode
2022.11Rickrolling the Artist: Injecting Backdoors into Text Encoders for Text-to-Image SynthesisICCV'23linkcode
2023.05Personalization as a Shortcut for Few-Shot Backdoor Attack against Text-to-Image Diffusion ModelsAAAI'24linkcode
2023.05Text-to-Image Diffusion Models can be Easily Backdoored through Multimodal Data PoisoningACM MM'23linkcode
2023.06VillanDiffusion: A Unified Backdoor Attack Framework for Diffusion ModelsNeurIPS'23linkcode
2023.07BAGM: A Backdoor Attack for Manipulating Text-to-Image Generative ModelsTIFS'24linkcode
2023.08Backdooring Textual Inversion for Concept CensorshiparXivlinkcode
2023.10Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative ModelsS&P'24linkcode
2024.01The Stronger the Diffusion Model, the Easier the Backdoor: Data Poisoning to Induce Copyright Breaches Without Adjusting Finetuning PipelineICML'24linkcode
2024.06Injecting Bias in Text-To-Image Models via Composite-Trigger BackdoorsarXivlink-
2024.07Control ControlNet: Multidimensional Backdoor Attack Based on ControlNetICONIP'24linkcode
2024.10EvilEdit: Backdooring Text-to-Image Diffusion Models in One SecondACM MM'24linkcode
2024.11Combinational Backdoor Attack against Customized Text-to-Image ModelsarXivlink-
2024.11TrojanEdit: Backdooring Text-Based Image Editing ModelsarXivlink-
2025.02Imperceptible Backdoor Attacks on Text-Guided 3D Scene GroundingTMM'25link-
2025.03Trigger without Trace: Towards Stealthy Backdoor Attack on Text-to-Image Diffusion ModelsTIFS'26linkcode
2025.03Silent Branding Attack: Trigger-free Data Poisoning Attack on Text-to-Image Diffusion ModelsCVPR'25linkcode
2025.04BadVideo: Stealthy Backdoor Attack against Text-to-Video GenerationICCV'25linkcode
2025.04Erased but Not Forgotten: How Backdoors Compromise Concept ErasurearXivlinkcode
2025.04REDEditing: Relationship-Driven Precise Backdoor Poisoning on Text-to-Image Diffusion ModelsarXivlink-
2025.06TWIST: Text-encoder Weight-editing for Inserting Secret Trojans in Text-to-Image ModelsACL'25link-
2025.08Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion ModelsarXivlink-
2025.08BadBlocks: Low-Cost and Stealthy Backdoor Attacks Tailored for Text-to-Image Diffusion ModelsarXivlink-
2026.01Key-Value Mapping-Based Text-to-Image Diffusion Model Backdoor AttacksAlgorithmslinkcode
2026.02Bad-PoseDiff: Pose-Guided Backdoor Triggering in Diffusion ModelsTrustCom'25link-
2026.02Semantic-level Backdoor Attack against Text-to-Image Diffusion ModelsarXiv'26link-
2026.02When Backdoors Go Beyond Triggers: Semantic Drift in Diffusion Models Under Encoder AttacksarXiv'26link-
2026.02When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign AdaptersCVPR'26linkcode
2026.03Tuning Just Enough: Lightweight Backdoor Attacks on Multi-Encoder Diffusion ModelsICLRW'26link-
2026.03When One Modality Rules Them All: Backdoor Modality Collapse in Multimodal Diffusion ModelsICLRW'26link-
2026.05PersGuard: Preventing Malicious Personalization in Text-to-Image Diffusion Models via Model BackdoorsTDSC'26link-
2026.05DiffusionHijack: Supply-Chain PRNG Backdoor Attack on Diffusion Models and Quantum Random Number DefensearXivlink-
2026.05Awakening the Hydra: Stabilizing Multi-Concept Backdoor Injection in Text-to-Image Diffusion ModelsarXivlink-
2026.05Beyond the False Trade-off: Adaptive EWC for Stealthy and Generalizable T2I BackdoorsarXivlink-
2026.06Inference-Configuration Robust Backdoor Attacks on Diffusion Models via Cross-Timestep Consistent TriggerIEEE Accesslink-
2026.06GoodDiffusion: Proactive Copyright Protection for Diffusion Bridge Models via Learnable Sample-specific SignaturesarXivlinkcode
2026.06Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion ModelsACL'26linkcode
2026.06Customization under Fire: Plugin Poisoning in Text-to-Image EcosystemCCS'26link-
2026.07Reducing Semantic Trigger Leakage in Backdoored Text-to-Image Diffusion ModelsICME'26link-
2026.07Cross-Lingual Vulnerabilities of Text-to-Image Models: Evaluating Data Poisoning Attacks Across Ten LanguagesICPR'26link-

Backdoor Defense

TimeTitleVenuePaperCode
2024.04UFID: A Unified Framework for Black-box Input-level Backdoor Detection on Diffusion ModelsAAAI'25linkcode
2024.07T2IShield: Defending Against Backdoors on Text-to-Image Diffusion ModelsECCV'24linkcode
2024.08Defending Text-to-image Diffusion Models: Surprising Efficacy of Textual Perturbations Against Backdoor AttacksECCVW'24linkcode
2024.11Fine-grained Prompt Screening: Defending Against Backdoor Attack on Text-to-Image Diffusion ModelsIJCAI'25link-
2025.01Backdoor Defense for Text Encoders in Text-to-Image Generative ModelsIEEE TDSC'25linkcode
2025.02BackdoorDM: A Comprehensive Benchmark for Backdoor Learning in Diffusion ModelNeurIPS'25linkcode
2025.03Efficient Input-level Backdoor Detection on Text-to-Image Synthesis via Neuron Activation VariationarXivlink-
2025.04Backdoor Defense in Diffusion Models via Spatial Attention UnlearningarXivlink-
2025.04Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion ModelsTPAMI'25linkcode
2026.01On the Fairness, Diversity and Reliability of Text-to-Image Generative ModelsArtificial Intelligence Reviewlinkcode
2026.02Backdoor Sentinel: Detecting and Detoxifying Backdoors in Diffusion Models via Temporal Noise ConsistencyarXivlink-
2026.03BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response DeviationCVPR'26linkcode
2026.03A Dual-Purpose Framework for Backdoor Defense and Backdoor Amplification in Diffusion ModelsTIFS'26link-
2026.04Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention ScalingarXivlink-

Large Vision Language Models

Backdoor Attack

TimeTitleVenuePaperCode
2024.02Shadowcast: Stealthy Data Poisoning Attacks against Vision-Language ModelsNeurIPS'24linkcode
2024.02VL-Trojan: Multimodal Instruction Backdoor Attacks against Autoregressive Visual Language ModelsIJCV'25linkcode
2024.02Test-Time BACKDOOR ATTACKS ON MULTIMODAL LARGE LANGUAGE MODELSarXivlinkcode
2024.03ImgTrojan: Jailbreaking Vision-Language Models with ONE ImageNAACL'25linkcode
2024.03TrojVLM: Backdoor Attack Against Vision Language ModelsECCV'24link-
2024.04PHYSICAL BACKDOOR ATTACK CAN JEOPARDIZE DRIVING WITH VISION-LARGE-LANGUAGE MODELSICMLW'24link-
2024.06Revisiting Backdoor Attacks against Large Vision-Language Models from Domain ShiftCVPR'25linkcode
2024.10BACKDOORING VISION-LANGUAGE MODELS WITH OUT-OF-DISTRIBUTION DATAICLR'25link-
2025.02Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language ModelsCVPR'25linkcode
2025.03BadToken: Token-level Backdoor Attacks to Multi-modal Large Language ModelsCVPR'25link-
2025.05Natural Reflection Backdoor Attack on Vision Language Model for Autonomous DrivingarXivlink-
2025.06Backdoor Attack on Vision Language Models with Stealthy Semantic ManipulationarXivlink
2025.07Shadow-Activated Backdoor Attacks on Multimodal Large Language ModelsACL'25linkcode
2025.08IAG: Input-aware Backdoor Attack on VLMs for Visual GroundingarXivlink-
2025.09TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language ModelsarXivlinkcode
2025.11MTAttack: Multi-Target Backdoor Attacks against Large Vision-LanguageModelsarXivlinkcode
2025.11BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language ModelsarXivlinkcode
2025.12Concept-Guided Backdoor Attack on Vision Language ModelsarXivlink-
2025.12BadVLM: Towards Efficient and Resilient Backdoor Attacks on Large Vision-Language ModelsCVPR'26link-
2026.04HIDDEN ADS: Behavior-Triggered Semantic Backdoors for Advertisement Injection in Vision–Language ModelsarXivlink-
2026.04Multimodal Backdoor Attack on VLMs for Autonomous Driving via Graffiti and Cross-Lingual TriggersarXivlink-
2026.04Follow My Eyes: Backdoor Attacks on VLM-based Scanpath PredictionarXivlink-
2026.04Phantasia: Context-Adaptive Backdoors in Vision Language ModelsarXivlinkcode
2026.05Cross-Modal Backdoors in Multimodal Large Language ModelsarXivlink-
2026.05CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion ModelsICML'26link-
2026.05BADBONE: Backdoor Attacks Against Backbone Models in Visual Prompt LearningarXivlinkcode
2026.05BadTail: Exploiting Rationale Tails for Stealthy Multimodal Backdoor AttacksICASSP'26link-
2026.07ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision–Language ModelsarXivlinkcode
2026.07Architectural Backdoors in Vision-Language Model Supply Chains via Representation SteeringarXivlink-
2026.08Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMsarXivlink-
2026.09FreqDoor: A Hidden Trojan in the Frequency Domain for Backdoor Attacks on Vision-Language ModelsarXivlink-

Backdoor Defense

TimeTitleVenuePaperCode
2025.05Backdoor Cleaning without External Guidance in MLLM Fine-tuningNeurIPS'25linkcode
2025.06ROBUST ANTI-BACKDOOR INSTRUCTION TUNING IN LVLMSarXivlink-
2025.06SRD: Reinforcement-Learned Semantic PerturbationAAAI'26linkcode
2026.01From Internal Diagnosis to External Auditing: A VLM-Driven Paradigm for Online Test-Time Backdoor DefensearXivlink-
2026.01TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-TuningarXivlinkcode
2026.03Probing Semantic Insensitivity for Inference-Time Backdoor Defense in Multimodal Large Language ModelAAAI'26link-
2026.03PurMM: Attention-Guided Test-Time Backdoor Purification in Multimodal Large Language ModelsAAAI'26link-
2026.03Test-Time Attention Purification for Backdoored Large Vision Language ModelsarXivlink-
2026.03Self-Purification Mitigates Backdoors in Multimodal Diffusion Language ModelsarXivlinkcode
2026.04A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language ModelsarXivlink-
2026.04Meta-Research on Backdoors: Dataset and Threat Model Shifts in Multimodal Backdoor AttacksarXivlink-
2026.08Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMsarXivlink-

VLM-based Embodied AI

Backdoor Attack

  • Embodied Agents
TimeTitleVenuePaperCode
2024.11TrojanRobot: Physical-World Backdoor Attacks Against VLM-based Robotic ManipulationarXivlinkcode
2025.10BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger LearningICLR'26link-
  • VLA
TimeTitleVenuePaperCode
2026.04FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action ModelsCVPR'26link-
2025.05BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled OptimizationarXivlinkcode
2025.10TabVLA: Targeted Backdoor Attacks on Vision-Language-Action ModelsarXivlinkcode
2025.10Goal-oriented Backdoor Attack against Vision-Language-Action Models via Physical ObjectsarXivlinkcode
2025.11AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action ModelsarXivlink-
2026.01State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State SpacearXivlink-
2026.01SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attacks on Vision-Language-Action ModelsFindings of ACL'26link-
2026.02Inject Once Survive Later: Backdooring Vision-Language-Action Models to Persist Through Downstream Fine-tuningarXivlinkcode
2026.05Towards Backdoor-Based Ownership Verification for Vision-Language-Action ModelsarXivlink-
2026.07!Imperio, smolVLA: The Implications of Data Poisoning on Open Source RoboticsKI'26linkcode
  • GUI Agents
TimeTitleVenuePaperCode
2025.05Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI AgentsEMNLP’25linkcode
2025.06Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile AgentsarXivlink-
2025.07VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding ManipulationCOLM‘25linkcode
2025.09Realistic Environmental Injection Attacks on GUI AgentsarXivlinkcode
2025.12AdapAction: Adaptive Target Action Backdoor Attack against GUI AgentsCVPR'26link-
2026.03SlowBA: An efficiency backdoor attack towards VLM-based GUI agentsarXivlinkcode
  • Web Agents
TimeTitleVenuePaperCode
2026.06MemVenom: Triggered Poisoning of Multimodal Memories in Web AgentsarXivlink

Backdoor Defense

TimeTitleVenuePaperCode
2026.02When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual TokensICRA'26link-
2026.07TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action BackdoorsarXivlink-

Others

TimeTitleVenuePaperCode
2026.03Self-Purification Mitigates Backdoors in Multimodal Diffusion Language ModelsarXivlinkcode
2026.05BadDLM: Backdooring Diffusion Language Models with Diverse TargetsarXivlink-
2026.06BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous DrivingarXivlink-
2026.07EmoAttack: Leveraging Adaptive Prompt Optimization for Multimodal Emotion Backdoor AttacksIPM'26link-

🥳 Reference

If you find this repository helpful for your research, we would greatly appreciate it if you could cite our papers. :sparkles:

@article{Wang_2025,
title={Backdoor Attacks and Defenses on Large Multimodal Models: A Survey},
author={Wang, Zhongqi and Zhang, Jie and Bao, Kexin and Liang, Yifei and Shan, Shiguang and Chen, Xilin},
year={2025},
month=dec }

@article{wang2025amdet,
  title={Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models}, 
  author={Zhongqi Wang and Jie Zhang and Shiguang Shan and Xilin Chen},
  journal={arXiv preprint arXiv:2512.00343},
  year={2025},
}

@article{wang2025dynamicattentionanalysisbackdoor,
  title={Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion Models}, 
  author={Zhongqi Wang and Jie Zhang and Shiguang Shan and Xilin Chen},
  journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
  year={2025},
}

@ARTICLE{11527385,
  author={Zhang, Jie and Wang, Zhongqi and Shan, Shiguang and Chen, Xilin},
  journal={IEEE Transactions on Information Forensics and Security (TIFS)}, 
  title={Trigger without Trace: Towards Stealthy Backdoor Attack on Text-to-Image Diffusion Models}, 
  year={2026},
  volume={},
  number={},
  pages={1-1},
  keywords={Modeling;Diffusion models;Text to image;Syntactics;Training;Automatic speech recognition;Conferences;Computers;Toxicology;Computer vision;Backdoor Attack;Text-to-Image Diffusion Models;Syntactic Trigger},
  doi={10.1109/TIFS.2026.3695430}}

@InProceedings{10.1007/978-3-031-73013-9_7,
  author="Wang, Zhongqi
  and Zhang, Jie
  and Shan, Shiguang
  and Chen, Xilin",
  title="T2IShield: Defending Against Backdoors on Text-to-Image Diffusion Models",
  booktitle="Computer Vision -- ECCV 2024",
  year="2025",
  publisher="Springer Nature Switzerland",
  address="Cham",
  pages="107--124",
  isbn="978-3-031-73013-9"
}
backdoor
diffusion-model
embodied-ai
lvlm
safety
security
vlp

Robin-WZQ/Awesome-Backdoor-on-LMMs

Awesome-Backdoor-on-LMMs is a collection of state-of-the-art, novel, exciting backdoor methods on LMMs (VLPs, TDMs, VLMs, and Agents).

See the code

README

🤗 Awesome-Backdoor-on-LMMs 🤗

Curated list of backdoor attacks and defenses on Large Multimodal Models (LMMs), aligned with our work:
Backdoor Attacks and Defenses on Large Multimodal Models: A Survey

arXiv Badge Awesome Badge visitors License Badge GitHub stars

Any additional things regarding backdoor, PRs, issues are welcome. Any problems, please contact wangzhongqi23s@ict.ac.cn. If you find this repository useful to your research or work, it is really appreciated to star this repository and cite our papers here. :sparkles:

📜 Table of Contents

👑 Awesome Papers

Vision Language Pretrained Models

Backdoor Attack

TimeTitleVenuePaperCode
2021.06POISONING AND BACKDOORING CONTRASTIVE LEARNINGarXivlink-
2021.07BadEncoder: Backdoor Attacks to Pre-trained Encoders in Self-Supervised LearningSSP'22linkcode
2022.09Data Poisoning Attacks Against Multimodal EncodersICML'23linkcode
2023.10GhostEncoder: Stealthy backdoor attacks with dynamic triggers to pre-trained encoders in self-supervised learningCS'24link-
2023.11BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive LearningCVPR'24linkcode
2024.05Distribution Preserving Backdoor Attack in Self-supervised LearningSSP'24link-
2024.08BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt LearningMICCAI'24linkcode
2025.03MP-Nav: Enhancing Data Poisoning Attacks against Multimodal LearningICML'25link-
2025.03Backdooring CLIP through Concept ConfusionarXivlink-
2025.10Invisible Backdoor Attack against Self-supervised LearningCVPR'25linkcode
2025.11Backdoor in Seconds: Unlocking Vulnerabilities in Large Pre-trained Models via Model EditingCIKM'25linkcode
2025.11ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-trainingNeurIPS'25linkcode
2026.01Backdoor Attacks on Multi-modal Contrastive LearningarXivlink-
2026.01Stealthy Backdoor Carriers: The Threat of Visual Prompts to CLIPIOTJlinkcode
2026.02BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive LearningarXivlink-
2026.03Dormant Backdoor: Weaponizing Model Finetuning for Feasible Backdoor Attacks against Pretrained ModelsAAAI'26linkcode
2026.04TEALTHY AND ADJUSTABLE TEXT-GUIDED BACKDOOR ATTACKS ON MULTIMODAL PRETRAINED MODELSarXivlinkcode
2026.05Rapid Switchable Backdoor Attack on Any CLIP Model with Multiple Target ClassesTMM'25link=
2026.06BadPromptFL: Parameters-Free Backdoor Attack on Vision-Language Federated LearningTCSVT'26link-
2026.08Backdoor Attacks on CLIP via Prompt LearningTPAMI'26linkcode

Backdoor Defense

TimeTitleVenuePaperCode
2023.02ASSET: Robust Backdoor Data Detection Across a Multiplicity of Deep Learning ParadigmsUSENIX'23linkcode
2023.03CleanCLIP: Mitigating Data Poisoning Attacks in Multimodal Contrastive LearningICCV'23linkcode
2023.03Robust Contrastive Language-Image Pre-training against Data Poisoning and Backdoor AttacksNeurIPS'23link-
2023.03Detecting Backdoors in Pre-trained EncodersCVPR'23linkcode
2023.10Better Safe than Sorry: Pre-training CLIP against Targeted Data Poisoning and Backdoor AttacksICML'24linkcode
2023.11Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training ObjectiveTMLR'25link-
2024.03Unlearning Backdoor Threats: Enhancing Backdoor Defense in Multimodal Contrastive Learning via Local Token UnlearningCVPRW'24link-
2024.09Adversarial Backdoor Defense in CLIParXivlink-
2024.09CleanerCLIP: Fine-grained Counterfactual Semantic Augmentation for BackdoorarXivlink-
2024.11Semantic Shield: Defending Vision-Language Models Against Backdooring and Poisoning via Fine-grained Knowledge AlignmentCVPR'24linkcode
2024.11DeDe: Detecting Backdoor Samples for SSL Encoders via DecodersCVPR'25linkcode
2024.12Defending Multimodal Backdoored Models by Repulsive Visual Prompt TuningarXivlink-
2024.12DETECTING BACKDOOR SAMPLES IN CONTRASTIVE LANGUAGE IMAGE PRETRAININGICLR'25linkcode
2024.12Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIParXivlinkcode
2025.02A Closer Look at Backdoor Attacks on CLIPICML'25link-
2025.02Neural Antidote: Class-Wise Prompt Tuning for Purifying Backdoors in CLIParXivlink-
2025.12Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained ModelsarXivlinkcode
2026.01Robust defense strategies for multimodal contrastive learning: efficient fine-tuning against backdoor attacksMultimedia Tools and Applicationslink-
2026.02InverTune: A Backdoor Defense Method for Multimodal Contrastive Learning via Backdoor-Adversarial Correlation AnalysisNDSS'26link-
2026.03DIFT: Protecting Contrastive Learning Against Data Poisoning Backdoor AttacksAAAI'26link-
2026.03BackdoorIDS: Zero-shot Backdoor Detection for Pretrained Vision EncoderarXivlinkcode
2026.04CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger InversionarXivlink-
2026.06Beyond Native Success: Auditing Deployment-Interface Exposure of CLIP BackdoorsarXivlink-
2026.06Region-Level Black-Box Defense Against Stealthy Embedding-Space Backdoors in CLIPPAKDD'26linkcode
2026.08When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive LearningarXivlink-

Text Conditioned Diffusion Models

Backdoor Attack

TimeTitleVenuePaperCode
2022.11Rickrolling the Artist: Injecting Backdoors into Text Encoders for Text-to-Image SynthesisICCV'23linkcode
2023.05Personalization as a Shortcut for Few-Shot Backdoor Attack against Text-to-Image Diffusion ModelsAAAI'24linkcode
2023.05Text-to-Image Diffusion Models can be Easily Backdoored through Multimodal Data PoisoningACM MM'23linkcode
2023.06VillanDiffusion: A Unified Backdoor Attack Framework for Diffusion ModelsNeurIPS'23linkcode
2023.07BAGM: A Backdoor Attack for Manipulating Text-to-Image Generative ModelsTIFS'24linkcode
2023.08Backdooring Textual Inversion for Concept CensorshiparXivlinkcode
2023.10Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative ModelsS&P'24linkcode
2024.01The Stronger the Diffusion Model, the Easier the Backdoor: Data Poisoning to Induce Copyright Breaches Without Adjusting Finetuning PipelineICML'24linkcode
2024.06Injecting Bias in Text-To-Image Models via Composite-Trigger BackdoorsarXivlink-
2024.07Control ControlNet: Multidimensional Backdoor Attack Based on ControlNetICONIP'24linkcode
2024.10EvilEdit: Backdooring Text-to-Image Diffusion Models in One SecondACM MM'24linkcode
2024.11Combinational Backdoor Attack against Customized Text-to-Image ModelsarXivlink-
2024.11TrojanEdit: Backdooring Text-Based Image Editing ModelsarXivlink-
2025.02Imperceptible Backdoor Attacks on Text-Guided 3D Scene GroundingTMM'25link-
2025.03Trigger without Trace: Towards Stealthy Backdoor Attack on Text-to-Image Diffusion ModelsTIFS'26linkcode
2025.03Silent Branding Attack: Trigger-free Data Poisoning Attack on Text-to-Image Diffusion ModelsCVPR'25linkcode
2025.04BadVideo: Stealthy Backdoor Attack against Text-to-Video GenerationICCV'25linkcode
2025.04Erased but Not Forgotten: How Backdoors Compromise Concept ErasurearXivlinkcode
2025.04REDEditing: Relationship-Driven Precise Backdoor Poisoning on Text-to-Image Diffusion ModelsarXivlink-
2025.06TWIST: Text-encoder Weight-editing for Inserting Secret Trojans in Text-to-Image ModelsACL'25link-
2025.08Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion ModelsarXivlink-
2025.08BadBlocks: Low-Cost and Stealthy Backdoor Attacks Tailored for Text-to-Image Diffusion ModelsarXivlink-
2026.01Key-Value Mapping-Based Text-to-Image Diffusion Model Backdoor AttacksAlgorithmslinkcode
2026.02Bad-PoseDiff: Pose-Guided Backdoor Triggering in Diffusion ModelsTrustCom'25link-
2026.02Semantic-level Backdoor Attack against Text-to-Image Diffusion ModelsarXiv'26link-
2026.02When Backdoors Go Beyond Triggers: Semantic Drift in Diffusion Models Under Encoder AttacksarXiv'26link-
2026.02When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign AdaptersCVPR'26linkcode
2026.03Tuning Just Enough: Lightweight Backdoor Attacks on Multi-Encoder Diffusion ModelsICLRW'26link-
2026.03When One Modality Rules Them All: Backdoor Modality Collapse in Multimodal Diffusion ModelsICLRW'26link-
2026.05PersGuard: Preventing Malicious Personalization in Text-to-Image Diffusion Models via Model BackdoorsTDSC'26link-
2026.05DiffusionHijack: Supply-Chain PRNG Backdoor Attack on Diffusion Models and Quantum Random Number DefensearXivlink-
2026.05Awakening the Hydra: Stabilizing Multi-Concept Backdoor Injection in Text-to-Image Diffusion ModelsarXivlink-
2026.05Beyond the False Trade-off: Adaptive EWC for Stealthy and Generalizable T2I BackdoorsarXivlink-
2026.06Inference-Configuration Robust Backdoor Attacks on Diffusion Models via Cross-Timestep Consistent TriggerIEEE Accesslink-
2026.06GoodDiffusion: Proactive Copyright Protection for Diffusion Bridge Models via Learnable Sample-specific SignaturesarXivlinkcode
2026.06Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion ModelsACL'26linkcode
2026.06Customization under Fire: Plugin Poisoning in Text-to-Image EcosystemCCS'26link-
2026.07Reducing Semantic Trigger Leakage in Backdoored Text-to-Image Diffusion ModelsICME'26link-
2026.07Cross-Lingual Vulnerabilities of Text-to-Image Models: Evaluating Data Poisoning Attacks Across Ten LanguagesICPR'26link-

Backdoor Defense

TimeTitleVenuePaperCode
2024.04UFID: A Unified Framework for Black-box Input-level Backdoor Detection on Diffusion ModelsAAAI'25linkcode
2024.07T2IShield: Defending Against Backdoors on Text-to-Image Diffusion ModelsECCV'24linkcode
2024.08Defending Text-to-image Diffusion Models: Surprising Efficacy of Textual Perturbations Against Backdoor AttacksECCVW'24linkcode
2024.11Fine-grained Prompt Screening: Defending Against Backdoor Attack on Text-to-Image Diffusion ModelsIJCAI'25link-
2025.01Backdoor Defense for Text Encoders in Text-to-Image Generative ModelsIEEE TDSC'25linkcode
2025.02BackdoorDM: A Comprehensive Benchmark for Backdoor Learning in Diffusion ModelNeurIPS'25linkcode
2025.03Efficient Input-level Backdoor Detection on Text-to-Image Synthesis via Neuron Activation VariationarXivlink-
2025.04Backdoor Defense in Diffusion Models via Spatial Attention UnlearningarXivlink-
2025.04Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion ModelsTPAMI'25linkcode
2026.01On the Fairness, Diversity and Reliability of Text-to-Image Generative ModelsArtificial Intelligence Reviewlinkcode
2026.02Backdoor Sentinel: Detecting and Detoxifying Backdoors in Diffusion Models via Temporal Noise ConsistencyarXivlink-
2026.03BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response DeviationCVPR'26linkcode
2026.03A Dual-Purpose Framework for Backdoor Defense and Backdoor Amplification in Diffusion ModelsTIFS'26link-
2026.04Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention ScalingarXivlink-

Large Vision Language Models

Backdoor Attack

TimeTitleVenuePaperCode
2024.02Shadowcast: Stealthy Data Poisoning Attacks against Vision-Language ModelsNeurIPS'24linkcode
2024.02VL-Trojan: Multimodal Instruction Backdoor Attacks against Autoregressive Visual Language ModelsIJCV'25linkcode
2024.02Test-Time BACKDOOR ATTACKS ON MULTIMODAL LARGE LANGUAGE MODELSarXivlinkcode
2024.03ImgTrojan: Jailbreaking Vision-Language Models with ONE ImageNAACL'25linkcode
2024.03TrojVLM: Backdoor Attack Against Vision Language ModelsECCV'24link-
2024.04PHYSICAL BACKDOOR ATTACK CAN JEOPARDIZE DRIVING WITH VISION-LARGE-LANGUAGE MODELSICMLW'24link-
2024.06Revisiting Backdoor Attacks against Large Vision-Language Models from Domain ShiftCVPR'25linkcode
2024.10BACKDOORING VISION-LANGUAGE MODELS WITH OUT-OF-DISTRIBUTION DATAICLR'25link-
2025.02Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language ModelsCVPR'25linkcode
2025.03BadToken: Token-level Backdoor Attacks to Multi-modal Large Language ModelsCVPR'25link-
2025.05Natural Reflection Backdoor Attack on Vision Language Model for Autonomous DrivingarXivlink-
2025.06Backdoor Attack on Vision Language Models with Stealthy Semantic ManipulationarXivlink
2025.07Shadow-Activated Backdoor Attacks on Multimodal Large Language ModelsACL'25linkcode
2025.08IAG: Input-aware Backdoor Attack on VLMs for Visual GroundingarXivlink-
2025.09TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language ModelsarXivlinkcode
2025.11MTAttack: Multi-Target Backdoor Attacks against Large Vision-LanguageModelsarXivlinkcode
2025.11BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language ModelsarXivlinkcode
2025.12Concept-Guided Backdoor Attack on Vision Language ModelsarXivlink-
2025.12BadVLM: Towards Efficient and Resilient Backdoor Attacks on Large Vision-Language ModelsCVPR'26link-
2026.04HIDDEN ADS: Behavior-Triggered Semantic Backdoors for Advertisement Injection in Vision–Language ModelsarXivlink-
2026.04Multimodal Backdoor Attack on VLMs for Autonomous Driving via Graffiti and Cross-Lingual TriggersarXivlink-
2026.04Follow My Eyes: Backdoor Attacks on VLM-based Scanpath PredictionarXivlink-
2026.04Phantasia: Context-Adaptive Backdoors in Vision Language ModelsarXivlinkcode
2026.05Cross-Modal Backdoors in Multimodal Large Language ModelsarXivlink-
2026.05CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion ModelsICML'26link-
2026.05BADBONE: Backdoor Attacks Against Backbone Models in Visual Prompt LearningarXivlinkcode
2026.05BadTail: Exploiting Rationale Tails for Stealthy Multimodal Backdoor AttacksICASSP'26link-
2026.07ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision–Language ModelsarXivlinkcode
2026.07Architectural Backdoors in Vision-Language Model Supply Chains via Representation SteeringarXivlink-
2026.08Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMsarXivlink-
2026.09FreqDoor: A Hidden Trojan in the Frequency Domain for Backdoor Attacks on Vision-Language ModelsarXivlink-

Backdoor Defense

TimeTitleVenuePaperCode
2025.05Backdoor Cleaning without External Guidance in MLLM Fine-tuningNeurIPS'25linkcode
2025.06ROBUST ANTI-BACKDOOR INSTRUCTION TUNING IN LVLMSarXivlink-
2025.06SRD: Reinforcement-Learned Semantic PerturbationAAAI'26linkcode
2026.01From Internal Diagnosis to External Auditing: A VLM-Driven Paradigm for Online Test-Time Backdoor DefensearXivlink-
2026.01TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-TuningarXivlinkcode
2026.03Probing Semantic Insensitivity for Inference-Time Backdoor Defense in Multimodal Large Language ModelAAAI'26link-
2026.03PurMM: Attention-Guided Test-Time Backdoor Purification in Multimodal Large Language ModelsAAAI'26link-
2026.03Test-Time Attention Purification for Backdoored Large Vision Language ModelsarXivlink-
2026.03Self-Purification Mitigates Backdoors in Multimodal Diffusion Language ModelsarXivlinkcode
2026.04A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language ModelsarXivlink-
2026.04Meta-Research on Backdoors: Dataset and Threat Model Shifts in Multimodal Backdoor AttacksarXivlink-
2026.08Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMsarXivlink-

VLM-based Embodied AI

Backdoor Attack

  • Embodied Agents
TimeTitleVenuePaperCode
2024.11TrojanRobot: Physical-World Backdoor Attacks Against VLM-based Robotic ManipulationarXivlinkcode
2025.10BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger LearningICLR'26link-
  • VLA
TimeTitleVenuePaperCode
2026.04FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action ModelsCVPR'26link-
2025.05BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled OptimizationarXivlinkcode
2025.10TabVLA: Targeted Backdoor Attacks on Vision-Language-Action ModelsarXivlinkcode
2025.10Goal-oriented Backdoor Attack against Vision-Language-Action Models via Physical ObjectsarXivlinkcode
2025.11AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action ModelsarXivlink-
2026.01State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State SpacearXivlink-
2026.01SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attacks on Vision-Language-Action ModelsFindings of ACL'26link-
2026.02Inject Once Survive Later: Backdooring Vision-Language-Action Models to Persist Through Downstream Fine-tuningarXivlinkcode
2026.05Towards Backdoor-Based Ownership Verification for Vision-Language-Action ModelsarXivlink-
2026.07!Imperio, smolVLA: The Implications of Data Poisoning on Open Source RoboticsKI'26linkcode
  • GUI Agents
TimeTitleVenuePaperCode
2025.05Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI AgentsEMNLP’25linkcode
2025.06Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile AgentsarXivlink-
2025.07VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding ManipulationCOLM‘25linkcode
2025.09Realistic Environmental Injection Attacks on GUI AgentsarXivlinkcode
2025.12AdapAction: Adaptive Target Action Backdoor Attack against GUI AgentsCVPR'26link-
2026.03SlowBA: An efficiency backdoor attack towards VLM-based GUI agentsarXivlinkcode
  • Web Agents
TimeTitleVenuePaperCode
2026.06MemVenom: Triggered Poisoning of Multimodal Memories in Web AgentsarXivlink

Backdoor Defense

TimeTitleVenuePaperCode
2026.02When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual TokensICRA'26link-
2026.07TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action BackdoorsarXivlink-

Others

TimeTitleVenuePaperCode
2026.03Self-Purification Mitigates Backdoors in Multimodal Diffusion Language ModelsarXivlinkcode
2026.05BadDLM: Backdooring Diffusion Language Models with Diverse TargetsarXivlink-
2026.06BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous DrivingarXivlink-
2026.07EmoAttack: Leveraging Adaptive Prompt Optimization for Multimodal Emotion Backdoor AttacksIPM'26link-

🥳 Reference

If you find this repository helpful for your research, we would greatly appreciate it if you could cite our papers. :sparkles:

@article{Wang_2025,
title={Backdoor Attacks and Defenses on Large Multimodal Models: A Survey},
author={Wang, Zhongqi and Zhang, Jie and Bao, Kexin and Liang, Yifei and Shan, Shiguang and Chen, Xilin},
year={2025},
month=dec }

@article{wang2025amdet,
  title={Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models}, 
  author={Zhongqi Wang and Jie Zhang and Shiguang Shan and Xilin Chen},
  journal={arXiv preprint arXiv:2512.00343},
  year={2025},
}

@article{wang2025dynamicattentionanalysisbackdoor,
  title={Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion Models}, 
  author={Zhongqi Wang and Jie Zhang and Shiguang Shan and Xilin Chen},
  journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
  year={2025},
}

@ARTICLE{11527385,
  author={Zhang, Jie and Wang, Zhongqi and Shan, Shiguang and Chen, Xilin},
  journal={IEEE Transactions on Information Forensics and Security (TIFS)}, 
  title={Trigger without Trace: Towards Stealthy Backdoor Attack on Text-to-Image Diffusion Models}, 
  year={2026},
  volume={},
  number={},
  pages={1-1},
  keywords={Modeling;Diffusion models;Text to image;Syntactics;Training;Automatic speech recognition;Conferences;Computers;Toxicology;Computer vision;Backdoor Attack;Text-to-Image Diffusion Models;Syntactic Trigger},
  doi={10.1109/TIFS.2026.3695430}}

@InProceedings{10.1007/978-3-031-73013-9_7,
  author="Wang, Zhongqi
  and Zhang, Jie
  and Shan, Shiguang
  and Chen, Xilin",
  title="T2IShield: Defending Against Backdoors on Text-to-Image Diffusion Models",
  booktitle="Computer Vision -- ECCV 2024",
  year="2025",
  publisher="Springer Nature Switzerland",
  address="Cham",
  pages="107--124",
  isbn="978-3-031-73013-9"
}
backdoor
diffusion-model
embodied-ai
lvlm
safety
security
vlp