anjunhu/Awesome-Trustworthy-MARS

A reading list centred around building, breaking and auditing trustworthy multi-agent recommendation and retrieval systems.

Python

0

26 commits

updated Sep 1, 2026

See the code

README

Amplified and Emergent Safety Risks in Multi-Agent Recommendation and Retrieval

A living, auto-updated reading list. Taxonomy follows our TMLR survey and the CIKM '26 tutorial. Risks are organised by origin (D3: amplified vs. emergent) rather than by attack name. Updated weekly by automated crawler.

Last updated: 2026-09-01


Table of Contents


Taxonomy Overview

The six dimensions

Every entry is positioned against the survey's six-dimension framework; the sections below are grouped by D3.

DimensionValues
D1Architecture eranon-LLM recsys · single-agent LLM recsys · multi-agent LLM recsys
D2Composition patternhierarchical · pipeline · ensemble · peer (tool use cuts across all four)
D3Risk originamplified by composition · emergent under composition
D4Failure driverdrift · misalignment · compromise
D5Attack surfacememory · tool use · inter-agent comms · orchestration · item side · user side
D6Contribution typeempirical attack · evaluation method · defence · position paper

Systems are additionally placed on the Level of Autonomy ladder (L0 passive → L1 conversational → L2 retrieval-augmented → L3 tool-driven → L4 single-agent planner → L5 multi-agent orchestration, with L6 a conceptual endpoint). This reading list is about L5.

Risk origin (D3)

Risks are classified by the single-agent isolation test: an agent retains its full tool and memory interface, but no other agents consume or produce its messages.

  • Amplified (A): risk exists in single-agent settings but worsens under composition.
  • Emergent (E): risk only arises through agent interaction.

Threat tiers determine evaluation scope:

TierDescriptionEvaluation scope
DriftSystem dynamics cause degradation without adversaryComponent
MisalignmentInternal agent exploits its positionInteraction
CompromiseExternal attacker corrupts one or more agentsComposition

Tag legend

Each entry carries pills for its risk origin, evaluation scope, and failure driver, followed by free-form topic chips.

amplified emergent   risk origin (D3)
component interaction composition   evaluation scope
drift misalignment compromise   failure driver (D4)
recsys benchmark   topic

Badges are local SVG assets in assets/badges/, regenerated by python3 assets/make_badges.py. Colours follow the survey's Figure 1 palette; every pill meets WCAG AA contrast.

Evaluation Framework

Evaluation is organised by scope and setting:

ScopeOfflineOnline
ComponentPer-agent constraint checks, recommender metrics, adversarial promptingBehavioural drift detection
InteractionRed-teaming of agent pairs, protocol checks, counterfactual analysisInter-agent message trace monitoring
CompositionEnd-to-end stress tests, fairness audits, collusion auditsSystem-level KPIs, incident reconstruction

1. Foundational MA-RS Papers

Papers defining multi-agent recommender architectures — the systems whose risks we study. Survey §3 (composition patterns D2, attack surfaces D5).

PaperVenuearXivCodeTags
AgentCF: Collaborative Learning with Autonomous Language Agents for Recommender Systems — Zhang et al.WWW 20242310.09233user-modelling recsys
MACRec: A Multi-Agent Collaboration Framework for Recommendation — Wang et al.arXiv 20242402.15235recsys hierarchical
Orchestrating Users and Items for Agentic Recommendations (MACF) — Wu et al.arXiv 20252511.18413recsys decentralised
Towards Agentic Recommender Systems in the Era of Multimodal LLMs — Li et al.arXiv 20252503.16734recsys multimodal
A Survey on LLM-powered Agents for Recommender Systems — AnonymousarXiv 20252502.10050survey recsys
Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems — Yousefi et al.arXiv 20252507.02097survey recsys
No-Human in the Loop: Agentic Evaluation at Scale for Recommendation — Zhang et al.NeurIPS WS 20252511.03051evaluation recsys

Amplified Risks

2. Integrity Attacks

Poisoning, backdoors, and prompt injection: failures with a clear single-agent baseline whose reach, persistence, or severity grows under composition. Survey §4.2.1. D3: amplified · D5: item side, memory, tool use.

PaperVenuearXivNotesTags
Securing AI Agents Against Prompt Injection Attacks — Zhuang et al.arXiv 20252511.15759amplified
Multi-Agent Systems Execute Arbitrary Malicious Code — Debenedetti et al.arXiv 20252503.12188emergent code-execution
Breaking and Fixing Defenses Against Control-Flow Hijacking in Multi-Agent Systems — Debenedetti et al.arXiv 20252510.17276emergent control-flow
Jailbreaking LLMs via Iterative Tool-Disguised Attacks via RL — Chen et al.arXiv 20262601.05466amplified tool-misuse rl
INJECAGENT: Benchmarking Indirect Prompt Injections in LLM Agents — Zhan et al.ACL Findings 20242403.02691GitHubamplified benchmark indirect-injection
A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities — Pasquini et al.arXiv 20252505.04806amplified benchmark
A Real-World Case Study of Attacking ChatGPT via Lightweight Prompt Injection — Yu et al.arXiv 20252504.16125amplified real-world
Demystifying Prompt Injection Attacks on Agentic AI Coding Editors — AnonymousarXiv 20252509.22040amplified tool-misuse
Exploit Tool Invocation Prompt for Tool Behavior Hijacking — AnonymousarXiv 20252509.05755emergent tool-misuse
BadRec: Exploring Backdoor Attack and Defense for LLM-empowered Recommendations — Ning et al.arXiv 20252504.11182amplified backdoor recsys defence
LoRec: Large Language Model for Robust Sequential Recommendation against Poisoning Attacks — Wang et al.SIGIR 20242401.17723amplified recsys sequential defence
Manipulating Recommender Systems: A Survey of Poisoning Attacks and Countermeasures — Nguyen et al.arXiv 20242404.14942amplified survey recsys
A Survey on Adversarial Recommender Systems — Deldjoo et al.ACM CSUR 20212005.10322DOIamplified survey recsys
Shilling Recommender Systems by Generating Side-feature-aware Fake User Profiles — AnonymousarXiv 20252509.17918amplified shilling recsys
LLM-Powered Audits Expose Shilling Attacks in Recommender Systems — AnonymousarXiv 20252509.24961amplified shilling recsys defence
DrunkAgent: Stealthy Memory Corruption in LLM-Powered Recommender Agents — Yang et al.arXiv 20252503.23804amplified memory recsys
Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases — AnonymousarXiv 20242407.12784amplified memory rag
Human-Imperceptible Retrieval Poisoning Attacks in LLM-Powered Applications — AnonymousarXiv 20242404.17196amplified rag retrieval
**Improving the Shortest Plank: Vulnerability-Aware Adversarial Training
for Robust Recommender System** — Kaike Zhang, Qi Cao, Yunfan Wu et al.arXiv 20242409.17476via HuggingFace Papersamplified component compromise
The Misattribution Gap: When Memory Poisoning Looks Like Model Failure in Agentic AI Systems — Tanzim Ahad, Ismail Hossain, Md Jahangir Alam et al.arXiv 20262605.22842emergent composition compromise
LoReTTA: A Low Resource Framework To Poison Continuous Time Dynamic Graphs — Himanshu Pal, Venkata Sai Pranav Bachina, Ankit Gangwal et al.arXiv 20252511.07379classical adversarial RecSysamplified component compromise
Enhancing Robustness of Graph Neural Networks through p-Laplacian — Anuj Kumar Sirohi, Subhanu Halder, Kabir Kumar et al.arXiv 20252511.06143classical adversarial RecSysamplified component compromise
Controllable and Stealthy Shilling Attacks via Dispersive Latent Diffusion — Shutong Qiao, Wei Yuan, Junliang Yu et al.arXiv 20252508.01987classical adversarial RecSysamplified component compromise
AUV-Fusion: Cross-Modal Adversarial Fusion of User Interactions and Visual Perturbations Against VARS — Hai Ling, Tianchi Wang, Xiaohao Liu et al.arXiv 20252507.22880classical adversarial RecSysamplified component compromise
Spattack: Subgroup Poisoning Attacks on Federated Recommender Systems — Bo Yan, Yurong Hao, Dingqi Liu et al.arXiv 20252507.06258classical adversarial RecSysamplified component compromise
IndirectAD: Practical Data Poisoning Attacks against Recommender Systems for Item Promotion — Zihao Wang, Tianhao Mao, XiaoFeng Wang et al.arXiv 20252511.05845classical adversarial RecSysamplified component compromise
Retrieval-Augmented Review Generation for Poisoning Recommender Systems — Shiyi Yang, Xinshu Li, Guanglin Zhou et al.arXiv 20252508.15252classical adversarial RecSysamplified component compromise
Stealthy LLM-Driven Data Poisoning Attacks Against Embedding-Based Retrieval-Augmented Recommender Systems — Fatemeh Nazary, Yashar Deldjoo, Tommaso Di Noia et al.arXiv 20252505.05196classical adversarial RecSysamplified component compromise
Diversity-aware Dual-promotion Poisoning Attack on Sequential Recommendation — Yuchuan Zhao, Tong Chen, Junliang Yu et al.arXiv 20252504.06586classical adversarial RecSysamplified component compromise
Exploiting Meta-Learning-based Poisoning Attacks for Graph Link Prediction — Mingchen Li, Di Zhuang, Keyu Chen et al.arXiv 20252504.06492classical adversarial RecSysamplified component compromise
Poison-RAG: Adversarial Data Poisoning Attacks on Retrieval-Augmented Generation in Recommender Systems — Fatemeh Nazary, Yashar Deldjoo, Tommaso di NoiaarXiv 20252501.11759classical adversarial RecSysamplified component compromise
Single-Node Trigger Backdoor Attacks in Graph-Based Recommendation Systems — Runze Li, Di Jin, Xiaobao Wang et al.arXiv 20252506.08401classical adversarial RecSysamplified component compromise
LLM-Based User Simulation for Low-Knowledge Shilling Attacks on Recommender Systems — Shengkang Gu, Jiahao Liu, Dongsheng Li et al.arXiv 20252505.13528classical adversarial RecSysemergent component compromise
Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks — Viet K. Nguyen, Mohammad I. HusainarXiv 20252512.14860amplified component compromise
Membership Inference Attacks on LLM-based Recommender Systems — Jiajie He, Min-Chun Chen, Xintong Chen et al.arXiv 20252508.18665amplified component compromise
It's the Thought that Counts: Evaluating the Attempts of Frontier LLMs to Persuade on Harmful Topics — Matthew Kowal, Jasper Timm, Jean-Francois Godbout et al.arXiv 20252506.02873amplified component compromise
Exploring Approaches for Detecting Memorization of Recommender System Data in Large Language Models — Antonio Colacicco, Vito Guida, Dario Di Palma et al.arXiv 20262601.02002amplified component compromise
Autonomous Agents on Blockchains: Standards, Execution Models, and Trust Boundaries — Saad AlqithamiarXiv 20262601.04583emergent composition compromise
Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning — Jiachen QianarXiv 20262604.16966amplified interaction compromise

3. Privacy and Inversion

Leakage of preferences, histories, and demographics, including compositional leakage where individually benign disclosures combine. Survey §4.2.2. D3: amplified (emergent when disclosures compose) · D5: memory, user side.

PaperVenuearXivNotesTags
Privacy Risks of LLM-Empowered Recommender Systems: An Inversion Attack Perspective — Wang et al.RecSys 20252508.03703amplified inversion recsys
The Sum Leaks More Than Its Parts: Compositional Privacy Risks in Multi-Agent Collaboration — AnonymousarXiv 20252509.14284emergent compositional
Your Language Model Can Secretly Be a Steganographic Privacy Leaking Agent (TrojanStego) — AnonymousarXiv 20252505.20118amplified steganography
A Privacy-Enhanced Development Paradigm for Multi-Agent Collaboration Systems — AnonymousarXiv 20252505.04799amplified defence
The 1st Workshop on Human-Centered Recommender Systems — Kaike Zhang, Yunfan Wu, Yougang lyu et al.arXiv 20242411.14760via HuggingFace Papersamplified component drift
Robust Recommender System: A Survey and Future Directions — Kaike Zhang, Qi Cao, Fei Sun et al.arXiv 20232309.02057via HuggingFace Papersamplified component compromise
FedAU2: Attribute Unlearning for User-Level Federated Recommender Systems with Adaptive and Robust Adversarial Training — Yuyuan Li, Junjie Fang, Fengyuan Yu et al.arXiv 20252511.22872classical adversarial RecSysamplified component compromise
ADAGE: Active Defenses Against GNN Extraction — Jing Xu, Franziska Boenisch, Adam DziedzicarXiv 20252503.00065classical adversarial RecSysamplified component compromise
RAID: An In-Training Defense against Attribute Inference Attacks in Recommender Systems — Xiaohua Feng, Yuyuan Li, Fengyuan Yu et al.arXiv 20252504.11510classical adversarial RecSysamplified component compromise
Membership Inference Attack against Large Language Model-based Recommendation Systems: A New Distillation-based Paradigm — Li Cuihong, Huang Xiaowen, Yin Chuanhuan et al.arXiv 20252511.14763amplified component compromise
LLM4MEA: Data-free Model Extraction Attacks on Sequential Recommenders via Large Language Models — Shilong Zhao, Fei Sun, Kaike Zhang et al.arXiv 20252507.16969amplified component compromise
From AutoRecSys to AutoRecLab: A Call to Build, Evaluate, and Govern Autonomous Recommender-Systems Research Labs — Joeran Beel, Bela Gipp, Tobias Vente et al.arXiv 20252510.18104amplified composition drift
Customized Retrieval-Augmented Generation with LLM for Debiasing Recommendation Unlearning — Haichao Zhang, Chong Zhang, Peiyu Hu et al.arXiv 20252511.05494amplified component drift
Audit the Whisper: Detecting Steganographic Collusion in Multi-Agent LLMs — Om TailorarXiv 20252510.04303emergent composition misalignment
AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI — Rafflesia Khan, Declan Joyce, Mansura HabibaarXiv 20252512.03180emergent composition drift
Lightweight Fairness for LLM-Based Recommendations via Kernelized Projection and Gated Adapters — Nan Cui, Wendy Hui Wang, Yue NingarXiv 20262603.23780amplified component drift
Attack by Unlearning: Unlearning-Induced Adversarial Attacks on Graph Neural Networks — Jiahao Zhang, Yilong Wang, Suhang WangarXiv 20262603.18570amplified component compromise
FeDecider: An LLM-Based Framework for Federated Cross-Domain Recommendation — Xinrui He, Ting-Wei Li, Tianxin Wei et al.arXiv 20262602.16034amplified component drift
TRACER: Token ReAssignment for Concept ERasure in Generative Recommendation — Ziheng Chen, Jiali Cheng, Zezhong Fan et al.arXiv 20262606.07688amplified composition drift
Rethinking Fairness in LLM-Based Recommender Systems: A Survey — Song-Duo Ma, Chu-Yun Chen, Bang-An Li et al.arXiv 20262606.28340amplified component drift
Trustworthy Recommendation in the Era of Large Language Models: Opportunities and Challenges — Bohao Wang, Yu Cui, Zhenxiang Xu et al.arXiv 20262606.00540amplified component drift
Prompt Optimization for User Simulation in Conversational Recommender Systems: A Multi-Objective Framework — Nipun B Nair, Tongtong Wu, Weiqing WangarXiv 20262607.00010amplified component drift
From Hidden Profiles to Governable Personalization: Recommender Systems in the Age of LLM Agents — Jiahao Liu, Mingzhe Han, Guanming Liu et al.arXiv 20262604.20065amplified component drift

4. Bias, Fairness, and Feedback Loops

Exposure bias, popularity loops, and dark patterns, amplified by LLM fluency and by state that accumulates across turns and users. Survey §4.2.2. D3: amplified · D5: user side, item side.

PaperVenuearXivNotesTags
Bias Beware: The Impact of Cognitive Biases on LLM-Driven Product Recommendations — Krasniqi et al.EMNLP 20252502.01349amplified cognitive-bias recsys
DarkBench: Benchmarking Dark Patterns in Large Language Models — Kran et al.arXiv 20252503.10728amplified dark-patterns benchmark
An Inconspicuous Attack to Bias LLM Responses — AnonymousarXiv 20242406.04755amplified stealthy
Quantifying Cognitive Bias Induction in LLM-Generated Content — AnonymousarXiv 20252507.03194amplified cognitive-bias
Understanding Biases in ChatGPT-based Recommender Systems — AnonymousarXiv 20242401.10545amplified recsys
Stereotype or Personalization? User Identity Biases Chatbot Recommendations — AnonymousarXiv 20242410.05613amplified recsys stereotype
Bias Mitigation for AI-Feedback Loops in Recommender Systems — AnonymousarXiv 20252509.00109amplified feedback-loop recsys
Aligning Recommendations with User Popularity Preferences — Mona Schirmer, Anton Thielmann, Pola Schwöbel et al.arXiv 20262604.01036amplified
Retrieval Augmented Conversational Recommendation with Reinforcement Learning — Zhenrui Yue, Honglei Zhuang, Zhen Qin et al.arXiv 20262604.04457
Beyond Static Best-of-N: Bayesian List-wise Alignment for LLM-based Recommendation — Ruijun Chen, Chongming Gao, Jiawei Chen et al.arXiv 20262605.04559amplified component drift
Multi-Agent Large Language Models for Conversational Task-Solving — Jonas BeckerarXiv 20242410.22932via HuggingFace Papersemergent component drift
LLM as Explainable Re-Ranker for Recommendation System — Yaqi Wang, Haojia Sun, Shuting ZhangarXiv 20252512.03439amplified component drift
The 2nd Workshop on Human-Centered Recommender Systems — Kaike Zhang, Jiakai Tang, Du Su et al.arXiv 20252511.19979amplified component drift
UFO: Unfair-to-Fair Evolving Mitigates Unfairness in LLM-based Recommender Systems via Self-Play Fine-tuning — Jiaming Zhang, Yuyuan Li, Xiaohua Feng et al.arXiv 20252511.18342amplified component drift
Music Recommendation with Large Language Models: Challenges, Opportunities, and Evaluation — Elena V. Epure, Yashar Deldjoo, Bruno Sguerra et al.arXiv 20252511.16478amplified component drift
Vectorized Context-Aware Embeddings for GAT-Based Collaborative Filtering — Danial Ebrat, Sepideh Ahmadian, Luis RuedaarXiv 20252510.26461amplified component drift
Does LLM Focus on the Right Words? Mitigating Context Bias in LLM-based Recommenders — Bohao Wang, Jiawei Chen, Feng Liu et al.arXiv 20252510.10978amplified component drift
Ethical AI prompt recommendations in large language models using collaborative filtering — Jordan Nelson, Almas Baimagambetov, Konstantinos Avgerinakis et al.arXiv 20252510.06924amplified component drift
Where Should I Study? Biased Language Models Decide! Evaluating Fairness in LMs for Academic Recommendations — Krithi Shailya, Akhilesh Kumar Mishra, Gokul S Krishnan et al.arXiv 20252509.04498amplified component drift
Revealing Potential Biases in LLM-Based Recommender Systems in the Cold Start Setting — Alexandre Andre, Gauthier Roy, Eva Dyer et al.arXiv 20252508.20401amplified component drift
PerFairX: Is There a Balance Between Fairness and Personality in Large Language Model Recommendations? — Chandan Kumar SaharXiv 20252509.08829amplified component drift
ViLLA-MMBench: A Unified Benchmark Suite for LLM-Augmented Multimodal Movie Recommendation — Fatemeh Nazary, Ali Tourani, Yashar Deldjoo et al.arXiv 20252508.04206amplified component drift
Toward Safe and Human-Aligned Game Conversational Recommendation via Multi-Agent Decomposition — Zheng Hui, Xiaokai Wei, Yexi Jiang et al.arXiv 20252504.20094amplified component compromise
Breaking User-Centric Agency: A Tri-Party Framework for Agent-Based Recommendation — Yaxin Gong, Chongming Gao, Chenxiao Fan et al.arXiv 20262603.10673amplified component drift
Ablation Study of a Fairness Auditing Agentic System for Bias Mitigation in Early-Onset Colorectal Cancer Detection — Amalia Ionescu, Jose Guadalupe Hernandez, Jui-Hsuan Chang et al.arXiv 20262603.17179amplified composition drift
LLMs as Orchestrators: Constraint-Compliant Multi-Agent Optimization for Recommendation Systems — Guilin Zhang, Kai Zhao, Jeffrey Friedman et al.arXiv 20262601.19121amplified component drift
Can Fairness Be Prompted? Prompt-Based Debiasing Strategies in High-Stakes Recommendations — Mihaela Rotar, Theresia Veronika Rampisela, Maria MaistroarXiv 20262603.12935amplified component drift
Uncertainty and Fairness Awareness in LLM-Based Recommendation Systems — Chandan Kumar Sah, Xiaoli Lian, Li Zhang et al.arXiv 20262602.02582amplified component drift
HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems — Sushant MehtaarXiv 20262601.19197amplified component drift
Towards Fair Large Language Model-based Recommender Systems without Costly Retraining — Jin Li, Huilin Gu, Shoujin Wang et al.arXiv 20262601.17492amplified component drift
Bridging Semantic Understanding and Popularity Bias with LLMs — Renqiang Luo, Dong Zhang, Yupeng Gao et al.arXiv 20262601.09478amplified component drift
Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders — Chan Aristella Lu, Arya Fayyazi, Junhao Zhang et al.arXiv 20262608.08284amplified composition drift
LBR: Towards Mitigating Length Bias in Large Language Models for Recommendation — Hongchen Li, Bohao Wang, Jingbang Chen et al.arXiv 20262607.04270amplified component drift
When to Ask a Question: Understanding Communication Strategies in Generative AI Tools — Charlotte Park, Kate Donahue, Manish RaghavanarXiv 20262605.11240amplified component drift
Can We Steer the Black-Box? Towards Controllability-Centric Evaluation of Recommender Systems with Collaborative Agents — Jiwen Zhou, Xiang Liu, Mingming Li et al.arXiv 20262607.13418amplified component drift

Emergent Risks

5. Belief Formation and Aggregation

Premature consensus, correlated error, and degenerate agreement: failures of how agents form and pool judgements. Survey §4.3.1. D3: emergent · D2: ensemble, peer.

PaperVenuearXivNotesTags
Consensus vs. Dissent: Dynamic LLM Modeling of Subjective Preferences in Group Recommenders — Cedric Waterschoot, Nava Tintarev, Francesco BarilearXiv 20262607.10235amplified component drift
CAPRA: Scaling Feedback on Software Architecture Deliverables with a Multi-Agent LLM System — Marco Becattini, Niccolò Caselli, Matteo Minin et al.arXiv 20262606.18976amplified component drift

6. Coordination and Delegation

Unverified delegation, cascading failure, prompt infection, and resource exhaustion along inter-agent paths. Survey §4.3.2. D3: emergent · D5: inter-agent comms, orchestration.

PaperVenuearXivNotesTags
Red-Teaming LLM Multi-Agent Systems via Communication Attacks (AiTM) — Chen et al.arXiv 20252502.14847emergent aitm
Topology-Aware Multi-Hop Attacks on LLM-Based Multi-Agent Systems — AnonymousarXiv 20252512.04129emergent topology
Breaking Pragmatic Multi-Agent LLM Systems with Optimized Prompt Attacks — Gu et al.arXiv 20252504.00218emergent optimisation
Contagious Recursive Blocking Attacks on Multi-Agent Systems (Corba) — AnonymousarXiv 20252502.14529emergent dos
A Multi-round Adaptive Stealthy Tampering Framework for LLM-MAS — AnonymousarXiv 20252508.03125emergent stealthy
Security Analysis of Agentic AI Communication Protocols — Louck et al.arXiv 20252511.03841emergent protocol
The Trust Paradox in LLM-Based Multi-Agent Systems — Xu et al.arXiv 20252510.18563emergent trust
Systems Security Foundations for Agentic Computing — Christodorescu et al.arXiv 20252512.01295emergent systems-security
A Benchmark for Tool Poisoning Attack on Real-World MCP Servers — AnonymousarXiv 20252508.14925emergent mcp tool-misuse
Advertisement Embedding Attacks Against Large Language Models — AnonymousarXiv 20252508.17674emergent advertising
A Safety-Aware Role-Orchestrated Multi-Agent LLM Framework for Behavioral Health Communication Simulation — Ha Na ChoarXiv 20262604.00249emergent

7. Strategic Interaction and Governance

Collusion, collective manipulation, and misreporting between agents representing parties with conflicting objectives. Survey §4.3.3. D3: emergent · D2: peer, hierarchical.

PaperVenuearXivNotesTags
A Survey of Collusion Risk in LLM-Powered Multi-Agent Systems — GhaemiNeurIPS WS 2025OpenReviewemergent survey collusion
Studying Coordination and Collusion in Multi-Agent LLM Code Reviews — AnonymousOpenReview 2025OpenReviewemergent collusion
Exposing Multi-Agent Collusion Risks in AI-Based Healthcare — AnonymousarXiv 20252512.03097emergent collusion healthcare
Beyond Single-Agent Safety: A Taxonomy of Risks in LLM-to-LLM Interactions — Bisconti et al.arXiv 20252512.02682emergent taxonomy
Emergent Social Intelligence Risks in Generative Multi-Agent Systems — Yue Huang, Yu Jiang, Wenjie Wang, Haomin Zhuang, Xiaonan Luo, Yuchen Ma, Zhangchen Xu, Zichen Chen, Nuno Moniz, Zinan Lin, Pin-Yu Chen, Nitesh V Chawla, Nouha Dziri, Huan Sun, Xiangliang ZhangarXiv 20262603.27771GitHubemergent collusion social-intelligence decentralised
HARP: Measuring Harm Amplification in Multi-Agent LLM Systems — Md Hafizur Rahman, Zafaryab Haider, Tanzim Mahfuz et al.arXiv 20262605.27489emergent composition compromise
Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs — Marcantonio Bracale Syrnikov, Federico Pierucci, Marcello Galisai et al.arXiv 20262601.11369emergent composition misalignment
Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce — Zeyuan Li, Lukas Petersson, Alessandro Acquisti et al.arXiv 20262608.14825emergent composition compromise
Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems — Jimmy Laurence Rippin, Simon C. Marshall, David Demitri Africa et al.arXiv 20262606.28425emergent composition misalignment
Agentic Copyright, Data Scraping & AI Governance: Toward a Coasean Bargain in the Era of Artificial Intelligence — Paulius Jurcys, Mark FenwickarXiv 20262604.07546emergent composition misalignment

8. Evaluation and Benchmarking

Scoped by the level at which a failure surfaces: component → interaction → composition. Survey §5. D6: evaluation method.

PaperVenuearXivNotesTags
Why Do Multi-Agent LLM Systems Fail? — Cemri et al.arXiv 20252503.13657emergent evaluation failure-taxonomy
AgentLeak: A Full-Stack Benchmark for Privacy Leakage in Multi-Agent LLM Systems — AnonymousarXiv 20262602.11510emergent benchmark full-stack
Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense — Saeid Jamshidi, Negar Shahabi, Foutse Khomh et al.arXiv 20262604.01127
Towards Position-Robust Talent Recommendation via Large Language Models — Silin Du, Hongyan LiuarXiv 20262604.02200amplified
Bilateral Intent-Enhanced Sequential Recommendation with Embedding Perturbation-Based Contrastive Learning — Shanfan Zhang, Yongyi Lin, Yuan RaoarXiv 20262604.02833
**ERASE: Benchmarking Feature Selection Methods for Deep Recommender
Systems** — Pengyue Jia, Yejing Wang, Zhaocheng Du et al.arXiv 20242403.12660via HuggingFace Paperscomponent drift
CogRec: A Cognitive Recommender Agent Fusing Large Language Models and Soar for Explainable Recommendation — Jiaxin Hu, Tao Wang, Bingsan Yang et al.arXiv 20252512.24113amplified component compromise
The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability — Guangneng HuarXiv 20252512.17389amplified component drift
Reveal Hidden Pitfalls and Navigate Next Generation of Vector Similarity Search from Task-Centric Views — Tingyang Chen, Cong Fu, Jiahua Wu et al.arXiv 20252512.12980composition drift
Combining LLM Semantic Reasoning with GNN Structural Modeling for Multi-View Multi-Label Feature Selection — Zhiqi Chen, Yuzhou Liu, Jiarui Liu et al.arXiv 20252511.08008component drift
ECKGBench: Benchmarking Large Language Models in E-commerce Leveraging Knowledge Graph — Langming Liu, Haibin Chen, Yuhao Wang et al.arXiv 20252503.15990amplified component drift
MARCO: A Cooperative Knowledge Transfer Framework for Personalized Cross-domain Recommendations — Lili Xie, Yi Zhang, Ruihong Qiu et al.arXiv 20252510.04508component drift
Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI — Anna Kozlova, Stanislau Salavei, Pavel Satalkin et al.arXiv 20262603.25821composition drift
LLMAR: A Tuning-Free Recommendation Framework for Sparse and Text-Rich Industrial Domains — Ryogo Hishikawa, Ichiro Kataoka, Shinya YudaarXiv 20262604.16379amplified component drift
MATRAG: Multi-Agent Transparent Retrieval-Augmented Generation for Explainable Recommendations — Sushant MehtaarXiv 20262604.20848component drift
RobustExplain: Evaluating Robustness of LLM-Based Explanation Agents for Recommendation — Guilin Zhang, Kai Zhao, Jeffrey Friedman et al.arXiv 20262601.19120component drift
Length-Adaptive Interest Network for Balancing Long and Short Sequence Modeling in CTR Prediction — Zhicheng Zhang, Zhaocheng Du, Jieming Zhu et al.arXiv 20262601.19142amplified component drift
A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing — Zhuohang Jiang, Yuxin Chen, Yongsen Pan et al.arXiv 20262608.04625component drift
DREAM Technical Report — Bin Zhang, Bowen Zheng, Chao Yi et al.arXiv 20262608.09408emergent composition compromise
RouteGuard: Certifying Routing Gain in LLM Multi-Agent Systems When Complementarity Is Not Enough — Anchen Sun, Kaiqi YangarXiv 20262608.07583component drift
CASPIAN: Online Detection and Attribution of Cascade Attacks in LLM Multi-Agent Systems via Cross-Channel Causal Monitoring — Kavana Venkatesh, Jafar Isbarov, Saad Amin et al.arXiv 20262605.19240emergent composition compromise

9. Mitigations

Organised by lifecycle stage: design-time containment → pre-deployment assurance → runtime detection → post-incident recovery → disclosure and governance. Survey §6. D6: defence.

PaperVenuearXivNotesTags
LlamaFirewall: An Open Source Guardrail System for Building Secure AI Agents — Meta AIarXiv 20252505.03574defence guardrail
PeerGuard: Defending Multi-Agent Systems Against Backdoor Attacks Through Mutual Reasoning — AnonymousarXiv 20252505.11642defence mutual-reasoning
GUARDIAN: Safeguarding LLM Multi-Agent Collaborations with Temporal Graph Modeling — AnonymousarXiv 20252505.19234defence graph monitoring
Safeguarding Multi-Agent Collaboration Through Credit-Based Dynamic Threat Detection — AnonymousarXiv 20252510.16219defence trust
SentinelAgent: Graph-based Anomaly Detection in LLM-based Multi-Agent Systems — He et al.arXiv 20252505.24201defence graph monitoring
A Review of Trust, Risk, and Security Management in LLM-based Agentic MAS (TRiSM) — AnonymousarXiv 20252506.04133defence survey governance
Securing Agentic AI: A Comprehensive Threat Model and Mitigation Framework — Narajala & NarayanarXiv 20252504.19956defence threat-model evaluation
Towards Secure Systems of Interacting AI Agents — AnonymousarXiv 20252505.02077defence formal
With a Little Help From My Friends: Collective Manipulation in Risk-Controlling Recommender Systems — Giovanni De Toni, Cristian Consonni, Erasmo Purificato et al.arXiv 20262603.28476
Agentic AI Frameworks: Architectures, Protocols, and Design Challenges — Hana Derouiche, Zaki Brahmi, Haithem MazeniarXiv 20252508.10146via HuggingFace Paperscomposition drift
Two is Better than One: Efficient Ensemble Defense for Robust and Compact Models — Yoojin Jung, Byung Cheol SongarXiv 20252504.04747classical adversarial RecSysamplified component compromise
ASTRA: Agentic Steerability and Risk Assessment Framework — Itay Hazan, Yael Mathov, Guy Shtar et al.arXiv 20252511.18114component compromise
Simulating Filter Bubble on Short-video Recommender System with Large Language Model Agents — Nicholas Sukiennik, Haoyu Wang, Zailin Zeng et al.arXiv 20252504.08742amplified component drift
Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection — Junjun Pan, Yixin Liu, Rui Miao et al.arXiv 20252512.18733component compromise
CITED: A Decision Boundary-Aware Signature for GNNs Towards Model Extraction Defense — Bolin Shen, Md Shamim Seraj, Zhan Cheng et al.arXiv 20262602.20418component compromise
Attacking and Defending Multi-Agent Collaborative Filtering Systems Through Connectivity — Anjun Hu, Hanting Xie, Saranya Govindan et al.arXiv 20262608.03272emergent component compromise

10. Broad Safety Surveys (Background)

Prior-era and general agent-safety surveys that the taxonomy builds on. Survey §2. D6: position paper.

PaperVenuearXivNotesTags
Agentic AI Needs a Systems Theory — Miehling et al.arXiv 20252503.00237systems-theory formal
A Comprehensive Survey in LLM(-Agent) Full Stack Safety — Wang et al.arXiv 20252504.15585survey
Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety — Ma et al.arXiv 20252502.05206survey
Agentic AI Security: Threats, Defenses, Evaluation — Chhabra et al.arXiv 20252510.23883survey
A Guide to Known Attacks and Impacts — AnonymousarXiv 20252506.23296incident-catalogue
A Taxonomy of Systemic Risks from General-Purpose AI — AnonymousarXiv 20242412.07780taxonomy systemic-risk
**MI9 -- Agent Intelligence Protocol: Runtime Governance for Agentic AI
Systems** — Charles L. Wang, Trisha Singhal, Ameya Kelkar et al.arXiv 20252508.03858via HuggingFace Papersemergent component drift
**Control Plane as a Tool: A Scalable Design Pattern for Agentic AI
Systems** — Sivasathivel KandasamyarXiv 20252505.06817via HuggingFace Paperscomponent drift

11. Uncategorised / New Additions

Papers added by crawler awaiting manual tagging.

PaperVenuearXivNotesTags
Let the Agent Steer: Closed-Loop Ranking Optimization via Influence Exchange — Yin Cheng, Liao Zhou, Xiyu Liang et al.arXiv 20262603.27765amplified
**Unbiased Recommender Learning from Missing-Not-At-Random Implicit
Feedback** — Yuta Saito, Suguru Yaginuma, Yuta Nishino et al.arXiv 20191909.03601via HuggingFace Papersamplified component drift
**Large Language Models are Competitive Near Cold-start Recommenders for
Language- and Item-based Preferences** — Scott Sanner, Krisztian Balog, Filip Radlinski et al.arXiv 20232307.14225via HuggingFace Papersamplified component drift
Matrix-Free Two-to-Infinity and One-to-Two Norms Estimation — Askar Tsyganov, Evgeny Frolov, Sergey Samsonov et al.arXiv 20252508.04444classical adversarial RecSysamplified component compromise
Navigating the Black Box: Leveraging LLMs for Effective Text-Level Graph Injection Attacks — Yuefei Lyu, Chaozhuo Li, Xi Zhang et al.arXiv 20252506.13276classical adversarial RecSysamplified component compromise
Invariance Matters: Empowering Social Recommendation via Graph Invariant Learning — Yonghui Yang, Le Wu, Yuxin Liao et al.arXiv 20252504.10432classical adversarial RecSysamplified component compromise
Towards Efficient Hypergraph and Multi-LLM Agent Recommender Systems — Tendai Mukande, Esraa Ali, Annalina Caputo et al.arXiv 20252512.06590amplified component drift
Agentic Explainable Artificial Intelligence (Agentic XAI) Approach To Explore Better Explanation — Tomoaki Yamaguchi, Yutong Zhou, Masahiro Ryo et al.arXiv 20252512.21066amplified component misalignment
Selective LLM-Guided Regularization for Enhancing Recommendation Models — Shanglin Yang, Zhan ShiarXiv 20252512.21526amplified component drift
STEP: Stepwise Curriculum Learning for Context-Knowledge Fusion in Conversational Recommendation — Zhenye Yang, Jinpeng Chen, Huan Li et al.arXiv 20252508.10669amplified component drift
Multi-agents based User Values Mining for Recommendation — Lijian Chen, Wei Yuan, Tong Chen et al.arXiv 20252505.00981amplified component drift
Bridging Legal Knowledge and AI: Retrieval-Augmented Generation with Vector Stores, Knowledge Graphs, and Hierarchical Non-negative Matrix Factorization — Ryan C. Barron, Maksim E. Eren, Olga M. Serafimova et al.arXiv 20252502.20364amplified component drift
Journalism-Guided Agentic In-Context Learning for News Stance Detection — Dahyun Lee, Jonghyeon Choi, Jiyoung Han et al.arXiv 20252507.11049amplified component drift
Hijacking online reviews: sparse manipulation and behavioral buffering in popularity-biased rating systems — Itsuki Fujisaki, Kunhao YangarXiv 20262604.13049amplified component compromise
VLM2Rec: Resolving Modality Collapse in Vision-Language Model Embedders for Multimodal Sequential Recommendation — Junyoung Kim, Woojoo Kim, Jaehyung Lim et al.arXiv 20262603.17450component drift
Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives — S Akash, Pratik Gajane, Jawar SingharXiv 20262603.18972amplified component compromise
A Cognitive Distribution and Behavior-Consistent Framework for Black-Box Attacks on Recommender Systems — Hongyue Zhang, Mingming Li, Dongqin Liu et al.arXiv 20262602.10633amplified component compromise
The Behavioral Fabric of LLM-Powered GUI Agents: Human Values and Interaction Outcomes — Simret Araya Gebreegziabher, Yukun Yang, Charles Chiang et al.arXiv 20262601.16356amplified component drift
AMEM4Rec: Leveraging Cross-User Similarity for Memory Evolution in Agentic LLM Recommenders — Minh-Duc Nguyen, Hai-Dang Kieu, Dung D. LearXiv 20262602.08837amplified composition drift
Structure-Preserving Projection for Mitigating Modality Bias in LLM-Based Sequential Recommendation — Tzu-Wei Chiu, Song-Duo Ma, Hsin-Yu Lin et al.arXiv 20262608.08583amplified component drift
Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons — Kaustubh Shivshankar Shejole, Tanish Agarwal, Arpit Agarwal et al.arXiv 20262608.10045amplified component compromise
Ranked by Position: Order Sensitivity as an Exploitable Attack Surface in LLM Listwise Recommenders — Ge Zhang, Jingru Cheng, Huiyuan ChenarXiv 20262607.24869amplified component compromise
RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle — Dongyang Ao, Kaixiang Fang, Shijie XuarXiv 20262608.11241amplified composition drift
Personalized Recommendation Tool Learning via Autonomous Language Agents — Mingdai Yang, Zhiwei Liu, Weizhi Zhang et al.arXiv 20262607.19739amplified component drift
Transparent and Controllable Recommendation Filtering via Multimodal Multi-Agent Collaboration — Chi Zhang, Zhipeng Xu, Jiahao Liu et al.arXiv 20262604.17459amplified component compromise

How to Contribute / Crawler Notes

This README is maintained by crawler.py in this repository. The crawler:

  1. Queries the arXiv API daily for new papers matching the taxonomy keywords
  2. Checks OpenReview for workshop/conference submissions (requires authentication)
  3. Crawls HuggingFace Papers for community-curated arXiv papers with GitHub links
  4. Tags each paper against the scope (component/interaction/composition), threat tier (drift/misalignment/compromise), and risk type (amplified/emergent)
  5. Saves unfiltered results to raw_crawl.json, then filters for relevance
  6. Commits the updated README automatically via GitHub Actions

To add a paper manually: edit papers.json and run python3 crawler.py --no-crawl.

Last crawler run: 2026-09-01

Contributors

anjunhu

14 commits

anjunhu/Awesome-Trustworthy-MARS

A reading list centred around building, breaking and auditing trustworthy multi-agent recommendation and retrieval systems.

Python

0

26 commits

updated Sep 1, 2026

See the code

README

Amplified and Emergent Safety Risks in Multi-Agent Recommendation and Retrieval

A living, auto-updated reading list. Taxonomy follows our TMLR survey and the CIKM '26 tutorial. Risks are organised by origin (D3: amplified vs. emergent) rather than by attack name. Updated weekly by automated crawler.

Last updated: 2026-09-01


Table of Contents


Taxonomy Overview

The six dimensions

Every entry is positioned against the survey's six-dimension framework; the sections below are grouped by D3.

DimensionValues
D1Architecture eranon-LLM recsys · single-agent LLM recsys · multi-agent LLM recsys
D2Composition patternhierarchical · pipeline · ensemble · peer (tool use cuts across all four)
D3Risk originamplified by composition · emergent under composition
D4Failure driverdrift · misalignment · compromise
D5Attack surfacememory · tool use · inter-agent comms · orchestration · item side · user side
D6Contribution typeempirical attack · evaluation method · defence · position paper

Systems are additionally placed on the Level of Autonomy ladder (L0 passive → L1 conversational → L2 retrieval-augmented → L3 tool-driven → L4 single-agent planner → L5 multi-agent orchestration, with L6 a conceptual endpoint). This reading list is about L5.

Risk origin (D3)

Risks are classified by the single-agent isolation test: an agent retains its full tool and memory interface, but no other agents consume or produce its messages.

  • Amplified (A): risk exists in single-agent settings but worsens under composition.
  • Emergent (E): risk only arises through agent interaction.

Threat tiers determine evaluation scope:

TierDescriptionEvaluation scope
DriftSystem dynamics cause degradation without adversaryComponent
MisalignmentInternal agent exploits its positionInteraction
CompromiseExternal attacker corrupts one or more agentsComposition

Tag legend

Each entry carries pills for its risk origin, evaluation scope, and failure driver, followed by free-form topic chips.

amplified emergent   risk origin (D3)
component interaction composition   evaluation scope
drift misalignment compromise   failure driver (D4)
recsys benchmark   topic

Badges are local SVG assets in assets/badges/, regenerated by python3 assets/make_badges.py. Colours follow the survey's Figure 1 palette; every pill meets WCAG AA contrast.

Evaluation Framework

Evaluation is organised by scope and setting:

ScopeOfflineOnline
ComponentPer-agent constraint checks, recommender metrics, adversarial promptingBehavioural drift detection
InteractionRed-teaming of agent pairs, protocol checks, counterfactual analysisInter-agent message trace monitoring
CompositionEnd-to-end stress tests, fairness audits, collusion auditsSystem-level KPIs, incident reconstruction

1. Foundational MA-RS Papers

Papers defining multi-agent recommender architectures — the systems whose risks we study. Survey §3 (composition patterns D2, attack surfaces D5).

PaperVenuearXivCodeTags
AgentCF: Collaborative Learning with Autonomous Language Agents for Recommender Systems — Zhang et al.WWW 20242310.09233user-modelling recsys
MACRec: A Multi-Agent Collaboration Framework for Recommendation — Wang et al.arXiv 20242402.15235recsys hierarchical
Orchestrating Users and Items for Agentic Recommendations (MACF) — Wu et al.arXiv 20252511.18413recsys decentralised
Towards Agentic Recommender Systems in the Era of Multimodal LLMs — Li et al.arXiv 20252503.16734recsys multimodal
A Survey on LLM-powered Agents for Recommender Systems — AnonymousarXiv 20252502.10050survey recsys
Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems — Yousefi et al.arXiv 20252507.02097survey recsys
No-Human in the Loop: Agentic Evaluation at Scale for Recommendation — Zhang et al.NeurIPS WS 20252511.03051evaluation recsys

Amplified Risks

2. Integrity Attacks

Poisoning, backdoors, and prompt injection: failures with a clear single-agent baseline whose reach, persistence, or severity grows under composition. Survey §4.2.1. D3: amplified · D5: item side, memory, tool use.

PaperVenuearXivNotesTags
Securing AI Agents Against Prompt Injection Attacks — Zhuang et al.arXiv 20252511.15759amplified
Multi-Agent Systems Execute Arbitrary Malicious Code — Debenedetti et al.arXiv 20252503.12188emergent code-execution
Breaking and Fixing Defenses Against Control-Flow Hijacking in Multi-Agent Systems — Debenedetti et al.arXiv 20252510.17276emergent control-flow
Jailbreaking LLMs via Iterative Tool-Disguised Attacks via RL — Chen et al.arXiv 20262601.05466amplified tool-misuse rl
INJECAGENT: Benchmarking Indirect Prompt Injections in LLM Agents — Zhan et al.ACL Findings 20242403.02691GitHubamplified benchmark indirect-injection
A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities — Pasquini et al.arXiv 20252505.04806amplified benchmark
A Real-World Case Study of Attacking ChatGPT via Lightweight Prompt Injection — Yu et al.arXiv 20252504.16125amplified real-world
Demystifying Prompt Injection Attacks on Agentic AI Coding Editors — AnonymousarXiv 20252509.22040amplified tool-misuse
Exploit Tool Invocation Prompt for Tool Behavior Hijacking — AnonymousarXiv 20252509.05755emergent tool-misuse
BadRec: Exploring Backdoor Attack and Defense for LLM-empowered Recommendations — Ning et al.arXiv 20252504.11182amplified backdoor recsys defence
LoRec: Large Language Model for Robust Sequential Recommendation against Poisoning Attacks — Wang et al.SIGIR 20242401.17723amplified recsys sequential defence
Manipulating Recommender Systems: A Survey of Poisoning Attacks and Countermeasures — Nguyen et al.arXiv 20242404.14942amplified survey recsys
A Survey on Adversarial Recommender Systems — Deldjoo et al.ACM CSUR 20212005.10322DOIamplified survey recsys
Shilling Recommender Systems by Generating Side-feature-aware Fake User Profiles — AnonymousarXiv 20252509.17918amplified shilling recsys
LLM-Powered Audits Expose Shilling Attacks in Recommender Systems — AnonymousarXiv 20252509.24961amplified shilling recsys defence
DrunkAgent: Stealthy Memory Corruption in LLM-Powered Recommender Agents — Yang et al.arXiv 20252503.23804amplified memory recsys
Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases — AnonymousarXiv 20242407.12784amplified memory rag
Human-Imperceptible Retrieval Poisoning Attacks in LLM-Powered Applications — AnonymousarXiv 20242404.17196amplified rag retrieval
**Improving the Shortest Plank: Vulnerability-Aware Adversarial Training
for Robust Recommender System** — Kaike Zhang, Qi Cao, Yunfan Wu et al.arXiv 20242409.17476via HuggingFace Papersamplified component compromise
The Misattribution Gap: When Memory Poisoning Looks Like Model Failure in Agentic AI Systems — Tanzim Ahad, Ismail Hossain, Md Jahangir Alam et al.arXiv 20262605.22842emergent composition compromise
LoReTTA: A Low Resource Framework To Poison Continuous Time Dynamic Graphs — Himanshu Pal, Venkata Sai Pranav Bachina, Ankit Gangwal et al.arXiv 20252511.07379classical adversarial RecSysamplified component compromise
Enhancing Robustness of Graph Neural Networks through p-Laplacian — Anuj Kumar Sirohi, Subhanu Halder, Kabir Kumar et al.arXiv 20252511.06143classical adversarial RecSysamplified component compromise
Controllable and Stealthy Shilling Attacks via Dispersive Latent Diffusion — Shutong Qiao, Wei Yuan, Junliang Yu et al.arXiv 20252508.01987classical adversarial RecSysamplified component compromise
AUV-Fusion: Cross-Modal Adversarial Fusion of User Interactions and Visual Perturbations Against VARS — Hai Ling, Tianchi Wang, Xiaohao Liu et al.arXiv 20252507.22880classical adversarial RecSysamplified component compromise
Spattack: Subgroup Poisoning Attacks on Federated Recommender Systems — Bo Yan, Yurong Hao, Dingqi Liu et al.arXiv 20252507.06258classical adversarial RecSysamplified component compromise
IndirectAD: Practical Data Poisoning Attacks against Recommender Systems for Item Promotion — Zihao Wang, Tianhao Mao, XiaoFeng Wang et al.arXiv 20252511.05845classical adversarial RecSysamplified component compromise
Retrieval-Augmented Review Generation for Poisoning Recommender Systems — Shiyi Yang, Xinshu Li, Guanglin Zhou et al.arXiv 20252508.15252classical adversarial RecSysamplified component compromise
Stealthy LLM-Driven Data Poisoning Attacks Against Embedding-Based Retrieval-Augmented Recommender Systems — Fatemeh Nazary, Yashar Deldjoo, Tommaso Di Noia et al.arXiv 20252505.05196classical adversarial RecSysamplified component compromise
Diversity-aware Dual-promotion Poisoning Attack on Sequential Recommendation — Yuchuan Zhao, Tong Chen, Junliang Yu et al.arXiv 20252504.06586classical adversarial RecSysamplified component compromise
Exploiting Meta-Learning-based Poisoning Attacks for Graph Link Prediction — Mingchen Li, Di Zhuang, Keyu Chen et al.arXiv 20252504.06492classical adversarial RecSysamplified component compromise
Poison-RAG: Adversarial Data Poisoning Attacks on Retrieval-Augmented Generation in Recommender Systems — Fatemeh Nazary, Yashar Deldjoo, Tommaso di NoiaarXiv 20252501.11759classical adversarial RecSysamplified component compromise
Single-Node Trigger Backdoor Attacks in Graph-Based Recommendation Systems — Runze Li, Di Jin, Xiaobao Wang et al.arXiv 20252506.08401classical adversarial RecSysamplified component compromise
LLM-Based User Simulation for Low-Knowledge Shilling Attacks on Recommender Systems — Shengkang Gu, Jiahao Liu, Dongsheng Li et al.arXiv 20252505.13528classical adversarial RecSysemergent component compromise
Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks — Viet K. Nguyen, Mohammad I. HusainarXiv 20252512.14860amplified component compromise
Membership Inference Attacks on LLM-based Recommender Systems — Jiajie He, Min-Chun Chen, Xintong Chen et al.arXiv 20252508.18665amplified component compromise
It's the Thought that Counts: Evaluating the Attempts of Frontier LLMs to Persuade on Harmful Topics — Matthew Kowal, Jasper Timm, Jean-Francois Godbout et al.arXiv 20252506.02873amplified component compromise
Exploring Approaches for Detecting Memorization of Recommender System Data in Large Language Models — Antonio Colacicco, Vito Guida, Dario Di Palma et al.arXiv 20262601.02002amplified component compromise
Autonomous Agents on Blockchains: Standards, Execution Models, and Trust Boundaries — Saad AlqithamiarXiv 20262601.04583emergent composition compromise
Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning — Jiachen QianarXiv 20262604.16966amplified interaction compromise

3. Privacy and Inversion

Leakage of preferences, histories, and demographics, including compositional leakage where individually benign disclosures combine. Survey §4.2.2. D3: amplified (emergent when disclosures compose) · D5: memory, user side.

PaperVenuearXivNotesTags
Privacy Risks of LLM-Empowered Recommender Systems: An Inversion Attack Perspective — Wang et al.RecSys 20252508.03703amplified inversion recsys
The Sum Leaks More Than Its Parts: Compositional Privacy Risks in Multi-Agent Collaboration — AnonymousarXiv 20252509.14284emergent compositional
Your Language Model Can Secretly Be a Steganographic Privacy Leaking Agent (TrojanStego) — AnonymousarXiv 20252505.20118amplified steganography
A Privacy-Enhanced Development Paradigm for Multi-Agent Collaboration Systems — AnonymousarXiv 20252505.04799amplified defence
The 1st Workshop on Human-Centered Recommender Systems — Kaike Zhang, Yunfan Wu, Yougang lyu et al.arXiv 20242411.14760via HuggingFace Papersamplified component drift
Robust Recommender System: A Survey and Future Directions — Kaike Zhang, Qi Cao, Fei Sun et al.arXiv 20232309.02057via HuggingFace Papersamplified component compromise
FedAU2: Attribute Unlearning for User-Level Federated Recommender Systems with Adaptive and Robust Adversarial Training — Yuyuan Li, Junjie Fang, Fengyuan Yu et al.arXiv 20252511.22872classical adversarial RecSysamplified component compromise
ADAGE: Active Defenses Against GNN Extraction — Jing Xu, Franziska Boenisch, Adam DziedzicarXiv 20252503.00065classical adversarial RecSysamplified component compromise
RAID: An In-Training Defense against Attribute Inference Attacks in Recommender Systems — Xiaohua Feng, Yuyuan Li, Fengyuan Yu et al.arXiv 20252504.11510classical adversarial RecSysamplified component compromise
Membership Inference Attack against Large Language Model-based Recommendation Systems: A New Distillation-based Paradigm — Li Cuihong, Huang Xiaowen, Yin Chuanhuan et al.arXiv 20252511.14763amplified component compromise
LLM4MEA: Data-free Model Extraction Attacks on Sequential Recommenders via Large Language Models — Shilong Zhao, Fei Sun, Kaike Zhang et al.arXiv 20252507.16969amplified component compromise
From AutoRecSys to AutoRecLab: A Call to Build, Evaluate, and Govern Autonomous Recommender-Systems Research Labs — Joeran Beel, Bela Gipp, Tobias Vente et al.arXiv 20252510.18104amplified composition drift
Customized Retrieval-Augmented Generation with LLM for Debiasing Recommendation Unlearning — Haichao Zhang, Chong Zhang, Peiyu Hu et al.arXiv 20252511.05494amplified component drift
Audit the Whisper: Detecting Steganographic Collusion in Multi-Agent LLMs — Om TailorarXiv 20252510.04303emergent composition misalignment
AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI — Rafflesia Khan, Declan Joyce, Mansura HabibaarXiv 20252512.03180emergent composition drift
Lightweight Fairness for LLM-Based Recommendations via Kernelized Projection and Gated Adapters — Nan Cui, Wendy Hui Wang, Yue NingarXiv 20262603.23780amplified component drift
Attack by Unlearning: Unlearning-Induced Adversarial Attacks on Graph Neural Networks — Jiahao Zhang, Yilong Wang, Suhang WangarXiv 20262603.18570amplified component compromise
FeDecider: An LLM-Based Framework for Federated Cross-Domain Recommendation — Xinrui He, Ting-Wei Li, Tianxin Wei et al.arXiv 20262602.16034amplified component drift
TRACER: Token ReAssignment for Concept ERasure in Generative Recommendation — Ziheng Chen, Jiali Cheng, Zezhong Fan et al.arXiv 20262606.07688amplified composition drift
Rethinking Fairness in LLM-Based Recommender Systems: A Survey — Song-Duo Ma, Chu-Yun Chen, Bang-An Li et al.arXiv 20262606.28340amplified component drift
Trustworthy Recommendation in the Era of Large Language Models: Opportunities and Challenges — Bohao Wang, Yu Cui, Zhenxiang Xu et al.arXiv 20262606.00540amplified component drift
Prompt Optimization for User Simulation in Conversational Recommender Systems: A Multi-Objective Framework — Nipun B Nair, Tongtong Wu, Weiqing WangarXiv 20262607.00010amplified component drift
From Hidden Profiles to Governable Personalization: Recommender Systems in the Age of LLM Agents — Jiahao Liu, Mingzhe Han, Guanming Liu et al.arXiv 20262604.20065amplified component drift

4. Bias, Fairness, and Feedback Loops

Exposure bias, popularity loops, and dark patterns, amplified by LLM fluency and by state that accumulates across turns and users. Survey §4.2.2. D3: amplified · D5: user side, item side.

PaperVenuearXivNotesTags
Bias Beware: The Impact of Cognitive Biases on LLM-Driven Product Recommendations — Krasniqi et al.EMNLP 20252502.01349amplified cognitive-bias recsys
DarkBench: Benchmarking Dark Patterns in Large Language Models — Kran et al.arXiv 20252503.10728amplified dark-patterns benchmark
An Inconspicuous Attack to Bias LLM Responses — AnonymousarXiv 20242406.04755amplified stealthy
Quantifying Cognitive Bias Induction in LLM-Generated Content — AnonymousarXiv 20252507.03194amplified cognitive-bias
Understanding Biases in ChatGPT-based Recommender Systems — AnonymousarXiv 20242401.10545amplified recsys
Stereotype or Personalization? User Identity Biases Chatbot Recommendations — AnonymousarXiv 20242410.05613amplified recsys stereotype
Bias Mitigation for AI-Feedback Loops in Recommender Systems — AnonymousarXiv 20252509.00109amplified feedback-loop recsys
Aligning Recommendations with User Popularity Preferences — Mona Schirmer, Anton Thielmann, Pola Schwöbel et al.arXiv 20262604.01036amplified
Retrieval Augmented Conversational Recommendation with Reinforcement Learning — Zhenrui Yue, Honglei Zhuang, Zhen Qin et al.arXiv 20262604.04457
Beyond Static Best-of-N: Bayesian List-wise Alignment for LLM-based Recommendation — Ruijun Chen, Chongming Gao, Jiawei Chen et al.arXiv 20262605.04559amplified component drift
Multi-Agent Large Language Models for Conversational Task-Solving — Jonas BeckerarXiv 20242410.22932via HuggingFace Papersemergent component drift
LLM as Explainable Re-Ranker for Recommendation System — Yaqi Wang, Haojia Sun, Shuting ZhangarXiv 20252512.03439amplified component drift
The 2nd Workshop on Human-Centered Recommender Systems — Kaike Zhang, Jiakai Tang, Du Su et al.arXiv 20252511.19979amplified component drift
UFO: Unfair-to-Fair Evolving Mitigates Unfairness in LLM-based Recommender Systems via Self-Play Fine-tuning — Jiaming Zhang, Yuyuan Li, Xiaohua Feng et al.arXiv 20252511.18342amplified component drift
Music Recommendation with Large Language Models: Challenges, Opportunities, and Evaluation — Elena V. Epure, Yashar Deldjoo, Bruno Sguerra et al.arXiv 20252511.16478amplified component drift
Vectorized Context-Aware Embeddings for GAT-Based Collaborative Filtering — Danial Ebrat, Sepideh Ahmadian, Luis RuedaarXiv 20252510.26461amplified component drift
Does LLM Focus on the Right Words? Mitigating Context Bias in LLM-based Recommenders — Bohao Wang, Jiawei Chen, Feng Liu et al.arXiv 20252510.10978amplified component drift
Ethical AI prompt recommendations in large language models using collaborative filtering — Jordan Nelson, Almas Baimagambetov, Konstantinos Avgerinakis et al.arXiv 20252510.06924amplified component drift
Where Should I Study? Biased Language Models Decide! Evaluating Fairness in LMs for Academic Recommendations — Krithi Shailya, Akhilesh Kumar Mishra, Gokul S Krishnan et al.arXiv 20252509.04498amplified component drift
Revealing Potential Biases in LLM-Based Recommender Systems in the Cold Start Setting — Alexandre Andre, Gauthier Roy, Eva Dyer et al.arXiv 20252508.20401amplified component drift
PerFairX: Is There a Balance Between Fairness and Personality in Large Language Model Recommendations? — Chandan Kumar SaharXiv 20252509.08829amplified component drift
ViLLA-MMBench: A Unified Benchmark Suite for LLM-Augmented Multimodal Movie Recommendation — Fatemeh Nazary, Ali Tourani, Yashar Deldjoo et al.arXiv 20252508.04206amplified component drift
Toward Safe and Human-Aligned Game Conversational Recommendation via Multi-Agent Decomposition — Zheng Hui, Xiaokai Wei, Yexi Jiang et al.arXiv 20252504.20094amplified component compromise
Breaking User-Centric Agency: A Tri-Party Framework for Agent-Based Recommendation — Yaxin Gong, Chongming Gao, Chenxiao Fan et al.arXiv 20262603.10673amplified component drift
Ablation Study of a Fairness Auditing Agentic System for Bias Mitigation in Early-Onset Colorectal Cancer Detection — Amalia Ionescu, Jose Guadalupe Hernandez, Jui-Hsuan Chang et al.arXiv 20262603.17179amplified composition drift
LLMs as Orchestrators: Constraint-Compliant Multi-Agent Optimization for Recommendation Systems — Guilin Zhang, Kai Zhao, Jeffrey Friedman et al.arXiv 20262601.19121amplified component drift
Can Fairness Be Prompted? Prompt-Based Debiasing Strategies in High-Stakes Recommendations — Mihaela Rotar, Theresia Veronika Rampisela, Maria MaistroarXiv 20262603.12935amplified component drift
Uncertainty and Fairness Awareness in LLM-Based Recommendation Systems — Chandan Kumar Sah, Xiaoli Lian, Li Zhang et al.arXiv 20262602.02582amplified component drift
HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems — Sushant MehtaarXiv 20262601.19197amplified component drift
Towards Fair Large Language Model-based Recommender Systems without Costly Retraining — Jin Li, Huilin Gu, Shoujin Wang et al.arXiv 20262601.17492amplified component drift
Bridging Semantic Understanding and Popularity Bias with LLMs — Renqiang Luo, Dong Zhang, Yupeng Gao et al.arXiv 20262601.09478amplified component drift
Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders — Chan Aristella Lu, Arya Fayyazi, Junhao Zhang et al.arXiv 20262608.08284amplified composition drift
LBR: Towards Mitigating Length Bias in Large Language Models for Recommendation — Hongchen Li, Bohao Wang, Jingbang Chen et al.arXiv 20262607.04270amplified component drift
When to Ask a Question: Understanding Communication Strategies in Generative AI Tools — Charlotte Park, Kate Donahue, Manish RaghavanarXiv 20262605.11240amplified component drift
Can We Steer the Black-Box? Towards Controllability-Centric Evaluation of Recommender Systems with Collaborative Agents — Jiwen Zhou, Xiang Liu, Mingming Li et al.arXiv 20262607.13418amplified component drift

Emergent Risks

5. Belief Formation and Aggregation

Premature consensus, correlated error, and degenerate agreement: failures of how agents form and pool judgements. Survey §4.3.1. D3: emergent · D2: ensemble, peer.

PaperVenuearXivNotesTags
Consensus vs. Dissent: Dynamic LLM Modeling of Subjective Preferences in Group Recommenders — Cedric Waterschoot, Nava Tintarev, Francesco BarilearXiv 20262607.10235amplified component drift
CAPRA: Scaling Feedback on Software Architecture Deliverables with a Multi-Agent LLM System — Marco Becattini, Niccolò Caselli, Matteo Minin et al.arXiv 20262606.18976amplified component drift

6. Coordination and Delegation

Unverified delegation, cascading failure, prompt infection, and resource exhaustion along inter-agent paths. Survey §4.3.2. D3: emergent · D5: inter-agent comms, orchestration.

PaperVenuearXivNotesTags
Red-Teaming LLM Multi-Agent Systems via Communication Attacks (AiTM) — Chen et al.arXiv 20252502.14847emergent aitm
Topology-Aware Multi-Hop Attacks on LLM-Based Multi-Agent Systems — AnonymousarXiv 20252512.04129emergent topology
Breaking Pragmatic Multi-Agent LLM Systems with Optimized Prompt Attacks — Gu et al.arXiv 20252504.00218emergent optimisation
Contagious Recursive Blocking Attacks on Multi-Agent Systems (Corba) — AnonymousarXiv 20252502.14529emergent dos
A Multi-round Adaptive Stealthy Tampering Framework for LLM-MAS — AnonymousarXiv 20252508.03125emergent stealthy
Security Analysis of Agentic AI Communication Protocols — Louck et al.arXiv 20252511.03841emergent protocol
The Trust Paradox in LLM-Based Multi-Agent Systems — Xu et al.arXiv 20252510.18563emergent trust
Systems Security Foundations for Agentic Computing — Christodorescu et al.arXiv 20252512.01295emergent systems-security
A Benchmark for Tool Poisoning Attack on Real-World MCP Servers — AnonymousarXiv 20252508.14925emergent mcp tool-misuse
Advertisement Embedding Attacks Against Large Language Models — AnonymousarXiv 20252508.17674emergent advertising
A Safety-Aware Role-Orchestrated Multi-Agent LLM Framework for Behavioral Health Communication Simulation — Ha Na ChoarXiv 20262604.00249emergent

7. Strategic Interaction and Governance

Collusion, collective manipulation, and misreporting between agents representing parties with conflicting objectives. Survey §4.3.3. D3: emergent · D2: peer, hierarchical.

PaperVenuearXivNotesTags
A Survey of Collusion Risk in LLM-Powered Multi-Agent Systems — GhaemiNeurIPS WS 2025OpenReviewemergent survey collusion
Studying Coordination and Collusion in Multi-Agent LLM Code Reviews — AnonymousOpenReview 2025OpenReviewemergent collusion
Exposing Multi-Agent Collusion Risks in AI-Based Healthcare — AnonymousarXiv 20252512.03097emergent collusion healthcare
Beyond Single-Agent Safety: A Taxonomy of Risks in LLM-to-LLM Interactions — Bisconti et al.arXiv 20252512.02682emergent taxonomy
Emergent Social Intelligence Risks in Generative Multi-Agent Systems — Yue Huang, Yu Jiang, Wenjie Wang, Haomin Zhuang, Xiaonan Luo, Yuchen Ma, Zhangchen Xu, Zichen Chen, Nuno Moniz, Zinan Lin, Pin-Yu Chen, Nitesh V Chawla, Nouha Dziri, Huan Sun, Xiangliang ZhangarXiv 20262603.27771GitHubemergent collusion social-intelligence decentralised
HARP: Measuring Harm Amplification in Multi-Agent LLM Systems — Md Hafizur Rahman, Zafaryab Haider, Tanzim Mahfuz et al.arXiv 20262605.27489emergent composition compromise
Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs — Marcantonio Bracale Syrnikov, Federico Pierucci, Marcello Galisai et al.arXiv 20262601.11369emergent composition misalignment
Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce — Zeyuan Li, Lukas Petersson, Alessandro Acquisti et al.arXiv 20262608.14825emergent composition compromise
Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems — Jimmy Laurence Rippin, Simon C. Marshall, David Demitri Africa et al.arXiv 20262606.28425emergent composition misalignment
Agentic Copyright, Data Scraping & AI Governance: Toward a Coasean Bargain in the Era of Artificial Intelligence — Paulius Jurcys, Mark FenwickarXiv 20262604.07546emergent composition misalignment

8. Evaluation and Benchmarking

Scoped by the level at which a failure surfaces: component → interaction → composition. Survey §5. D6: evaluation method.

PaperVenuearXivNotesTags
Why Do Multi-Agent LLM Systems Fail? — Cemri et al.arXiv 20252503.13657emergent evaluation failure-taxonomy
AgentLeak: A Full-Stack Benchmark for Privacy Leakage in Multi-Agent LLM Systems — AnonymousarXiv 20262602.11510emergent benchmark full-stack
Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense — Saeid Jamshidi, Negar Shahabi, Foutse Khomh et al.arXiv 20262604.01127
Towards Position-Robust Talent Recommendation via Large Language Models — Silin Du, Hongyan LiuarXiv 20262604.02200amplified
Bilateral Intent-Enhanced Sequential Recommendation with Embedding Perturbation-Based Contrastive Learning — Shanfan Zhang, Yongyi Lin, Yuan RaoarXiv 20262604.02833
**ERASE: Benchmarking Feature Selection Methods for Deep Recommender
Systems** — Pengyue Jia, Yejing Wang, Zhaocheng Du et al.arXiv 20242403.12660via HuggingFace Paperscomponent drift
CogRec: A Cognitive Recommender Agent Fusing Large Language Models and Soar for Explainable Recommendation — Jiaxin Hu, Tao Wang, Bingsan Yang et al.arXiv 20252512.24113amplified component compromise
The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability — Guangneng HuarXiv 20252512.17389amplified component drift
Reveal Hidden Pitfalls and Navigate Next Generation of Vector Similarity Search from Task-Centric Views — Tingyang Chen, Cong Fu, Jiahua Wu et al.arXiv 20252512.12980composition drift
Combining LLM Semantic Reasoning with GNN Structural Modeling for Multi-View Multi-Label Feature Selection — Zhiqi Chen, Yuzhou Liu, Jiarui Liu et al.arXiv 20252511.08008component drift
ECKGBench: Benchmarking Large Language Models in E-commerce Leveraging Knowledge Graph — Langming Liu, Haibin Chen, Yuhao Wang et al.arXiv 20252503.15990amplified component drift
MARCO: A Cooperative Knowledge Transfer Framework for Personalized Cross-domain Recommendations — Lili Xie, Yi Zhang, Ruihong Qiu et al.arXiv 20252510.04508component drift
Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI — Anna Kozlova, Stanislau Salavei, Pavel Satalkin et al.arXiv 20262603.25821composition drift
LLMAR: A Tuning-Free Recommendation Framework for Sparse and Text-Rich Industrial Domains — Ryogo Hishikawa, Ichiro Kataoka, Shinya YudaarXiv 20262604.16379amplified component drift
MATRAG: Multi-Agent Transparent Retrieval-Augmented Generation for Explainable Recommendations — Sushant MehtaarXiv 20262604.20848component drift
RobustExplain: Evaluating Robustness of LLM-Based Explanation Agents for Recommendation — Guilin Zhang, Kai Zhao, Jeffrey Friedman et al.arXiv 20262601.19120component drift
Length-Adaptive Interest Network for Balancing Long and Short Sequence Modeling in CTR Prediction — Zhicheng Zhang, Zhaocheng Du, Jieming Zhu et al.arXiv 20262601.19142amplified component drift
A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing — Zhuohang Jiang, Yuxin Chen, Yongsen Pan et al.arXiv 20262608.04625component drift
DREAM Technical Report — Bin Zhang, Bowen Zheng, Chao Yi et al.arXiv 20262608.09408emergent composition compromise
RouteGuard: Certifying Routing Gain in LLM Multi-Agent Systems When Complementarity Is Not Enough — Anchen Sun, Kaiqi YangarXiv 20262608.07583component drift
CASPIAN: Online Detection and Attribution of Cascade Attacks in LLM Multi-Agent Systems via Cross-Channel Causal Monitoring — Kavana Venkatesh, Jafar Isbarov, Saad Amin et al.arXiv 20262605.19240emergent composition compromise

9. Mitigations

Organised by lifecycle stage: design-time containment → pre-deployment assurance → runtime detection → post-incident recovery → disclosure and governance. Survey §6. D6: defence.

PaperVenuearXivNotesTags
LlamaFirewall: An Open Source Guardrail System for Building Secure AI Agents — Meta AIarXiv 20252505.03574defence guardrail
PeerGuard: Defending Multi-Agent Systems Against Backdoor Attacks Through Mutual Reasoning — AnonymousarXiv 20252505.11642defence mutual-reasoning
GUARDIAN: Safeguarding LLM Multi-Agent Collaborations with Temporal Graph Modeling — AnonymousarXiv 20252505.19234defence graph monitoring
Safeguarding Multi-Agent Collaboration Through Credit-Based Dynamic Threat Detection — AnonymousarXiv 20252510.16219defence trust
SentinelAgent: Graph-based Anomaly Detection in LLM-based Multi-Agent Systems — He et al.arXiv 20252505.24201defence graph monitoring
A Review of Trust, Risk, and Security Management in LLM-based Agentic MAS (TRiSM) — AnonymousarXiv 20252506.04133defence survey governance
Securing Agentic AI: A Comprehensive Threat Model and Mitigation Framework — Narajala & NarayanarXiv 20252504.19956defence threat-model evaluation
Towards Secure Systems of Interacting AI Agents — AnonymousarXiv 20252505.02077defence formal
With a Little Help From My Friends: Collective Manipulation in Risk-Controlling Recommender Systems — Giovanni De Toni, Cristian Consonni, Erasmo Purificato et al.arXiv 20262603.28476
Agentic AI Frameworks: Architectures, Protocols, and Design Challenges — Hana Derouiche, Zaki Brahmi, Haithem MazeniarXiv 20252508.10146via HuggingFace Paperscomposition drift
Two is Better than One: Efficient Ensemble Defense for Robust and Compact Models — Yoojin Jung, Byung Cheol SongarXiv 20252504.04747classical adversarial RecSysamplified component compromise
ASTRA: Agentic Steerability and Risk Assessment Framework — Itay Hazan, Yael Mathov, Guy Shtar et al.arXiv 20252511.18114component compromise
Simulating Filter Bubble on Short-video Recommender System with Large Language Model Agents — Nicholas Sukiennik, Haoyu Wang, Zailin Zeng et al.arXiv 20252504.08742amplified component drift
Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection — Junjun Pan, Yixin Liu, Rui Miao et al.arXiv 20252512.18733component compromise
CITED: A Decision Boundary-Aware Signature for GNNs Towards Model Extraction Defense — Bolin Shen, Md Shamim Seraj, Zhan Cheng et al.arXiv 20262602.20418component compromise
Attacking and Defending Multi-Agent Collaborative Filtering Systems Through Connectivity — Anjun Hu, Hanting Xie, Saranya Govindan et al.arXiv 20262608.03272emergent component compromise

10. Broad Safety Surveys (Background)

Prior-era and general agent-safety surveys that the taxonomy builds on. Survey §2. D6: position paper.

PaperVenuearXivNotesTags
Agentic AI Needs a Systems Theory — Miehling et al.arXiv 20252503.00237systems-theory formal
A Comprehensive Survey in LLM(-Agent) Full Stack Safety — Wang et al.arXiv 20252504.15585survey
Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety — Ma et al.arXiv 20252502.05206survey
Agentic AI Security: Threats, Defenses, Evaluation — Chhabra et al.arXiv 20252510.23883survey
A Guide to Known Attacks and Impacts — AnonymousarXiv 20252506.23296incident-catalogue
A Taxonomy of Systemic Risks from General-Purpose AI — AnonymousarXiv 20242412.07780taxonomy systemic-risk
**MI9 -- Agent Intelligence Protocol: Runtime Governance for Agentic AI
Systems** — Charles L. Wang, Trisha Singhal, Ameya Kelkar et al.arXiv 20252508.03858via HuggingFace Papersemergent component drift
**Control Plane as a Tool: A Scalable Design Pattern for Agentic AI
Systems** — Sivasathivel KandasamyarXiv 20252505.06817via HuggingFace Paperscomponent drift

11. Uncategorised / New Additions

Papers added by crawler awaiting manual tagging.

PaperVenuearXivNotesTags
Let the Agent Steer: Closed-Loop Ranking Optimization via Influence Exchange — Yin Cheng, Liao Zhou, Xiyu Liang et al.arXiv 20262603.27765amplified
**Unbiased Recommender Learning from Missing-Not-At-Random Implicit
Feedback** — Yuta Saito, Suguru Yaginuma, Yuta Nishino et al.arXiv 20191909.03601via HuggingFace Papersamplified component drift
**Large Language Models are Competitive Near Cold-start Recommenders for
Language- and Item-based Preferences** — Scott Sanner, Krisztian Balog, Filip Radlinski et al.arXiv 20232307.14225via HuggingFace Papersamplified component drift
Matrix-Free Two-to-Infinity and One-to-Two Norms Estimation — Askar Tsyganov, Evgeny Frolov, Sergey Samsonov et al.arXiv 20252508.04444classical adversarial RecSysamplified component compromise
Navigating the Black Box: Leveraging LLMs for Effective Text-Level Graph Injection Attacks — Yuefei Lyu, Chaozhuo Li, Xi Zhang et al.arXiv 20252506.13276classical adversarial RecSysamplified component compromise
Invariance Matters: Empowering Social Recommendation via Graph Invariant Learning — Yonghui Yang, Le Wu, Yuxin Liao et al.arXiv 20252504.10432classical adversarial RecSysamplified component compromise
Towards Efficient Hypergraph and Multi-LLM Agent Recommender Systems — Tendai Mukande, Esraa Ali, Annalina Caputo et al.arXiv 20252512.06590amplified component drift
Agentic Explainable Artificial Intelligence (Agentic XAI) Approach To Explore Better Explanation — Tomoaki Yamaguchi, Yutong Zhou, Masahiro Ryo et al.arXiv 20252512.21066amplified component misalignment
Selective LLM-Guided Regularization for Enhancing Recommendation Models — Shanglin Yang, Zhan ShiarXiv 20252512.21526amplified component drift
STEP: Stepwise Curriculum Learning for Context-Knowledge Fusion in Conversational Recommendation — Zhenye Yang, Jinpeng Chen, Huan Li et al.arXiv 20252508.10669amplified component drift
Multi-agents based User Values Mining for Recommendation — Lijian Chen, Wei Yuan, Tong Chen et al.arXiv 20252505.00981amplified component drift
Bridging Legal Knowledge and AI: Retrieval-Augmented Generation with Vector Stores, Knowledge Graphs, and Hierarchical Non-negative Matrix Factorization — Ryan C. Barron, Maksim E. Eren, Olga M. Serafimova et al.arXiv 20252502.20364amplified component drift
Journalism-Guided Agentic In-Context Learning for News Stance Detection — Dahyun Lee, Jonghyeon Choi, Jiyoung Han et al.arXiv 20252507.11049amplified component drift
Hijacking online reviews: sparse manipulation and behavioral buffering in popularity-biased rating systems — Itsuki Fujisaki, Kunhao YangarXiv 20262604.13049amplified component compromise
VLM2Rec: Resolving Modality Collapse in Vision-Language Model Embedders for Multimodal Sequential Recommendation — Junyoung Kim, Woojoo Kim, Jaehyung Lim et al.arXiv 20262603.17450component drift
Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives — S Akash, Pratik Gajane, Jawar SingharXiv 20262603.18972amplified component compromise
A Cognitive Distribution and Behavior-Consistent Framework for Black-Box Attacks on Recommender Systems — Hongyue Zhang, Mingming Li, Dongqin Liu et al.arXiv 20262602.10633amplified component compromise
The Behavioral Fabric of LLM-Powered GUI Agents: Human Values and Interaction Outcomes — Simret Araya Gebreegziabher, Yukun Yang, Charles Chiang et al.arXiv 20262601.16356amplified component drift
AMEM4Rec: Leveraging Cross-User Similarity for Memory Evolution in Agentic LLM Recommenders — Minh-Duc Nguyen, Hai-Dang Kieu, Dung D. LearXiv 20262602.08837amplified composition drift
Structure-Preserving Projection for Mitigating Modality Bias in LLM-Based Sequential Recommendation — Tzu-Wei Chiu, Song-Duo Ma, Hsin-Yu Lin et al.arXiv 20262608.08583amplified component drift
Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons — Kaustubh Shivshankar Shejole, Tanish Agarwal, Arpit Agarwal et al.arXiv 20262608.10045amplified component compromise
Ranked by Position: Order Sensitivity as an Exploitable Attack Surface in LLM Listwise Recommenders — Ge Zhang, Jingru Cheng, Huiyuan ChenarXiv 20262607.24869amplified component compromise
RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle — Dongyang Ao, Kaixiang Fang, Shijie XuarXiv 20262608.11241amplified composition drift
Personalized Recommendation Tool Learning via Autonomous Language Agents — Mingdai Yang, Zhiwei Liu, Weizhi Zhang et al.arXiv 20262607.19739amplified component drift
Transparent and Controllable Recommendation Filtering via Multimodal Multi-Agent Collaboration — Chi Zhang, Zhipeng Xu, Jiahao Liu et al.arXiv 20262604.17459amplified component compromise

How to Contribute / Crawler Notes

This README is maintained by crawler.py in this repository. The crawler:

  1. Queries the arXiv API daily for new papers matching the taxonomy keywords
  2. Checks OpenReview for workshop/conference submissions (requires authentication)
  3. Crawls HuggingFace Papers for community-curated arXiv papers with GitHub links
  4. Tags each paper against the scope (component/interaction/composition), threat tier (drift/misalignment/compromise), and risk type (amplified/emergent)
  5. Saves unfiltered results to raw_crawl.json, then filters for relevance
  6. Commits the updated README automatically via GitHub Actions

To add a paper manually: edit papers.json and run python3 crawler.py --no-crawl.

Last crawler run: 2026-09-01

Contributors

anjunhu

14 commits

Languages

Python

98.9%

Shell

1.1%