DataArcTech/Awesome-Agent-Skill-Papers

The repo of survey paper "A Survey of Agent Skills: Toward Procedural Infrastructure for LLM Agents"

22

7 commits

updated May 19, 2026

See the code

README

🧩 A Survey of Agent Skills: Toward Procedural Infrastructure for LLM Agents

Taxonomy of agent skills

🌐 Preprint Link · 📄 PDF File · 🗺️ Taxonomy · 📚 Paper List · ✨ Contribute

🌟 Overview

Agent skills are emerging as a reusable procedural layer for LLM agents: they compress experience, encode domain know-how, package workflows, and help agents retrieve, compose, execute, refine, and govern capabilities across tasks. This repository accompanies the survey A Survey of Agent Skills: Toward Procedural Infrastructure for LLM Agents and collects papers around the agent-skill ecosystem.

🫆 Citation

@article{yang2026asurveyofagentskills,
	doi = {10.20944/preprints202605.1276.v1},
	url = {https://doi.org/10.20944/preprints202605.1276.v1},
	year = 2026,
	month = {May},
	publisher = {Preprints},
	author = {Cehao Yang and Xiaojun Wu and Honghao Liu and Xueyuan Lin and Chengjin Xu and Xuhui Jiang and Yuanliang Sun and Wenjie Zhang and Zhichao Shi and Yijie Xu and Jia Li and Hui Xiong and Jian Guo},
	title = {A Survey of Agent Skills: Toward Procedural Infrastructure for LLM Agents},
	journal = {Preprints}
}

🗺️ Taxonomy at a Glance

The survey organizes agent-skill research into six connected layers:

IconLayerWhat it Covers
🧠OntologyWhat a skill is, how it relates to memory, cognition, compression, and reusable procedural knowledge.
📦Representation and PackagingHow skills are written, structured, serialized, distributed, and packaged.
🔁LifecycleHow skills are acquired, stored, retrieved, executed, refined, retired, and internalized.
⚙️Runtime IntegrationHow skills connect to terminals, tools, multi-agent systems, benchmarks, and execution harnesses.
🛡️GovernanceHow skill ecosystems handle marketplaces, security risks, safety, auditing, and trustworthy usage.
🚀ApplicationWhere agent skills are used in embodied robotics, games, web agents, GUI/mobile/OS agents, and coding workflows.

✨ Tips for Uploading Papers

Suggested row format:

| Paper Title | [arXiv](https://arxiv.org/abs/xxxx.xxxxx) | Author A, Author B, Author C | 2026 |

🧠 Layer 1: Ontology

Starting from Memory: The Cognitive Architecture of Agents

Paper TitlePaper URLAuthor ListYear
ReAct: Synergizing Reasoning and Acting in Language Modelshttps://arxiv.org/abs/2210.03629Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao2023
Cognitive Architectures for Language Agentshttps://arxiv.org/abs/2309.02427Theodore R. Sumers, Shunyu Yao, Karthik Narasimhan, Thomas L. Griffiths2024
A Survey on the Memory Mechanism of Large Language Model based Agentshttps://arxiv.org/abs/2404.13501Zeyu Zhang, Xiaohe Bo, Chen Ma, Rui Li, Xu Chen, Quanyu Dai, Jieming Zhu, Zhenhua Dong, Ji-Rong Wen2024

Human Inspiration: Skill as Compression from Memory to Pattern

Paper TitlePaper URLAuthor ListYear
Experience Compression Spectrum: Unifying Memory, Skills, and Rules in LLM Agentshttps://arxiv.org/abs/2604.15877Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He2026
Procedural Knowledge Improves Agentic LLM Workflowshttps://arxiv.org/abs/2511.07568Vincent Hsiao, Mark Roberts, Leslie Smith2025

Skill as a Medium: Distilling and Reusing Human Wisdom

Paper TitlePaper URLAuthor ListYear
SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Taskshttps://arxiv.org/abs/2602.12670Xiangyi Li, Wenbo Chen, Yimin Liu, Shenghan Zheng, Xiaokun Chen, Yifeng He, Yubo Li, Bingran You, Haotian Shen, Jiankai Sun, Shuyi Wang, Binxu Li, Qunhong Zeng, Di Wang, Xuandong Zhao, Yuanli Wang, Roey Ben Chaim, Zonglin Di, Yipeng Gao, Junwei He, Yizhuo He, Liqiang Jing, Luyang Kong, Xin Lan, Jiachen Li, Songlin Li, Yijiang Li, Yueqian Lin, Xinyi Liu, Xuanqing Liu, Haoran Lyu, Ze Ma, Bowei Wang, Runhui Wang, Tianyu Wang, Wengao Ye, Yue Zhang, Hanwen Xing, Yiqi Xue, Steven Dillmann, Han-chung Lee2026
ExpeL: LLM Agents Are Experiential Learnershttps://arxiv.org/abs/2308.10144Andrew Zhao, Daniel Huang, Quentin Xu, Matthieu Lin, Yong-Jin Liu, Gao Huang2024
SOP-Agent: Empower General Purpose AI Agent with Domain-Specific SOPshttps://arxiv.org/abs/2501.09316Anbang Ye, Qianran Ma, Jia Chen, Muqi Li, Tong Li, Fujiao Liu, Siqi Mai, Meichen Lu, Haitao Bao, Yang You2025
Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionalityhttps://arxiv.org/abs/2602.08004George Ling, Shanshan Zhong, Richard Huang2026

📦 Layer 2: Representation and Packaging

Natural Language

Paper TitlePaper URLAuthor ListYear
ExpeL: LLM Agents Are Experiential Learnershttps://arxiv.org/abs/2308.10144Andrew Zhao, Daniel Huang, Quentin Xu, Matthieu Lin, Yong-Jin Liu, Gao Huang2024

Code Snippets

Paper TitlePaper URLAuthor ListYear
Voyager: An Open-Ended Embodied Agent with Large Language Modelshttps://arxiv.org/abs/2305.16291Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar2023

Decision Graph

Paper TitlePaper URLAuthor ListYear
SOP-Agent: Empower General Purpose AI Agent with Domain-Specific SOPshttps://arxiv.org/abs/2501.09316Anbang Ye, Qianran Ma, Jia Chen, Muqi Li, Tong Li, Fujiao Liu, Siqi Mai, Meichen Lu, Haitao Bao, Yang You2025

Advanced Design

Paper TitlePaper URLAuthor ListYear
Skilldex: A Package Manager and Registry for Agent Skill Packages with Hierarchical Scope-Based Distributionhttps://arxiv.org/abs/2604.16911Sampriti Saha, Pranav Hemanth2026
From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skillshttps://arxiv.org/abs/2604.24026Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu2026

🔁 Layer 3: Lifecycle

Acquisition Stage

Paper TitlePaper URLAuthor ListYear
Inducing Programmatic Skills for Agentic Taskshttps://arxiv.org/abs/2504.06821Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig, Daniel Fried2025
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skillshttps://arxiv.org/abs/2504.07079Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, Yu Su2025
Automated Skill Discovery for Language Agents through Exploration and Iterative Feedbackhttps://arxiv.org/abs/2506.04287Yongjin Yang, Sinjae Kang, Juyong Lee, Dongjun Lee, Se-Young Yun, Kimin Lee2025
SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?https://arxiv.org/abs/2603.00718Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh2026
SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learninghttps://arxiv.org/abs/2602.08234Peng Xia, Jianwen Chen, Hanyang Wang, Jiaqi Liu, Kaide Zeng, Yu Wang, Siwei Han, Yiyang Zhou, Xujiang Zhao, Haifeng Chen, Zeyu Zheng, Cihang Xie, Huaxiu Yao2026
SkillX: Automatically Constructing Skill Knowledge Bases for Agentshttps://arxiv.org/abs/2604.04804Chenxi Wang, Zhuoyun Yu, Xin Xie, Wuguannan Yao, Runnan Fang, Shuofei Qiao, Kexin Cao, Guozhou Zheng, Xiang Qi, Peng Zhang, Shumin Deng2026
Dynamic Dual-Granularity Skill Bank for Agentic RLhttps://arxiv.org/abs/2603.28716Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao2026
XSkill: Continual Learning from Experience and Skills in Multimodal Agentshttps://arxiv.org/abs/2603.12056Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung2026
Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agentshttps://arxiv.org/abs/2602.01869Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang2026
Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Taskshttps://arxiv.org/abs/2604.20987Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha2026
Skillact: Using skill abstractions improves llm agentshttps://openreview.net/forum?id=6LG3cIRrF4Anthony Zhe Liu, Jongwook Choi, Sungryull Sohn, Yao Fu, Jaekyeom Kim, Dong-Ki Kim, Xinhe Wang, Jaewon Yoo, Honglak Lee2024
PolySkill: Learning Generalizable Skills Through Polymorphic Abstractionhttps://arxiv.org/abs/2510.15863Simon Yu, Gang Li, Weiyan Shi, Peng Qi2026
CASCADE: Cumulative Agentic Skill Creation through Autonomous Development and Evolutionhttps://arxiv.org/abs/2512.23880Xu Huang, Junwu Chen, Yuxing Fei, Zhuohan Li, Philippe Schwaller, Gerbrand Ceder2026
SKILLFOUNDRY: Building Self-Evolving Agent Skill Libraries from Heterogeneous Scientific Resourceshttps://arxiv.org/abs/2604.03964Shuaike Shen, Wenduo Cheng, Mingqian Ma, Alistair Turcan, Martin Jinye Zhang, Jian Ma2026
Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skillshttps://arxiv.org/abs/2603.25158Jingwei Ni, Yihao Liu, Xinpeng Liu, Yutao Sun, Mengyu Zhou, Pengyu Cheng, Dexin Wang, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang2026
ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learninghttps://arxiv.org/abs/2603.16060Yu Li, Rui Miao, Zhengling Qi, Tian Lan2026
CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verificationhttps://arxiv.org/abs/2604.01687Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, Chengze Li, Wei-Chieh Huang, Yifei Yao, Kening Zheng, Xue Liu, Xiaoxiao Li, Philip S. Yu2026
AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolutionhttps://arxiv.org/abs/2603.01145Yutao Yang, Junsong Li, Qianjun Pan, Bihao Zhan, Yuxuan Cai, Lin Du, Jie Zhou, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Liang He2026

Storage Stage

Paper TitlePaper URLAuthor ListYear
SkillX: Automatically Constructing Skill Knowledge Bases for Agentshttps://arxiv.org/abs/2604.04804Chenxi Wang, Zhuoyun Yu, Xin Xie, Wuguannan Yao, Runnan Fang, Shuofei Qiao, Kexin Cao, Guozhou Zheng, Xiang Qi, Peng Zhang, Shumin Deng2026
SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learninghttps://arxiv.org/abs/2602.08234Peng Xia, Jianwen Chen, Hanyang Wang, Jiaqi Liu, Kaide Zeng, Yu Wang, Siwei Han, Yiyang Zhou, Xujiang Zhao, Haifeng Chen, Zeyu Zheng, Cihang Xie, Huaxiu Yao2026
Dynamic Dual-Granularity Skill Bank for Agentic RLhttps://arxiv.org/abs/2603.28716Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao2026
Arise: Agent reasoning with intrinsic skill evolution in hierarchical reinforcement learninghttps://arxiv.org/abs/2603.16060Yu Li, Rui Miao, Zhengling Qi, Tian Lan2026
Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scalehttps://arxiv.org/abs/2603.02176Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu2026
Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAGhttps://arxiv.org/abs/2604.14572Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh2026
SKILLFOUNDRY: Building Self-Evolving Agent Skill Libraries from Heterogeneous Scientific Resourceshttps://arxiv.org/abs/2604.03964Shuaike Shen, Wenduo Cheng, Mingqian Ma, Alistair Turcan, Martin Jinye Zhang, Jian Ma2026
Graph of Skills: Dependency-Aware Structural Retrieval for Massive Agent Skillshttps://arxiv.org/abs/2604.05333Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun2026
SkillNet: Create, Evaluate, and Connect AI Skillshttps://arxiv.org/abs/2603.04448Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen2026

Retrieval & Disclosure

Paper TitlePaper URLAuthor ListYear
Skill Retrieval Augmentation for Agentic AIhttps://arxiv.org/abs/2604.24594Weihang Su, Jianming Long, Qingyao Ai, Yichen Tang, Changyue Wang, Yiteng Tu, Yiqun Liu2026
How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settingshttps://arxiv.org/abs/2604.04323Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang2026
CUA-Skill: Develop Skills for Computer Using Agenthttps://arxiv.org/abs/2601.21123Tianyi Chen, Yinheng Li, Michael Solodko, Sen Wang, Nan Jiang, Tingyuan Cui, Junheng Hao, Jongwoo Ko, Sara Abdali, Leon Xu, Suzhen Zheng, Hao Fan, Pashmina Cameron, Justin Wagle, Kazuhito Koishida2026
AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolutionhttps://arxiv.org/abs/2603.01145Yutao Yang, Junsong Li, Qianjun Pan, Bihao Zhan, Yuxuan Cai, Lin Du, Jie Zhou, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Liang He2026
SkillRouter: Skill Routing for LLM Agents at Scalehttps://arxiv.org/abs/2603.22455YanZhao Zheng, ZhenTao Zhang, Chao Ma, YuanQiang Yu, JiHuai Zhu, Yong Wu, Tianze Xu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu2026
SkillReducer: Optimizing LLM Agent Skills for Token Efficiencyhttps://arxiv.org/abs/2603.29919Yudong Gao, Zongjie Li, Yuanyuanyuan, Zimo Ji, Pingchuan Ma, Shuai Wang2026
Graph of Skills: Dependency-Aware Structural Retrieval for Massive Agent Skillshttps://arxiv.org/abs/2604.05333Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun2026

Composition, Orchestration & Execution

Paper TitlePaper URLAuthor ListYear
PolySkill: Learning Generalizable Skills Through Polymorphic Abstractionhttps://arxiv.org/abs/2510.15863Simon Yu, Gang Li, Weiyan Shi, Peng Qi2026
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skillshttps://arxiv.org/abs/2504.07079Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, Yu Su2025
Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scalehttps://arxiv.org/abs/2603.02176Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu2026
GraSP: Graph-Structured Skill Compositions for LLM Agentshttps://arxiv.org/abs/2604.17870Tianle Xia, Lingxiang Hu, Yiding Sun, Ming Xu, Lan Xu, Siying Wang, Wei Xu, Jie Jiang2026
SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?https://arxiv.org/abs/2603.00718Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh2026
SkillOrchestra: Learning to Route Agents via Skill Transferhttps://arxiv.org/abs/2602.19672Jiayu Wang, Yifei Ming, Zixuan Ke, Shafiq Joty, Aws Albarghouthi, Frederic Sala2026
Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesishttps://arxiv.org/abs/2602.03279Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Xuan Ren, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang2026

Refinement & Evolution

Paper TitlePaper URLAuthor ListYear
SkillTracer: Structural Failure Attribution and Refinement of Agentic Skills in Long-Horizon Web Taskshttps://openreview.net/forum?id=OiyEjThGeZYuyang Li, Yiran Dou, Jie-Jing Shao, Yueming Lyu, Ivor Tsang, Haiyan Yin
Meta Context Engineering via Agentic Skill Evolutionhttps://arxiv.org/abs/2601.21557Haoran Ye, Xuning He, Vincent Arak, Haonan Dong, Guojie Song2026
Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agentshttps://arxiv.org/abs/2602.01869Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang2026
MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agentshttps://arxiv.org/abs/2602.02474Haozhen Zhang, Quanyu Long, Jianzhu Bao, Tao Feng, Weizhi Zhang, Haodong Yue, Wenya Wang2026
EvoSkill: Automated Skill Discovery for Multi-Agent Systemshttps://arxiv.org/abs/2603.02766Salaheddin Alzubi, Noah Provenzano, Jaydon Bingham, Weiyuan Chen, Tu Vu2026
Memento-Skills: Let Agents Design Agentshttps://arxiv.org/abs/2603.18743Huichi Zhou, Siyuan Guo, Anjie Liu, Zhongwei Yu, Ziqin Gong, Bowen Zhao, Zhixun Chen, Menglong Zhang, Yihang Chen, Jinsong Li, Runyu Yang, Qiangbin Liu, Xinlei Yu, Jianmin Zhou, Na Wang, Chunyang Sun, Jun Wang2026
Dynamic Dual-Granularity Skill Bank for Agentic RLhttps://arxiv.org/abs/2603.28716Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao2026
CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verificationhttps://arxiv.org/abs/2604.01687Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, Chengze Li, Wei-Chieh Huang, Yifei Yao, Kening Zheng, Xue Liu, Xiaoxiao Li, Philip S. Yu2026
SkillClaw: Let Skills Evolve Collectively with Agentic Evolverhttps://arxiv.org/abs/2604.08377Ziyu Ma, Shidong Yang, Yuxiang Ji, Xucong Wang, Yong Wang, Yiming Hu, Tongwen Huang, Xiangxiang Chu2026
SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Supporthttps://arxiv.org/abs/2604.08618Xingyan Liu, Xiyue Luo, Linyu Li, Ganghong Huang, Jianfeng Liu, Honglin Qiao2026

Deprecation & Retirement

Paper TitlePaper URLAuthor ListYear
Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agentshttps://arxiv.org/abs/2602.01869Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang2026
Dynamic Dual-Granularity Skill Bank for Agentic RLhttps://arxiv.org/abs/2603.28716Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao2026
Reinforcement learning for self-improving agent with skill libraryhttps://arxiv.org/abs/2512.17102Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong2025

Internalization Stage

Paper TitlePaper URLAuthor ListYear
EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecyclehttps://arxiv.org/abs/2510.16079Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi2025
SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalizationhttps://arxiv.org/abs/2604.02268Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Chengcheng Han, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen2026
Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agentshttps://arxiv.org/abs/2604.10674Hao Wang, Guozhi Wang, Han Xiao, Yufeng Zhou, Yue Pan, Jichao Wang, Ke Xu, Yafei Wen, Xiaohu Ruan, Xiaoxin Chen, Honggang Qi2026
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reasonhttps://arxiv.org/abs/2507.02841Kaiyi Zhang, Ang Lv, Jinpeng Li, Yongbo Wang, Feng Wang, Haoyuan Hu, Rui Yan2025
Internalizing Meta-Experience into Memory for Guided Reinforcement Learning in Large Language Modelshttps://arxiv.org/abs/2602.10224Shiting Huang, Zecheng Li, Yu Zeng, Qingnan Ren, Zhen Fang, Qisheng Su, Kou Shi, Lin Chen, Zehui Chen, Feng Zhao2026
Dynamic Dual-Granularity Skill Bank for Agentic RLhttps://arxiv.org/abs/2603.28716Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao2026

⚙️ Layer 4: Runtime Integration

Terminal Interface

Paper TitlePaper URLAuthor ListYear
Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaceshttps://arxiv.org/abs/2601.11868Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, Junhong Shen, Guanghao Ye, Haowei Lin, Jason Poulos, Maoyu Wang, Marianna Nezhurina, Jenia Jitsev, Di Lu, Orfeas Menis Mastromichalakis, Zhiwei Xu, Zizhao Chen, Yue Liu, Robert Zhang, Leon Liangyu Chen, Anurag Kashyap, Jan-Lucas Uslu, Jeffrey Li, Jianbo Wu, Minghao Yan, Song Bian, Vedang Sharma, Ke Sun, Steven Dillmann, Akshay Anand, Andrew Lanpouthakoun, Bardia Koopah, Changran Hu, Etash Guha, Gabriel H. S. Dreiman, Jiacheng Zhu, Karl Krauth, Li Zhong, Niklas Muennighoff, Robert Amanfu, Shangyin Tan, Shreyas Pimpalgaonkar, Tushar Aggarwal, Xiangning Lin, Xin Lan, Xuandong Zhao, Yiqing Liang, Yuanli Wang, Zilong Wang, Changzhi Zhou, David Heineman, Hange Liu, Harsh Trivedi, John Yang, Junhong Lin, Manish Shetty, Michael Yang, Nabil Omi, Negin Raoof, Shanda Li, Terry Yue Zhuo, Wuwei Lin, Yiwei Dai, Yuxin Wang, Wenhao Chai, Shang Zhou, Dariush Wahdany, Ziyu She, Jiaming Hu, Zhikang Dong, Yuxuan Zhu, Sasha Cui, Ahson Saiyed, Arinbjörn Kolbeinsson, Jesse Hu, Christopher Michael Rytting, Ryan Marten, Yixin Wang, Alex Dimakis, Andy Konwinski, Ludwig Schmidt2026
Terminal Agents Suffice for Enterprise Automationhttps://arxiv.org/abs/2604.00073Patrice Bechard, Orlando Marquez Ayala, Emily Chen, Jordan Skelton, Sagar Davasam, Srinivas Sunkara, Vikas Yadav, Sai Rajeswar2026
Toward Scalable Terminal Task Synthesis via Skill Graphshttps://arxiv.org/abs/2604.25727Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiangtao Guan, Yun Yang, Dingxin Hu, Jiang Zhou, Xing Wu, Zhuo Han, Feng Zhang, Lilin Wang2026
AgentClick: A Skill-Based Human-in-the-Loop Review Layer for Terminal AI Agentshttps://arxiv.org/abs/2604.16520Haomin Zhuang, Hanwen Xing, Xiangliang Zhang2026

Tool Interface

Paper TitlePaper URLAuthor ListYear
Toolformer: Language Models Can Teach Themselves to Use Toolshttps://arxiv.org/abs/2302.04761Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, Maria Lomeli, Luke Zettlemoyer, Nicola Cancedda, Thomas Scialom2023
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Toolshttps://arxiv.org/abs/2509.09734Zikang Guo, Benfeng Xu, Chiwei Zhu, Wentao Hong, Xiaorui Wang, Zhendong Mao2025
Agent Skill Framework: Perspectives on the Potential of Small Language Models in Industrial Environmentshttps://arxiv.org/abs/2602.16653Yangjie Xu, Lujun Li, Lama Sleem, Niccolo Gentile, Yewei Song, Yiqun Wang, Siming Ji, Wenbo Wu, Radu State2026
Procedural Knowledge Improves Agentic LLM Workflowshttps://arxiv.org/abs/2511.07568Vincent Hsiao, Mark Roberts, Leslie Smith2025
SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?https://arxiv.org/abs/2603.00718Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh2026

Multi-Agent System Integration

Paper TitlePaper URLAuthor ListYear
MetaGPT: Meta Programming for A Multi-Agent Collaborative Frameworkhttps://arxiv.org/abs/2308.00352Sirui Hong, Mingchen Zhuge, Jiaqi Chen, Xiawu Zheng, Yuheng Cheng, Ceyao Zhang, Jinlin Wang, Zili Wang, Steven Ka Shing Yau, Zijuan Lin, Liyang Zhou, Chenyu Ran, Lingfeng Xiao, Chenglin Wu, Jürgen Schmidhuber2024
When Single-Agent with Skills Replace Multi-Agent Systems and When They Failhttps://arxiv.org/abs/2601.04748Xiaoxiao Li2026
ABSTRAL: Automatic Design of Multi-Agent Systems Through Iterative Refinement and Topology Optimizationhttps://arxiv.org/abs/2603.22791Weijia Song, Jiashu Yue, Zhe Pang2026
SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topologyhttps://arxiv.org/abs/2604.17503Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu2026
Memento-Skills: Let Agents Design Agentshttps://arxiv.org/abs/2603.18743Huichi Zhou, Siyuan Guo, Anjie Liu, Zhongwei Yu, Ziqin Gong, Bowen Zhao, Zhixun Chen, Menglong Zhang, Yihang Chen, Jinsong Li, Runyu Yang, Qiangbin Liu, Xinlei Yu, Jianmin Zhou, Na Wang, Chunyang Sun, Jun Wang2026

Harness Integration

Paper TitlePaper URLAuthor ListYear
ClawArena: Benchmarking AI Agents in Evolving Information Environmentshttps://arxiv.org/abs/2604.04202Haonian Ji, Kaiwen Xiong, Siwei Han, Peng Xia, Shi Qiu, Yiyang Zhou, Jiaqi Liu, Jinlong Li, Bingzhou Li, Zeyu Zheng, Cihang Xie, Huaxiu Yao2026
SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Taskshttps://arxiv.org/abs/2602.12670Xiangyi Li, Wenbo Chen, Yimin Liu, Shenghan Zheng, Xiaokun Chen, Yifeng He, Yubo Li, Bingran You, Haotian Shen, Jiankai Sun, Shuyi Wang, Binxu Li, Qunhong Zeng, Di Wang, Xuandong Zhao, Yuanli Wang, Roey Ben Chaim, Zonglin Di, Yipeng Gao, Junwei He, Yizhuo He, Liqiang Jing, Luyang Kong, Xin Lan, Jiachen Li, Songlin Li, Yijiang Li, Yueqian Lin, Xinyi Liu, Xuanqing Liu, Haoran Lyu, Ze Ma, Bowei Wang, Runhui Wang, Tianyu Wang, Wengao Ye, Yue Zhang, Hanwen Xing, Yiqi Xue, Steven Dillmann, Han-chung Lee2026
SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Taskshttps://arxiv.org/abs/2604.20087Shanshan Zhong, Yi Lu, Jingjie Ning, Yibing Wan, Lihan Feng, Yuyi Ao, Leonardo F. R. Ribeiro, Markus Dreyer, Sean Ammirati, Chenyan Xiong2026
Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scalehttps://arxiv.org/abs/2603.02176Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu2026
AgentFactory: A Self-Evolving Framework Through Executable Subagent Accumulation and Reusehttps://arxiv.org/abs/2603.18000Zhang Zhang, Shuqi Lu, Hongjin Qian, Di He, Zheng Liu2026
SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agentshttps://arxiv.org/abs/2604.17308Ziao Zhang, Kou Shi, Shiting Huang, Avery Nie, Yu Zeng, Yiming Zhao, Zhen Fang, Qishen Su, Haibo Qiu, Wei Yang, Qingnan Ren, Shun Zou, Wenxuan Huang, Lin Chen, Zehui Chen, Feng Zhao2026
AgentEvolver: Towards Efficient Self-Evolving Agent Systemhttps://arxiv.org/abs/2511.10395Yunpeng Zhai, Shuchang Tao, Cheng Chen, Anni Zou, Ziqian Chen, Qingxu Fu, Shinji Mai, Li Yu, Jiaji Deng, Zouying Cao, Zhaoyang Liu, Bolin Ding, Jingren Zhou2025

🛡️ Layer 5: Governance

Marketplaces and Ecosystems

Paper TitlePaper URLAuthor ListYear
Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionalityhttps://arxiv.org/abs/2602.08004George Ling, Shanshan Zhong, Richard Huang2026

Threat and Risk Surface

Paper TitlePaper URLAuthor ListYear
When Skills Lie: Hidden-Comment Injection in LLM Agentshttps://arxiv.org/abs/2602.10498Qianli Wang, Boyang Ma, Minghui Xu, Yue Zhang2026
Agent Skills Enable a New Class of Realistic and Trivially Simple Prompt Injectionshttps://arxiv.org/abs/2510.26328David Schmotz, Sahar Abdelnabi, Maksym Andriushchenko2025
SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinementhttps://arxiv.org/abs/2602.14211Xiaojun Jia, Jie Liao, Simeng Qin, Jindong Gu, Wenqi Ren, Xiaochun Cao, Yang Liu, Philip Torr2026
Skill-Inject: Measuring Agent Vulnerability to Skill File Attackshttps://arxiv.org/abs/2602.20156David Schmotz, Luca Beurer-Kellner, Sahar Abdelnabi, Maksym Andriushchenko2026
Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystemshttps://arxiv.org/abs/2601.17548Narek Maloyan, Dmitry Namiot2026
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoninghttps://arxiv.org/abs/2604.09378Guiyao Tie, Jiawen Shi, Pan Zhou, Lichao Sun2026
SkillTrojan: Backdoor Attacks on Skill-Based Agent Systemshttps://arxiv.org/abs/2604.06811Yunhao Feng, Yifan Ding, Yingshui Tan, Boren Zheng, Yanming Guo, Xiaolong Li, Kun Zhai, Yishan Li, Wenke Huang2026
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?https://arxiv.org/abs/2604.15415Yukun Jiang, Yage Zhang, Michael Backes, Xinyue Shen, Yang Zhang2026
Malicious Agent Skills in the Wild: A Large-Scale Security Empirical Studyhttps://arxiv.org/abs/2602.06547Yi Liu, Zhihao Chen, Yanjun Zhang, Gelei Deng, Yuekang Li, Jianting Ning, Ying Zhang, Leo Yu Zhang2026
Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scalehttps://arxiv.org/abs/2601.10338Yi Liu, Weizhe Wang, Ruitao Feng, Yao Zhang, Guangquan Xu, Gelei Deng, Yuekang Li, Leo Zhang2026
Red Skills or Blue Skills? A Dive Into Skills Published on ClawHubhttps://arxiv.org/abs/2604.13064Haichuan Hu, Ye Shang, Quanjun Zhang2026
RouteGuard: Internal-Signal Detection of Skill Poisoning in LLM Agentshttps://arxiv.org/abs/2604.22888Wenjie Xiao, Xuehai Tang, Biyu Zhou, Songlin Hu, Jizhong Han2026
SkillClone: Multi-Modal Clone Detection and Clone Propagation Analysis in the Agent Skill Ecosystemhttps://arxiv.org/abs/2603.22447Jiaying Zhu, Lyuye Zhang, Wenbo Guo, Yang Liu2026
Formal analysis and supply chain security for agentic AI skillshttps://arxiv.org/abs/2603.00195Varun Pratap Bhardwaj2026
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystemshttps://arxiv.org/abs/2604.03081Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma2026
SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaborationhttps://arxiv.org/abs/2603.21019Zihan Guo, Zhiyu Chen, Xiaohang Nie, Jianghao Lin, Yuanjian Zhou, Weinan Zhang2026
SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skillshttps://arxiv.org/abs/2604.06550Yinghan Hou, Zongyou Yang2026
Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skillshttps://arxiv.org/abs/2604.25109Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu2026
SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinementhttps://arxiv.org/abs/2604.04989Zenghao Duan, Yuxin Tian, Zhiyi Yin, Liang Pang, Jingcheng Deng, Zihao Wei, Shicheng Xu, Yuyao Ge, Xueqi Cheng2026
Malicious Or Not: Adding Repository Context to Agent Skill Classificationhttps://arxiv.org/abs/2603.16572Florian Holzbauer, David Schmidt, Gabriel Gegenhuber, Sebastian Schrittwieser, Johanna Ullrich2026
Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threatshttps://arxiv.org/abs/2603.11619Xinhao Deng, Yixiang Zhang, Jiaqing Wu, Jiaqi Bai, Sibo Yi, Zhuoheng Zou, Yue Xiao, Rennai Qiu, Jianan Ma, Jialuo Chen, Xiaohu Du, Xiaofang Yang, Shiwen Cui, Changhua Meng, Weiqiang Wang, Jiaxing Song, Ke Xu, Qi Li2026
STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systemshttps://arxiv.org/abs/2604.10286Guijia Zhang, Shu Yang, Xilin Gong, Di Wang2026

Safe Usage and Governance Mechanisms

Paper TitlePaper URLAuthor ListYear
SoK: Agentic Skills--Beyond Tool Use in LLM Agentshttps://arxiv.org/abs/2602.20867Yanna Jiang, Delong Li, Haiyu Deng, Baihe Ma, Xu Wang, Qin Wang, Guangsheng Yu2026
Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Studyhttps://arxiv.org/abs/2604.03070Zhihao Chen, Ying Zhang, Yi Liu, Gelei Deng, Yuekang Li, Yanjun Zhang, Jianting Ning, Leo Yu Zhang, Lei Ma, Zhiqiang Li2026
NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Railshttps://arxiv.org/abs/2310.10501Traian Rebedea, Razvan Dinu, Makesh Sreedhar, Christopher Parisien, Jonathan Cohen2023
Agent Contracts: A Formal Framework for Resource-Bounded Autonomous AI Systemshttps://arxiv.org/abs/2601.08815Qing Ye, Jing Tan2026
SkillNet: Create, Evaluate, and Connect AI Skillshttps://arxiv.org/abs/2603.04448Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen2026
Towards Secure Agent Skills: Architecture, Threat Taxonomy, and Security Analysishttps://arxiv.org/abs/2604.02837Zhiyuan Li, Jingzheng Wu, Xiang Ling, Xing Cui, Tianyue Luo2026
SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistantshttps://arxiv.org/abs/2603.28807Haoyu Wang, Zibo Xiao, Yedi Zhang, Christopher M. Poskitt, Jun Sun2026

🚀 Layer 6: Application

Embodied Robotics & Physical Manipulation

Paper TitlePaper URLAuthor ListYear
Do As I Can, Not As I Say: Grounding Language in Robotic Affordanceshttps://arxiv.org/abs/2204.01691Michael Ahn, Anthony Brohan, Noah Brown, Yevgen Chebotar, Omar Cortes, Byron David, Chelsea Finn, Chuyuan Fu, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Daniel Ho, Jasmine Hsu, Julian Ibarz, Brian Ichter, Alex Irpan, Eric Jang, Rosario Jauregui Ruano, Kyle Jeffrey, Sally Jesmonth, Nikhil J Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Kuang-Huei Lee, Sergey Levine, Yao Lu, Linda Luu, Carolina Parada, Peter Pastor, Jornell Quiambao, Kanishka Rao, Jarek Rettinghouse, Diego Reyes, Pierre Sermanet, Nicolas Sievers, Clayton Tan, Alexander Toshev, Vincent Vanhoucke, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Mengyuan Yan, Andy Zeng2022
XSkill: Cross Embodiment Skill Discoveryhttps://arxiv.org/abs/2307.09955Mengda Xu, Zhenjia Xu, Cheng Chi, Manuela Veloso, Shuran Song2023
Uni-Skill: Building Self-Evolving Skill Repository for Generalizable Robotic Manipulationhttps://arxiv.org/abs/2603.02623Senwei Xie, Yuntian Zhang, Ruiping Wang, Xilin Chen2026
Agentic Skill Discoveryhttps://arxiv.org/abs/2405.15019Xufeng Zhao, Cornelius Weber, Stefan Wermter2024
Lifelong Robot Library Learning: Bootstrapping Composable and Generalizable Skills for Embodied Control with Language Modelshttps://arxiv.org/abs/2406.18746Georgios Tziafas, Hamidreza Kasaei2024
VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thoughthttps://arxiv.org/abs/2406.14596Gabriel Sarch, Lawrence Jang, Michael J. Tarr, William W. Cohen, Kenneth Marino, Katerina Fragkiadaki2025
ASCENT: Autonomous Skill Learning Toward Complex Embodied Tasks With Foundation Modelshttps://doi.org/10.1109/ICRA55743.2025.11127927Haolin Wu, Yuecheng Liu, Junyi Dong, Heng Zhang, Sitong Mao, Hesheng Wang, Weigang Wu, Shunbo Zhou2025
Real-Time Verification of Embodied Reasoning for Generative Skill Acquisitionhttps://arxiv.org/abs/2505.11175Bo Yue, Shuqi Guo, Kaiyu Hu, Chujiao Wang, Benyou Wang, Kui Jia, Guiliang Liu2025
SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassemblyhttps://arxiv.org/abs/2603.11080Chang Liu, Sibo Tian, Xiao Liang, Minghui Zheng2026
Learning Without Losing Identity: Capability Evolution for Embodied Agentshttps://arxiv.org/abs/2604.07799Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li2026

Open-Ended Game Environments

Paper TitlePaper URLAuthor ListYear
A deep hierarchical approach to lifelong learning in minecrafthttps://doi.org/10.1609/aaai.v31i1.10744Chen Tessler, Shahar Givony, Tom Zahavy, Daniel Mankowitz, Shie Mannor2017
Hierarchical and interpretable skill acquisition in multi-task reinforcement learninghttps://arxiv.org/abs/1712.07294Tianmin Shu, Caiming Xiong, Richard Socher2017
Skill reinforcement learning and planning for open-world long-horizon taskshttps://arxiv.org/abs/2303.16563Haoqi Yuan, Chi Zhang, Hongcheng Wang, Feiyang Xie, Penglin Cai, Hao Dong, Zongqing Lu2023
MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledgehttps://arxiv.org/abs/2206.08853Linxi Fan, Guanzhi Wang, Yunfan Jiang, Ajay Mandlekar, Yuncong Yang, Haoyi Zhu, Andrew Tang, De-An Huang, Yuke Zhu, Anima Anandkumar2022
MCU: An evaluation framework for open-ended game agentshttps://proceedings.mlr.press/v267/zheng25j.htmlXinyue Zheng, Haowei Lin, Kaichen He, Zihao Wang, Qiang Fu, Haobo Fu, Zilong Zheng, Yitao Liang2025
Voyager: An Open-Ended Embodied Agent with Large Language Modelshttps://arxiv.org/abs/2305.16291Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar2023
Odyssey: Empowering minecraft agents with open-world skillshttps://arxiv.org/abs/2407.15325Shunyu Liu, Yaoru Li, Kongcheng Zhang, Zhenyu Cui, Wenkai Fang, Yuxuan Zheng, Tongya Zheng, Mingli Song2024
See and Think: Embodied Agent in Virtual Environmenthttps://arxiv.org/abs/2311.15209Zhonghan Zhao, Wenhao Chai, Xuan Wang, Li Boyi, Shengyu Hao, Shidong Cao, Tian Ye, Gaoang Wang2024
Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolutionhttps://arxiv.org/abs/2505.17673Jiawei Du, Jinlong Wu, Yuzheng Chen, Yucheng Hu, Bing Li, Joey Tianyi Zhou2025
SAG-Agent: Enabling Long-Horizon Reasoning in Strategy Games via Dynamic Knowledge Graphshttps://arxiv.org/abs/2510.15259Chenwei Tang, Lin Long, Xinyu Liu, Jingyu Xing, Zizhou Wang, Joey Tianyi Zhou, Jiawei Du, Liangli Zhen, Jiancheng Lv2026
SCALAR: Learning and Composing Skills through LLM Guided Symbolic Planning and Deep RL Groundinghttps://arxiv.org/abs/2603.09036Renos Zabounidis, Yue Wu, Simon Stepputtis, Woojun Kim, Yuanzhi Li, Tom Mitchell, Katia Sycara2026
Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Taskshttps://arxiv.org/abs/2604.20987Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha2026

Web Agents & Browser Automation

Paper TitlePaper URLAuthor ListYear
Mind2Web: Towards a Generalist Agent for the Webhttps://arxiv.org/abs/2306.06070Xiang Deng, Yu Gu, Boyuan Zheng, Shijie Chen, Samuel Stevens, Boshi Wang, Huan Sun, Yu Su2023
WebVoyager: Building an End-to-End Web Agent with Large Multimodal Modelshttps://arxiv.org/abs/2401.13919Hongliang He, Wenlin Yao, Kaixin Ma, Wenhao Yu, Yong Dai, Hongming Zhang, Zhenzhong Lan, Dong Yu2024
WebArena: A Realistic Web Environment for Building Autonomous Agentshttps://arxiv.org/abs/2307.13854Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, Graham Neubig2024
Agent Workflow Memoryhttps://arxiv.org/abs/2409.07429Zora Zhiruo Wang, Jiayuan Mao, Daniel Fried, Graham Neubig2024
Inducing Programmatic Skills for Agentic Taskshttps://arxiv.org/abs/2504.06821Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig, Daniel Fried2025
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skillshttps://arxiv.org/abs/2504.07079Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, Yu Su2025
SkillEvo: An Experience Learning Framework with Reinforcement Learning for Skill Evolutionhttps://openreview.net/forum?id=S1cIE9pe3kZishan Xu, Yifu Guo, Yuquan Lu, Fengyu Yang, Zhiyuan Yao, Jiaye Lin, Ruyi Gong, Lihua Cai2026
WebXSkill: Skill Learning for Autonomous Web Agentshttps://arxiv.org/abs/2604.13318Zhaoyang Wang, Qianhui Wu, Xuchao Zhang, Chaoyun Zhang, Wenlin Yao, Fazle Elahi Faisal, Baolin Peng, Si Qin, Suman Nath, Qingwei Lin, Chetan Bansal, Dongmei Zhang, Saravan Rajmohan, Jianfeng Gao, Huaxiu Yao2026
ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agentshttps://arxiv.org/abs/2603.20340Zijian Lu, Yiping Zuo, Yupeng Nie, Xin He, Weibei Fan, Lianyong Qi, Shi Jin2026

GUI, Mobile & OS Agents

Paper TitlePaper URLAuthor ListYear
OS-Copilot: Towards Generalist Computer Agents with Self-Improvementhttps://arxiv.org/abs/2402.07456Zhiyong Wu, Chengcheng Han, Zichen Ding, Zhenmin Weng, Zhoumianze Liu, Shunyu Yao, Tao Yu, Lingpeng Kong2024
AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agentshttps://arxiv.org/abs/2405.14573Christopher Rawles, Sarah Clinckemaillie, Yifan Chang, Jonathan Waltz, Gabrielle Lau, Marybeth Fair, Alice Li, William Bishop, Wei Li, Folawiyo Campbell-Ajala, Daniel Toyama, Robert Berry, Divya Tyamagundlu, Timothy Lillicrap, Oriana Riva2025
Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scalehttps://arxiv.org/abs/2409.08264Rogerio Bonatti, Dan Zhao, Francesco Bonacci, Dillon Dupont, Sara Abdali, Yinheng Li, Yadong Lu, Justin Wagle, Kazuhito Koishida, Arthur Bucker, Lawrence Jang, Zack Hui2024
Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skillshttps://arxiv.org/abs/2506.10387Yuquan Xie, Zaijing Li, Rui Shao, Gongwei Chen, Kaiwen Zhou, Yinchuan Li, Dongmei Jiang, Liqiang Nie2025
CUA-Skill: Develop Skills for Computer Using Agenthttps://arxiv.org/abs/2601.21123Tianyi Chen, Yinheng Li, Michael Solodko, Sen Wang, Nan Jiang, Tingyuan Cui, Junheng Hao, Jongwoo Ko, Sara Abdali, Leon Xu, Suzhen Zheng, Hao Fan, Pashmina Cameron, Justin Wagle, Kazuhito Koishida2026
OSExpert: Computer-Use Agents Learning Professional Skills via Explorationhttps://arxiv.org/abs/2603.07978Jiateng Liu, Zhenhailong Wang, Rushi Wang, Bingxuan Li, Jeonghwan Kim, Aditi Tiwari, Pengfei Yu, Denghui Zhang, Heng Ji2026
SkillDroid: Compile Once, Reuse Foreverhttps://arxiv.org/abs/2604.14872Qijia Chen, Andrea Bellucci, Zhida Sun, Giulio Jacucci2026

Software Engineering & Coding Agents

Paper TitlePaper URLAuthor ListYear
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?https://arxiv.org/abs/2310.06770Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan2024
Swe-exp: Experience-driven software issue resolutionhttps://arxiv.org/abs/2507.23361Silin Chen, Shaoxin Lin, Yuling Shi, Heng Lian, Xiaodong Gu, Longfei Yun, Dong Chen, Lin Cao, Jiyang Liu, Nu Xia, others2025
Kimi-Dev: Agentless Training as Skill Prior for SWE-Agentshttps://arxiv.org/abs/2509.23045Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu2025
Hybrid-Gym: Training Coding Agents to Generalize Across Taskshttps://arxiv.org/abs/2602.16819Yiqing Xie, Emmy Liu, Gaokai Zhang, Nachiket Kotalwar, Shubham Gandhi, Sathwik Acharya, Xingyao Wang, Carolyn Rose, Graham Neubig, Daniel Fried2026
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?https://arxiv.org/abs/2603.15401Tingxu Han, Yi Zhang, Wei Song, Chunrong Fang, Zhenyu Chen, Youcheng Sun, Lijie Hu2026
EffiSkill: Agent Skill Based Automated Code Efficiency Optimizationhttps://arxiv.org/abs/2603.27850Zimu Wang, Yuling Shi, Mengfan Li, Zijun Liu, Jie M. Zhang, Chengcheng Wan, Xiaodong Gu2026
Scaling Coding Agents via Atomic Skillshttps://arxiv.org/abs/2604.05013Yingwei Ma, Yue Liu, Xinlong Yang, Yanhao Li, Kelin Fu, Yibo Miao, Yuchong Xie, Zhexu Wang, Shing-Chi Cheung2026
SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineeringhttps://arxiv.org/abs/2604.09297Jingzhi Gong, Ruizhen Gu, Zhiwei Fei, Yazhuo Cao, Lukas Twist, Alina Geiger, Shuo Han, Dominik Sobania, Federica Sarro, Jie M. Zhang2026

Contributors

hachihao

7 commits

DataArcTech/Awesome-Agent-Skill-Papers

The repo of survey paper "A Survey of Agent Skills: Toward Procedural Infrastructure for LLM Agents"

22

7 commits

updated May 19, 2026

See the code

README

🧩 A Survey of Agent Skills: Toward Procedural Infrastructure for LLM Agents

Taxonomy of agent skills

🌐 Preprint Link · 📄 PDF File · 🗺️ Taxonomy · 📚 Paper List · ✨ Contribute

🌟 Overview

Agent skills are emerging as a reusable procedural layer for LLM agents: they compress experience, encode domain know-how, package workflows, and help agents retrieve, compose, execute, refine, and govern capabilities across tasks. This repository accompanies the survey A Survey of Agent Skills: Toward Procedural Infrastructure for LLM Agents and collects papers around the agent-skill ecosystem.

🫆 Citation

@article{yang2026asurveyofagentskills,
	doi = {10.20944/preprints202605.1276.v1},
	url = {https://doi.org/10.20944/preprints202605.1276.v1},
	year = 2026,
	month = {May},
	publisher = {Preprints},
	author = {Cehao Yang and Xiaojun Wu and Honghao Liu and Xueyuan Lin and Chengjin Xu and Xuhui Jiang and Yuanliang Sun and Wenjie Zhang and Zhichao Shi and Yijie Xu and Jia Li and Hui Xiong and Jian Guo},
	title = {A Survey of Agent Skills: Toward Procedural Infrastructure for LLM Agents},
	journal = {Preprints}
}

🗺️ Taxonomy at a Glance

The survey organizes agent-skill research into six connected layers:

IconLayerWhat it Covers
🧠OntologyWhat a skill is, how it relates to memory, cognition, compression, and reusable procedural knowledge.
📦Representation and PackagingHow skills are written, structured, serialized, distributed, and packaged.
🔁LifecycleHow skills are acquired, stored, retrieved, executed, refined, retired, and internalized.
⚙️Runtime IntegrationHow skills connect to terminals, tools, multi-agent systems, benchmarks, and execution harnesses.
🛡️GovernanceHow skill ecosystems handle marketplaces, security risks, safety, auditing, and trustworthy usage.
🚀ApplicationWhere agent skills are used in embodied robotics, games, web agents, GUI/mobile/OS agents, and coding workflows.

✨ Tips for Uploading Papers

Suggested row format:

| Paper Title | [arXiv](https://arxiv.org/abs/xxxx.xxxxx) | Author A, Author B, Author C | 2026 |

🧠 Layer 1: Ontology

Starting from Memory: The Cognitive Architecture of Agents

Paper TitlePaper URLAuthor ListYear
ReAct: Synergizing Reasoning and Acting in Language Modelshttps://arxiv.org/abs/2210.03629Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao2023
Cognitive Architectures for Language Agentshttps://arxiv.org/abs/2309.02427Theodore R. Sumers, Shunyu Yao, Karthik Narasimhan, Thomas L. Griffiths2024
A Survey on the Memory Mechanism of Large Language Model based Agentshttps://arxiv.org/abs/2404.13501Zeyu Zhang, Xiaohe Bo, Chen Ma, Rui Li, Xu Chen, Quanyu Dai, Jieming Zhu, Zhenhua Dong, Ji-Rong Wen2024

Human Inspiration: Skill as Compression from Memory to Pattern

Paper TitlePaper URLAuthor ListYear
Experience Compression Spectrum: Unifying Memory, Skills, and Rules in LLM Agentshttps://arxiv.org/abs/2604.15877Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He2026
Procedural Knowledge Improves Agentic LLM Workflowshttps://arxiv.org/abs/2511.07568Vincent Hsiao, Mark Roberts, Leslie Smith2025

Skill as a Medium: Distilling and Reusing Human Wisdom

Paper TitlePaper URLAuthor ListYear
SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Taskshttps://arxiv.org/abs/2602.12670Xiangyi Li, Wenbo Chen, Yimin Liu, Shenghan Zheng, Xiaokun Chen, Yifeng He, Yubo Li, Bingran You, Haotian Shen, Jiankai Sun, Shuyi Wang, Binxu Li, Qunhong Zeng, Di Wang, Xuandong Zhao, Yuanli Wang, Roey Ben Chaim, Zonglin Di, Yipeng Gao, Junwei He, Yizhuo He, Liqiang Jing, Luyang Kong, Xin Lan, Jiachen Li, Songlin Li, Yijiang Li, Yueqian Lin, Xinyi Liu, Xuanqing Liu, Haoran Lyu, Ze Ma, Bowei Wang, Runhui Wang, Tianyu Wang, Wengao Ye, Yue Zhang, Hanwen Xing, Yiqi Xue, Steven Dillmann, Han-chung Lee2026
ExpeL: LLM Agents Are Experiential Learnershttps://arxiv.org/abs/2308.10144Andrew Zhao, Daniel Huang, Quentin Xu, Matthieu Lin, Yong-Jin Liu, Gao Huang2024
SOP-Agent: Empower General Purpose AI Agent with Domain-Specific SOPshttps://arxiv.org/abs/2501.09316Anbang Ye, Qianran Ma, Jia Chen, Muqi Li, Tong Li, Fujiao Liu, Siqi Mai, Meichen Lu, Haitao Bao, Yang You2025
Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionalityhttps://arxiv.org/abs/2602.08004George Ling, Shanshan Zhong, Richard Huang2026

📦 Layer 2: Representation and Packaging

Natural Language

Paper TitlePaper URLAuthor ListYear
ExpeL: LLM Agents Are Experiential Learnershttps://arxiv.org/abs/2308.10144Andrew Zhao, Daniel Huang, Quentin Xu, Matthieu Lin, Yong-Jin Liu, Gao Huang2024

Code Snippets

Paper TitlePaper URLAuthor ListYear
Voyager: An Open-Ended Embodied Agent with Large Language Modelshttps://arxiv.org/abs/2305.16291Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar2023

Decision Graph

Paper TitlePaper URLAuthor ListYear
SOP-Agent: Empower General Purpose AI Agent with Domain-Specific SOPshttps://arxiv.org/abs/2501.09316Anbang Ye, Qianran Ma, Jia Chen, Muqi Li, Tong Li, Fujiao Liu, Siqi Mai, Meichen Lu, Haitao Bao, Yang You2025

Advanced Design

Paper TitlePaper URLAuthor ListYear
Skilldex: A Package Manager and Registry for Agent Skill Packages with Hierarchical Scope-Based Distributionhttps://arxiv.org/abs/2604.16911Sampriti Saha, Pranav Hemanth2026
From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skillshttps://arxiv.org/abs/2604.24026Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu2026

🔁 Layer 3: Lifecycle

Acquisition Stage

Paper TitlePaper URLAuthor ListYear
Inducing Programmatic Skills for Agentic Taskshttps://arxiv.org/abs/2504.06821Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig, Daniel Fried2025
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skillshttps://arxiv.org/abs/2504.07079Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, Yu Su2025
Automated Skill Discovery for Language Agents through Exploration and Iterative Feedbackhttps://arxiv.org/abs/2506.04287Yongjin Yang, Sinjae Kang, Juyong Lee, Dongjun Lee, Se-Young Yun, Kimin Lee2025
SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?https://arxiv.org/abs/2603.00718Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh2026
SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learninghttps://arxiv.org/abs/2602.08234Peng Xia, Jianwen Chen, Hanyang Wang, Jiaqi Liu, Kaide Zeng, Yu Wang, Siwei Han, Yiyang Zhou, Xujiang Zhao, Haifeng Chen, Zeyu Zheng, Cihang Xie, Huaxiu Yao2026
SkillX: Automatically Constructing Skill Knowledge Bases for Agentshttps://arxiv.org/abs/2604.04804Chenxi Wang, Zhuoyun Yu, Xin Xie, Wuguannan Yao, Runnan Fang, Shuofei Qiao, Kexin Cao, Guozhou Zheng, Xiang Qi, Peng Zhang, Shumin Deng2026
Dynamic Dual-Granularity Skill Bank for Agentic RLhttps://arxiv.org/abs/2603.28716Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao2026
XSkill: Continual Learning from Experience and Skills in Multimodal Agentshttps://arxiv.org/abs/2603.12056Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung2026
Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agentshttps://arxiv.org/abs/2602.01869Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang2026
Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Taskshttps://arxiv.org/abs/2604.20987Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha2026
Skillact: Using skill abstractions improves llm agentshttps://openreview.net/forum?id=6LG3cIRrF4Anthony Zhe Liu, Jongwook Choi, Sungryull Sohn, Yao Fu, Jaekyeom Kim, Dong-Ki Kim, Xinhe Wang, Jaewon Yoo, Honglak Lee2024
PolySkill: Learning Generalizable Skills Through Polymorphic Abstractionhttps://arxiv.org/abs/2510.15863Simon Yu, Gang Li, Weiyan Shi, Peng Qi2026
CASCADE: Cumulative Agentic Skill Creation through Autonomous Development and Evolutionhttps://arxiv.org/abs/2512.23880Xu Huang, Junwu Chen, Yuxing Fei, Zhuohan Li, Philippe Schwaller, Gerbrand Ceder2026
SKILLFOUNDRY: Building Self-Evolving Agent Skill Libraries from Heterogeneous Scientific Resourceshttps://arxiv.org/abs/2604.03964Shuaike Shen, Wenduo Cheng, Mingqian Ma, Alistair Turcan, Martin Jinye Zhang, Jian Ma2026
Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skillshttps://arxiv.org/abs/2603.25158Jingwei Ni, Yihao Liu, Xinpeng Liu, Yutao Sun, Mengyu Zhou, Pengyu Cheng, Dexin Wang, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang2026
ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learninghttps://arxiv.org/abs/2603.16060Yu Li, Rui Miao, Zhengling Qi, Tian Lan2026
CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verificationhttps://arxiv.org/abs/2604.01687Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, Chengze Li, Wei-Chieh Huang, Yifei Yao, Kening Zheng, Xue Liu, Xiaoxiao Li, Philip S. Yu2026
AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolutionhttps://arxiv.org/abs/2603.01145Yutao Yang, Junsong Li, Qianjun Pan, Bihao Zhan, Yuxuan Cai, Lin Du, Jie Zhou, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Liang He2026

Storage Stage

Paper TitlePaper URLAuthor ListYear
SkillX: Automatically Constructing Skill Knowledge Bases for Agentshttps://arxiv.org/abs/2604.04804Chenxi Wang, Zhuoyun Yu, Xin Xie, Wuguannan Yao, Runnan Fang, Shuofei Qiao, Kexin Cao, Guozhou Zheng, Xiang Qi, Peng Zhang, Shumin Deng2026
SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learninghttps://arxiv.org/abs/2602.08234Peng Xia, Jianwen Chen, Hanyang Wang, Jiaqi Liu, Kaide Zeng, Yu Wang, Siwei Han, Yiyang Zhou, Xujiang Zhao, Haifeng Chen, Zeyu Zheng, Cihang Xie, Huaxiu Yao2026
Dynamic Dual-Granularity Skill Bank for Agentic RLhttps://arxiv.org/abs/2603.28716Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao2026
Arise: Agent reasoning with intrinsic skill evolution in hierarchical reinforcement learninghttps://arxiv.org/abs/2603.16060Yu Li, Rui Miao, Zhengling Qi, Tian Lan2026
Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scalehttps://arxiv.org/abs/2603.02176Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu2026
Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAGhttps://arxiv.org/abs/2604.14572Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh2026
SKILLFOUNDRY: Building Self-Evolving Agent Skill Libraries from Heterogeneous Scientific Resourceshttps://arxiv.org/abs/2604.03964Shuaike Shen, Wenduo Cheng, Mingqian Ma, Alistair Turcan, Martin Jinye Zhang, Jian Ma2026
Graph of Skills: Dependency-Aware Structural Retrieval for Massive Agent Skillshttps://arxiv.org/abs/2604.05333Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun2026
SkillNet: Create, Evaluate, and Connect AI Skillshttps://arxiv.org/abs/2603.04448Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen2026

Retrieval & Disclosure

Paper TitlePaper URLAuthor ListYear
Skill Retrieval Augmentation for Agentic AIhttps://arxiv.org/abs/2604.24594Weihang Su, Jianming Long, Qingyao Ai, Yichen Tang, Changyue Wang, Yiteng Tu, Yiqun Liu2026
How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settingshttps://arxiv.org/abs/2604.04323Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang2026
CUA-Skill: Develop Skills for Computer Using Agenthttps://arxiv.org/abs/2601.21123Tianyi Chen, Yinheng Li, Michael Solodko, Sen Wang, Nan Jiang, Tingyuan Cui, Junheng Hao, Jongwoo Ko, Sara Abdali, Leon Xu, Suzhen Zheng, Hao Fan, Pashmina Cameron, Justin Wagle, Kazuhito Koishida2026
AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolutionhttps://arxiv.org/abs/2603.01145Yutao Yang, Junsong Li, Qianjun Pan, Bihao Zhan, Yuxuan Cai, Lin Du, Jie Zhou, Kai Chen, Qin Chen, Xin Li, Bo Zhang, Liang He2026
SkillRouter: Skill Routing for LLM Agents at Scalehttps://arxiv.org/abs/2603.22455YanZhao Zheng, ZhenTao Zhang, Chao Ma, YuanQiang Yu, JiHuai Zhu, Yong Wu, Tianze Xu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu2026
SkillReducer: Optimizing LLM Agent Skills for Token Efficiencyhttps://arxiv.org/abs/2603.29919Yudong Gao, Zongjie Li, Yuanyuanyuan, Zimo Ji, Pingchuan Ma, Shuai Wang2026
Graph of Skills: Dependency-Aware Structural Retrieval for Massive Agent Skillshttps://arxiv.org/abs/2604.05333Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun2026

Composition, Orchestration & Execution

Paper TitlePaper URLAuthor ListYear
PolySkill: Learning Generalizable Skills Through Polymorphic Abstractionhttps://arxiv.org/abs/2510.15863Simon Yu, Gang Li, Weiyan Shi, Peng Qi2026
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skillshttps://arxiv.org/abs/2504.07079Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, Yu Su2025
Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scalehttps://arxiv.org/abs/2603.02176Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu2026
GraSP: Graph-Structured Skill Compositions for LLM Agentshttps://arxiv.org/abs/2604.17870Tianle Xia, Lingxiang Hu, Yiding Sun, Ming Xu, Lan Xu, Siying Wang, Wei Xu, Jie Jiang2026
SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?https://arxiv.org/abs/2603.00718Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh2026
SkillOrchestra: Learning to Route Agents via Skill Transferhttps://arxiv.org/abs/2602.19672Jiayu Wang, Yifei Ming, Zixuan Ke, Shafiq Joty, Aws Albarghouthi, Frederic Sala2026
Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesishttps://arxiv.org/abs/2602.03279Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Xuan Ren, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang2026

Refinement & Evolution

Paper TitlePaper URLAuthor ListYear
SkillTracer: Structural Failure Attribution and Refinement of Agentic Skills in Long-Horizon Web Taskshttps://openreview.net/forum?id=OiyEjThGeZYuyang Li, Yiran Dou, Jie-Jing Shao, Yueming Lyu, Ivor Tsang, Haiyan Yin
Meta Context Engineering via Agentic Skill Evolutionhttps://arxiv.org/abs/2601.21557Haoran Ye, Xuning He, Vincent Arak, Haonan Dong, Guojie Song2026
Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agentshttps://arxiv.org/abs/2602.01869Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang2026
MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agentshttps://arxiv.org/abs/2602.02474Haozhen Zhang, Quanyu Long, Jianzhu Bao, Tao Feng, Weizhi Zhang, Haodong Yue, Wenya Wang2026
EvoSkill: Automated Skill Discovery for Multi-Agent Systemshttps://arxiv.org/abs/2603.02766Salaheddin Alzubi, Noah Provenzano, Jaydon Bingham, Weiyuan Chen, Tu Vu2026
Memento-Skills: Let Agents Design Agentshttps://arxiv.org/abs/2603.18743Huichi Zhou, Siyuan Guo, Anjie Liu, Zhongwei Yu, Ziqin Gong, Bowen Zhao, Zhixun Chen, Menglong Zhang, Yihang Chen, Jinsong Li, Runyu Yang, Qiangbin Liu, Xinlei Yu, Jianmin Zhou, Na Wang, Chunyang Sun, Jun Wang2026
Dynamic Dual-Granularity Skill Bank for Agentic RLhttps://arxiv.org/abs/2603.28716Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao2026
CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verificationhttps://arxiv.org/abs/2604.01687Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, Chengze Li, Wei-Chieh Huang, Yifei Yao, Kening Zheng, Xue Liu, Xiaoxiao Li, Philip S. Yu2026
SkillClaw: Let Skills Evolve Collectively with Agentic Evolverhttps://arxiv.org/abs/2604.08377Ziyu Ma, Shidong Yang, Yuxiang Ji, Xucong Wang, Yong Wang, Yiming Hu, Tongwen Huang, Xiangxiang Chu2026
SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Supporthttps://arxiv.org/abs/2604.08618Xingyan Liu, Xiyue Luo, Linyu Li, Ganghong Huang, Jianfeng Liu, Honglin Qiao2026

Deprecation & Retirement

Paper TitlePaper URLAuthor ListYear
Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agentshttps://arxiv.org/abs/2602.01869Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang2026
Dynamic Dual-Granularity Skill Bank for Agentic RLhttps://arxiv.org/abs/2603.28716Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao2026
Reinforcement learning for self-improving agent with skill libraryhttps://arxiv.org/abs/2512.17102Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong2025

Internalization Stage

Paper TitlePaper URLAuthor ListYear
EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecyclehttps://arxiv.org/abs/2510.16079Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi2025
SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalizationhttps://arxiv.org/abs/2604.02268Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Chengcheng Han, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen2026
Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agentshttps://arxiv.org/abs/2604.10674Hao Wang, Guozhi Wang, Han Xiao, Yufeng Zhou, Yue Pan, Jichao Wang, Ke Xu, Yafei Wen, Xiaohu Ruan, Xiaoxin Chen, Honggang Qi2026
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reasonhttps://arxiv.org/abs/2507.02841Kaiyi Zhang, Ang Lv, Jinpeng Li, Yongbo Wang, Feng Wang, Haoyuan Hu, Rui Yan2025
Internalizing Meta-Experience into Memory for Guided Reinforcement Learning in Large Language Modelshttps://arxiv.org/abs/2602.10224Shiting Huang, Zecheng Li, Yu Zeng, Qingnan Ren, Zhen Fang, Qisheng Su, Kou Shi, Lin Chen, Zehui Chen, Feng Zhao2026
Dynamic Dual-Granularity Skill Bank for Agentic RLhttps://arxiv.org/abs/2603.28716Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dongbin Zhao2026

⚙️ Layer 4: Runtime Integration

Terminal Interface

Paper TitlePaper URLAuthor ListYear
Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaceshttps://arxiv.org/abs/2601.11868Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, Junhong Shen, Guanghao Ye, Haowei Lin, Jason Poulos, Maoyu Wang, Marianna Nezhurina, Jenia Jitsev, Di Lu, Orfeas Menis Mastromichalakis, Zhiwei Xu, Zizhao Chen, Yue Liu, Robert Zhang, Leon Liangyu Chen, Anurag Kashyap, Jan-Lucas Uslu, Jeffrey Li, Jianbo Wu, Minghao Yan, Song Bian, Vedang Sharma, Ke Sun, Steven Dillmann, Akshay Anand, Andrew Lanpouthakoun, Bardia Koopah, Changran Hu, Etash Guha, Gabriel H. S. Dreiman, Jiacheng Zhu, Karl Krauth, Li Zhong, Niklas Muennighoff, Robert Amanfu, Shangyin Tan, Shreyas Pimpalgaonkar, Tushar Aggarwal, Xiangning Lin, Xin Lan, Xuandong Zhao, Yiqing Liang, Yuanli Wang, Zilong Wang, Changzhi Zhou, David Heineman, Hange Liu, Harsh Trivedi, John Yang, Junhong Lin, Manish Shetty, Michael Yang, Nabil Omi, Negin Raoof, Shanda Li, Terry Yue Zhuo, Wuwei Lin, Yiwei Dai, Yuxin Wang, Wenhao Chai, Shang Zhou, Dariush Wahdany, Ziyu She, Jiaming Hu, Zhikang Dong, Yuxuan Zhu, Sasha Cui, Ahson Saiyed, Arinbjörn Kolbeinsson, Jesse Hu, Christopher Michael Rytting, Ryan Marten, Yixin Wang, Alex Dimakis, Andy Konwinski, Ludwig Schmidt2026
Terminal Agents Suffice for Enterprise Automationhttps://arxiv.org/abs/2604.00073Patrice Bechard, Orlando Marquez Ayala, Emily Chen, Jordan Skelton, Sagar Davasam, Srinivas Sunkara, Vikas Yadav, Sai Rajeswar2026
Toward Scalable Terminal Task Synthesis via Skill Graphshttps://arxiv.org/abs/2604.25727Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiangtao Guan, Yun Yang, Dingxin Hu, Jiang Zhou, Xing Wu, Zhuo Han, Feng Zhang, Lilin Wang2026
AgentClick: A Skill-Based Human-in-the-Loop Review Layer for Terminal AI Agentshttps://arxiv.org/abs/2604.16520Haomin Zhuang, Hanwen Xing, Xiangliang Zhang2026

Tool Interface

Paper TitlePaper URLAuthor ListYear
Toolformer: Language Models Can Teach Themselves to Use Toolshttps://arxiv.org/abs/2302.04761Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, Maria Lomeli, Luke Zettlemoyer, Nicola Cancedda, Thomas Scialom2023
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Toolshttps://arxiv.org/abs/2509.09734Zikang Guo, Benfeng Xu, Chiwei Zhu, Wentao Hong, Xiaorui Wang, Zhendong Mao2025
Agent Skill Framework: Perspectives on the Potential of Small Language Models in Industrial Environmentshttps://arxiv.org/abs/2602.16653Yangjie Xu, Lujun Li, Lama Sleem, Niccolo Gentile, Yewei Song, Yiqun Wang, Siming Ji, Wenbo Wu, Radu State2026
Procedural Knowledge Improves Agentic LLM Workflowshttps://arxiv.org/abs/2511.07568Vincent Hsiao, Mark Roberts, Leslie Smith2025
SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?https://arxiv.org/abs/2603.00718Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh2026

Multi-Agent System Integration

Paper TitlePaper URLAuthor ListYear
MetaGPT: Meta Programming for A Multi-Agent Collaborative Frameworkhttps://arxiv.org/abs/2308.00352Sirui Hong, Mingchen Zhuge, Jiaqi Chen, Xiawu Zheng, Yuheng Cheng, Ceyao Zhang, Jinlin Wang, Zili Wang, Steven Ka Shing Yau, Zijuan Lin, Liyang Zhou, Chenyu Ran, Lingfeng Xiao, Chenglin Wu, Jürgen Schmidhuber2024
When Single-Agent with Skills Replace Multi-Agent Systems and When They Failhttps://arxiv.org/abs/2601.04748Xiaoxiao Li2026
ABSTRAL: Automatic Design of Multi-Agent Systems Through Iterative Refinement and Topology Optimizationhttps://arxiv.org/abs/2603.22791Weijia Song, Jiashu Yue, Zhe Pang2026
SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topologyhttps://arxiv.org/abs/2604.17503Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu2026
Memento-Skills: Let Agents Design Agentshttps://arxiv.org/abs/2603.18743Huichi Zhou, Siyuan Guo, Anjie Liu, Zhongwei Yu, Ziqin Gong, Bowen Zhao, Zhixun Chen, Menglong Zhang, Yihang Chen, Jinsong Li, Runyu Yang, Qiangbin Liu, Xinlei Yu, Jianmin Zhou, Na Wang, Chunyang Sun, Jun Wang2026

Harness Integration

Paper TitlePaper URLAuthor ListYear
ClawArena: Benchmarking AI Agents in Evolving Information Environmentshttps://arxiv.org/abs/2604.04202Haonian Ji, Kaiwen Xiong, Siwei Han, Peng Xia, Shi Qiu, Yiyang Zhou, Jiaqi Liu, Jinlong Li, Bingzhou Li, Zeyu Zheng, Cihang Xie, Huaxiu Yao2026
SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Taskshttps://arxiv.org/abs/2602.12670Xiangyi Li, Wenbo Chen, Yimin Liu, Shenghan Zheng, Xiaokun Chen, Yifeng He, Yubo Li, Bingran You, Haotian Shen, Jiankai Sun, Shuyi Wang, Binxu Li, Qunhong Zeng, Di Wang, Xuandong Zhao, Yuanli Wang, Roey Ben Chaim, Zonglin Di, Yipeng Gao, Junwei He, Yizhuo He, Liqiang Jing, Luyang Kong, Xin Lan, Jiachen Li, Songlin Li, Yijiang Li, Yueqian Lin, Xinyi Liu, Xuanqing Liu, Haoran Lyu, Ze Ma, Bowei Wang, Runhui Wang, Tianyu Wang, Wengao Ye, Yue Zhang, Hanwen Xing, Yiqi Xue, Steven Dillmann, Han-chung Lee2026
SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Taskshttps://arxiv.org/abs/2604.20087Shanshan Zhong, Yi Lu, Jingjie Ning, Yibing Wan, Lihan Feng, Yuyi Ao, Leonardo F. R. Ribeiro, Markus Dreyer, Sean Ammirati, Chenyan Xiong2026
Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scalehttps://arxiv.org/abs/2603.02176Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu2026
AgentFactory: A Self-Evolving Framework Through Executable Subagent Accumulation and Reusehttps://arxiv.org/abs/2603.18000Zhang Zhang, Shuqi Lu, Hongjin Qian, Di He, Zheng Liu2026
SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agentshttps://arxiv.org/abs/2604.17308Ziao Zhang, Kou Shi, Shiting Huang, Avery Nie, Yu Zeng, Yiming Zhao, Zhen Fang, Qishen Su, Haibo Qiu, Wei Yang, Qingnan Ren, Shun Zou, Wenxuan Huang, Lin Chen, Zehui Chen, Feng Zhao2026
AgentEvolver: Towards Efficient Self-Evolving Agent Systemhttps://arxiv.org/abs/2511.10395Yunpeng Zhai, Shuchang Tao, Cheng Chen, Anni Zou, Ziqian Chen, Qingxu Fu, Shinji Mai, Li Yu, Jiaji Deng, Zouying Cao, Zhaoyang Liu, Bolin Ding, Jingren Zhou2025

🛡️ Layer 5: Governance

Marketplaces and Ecosystems

Paper TitlePaper URLAuthor ListYear
Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionalityhttps://arxiv.org/abs/2602.08004George Ling, Shanshan Zhong, Richard Huang2026

Threat and Risk Surface

Paper TitlePaper URLAuthor ListYear
When Skills Lie: Hidden-Comment Injection in LLM Agentshttps://arxiv.org/abs/2602.10498Qianli Wang, Boyang Ma, Minghui Xu, Yue Zhang2026
Agent Skills Enable a New Class of Realistic and Trivially Simple Prompt Injectionshttps://arxiv.org/abs/2510.26328David Schmotz, Sahar Abdelnabi, Maksym Andriushchenko2025
SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinementhttps://arxiv.org/abs/2602.14211Xiaojun Jia, Jie Liao, Simeng Qin, Jindong Gu, Wenqi Ren, Xiaochun Cao, Yang Liu, Philip Torr2026
Skill-Inject: Measuring Agent Vulnerability to Skill File Attackshttps://arxiv.org/abs/2602.20156David Schmotz, Luca Beurer-Kellner, Sahar Abdelnabi, Maksym Andriushchenko2026
Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystemshttps://arxiv.org/abs/2601.17548Narek Maloyan, Dmitry Namiot2026
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoninghttps://arxiv.org/abs/2604.09378Guiyao Tie, Jiawen Shi, Pan Zhou, Lichao Sun2026
SkillTrojan: Backdoor Attacks on Skill-Based Agent Systemshttps://arxiv.org/abs/2604.06811Yunhao Feng, Yifan Ding, Yingshui Tan, Boren Zheng, Yanming Guo, Xiaolong Li, Kun Zhai, Yishan Li, Wenke Huang2026
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?https://arxiv.org/abs/2604.15415Yukun Jiang, Yage Zhang, Michael Backes, Xinyue Shen, Yang Zhang2026
Malicious Agent Skills in the Wild: A Large-Scale Security Empirical Studyhttps://arxiv.org/abs/2602.06547Yi Liu, Zhihao Chen, Yanjun Zhang, Gelei Deng, Yuekang Li, Jianting Ning, Ying Zhang, Leo Yu Zhang2026
Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scalehttps://arxiv.org/abs/2601.10338Yi Liu, Weizhe Wang, Ruitao Feng, Yao Zhang, Guangquan Xu, Gelei Deng, Yuekang Li, Leo Zhang2026
Red Skills or Blue Skills? A Dive Into Skills Published on ClawHubhttps://arxiv.org/abs/2604.13064Haichuan Hu, Ye Shang, Quanjun Zhang2026
RouteGuard: Internal-Signal Detection of Skill Poisoning in LLM Agentshttps://arxiv.org/abs/2604.22888Wenjie Xiao, Xuehai Tang, Biyu Zhou, Songlin Hu, Jizhong Han2026
SkillClone: Multi-Modal Clone Detection and Clone Propagation Analysis in the Agent Skill Ecosystemhttps://arxiv.org/abs/2603.22447Jiaying Zhu, Lyuye Zhang, Wenbo Guo, Yang Liu2026
Formal analysis and supply chain security for agentic AI skillshttps://arxiv.org/abs/2603.00195Varun Pratap Bhardwaj2026
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystemshttps://arxiv.org/abs/2604.03081Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma2026
SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaborationhttps://arxiv.org/abs/2603.21019Zihan Guo, Zhiyu Chen, Xiaohang Nie, Jianghao Lin, Yuanjian Zhou, Weinan Zhang2026
SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skillshttps://arxiv.org/abs/2604.06550Yinghan Hou, Zongyou Yang2026
Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skillshttps://arxiv.org/abs/2604.25109Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu2026
SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinementhttps://arxiv.org/abs/2604.04989Zenghao Duan, Yuxin Tian, Zhiyi Yin, Liang Pang, Jingcheng Deng, Zihao Wei, Shicheng Xu, Yuyao Ge, Xueqi Cheng2026
Malicious Or Not: Adding Repository Context to Agent Skill Classificationhttps://arxiv.org/abs/2603.16572Florian Holzbauer, David Schmidt, Gabriel Gegenhuber, Sebastian Schrittwieser, Johanna Ullrich2026
Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threatshttps://arxiv.org/abs/2603.11619Xinhao Deng, Yixiang Zhang, Jiaqing Wu, Jiaqi Bai, Sibo Yi, Zhuoheng Zou, Yue Xiao, Rennai Qiu, Jianan Ma, Jialuo Chen, Xiaohu Du, Xiaofang Yang, Shiwen Cui, Changhua Meng, Weiqiang Wang, Jiaxing Song, Ke Xu, Qi Li2026
STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systemshttps://arxiv.org/abs/2604.10286Guijia Zhang, Shu Yang, Xilin Gong, Di Wang2026

Safe Usage and Governance Mechanisms

Paper TitlePaper URLAuthor ListYear
SoK: Agentic Skills--Beyond Tool Use in LLM Agentshttps://arxiv.org/abs/2602.20867Yanna Jiang, Delong Li, Haiyu Deng, Baihe Ma, Xu Wang, Qin Wang, Guangsheng Yu2026
Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Studyhttps://arxiv.org/abs/2604.03070Zhihao Chen, Ying Zhang, Yi Liu, Gelei Deng, Yuekang Li, Yanjun Zhang, Jianting Ning, Leo Yu Zhang, Lei Ma, Zhiqiang Li2026
NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Railshttps://arxiv.org/abs/2310.10501Traian Rebedea, Razvan Dinu, Makesh Sreedhar, Christopher Parisien, Jonathan Cohen2023
Agent Contracts: A Formal Framework for Resource-Bounded Autonomous AI Systemshttps://arxiv.org/abs/2601.08815Qing Ye, Jing Tan2026
SkillNet: Create, Evaluate, and Connect AI Skillshttps://arxiv.org/abs/2603.04448Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen2026
Towards Secure Agent Skills: Architecture, Threat Taxonomy, and Security Analysishttps://arxiv.org/abs/2604.02837Zhiyuan Li, Jingzheng Wu, Xiang Ling, Xing Cui, Tianyue Luo2026
SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistantshttps://arxiv.org/abs/2603.28807Haoyu Wang, Zibo Xiao, Yedi Zhang, Christopher M. Poskitt, Jun Sun2026

🚀 Layer 6: Application

Embodied Robotics & Physical Manipulation

Paper TitlePaper URLAuthor ListYear
Do As I Can, Not As I Say: Grounding Language in Robotic Affordanceshttps://arxiv.org/abs/2204.01691Michael Ahn, Anthony Brohan, Noah Brown, Yevgen Chebotar, Omar Cortes, Byron David, Chelsea Finn, Chuyuan Fu, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Daniel Ho, Jasmine Hsu, Julian Ibarz, Brian Ichter, Alex Irpan, Eric Jang, Rosario Jauregui Ruano, Kyle Jeffrey, Sally Jesmonth, Nikhil J Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Kuang-Huei Lee, Sergey Levine, Yao Lu, Linda Luu, Carolina Parada, Peter Pastor, Jornell Quiambao, Kanishka Rao, Jarek Rettinghouse, Diego Reyes, Pierre Sermanet, Nicolas Sievers, Clayton Tan, Alexander Toshev, Vincent Vanhoucke, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Mengyuan Yan, Andy Zeng2022
XSkill: Cross Embodiment Skill Discoveryhttps://arxiv.org/abs/2307.09955Mengda Xu, Zhenjia Xu, Cheng Chi, Manuela Veloso, Shuran Song2023
Uni-Skill: Building Self-Evolving Skill Repository for Generalizable Robotic Manipulationhttps://arxiv.org/abs/2603.02623Senwei Xie, Yuntian Zhang, Ruiping Wang, Xilin Chen2026
Agentic Skill Discoveryhttps://arxiv.org/abs/2405.15019Xufeng Zhao, Cornelius Weber, Stefan Wermter2024
Lifelong Robot Library Learning: Bootstrapping Composable and Generalizable Skills for Embodied Control with Language Modelshttps://arxiv.org/abs/2406.18746Georgios Tziafas, Hamidreza Kasaei2024
VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thoughthttps://arxiv.org/abs/2406.14596Gabriel Sarch, Lawrence Jang, Michael J. Tarr, William W. Cohen, Kenneth Marino, Katerina Fragkiadaki2025
ASCENT: Autonomous Skill Learning Toward Complex Embodied Tasks With Foundation Modelshttps://doi.org/10.1109/ICRA55743.2025.11127927Haolin Wu, Yuecheng Liu, Junyi Dong, Heng Zhang, Sitong Mao, Hesheng Wang, Weigang Wu, Shunbo Zhou2025
Real-Time Verification of Embodied Reasoning for Generative Skill Acquisitionhttps://arxiv.org/abs/2505.11175Bo Yue, Shuqi Guo, Kaiyu Hu, Chujiao Wang, Benyou Wang, Kui Jia, Guiliang Liu2025
SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassemblyhttps://arxiv.org/abs/2603.11080Chang Liu, Sibo Tian, Xiao Liang, Minghui Zheng2026
Learning Without Losing Identity: Capability Evolution for Embodied Agentshttps://arxiv.org/abs/2604.07799Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li2026

Open-Ended Game Environments

Paper TitlePaper URLAuthor ListYear
A deep hierarchical approach to lifelong learning in minecrafthttps://doi.org/10.1609/aaai.v31i1.10744Chen Tessler, Shahar Givony, Tom Zahavy, Daniel Mankowitz, Shie Mannor2017
Hierarchical and interpretable skill acquisition in multi-task reinforcement learninghttps://arxiv.org/abs/1712.07294Tianmin Shu, Caiming Xiong, Richard Socher2017
Skill reinforcement learning and planning for open-world long-horizon taskshttps://arxiv.org/abs/2303.16563Haoqi Yuan, Chi Zhang, Hongcheng Wang, Feiyang Xie, Penglin Cai, Hao Dong, Zongqing Lu2023
MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledgehttps://arxiv.org/abs/2206.08853Linxi Fan, Guanzhi Wang, Yunfan Jiang, Ajay Mandlekar, Yuncong Yang, Haoyi Zhu, Andrew Tang, De-An Huang, Yuke Zhu, Anima Anandkumar2022
MCU: An evaluation framework for open-ended game agentshttps://proceedings.mlr.press/v267/zheng25j.htmlXinyue Zheng, Haowei Lin, Kaichen He, Zihao Wang, Qiang Fu, Haobo Fu, Zilong Zheng, Yitao Liang2025
Voyager: An Open-Ended Embodied Agent with Large Language Modelshttps://arxiv.org/abs/2305.16291Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar2023
Odyssey: Empowering minecraft agents with open-world skillshttps://arxiv.org/abs/2407.15325Shunyu Liu, Yaoru Li, Kongcheng Zhang, Zhenyu Cui, Wenkai Fang, Yuxuan Zheng, Tongya Zheng, Mingli Song2024
See and Think: Embodied Agent in Virtual Environmenthttps://arxiv.org/abs/2311.15209Zhonghan Zhao, Wenhao Chai, Xuan Wang, Li Boyi, Shengyu Hao, Shidong Cao, Tian Ye, Gaoang Wang2024
Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolutionhttps://arxiv.org/abs/2505.17673Jiawei Du, Jinlong Wu, Yuzheng Chen, Yucheng Hu, Bing Li, Joey Tianyi Zhou2025
SAG-Agent: Enabling Long-Horizon Reasoning in Strategy Games via Dynamic Knowledge Graphshttps://arxiv.org/abs/2510.15259Chenwei Tang, Lin Long, Xinyu Liu, Jingyu Xing, Zizhou Wang, Joey Tianyi Zhou, Jiawei Du, Liangli Zhen, Jiancheng Lv2026
SCALAR: Learning and Composing Skills through LLM Guided Symbolic Planning and Deep RL Groundinghttps://arxiv.org/abs/2603.09036Renos Zabounidis, Yue Wu, Simon Stepputtis, Woojun Kim, Yuanzhi Li, Tom Mitchell, Katia Sycara2026
Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Taskshttps://arxiv.org/abs/2604.20987Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha2026

Web Agents & Browser Automation

Paper TitlePaper URLAuthor ListYear
Mind2Web: Towards a Generalist Agent for the Webhttps://arxiv.org/abs/2306.06070Xiang Deng, Yu Gu, Boyuan Zheng, Shijie Chen, Samuel Stevens, Boshi Wang, Huan Sun, Yu Su2023
WebVoyager: Building an End-to-End Web Agent with Large Multimodal Modelshttps://arxiv.org/abs/2401.13919Hongliang He, Wenlin Yao, Kaixin Ma, Wenhao Yu, Yong Dai, Hongming Zhang, Zhenzhong Lan, Dong Yu2024
WebArena: A Realistic Web Environment for Building Autonomous Agentshttps://arxiv.org/abs/2307.13854Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, Graham Neubig2024
Agent Workflow Memoryhttps://arxiv.org/abs/2409.07429Zora Zhiruo Wang, Jiayuan Mao, Daniel Fried, Graham Neubig2024
Inducing Programmatic Skills for Agentic Taskshttps://arxiv.org/abs/2504.06821Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig, Daniel Fried2025
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skillshttps://arxiv.org/abs/2504.07079Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, Yu Su2025
SkillEvo: An Experience Learning Framework with Reinforcement Learning for Skill Evolutionhttps://openreview.net/forum?id=S1cIE9pe3kZishan Xu, Yifu Guo, Yuquan Lu, Fengyu Yang, Zhiyuan Yao, Jiaye Lin, Ruyi Gong, Lihua Cai2026
WebXSkill: Skill Learning for Autonomous Web Agentshttps://arxiv.org/abs/2604.13318Zhaoyang Wang, Qianhui Wu, Xuchao Zhang, Chaoyun Zhang, Wenlin Yao, Fazle Elahi Faisal, Baolin Peng, Si Qin, Suman Nath, Qingwei Lin, Chetan Bansal, Dongmei Zhang, Saravan Rajmohan, Jianfeng Gao, Huaxiu Yao2026
ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agentshttps://arxiv.org/abs/2603.20340Zijian Lu, Yiping Zuo, Yupeng Nie, Xin He, Weibei Fan, Lianyong Qi, Shi Jin2026

GUI, Mobile & OS Agents

Paper TitlePaper URLAuthor ListYear
OS-Copilot: Towards Generalist Computer Agents with Self-Improvementhttps://arxiv.org/abs/2402.07456Zhiyong Wu, Chengcheng Han, Zichen Ding, Zhenmin Weng, Zhoumianze Liu, Shunyu Yao, Tao Yu, Lingpeng Kong2024
AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agentshttps://arxiv.org/abs/2405.14573Christopher Rawles, Sarah Clinckemaillie, Yifan Chang, Jonathan Waltz, Gabrielle Lau, Marybeth Fair, Alice Li, William Bishop, Wei Li, Folawiyo Campbell-Ajala, Daniel Toyama, Robert Berry, Divya Tyamagundlu, Timothy Lillicrap, Oriana Riva2025
Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scalehttps://arxiv.org/abs/2409.08264Rogerio Bonatti, Dan Zhao, Francesco Bonacci, Dillon Dupont, Sara Abdali, Yinheng Li, Yadong Lu, Justin Wagle, Kazuhito Koishida, Arthur Bucker, Lawrence Jang, Zack Hui2024
Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skillshttps://arxiv.org/abs/2506.10387Yuquan Xie, Zaijing Li, Rui Shao, Gongwei Chen, Kaiwen Zhou, Yinchuan Li, Dongmei Jiang, Liqiang Nie2025
CUA-Skill: Develop Skills for Computer Using Agenthttps://arxiv.org/abs/2601.21123Tianyi Chen, Yinheng Li, Michael Solodko, Sen Wang, Nan Jiang, Tingyuan Cui, Junheng Hao, Jongwoo Ko, Sara Abdali, Leon Xu, Suzhen Zheng, Hao Fan, Pashmina Cameron, Justin Wagle, Kazuhito Koishida2026
OSExpert: Computer-Use Agents Learning Professional Skills via Explorationhttps://arxiv.org/abs/2603.07978Jiateng Liu, Zhenhailong Wang, Rushi Wang, Bingxuan Li, Jeonghwan Kim, Aditi Tiwari, Pengfei Yu, Denghui Zhang, Heng Ji2026
SkillDroid: Compile Once, Reuse Foreverhttps://arxiv.org/abs/2604.14872Qijia Chen, Andrea Bellucci, Zhida Sun, Giulio Jacucci2026

Software Engineering & Coding Agents

Paper TitlePaper URLAuthor ListYear
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?https://arxiv.org/abs/2310.06770Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan2024
Swe-exp: Experience-driven software issue resolutionhttps://arxiv.org/abs/2507.23361Silin Chen, Shaoxin Lin, Yuling Shi, Heng Lian, Xiaodong Gu, Longfei Yun, Dong Chen, Lin Cao, Jiyang Liu, Nu Xia, others2025
Kimi-Dev: Agentless Training as Skill Prior for SWE-Agentshttps://arxiv.org/abs/2509.23045Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu2025
Hybrid-Gym: Training Coding Agents to Generalize Across Taskshttps://arxiv.org/abs/2602.16819Yiqing Xie, Emmy Liu, Gaokai Zhang, Nachiket Kotalwar, Shubham Gandhi, Sathwik Acharya, Xingyao Wang, Carolyn Rose, Graham Neubig, Daniel Fried2026
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?https://arxiv.org/abs/2603.15401Tingxu Han, Yi Zhang, Wei Song, Chunrong Fang, Zhenyu Chen, Youcheng Sun, Lijie Hu2026
EffiSkill: Agent Skill Based Automated Code Efficiency Optimizationhttps://arxiv.org/abs/2603.27850Zimu Wang, Yuling Shi, Mengfan Li, Zijun Liu, Jie M. Zhang, Chengcheng Wan, Xiaodong Gu2026
Scaling Coding Agents via Atomic Skillshttps://arxiv.org/abs/2604.05013Yingwei Ma, Yue Liu, Xinlong Yang, Yanhao Li, Kelin Fu, Yibo Miao, Yuchong Xie, Zhexu Wang, Shing-Chi Cheung2026
SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineeringhttps://arxiv.org/abs/2604.09297Jingzhi Gong, Ruizhen Gu, Zhiwei Fei, Yazhuo Cao, Lukas Twist, Alina Geiger, Shuo Han, Dominik Sobania, Federica Sarro, Jie M. Zhang2026

Contributors

hachihao

7 commits