YsTvT/Awesome-Agentic-RL-Papers

107

42 commits

updated Oct 22, 2025

See the code

README

Awesome Agentic RL Papers

A curated collection of research papers on LLM-based agents and agent training methodologies.

Awesome License: MIT

πŸ“‹ Table of Contents


🎯 Agent Tuning

TitleVenueDateCodeStars
Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM AgentsICLR 2026 under review2025-09--
SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated ReasoningarXiv2025-09GitHub
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Credit AssignmentarXiv2025-05GitHub
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning TasksarXiv2025-05GitHub
Group-in-Group Policy Optimization for LLM Agent TrainingarXiv2025-05GitHub
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningCOLM 20252025-05GitHub
Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement LearningICML 20252025-05GitHub
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement LearningarXiv2025-04GitHub
NAT: Enhancing Agent Tuning with Negative SamplesNAACL 20252025-04GitHub
UI-R1: Enhancing Action Prediction of GUI Agents by Reinforcement LearningarXiv2025-03GitHub
GUI-Xplore: Empowering Generalizable GUI Agents with One ExplorationCVPR 20252025-03GitHub
ATLaS: Agent Tuning via Learning Critical StepsACL 20252025-03--
ReSearch: Learning to Reason with Search for LLMs via Reinforcement LearningarXiv2025-03GitHub
A Review of Prominent Paradigms for LLM-Based Agents: Tool Use, Planning, and Feedback LearningCOLING 20252025-01GitHub
AgentRefine: Enhancing Agent Generalization through Refinement TuningICLR 20252025-01--
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool UsageICLR 20252024-12GitHub
WEBRL: Training LLM Web Agents via Self-Evolving Online Curriculum RLICLR 20252024-11GitHub
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction TuningNeurIPS 20242024-11--
Agent Q: Advanced Reasoning and Learning for Autonomous AI AgentsarXiv2024-08GitHub
ShortcutsBench: A Large Scale Real-world Benchmark for API-based AgentsICLR 20252024-07GitHub
AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge BasesNeurIPS 20242024-07GitHub
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous RLNeurIPS 20242024-06GitHub
Fine-Tuning Large Vision-Language Models as Decision Making Agents via RLNeurIPS 20242024-05GitHub
AgentStudio: A Toolkit for Building General Virtual AgentsICLR 20252024-03GitHub
Cradle: Empowering Foundation Agents Towards General Computer ControlarXiv2024-03GitHub
Agent-FLAN: Designing Data and Methods of Effective Agent TuningACL Findings 20242024-03GitHub
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based AgentsNeurIPS 20242024-02GitHub
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RLarXiv2024-02GitHub
AgentTuning: Enabling Generalized Agent Abilities for LLMsACL Findings 20242023-10GitHub
FireAct: Toward Language Agent Fine-tuningarXiv2023-10GitHub
EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of ThoughtNeurIPS 20232023-05GitHub
Reflexion: Language Agents with Verbal Reinforcement LearningNeurIPS 20232023-03GitHub

🎯 Agent Memory


πŸ”„ Multi-turn

Overview and Experience


Environment and Framework


Policy Optimization


Credit Assignment & Reward


Specific Domain


🎯 Tool Calling

TitleVenueDateCodeStars
StepTool: Enhancing Multi-Step Tool Usage in LLMs via Step-Grained Reinforcement LearningCIKM 20252025-08GitHub
Tool-Planner: Task Planning with Clusters across Multiple ToolsICLR 20252025-08GitHub
GTool: Graph Enhanced Tool Planning with Large Language ModelarXiv2025-08--
Agent-as-Tool: A Study on the Hierarchical Decision Making with Reinforcement LearningarXiv2025-07--
AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement LearningarXiv2025-07GitHub
NaviAgent: Bilevel Planning on Tool Dependency Graphs for Function CallingarXiv2025-06--
TreeRL: LLM Reinforcement Learning with On-Policy Tree SearchACL 20252025-06GitHub
Alita: Generalist Agent Enabling Scalable Agentic Reasoning with Minimal Predefinition and Maximal Self-EvolutionarXiv2025-05GitHub
Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem SolvingarXiv2025-05GitHub
Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced ReasoningarXiv2025-05GitHub
ToRL: Scaling Tool-Integrated RLarXiv2025-03GitHub
ToolDial: Multi-turn Dialogue Generation Method for Tool-Augmented Language ModelsICLR 20252025-03GitHub
OctoTools: An Agentic Framework with Extensible Tools for Complex ReasoningNAACL 20252025-02GitHub
From Exploration to Mastery: Enabling LLMs to Master Tools via Self-Driven InteractionsICLR 20252025-02GitHub
AGILE: A Novel Reinforcement Learning Framework of LLM AgentsNeurIPS 20242024-11GitHub
Toolken+: Improving LLM Tool Usage with Reranking and a Reject OptionEMNLP 20242024-10--
MindSearch: Mimicking Human Minds Elicits Deep AI SearcherarXiv2024-07GitHub
Executable Code Actions Elicit Better LLM AgentsICML 20242024-05GitHub
Learning to Use Tools via Cooperative and Interactive Agents with Large Language ModelsarXiv2024-03--
AnyTool: Self-Reflective, Hierarchical Agents for Large-Scale API CallsarXiv2024-02GitHub
TOOLVERIFIER: Generalization to New Tools via Self-VerificationEMNLP 20242024-02GitHub
ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool EmbeddingsNeurIPS 20232024-01GitHub
ControlLLM: Augment Language Models with Tools by Searching on GraphsECCV 20242023-10GitHub

🎯 Search Agent

TitleVenueDateCodeStars
Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM AgentsICLR 2026 under review2025-09--
SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated ReasoningarXiv2025-09GitHub
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Credit AssignmentarXiv2025-05GitHub
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning TasksarXiv2025-05GitHub
Group-in-Group Policy Optimization for LLM Agent TrainingarXiv2025-05GitHub
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningCOLM 20252025-05GitHub
Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement LearningICML 20252025-05GitHub
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement LearningarXiv2025-04GitHub
NAT: Enhancing Agent Tuning with Negative SamplesNAACL 20252025-04GitHub
UI-R1: Enhancing Action Prediction of GUI Agents by Reinforcement LearningarXiv2025-03GitHub
GUI-Xplore: Empowering Generalizable GUI Agents with One ExplorationCVPR 20252025-03GitHub
ATLaS: Agent Tuning via Learning Critical StepsACL 20252025-03--
ReSearch: Learning to Reason with Search for LLMs via Reinforcement LearningarXiv2025-03GitHub
A Review of Prominent Paradigms for LLM-Based Agents: Tool Use, Planning, and Feedback LearningCOLING 20252025-01GitHub
AgentRefine: Enhancing Agent Generalization through Refinement TuningICLR 20252025-01--
WebWalker: Benchmarking LLMs in Web TraversalACL 20252025-01--
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool UsageICLR 20252024-12GitHub
WEBRL: Training LLM Web Agents via Self-Evolving Online Curriculum RLICLR 20252024-11GitHub
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction TuningNeurIPS 20242024-11--
Agent Q: Advanced Reasoning and Learning for Autonomous AI AgentsarXiv2024-08GitHub
ShortcutsBench: A Large Scale Real-world Benchmark for API-based AgentsICLR 20252024-07GitHub
AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge BasesNeurIPS 20242024-07GitHub
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous RLNeurIPS 20242024-06GitHub
Fine-Tuning Large Vision-Language Models as Decision Making Agents via RLNeurIPS 20242024-05GitHub
AgentStudio: A Toolkit for Building General Virtual AgentsICLR 20252024-03GitHub
Cradle: Empowering Foundation Agents Towards General Computer ControlarXiv2024-03GitHub
Agent-FLAN: Designing Data and Methods of Effective Agent TuningACL Findings 20242024-03GitHub
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based AgentsNeurIPS 20242024-02GitHub
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RLarXiv2024-02GitHub
WebDancer: Towards Autonomous Information Seeking AgencyarXiv2025-05--
WebSailor: Navigating Super-human Reasoning for Web AgentarXiv2025-07--
WebShaper: Agentically Data Synthesizing via Information-Seeking FormalizationarXiv2025-07--
AgentTuning: Enabling Generalized Agent Abilities for LLMsACL Findings 20242023-10GitHub
FireAct: Toward Language Agent Fine-tuningarXiv2023-10GitHub
WebArena: A Realistic Web Environment for Building Autonomous AgentsNeurIPS 20232023-07GitHub
GAIA: a benchmark for General AI AssistantsNeurIPS 20232023-07GitHub
Reflexion: Language Agents with Verbal Reinforcement LearningNeurIPS 20232023-03GitHub
ReAct: Synergizing Reasoning and Acting in Language ModelsICLR 20232022-10GitHub
ToolFormer: Language Models Can Teach Themselves to Use ToolsNeurIPS 20232022-07GitHub
WebGPT: Browser-assisted question-answering with human feedbackarXiv2021-12--
--

🎯 Agent Workflow


🎯 Agent Evaluation & Benchmark

Contributors

YsTvT

13 commits

KeibingYang

10 commits

Rouse77

7 commits

ElevenLiy

6 commits

YsTvT/Awesome-Agentic-RL-Papers

107

42 commits

updated Oct 22, 2025

See the code

README

Awesome Agentic RL Papers

A curated collection of research papers on LLM-based agents and agent training methodologies.

Awesome License: MIT

πŸ“‹ Table of Contents


🎯 Agent Tuning

TitleVenueDateCodeStars
Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM AgentsICLR 2026 under review2025-09--
SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated ReasoningarXiv2025-09GitHub
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Credit AssignmentarXiv2025-05GitHub
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning TasksarXiv2025-05GitHub
Group-in-Group Policy Optimization for LLM Agent TrainingarXiv2025-05GitHub
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningCOLM 20252025-05GitHub
Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement LearningICML 20252025-05GitHub
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement LearningarXiv2025-04GitHub
NAT: Enhancing Agent Tuning with Negative SamplesNAACL 20252025-04GitHub
UI-R1: Enhancing Action Prediction of GUI Agents by Reinforcement LearningarXiv2025-03GitHub
GUI-Xplore: Empowering Generalizable GUI Agents with One ExplorationCVPR 20252025-03GitHub
ATLaS: Agent Tuning via Learning Critical StepsACL 20252025-03--
ReSearch: Learning to Reason with Search for LLMs via Reinforcement LearningarXiv2025-03GitHub
A Review of Prominent Paradigms for LLM-Based Agents: Tool Use, Planning, and Feedback LearningCOLING 20252025-01GitHub
AgentRefine: Enhancing Agent Generalization through Refinement TuningICLR 20252025-01--
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool UsageICLR 20252024-12GitHub
WEBRL: Training LLM Web Agents via Self-Evolving Online Curriculum RLICLR 20252024-11GitHub
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction TuningNeurIPS 20242024-11--
Agent Q: Advanced Reasoning and Learning for Autonomous AI AgentsarXiv2024-08GitHub
ShortcutsBench: A Large Scale Real-world Benchmark for API-based AgentsICLR 20252024-07GitHub
AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge BasesNeurIPS 20242024-07GitHub
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous RLNeurIPS 20242024-06GitHub
Fine-Tuning Large Vision-Language Models as Decision Making Agents via RLNeurIPS 20242024-05GitHub
AgentStudio: A Toolkit for Building General Virtual AgentsICLR 20252024-03GitHub
Cradle: Empowering Foundation Agents Towards General Computer ControlarXiv2024-03GitHub
Agent-FLAN: Designing Data and Methods of Effective Agent TuningACL Findings 20242024-03GitHub
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based AgentsNeurIPS 20242024-02GitHub
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RLarXiv2024-02GitHub
AgentTuning: Enabling Generalized Agent Abilities for LLMsACL Findings 20242023-10GitHub
FireAct: Toward Language Agent Fine-tuningarXiv2023-10GitHub
EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of ThoughtNeurIPS 20232023-05GitHub
Reflexion: Language Agents with Verbal Reinforcement LearningNeurIPS 20232023-03GitHub

🎯 Agent Memory


πŸ”„ Multi-turn

Overview and Experience


Environment and Framework


Policy Optimization


Credit Assignment & Reward


Specific Domain


🎯 Tool Calling

TitleVenueDateCodeStars
StepTool: Enhancing Multi-Step Tool Usage in LLMs via Step-Grained Reinforcement LearningCIKM 20252025-08GitHub
Tool-Planner: Task Planning with Clusters across Multiple ToolsICLR 20252025-08GitHub
GTool: Graph Enhanced Tool Planning with Large Language ModelarXiv2025-08--
Agent-as-Tool: A Study on the Hierarchical Decision Making with Reinforcement LearningarXiv2025-07--
AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement LearningarXiv2025-07GitHub
NaviAgent: Bilevel Planning on Tool Dependency Graphs for Function CallingarXiv2025-06--
TreeRL: LLM Reinforcement Learning with On-Policy Tree SearchACL 20252025-06GitHub
Alita: Generalist Agent Enabling Scalable Agentic Reasoning with Minimal Predefinition and Maximal Self-EvolutionarXiv2025-05GitHub
Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem SolvingarXiv2025-05GitHub
Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced ReasoningarXiv2025-05GitHub
ToRL: Scaling Tool-Integrated RLarXiv2025-03GitHub
ToolDial: Multi-turn Dialogue Generation Method for Tool-Augmented Language ModelsICLR 20252025-03GitHub
OctoTools: An Agentic Framework with Extensible Tools for Complex ReasoningNAACL 20252025-02GitHub
From Exploration to Mastery: Enabling LLMs to Master Tools via Self-Driven InteractionsICLR 20252025-02GitHub
AGILE: A Novel Reinforcement Learning Framework of LLM AgentsNeurIPS 20242024-11GitHub
Toolken+: Improving LLM Tool Usage with Reranking and a Reject OptionEMNLP 20242024-10--
MindSearch: Mimicking Human Minds Elicits Deep AI SearcherarXiv2024-07GitHub
Executable Code Actions Elicit Better LLM AgentsICML 20242024-05GitHub
Learning to Use Tools via Cooperative and Interactive Agents with Large Language ModelsarXiv2024-03--
AnyTool: Self-Reflective, Hierarchical Agents for Large-Scale API CallsarXiv2024-02GitHub
TOOLVERIFIER: Generalization to New Tools via Self-VerificationEMNLP 20242024-02GitHub
ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool EmbeddingsNeurIPS 20232024-01GitHub
ControlLLM: Augment Language Models with Tools by Searching on GraphsECCV 20242023-10GitHub

🎯 Search Agent

TitleVenueDateCodeStars
Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM AgentsICLR 2026 under review2025-09--
SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated ReasoningarXiv2025-09GitHub
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Credit AssignmentarXiv2025-05GitHub
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning TasksarXiv2025-05GitHub
Group-in-Group Policy Optimization for LLM Agent TrainingarXiv2025-05GitHub
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningCOLM 20252025-05GitHub
Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement LearningICML 20252025-05GitHub
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement LearningarXiv2025-04GitHub
NAT: Enhancing Agent Tuning with Negative SamplesNAACL 20252025-04GitHub
UI-R1: Enhancing Action Prediction of GUI Agents by Reinforcement LearningarXiv2025-03GitHub
GUI-Xplore: Empowering Generalizable GUI Agents with One ExplorationCVPR 20252025-03GitHub
ATLaS: Agent Tuning via Learning Critical StepsACL 20252025-03--
ReSearch: Learning to Reason with Search for LLMs via Reinforcement LearningarXiv2025-03GitHub
A Review of Prominent Paradigms for LLM-Based Agents: Tool Use, Planning, and Feedback LearningCOLING 20252025-01GitHub
AgentRefine: Enhancing Agent Generalization through Refinement TuningICLR 20252025-01--
WebWalker: Benchmarking LLMs in Web TraversalACL 20252025-01--
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool UsageICLR 20252024-12GitHub
WEBRL: Training LLM Web Agents via Self-Evolving Online Curriculum RLICLR 20252024-11GitHub
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction TuningNeurIPS 20242024-11--
Agent Q: Advanced Reasoning and Learning for Autonomous AI AgentsarXiv2024-08GitHub
ShortcutsBench: A Large Scale Real-world Benchmark for API-based AgentsICLR 20252024-07GitHub
AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge BasesNeurIPS 20242024-07GitHub
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous RLNeurIPS 20242024-06GitHub
Fine-Tuning Large Vision-Language Models as Decision Making Agents via RLNeurIPS 20242024-05GitHub
AgentStudio: A Toolkit for Building General Virtual AgentsICLR 20252024-03GitHub
Cradle: Empowering Foundation Agents Towards General Computer ControlarXiv2024-03GitHub
Agent-FLAN: Designing Data and Methods of Effective Agent TuningACL Findings 20242024-03GitHub
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based AgentsNeurIPS 20242024-02GitHub
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RLarXiv2024-02GitHub
WebDancer: Towards Autonomous Information Seeking AgencyarXiv2025-05--
WebSailor: Navigating Super-human Reasoning for Web AgentarXiv2025-07--
WebShaper: Agentically Data Synthesizing via Information-Seeking FormalizationarXiv2025-07--
AgentTuning: Enabling Generalized Agent Abilities for LLMsACL Findings 20242023-10GitHub
FireAct: Toward Language Agent Fine-tuningarXiv2023-10GitHub
WebArena: A Realistic Web Environment for Building Autonomous AgentsNeurIPS 20232023-07GitHub
GAIA: a benchmark for General AI AssistantsNeurIPS 20232023-07GitHub
Reflexion: Language Agents with Verbal Reinforcement LearningNeurIPS 20232023-03GitHub
ReAct: Synergizing Reasoning and Acting in Language ModelsICLR 20232022-10GitHub
ToolFormer: Language Models Can Teach Themselves to Use ToolsNeurIPS 20232022-07GitHub
WebGPT: Browser-assisted question-answering with human feedbackarXiv2021-12--
--

🎯 Agent Workflow


🎯 Agent Evaluation & Benchmark

Contributors

YsTvT

13 commits

KeibingYang

10 commits

Rouse77

7 commits

ElevenLiy

6 commits