blacksnail789521/Agentic-RL-Training-Recipes

Training Recipes for Agentic Reinforcement Learning in LLMs: A Survey

51

6 commits

updated Jan 30, 2026

See the code

README

Agentic-RL-Training-Recipes

Training Recipes for Agentic Reinforcement Learning in LLMs: A Survey

Paper GitHub Stars Topic How to Cite

✨ If you find our survey useful, a star ⭐ on GitHub helps others discover it and keeps you updated on future releases.

Table of Contents

Training Schemes

PaperTLDRComponent↳ FocusYearVenue
Reinforced Self-Training (ReST) for Language ModelingIterative self-improvement via generating and filtering high-quality trajectories.Training SchemesRollout & Data Strategy2023arXiv
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language ModelsSelf-play fine-tuning against previous iterations.Training SchemesRollout & Data Strategy2024ICML
Scaling Relationship on Learning Mathematical Reasoning with Large Language ModelsSimple rejection sampling strategy for data collection.Training SchemesRollout & Data Strategy2023arXiv
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language ModelsIntroduces Group Relative Policy Optimization (GRPO) for group-based sampling.Training SchemesRollout & Data Strategy2024arXiv
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement LearningDown-sampling strategy to filter rollouts and reduce compute.Training SchemesRollout & Data Strategy2025arXiv
Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable RewardsTree-based exploration with branching at high-uncertainty steps.Training SchemesRollout & Data Strategy2025arXiv
Trial and Error: Exploration-Based Trajectory Optimization for LLM AgentsLearn from failure trajectories via contrastive preference pairs.Training SchemesRollout & Data Strategy2024ACL
SAC-GLAM: Improving Online RL for LLM agents with Soft Actor-Critic and Hindsight RelabelingAdapts soft actor-critic and hindsight replay for open-ended exploration.Training SchemesRollout & Data Strategy2024arXiv
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement LearningReverse curriculum learning starting from goal proximity.Training SchemesRollout & Data Strategy2024ICML
Voyager: An Open-Ended Embodied Agent with Large Language ModelsUses predefined progressions in open-ended worlds (Minecraft).Training SchemesRollout & Data Strategy2023arXiv
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable EnvironmentsDynamically generates tasks based on current agent performance.Training SchemesRollout & Data Strategy2025arXiv
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement LearningSelf-correcting curriculum for web agents.Training SchemesRollout & Data Strategy2025ICLR
VCRL: Variance-based Curriculum Reinforcement Learning for Large Language ModelsUses variance of group rewards to prioritize medium-difficulty tasks.Training SchemesRollout & Data Strategy2025arXiv
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningUses exact matching outcome rewards for definitive tasks.Training SchemesFeedback & Credit2025COLM
ReSearch: Learning to Reason with Search for LLMs via Reinforcement LearningExact matching outcome rewards for search tasks.Training SchemesFeedback & Credit2025arXiv
SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory SynthesisFunctional verification for open-ended intent satisfaction.Training SchemesFeedback & Credit2025arXiv
R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement LearningOptimizes efficiency by penalizing retrieval costs.Training SchemesFeedback & Credit2025arXiv
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement LearningReward modeling for open-ended search tasks.Training SchemesFeedback & Credit2025arXiv
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement LearningIntent satisfaction rewards for search agents.Training SchemesFeedback & Credit2025arXiv
Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search AgentOptimizes efficiency and functional verification.Training SchemesFeedback & Credit2025arXiv
DeepRAG: Thinking to Retrieve Step by Step for Large Language ModelsOptimizes efficiency by explicitly penalizing unnecessary retrieval actions.Training SchemesFeedback & Credit2025arXiv
UR^2: Unify RAG and Reasoning through Reinforcement LearningEfficiency-aware reward modeling for retrieval.Training SchemesFeedback & Credit2025arXiv
ReZero: Enhancing LLM search ability by trying one-more-timeRewards focused on relevance and formatting in IR.Training SchemesFeedback & Credit2025arXiv
s3: You Don't Need That Much Data to Train a Search Agent via RLIR reward modeling for query diversity and relevance.Training SchemesFeedback & Credit2025arXiv
AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement LearningPlanning-centric rewards for search agents.Training SchemesFeedback & Credit2025arXiv
DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement LearningIR rewards for deep exploration of topics.Training SchemesFeedback & Credit2025arXiv
O^2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question AnsweringOutcome-oriented rewards for search quality.Training SchemesFeedback & Credit2025arXiv
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement LearningTool-augmented reward modeling for long-form agentic tasks.Training SchemesFeedback & Credit2025arXiv
Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement LearningUses Shortest Path Reward Estimation for trajectory quality.Training SchemesFeedback & Credit2025NeurIPS
Synthetic Data Generation and Multi-Step Reinforcement Learning for Reasoning and Tool UseHolistic history analysis for process rewards.Training SchemesFeedback & Credit2025COLM
Iterative Self-Incentivization Empowers Large Language Models as Agentic SearchersProcess rewards for search exploration steps.Training SchemesFeedback & Credit2025NeurIPS
ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMsDense supervision via process reward models (PRM).Training SchemesFeedback & Credit2025NeurIPS
Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented ReasoningGranular evaluation of specific reasoning steps.Training SchemesFeedback & Credit2025NeurIPS
Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented GenerationVerification-based process rewards for reasoning.Training SchemesFeedback & Credit2025arXiv
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon AgentsProcess supervision for verifiable meta-reasoning steps.Training SchemesFeedback & Credit2025arXiv
StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy OptimizationIntermediate search quality evaluation.Training SchemesFeedback & Credit2025arXiv
Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim VerificationHierarchical rewards for information seeking.Training SchemesFeedback & Credit2025arXiv
ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement LearningRewards parallel decomposition efficiency.Training SchemesFeedback & Credit2025arXiv
CAPO: Towards Enhancing LLM Reasoning through Generative Credit AssignmentUses LLMs to grade/critique intermediate steps.Training SchemesFeedback & Credit2025arXiv
Advancing Language Multi-Agent Learning with Credit Re-Assignment for Interactive Environment GeneralizationCollaborative grading for UI actions.Training SchemesFeedback & Credit2025arXiv
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective CriticLLM-based critique for search trajectories.Training SchemesFeedback & Credit2025arXiv
Retrospective In-Context Learning for Temporal Credit Assignment with Large Language ModelsVerbal feedback for self-correction via retrospective analysis.Training SchemesFeedback & Credit2025NeurIPS
Reflexion: language agents with verbal reinforcement learningVerbal reinforcement for iterative refinement.Training SchemesFeedback & Credit2023NeurIPS
VinePPO: Refining Credit Assignment in RL Training of LLMsStatistical credit assignment using rollout branching.Training SchemesFeedback & Credit2025arXiv
Exploiting Tree Structure for Credit Assignment in RL Training of LLMsTree-structured estimation for step-wise credit.Training SchemesFeedback & Credit2025arXiv
SPA-RL: Reinforcing LLM Agents via Stepwise Progress AttributionTrains dedicated value networks for step influence.Training SchemesFeedback & Credit2025arXiv
Agentic Reinforcement Learning with Implicit Step RewardsImplicit value prediction for self-taught reasoners.Training SchemesFeedback & Credit2025arXiv
GRPO-$\lambda$: Credit Assignment improves LLM ReasoningReformulated objective for granular updates without value heads.Training SchemesFeedback & Credit2025arXiv
Group-in-Group Policy Optimization for LLM Agent TrainingGroup-in-Group policy optimization for credit assignment.Training SchemesFeedback & Credit2025arXiv
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward DesignMulti-turn adaptation of GRPO credit assignment.Training SchemesFeedback & Credit2025arXiv
Proximal Policy Optimization AlgorithmsStandard clipped gradient optimization (Trust Region).Training SchemesPolicy Optimization2017arXiv
VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning TasksVariant of PPO adapted for agentic stability.Training SchemesPolicy Optimization2025arXiv
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement LearningScaled GRPO for reasoning tasks.Training SchemesPolicy Optimization2025arXiv
DAPO: An Open-Source LLM Reinforcement Learning System at ScaleSystematized GRPO for scale and distributed training.Training SchemesPolicy Optimization2025arXiv
URPO: A Unified Reward & Policy Optimization Framework for Large Language ModelsUnifies policy optimization with reward modeling.Training SchemesPolicy Optimization2025arXiv
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based ModelingGeometry-aware objectives for tree-structured policies.Training SchemesPolicy Optimization2025arXiv
Part I: Tricks or Traps? A Deep Dive into RL for LLM ReasoningLightweight PPO with entropy bonuses.Training SchemesPolicy Optimization2025arXiv
A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic SystemsSurvey on reasoning degeneracy and regularization.Training SchemesPolicy Optimization2025arXiv
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement LearningPRM-free step-level estimation for efficiency.Training SchemesPolicy Optimization2025arXiv
Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewardsAsymmetric REINFORCE for off-policy data reuse.Training SchemesPolicy Optimization2025arXiv
Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective RolloutsSelective rollout strategy to optimize compute budget.Training SchemesPolicy Optimization2025arXiv
A Survey on the Optimization of Large Language Model-based AgentsSurvey on efficient optimization strategies.Training SchemesPolicy Optimization2025arXiv
Exploring the Limit of Outcome Reward for Learning Mathematical ReasoningUses early stopping triggers (KL spikes) for stability.Training SchemesPolicy Optimization2025arXiv
LLM-based Agentic Reasoning Frameworks: A Survey from Methods to ScenariosOverview of reasoning stability and hacking.Training SchemesPolicy Optimization2025arXiv
AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-ImprovementMulti-objective scaffolds for safety and performance.Training SchemesPolicy Optimization2025arXiv
Safe RLHF: Safe Reinforcement Learning from Human FeedbackConstrained MDP formulation for safety.Training SchemesPolicy Optimization2023ICLR 2024
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained LearningSafety constraints for vision-language agents.Training SchemesPolicy Optimization2025arXiv
Agentic Reinforcement Learning for Search is UnsafePenalizes harmful queries in search agents.Training SchemesPolicy Optimization2025arXiv
MemLLM: Finetuning LLMs to Use An Explicit Read-Write MemoryFine-tunes models to execute explicit read/write API calls.Training SchemesTraining-Time Memory2024arXiv
MemoChat: Tuning LLMs to Use Memos for Consistent Long-Range Open-Domain ConversationTrains multi-stage summarization pipelines.Training SchemesTraining-Time Memory2023arXiv
Augmenting Language Models with Long-Term MemoryIntroduces decoupled memory encoders.Training SchemesTraining-Time Memory2023NeurIPS
Self-RAG: Learning to Retrieve, Generate, and Critique through Self-ReflectionTrains reflection tokens to trigger on-demand retrieval.Training SchemesTraining-Time Memory2024ICLR
MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon AgentsUses RLVR to compress context into a constant footprint.Training SchemesTraining-Time Memory2025arXiv
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory AgentAdapts DAPO for streaming document processing.Training SchemesTraining-Time Memory2025arXiv
Memory-R1: Enhancing large language model agents to manage and utilize memories via reinforcement learningUses PPO/GRPO to train a dedicated memory-manager agent.Training SchemesTraining-Time Memory2025arXiv
LongMemEval: Benchmarking chat assistants on long-term interactive memoryBenchmark for knowledge updates and abstention.Training SchemesTraining-Time Memory2024arXiv
LongBench-v2: Towards deeper understanding and reasoning on realistic long-context multitasksBenchmark for extreme-context (2M tokens) tasks.Training SchemesTraining-Time Memory2025ACL

Training Infrastructure

PaperTLDRComponent↳ FocusYearVenue
Proximal Policy Optimization AlgorithmsStandard synchronous execution model for on-policy consistency.Training InfrastructureActor-Learner Architectures2017ICLR
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language ModelsUtilizes synchronous execution to simplify credit assignment.Training InfrastructureActor-Learner Architectures2024arXiv
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language ReasoningDecouples collection and training with staleness control.Training InfrastructureActor-Learner Architectures2025NeurIPS
Asynchronous Methods for Deep Reinforcement LearningIntroduces asynchronous actor-learner decoupling.Training InfrastructureActor-Learner Architectures2016ICML
IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner ArchitecturesV-trace correction for off-policy lag in asynchronous setups.Training InfrastructureActor-Learner Architectures2018ICML
IMPACT: Importance Weighted Asynchronous Architectures with Clipped Target NetworksUses clipped target networks to stabilize stale critics.Training InfrastructureActor-Learner Architectures2020ICLR
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM TrainingOrchestrates disjoint GPU groups with AIPO for lag correction.Training InfrastructureActor-Learner Architectures2025arXiv
Defeating the Training-Inference Mismatch via FP16Switches to FP16 to reduce training-inference numerical divergence.Training InfrastructurePrecision & Acceleration2025arXiv
FP8-LM: Training FP8 Large Language ModelsDemonstrates doubled throughput with FP8 training.Training InfrastructurePrecision & Acceleration2023arXiv
COAT: Compressing Optimizer states and Activations for Memory-Efficient FP8 TrainingCompresses optimizer states and activations for efficiency.Training InfrastructurePrecision & Acceleration2025ICLR
Scaling FP8 training to trillion-token LLMsSmoothing operation to handle activation outliers in FP8.Training InfrastructurePrecision & Acceleration2025ICLR
Optimizing Large Language Model Training Using FP4 QuantizationEnables FP4 training via block-wise quantization.Training InfrastructurePrecision & Acceleration2025ICML
HALO: Hadamard-Assisted Lower-Precision Optimization for LLMsHadamard rotations to spread outliers for low-bit precision.Training InfrastructurePrecision & Acceleration2025NeurIPS
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMsUses Adaptive Quantization Noise (AQN) for exploration.Training InfrastructurePrecision & Acceleration2025arXiv
Efficient Memory Management for Large Language Model Serving with PagedAttentionOptimized inference kernel that contributes to mismatch.Training InfrastructureTraining-Inference Mismatch2023SOSP
SGLang: Efficient Execution of Structured Language Model ProgramsHigh-throughput inference engine often differing from learner.Training InfrastructureTraining-Inference Mismatch2024NeurIPS
PyTorch FSDP: Experiences on Scaling Fully Sharded Data ParallelHigh-precision training framework (standard baseline).Training InfrastructureTraining-Inference Mismatch2023arXiv
Megatron-LM: Training Multi-Billion Parameter Language Models Using Model ParallelismHigh-precision training framework (standard baseline).Training InfrastructureTraining-Inference Mismatch2019arXiv
MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning AttentionUpcasts output head to FP32 to fix entropy collapse.Training InfrastructureTraining-Inference Mismatch2025arXiv
Your Efficient RL Framework Secretly Brings You Off-Policy RL TrainingToken-level importance sampling to correct distribution shift.Training InfrastructureTraining-Inference Mismatch2025Blog
When Speed Kills Stability: Demystifying RL Collapse from the Training-Inference MismatchSequence masking to robustly handle off-policy shift.Training InfrastructureTraining-Inference Mismatch2025Blog
DeepSeek-V3.2: Pushing the Frontier of Open Large Language ModelsAdopts off-policy sequence masking for training stability.Training InfrastructureTraining-Inference Mismatch2025arXiv

Training Environments

PaperTLDRComponent↳ FocusYearVenue
Agentic Reasoning and Tool Integration for LLMs via Reinforcement LearningUses outcome-based rewards to train tool invocation without step-level supervision.Training EnvironmentsSingle-Domain Environments2025arXiv
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool UseModular framework for unified performance across SQL, code, and visual tasks.Training EnvironmentsSingle-Domain Environments2025arXiv
Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement LearningUses Dynamic-PPO to optimize tool usage for external retrieval.Training EnvironmentsSingle-Domain Environments2025arXiv
Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement LearningFormalizes tool use as an MDP to improve multi-step reasoning.Training EnvironmentsSingle-Domain Environments2025arXiv
Simulating Environments with Reasoning Models for Agent TrainingLeverages simulated feedback to overcome data scarcity.Training EnvironmentsSingle-Domain Environments2025arXiv
Introducing the Model Context ProtocolStandard for reproducible agent-tool interactions.Training EnvironmentsSingle-Domain Environments2024Blog
Navigating WebAI: Training Agents to Complete Web Tasks with Large Language Models and Reinforcement LearningTrains hierarchical T5 planner with V-MPO for web navigation.Training EnvironmentsSingle-Domain Environments2024SAC
AutoWebGLM: A Large Language Model-based Web Navigating AgentStaged pipeline (SFT $\to$ DPO $\to$ RFT) for stability in web agents.Training EnvironmentsSingle-Domain Environments2024KDD
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement LearningApplies on-policy M-GRPO using sparse binary signals in WebArena-Lite.Training EnvironmentsSingle-Domain Environments2025EMNLP
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement LearningUses self-evolving curriculum and outcome reward models for web agents.Training EnvironmentsSingle-Domain Environments2025ICLR
ReTool: Reinforcement Learning for Strategic Tool Use in LLMsShows reward-driven learning yields emergent tool behaviors.Training EnvironmentsSingle-Domain Environments2025arXiv
ToRL: Scaling Tool-Integrated RLDemonstrates emergent tool use from reward-driven learning.Training EnvironmentsSingle-Domain Environments2025arXiv
Reinforcement Learning for Reasoning in Large Language Models with One Training ExampleShows single verifier-rewarded problem can double performance.Training EnvironmentsSingle-Domain Environments2025arXiv
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler FeedbackDecomposes code tasks into curriculum-aligned sub-problems with compiler feedback.Training EnvironmentsSingle-Domain Environments2024ACL
The BrowserGym Ecosystem for Web Agent ResearchAggregates web benchmarks into a fixed schema.Training EnvironmentsMulti-Domain Environments2025TMLR
AgentGym: Evolving Large Language Model-based Agents across Diverse EnvironmentsUnifies diverse domains via a consistent HTTP interface.Training EnvironmentsMulti-Domain Environments2025ACL
Mind2Web: Towards a Generalist Agent for the WebUses strict splits to penalize layout memorization.Training EnvironmentsMulti-Domain Environments2023NeurIPS
WebCanvas: Benchmarking Web Agents in Online EnvironmentsEvaluates agents against live, drifting UIs.Training EnvironmentsMulti-Domain Environments2024arXiv
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web TasksUnifies multimodal tasks through consistent GUI interfaces.Training EnvironmentsMulti-Domain Environments2024ACL
WebVoyager: Building an End-to-End Web Agent with Large Multimodal ModelsUnifies multimodal tasks through consistent GUI interfaces.Training EnvironmentsMulti-Domain Environments2024ACL
AgentGen: Enhancing Planning Abilities for Large Language Model based Agent via Environment and Task GenerationApplies bidirectional evolution to synthesize environment code.Training EnvironmentsMulti-Domain Environments2025KDD
Eurekaverse: Environment Curriculum Generation via Large Language ModelsLLMs write simulation code for embodied control tasks.Training EnvironmentsMulti-Domain Environments2024CoRL
InSTA: Towards Internet-Scale Training For AgentsGenerates verifiable tasks on unlabeled websites at internet scale.Training EnvironmentsMulti-Domain Environments2025arXiv
Self-Challenging Language Model AgentsGenerates verifiable Code-as-Task instances to bootstrap training data.Training EnvironmentsMulti-Domain Environments2025arXiv
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement LearningDynamically expands horizon from greedy to exploratory settings.Training EnvironmentsMulti-Domain Environments2025arXiv
Thinking vs. Doing: Agents that Reason by Scaling Test-Time InteractionAgents learn to adaptively allocate patience for test-time budgets.Training EnvironmentsMulti-Domain Environments2025arXiv

Benchmarks for Training Environments

PaperTLDRComponent↳ FocusYearVenue
AgentGym: Evaluating and Training Large Language Model-based Agents across Diverse EnvironmentsUnifies diverse tasks (web, games, databases) under a standard interface.Benchmarks for Training EnvironmentsTraining Gyms2025ACL
The BrowserGym Ecosystem for Web Agent ResearchUnifies diverse web tasks under a standard interface for generalization.Benchmarks for Training EnvironmentsTraining Gyms2025TMLR
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement LearningProvides functional browser environments with self-evolving curricula.Benchmarks for Training EnvironmentsTraining Gyms2025ICLR
WebArena: A Realistic Web Environment for Building Autonomous AgentsFunctional browser environment for learning navigation policies.Benchmarks for Training EnvironmentsTraining Gyms2024ICLR
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer EnvironmentsHigh-fidelity environment for computer control (OS).Benchmarks for Training EnvironmentsTraining Gyms2024NeurIPS
AndroidWorld: A Dynamic Benchmarking Environment for Autonomous AgentsHigh-fidelity environment for mobile control.Benchmarks for Training EnvironmentsTraining Gyms2025ICLR
ALFWorld: Aligning Text and Embodied Environments for Interactive LearningBridges high-level reasoning with low-level embodied physics.Benchmarks for Training EnvironmentsTraining Gyms2021ICLR
Measuring Massive Multitask Language UnderstandingStandardized exam metrics for general cognitive reasoning.Benchmarks for Training EnvironmentsCertification Benchmarks2021ICLR
Training Verifiers to Solve Math Word ProblemsStandardized benchmark for grade-school math reasoning.Benchmarks for Training EnvironmentsCertification Benchmarks2021arXiv
AgentBench: Evaluating LLMs as AgentsQuantifies the gap between commercial and open-source models across 8 modalities.Benchmarks for Training EnvironmentsCertification Benchmarks2024ICLR
PaperBench: Evaluating AI's Ability to Replicate AI ResearchCertification test for research reproduction capabilities.Benchmarks for Training EnvironmentsCertification Benchmarks2025ICML
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?Certification test for software engineering and error recovery.Benchmarks for Training EnvironmentsCertification Benchmarks2024ICLR
CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application VulnerabilitiesAdversarial scenarios to certify robustness against exploits.Benchmarks for Training EnvironmentsCertification Benchmarks2025ICML
Do the Rewards Justify the Means? Measuring Trade-offs Between Rewards and Ethical Behavior in the MACHIAVELLI BenchmarkInteractive scenarios to certify robustness against ethical hazards.Benchmarks for Training EnvironmentsCertification Benchmarks2023ICML
R-Judge: Benchmarking Safety Risk Awareness for LLM AgentsStatic trajectories to certify ability to refuse unsafe instructions.Benchmarks for Training EnvironmentsCertification Benchmarks2024EMNLP (Findings)

How to Contribute

We welcome contributions! Feel free to open a PR with improvements, fixes, or additional resources.

Citation

@article{chang2026training,
  title={Training Recipes for Agentic Reinforcement Learning in LLMs: A Survey},
  author={Chang, Ching and Xiao, Yijia and Xu, Jade and Xu, Fred and Ye, Chenchen and Li, Ruoyan and Zhang, Junkai and Deng, Yihe and Zheng, Kyle and Ji, Ethan and others},
  journal={TechRxiv},
  year={2026},
  publisher={TechRxiv},
  doi={10.36227/techrxiv.176972131.13438500/v1},
  url={https://www.techrxiv.org/users/1020340/articles/1380448-training-recipes-for-agentic-reinforcement-learning-in-llms-a-survey}
}

Contributors

blacksnail789521/Agentic-RL-Training-Recipes

Training Recipes for Agentic Reinforcement Learning in LLMs: A Survey

51

6 commits

updated Jan 30, 2026

See the code

README

Agentic-RL-Training-Recipes

Training Recipes for Agentic Reinforcement Learning in LLMs: A Survey

Paper GitHub Stars Topic How to Cite

✨ If you find our survey useful, a star ⭐ on GitHub helps others discover it and keeps you updated on future releases.

Table of Contents

Training Schemes

PaperTLDRComponent↳ FocusYearVenue
Reinforced Self-Training (ReST) for Language ModelingIterative self-improvement via generating and filtering high-quality trajectories.Training SchemesRollout & Data Strategy2023arXiv
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language ModelsSelf-play fine-tuning against previous iterations.Training SchemesRollout & Data Strategy2024ICML
Scaling Relationship on Learning Mathematical Reasoning with Large Language ModelsSimple rejection sampling strategy for data collection.Training SchemesRollout & Data Strategy2023arXiv
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language ModelsIntroduces Group Relative Policy Optimization (GRPO) for group-based sampling.Training SchemesRollout & Data Strategy2024arXiv
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement LearningDown-sampling strategy to filter rollouts and reduce compute.Training SchemesRollout & Data Strategy2025arXiv
Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable RewardsTree-based exploration with branching at high-uncertainty steps.Training SchemesRollout & Data Strategy2025arXiv
Trial and Error: Exploration-Based Trajectory Optimization for LLM AgentsLearn from failure trajectories via contrastive preference pairs.Training SchemesRollout & Data Strategy2024ACL
SAC-GLAM: Improving Online RL for LLM agents with Soft Actor-Critic and Hindsight RelabelingAdapts soft actor-critic and hindsight replay for open-ended exploration.Training SchemesRollout & Data Strategy2024arXiv
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement LearningReverse curriculum learning starting from goal proximity.Training SchemesRollout & Data Strategy2024ICML
Voyager: An Open-Ended Embodied Agent with Large Language ModelsUses predefined progressions in open-ended worlds (Minecraft).Training SchemesRollout & Data Strategy2023arXiv
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable EnvironmentsDynamically generates tasks based on current agent performance.Training SchemesRollout & Data Strategy2025arXiv
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement LearningSelf-correcting curriculum for web agents.Training SchemesRollout & Data Strategy2025ICLR
VCRL: Variance-based Curriculum Reinforcement Learning for Large Language ModelsUses variance of group rewards to prioritize medium-difficulty tasks.Training SchemesRollout & Data Strategy2025arXiv
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningUses exact matching outcome rewards for definitive tasks.Training SchemesFeedback & Credit2025COLM
ReSearch: Learning to Reason with Search for LLMs via Reinforcement LearningExact matching outcome rewards for search tasks.Training SchemesFeedback & Credit2025arXiv
SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory SynthesisFunctional verification for open-ended intent satisfaction.Training SchemesFeedback & Credit2025arXiv
R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement LearningOptimizes efficiency by penalizing retrieval costs.Training SchemesFeedback & Credit2025arXiv
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement LearningReward modeling for open-ended search tasks.Training SchemesFeedback & Credit2025arXiv
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement LearningIntent satisfaction rewards for search agents.Training SchemesFeedback & Credit2025arXiv
Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search AgentOptimizes efficiency and functional verification.Training SchemesFeedback & Credit2025arXiv
DeepRAG: Thinking to Retrieve Step by Step for Large Language ModelsOptimizes efficiency by explicitly penalizing unnecessary retrieval actions.Training SchemesFeedback & Credit2025arXiv
UR^2: Unify RAG and Reasoning through Reinforcement LearningEfficiency-aware reward modeling for retrieval.Training SchemesFeedback & Credit2025arXiv
ReZero: Enhancing LLM search ability by trying one-more-timeRewards focused on relevance and formatting in IR.Training SchemesFeedback & Credit2025arXiv
s3: You Don't Need That Much Data to Train a Search Agent via RLIR reward modeling for query diversity and relevance.Training SchemesFeedback & Credit2025arXiv
AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement LearningPlanning-centric rewards for search agents.Training SchemesFeedback & Credit2025arXiv
DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement LearningIR rewards for deep exploration of topics.Training SchemesFeedback & Credit2025arXiv
O^2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question AnsweringOutcome-oriented rewards for search quality.Training SchemesFeedback & Credit2025arXiv
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement LearningTool-augmented reward modeling for long-form agentic tasks.Training SchemesFeedback & Credit2025arXiv
Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement LearningUses Shortest Path Reward Estimation for trajectory quality.Training SchemesFeedback & Credit2025NeurIPS
Synthetic Data Generation and Multi-Step Reinforcement Learning for Reasoning and Tool UseHolistic history analysis for process rewards.Training SchemesFeedback & Credit2025COLM
Iterative Self-Incentivization Empowers Large Language Models as Agentic SearchersProcess rewards for search exploration steps.Training SchemesFeedback & Credit2025NeurIPS
ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMsDense supervision via process reward models (PRM).Training SchemesFeedback & Credit2025NeurIPS
Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented ReasoningGranular evaluation of specific reasoning steps.Training SchemesFeedback & Credit2025NeurIPS
Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented GenerationVerification-based process rewards for reasoning.Training SchemesFeedback & Credit2025arXiv
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon AgentsProcess supervision for verifiable meta-reasoning steps.Training SchemesFeedback & Credit2025arXiv
StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy OptimizationIntermediate search quality evaluation.Training SchemesFeedback & Credit2025arXiv
Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim VerificationHierarchical rewards for information seeking.Training SchemesFeedback & Credit2025arXiv
ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement LearningRewards parallel decomposition efficiency.Training SchemesFeedback & Credit2025arXiv
CAPO: Towards Enhancing LLM Reasoning through Generative Credit AssignmentUses LLMs to grade/critique intermediate steps.Training SchemesFeedback & Credit2025arXiv
Advancing Language Multi-Agent Learning with Credit Re-Assignment for Interactive Environment GeneralizationCollaborative grading for UI actions.Training SchemesFeedback & Credit2025arXiv
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective CriticLLM-based critique for search trajectories.Training SchemesFeedback & Credit2025arXiv
Retrospective In-Context Learning for Temporal Credit Assignment with Large Language ModelsVerbal feedback for self-correction via retrospective analysis.Training SchemesFeedback & Credit2025NeurIPS
Reflexion: language agents with verbal reinforcement learningVerbal reinforcement for iterative refinement.Training SchemesFeedback & Credit2023NeurIPS
VinePPO: Refining Credit Assignment in RL Training of LLMsStatistical credit assignment using rollout branching.Training SchemesFeedback & Credit2025arXiv
Exploiting Tree Structure for Credit Assignment in RL Training of LLMsTree-structured estimation for step-wise credit.Training SchemesFeedback & Credit2025arXiv
SPA-RL: Reinforcing LLM Agents via Stepwise Progress AttributionTrains dedicated value networks for step influence.Training SchemesFeedback & Credit2025arXiv
Agentic Reinforcement Learning with Implicit Step RewardsImplicit value prediction for self-taught reasoners.Training SchemesFeedback & Credit2025arXiv
GRPO-$\lambda$: Credit Assignment improves LLM ReasoningReformulated objective for granular updates without value heads.Training SchemesFeedback & Credit2025arXiv
Group-in-Group Policy Optimization for LLM Agent TrainingGroup-in-Group policy optimization for credit assignment.Training SchemesFeedback & Credit2025arXiv
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward DesignMulti-turn adaptation of GRPO credit assignment.Training SchemesFeedback & Credit2025arXiv
Proximal Policy Optimization AlgorithmsStandard clipped gradient optimization (Trust Region).Training SchemesPolicy Optimization2017arXiv
VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning TasksVariant of PPO adapted for agentic stability.Training SchemesPolicy Optimization2025arXiv
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement LearningScaled GRPO for reasoning tasks.Training SchemesPolicy Optimization2025arXiv
DAPO: An Open-Source LLM Reinforcement Learning System at ScaleSystematized GRPO for scale and distributed training.Training SchemesPolicy Optimization2025arXiv
URPO: A Unified Reward & Policy Optimization Framework for Large Language ModelsUnifies policy optimization with reward modeling.Training SchemesPolicy Optimization2025arXiv
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based ModelingGeometry-aware objectives for tree-structured policies.Training SchemesPolicy Optimization2025arXiv
Part I: Tricks or Traps? A Deep Dive into RL for LLM ReasoningLightweight PPO with entropy bonuses.Training SchemesPolicy Optimization2025arXiv
A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic SystemsSurvey on reasoning degeneracy and regularization.Training SchemesPolicy Optimization2025arXiv
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement LearningPRM-free step-level estimation for efficiency.Training SchemesPolicy Optimization2025arXiv
Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewardsAsymmetric REINFORCE for off-policy data reuse.Training SchemesPolicy Optimization2025arXiv
Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective RolloutsSelective rollout strategy to optimize compute budget.Training SchemesPolicy Optimization2025arXiv
A Survey on the Optimization of Large Language Model-based AgentsSurvey on efficient optimization strategies.Training SchemesPolicy Optimization2025arXiv
Exploring the Limit of Outcome Reward for Learning Mathematical ReasoningUses early stopping triggers (KL spikes) for stability.Training SchemesPolicy Optimization2025arXiv
LLM-based Agentic Reasoning Frameworks: A Survey from Methods to ScenariosOverview of reasoning stability and hacking.Training SchemesPolicy Optimization2025arXiv
AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-ImprovementMulti-objective scaffolds for safety and performance.Training SchemesPolicy Optimization2025arXiv
Safe RLHF: Safe Reinforcement Learning from Human FeedbackConstrained MDP formulation for safety.Training SchemesPolicy Optimization2023ICLR 2024
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained LearningSafety constraints for vision-language agents.Training SchemesPolicy Optimization2025arXiv
Agentic Reinforcement Learning for Search is UnsafePenalizes harmful queries in search agents.Training SchemesPolicy Optimization2025arXiv
MemLLM: Finetuning LLMs to Use An Explicit Read-Write MemoryFine-tunes models to execute explicit read/write API calls.Training SchemesTraining-Time Memory2024arXiv
MemoChat: Tuning LLMs to Use Memos for Consistent Long-Range Open-Domain ConversationTrains multi-stage summarization pipelines.Training SchemesTraining-Time Memory2023arXiv
Augmenting Language Models with Long-Term MemoryIntroduces decoupled memory encoders.Training SchemesTraining-Time Memory2023NeurIPS
Self-RAG: Learning to Retrieve, Generate, and Critique through Self-ReflectionTrains reflection tokens to trigger on-demand retrieval.Training SchemesTraining-Time Memory2024ICLR
MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon AgentsUses RLVR to compress context into a constant footprint.Training SchemesTraining-Time Memory2025arXiv
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory AgentAdapts DAPO for streaming document processing.Training SchemesTraining-Time Memory2025arXiv
Memory-R1: Enhancing large language model agents to manage and utilize memories via reinforcement learningUses PPO/GRPO to train a dedicated memory-manager agent.Training SchemesTraining-Time Memory2025arXiv
LongMemEval: Benchmarking chat assistants on long-term interactive memoryBenchmark for knowledge updates and abstention.Training SchemesTraining-Time Memory2024arXiv
LongBench-v2: Towards deeper understanding and reasoning on realistic long-context multitasksBenchmark for extreme-context (2M tokens) tasks.Training SchemesTraining-Time Memory2025ACL

Training Infrastructure

PaperTLDRComponent↳ FocusYearVenue
Proximal Policy Optimization AlgorithmsStandard synchronous execution model for on-policy consistency.Training InfrastructureActor-Learner Architectures2017ICLR
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language ModelsUtilizes synchronous execution to simplify credit assignment.Training InfrastructureActor-Learner Architectures2024arXiv
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language ReasoningDecouples collection and training with staleness control.Training InfrastructureActor-Learner Architectures2025NeurIPS
Asynchronous Methods for Deep Reinforcement LearningIntroduces asynchronous actor-learner decoupling.Training InfrastructureActor-Learner Architectures2016ICML
IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner ArchitecturesV-trace correction for off-policy lag in asynchronous setups.Training InfrastructureActor-Learner Architectures2018ICML
IMPACT: Importance Weighted Asynchronous Architectures with Clipped Target NetworksUses clipped target networks to stabilize stale critics.Training InfrastructureActor-Learner Architectures2020ICLR
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM TrainingOrchestrates disjoint GPU groups with AIPO for lag correction.Training InfrastructureActor-Learner Architectures2025arXiv
Defeating the Training-Inference Mismatch via FP16Switches to FP16 to reduce training-inference numerical divergence.Training InfrastructurePrecision & Acceleration2025arXiv
FP8-LM: Training FP8 Large Language ModelsDemonstrates doubled throughput with FP8 training.Training InfrastructurePrecision & Acceleration2023arXiv
COAT: Compressing Optimizer states and Activations for Memory-Efficient FP8 TrainingCompresses optimizer states and activations for efficiency.Training InfrastructurePrecision & Acceleration2025ICLR
Scaling FP8 training to trillion-token LLMsSmoothing operation to handle activation outliers in FP8.Training InfrastructurePrecision & Acceleration2025ICLR
Optimizing Large Language Model Training Using FP4 QuantizationEnables FP4 training via block-wise quantization.Training InfrastructurePrecision & Acceleration2025ICML
HALO: Hadamard-Assisted Lower-Precision Optimization for LLMsHadamard rotations to spread outliers for low-bit precision.Training InfrastructurePrecision & Acceleration2025NeurIPS
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMsUses Adaptive Quantization Noise (AQN) for exploration.Training InfrastructurePrecision & Acceleration2025arXiv
Efficient Memory Management for Large Language Model Serving with PagedAttentionOptimized inference kernel that contributes to mismatch.Training InfrastructureTraining-Inference Mismatch2023SOSP
SGLang: Efficient Execution of Structured Language Model ProgramsHigh-throughput inference engine often differing from learner.Training InfrastructureTraining-Inference Mismatch2024NeurIPS
PyTorch FSDP: Experiences on Scaling Fully Sharded Data ParallelHigh-precision training framework (standard baseline).Training InfrastructureTraining-Inference Mismatch2023arXiv
Megatron-LM: Training Multi-Billion Parameter Language Models Using Model ParallelismHigh-precision training framework (standard baseline).Training InfrastructureTraining-Inference Mismatch2019arXiv
MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning AttentionUpcasts output head to FP32 to fix entropy collapse.Training InfrastructureTraining-Inference Mismatch2025arXiv
Your Efficient RL Framework Secretly Brings You Off-Policy RL TrainingToken-level importance sampling to correct distribution shift.Training InfrastructureTraining-Inference Mismatch2025Blog
When Speed Kills Stability: Demystifying RL Collapse from the Training-Inference MismatchSequence masking to robustly handle off-policy shift.Training InfrastructureTraining-Inference Mismatch2025Blog
DeepSeek-V3.2: Pushing the Frontier of Open Large Language ModelsAdopts off-policy sequence masking for training stability.Training InfrastructureTraining-Inference Mismatch2025arXiv

Training Environments

PaperTLDRComponent↳ FocusYearVenue
Agentic Reasoning and Tool Integration for LLMs via Reinforcement LearningUses outcome-based rewards to train tool invocation without step-level supervision.Training EnvironmentsSingle-Domain Environments2025arXiv
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool UseModular framework for unified performance across SQL, code, and visual tasks.Training EnvironmentsSingle-Domain Environments2025arXiv
Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement LearningUses Dynamic-PPO to optimize tool usage for external retrieval.Training EnvironmentsSingle-Domain Environments2025arXiv
Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement LearningFormalizes tool use as an MDP to improve multi-step reasoning.Training EnvironmentsSingle-Domain Environments2025arXiv
Simulating Environments with Reasoning Models for Agent TrainingLeverages simulated feedback to overcome data scarcity.Training EnvironmentsSingle-Domain Environments2025arXiv
Introducing the Model Context ProtocolStandard for reproducible agent-tool interactions.Training EnvironmentsSingle-Domain Environments2024Blog
Navigating WebAI: Training Agents to Complete Web Tasks with Large Language Models and Reinforcement LearningTrains hierarchical T5 planner with V-MPO for web navigation.Training EnvironmentsSingle-Domain Environments2024SAC
AutoWebGLM: A Large Language Model-based Web Navigating AgentStaged pipeline (SFT $\to$ DPO $\to$ RFT) for stability in web agents.Training EnvironmentsSingle-Domain Environments2024KDD
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement LearningApplies on-policy M-GRPO using sparse binary signals in WebArena-Lite.Training EnvironmentsSingle-Domain Environments2025EMNLP
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement LearningUses self-evolving curriculum and outcome reward models for web agents.Training EnvironmentsSingle-Domain Environments2025ICLR
ReTool: Reinforcement Learning for Strategic Tool Use in LLMsShows reward-driven learning yields emergent tool behaviors.Training EnvironmentsSingle-Domain Environments2025arXiv
ToRL: Scaling Tool-Integrated RLDemonstrates emergent tool use from reward-driven learning.Training EnvironmentsSingle-Domain Environments2025arXiv
Reinforcement Learning for Reasoning in Large Language Models with One Training ExampleShows single verifier-rewarded problem can double performance.Training EnvironmentsSingle-Domain Environments2025arXiv
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler FeedbackDecomposes code tasks into curriculum-aligned sub-problems with compiler feedback.Training EnvironmentsSingle-Domain Environments2024ACL
The BrowserGym Ecosystem for Web Agent ResearchAggregates web benchmarks into a fixed schema.Training EnvironmentsMulti-Domain Environments2025TMLR
AgentGym: Evolving Large Language Model-based Agents across Diverse EnvironmentsUnifies diverse domains via a consistent HTTP interface.Training EnvironmentsMulti-Domain Environments2025ACL
Mind2Web: Towards a Generalist Agent for the WebUses strict splits to penalize layout memorization.Training EnvironmentsMulti-Domain Environments2023NeurIPS
WebCanvas: Benchmarking Web Agents in Online EnvironmentsEvaluates agents against live, drifting UIs.Training EnvironmentsMulti-Domain Environments2024arXiv
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web TasksUnifies multimodal tasks through consistent GUI interfaces.Training EnvironmentsMulti-Domain Environments2024ACL
WebVoyager: Building an End-to-End Web Agent with Large Multimodal ModelsUnifies multimodal tasks through consistent GUI interfaces.Training EnvironmentsMulti-Domain Environments2024ACL
AgentGen: Enhancing Planning Abilities for Large Language Model based Agent via Environment and Task GenerationApplies bidirectional evolution to synthesize environment code.Training EnvironmentsMulti-Domain Environments2025KDD
Eurekaverse: Environment Curriculum Generation via Large Language ModelsLLMs write simulation code for embodied control tasks.Training EnvironmentsMulti-Domain Environments2024CoRL
InSTA: Towards Internet-Scale Training For AgentsGenerates verifiable tasks on unlabeled websites at internet scale.Training EnvironmentsMulti-Domain Environments2025arXiv
Self-Challenging Language Model AgentsGenerates verifiable Code-as-Task instances to bootstrap training data.Training EnvironmentsMulti-Domain Environments2025arXiv
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement LearningDynamically expands horizon from greedy to exploratory settings.Training EnvironmentsMulti-Domain Environments2025arXiv
Thinking vs. Doing: Agents that Reason by Scaling Test-Time InteractionAgents learn to adaptively allocate patience for test-time budgets.Training EnvironmentsMulti-Domain Environments2025arXiv

Benchmarks for Training Environments

PaperTLDRComponent↳ FocusYearVenue
AgentGym: Evaluating and Training Large Language Model-based Agents across Diverse EnvironmentsUnifies diverse tasks (web, games, databases) under a standard interface.Benchmarks for Training EnvironmentsTraining Gyms2025ACL
The BrowserGym Ecosystem for Web Agent ResearchUnifies diverse web tasks under a standard interface for generalization.Benchmarks for Training EnvironmentsTraining Gyms2025TMLR
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement LearningProvides functional browser environments with self-evolving curricula.Benchmarks for Training EnvironmentsTraining Gyms2025ICLR
WebArena: A Realistic Web Environment for Building Autonomous AgentsFunctional browser environment for learning navigation policies.Benchmarks for Training EnvironmentsTraining Gyms2024ICLR
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer EnvironmentsHigh-fidelity environment for computer control (OS).Benchmarks for Training EnvironmentsTraining Gyms2024NeurIPS
AndroidWorld: A Dynamic Benchmarking Environment for Autonomous AgentsHigh-fidelity environment for mobile control.Benchmarks for Training EnvironmentsTraining Gyms2025ICLR
ALFWorld: Aligning Text and Embodied Environments for Interactive LearningBridges high-level reasoning with low-level embodied physics.Benchmarks for Training EnvironmentsTraining Gyms2021ICLR
Measuring Massive Multitask Language UnderstandingStandardized exam metrics for general cognitive reasoning.Benchmarks for Training EnvironmentsCertification Benchmarks2021ICLR
Training Verifiers to Solve Math Word ProblemsStandardized benchmark for grade-school math reasoning.Benchmarks for Training EnvironmentsCertification Benchmarks2021arXiv
AgentBench: Evaluating LLMs as AgentsQuantifies the gap between commercial and open-source models across 8 modalities.Benchmarks for Training EnvironmentsCertification Benchmarks2024ICLR
PaperBench: Evaluating AI's Ability to Replicate AI ResearchCertification test for research reproduction capabilities.Benchmarks for Training EnvironmentsCertification Benchmarks2025ICML
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?Certification test for software engineering and error recovery.Benchmarks for Training EnvironmentsCertification Benchmarks2024ICLR
CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application VulnerabilitiesAdversarial scenarios to certify robustness against exploits.Benchmarks for Training EnvironmentsCertification Benchmarks2025ICML
Do the Rewards Justify the Means? Measuring Trade-offs Between Rewards and Ethical Behavior in the MACHIAVELLI BenchmarkInteractive scenarios to certify robustness against ethical hazards.Benchmarks for Training EnvironmentsCertification Benchmarks2023ICML
R-Judge: Benchmarking Safety Risk Awareness for LLM AgentsStatic trajectories to certify ability to refuse unsafe instructions.Benchmarks for Training EnvironmentsCertification Benchmarks2024EMNLP (Findings)

How to Contribute

We welcome contributions! Feel free to open a PR with improvements, fixes, or additional resources.

Citation

@article{chang2026training,
  title={Training Recipes for Agentic Reinforcement Learning in LLMs: A Survey},
  author={Chang, Ching and Xiao, Yijia and Xu, Jade and Xu, Fred and Ye, Chenchen and Li, Ruoyan and Zhang, Junkai and Deng, Yihe and Zheng, Kyle and Ji, Ethan and others},
  journal={TechRxiv},
  year={2026},
  publisher={TechRxiv},
  doi={10.36227/techrxiv.176972131.13438500/v1},
  url={https://www.techrxiv.org/users/1020340/articles/1380448-training-recipes-for-agentic-reinforcement-learning-in-llms-a-survey}
}

Contributors