| 2026.8 | Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember | arxiv |
| 2026.8 | Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent | arxiv |
| 2026.8 | ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment | arxiv |
| 2026.8 | EASy: Towards Efficient LLM-Based Agentic System | arxiv |
| 2026.8 | HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards | arxiv |
| 2026.8 | Contextual Information Policy Optimization for Search Agents | arxiv |
| 2026.8 | Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning | arxiv |
| 2026.8 | Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding | arxiv |
| 2026.8 | LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation | arxiv |
| 2026.8 | ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Models | arxiv |
| 2026.8 | Mitigating Context Interference for Reliable and Efficient Search Agents | arxiv |
| 2026.7 | Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism | arxiv |
| 2026.7 | LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning | arxiv |
| 2026.7 | ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability) | arxiv |
| 2026.7 | CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents | arxiv |
| 2026.7 | PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning | arxiv |
| 2026.7 | Agent-UCT: Upper Confidence Bounds Applied to Trees for Agentic Workflow Optimization with Cost-Awareness | arxiv |
| 2026.7 | Reason Before You Retrieve: Agentic Planning for Multi-modal RAG | arxiv |
| 2026.7 | Reinforcement Learning for Large Language Model Selective Evidence Adoption from Contaminated Retrieval Results | arxiv |
| 2026.7 | PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning | arxiv |
| 2026.7 | AREX: Towards a Recursively Self-Improving Agent for Deep Research | arxiv |
| 2026.7 | WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback | arxiv |
| 2026.7 | EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff | arxiv |
| 2026.7 | Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL | arxiv |
| 2026.7 | Harness-G: A Graph-Structured Harness for Search Agents | arxiv |
| 2026.7 | Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents | arxiv |
| 2026.7 | SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation | arxiv |
| 2026.7 | DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment | arxiv |
| 2026.7 | Mach-Mind-4-Flash Technical Report | arxiv |
| 2026.7 | AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs | arxiv |
| 2026.7 | Multi-Turn Agentic Scientific Literature Search via Workflow Induction | arXiv |
| 2026.6 | ECHO: Prune to act, trace to learn with selective turn memory in agentic RL | arXiv |
| 2026.6 | ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents | arXiv |
| 2026.6 | ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering | arXiv |
| 2026.6 | Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning | arXiv |
| 2026.6 | GraphPO: Graph-based Policy Optimization for Reasoning Models | arXiv |
| 2026.6 | MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual Environments | arXiv |
| 2026.6 | Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher | arXiv |
| 2026.6 | HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry | arXiv |
| 2026.6 | SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating | arXiv |
| 2026.6 | Agents-K1: Towards Agent-native Knowledge Orchestration | arXiv |
| 2026.6 | Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training | arXiv |
| 2026.6 | Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals | arXiv |
| 2026.6 | TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents | arXiv |
| 2026.6 | ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents | arXiv |
| 2026.6 | Adaptive Latent Agentic Reasoning | arXiv |
| 2026.6 | Self-Evolving Deep Research via Joint Generation and Evaluation | arXiv |
| 2026.5 | AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering | arXiv |
| 2026.5 | Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward | arXiv |
| 2026.5 | LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards | arXiv |
| 2026.5 | Learning Agent-Compatible Context Management for Long-Horizon Tasks | arXiv |
| 2026.5 | COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents | arXiv |
| 2026.5 | PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning | arXiv |
| 2026.5 | RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards | arXiv |
| 2026.5 | Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents | arXiv |
| 2026.5 | CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG | arXiv |
| 2026.5 | Calibrating LLMs with Semantic-level Reward | arXiv |
| 2026.5 | Argus: Evidence Assembly for Scalable Deep Research Agents | arXiv |
| 2026.5 | SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning | arXiv |
| 2026.5 | Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning | arXiv |
| 2026.5 | Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents | arXiv |
| 2026.5 | HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents | arXiv |
| 2026.5 | Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents | arXiv |
| 2026.5 | Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers | arXiv |
| 2026.4 | OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search | arXiv |
| 2026.4 | CroSearch-R1: Better Leveraging Cross-lingual Knowledge for Retrieval-Augmented Generation | arXiv |
| 2026.4 | How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum | arXiv |
| 2026.4 | Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph Optimization | arXiv |
| 2026.4 | OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models | arXiv |
| 2026.4 | DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data | arXiv |
| 2026.4 | $\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data | arXiv |
| 2026.4 | Mind DeepResearch Technical Report | arXiv |
| 2026.4 | Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization | arXiv |
| 2026.4 | ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoning | arXiv |
| 2026.4 | ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents | arXiv |
| 2026.4 | WebExpert: domain-aware web agents with critic-guided expert experience for high-precision search | arXiv |
| 2026.4 | Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search | arXiv |
| 2026.3 | TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs | arXiv |
| 2026.3 | A Subgoal-driven Framework for Improving Long-Horizon LLM Agents | arXiv |
| 2026.3 | MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification | arXiv |
| 2026.3 | Meta-Reinforcement Learning with Self-Reflection for Agentic Search | arXiv |
| 2026.3 | Improving Search Agent with One Line of Code | arXiv |
| 2026.3 | Ares: Adaptive Reasoning Effort Selection for Efficient LLM Agents | arXiv |
| 2026.3 | Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented Agents | arXiv |
| 2026.3 | SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic Plans | arXiv |
| 2026.3 | KARL: Knowledge Agents via Reinforcement Learning | arXiv |
| 2026.3 | MemPO: Self-Memory Policy Optimization for Long-Horizon Agents | arXiv |
| 2026.3 | Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search Agents | arXiv |
| 2026.2 | Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning | arXiv |
| 2026.2 | Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training | arXiv |
| 2026.2 | Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization | arXiv |
| 2026.2 | OmniGAIA: Towards Native Omni-Modal AI Agents |arXiv | | |
| 2026.2 | Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric | arXiv |
| 2026.2 | REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents | arXiv |
| 2026.2 | KLong: Training LLM Agent for Extremely Long-horizon Tasks | arXiv |
| 2026.2 | When to Memorize and When to Stop: Gated Recurrent Memory for Long-Context Reasoning | arXiv |
| 2026.2 | TodoEvolve: Learning to Architect Agent Planning Systems | arXiv |
| 2026.2 | SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents | arXiv |
| 2026.2 | SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search Agent | arXiv |
| 2026.2 | AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents | arXiv |
| 2026.2 | AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research | arXiv |
| 2026.2 | DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents | arXiv |
| 2026.2 | Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation | arXiv |
| 2026.2 | Training Multi-Turn Search Agent via Contrastive Dynamic Branch Sampling | arXiv |
| 2026.2 | Scaling Search-Augmented LLM Reasoning via Adaptive Information Control | arXiv |
| 2026.2 | CRAFT: Calibrated Reasoning with Answer-Faithful Traces via Reinforcement Learning for Multi-Hop Question Answering | arXiv |
| 2026.2 | TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization | arXiv |
| 2026.2 | Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward | arXiv |
| 2026.2 | Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning | arXiv |
| 2026.2 | Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents | arXiv |
| 2026.2 | WideSeek: Advancing Wide Research via Multi-Agent Scaling | arXiv |
| 2026.2 | IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning | arXiv |
| 2026.2 | Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration | arXiv |
| 2026.2 | WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning | arXiv |
| 2026.2 | Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards | arXiv |
| 2026.1 | SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation | arXiv |
| 2026.1 | Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning | arXiv |
| 2026.1 | BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search | arXiv |
| 2026.1 | Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards | arXiv |
| 2026.1 | TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG | arXiv |
| 2026.1 | D2Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning | arXiv |
| 2026.1 | ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking | arXiv |
| 2026.1 | PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering | arXiv |
| 2026.1 | PaperScout: An Autonomous Agent for Academic Paper Search with Process-Aware Sequence-Level Policy Optimization | arXiv |
| 2026.1 | M3Searcher: Modular Multimodal Information Seeking Agency with Retrieval-Oriented Reasoning | arXiv |
| 2026.1 | LRAS: Advanced Legal Reasoning with Agentic Search | arXiv |
| 2026.1 | Dr. Zero: Self-Evolving Search Agents without Training Data | arXiv |
| 2026.1 | ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration | arXiv |
| 2026.1 | SmartSearch: Process Reward-Guided Query Refinement for Search Agents | arXiv |
| 2026.1 | Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search | arXiv |
| 2026.1 | WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning | arXiv |
| 2026.1 | O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL | arXiv |
| 2026.1 | RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation Detection | arXiv |
| 2026.1 | AT2PO: Agentic Turn-based Policy Optimization via Tree Search | arXiv |
| 2025.12 | FoldAct: Efficient and Stable Context Folding for Long-Horizon Search Agents | arXiv |
| 2025.12 | Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization | arXiv |
| 2025.12 | Step-DeepResearch Technical Report | arXiv |
| 2025.12 | AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning | arXiv |
| 2025.12 | An Open and Reproducible Deep Research Agent for Long-Form Question Answering | arXiv |
| 2025.12 | CoDA: A Context-Decoupled Hierarchical Agent with Reinforcement Learning | arXiv |
| 2025.12 | LightSearcher: Efficient DeepSearch via Experiential Memory | arXiv |
| 2025.12 | RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning | arXiv |
| 2025.12 | Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization | arXiv |
| 2025.12 | CARL: Critical Action Focused Reinforcement Learning for Multi-Step Agent | arXiv |
| 2025.12 | On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death Spiral | arXiv |
| 2025.11 | ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration | arXiv |
| 2025.11 | ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning | arXiv |
| 2025.11 | ST-PPO: Stabilized Off-Policy Proximal Policy Optimization for Multi-Turn Agents Training | arXiv |
| 2025.11 | DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs | arXiv |
| 2025.11 | DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research | arXiv |
| 2025.11 | General Agentic Memory Via Deep Research arXiv | |
| 2025.11 | Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement Learning | arXiv |
| 2025.11 | Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO | arXiv |
| 2025.11 | Think Before You Retrieve: Learning Test-Time Adaptive Search with Small Language Models | arXiv |
| 2025.11 | Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction | arXiv |
| 2025.11 | TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework | arXiv |
| 2025.11 | IterResearch: Rethinking Long-Horizon Agents via Markovian State Reconstruction | arXiv |
| 2025.11 | Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning | arXiv |
| 2025.11 | MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning | arXiv |
| 2025.10 | Search Self-play: Pushing the Frontier of Agent Capability without Supervision | arXiv |
| 2025.10 | Reinforcement Learning for Long-Horizon Multi-Turn Search Agents | arXiv |
| 2025.10 | DeepAgent: A General Reasoning Agent with Scalable Toolsets | arXiv |
| 2025.10 | WebLeaper: Empowering Efficiency and Efficacy in WebAgent via Enabling Info-Rich Seeking | arXiv |
| 2025.10 | KnowCoder-A1: Incentivizing Agentic Reasoning Capability with Outcome Supervision for KBQA | arXiv |
| 2025.10 | GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning | arXiv |
| 2025.10 | InfoFlow: Reinforcing Search Agent Via Reward Density Optimization | arXiv |
| 2025.10 | Repurposing Synthetic Data for Fine-grained Search Agent Supervision | arXiv |
| 2025.10 | Tongyi DeepResearch Technical Report | arXiv |
| 2025.10 | Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth | arXiv |
| 2025.10 | SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents | arXiv |
| 2025.10 | Agentic Reinforcement Learning for Search is Unsafe | arXiv |
| 2025.10 | WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection | arXiv |
| 2025.10 | PokeeResearch: Effective Deep Research via Reinforcement Learning from AI Feedback and Robust Reasoning Scaffold | arXiv |
| 2025.10 | Plan Then Retrieve: Reinforcement Learning-Guided Complex Reasoning over Knowledge Graphs | arXiv |
| 2025.10 | DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning | arXiv |
| 2025.10 | Scaling Long-Horizon LLM Agent via Context-Folding | arXiv |
| 2025.10 | Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation | arXiv |
| 2025.10 | PoU: Proof-of-Use to Counter Tool-Call Hacking in DeepResearch Agents | arXiv |
| 2025.10 | DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping | arXiv |
| 2025.10 | Stop-RAG: Value-Based Retrieval Control for Iterative RAG | arXiv |
| 2025.10 | Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering | arXiv |
| 2025.10 | Agentic Entropy-Balanced Policy Optimization | arXiv |
| 2025.10 | An Efficient Rubric-based Generative Verifier for Search-Augmented LLMs | arXiv |
| 2025.10 | Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents | ICLR 2026 |
| 2025.10 | Towards Agentic Self-Learning LLMs in Search Environment | arXiv |
| 2025.10 | From Faithfulness to Correctness: Generative Reward Models that Think Critically | arXiv |
| 2025.10 | Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window | arXiv |
| 2025.10 | QAgent: A modular Search Agent with Interactive Query Understanding | arXiv |
| 2025.10 | A2Search: Ambiguity-Aware Question Answering with Reinforcement Learning | arXiv |
| 2025.10 | HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation | arXiv |
| 2025.10 | Search-R3: Unifying Reasoning and Embedding Generation in Large Language Models | arXiv |
| 2025.10 | Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them | arXiv |
| 2025.10 | ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards | arXiv |
| 2025.10 | Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs | arXiv |
| 2025.10 | Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents | arXiv |
| 2025.10 | MARS: Optimizing Dual-System Deep Research via Multi-Agent Reinforcement Learning | arXiv |
| 2025.10 | Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents | arXiv |
| 2025.9 | InfoAgent: Advancing Autonomous Information-Seeking Agents | arXiv |
| 2025.9 | SIRAG: Towards Stable and Interpretable RAG with A Process-Supervised Multi-Agent Framework | arXiv |
| 2025.9 | Towards General Agentic Intelligence via Environment Scaling | arXiv |
| 2025.9 | ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization | arXiv |
| 2025.9 | WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning | arXiv |
| 2025.9 | WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon Agents | arXiv |
| 2025.9 | Scaling Agents via Continual Pre-training | arXiv |
| 2025.9 | WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents | arXiv |
| 2025.9 | DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL | arXiv |
| 2025.9 | AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning | arXiv |
| 2025.9 | SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents | arXiv |
| 2025.9 | VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use | arXiv |
| 2025.9 | Open Data Synthesis For Deep Research | arXiv |
| 2025.8 | Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities | arXiv |
| 2025.8 | AWorld: Orchestrating the Training Recipe for Agentic AI | arXiv |
| 2025.8 | AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning | arXiv |
| 2025.8 | Memento: Fine-tuning LLM Agents without Fine-tuning LLMs | arXiv |
| 2025.8 | OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval | arXiv |
| 2025.8 | Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL | arXiv |
| 2025.8 | MedReseacher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis Framework | arXiv |
| 2025.8 | Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward | arXiv |
| 2025.8 | WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent | arXiv |
| 2025.8 | HierSearch: A Hierarchical Enterprise Deep Search Framework Integrating Local and Web Searches | arXiv |
| 2025.8 | REX-RAG: Reasoning Exploration with Policy Correction in Retrieval-Augmented Generation | arXiv |
| 2025.8 | Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL | arXiv |
| 2025.8 | SSRL: Self-Search Reinforcement Learning | arXiv |
| 2025.8 | UR2: Unify RAG and Reasoning through Reinforcement Learning | arXiv |
| 2025.8 | ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning | arXiv |
| 2025.8 | Lucy: edgerunning agentic web search on mobile with machine generated task vectors | arXiv |
| 2025.8 | MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented Generation | arXiv |
| 2025.8 | Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge Synergy | arXiv |
| 2025.8 | GRAIL:Learning to Interact with Large Knowledge Graphs for Retrieval Augmented Reasoning | arXiv |
| 2025.7 | Agentic Reinforced Policy Optimization | arXiv |
| 2025.7 | WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization | arXiv |
| 2025.7 | DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning | arXiv |
| 2025.7 | WebSailor: Navigating Super-human Reasoning for Web Agent | arXiv |
| 2025.7 | RAG-R1 : Incentivize the Search and Reasoning Capabilities of LLMs through Multi-query Parallelism | arXiv |
| 2025.6 | Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim Verification | arXiv |
| 2025.6 | R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning | arXiv |
| 2025.6 | KunLunBaizeRAG: Reinforcement Learning Driven Inference Performance Leap for Large Language Models | arXiv |
| 2025.5 | Visual Agentic Reinforcement Fine-Tuning | arXiv |
| 2025.5 | Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning | arXiv |
| 2025.5 | Search and Refine During Think: Autonomous Retrieval-Augmented Reasoning of LLMs | arXiv |
| 2025.5 | Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty | arXiv |
| 2025.5 | Scent of Knowledge: Optimizing Search-Enhanced Reasoning with Information Foraging | arXiv |
| 2025.5 | An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents | arXiv |
| 2025.5 | VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning | arXiv |
| 2025.5 | EvolveSearch: An Iterative Self-Evolving Search Agent | arXiv |
| 2025.5 | ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement Learning | arXiv |
| 2025.5 | Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning | arXiv |
| 2025.5 | R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning | arXiv |
| 2025.5 | Pangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning | arXiv |
| 2025.5 | MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability | arXiv |
| 2025.5 | StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization | arXiv |
| 2025.5 | Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents | arXiv |
| 2025.5 | WebDancer: Towards Autonomous Information Seeking Agency | arXiv |
| 2025.5 | ZeroSearch: Incentivize the Search Capability of LLMs without Searching | arXiv |
| 2025.5 | O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering | arXiv |
| 2025.5 | s3: You Don't Need That Much Data to Train a Search Agent via RL | arXiv |
| 2025.5 | Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search Agent | arXiv |
| 2025.4 | WebThinker: Empowering Large Reasoning Models with Deep Research Capability | arXiv |
| 2025.4 | Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use | arXiv |
| 2025.4 | DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments | arXiv |
| 2025.4 | ReZero: Enhancing LLM Search Ability by Trying One More Time | arXiv |
| 2025.3 | ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning | arXiv |
| 2025.3 | Agent models: Internalizing Chain-of-Action Generation into Reasoning models | arXiv |
| 2025.3 | R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning | arXiv |
| 2025.3 | Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning | arXiv |
| 2025.2 | DeepRetrieval: Hacking Real Search Engines and Retrievers with LLMs via Reinforcement Learning | arXiv |
| 2025.2 | RAG-Gym: Systematic Optimization of Language Agents for Retrieval-Augmented Generation | arXiv |
| 2025.2 | DeepRAG: Thinking to Retrieval Step by Step for Large Language Models | arXiv |
| 2025.1 | Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning | arXiv |
| 2024.10 | SmartRAG: Jointly Learn RAG-Related Tasks From the Environment Feedback | ICLR 2025 |