YunjiaXi/Awesome-Search-Agent-Papers

198

49 commits

updated Aug 13, 2026

See the code

README

Awesome Search Agent Papers

This repository aims to collect and organize the latest research papers on Search Agents. Search agents leverage dynamic planning and in-depth information retrieval capabilities of intelligent agents, enabling them to dynamically adjust their search plans based on context for more efficient and accurate information acquisition.

This repository covers areas including, but not limited to Search Agent, Agentic RAG (Retrieval-Augmented Generation), Deep Research, Deep Search, Search-enhanced Reasoning Models.

We broadly categorize current solutions into the following types:

  • Early Iterative Retrieval: Papers exploring early mechanisms of iterative retrieval.
  • Tuning-free Methods: Approaches that achieve search agent functionality without extensive specific training data.
  • SFT-based Methods: Methods that train search agents using Supervised Fine-Tuning.
  • RL-based Methods: Methods that train search agents using Reinforcement Learning.

For a deeper look, check out our survey paper: A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges. If you find this repository helpful, please cite our survey paper.

@article{xi2025survey,
  title={A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges},
  author={Xi, Yunjia and Lin, Jianghao and Xiao, Yongzhao and Zhou, Zheli and Shan, Rong and Gao, Te and Zhu, Jiachen and Liu, Weiwen and Yu, Yong and Zhang, Weinan},
  journal={arXiv preprint arXiv:2508.05668},
  year={2025}
}

🔥 News

Table of Contents


Methods

Tuning-free Methods

TimePaper TitleVenue
2026.8EviGraph: Evidence-Guided Autonomous Research AgentsarXiv
2026.8A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM SystemsarXiv
2026.8Self-Correcting Long-Horizon Search Agents via Tree-Structured MemoryarXiv
2026.7PoTRE: Test-Time Reasoning inspired by Cognitive HeterogeneityarXiv
2026.7A New Role for Relevance: Guiding Corpus Interaction in Agentic SearcharXiv
2026.7Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data SynthesisarXiv
2026.7EMBL AI Librarian: Life-Sciences Knowledge Layer for AI AgentsarXiv
2026.7FinanceHarness: Autonomous Financial Deep Research FrameworkarXiv
2026.7DeepResearch Agent SystemarXiv
2026.7WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web SearcharXiv
2026.7Bayesian Uncertainty Propagation for Agentic RAG Pipelines: A Proof-of-Concept Study on Multi-Hop Question AnsweringarXiv
2026.6One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure AttributionarXiv
2026.6Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and NoveltyarXiv
2026.6Beyond Parallel Sampling: Diverse Query Initialization for Agentic SearcharXiv
2026.6ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep ResearcharXiv
2026.6TreeSeeker: Tree-Structured Trial, Error, and Return in Deep SearcharXiv
2026.6DuMate-DeepResearch: An Auditable Multi-Agent System with Recursive Search and Rubric-Grounded ReasoningarXiv
2026.6ActiveMem: Distributed Active Memory for Long-Horizon LLM ReasoningarXiv
2026.6Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop RetrievalarXiv
2026.6MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QAarXiv
2026.6PhotoCraft: Agentic Reasoning with Hierarchical Self-Evolving Memory for Deep Image SearcharXiv
2026.5DynaTree: Dynamic Agentic Retrieval Tree for Time-Sensitive News RetrievalarXiv
2026.5Hypothesis-Driven Deep Research with Large Language Models: A Structured Methodology for Automated Knowledge DiscoveryarXiv
2026.5PresentAgent-2: Towards Generalist Multimodal Presentation AgentsarXiv
2026.5PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory RefinementarXiv
2026.5AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration -- Learning from Cheap, Optimizing ExpensivearXiv
2026.5AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research AgentsarXiv
2026.5ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time ScalingarXiv
2026.5Parallel Context Compaction for Long-Horizon LLM Agent ServingarXiv
2026.5The Context Gathering Decision Process: A POMDP Framework for Agentic SearcharXiv
2026.5AgenticRAG: Agentic Retrieval for Enterprise Knowledge BasesarXiv
2026.5Inference-Time Budget Control for LLM Search AgentsarXiv
2026.5Superintelligent Retrieval Agent: The Next Frontier of Information RetrievalarXiv
2026.4Self-Optimizing Multi-Agent Systems for Deep ResearcharXiv
2026.4InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information SeekingarXiv
2026.4PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive ReflectionarXiv
2026.4Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost MonitoringarXiv
2026.4Towards Trustworthy Report Generation: A Deep Research Agent with Progressive Confidence Estimation and CalibrationarXiv
2026.4DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data StorytellingarXiv
2026.4Towards Knowledgeable Deep Research: Framework and BenchmarkarXiv
2026.4EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning ToolsarXiv
2026.3Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data LakesarXiv
2026.3Test-Time Strategies for More Efficient and Accurate Agentic RAGarXiv
2026.2Keyword search is all you need: Achieving RAG-Level Performance without vector databases using agentic tool usearXiv
2026.2Evaluating Stochasticity in Deep Research AgentsarXiv
2026.2Knowledge Integration Decay in Search-Augmented Reasoning of Large Language ModelsarXiv
2026.2Table-as-Search: Formulate Long-Horizon Agentic Information Seeking as Table CompletionarXiv
2026.2Lemon Agent Technical ReportarXiv
2026.2When Is Enough Not Enough? Illusory Completion in Search AgentsarXiv
2026.2W&D:Scaling Parallel Tool Calling for Efficient Deep Research AgentsarXiv
2026.2PreFlect: From Retrospective to Prospective Reflection in Large Language Model AgentsarXiv
2026.2LawThinker: A Deep Research Legal Agent in Dynamic EnvironmentsarXiv
2026.2FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agentsarxiv
2026.2A-MapReduce: Executing Wide Search via Agentic MapReducearXiv
2026.2G-MemLLM: Gated Latent Memory Augmentation for Long-Context Reasoning in Large Language ModelsarXiv
2026.2Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive NeurosciencearXiv
2026.2ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web SearcharXiv
2026.2SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model AssemblyarXiv
2026.2RE-TRAC: REcursive TRAjectory Compression for Deep Search AgentsarXiv
2026.2CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question AnsweringarXiv
2026.2DeepRead: Document Structure-Aware Reasoning to Enhance Agentic SearcharXiv
2026.1Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided VerificationarXiv
2026.1ExpSeek: Self-Triggered Experience Seeking for Web AgentsarXiv
2026.1Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon AgentsarXiv
2026.1Over-Searching in Search-Augmented Large Language ModelsarXiv
2026.1EvoFSM: Controllable Self-Evolution for Deep Research with Finite State MachinesarXiv
2026.1Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic SearcharXiv
2026.1InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous AgentsarXiv
2026.1EvoRoute: Experience-Driven Self-Routing LLM Agent SystemsarXiv
2026.1RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation DetectionarXiv
2026.1Mind2Report: A Cognitive Deep Research Agent for Expert-Level Commercial Report SynthesisarXiv
2025.12Multimodal Fact-Checking: An Agent-based ApproacharXiv
2025.12A Hierarchical Tree-based approach for creating Configurable and Static Deep Research Agent (Static-DRA)arXiv
2025.11RhinoInsight: Improving Deep Research through Control Mechanisms for Model Behavior and ContextarXiv
2025.11Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-DesignarXiv
2025.11ARISE: Agentic Rubric-Guided Iterative Survey Engine for Automated Scholarly Paper GenerationarXiv
2025.11Evidence-Bound Autonomous Research (EviBound): A Governance Framework for Eliminating False ClaimsarXiv
2025.11Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim VerificationarXiv
2025.10Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep ResearcharXiv
2025.10Dingtalk DeepResearch: A Unified Multi Agent Framework for Adaptive Intelligence in Enterprise EnvironmentsarXiv
2025.10Co-Sight: Enhancing LLM-Based Agents via Conflict-Aware Meta-Verification and Trustworthy Reasoning with Structured FactsarXiv
2025.10FAIR-RAG: Faithful Adaptive Iterative Refinement for Retrieval-Augmented GenerationarXiv
2025.10BrowseConf: Confidence-Guided Test-Time Scaling for Web AgentsarXiv
2025.10ParallelMuse: Agentic Parallel Thinking for Deep Information SeekingarXiv
2025.10SQuAI: Scientific Question-Answering with Multi-Agent Retrieval-Augmented GenerationarXiv
2025.10Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic SearcharXiv
2025.10MIRAGE: Agentic Framework for Multimodal Misinformation Detection with Web-Grounded ReasoningarXiv
2025.10Enterprise Deep Research: Steerable Multi-Agent Deep Research for Enterprise AnalyticsarXiv
2025.10ScholarEval: Research Idea Evaluation Grounded in LiteraturearXiv
2025.10FinSight: Towards Real-World Financial Deep ResearcharXiv
2025.10Real Deep Research for AI, Robotics and BeyondarXiv
2025.10PluriHop: Exhaustive, Recall-Sensitive QA over Distractor-Rich CorporaarXiv
2025.10Scaling Long-Horizon LLM Agent via Context-FoldingarXiv
2025.10Where to Search: Measure the Prior-Structured Search Space of LLM AgentsarXiv
2025.10PRISM: Agentic Retrieval with LLMs for Multi-Hop Question AnsweringarXiv
2025.10Adaptive Reasoning Executor: A Collaborative Agent System for Efficient ReasoningarXiv
2025.10ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research AgentsarXiv
2025.10FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation DetectionarXiv
2025.10DualResearch: Entropy-Gated Dual-Graph Retrieval for Answer ReconstructionarXiv
2025.10FlowSearch: Advancing deep research with dynamic structured knowledge flowarXiv
2025.10FlashResearch: Real-time Agent Orchestration for Efficient Deep ResearcharXiv
2025.10Pushing Test-Time Scaling Limits of Deep Search with Asymmetric VerificationarXiv
2025.9ARK-V1: An LLM-Agent for Knowledge Graph Question Answering Requiring Commonsense ReasoningarXiv
2025.9Recon-Act: A Self-Evolving Multi-Agent Browser-Use System via Web Reconnaissance, Tool Generation, and Task ExecutionarXiv
2025.9InteGround: On the Evaluation of Verification and Retrieval Planning in Integrative GroundingarXiv
2025.9Deep Research is the New Analytics System: Towards Building the Runtime for AI-Driven AnalyticsarXiv
2025.9L-MARS: Legal Multi-Agent Workflow with Orchestrated Reasoning and Agentic SearcharXiv
2025.9Universal Deep Research: Bring Your Own Model and StrategyarXiv
2025.8You Don't Need Pre-built Graphs for RAG: Retrieval Augmented Generation with Adaptive Reasoning StructuresarXiv
2025.8Improving and Evaluating Open Deep Research AgentsarXiv
2025.8BrowseMaster: Towards Scalable Web Browsing via Tool-Augmented Programmatic Agent PairarXiv
2025.8Efficient Agent: Optimizing Planning Capability for Multimodal Retrieval Augmented GenerationarXiv
2025.7SPAR: Scholar Paper Retrieval with LLM-based Agents for Enhanced Academic SearcharXiv
2025.7Agentic RAG with Knowledge Graphs for Complex Multi-Hop Reasoning in Real-World ApplicationsarXiv
2025.7Deep Researcher with Test-Time DiffusionarXiv
2025.7Decoupled Planning and Execution: A Hierarchical Reasoning Framework for Deep SearcharXiv
2025.6Towards Robust Fact-Checking: A Multi-Agent System with Advanced Evidence RetrievalarXiv
2025.6Towards AI Search ParadigmarXiv
2025.6KnowCoder-V2: Deep Knowledge AnalysisarXiv
2025.6Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic FrameworkarXiv
2025.6From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning AgentsarXiv
2025.5AutoData: A Multi-Agent System for Open Web Data CollectionarXiv
2025.5ManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent FrameworkarXiv
2025.5Code Researcher: Deep Research Agent for Large Systems Code and Commit HistoryarXiv
2025.5MA-RAG: Multi-Agent Retrieval-Augmented Generation via Collaborative Chain-of-Thought ReasoningarXiv
2025.5ITERKEY: Iterative Keyword Generation with LLMs for Enhanced Retrieval Augmented GenerationarXiv
2025.3Open deep search: Democratizing search with open-source reasoning agents.arXiv
2025.3MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree SearcharXiv
2025.3Agentic RAG with Human-in-the-RetrievalICSA-C 2025
2025.2WebWalker: Benchmarking LLMs in Web TraversalACL 2025
2025.2Holistically Guided Monte Carlo Tree Search for Intricate Information SeekingarXiv
2025.2ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agentsarxiv
2025.2Agentic Reasoning: Reasoning LLMs with Tools for the Deep ResearcharXiv
2025.2An Agent Framework for Real-Time Financial Information Searching with Large Language ModelsarXiv
2025.2DeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point ThinkingarXiv
2025.2MCTS-KBQA: Monte Carlo Tree Search for Knowledge Base Question AnsweringarXiv
2025.1Search-o1: Agentic search-enhanced large reasoning modelsarXiv
2025.1AirRAG: Activating Intrinsic Reasoning for Retrieval Augmented Generation using Tree-based SearcharXiv
2025.1ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process RewardingarXiv
2025.1Retrieval-Augmented Generation by Evidence Retroactivity in LLMsarXiv
2024.12Level-Navi Agent: A Framework and benchmark for Chinese Web Search AgentsarXiv
2024.12RAG-Star: Enhancing Deliberative Reasoning with Retrieval Augmented Verification and RefinementarXiv
2024.12Progressive Multimodal Reasoning via Active RetrievalarXiv
2024.11SRSA: A Cost-Efficient Strategy-Router Search Agent for Real-world Human-Machine InteractionsarXiv
2024.10Plan*rag: Efficient test-time planning for retrieval augmented generation.arXiv
2024.10Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging TasksarXiv
2024.10Inference scaling for long-context retrieval augmented generation.ICLR 2025
2024.9Agent-G: An Agentic Framework for Graph Retrieval Augmented Generationarxiv
2024.8Into the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent ConversationsEMNLP 2024
2024.8Hierarchical Retrieval-Augmented Generation Model with Rethink for Multi-hop Question Answeringarxiv
2024.7MindSearch: Mimicking Human Minds Elicits Deep AI SearcherarXiv
2024.7Retrieve, Summarize, Plan: Advancing Multi-hop Question Answering with an Iterative ApproachWWW2025 Agent4IR
2024.6PlanRAG: A Plan-then-Retrieval Augmented Generation for Generative Large Language Models as Decision MakersNAACL 2024
2024.4Assisting in Writing Wikipedia-like Articles From Scratch with Large Language ModelsNAACL 2024
2024.2Metacognitive Retrieval-Augmented Large Language ModelsWWW 2024
2023.8Knowledge-Driven CoT: Exploring Faithful Reasoning in LLMs for Knowledge-intensive Question AnsweringarXiv
2023.4Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive TasksWWW 2024

SFT-based Methods

TimePaper TitleVenue
2026.7Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?arXiv
2026.7Think Big, Search Small: Where Capacity Matters in Hierarchical Search Agents?arXiv
2026.6Contrastive Reflection for Iterative Prompt OptimizationarXiv
2026.6Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent WorkflowsarXiv
2026.6FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search AgentsarXiv
2026.5LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAGarXiv
2026.5LongSeeker: Elastic Context Orchestration for Long-Horizon Search AgentsarXiv
2026.5OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesarXiv
2026.5Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search SystemsarXiv
2026.4Learning to Retrieve from Agent TrajectoriesarXiv
2026.4Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM AgentsarXiv
2026.3OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training DataarXiv
2026.2ProductResearch: Training E-Commerce Deep Research Agents via Multi-Agent Synthetic Trajectory DistillationarXiv
2026.2WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory PruningarXiv
2026.1RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data SynthesisarXiv
2025.12DocDancer: Towards Agentic Document-Grounded Information SeekingarXiv
2025.12Nested Browser-Use Learning for Agentic Information SeekingarXiv
2025.12Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearcharXiv
2025.11SynClaimEval: A Framework for Evaluating the Utility of Synthetic Data in Long-Context Claim VerificationarXiv
2025.11REAP: Enhancing RAG with Recursive Evaluation and Adaptive Planning for Multi-Hop Question AnsweringarXiv
2025.10AgentFrontier: Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data SynthesisarXiv
2025.10DecoupleSearch: Decouple Planning and Search via Hierarchical Reward ModelingarXiv
2025.10AgentFold: Long-Horizon Web Agents with Proactive Context ManagementarXiv
2025.10Explore to Evolve: Scaling Evolved Aggregation Logic via Proactive Online Exploration for Deep Research AgentsarXiv
2025.10Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement MechanismsarXiv
2025.10BrowserAgent: Building Web Agents with Human-Inspired Web Browsing ActionsarXiv
2025.9AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level EvaluationarXiv
2025.9WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep ResearcharXiv
2025.9Open Data Synthesis For Deep ResearcharXiv
2025.8Hybrid Deep Searcher: Integrating Parallel and Sequential Search ReasoningarXiv
2025.8TURA: Tool-Augmented Unified Retrieval Agent for AI SearcharXiv
2025.7Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models TrainingarXiv
2025.5SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory SynthesisarXiv
2025.5Iterative Self-Incentivization Empowers Large Language Models as Agentic SearchersarXiv
2025.4KBQA-o1: Agentic Knowledge Base Question Answering with Monte Carlo Tree SearchICML 2025
2025.3ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented GenerationarXiv
2025.2RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM GenerationarXiv
2025.1Chain-of-Retrieval Augmented GenerationarXiv
2024.11Auto-rag: Autonomous retrieval-augmented generation for large language models.arXiv
2024.10Open-RAG: Enhanced Retrieval Augmented Reasoning with Open-Source Large Language ModelsEMNLP 2025
2023.12KwaiAgents: Generalized Information-seeking Agent System with Large Language ModelsWWW 2024
2023.12ReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM AgentICLR 2024
2023.10Self-rag: Learning to retrieve, generate, and critique through self-reflectionICLR 2024

RL-based Methods

TimePaper TitleVenue
2026.8Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Rememberarxiv
2026.8Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agentarxiv
2026.8ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignmentarxiv
2026.8EASy: Towards Efficient LLM-Based Agentic Systemarxiv
2026.8HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewardsarxiv
2026.8Contextual Information Policy Optimization for Search Agentsarxiv
2026.8Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learningarxiv
2026.8Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Groundingarxiv
2026.8LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillationarxiv
2026.8ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Modelsarxiv
2026.8Mitigating Context Interference for Reliable and Efficient Search Agentsarxiv
2026.7Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanismarxiv
2026.7LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoningarxiv
2026.7ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability)arxiv
2026.7CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agentsarxiv
2026.7PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learningarxiv
2026.7Agent-UCT: Upper Confidence Bounds Applied to Trees for Agentic Workflow Optimization with Cost-Awarenessarxiv
2026.7Reason Before You Retrieve: Agentic Planning for Multi-modal RAGarxiv
2026.7Reinforcement Learning for Large Language Model Selective Evidence Adoption from Contaminated Retrieval Resultsarxiv
2026.7PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learningarxiv
2026.7AREX: Towards a Recursively Self-Improving Agent for Deep Researcharxiv
2026.7WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedbackarxiv
2026.7EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoffarxiv
2026.7Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RLarxiv
2026.7Harness-G: A Graph-Structured Harness for Search Agentsarxiv
2026.7Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agentsarxiv
2026.7SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulationarxiv
2026.7DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environmentarxiv
2026.7Mach-Mind-4-Flash Technical Reportarxiv
2026.7AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphsarxiv
2026.7Multi-Turn Agentic Scientific Literature Search via Workflow InductionarXiv
2026.6ECHO: Prune to act, trace to learn with selective turn memory in agentic RLarXiv
2026.6ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using AgentsarXiv
2026.6ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question AnsweringarXiv
2026.6Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement LearningarXiv
2026.6GraphPO: Graph-based Policy Optimization for Reasoning ModelsarXiv
2026.6MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual EnvironmentsarXiv
2026.6Hybrid Open-Ended Tri-Evolution Makes Better Deep ResearcherarXiv
2026.6HarnessX: A Composable, Adaptive, and Evolvable Agent Harness FoundryarXiv
2026.6SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward GatingarXiv
2026.6Agents-K1: Towards Agent-native Knowledge OrchestrationarXiv
2026.6Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During TrainingarXiv
2026.6Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning SignalsarXiv
2026.6TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search AgentsarXiv
2026.6ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search AgentsarXiv
2026.6Adaptive Latent Agentic ReasoningarXiv
2026.6Self-Evolving Deep Research via Joint Generation and EvaluationarXiv
2026.5AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question AnsweringarXiv
2026.5Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware RewardarXiv
2026.5LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric RewardsarXiv
2026.5Learning Agent-Compatible Context Management for Long-Horizon TasksarXiv
2026.5COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search AgentsarXiv
2026.5PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement LearningarXiv
2026.5RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable RewardsarXiv
2026.5Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search AgentsarXiv
2026.5CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAGarXiv
2026.5Calibrating LLMs with Semantic-level RewardarXiv
2026.5Argus: Evidence Assembly for Scalable Deep Research AgentsarXiv
2026.5SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented ReasoningarXiv
2026.5Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented ReasoningarXiv
2026.5Co-ReAct: Rubrics as Step-Level Collaborators for ReAct AgentsarXiv
2026.5HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search AgentsarXiv
2026.5Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search AgentsarXiv
2026.5Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without VerifiersarXiv
2026.4OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic SearcharXiv
2026.4CroSearch-R1: Better Leveraging Cross-lingual Knowledge for Retrieval-Augmented GenerationarXiv
2026.4How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss ContinuumarXiv
2026.4Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph OptimizationarXiv
2026.4OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language ModelsarXiv
2026.4DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open DataarXiv
2026.4$\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External DataarXiv
2026.4Mind DeepResearch Technical ReportarXiv
2026.4Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy OptimizationarXiv
2026.4ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic ReasoningarXiv
2026.4ContextBudget: Budget-Aware Context Management for Long-Horizon Search AgentsarXiv
2026.4WebExpert: domain-aware web agents with critic-guided expert experience for high-precision searcharXiv
2026.4Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic SearcharXiv
2026.3TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMsarXiv
2026.3A Subgoal-driven Framework for Improving Long-Horizon LLM AgentsarXiv
2026.3MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via VerificationarXiv
2026.3Meta-Reinforcement Learning with Self-Reflection for Agentic SearcharXiv
2026.3Improving Search Agent with One Line of CodearXiv
2026.3Ares: Adaptive Reasoning Effort Selection for Efficient LLM AgentsarXiv
2026.3Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented AgentsarXiv
2026.3SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic PlansarXiv
2026.3KARL: Knowledge Agents via Reinforcement LearningarXiv
2026.3MemPO: Self-Memory Policy Optimization for Long-Horizon AgentsarXiv
2026.3Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search AgentsarXiv
2026.2Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented ReasoningarXiv
2026.2Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG TrainingarXiv
2026.2Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and GeneralizationarXiv
2026.2OmniGAIA: Towards Native Omni-Modal AI Agents |arXiv |
2026.2Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive RubricarXiv
2026.2REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search AgentsarXiv
2026.2KLong: Training LLM Agent for Extremely Long-horizon TasksarXiv
2026.2When to Memorize and When to Stop: Gated Recurrent Memory for Long-Context ReasoningarXiv
2026.2TodoEvolve: Learning to Architect Agent Planning SystemsarXiv
2026.2SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search AgentsarXiv
2026.2SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search AgentarXiv
2026.2AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale AgentsarXiv
2026.2AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep ResearcharXiv
2026.2DLLM-Searcher: Adapting Diffusion Large Language Model for Search AgentsarXiv
2026.2Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report GenerationarXiv
2026.2Training Multi-Turn Search Agent via Contrastive Dynamic Branch SamplingarXiv
2026.2Scaling Search-Augmented LLM Reasoning via Adaptive Information ControlarXiv
2026.2CRAFT: Calibrated Reasoning with Answer-Faithful Traces via Reinforcement Learning for Multi-Hop Question AnsweringarXiv
2026.2TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy OptimizationarXiv
2026.2Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain RewardarXiv
2026.2Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled TuningarXiv
2026.2Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model AgentsarXiv
2026.2WideSeek: Advancing Wide Research via Multi-Agent ScalingarXiv
2026.2IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement LearningarXiv
2026.2Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner CollaborationarXiv
2026.2WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement LearningarXiv
2026.2Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based RewardsarXiv
2026.1SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment SimulationarXiv
2026.1Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement LearningarXiv
2026.1BAPO: Boundary-Aware Policy Optimization for Reliable Agentic SearcharXiv
2026.1Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric RewardsarXiv
2026.1TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAGarXiv
2026.1D2Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented ReasoningarXiv
2026.1ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative RankingarXiv
2026.1PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question AnsweringarXiv
2026.1PaperScout: An Autonomous Agent for Academic Paper Search with Process-Aware Sequence-Level Policy OptimizationarXiv
2026.1M3Searcher: Modular Multimodal Information Seeking Agency with Retrieval-Oriented ReasoningarXiv
2026.1LRAS: Advanced Legal Reasoning with Agentic SearcharXiv
2026.1Dr. Zero: Self-Evolving Search Agents without Training DataarXiv
2026.1ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior CalibrationarXiv
2026.1SmartSearch: Process Reward-Guided Query Refinement for Search AgentsarXiv
2026.1Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic SearcharXiv
2026.1WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web ReasoningarXiv
2026.1O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RLarXiv
2026.1RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation DetectionarXiv
2026.1AT2PO: Agentic Turn-based Policy Optimization via Tree SearcharXiv
2025.12FoldAct: Efficient and Stable Context Folding for Long-Horizon Search AgentsarXiv
2025.12Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy OptimizationarXiv
2025.12Step-DeepResearch Technical ReportarXiv
2025.12AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement LearningarXiv
2025.12An Open and Reproducible Deep Research Agent for Long-Form Question AnsweringarXiv
2025.12CoDA: A Context-Decoupled Hierarchical Agent with Reinforcement LearningarXiv
2025.12LightSearcher: Efficient DeepSearch via Experiential MemoryarXiv
2025.12RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement LearningarXiv
2025.12Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy OptimizationarXiv
2025.12CARL: Critical Action Focused Reinforcement Learning for Multi-Step AgentarXiv
2025.12On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death SpiralarXiv
2025.11ToolOrchestra: Elevating Intelligence via Efficient Model and Tool OrchestrationarXiv
2025.11ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement LearningarXiv
2025.11ST-PPO: Stabilized Off-Policy Proximal Policy Optimization for Multi-Turn Agents TrainingarXiv
2025.11DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMsarXiv
2025.11DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep ResearcharXiv
2025.11General Agentic Memory Via Deep Research arXiv
2025.11Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement LearningarXiv
2025.11Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPOarXiv
2025.11Think Before You Retrieve: Learning Test-Time Adaptive Search with Small Language ModelsarXiv
2025.11Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn InteractionarXiv
2025.11TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation FrameworkarXiv
2025.11IterResearch: Rethinking Long-Horizon Agents via Markovian State ReconstructionarXiv
2025.11Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented ReasoningarXiv
2025.11MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement LearningarXiv
2025.10Search Self-play: Pushing the Frontier of Agent Capability without SupervisionarXiv
2025.10Reinforcement Learning for Long-Horizon Multi-Turn Search AgentsarXiv
2025.10DeepAgent: A General Reasoning Agent with Scalable ToolsetsarXiv
2025.10WebLeaper: Empowering Efficiency and Efficacy in WebAgent via Enabling Info-Rich SeekingarXiv
2025.10KnowCoder-A1: Incentivizing Agentic Reasoning Capability with Outcome Supervision for KBQAarXiv
2025.10GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement LearningarXiv
2025.10InfoFlow: Reinforcing Search Agent Via Reward Density OptimizationarXiv
2025.10Repurposing Synthetic Data for Fine-grained Search Agent SupervisionarXiv
2025.10Tongyi DeepResearch Technical ReportarXiv
2025.10Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval DeptharXiv
2025.10SafeSearch: Do Not Trade Safety for Utility in LLM Search AgentsarXiv
2025.10Agentic Reinforcement Learning for Search is UnsafearXiv
2025.10WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-ReflectionarXiv
2025.10PokeeResearch: Effective Deep Research via Reinforcement Learning from AI Feedback and Robust Reasoning ScaffoldarXiv
2025.10Plan Then Retrieve: Reinforcement Learning-Guided Complex Reasoning over Knowledge GraphsarXiv
2025.10DSPO: Stable and Efficient Policy Optimization for Agentic Search and ReasoningarXiv
2025.10Scaling Long-Horizon LLM Agent via Context-FoldingarXiv
2025.10Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented GenerationarXiv
2025.10PoU: Proof-of-Use to Counter Tool-Call Hacking in DeepResearch AgentsarXiv
2025.10DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage ShapingarXiv
2025.10Stop-RAG: Value-Based Retrieval Control for Iterative RAGarXiv
2025.10Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and FilteringarXiv
2025.10Agentic Entropy-Balanced Policy OptimizationarXiv
2025.10An Efficient Rubric-based Generative Verifier for Search-Augmented LLMsarXiv
2025.10Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM AgentsICLR 2026
2025.10Towards Agentic Self-Learning LLMs in Search EnvironmentarXiv
2025.10From Faithfulness to Correctness: Generative Reward Models that Think CriticallyarXiv
2025.10Beyond Turn Limits: Training Deep Search Agents with Dynamic Context WindowarXiv
2025.10QAgent: A modular Search Agent with Interactive Query UnderstandingarXiv
2025.10A2Search: Ambiguity-Aware Question Answering with Reinforcement LearningarXiv
2025.10HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented GenerationarXiv
2025.10Search-R3: Unifying Reasoning and Embedding Generation in Large Language ModelsarXiv
2025.10Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain ThemarXiv
2025.10ReSeek: A Self-Correcting Framework for Search Agents with Instructive RewardsarXiv
2025.10Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMsarXiv
2025.10Beyond Outcome Reward: Decoupling Search and Answering Improves LLM AgentsarXiv
2025.10MARS: Optimizing Dual-System Deep Research via Multi-Agent Reinforcement LearningarXiv
2025.10Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search AgentsarXiv
2025.9InfoAgent: Advancing Autonomous Information-Seeking AgentsarXiv
2025.9SIRAG: Towards Stable and Interpretable RAG with A Process-Supervised Multi-Agent FrameworkarXiv
2025.9Towards General Agentic Intelligence via Environment ScalingarXiv
2025.9ReSum: Unlocking Long-Horizon Search Intelligence via Context SummarizationarXiv
2025.9WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement LearningarXiv
2025.9WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon AgentsarXiv
2025.9Scaling Agents via Continual Pre-trainingarXiv
2025.9WebExplorer: Explore and Evolve for Training Long-Horizon Web AgentsarXiv
2025.9DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RLarXiv
2025.9AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement LearningarXiv
2025.9SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single AgentsarXiv
2025.9VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool UsearXiv
2025.9Open Data Synthesis For Deep ResearcharXiv
2025.8Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG CapabilitiesarXiv
2025.8AWorld: Orchestrating the Training Recipe for Agentic AIarXiv
2025.8AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement LearningarXiv
2025.8Memento: Fine-tuning LLM Agents without Fine-tuning LLMsarXiv
2025.8OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop RetrievalarXiv
2025.8Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RLarXiv
2025.8MedReseacher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis FrameworkarXiv
2025.8Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought RewardarXiv
2025.8WebWatcher: Breaking New Frontier of Vision-Language Deep Research AgentarXiv
2025.8HierSearch: A Hierarchical Enterprise Deep Search Framework Integrating Local and Web SearchesarXiv
2025.8REX-RAG: Reasoning Exploration with Policy Correction in Retrieval-Augmented GenerationarXiv
2025.8Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RLarXiv
2025.8SSRL: Self-Search Reinforcement LearningarXiv
2025.8UR2: Unify RAG and Reasoning through Reinforcement LearningarXiv
2025.8ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement LearningarXiv
2025.8Lucy: edgerunning agentic web search on mobile with machine generated task vectorsarXiv
2025.8MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented GenerationarXiv
2025.8Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge SynergyarXiv
2025.8GRAIL:Learning to Interact with Large Knowledge Graphs for Retrieval Augmented ReasoningarXiv
2025.7Agentic Reinforced Policy OptimizationarXiv
2025.7WebShaper: Agentically Data Synthesizing via Information-Seeking FormalizationarXiv
2025.7DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement LearningarXiv
2025.7WebSailor: Navigating Super-human Reasoning for Web AgentarXiv
2025.7RAG-R1 : Incentivize the Search and Reasoning Capabilities of LLMs through Multi-query ParallelismarXiv
2025.6Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim VerificationarXiv
2025.6R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement LearningarXiv
2025.6KunLunBaizeRAG: Reinforcement Learning Driven Inference Performance Leap for Large Language ModelsarXiv
2025.5Visual Agentic Reinforcement Fine-TuningarXiv
2025.5Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement LearningarXiv
2025.5Search and Refine During Think: Autonomous Retrieval-Augmented Reasoning of LLMsarXiv
2025.5Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing UncertaintyarXiv
2025.5Scent of Knowledge: Optimizing Search-Enhanced Reasoning with Information ForagingarXiv
2025.5An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM AgentsarXiv
2025.5VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement LearningarXiv
2025.5EvolveSearch: An Iterative Self-Evolving Search AgentarXiv
2025.5ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement LearningarXiv
2025.5Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement LearningarXiv
2025.5R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement LearningarXiv
2025.5Pangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement LearningarXiv
2025.5MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search CapabilityarXiv
2025.5StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy OptimizationarXiv
2025.5Demystifying and Enhancing the Efficiency of Large Language Model Based Search AgentsarXiv
2025.5WebDancer: Towards Autonomous Information Seeking AgencyarXiv
2025.5ZeroSearch: Incentivize the Search Capability of LLMs without SearchingarXiv
2025.5O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question AnsweringarXiv
2025.5s3: You Don't Need That Much Data to Train a Search Agent via RLarXiv
2025.5Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search AgentarXiv
2025.4WebThinker: Empowering Large Reasoning Models with Deep Research CapabilityarXiv
2025.4Synthetic Data Generation & Multi-Step RL for Reasoning & Tool UsearXiv
2025.4DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world EnvironmentsarXiv
2025.4ReZero: Enhancing LLM Search Ability by Trying One More TimearXiv
2025.3ReSearch: Learning to Reason with Search for LLMs via Reinforcement LearningarXiv
2025.3Agent models: Internalizing Chain-of-Action Generation into Reasoning modelsarXiv
2025.3R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement LearningarXiv
2025.3Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningarXiv
2025.2DeepRetrieval: Hacking Real Search Engines and Retrievers with LLMs via Reinforcement LearningarXiv
2025.2RAG-Gym: Systematic Optimization of Language Agents for Retrieval-Augmented GenerationarXiv
2025.2DeepRAG: Thinking to Retrieval Step by Step for Large Language ModelsarXiv
2025.1Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement LearningarXiv
2024.10SmartRAG: Jointly Learn RAG-Related Tasks From the Environment FeedbackICLR 2025

Early Iterative Retrieval

TimePaper TitleVenue
2025.6Dynamic Context Tuning for Retrieval-Augmented Generation: Enhancing Multi-Turn Planning and Tool AdaptationarXiv
2025.4Scaling Test-Time Inference with Policy-Optimized, Dynamic Retrieval-Augmented Generation via KV Caching and DecodingarXiv
2025.4Credible plan-driven RAG method for Multi-hop Question AnsweringarXiv
2025.3Graph-Augmented Reasoning: Evolving Step-by-Step Knowledge Graph Retrieval for LLM ReasoningarXiv
2024.11DMQR-RAG: Diverse Multi-Query Rewriting for RAGarXiv
2024.7Adaptive Retrieval-Augmented Generation for Conversational SystemsNAACL 2025
2024.7Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid ApproachEMNLP 2024
2024.7REAPER: Reasoning based Retrieval Planning for Complex RAG SystemsCIKM 2024
2024.6Generate-then-Ground in Retrieval-Augmented Generation for Multi-hop Question AnsweringACL 2024
2024.6Learning to Plan for Retrieval-Augmented Large Language Models from Knowledge GraphsEMNLP 2024
2024.6A Surprisingly Simple yet Effective Multi-Query Rewriting Method for Conversational Passage RetrievalSIGIR 2024
2024.3RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in Long-Horizon GenerationNeurIPS 2024
2024.3Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question ComplexityNAACL 2024
2024.3Generating Multi-Aspect Queries for Conversational SearcharXiv
2024.1Corrective Retrieval Augmented GenerationarXiv
2023.5Enhancing retrieval-augmented large language models with iterative retrieval-generation synergy.EMNLP 2023
2023.5Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous SourcesICLR 2024
2023.5Active retrieval augmented generation.EMNLP 2023
2022.12Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions.ACL 2023
2022.12DEMONSTRATE–SEARCH–PREDICT: Composing retrieval and language models for knowledge-intensive NLParXiv
2022.1Measuring and Narrowing the Compositionality Gap in Language ModelsEMNLP 2023

Datasets

Multi-Hop QA Dataset

NameTitleVenue
BrowseCompBrowseComp: A Simple Yet Challenging Benchmark for Browsing AgentsarXiv 2025
InfoDeepSeekInfoDeepSeek: Benchmarking Agentic Information Seeking for Retrieval-Augmented GenerationarXiv 2025
ORIONManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent FrameworkarXiv 2025
BrowseComp-ZHBrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in ChinesearXiv 2025
PopQAWhen Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric MemoriesACL 2023
WebPuzzlePangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement LearningarXiv 2025
BLURBrowsing Lost Unformed Recollections: A Benchmark for Tip-of-the-Tongue Search and ReasoningarXiv 2025
BRIGHTBRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive RetrievalICLR 2025
SealQASealQA: Raising the Bar for Reasoning in Search-Augmented Language ModelsarXiv 2025
MMSearchMMSearch: Benchmarking the Potential of Large Models as Multi-modal Search EnginesarXiv 2024
ScholarSearchScholarSearch: Benchmarking Scholar Searching Ability of LLMsarXiv 2025
Mind2Web 2Mind2Web 2: Evaluating Agentic Search with Agent-as-a-JudgearXiv 2025
BrowseComp-PlusBrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research AgentarXiv 2025
MM-BrowseCompMM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing AgentsarXiv 2025
WebShaperQAWebShaper: Agentically Data Synthesizing via Information-Seeking FormalizationarXiv 2025
WebWalkerQAWebWalker: Benchmarking LLMs in Web TraversalACL 2025
BrowseComp-VLWebWatcher: Breaking New Frontier of Vision-Language Deep Research AgentarXiv 2025
MAT-SearchVisual Agentic Reinforcement Fine-TuningarXiv 2025
MMSearch-PlusMMSearch-Plus: A Simple Yet Challenging Benchmark for Multimodal Browsing AgentsarXiv 2025
WebDetectiveDemystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metricsarXiv 2025
PaperArenaPaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific LiteraturearXiv 2025
WebAggregatorQAExplore to Evolve: Scaling Evolved Aggregation Logic via Proactive Online Exploration for Deep Research AgentsarXiv 2025
PluriHopWINDPluriHop: Exhaustive, Recall-Sensitive QA over Distractor-Rich CorporaarXiv 2025
CRUMQsEvaluating Retrieval-Augmented Generation Systems on Unanswerable, Uncheatable, Realistic, Multi-hop QueriesarXiv 2025
InteractCompInteractComp: Evaluating Search Agents With Ambiguous QueriesarXiv 2025
Needle in the WebNeedle in the Web: A Benchmark for Retrieving Targeted Web Pages in the WildarXiv 2025
ShotFinderShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web SearcharXiv 2025
WideSeekWideSeek: Advancing Wide Research via Multi-Agent ScalingarXiv 2025
GISAGISA: A Benchmark for General Information-Seeking AssistantarXiv 2026
BrowseComp-V3BrowseComp-V3: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing AgentsarXiv 2026
LiveNewsBenchLiveNewsBench: Evaluating LLM Web Search Capabilities with Freshly Curated NewsarXiv 2026
OmniGAIAOmniGAIA: Towards Native Omni-Modal AI AgentsarXiv 2026
MC-SearchMC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning ChainsarXiv 2026
InterLV-SearchInterLV-Search: Benchmarking Interleaved Multimodal Agentic SearcharXiv 2026
LoHoSearchLoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty CeilingarXiv 2026
EvoBrowseCompEvoBrowseComp: Benchmarking Search Agents on Evolving KnowledgearXiv 2026

Fact-checking dataset

Open-domain QA for Deep Research

NameTitleVenue
O2-QAO2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question AnsweringarXiv 2025
Researchy QuestionsResearchy Questions: A Dataset of Multi-Perspective, Decompositional Questions for LLM Web Agents.arXiv 2024
MultimodalReportBenchMultimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic FrameworkarXiv 2025
DeepResearchGymDeepResearchGym: A Free, Transparent, and Reproducible Evaluation Sandbox for Deep ResearcharXiv 2025
Deep Research BenchDeep Research Bench: Evaluating AI Web Research AgentsarXiv 2025
DeepResearch BenchDeepResearch Bench: A Comprehensive Benchmark for Deep Research AgentsarXiv 2025
WildSeekInto the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent ConversationsEMNLP 2024
ProxyQAPROXYQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language ModelsACL 2024
Long2RAGLong2RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point RecallEMNLP 2024
ResearcherBenchResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific InquiryarXiv 2025
ReportBenchReportBench: Evaluating Deep Research Agents via Academic Survey TasksarXiv 2025
DeepScholar-BenchDeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research SynthesisarXiv 2025
ResearchQAResearchQA: Evaluating Scholarly Question Answering at Scale Across 75 Fields with Survey-Mined Questions and RubricsarXiv 2025
DeepResearch ArenaDeepResearch Arena: The First Exam of LLMs' Research Abilities via Seminar-Grounded TasksarXiv 2025
DeepTRACEDeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and EvidencearXiv 2025
RigorousBenchA Rigorous Benchmark with Multidimensional Evaluation for Deep Research Agents: From Answers to ReportsarXiv 2025
SurveyBenchSurveyBench: How Well Can LLM(-Agents) Write Academic Surveys?arXiv 2025
DRBenchDRBench: A Realistic Benchmark for Enterprise Deep ResearcharXiv 2025
REPORTEVALUnderstanding DeepResearch via ReportsarXiv 2025
LiveResearchBenchLiveResearchBench: A Live Benchmark for User-Centric Deep Research in the WildarXiv 2025
DeepWideSearchDeepWideSearch: Benchmarking Depth and Width in Agentic Information SeekingarXiv 2025
ResearchRubricsResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research AgentsarXiv 2025
DEERDEER: A Comprehensive and Reliable Benchmark for Deep-Research Expert ReportsarXiv 2025
IDRBenchIDRBench: Interactive Deep Research BenchmarkarXiv 2025
VideoDRWatching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video ReasoningarXiv 2025
DR-ArenaDR-Arena: an Automated Evaluation Framework for Deep Research AgentsarXiv 2025
DeepResearchEvalDeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic EvaluationarXiv 2025
Deep Research Bench IIDeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert ReportarXiv 2025
MR DREBeyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report RevisionarXiv 2025
DeepSurvey-BenchDeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific SurveyarXiv 2026
Vision-DeepResearchVision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language ModelsarXiv 2026
DDR-BenchHunt Instead of Wait: Evaluating Deep Data Research on Large Language ModelsarXiv 2026
WLCWiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia ArticlesarXiv 2026
DRACODRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and ObjectivityarXiv 2026
DeepResearch-9KDeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research AgentarXiv 2026
KDR-BenchTowards Knowledgeable Deep Research: Framework and BenchmarkarXiv 2026
DR$^{3}$-EvalDR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research EvaluationarXiv 2026
AutoResearchBenchAutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature DiscoveryarXiv 2026
DeepWeb-BenchDeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon DerivationarXiv 2026

Domain-specific dataset

NameTitleVenue
FinSearchBench-24An Agent Framework for Real-Time Financial Information Searching with Large Language ModelsarXiv 2024
MIRAGEMIRAGE: A Benchmark for Multimodal Information-Seeking and Reasoning in Agricultural Expert-Guided ConversationsarXiv 2025
xbenchxbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World EvaluationsarXiv 2025
SolutionBenchDeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point ThinkingarXiv 2025
DQAPlanRAG: A Plan-then-Retrieval Augmented Generation for Generative Large Language Models as Decision MakersNAACL 2024
MedMCQAMedMCQA: A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question AnsweringPMLR 2022
MedBrowseComMedBrowseComp: Benchmarking Medical Deep Research and Computer UsearXiv 2025
GPQAGpqa: A graduate-level google-proof q&a benchmark.COLM 2024
ScIRGen-GeoScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific ResearchKDD 2025
OlympiadBenchOlympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problemsACL 2024
DeepShopDeepShop: A Benchmark for Deep Research Shopping AgentsarXiv 2025
USACOCan Language Models Solve Olympiad Programming?COLM 2024
GAIAGAIA: a benchmark for general AI assistants.arXiv 2023
HLEHumanity's Last ExamarXiv 2025
HERBBenchmarking Deep Search over Heterogeneous Enterprise DataarXiv 2025
FinAgentBenchFinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question AnsweringarXiv 2025
FinSearchCompFinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and ReasoningarXiv 2025
AirQAAirQA: A Comprehensive QA Dataset for AI Research with Instance-Level EvaluationarXiv 2025
FinDeepResearchFinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial AnalysisarXiv 2025
TSVerTSVer: A Benchmark for Fact Verification Against Time-Series EvidencearXiv 2025
FinRptFinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report GenerationarXiv 2025
LocalSearchBenchLocalSearchBench: Benchmarking Agentic Search in Real-World Local Life ServicesarXiv 2025
HotelQuESTHotelQuEST: Balancing Quality and Efficiency in Agentic SearcharXiv 2026
Deep FinResearch BenchDeep FinResearch Bench: Evaluating AI's Ability to Conduct Professional Financial Investment ResearcharXiv 2026
BioMedArenaBioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research AgentsarXiv 2026
SVFSearchSVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical DomainarXiv 2026
BigFinanceBenchBigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research AgentsarXiv 2026
Telco-GAIATelco-GAIA: Bilingual Benchmark for Agents in Telecom DomainarXiv 2026
FinResearchBench II:FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report QualityarXiv 2026

Other Aspect

NameTitleVenue
Instruct2DSAutoData: A Multi-Agent System for Open Web Data CollectionarXiv 2025
IIRCIIRC: A Dataset of Incomplete Information Reading Comprehension QuestionsEMNLP 2020
Search ArenaSearch Arena: Analyzing Search-Augmented LLMsarXiv 2025
CONFLICTSDRAGged into CONFLICTS:Detecting and Addressing Conflicting Sources in Search-Augmented LLMsarXiv 2025
WebWalkerQAWebWalker: Benchmarking LLMs in Web TraversalarXiv 2025
ToolQAToolQA: A Dataset for LLM Question Answering with External ToolsarXiv 2023
RAGCheckerRAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented GenerationarXiv 2024
DRComparatorDeep Research Comparator: A Platform For Fine-grained Human Annotations of Deep Research AgentsarXiv 2025
RAVineRAVine: Reality-Aligned Evaluation for Agentic SearcharXiv 2025
WideSearchWideSearch: Benchmarking Agentic Broad Info-SeekingarXiv 2025
ClawBenchClawBench: Can AI Agents Complete Everyday Online Tasks?arXiv 2026
InfoMosaic-BenchInfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented AgentsarXiv 2025
DeepResearchGuardDeepResearchGuard: Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for SafetyarXiv 2025
Pre-Exec BenchBuilding a Foundational Guardrail for General Agentic Systems via Synthetic DataarXiv 2025
RAGCap-BenchRAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation SystemsarXiv 2025
HSCodeCompHSCodeComp: A Realistic and Expert-level Benchmark for Deep Search Agents in Hierarchical Rule ApplicationarXiv 2025
Chameleon Benchmark[The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models](https://arxiv.org/abs/2510.16712
)arXiv 2025
LiveSearchBenchLiveSearchBench: An Automatically Constructed Benchmark for Retrieval and Reasoning over Dynamic KnowledgearXiv 2025
FACTSThe FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model FactualityarXiv 2025
OverSearchQAOver-Searching in Search-Augmented Large Language ModelsarXiv 2025
DeepHalluBenchWhy Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research TrajectoryarXiv 2025
SAGESAGE: Benchmarking and Improving Retrieval for Deep Research AgentsarXiv 2025
MPW-BenchEvaluating the Search Agent in a Parallel WorldarXiv 2026
UIS-QAUIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information SeekingarXiv 2026
BCASQuantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM SearcharXiv 2026
MYSQALanguage Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real UsersarXiv 2026
MERRINMERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web EnvironmentsarXiv 2026
/Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research AgentsarXiv 2026
DailyReportDailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks)arXiv 2026
DISCOBENCHWhen Search Agents Should Ask: DiscoBench for Clarification-Aware Deep SearcharXiv 2026
DRFLOWDRFLOW: A Deep Research Benchmark for Personalized Workflow PredictionarXiv 2026
PACEPACE: A Proxy for Agentic Capability EvaluationarXiv 2026
DRNOISEDRNOISE: Benchmarking Deep Research Agents in Misleading Evidence EnvironmentsarXiv 2026
SimpleWikiSearchSimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic SearcharXiv 2026
DeepStressDeepStress: Stress-Testing Deep Search AgentsarXiv 2026
SearchAuditor:SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search AgentsarXiv 2026
EcoAgent-BenchEcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM AgentsarXiv 2026

Feel free to open an issue or PR to add new papers and benchmarks!

Contributors

YunjiaXi

47 commits

Necolizer

1 commits

reacher-z

1 commits

YunjiaXi/Awesome-Search-Agent-Papers

198

49 commits

updated Aug 13, 2026

See the code

README

Awesome Search Agent Papers

This repository aims to collect and organize the latest research papers on Search Agents. Search agents leverage dynamic planning and in-depth information retrieval capabilities of intelligent agents, enabling them to dynamically adjust their search plans based on context for more efficient and accurate information acquisition.

This repository covers areas including, but not limited to Search Agent, Agentic RAG (Retrieval-Augmented Generation), Deep Research, Deep Search, Search-enhanced Reasoning Models.

We broadly categorize current solutions into the following types:

  • Early Iterative Retrieval: Papers exploring early mechanisms of iterative retrieval.
  • Tuning-free Methods: Approaches that achieve search agent functionality without extensive specific training data.
  • SFT-based Methods: Methods that train search agents using Supervised Fine-Tuning.
  • RL-based Methods: Methods that train search agents using Reinforcement Learning.

For a deeper look, check out our survey paper: A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges. If you find this repository helpful, please cite our survey paper.

@article{xi2025survey,
  title={A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges},
  author={Xi, Yunjia and Lin, Jianghao and Xiao, Yongzhao and Zhou, Zheli and Shan, Rong and Gao, Te and Zhu, Jiachen and Liu, Weiwen and Yu, Yong and Zhang, Weinan},
  journal={arXiv preprint arXiv:2508.05668},
  year={2025}
}

🔥 News

Table of Contents


Methods

Tuning-free Methods

TimePaper TitleVenue
2026.8EviGraph: Evidence-Guided Autonomous Research AgentsarXiv
2026.8A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM SystemsarXiv
2026.8Self-Correcting Long-Horizon Search Agents via Tree-Structured MemoryarXiv
2026.7PoTRE: Test-Time Reasoning inspired by Cognitive HeterogeneityarXiv
2026.7A New Role for Relevance: Guiding Corpus Interaction in Agentic SearcharXiv
2026.7Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data SynthesisarXiv
2026.7EMBL AI Librarian: Life-Sciences Knowledge Layer for AI AgentsarXiv
2026.7FinanceHarness: Autonomous Financial Deep Research FrameworkarXiv
2026.7DeepResearch Agent SystemarXiv
2026.7WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web SearcharXiv
2026.7Bayesian Uncertainty Propagation for Agentic RAG Pipelines: A Proof-of-Concept Study on Multi-Hop Question AnsweringarXiv
2026.6One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure AttributionarXiv
2026.6Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and NoveltyarXiv
2026.6Beyond Parallel Sampling: Diverse Query Initialization for Agentic SearcharXiv
2026.6ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep ResearcharXiv
2026.6TreeSeeker: Tree-Structured Trial, Error, and Return in Deep SearcharXiv
2026.6DuMate-DeepResearch: An Auditable Multi-Agent System with Recursive Search and Rubric-Grounded ReasoningarXiv
2026.6ActiveMem: Distributed Active Memory for Long-Horizon LLM ReasoningarXiv
2026.6Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop RetrievalarXiv
2026.6MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QAarXiv
2026.6PhotoCraft: Agentic Reasoning with Hierarchical Self-Evolving Memory for Deep Image SearcharXiv
2026.5DynaTree: Dynamic Agentic Retrieval Tree for Time-Sensitive News RetrievalarXiv
2026.5Hypothesis-Driven Deep Research with Large Language Models: A Structured Methodology for Automated Knowledge DiscoveryarXiv
2026.5PresentAgent-2: Towards Generalist Multimodal Presentation AgentsarXiv
2026.5PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory RefinementarXiv
2026.5AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration -- Learning from Cheap, Optimizing ExpensivearXiv
2026.5AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research AgentsarXiv
2026.5ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time ScalingarXiv
2026.5Parallel Context Compaction for Long-Horizon LLM Agent ServingarXiv
2026.5The Context Gathering Decision Process: A POMDP Framework for Agentic SearcharXiv
2026.5AgenticRAG: Agentic Retrieval for Enterprise Knowledge BasesarXiv
2026.5Inference-Time Budget Control for LLM Search AgentsarXiv
2026.5Superintelligent Retrieval Agent: The Next Frontier of Information RetrievalarXiv
2026.4Self-Optimizing Multi-Agent Systems for Deep ResearcharXiv
2026.4InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information SeekingarXiv
2026.4PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive ReflectionarXiv
2026.4Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost MonitoringarXiv
2026.4Towards Trustworthy Report Generation: A Deep Research Agent with Progressive Confidence Estimation and CalibrationarXiv
2026.4DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data StorytellingarXiv
2026.4Towards Knowledgeable Deep Research: Framework and BenchmarkarXiv
2026.4EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning ToolsarXiv
2026.3Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data LakesarXiv
2026.3Test-Time Strategies for More Efficient and Accurate Agentic RAGarXiv
2026.2Keyword search is all you need: Achieving RAG-Level Performance without vector databases using agentic tool usearXiv
2026.2Evaluating Stochasticity in Deep Research AgentsarXiv
2026.2Knowledge Integration Decay in Search-Augmented Reasoning of Large Language ModelsarXiv
2026.2Table-as-Search: Formulate Long-Horizon Agentic Information Seeking as Table CompletionarXiv
2026.2Lemon Agent Technical ReportarXiv
2026.2When Is Enough Not Enough? Illusory Completion in Search AgentsarXiv
2026.2W&D:Scaling Parallel Tool Calling for Efficient Deep Research AgentsarXiv
2026.2PreFlect: From Retrospective to Prospective Reflection in Large Language Model AgentsarXiv
2026.2LawThinker: A Deep Research Legal Agent in Dynamic EnvironmentsarXiv
2026.2FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agentsarxiv
2026.2A-MapReduce: Executing Wide Search via Agentic MapReducearXiv
2026.2G-MemLLM: Gated Latent Memory Augmentation for Long-Context Reasoning in Large Language ModelsarXiv
2026.2Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive NeurosciencearXiv
2026.2ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web SearcharXiv
2026.2SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model AssemblyarXiv
2026.2RE-TRAC: REcursive TRAjectory Compression for Deep Search AgentsarXiv
2026.2CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question AnsweringarXiv
2026.2DeepRead: Document Structure-Aware Reasoning to Enhance Agentic SearcharXiv
2026.1Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided VerificationarXiv
2026.1ExpSeek: Self-Triggered Experience Seeking for Web AgentsarXiv
2026.1Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon AgentsarXiv
2026.1Over-Searching in Search-Augmented Large Language ModelsarXiv
2026.1EvoFSM: Controllable Self-Evolution for Deep Research with Finite State MachinesarXiv
2026.1Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic SearcharXiv
2026.1InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous AgentsarXiv
2026.1EvoRoute: Experience-Driven Self-Routing LLM Agent SystemsarXiv
2026.1RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation DetectionarXiv
2026.1Mind2Report: A Cognitive Deep Research Agent for Expert-Level Commercial Report SynthesisarXiv
2025.12Multimodal Fact-Checking: An Agent-based ApproacharXiv
2025.12A Hierarchical Tree-based approach for creating Configurable and Static Deep Research Agent (Static-DRA)arXiv
2025.11RhinoInsight: Improving Deep Research through Control Mechanisms for Model Behavior and ContextarXiv
2025.11Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-DesignarXiv
2025.11ARISE: Agentic Rubric-Guided Iterative Survey Engine for Automated Scholarly Paper GenerationarXiv
2025.11Evidence-Bound Autonomous Research (EviBound): A Governance Framework for Eliminating False ClaimsarXiv
2025.11Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim VerificationarXiv
2025.10Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep ResearcharXiv
2025.10Dingtalk DeepResearch: A Unified Multi Agent Framework for Adaptive Intelligence in Enterprise EnvironmentsarXiv
2025.10Co-Sight: Enhancing LLM-Based Agents via Conflict-Aware Meta-Verification and Trustworthy Reasoning with Structured FactsarXiv
2025.10FAIR-RAG: Faithful Adaptive Iterative Refinement for Retrieval-Augmented GenerationarXiv
2025.10BrowseConf: Confidence-Guided Test-Time Scaling for Web AgentsarXiv
2025.10ParallelMuse: Agentic Parallel Thinking for Deep Information SeekingarXiv
2025.10SQuAI: Scientific Question-Answering with Multi-Agent Retrieval-Augmented GenerationarXiv
2025.10Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic SearcharXiv
2025.10MIRAGE: Agentic Framework for Multimodal Misinformation Detection with Web-Grounded ReasoningarXiv
2025.10Enterprise Deep Research: Steerable Multi-Agent Deep Research for Enterprise AnalyticsarXiv
2025.10ScholarEval: Research Idea Evaluation Grounded in LiteraturearXiv
2025.10FinSight: Towards Real-World Financial Deep ResearcharXiv
2025.10Real Deep Research for AI, Robotics and BeyondarXiv
2025.10PluriHop: Exhaustive, Recall-Sensitive QA over Distractor-Rich CorporaarXiv
2025.10Scaling Long-Horizon LLM Agent via Context-FoldingarXiv
2025.10Where to Search: Measure the Prior-Structured Search Space of LLM AgentsarXiv
2025.10PRISM: Agentic Retrieval with LLMs for Multi-Hop Question AnsweringarXiv
2025.10Adaptive Reasoning Executor: A Collaborative Agent System for Efficient ReasoningarXiv
2025.10ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research AgentsarXiv
2025.10FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation DetectionarXiv
2025.10DualResearch: Entropy-Gated Dual-Graph Retrieval for Answer ReconstructionarXiv
2025.10FlowSearch: Advancing deep research with dynamic structured knowledge flowarXiv
2025.10FlashResearch: Real-time Agent Orchestration for Efficient Deep ResearcharXiv
2025.10Pushing Test-Time Scaling Limits of Deep Search with Asymmetric VerificationarXiv
2025.9ARK-V1: An LLM-Agent for Knowledge Graph Question Answering Requiring Commonsense ReasoningarXiv
2025.9Recon-Act: A Self-Evolving Multi-Agent Browser-Use System via Web Reconnaissance, Tool Generation, and Task ExecutionarXiv
2025.9InteGround: On the Evaluation of Verification and Retrieval Planning in Integrative GroundingarXiv
2025.9Deep Research is the New Analytics System: Towards Building the Runtime for AI-Driven AnalyticsarXiv
2025.9L-MARS: Legal Multi-Agent Workflow with Orchestrated Reasoning and Agentic SearcharXiv
2025.9Universal Deep Research: Bring Your Own Model and StrategyarXiv
2025.8You Don't Need Pre-built Graphs for RAG: Retrieval Augmented Generation with Adaptive Reasoning StructuresarXiv
2025.8Improving and Evaluating Open Deep Research AgentsarXiv
2025.8BrowseMaster: Towards Scalable Web Browsing via Tool-Augmented Programmatic Agent PairarXiv
2025.8Efficient Agent: Optimizing Planning Capability for Multimodal Retrieval Augmented GenerationarXiv
2025.7SPAR: Scholar Paper Retrieval with LLM-based Agents for Enhanced Academic SearcharXiv
2025.7Agentic RAG with Knowledge Graphs for Complex Multi-Hop Reasoning in Real-World ApplicationsarXiv
2025.7Deep Researcher with Test-Time DiffusionarXiv
2025.7Decoupled Planning and Execution: A Hierarchical Reasoning Framework for Deep SearcharXiv
2025.6Towards Robust Fact-Checking: A Multi-Agent System with Advanced Evidence RetrievalarXiv
2025.6Towards AI Search ParadigmarXiv
2025.6KnowCoder-V2: Deep Knowledge AnalysisarXiv
2025.6Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic FrameworkarXiv
2025.6From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning AgentsarXiv
2025.5AutoData: A Multi-Agent System for Open Web Data CollectionarXiv
2025.5ManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent FrameworkarXiv
2025.5Code Researcher: Deep Research Agent for Large Systems Code and Commit HistoryarXiv
2025.5MA-RAG: Multi-Agent Retrieval-Augmented Generation via Collaborative Chain-of-Thought ReasoningarXiv
2025.5ITERKEY: Iterative Keyword Generation with LLMs for Enhanced Retrieval Augmented GenerationarXiv
2025.3Open deep search: Democratizing search with open-source reasoning agents.arXiv
2025.3MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree SearcharXiv
2025.3Agentic RAG with Human-in-the-RetrievalICSA-C 2025
2025.2WebWalker: Benchmarking LLMs in Web TraversalACL 2025
2025.2Holistically Guided Monte Carlo Tree Search for Intricate Information SeekingarXiv
2025.2ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agentsarxiv
2025.2Agentic Reasoning: Reasoning LLMs with Tools for the Deep ResearcharXiv
2025.2An Agent Framework for Real-Time Financial Information Searching with Large Language ModelsarXiv
2025.2DeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point ThinkingarXiv
2025.2MCTS-KBQA: Monte Carlo Tree Search for Knowledge Base Question AnsweringarXiv
2025.1Search-o1: Agentic search-enhanced large reasoning modelsarXiv
2025.1AirRAG: Activating Intrinsic Reasoning for Retrieval Augmented Generation using Tree-based SearcharXiv
2025.1ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process RewardingarXiv
2025.1Retrieval-Augmented Generation by Evidence Retroactivity in LLMsarXiv
2024.12Level-Navi Agent: A Framework and benchmark for Chinese Web Search AgentsarXiv
2024.12RAG-Star: Enhancing Deliberative Reasoning with Retrieval Augmented Verification and RefinementarXiv
2024.12Progressive Multimodal Reasoning via Active RetrievalarXiv
2024.11SRSA: A Cost-Efficient Strategy-Router Search Agent for Real-world Human-Machine InteractionsarXiv
2024.10Plan*rag: Efficient test-time planning for retrieval augmented generation.arXiv
2024.10Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging TasksarXiv
2024.10Inference scaling for long-context retrieval augmented generation.ICLR 2025
2024.9Agent-G: An Agentic Framework for Graph Retrieval Augmented Generationarxiv
2024.8Into the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent ConversationsEMNLP 2024
2024.8Hierarchical Retrieval-Augmented Generation Model with Rethink for Multi-hop Question Answeringarxiv
2024.7MindSearch: Mimicking Human Minds Elicits Deep AI SearcherarXiv
2024.7Retrieve, Summarize, Plan: Advancing Multi-hop Question Answering with an Iterative ApproachWWW2025 Agent4IR
2024.6PlanRAG: A Plan-then-Retrieval Augmented Generation for Generative Large Language Models as Decision MakersNAACL 2024
2024.4Assisting in Writing Wikipedia-like Articles From Scratch with Large Language ModelsNAACL 2024
2024.2Metacognitive Retrieval-Augmented Large Language ModelsWWW 2024
2023.8Knowledge-Driven CoT: Exploring Faithful Reasoning in LLMs for Knowledge-intensive Question AnsweringarXiv
2023.4Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive TasksWWW 2024

SFT-based Methods

TimePaper TitleVenue
2026.7Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?arXiv
2026.7Think Big, Search Small: Where Capacity Matters in Hierarchical Search Agents?arXiv
2026.6Contrastive Reflection for Iterative Prompt OptimizationarXiv
2026.6Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent WorkflowsarXiv
2026.6FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search AgentsarXiv
2026.5LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAGarXiv
2026.5LongSeeker: Elastic Context Orchestration for Long-Horizon Search AgentsarXiv
2026.5OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesarXiv
2026.5Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search SystemsarXiv
2026.4Learning to Retrieve from Agent TrajectoriesarXiv
2026.4Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM AgentsarXiv
2026.3OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training DataarXiv
2026.2ProductResearch: Training E-Commerce Deep Research Agents via Multi-Agent Synthetic Trajectory DistillationarXiv
2026.2WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory PruningarXiv
2026.1RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data SynthesisarXiv
2025.12DocDancer: Towards Agentic Document-Grounded Information SeekingarXiv
2025.12Nested Browser-Use Learning for Agentic Information SeekingarXiv
2025.12Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearcharXiv
2025.11SynClaimEval: A Framework for Evaluating the Utility of Synthetic Data in Long-Context Claim VerificationarXiv
2025.11REAP: Enhancing RAG with Recursive Evaluation and Adaptive Planning for Multi-Hop Question AnsweringarXiv
2025.10AgentFrontier: Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data SynthesisarXiv
2025.10DecoupleSearch: Decouple Planning and Search via Hierarchical Reward ModelingarXiv
2025.10AgentFold: Long-Horizon Web Agents with Proactive Context ManagementarXiv
2025.10Explore to Evolve: Scaling Evolved Aggregation Logic via Proactive Online Exploration for Deep Research AgentsarXiv
2025.10Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement MechanismsarXiv
2025.10BrowserAgent: Building Web Agents with Human-Inspired Web Browsing ActionsarXiv
2025.9AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level EvaluationarXiv
2025.9WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep ResearcharXiv
2025.9Open Data Synthesis For Deep ResearcharXiv
2025.8Hybrid Deep Searcher: Integrating Parallel and Sequential Search ReasoningarXiv
2025.8TURA: Tool-Augmented Unified Retrieval Agent for AI SearcharXiv
2025.7Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models TrainingarXiv
2025.5SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory SynthesisarXiv
2025.5Iterative Self-Incentivization Empowers Large Language Models as Agentic SearchersarXiv
2025.4KBQA-o1: Agentic Knowledge Base Question Answering with Monte Carlo Tree SearchICML 2025
2025.3ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented GenerationarXiv
2025.2RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM GenerationarXiv
2025.1Chain-of-Retrieval Augmented GenerationarXiv
2024.11Auto-rag: Autonomous retrieval-augmented generation for large language models.arXiv
2024.10Open-RAG: Enhanced Retrieval Augmented Reasoning with Open-Source Large Language ModelsEMNLP 2025
2023.12KwaiAgents: Generalized Information-seeking Agent System with Large Language ModelsWWW 2024
2023.12ReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM AgentICLR 2024
2023.10Self-rag: Learning to retrieve, generate, and critique through self-reflectionICLR 2024

RL-based Methods

TimePaper TitleVenue
2026.8Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Rememberarxiv
2026.8Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agentarxiv
2026.8ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignmentarxiv
2026.8EASy: Towards Efficient LLM-Based Agentic Systemarxiv
2026.8HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewardsarxiv
2026.8Contextual Information Policy Optimization for Search Agentsarxiv
2026.8Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learningarxiv
2026.8Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Groundingarxiv
2026.8LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillationarxiv
2026.8ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Modelsarxiv
2026.8Mitigating Context Interference for Reliable and Efficient Search Agentsarxiv
2026.7Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanismarxiv
2026.7LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoningarxiv
2026.7ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability)arxiv
2026.7CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agentsarxiv
2026.7PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learningarxiv
2026.7Agent-UCT: Upper Confidence Bounds Applied to Trees for Agentic Workflow Optimization with Cost-Awarenessarxiv
2026.7Reason Before You Retrieve: Agentic Planning for Multi-modal RAGarxiv
2026.7Reinforcement Learning for Large Language Model Selective Evidence Adoption from Contaminated Retrieval Resultsarxiv
2026.7PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learningarxiv
2026.7AREX: Towards a Recursively Self-Improving Agent for Deep Researcharxiv
2026.7WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedbackarxiv
2026.7EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoffarxiv
2026.7Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RLarxiv
2026.7Harness-G: A Graph-Structured Harness for Search Agentsarxiv
2026.7Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agentsarxiv
2026.7SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulationarxiv
2026.7DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environmentarxiv
2026.7Mach-Mind-4-Flash Technical Reportarxiv
2026.7AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphsarxiv
2026.7Multi-Turn Agentic Scientific Literature Search via Workflow InductionarXiv
2026.6ECHO: Prune to act, trace to learn with selective turn memory in agentic RLarXiv
2026.6ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using AgentsarXiv
2026.6ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question AnsweringarXiv
2026.6Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement LearningarXiv
2026.6GraphPO: Graph-based Policy Optimization for Reasoning ModelsarXiv
2026.6MetaResearcher: Scaling Deep Research via Self-Reflective Reinforcement Learning in Adversarial Virtual EnvironmentsarXiv
2026.6Hybrid Open-Ended Tri-Evolution Makes Better Deep ResearcherarXiv
2026.6HarnessX: A Composable, Adaptive, and Evolvable Agent Harness FoundryarXiv
2026.6SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward GatingarXiv
2026.6Agents-K1: Towards Agent-native Knowledge OrchestrationarXiv
2026.6Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During TrainingarXiv
2026.6Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning SignalsarXiv
2026.6TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search AgentsarXiv
2026.6ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search AgentsarXiv
2026.6Adaptive Latent Agentic ReasoningarXiv
2026.6Self-Evolving Deep Research via Joint Generation and EvaluationarXiv
2026.5AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question AnsweringarXiv
2026.5Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware RewardarXiv
2026.5LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric RewardsarXiv
2026.5Learning Agent-Compatible Context Management for Long-Horizon TasksarXiv
2026.5COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search AgentsarXiv
2026.5PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement LearningarXiv
2026.5RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable RewardsarXiv
2026.5Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search AgentsarXiv
2026.5CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAGarXiv
2026.5Calibrating LLMs with Semantic-level RewardarXiv
2026.5Argus: Evidence Assembly for Scalable Deep Research AgentsarXiv
2026.5SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented ReasoningarXiv
2026.5Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented ReasoningarXiv
2026.5Co-ReAct: Rubrics as Step-Level Collaborators for ReAct AgentsarXiv
2026.5HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search AgentsarXiv
2026.5Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search AgentsarXiv
2026.5Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without VerifiersarXiv
2026.4OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic SearcharXiv
2026.4CroSearch-R1: Better Leveraging Cross-lingual Knowledge for Retrieval-Augmented GenerationarXiv
2026.4How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss ContinuumarXiv
2026.4Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph OptimizationarXiv
2026.4OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language ModelsarXiv
2026.4DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open DataarXiv
2026.4$\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External DataarXiv
2026.4Mind DeepResearch Technical ReportarXiv
2026.4Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy OptimizationarXiv
2026.4ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic ReasoningarXiv
2026.4ContextBudget: Budget-Aware Context Management for Long-Horizon Search AgentsarXiv
2026.4WebExpert: domain-aware web agents with critic-guided expert experience for high-precision searcharXiv
2026.4Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic SearcharXiv
2026.3TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMsarXiv
2026.3A Subgoal-driven Framework for Improving Long-Horizon LLM AgentsarXiv
2026.3MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via VerificationarXiv
2026.3Meta-Reinforcement Learning with Self-Reflection for Agentic SearcharXiv
2026.3Improving Search Agent with One Line of CodearXiv
2026.3Ares: Adaptive Reasoning Effort Selection for Efficient LLM AgentsarXiv
2026.3Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented AgentsarXiv
2026.3SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic PlansarXiv
2026.3KARL: Knowledge Agents via Reinforcement LearningarXiv
2026.3MemPO: Self-Memory Policy Optimization for Long-Horizon AgentsarXiv
2026.3Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search AgentsarXiv
2026.2Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented ReasoningarXiv
2026.2Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG TrainingarXiv
2026.2Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and GeneralizationarXiv
2026.2OmniGAIA: Towards Native Omni-Modal AI Agents |arXiv |
2026.2Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive RubricarXiv
2026.2REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search AgentsarXiv
2026.2KLong: Training LLM Agent for Extremely Long-horizon TasksarXiv
2026.2When to Memorize and When to Stop: Gated Recurrent Memory for Long-Context ReasoningarXiv
2026.2TodoEvolve: Learning to Architect Agent Planning SystemsarXiv
2026.2SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search AgentsarXiv
2026.2SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search AgentarXiv
2026.2AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale AgentsarXiv
2026.2AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep ResearcharXiv
2026.2DLLM-Searcher: Adapting Diffusion Large Language Model for Search AgentsarXiv
2026.2Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report GenerationarXiv
2026.2Training Multi-Turn Search Agent via Contrastive Dynamic Branch SamplingarXiv
2026.2Scaling Search-Augmented LLM Reasoning via Adaptive Information ControlarXiv
2026.2CRAFT: Calibrated Reasoning with Answer-Faithful Traces via Reinforcement Learning for Multi-Hop Question AnsweringarXiv
2026.2TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy OptimizationarXiv
2026.2Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain RewardarXiv
2026.2Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled TuningarXiv
2026.2Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model AgentsarXiv
2026.2WideSeek: Advancing Wide Research via Multi-Agent ScalingarXiv
2026.2IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement LearningarXiv
2026.2Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner CollaborationarXiv
2026.2WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement LearningarXiv
2026.2Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based RewardsarXiv
2026.1SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment SimulationarXiv
2026.1Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement LearningarXiv
2026.1BAPO: Boundary-Aware Policy Optimization for Reliable Agentic SearcharXiv
2026.1Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric RewardsarXiv
2026.1TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAGarXiv
2026.1D2Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented ReasoningarXiv
2026.1ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative RankingarXiv
2026.1PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question AnsweringarXiv
2026.1PaperScout: An Autonomous Agent for Academic Paper Search with Process-Aware Sequence-Level Policy OptimizationarXiv
2026.1M3Searcher: Modular Multimodal Information Seeking Agency with Retrieval-Oriented ReasoningarXiv
2026.1LRAS: Advanced Legal Reasoning with Agentic SearcharXiv
2026.1Dr. Zero: Self-Evolving Search Agents without Training DataarXiv
2026.1ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior CalibrationarXiv
2026.1SmartSearch: Process Reward-Guided Query Refinement for Search AgentsarXiv
2026.1Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic SearcharXiv
2026.1WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web ReasoningarXiv
2026.1O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RLarXiv
2026.1RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation DetectionarXiv
2026.1AT2PO: Agentic Turn-based Policy Optimization via Tree SearcharXiv
2025.12FoldAct: Efficient and Stable Context Folding for Long-Horizon Search AgentsarXiv
2025.12Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy OptimizationarXiv
2025.12Step-DeepResearch Technical ReportarXiv
2025.12AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement LearningarXiv
2025.12An Open and Reproducible Deep Research Agent for Long-Form Question AnsweringarXiv
2025.12CoDA: A Context-Decoupled Hierarchical Agent with Reinforcement LearningarXiv
2025.12LightSearcher: Efficient DeepSearch via Experiential MemoryarXiv
2025.12RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement LearningarXiv
2025.12Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy OptimizationarXiv
2025.12CARL: Critical Action Focused Reinforcement Learning for Multi-Step AgentarXiv
2025.12On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death SpiralarXiv
2025.11ToolOrchestra: Elevating Intelligence via Efficient Model and Tool OrchestrationarXiv
2025.11ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement LearningarXiv
2025.11ST-PPO: Stabilized Off-Policy Proximal Policy Optimization for Multi-Turn Agents TrainingarXiv
2025.11DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMsarXiv
2025.11DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep ResearcharXiv
2025.11General Agentic Memory Via Deep Research arXiv
2025.11Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement LearningarXiv
2025.11Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPOarXiv
2025.11Think Before You Retrieve: Learning Test-Time Adaptive Search with Small Language ModelsarXiv
2025.11Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn InteractionarXiv
2025.11TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation FrameworkarXiv
2025.11IterResearch: Rethinking Long-Horizon Agents via Markovian State ReconstructionarXiv
2025.11Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented ReasoningarXiv
2025.11MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement LearningarXiv
2025.10Search Self-play: Pushing the Frontier of Agent Capability without SupervisionarXiv
2025.10Reinforcement Learning for Long-Horizon Multi-Turn Search AgentsarXiv
2025.10DeepAgent: A General Reasoning Agent with Scalable ToolsetsarXiv
2025.10WebLeaper: Empowering Efficiency and Efficacy in WebAgent via Enabling Info-Rich SeekingarXiv
2025.10KnowCoder-A1: Incentivizing Agentic Reasoning Capability with Outcome Supervision for KBQAarXiv
2025.10GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement LearningarXiv
2025.10InfoFlow: Reinforcing Search Agent Via Reward Density OptimizationarXiv
2025.10Repurposing Synthetic Data for Fine-grained Search Agent SupervisionarXiv
2025.10Tongyi DeepResearch Technical ReportarXiv
2025.10Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval DeptharXiv
2025.10SafeSearch: Do Not Trade Safety for Utility in LLM Search AgentsarXiv
2025.10Agentic Reinforcement Learning for Search is UnsafearXiv
2025.10WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-ReflectionarXiv
2025.10PokeeResearch: Effective Deep Research via Reinforcement Learning from AI Feedback and Robust Reasoning ScaffoldarXiv
2025.10Plan Then Retrieve: Reinforcement Learning-Guided Complex Reasoning over Knowledge GraphsarXiv
2025.10DSPO: Stable and Efficient Policy Optimization for Agentic Search and ReasoningarXiv
2025.10Scaling Long-Horizon LLM Agent via Context-FoldingarXiv
2025.10Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented GenerationarXiv
2025.10PoU: Proof-of-Use to Counter Tool-Call Hacking in DeepResearch AgentsarXiv
2025.10DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage ShapingarXiv
2025.10Stop-RAG: Value-Based Retrieval Control for Iterative RAGarXiv
2025.10Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and FilteringarXiv
2025.10Agentic Entropy-Balanced Policy OptimizationarXiv
2025.10An Efficient Rubric-based Generative Verifier for Search-Augmented LLMsarXiv
2025.10Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM AgentsICLR 2026
2025.10Towards Agentic Self-Learning LLMs in Search EnvironmentarXiv
2025.10From Faithfulness to Correctness: Generative Reward Models that Think CriticallyarXiv
2025.10Beyond Turn Limits: Training Deep Search Agents with Dynamic Context WindowarXiv
2025.10QAgent: A modular Search Agent with Interactive Query UnderstandingarXiv
2025.10A2Search: Ambiguity-Aware Question Answering with Reinforcement LearningarXiv
2025.10HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented GenerationarXiv
2025.10Search-R3: Unifying Reasoning and Embedding Generation in Large Language ModelsarXiv
2025.10Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain ThemarXiv
2025.10ReSeek: A Self-Correcting Framework for Search Agents with Instructive RewardsarXiv
2025.10Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMsarXiv
2025.10Beyond Outcome Reward: Decoupling Search and Answering Improves LLM AgentsarXiv
2025.10MARS: Optimizing Dual-System Deep Research via Multi-Agent Reinforcement LearningarXiv
2025.10Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search AgentsarXiv
2025.9InfoAgent: Advancing Autonomous Information-Seeking AgentsarXiv
2025.9SIRAG: Towards Stable and Interpretable RAG with A Process-Supervised Multi-Agent FrameworkarXiv
2025.9Towards General Agentic Intelligence via Environment ScalingarXiv
2025.9ReSum: Unlocking Long-Horizon Search Intelligence via Context SummarizationarXiv
2025.9WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement LearningarXiv
2025.9WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon AgentsarXiv
2025.9Scaling Agents via Continual Pre-trainingarXiv
2025.9WebExplorer: Explore and Evolve for Training Long-Horizon Web AgentsarXiv
2025.9DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RLarXiv
2025.9AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement LearningarXiv
2025.9SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single AgentsarXiv
2025.9VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool UsearXiv
2025.9Open Data Synthesis For Deep ResearcharXiv
2025.8Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG CapabilitiesarXiv
2025.8AWorld: Orchestrating the Training Recipe for Agentic AIarXiv
2025.8AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement LearningarXiv
2025.8Memento: Fine-tuning LLM Agents without Fine-tuning LLMsarXiv
2025.8OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop RetrievalarXiv
2025.8Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RLarXiv
2025.8MedReseacher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis FrameworkarXiv
2025.8Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought RewardarXiv
2025.8WebWatcher: Breaking New Frontier of Vision-Language Deep Research AgentarXiv
2025.8HierSearch: A Hierarchical Enterprise Deep Search Framework Integrating Local and Web SearchesarXiv
2025.8REX-RAG: Reasoning Exploration with Policy Correction in Retrieval-Augmented GenerationarXiv
2025.8Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RLarXiv
2025.8SSRL: Self-Search Reinforcement LearningarXiv
2025.8UR2: Unify RAG and Reasoning through Reinforcement LearningarXiv
2025.8ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement LearningarXiv
2025.8Lucy: edgerunning agentic web search on mobile with machine generated task vectorsarXiv
2025.8MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented GenerationarXiv
2025.8Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge SynergyarXiv
2025.8GRAIL:Learning to Interact with Large Knowledge Graphs for Retrieval Augmented ReasoningarXiv
2025.7Agentic Reinforced Policy OptimizationarXiv
2025.7WebShaper: Agentically Data Synthesizing via Information-Seeking FormalizationarXiv
2025.7DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement LearningarXiv
2025.7WebSailor: Navigating Super-human Reasoning for Web AgentarXiv
2025.7RAG-R1 : Incentivize the Search and Reasoning Capabilities of LLMs through Multi-query ParallelismarXiv
2025.6Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim VerificationarXiv
2025.6R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement LearningarXiv
2025.6KunLunBaizeRAG: Reinforcement Learning Driven Inference Performance Leap for Large Language ModelsarXiv
2025.5Visual Agentic Reinforcement Fine-TuningarXiv
2025.5Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement LearningarXiv
2025.5Search and Refine During Think: Autonomous Retrieval-Augmented Reasoning of LLMsarXiv
2025.5Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing UncertaintyarXiv
2025.5Scent of Knowledge: Optimizing Search-Enhanced Reasoning with Information ForagingarXiv
2025.5An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM AgentsarXiv
2025.5VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement LearningarXiv
2025.5EvolveSearch: An Iterative Self-Evolving Search AgentarXiv
2025.5ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement LearningarXiv
2025.5Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement LearningarXiv
2025.5R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement LearningarXiv
2025.5Pangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement LearningarXiv
2025.5MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search CapabilityarXiv
2025.5StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy OptimizationarXiv
2025.5Demystifying and Enhancing the Efficiency of Large Language Model Based Search AgentsarXiv
2025.5WebDancer: Towards Autonomous Information Seeking AgencyarXiv
2025.5ZeroSearch: Incentivize the Search Capability of LLMs without SearchingarXiv
2025.5O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question AnsweringarXiv
2025.5s3: You Don't Need That Much Data to Train a Search Agent via RLarXiv
2025.5Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search AgentarXiv
2025.4WebThinker: Empowering Large Reasoning Models with Deep Research CapabilityarXiv
2025.4Synthetic Data Generation & Multi-Step RL for Reasoning & Tool UsearXiv
2025.4DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world EnvironmentsarXiv
2025.4ReZero: Enhancing LLM Search Ability by Trying One More TimearXiv
2025.3ReSearch: Learning to Reason with Search for LLMs via Reinforcement LearningarXiv
2025.3Agent models: Internalizing Chain-of-Action Generation into Reasoning modelsarXiv
2025.3R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement LearningarXiv
2025.3Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement LearningarXiv
2025.2DeepRetrieval: Hacking Real Search Engines and Retrievers with LLMs via Reinforcement LearningarXiv
2025.2RAG-Gym: Systematic Optimization of Language Agents for Retrieval-Augmented GenerationarXiv
2025.2DeepRAG: Thinking to Retrieval Step by Step for Large Language ModelsarXiv
2025.1Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement LearningarXiv
2024.10SmartRAG: Jointly Learn RAG-Related Tasks From the Environment FeedbackICLR 2025

Early Iterative Retrieval

TimePaper TitleVenue
2025.6Dynamic Context Tuning for Retrieval-Augmented Generation: Enhancing Multi-Turn Planning and Tool AdaptationarXiv
2025.4Scaling Test-Time Inference with Policy-Optimized, Dynamic Retrieval-Augmented Generation via KV Caching and DecodingarXiv
2025.4Credible plan-driven RAG method for Multi-hop Question AnsweringarXiv
2025.3Graph-Augmented Reasoning: Evolving Step-by-Step Knowledge Graph Retrieval for LLM ReasoningarXiv
2024.11DMQR-RAG: Diverse Multi-Query Rewriting for RAGarXiv
2024.7Adaptive Retrieval-Augmented Generation for Conversational SystemsNAACL 2025
2024.7Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid ApproachEMNLP 2024
2024.7REAPER: Reasoning based Retrieval Planning for Complex RAG SystemsCIKM 2024
2024.6Generate-then-Ground in Retrieval-Augmented Generation for Multi-hop Question AnsweringACL 2024
2024.6Learning to Plan for Retrieval-Augmented Large Language Models from Knowledge GraphsEMNLP 2024
2024.6A Surprisingly Simple yet Effective Multi-Query Rewriting Method for Conversational Passage RetrievalSIGIR 2024
2024.3RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in Long-Horizon GenerationNeurIPS 2024
2024.3Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question ComplexityNAACL 2024
2024.3Generating Multi-Aspect Queries for Conversational SearcharXiv
2024.1Corrective Retrieval Augmented GenerationarXiv
2023.5Enhancing retrieval-augmented large language models with iterative retrieval-generation synergy.EMNLP 2023
2023.5Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous SourcesICLR 2024
2023.5Active retrieval augmented generation.EMNLP 2023
2022.12Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions.ACL 2023
2022.12DEMONSTRATE–SEARCH–PREDICT: Composing retrieval and language models for knowledge-intensive NLParXiv
2022.1Measuring and Narrowing the Compositionality Gap in Language ModelsEMNLP 2023

Datasets

Multi-Hop QA Dataset

NameTitleVenue
BrowseCompBrowseComp: A Simple Yet Challenging Benchmark for Browsing AgentsarXiv 2025
InfoDeepSeekInfoDeepSeek: Benchmarking Agentic Information Seeking for Retrieval-Augmented GenerationarXiv 2025
ORIONManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent FrameworkarXiv 2025
BrowseComp-ZHBrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in ChinesearXiv 2025
PopQAWhen Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric MemoriesACL 2023
WebPuzzlePangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement LearningarXiv 2025
BLURBrowsing Lost Unformed Recollections: A Benchmark for Tip-of-the-Tongue Search and ReasoningarXiv 2025
BRIGHTBRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive RetrievalICLR 2025
SealQASealQA: Raising the Bar for Reasoning in Search-Augmented Language ModelsarXiv 2025
MMSearchMMSearch: Benchmarking the Potential of Large Models as Multi-modal Search EnginesarXiv 2024
ScholarSearchScholarSearch: Benchmarking Scholar Searching Ability of LLMsarXiv 2025
Mind2Web 2Mind2Web 2: Evaluating Agentic Search with Agent-as-a-JudgearXiv 2025
BrowseComp-PlusBrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research AgentarXiv 2025
MM-BrowseCompMM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing AgentsarXiv 2025
WebShaperQAWebShaper: Agentically Data Synthesizing via Information-Seeking FormalizationarXiv 2025
WebWalkerQAWebWalker: Benchmarking LLMs in Web TraversalACL 2025
BrowseComp-VLWebWatcher: Breaking New Frontier of Vision-Language Deep Research AgentarXiv 2025
MAT-SearchVisual Agentic Reinforcement Fine-TuningarXiv 2025
MMSearch-PlusMMSearch-Plus: A Simple Yet Challenging Benchmark for Multimodal Browsing AgentsarXiv 2025
WebDetectiveDemystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metricsarXiv 2025
PaperArenaPaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific LiteraturearXiv 2025
WebAggregatorQAExplore to Evolve: Scaling Evolved Aggregation Logic via Proactive Online Exploration for Deep Research AgentsarXiv 2025
PluriHopWINDPluriHop: Exhaustive, Recall-Sensitive QA over Distractor-Rich CorporaarXiv 2025
CRUMQsEvaluating Retrieval-Augmented Generation Systems on Unanswerable, Uncheatable, Realistic, Multi-hop QueriesarXiv 2025
InteractCompInteractComp: Evaluating Search Agents With Ambiguous QueriesarXiv 2025
Needle in the WebNeedle in the Web: A Benchmark for Retrieving Targeted Web Pages in the WildarXiv 2025
ShotFinderShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web SearcharXiv 2025
WideSeekWideSeek: Advancing Wide Research via Multi-Agent ScalingarXiv 2025
GISAGISA: A Benchmark for General Information-Seeking AssistantarXiv 2026
BrowseComp-V3BrowseComp-V3: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing AgentsarXiv 2026
LiveNewsBenchLiveNewsBench: Evaluating LLM Web Search Capabilities with Freshly Curated NewsarXiv 2026
OmniGAIAOmniGAIA: Towards Native Omni-Modal AI AgentsarXiv 2026
MC-SearchMC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning ChainsarXiv 2026
InterLV-SearchInterLV-Search: Benchmarking Interleaved Multimodal Agentic SearcharXiv 2026
LoHoSearchLoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty CeilingarXiv 2026
EvoBrowseCompEvoBrowseComp: Benchmarking Search Agents on Evolving KnowledgearXiv 2026

Fact-checking dataset

Open-domain QA for Deep Research

NameTitleVenue
O2-QAO2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question AnsweringarXiv 2025
Researchy QuestionsResearchy Questions: A Dataset of Multi-Perspective, Decompositional Questions for LLM Web Agents.arXiv 2024
MultimodalReportBenchMultimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic FrameworkarXiv 2025
DeepResearchGymDeepResearchGym: A Free, Transparent, and Reproducible Evaluation Sandbox for Deep ResearcharXiv 2025
Deep Research BenchDeep Research Bench: Evaluating AI Web Research AgentsarXiv 2025
DeepResearch BenchDeepResearch Bench: A Comprehensive Benchmark for Deep Research AgentsarXiv 2025
WildSeekInto the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent ConversationsEMNLP 2024
ProxyQAPROXYQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language ModelsACL 2024
Long2RAGLong2RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point RecallEMNLP 2024
ResearcherBenchResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific InquiryarXiv 2025
ReportBenchReportBench: Evaluating Deep Research Agents via Academic Survey TasksarXiv 2025
DeepScholar-BenchDeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research SynthesisarXiv 2025
ResearchQAResearchQA: Evaluating Scholarly Question Answering at Scale Across 75 Fields with Survey-Mined Questions and RubricsarXiv 2025
DeepResearch ArenaDeepResearch Arena: The First Exam of LLMs' Research Abilities via Seminar-Grounded TasksarXiv 2025
DeepTRACEDeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and EvidencearXiv 2025
RigorousBenchA Rigorous Benchmark with Multidimensional Evaluation for Deep Research Agents: From Answers to ReportsarXiv 2025
SurveyBenchSurveyBench: How Well Can LLM(-Agents) Write Academic Surveys?arXiv 2025
DRBenchDRBench: A Realistic Benchmark for Enterprise Deep ResearcharXiv 2025
REPORTEVALUnderstanding DeepResearch via ReportsarXiv 2025
LiveResearchBenchLiveResearchBench: A Live Benchmark for User-Centric Deep Research in the WildarXiv 2025
DeepWideSearchDeepWideSearch: Benchmarking Depth and Width in Agentic Information SeekingarXiv 2025
ResearchRubricsResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research AgentsarXiv 2025
DEERDEER: A Comprehensive and Reliable Benchmark for Deep-Research Expert ReportsarXiv 2025
IDRBenchIDRBench: Interactive Deep Research BenchmarkarXiv 2025
VideoDRWatching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video ReasoningarXiv 2025
DR-ArenaDR-Arena: an Automated Evaluation Framework for Deep Research AgentsarXiv 2025
DeepResearchEvalDeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic EvaluationarXiv 2025
Deep Research Bench IIDeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert ReportarXiv 2025
MR DREBeyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report RevisionarXiv 2025
DeepSurvey-BenchDeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific SurveyarXiv 2026
Vision-DeepResearchVision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language ModelsarXiv 2026
DDR-BenchHunt Instead of Wait: Evaluating Deep Data Research on Large Language ModelsarXiv 2026
WLCWiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia ArticlesarXiv 2026
DRACODRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and ObjectivityarXiv 2026
DeepResearch-9KDeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research AgentarXiv 2026
KDR-BenchTowards Knowledgeable Deep Research: Framework and BenchmarkarXiv 2026
DR$^{3}$-EvalDR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research EvaluationarXiv 2026
AutoResearchBenchAutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature DiscoveryarXiv 2026
DeepWeb-BenchDeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon DerivationarXiv 2026

Domain-specific dataset

NameTitleVenue
FinSearchBench-24An Agent Framework for Real-Time Financial Information Searching with Large Language ModelsarXiv 2024
MIRAGEMIRAGE: A Benchmark for Multimodal Information-Seeking and Reasoning in Agricultural Expert-Guided ConversationsarXiv 2025
xbenchxbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World EvaluationsarXiv 2025
SolutionBenchDeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point ThinkingarXiv 2025
DQAPlanRAG: A Plan-then-Retrieval Augmented Generation for Generative Large Language Models as Decision MakersNAACL 2024
MedMCQAMedMCQA: A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question AnsweringPMLR 2022
MedBrowseComMedBrowseComp: Benchmarking Medical Deep Research and Computer UsearXiv 2025
GPQAGpqa: A graduate-level google-proof q&a benchmark.COLM 2024
ScIRGen-GeoScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific ResearchKDD 2025
OlympiadBenchOlympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problemsACL 2024
DeepShopDeepShop: A Benchmark for Deep Research Shopping AgentsarXiv 2025
USACOCan Language Models Solve Olympiad Programming?COLM 2024
GAIAGAIA: a benchmark for general AI assistants.arXiv 2023
HLEHumanity's Last ExamarXiv 2025
HERBBenchmarking Deep Search over Heterogeneous Enterprise DataarXiv 2025
FinAgentBenchFinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question AnsweringarXiv 2025
FinSearchCompFinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and ReasoningarXiv 2025
AirQAAirQA: A Comprehensive QA Dataset for AI Research with Instance-Level EvaluationarXiv 2025
FinDeepResearchFinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial AnalysisarXiv 2025
TSVerTSVer: A Benchmark for Fact Verification Against Time-Series EvidencearXiv 2025
FinRptFinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report GenerationarXiv 2025
LocalSearchBenchLocalSearchBench: Benchmarking Agentic Search in Real-World Local Life ServicesarXiv 2025
HotelQuESTHotelQuEST: Balancing Quality and Efficiency in Agentic SearcharXiv 2026
Deep FinResearch BenchDeep FinResearch Bench: Evaluating AI's Ability to Conduct Professional Financial Investment ResearcharXiv 2026
BioMedArenaBioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research AgentsarXiv 2026
SVFSearchSVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical DomainarXiv 2026
BigFinanceBenchBigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research AgentsarXiv 2026
Telco-GAIATelco-GAIA: Bilingual Benchmark for Agents in Telecom DomainarXiv 2026
FinResearchBench II:FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report QualityarXiv 2026

Other Aspect

NameTitleVenue
Instruct2DSAutoData: A Multi-Agent System for Open Web Data CollectionarXiv 2025
IIRCIIRC: A Dataset of Incomplete Information Reading Comprehension QuestionsEMNLP 2020
Search ArenaSearch Arena: Analyzing Search-Augmented LLMsarXiv 2025
CONFLICTSDRAGged into CONFLICTS:Detecting and Addressing Conflicting Sources in Search-Augmented LLMsarXiv 2025
WebWalkerQAWebWalker: Benchmarking LLMs in Web TraversalarXiv 2025
ToolQAToolQA: A Dataset for LLM Question Answering with External ToolsarXiv 2023
RAGCheckerRAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented GenerationarXiv 2024
DRComparatorDeep Research Comparator: A Platform For Fine-grained Human Annotations of Deep Research AgentsarXiv 2025
RAVineRAVine: Reality-Aligned Evaluation for Agentic SearcharXiv 2025
WideSearchWideSearch: Benchmarking Agentic Broad Info-SeekingarXiv 2025
ClawBenchClawBench: Can AI Agents Complete Everyday Online Tasks?arXiv 2026
InfoMosaic-BenchInfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented AgentsarXiv 2025
DeepResearchGuardDeepResearchGuard: Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for SafetyarXiv 2025
Pre-Exec BenchBuilding a Foundational Guardrail for General Agentic Systems via Synthetic DataarXiv 2025
RAGCap-BenchRAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation SystemsarXiv 2025
HSCodeCompHSCodeComp: A Realistic and Expert-level Benchmark for Deep Search Agents in Hierarchical Rule ApplicationarXiv 2025
Chameleon Benchmark[The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models](https://arxiv.org/abs/2510.16712
)arXiv 2025
LiveSearchBenchLiveSearchBench: An Automatically Constructed Benchmark for Retrieval and Reasoning over Dynamic KnowledgearXiv 2025
FACTSThe FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model FactualityarXiv 2025
OverSearchQAOver-Searching in Search-Augmented Large Language ModelsarXiv 2025
DeepHalluBenchWhy Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research TrajectoryarXiv 2025
SAGESAGE: Benchmarking and Improving Retrieval for Deep Research AgentsarXiv 2025
MPW-BenchEvaluating the Search Agent in a Parallel WorldarXiv 2026
UIS-QAUIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information SeekingarXiv 2026
BCASQuantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM SearcharXiv 2026
MYSQALanguage Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real UsersarXiv 2026
MERRINMERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web EnvironmentsarXiv 2026
/Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research AgentsarXiv 2026
DailyReportDailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks)arXiv 2026
DISCOBENCHWhen Search Agents Should Ask: DiscoBench for Clarification-Aware Deep SearcharXiv 2026
DRFLOWDRFLOW: A Deep Research Benchmark for Personalized Workflow PredictionarXiv 2026
PACEPACE: A Proxy for Agentic Capability EvaluationarXiv 2026
DRNOISEDRNOISE: Benchmarking Deep Research Agents in Misleading Evidence EnvironmentsarXiv 2026
SimpleWikiSearchSimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic SearcharXiv 2026
DeepStressDeepStress: Stress-Testing Deep Search AgentsarXiv 2026
SearchAuditor:SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search AgentsarXiv 2026
EcoAgent-BenchEcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM AgentsarXiv 2026

Feel free to open an issue or PR to add new papers and benchmarks!

Contributors

YunjiaXi

47 commits

Necolizer

1 commits

reacher-z

1 commits