DavidZWZ/Awesome-Deep-Research

[ACL 2026 KnowFM] Awesome Agentic Deep Research Resources

867

89 commits

updated Jul 23, 2026

See the code

README

πŸ€– Awesome Agentic Deep Research Resources

Awesome arXiv Maintenance Contribution Welcome Code

Oryx Video-ChatGPT

Welcome to Awesome-Deep-Research! πŸš€ This repository serves as your comprehensive guide to the cutting-edge world of Agentic Deep Research. We've meticulously curated a collection of resources for you.

DeepResearch Framework

Whether you're a researcher, developer, or enthusiast, this repository is your gateway to exploring the fascinating intersection of artificial intelligence and autonomous agents. For a detailed analysis of the changing paradigm in information search, check out our position paper: From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents πŸ“„, which outlines existing domain trends and future directions. For researchers interested in the broader intersection of RAG and Reasoning, we also recommend exploring our comprehensive collection at Awesome-RAG-Reasoning πŸ”₯πŸ”₯πŸ”₯.

Table of Contents

Industry-Leading Products

  • Gemini Deep Research: Google's advanced research assistant for deep analysis (December 11, 2024)
  • Deep Research: OpenAI's deep research platform [API Guide] (February 2, 2025)
  • Perplexity Deep Research: Perplexity's product for in-depth research and analysis (February 14, 2025)
  • Grok Agents: xAI's autonomous DeepSearch agents powered by Grok-3 (February 19, 2025)
  • Copilot Researcher: Researcher and Analyst in Microsoft 365 Copilot (March 25, 2025)
  • Research: Anthropic's research platform to find and reason with information (April 15, 2025)
  • Manus: Advanced research and analysis platform (March 6, 2025)
  • 🦌 DeerFlow: ByteDance's research and analysis solution (May 9, 2025)
  • Deep Research: Alibaba's Qwen-powered research assistant (May 14, 2025)
  • Kimi-Researcher: Moonshot's research assistant powered by Kimi (June 20, 2025)
  • Not Human Search: Search engine for AI agents. Available as MCP server for tool discovery.
  • SearchHive: API platform for web scraping, search, and AI-powered deep research.

Open-Source Implementations

Latest Research Papers

πŸ”₯πŸ”₯πŸ”₯ This section showcases the most recent and impactful research papers in the field of Agentic Deep Research. Each paper represents a significant advancement in the development of autonomous research agents, search capabilities, and reasoning frameworks. The papers are organized chronologically, with the most recent publications at the top. Key areas covered include:

  • πŸ€– Agentic frameworks for deep research
  • πŸ” Search-enhanced reasoning models
  • 🌐 Web agents for deep research
  • πŸ”„ Reasoning and retrieval-augmented generation
  • πŸ“Š Multimodal deep research

πŸš€πŸš€πŸš€ Stay tuned for the hottest breakthroughs in the field!

TitleDate & CodeBase modelOptimizationSearch EngineAgent ArchitectureTraining DatasetEvaluation Dataset
STAMP: Provenance-Guided Credit Assignment for Deep Search Agents2026/07/13Qwen3-30B-A3B-Thinking-2507SFT, GRPOWeb SearchSingle-AgentSynthesized bilingual Wikipedia QA (3K SFT, 2.6K RL)BrowseComp, BrowseComp-ZH, xbench-DS
WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search2026/07/09 GitHub starsGLM-4.5, Qwen3-32B, Qwen3.5-35B, Kimi-K2-ThinkingPromptingWeb Search, Local RetrievalMulti-Agent–BrowseComp-Plus, WideSearch, DeepWideSearch, GISA
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment2026/07/08Qwen3.5-9B-InstructSFT (self-distillation), GRPOWeb Search, Local RetrievalSingle-AgentDeepSearch-World (420K multi-hop Wikipedia QA)BrowseComp, BrowseComp-ZH, HLE, GAIA, xbench, HotpotQA, SearchQA, DeepSearch-Val
VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning2026/07/03 GitHub starsQwen3-VL-8B-InstructSFT, BiSPOWeb SearchSingle-AgentFVQA, DeepEyes, DeepEyesV2VideoSearch-QA, VideoDR, MMSearch, HR-MMSearch, FVQA, InfoSeek, SimpleVQA, LiveVQA, MMVU, TempCompass, VideoMMMU, VideoMathQA
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent2026/06/29 GitHub starsQwen3.5-35B-A3BSFT, GRPO, On-Policy DistillationWeb SearchSingle-AgentMLE-Dojo, Kaggle, NemotronSEAL-0, IFBench, BrowseComp, GAIA, SciCode, MLE-Bench-Lite, HLE, HiPhO, FrontierScience-Olympiad, LongBench V2, IFEval, τ²-Bench, VitaBench, MatTools, MolBench-Bind
RΒ²-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search2026/06/26 GitHub starsQwen2.5-3B-Base, Qwen2.5-7B, Qwen3-4BSFT, RL (RΒ²PO)Local RetrievalSingle-AgentHotpotQA, NQNQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle
ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep Research2026/06/18Qwen3-32B, DeepSeek-V3.2PromptingWeb SearchMulti-Agent–DeepResearch Bench, DeepResearch Gym
DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents2026/06/15Qwen3-8BSFT, GRPOWeb Search, Local RetrievalSingle-AgentDeepRubric (9K query-rubric pairs), Wikipedia, OpenScholarAstaBench-ScholarQA-CS2, ResearchQA, DeepResearch Bench
S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research Agents2026/06/13Qwen3-32BSFTWeb SearchSingle-AgentS1-DeepResearch-15KGAIA, BrowseComp, xBench-DeepSearch, HLE, DeepResearch Bench, DeepResearch Bench II, ComplexBench, GTA
Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals2026/06/09Qwen2.5-7B-Instruct, Qwen3-8BPPO, GRPO, SFT, LoRALocal RetrievalMulti-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle
Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training2026/06/09 GitHub starsQwen3-1.7B, Qwen3-4BSFT, GRPO, DAPOLocal RetrievalSingle-AgentSynthetic queries (DeepResearchGym/ClueWeb22)2WikiMultiHopQA, Bamboogle, HotpotQA, MuSiQue, Natural Questions, PopQA, TriviaQA, GAIA, HLE, WebWalkerQA
SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research2026/06/08 GitHub starsTongyi DeepResearch-30B-A3B, Qwen3-30B-A3B-Thinking-2507SFTWeb SearchMulti-Agent–BrowseComp, BrowseComp-ZH, GAIA, xbench-DeepSearch-2505
SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating2026/06/05 GitHub starsTongyi-DeepResearch-30B, Qwen3-30B-A3B-Instruct-2507SFT, GRPOWeb SearchSingle-AgentASearcher, TaskCraft, WebWalker, WebVoyager, WebShaper, REDSearcher, WebDancer, MegaScienceGAIA, BrowseComp, xbench-DeepSearch, HLE
Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking2026/06/05GPT-5, GPT-4.1, GPT-4o, Gemini-2.5-Pro, Gemini-2.5-FlashPrompting (training-free)Web SearchSingle-Agent–MM-BrowseComp, HLE-VL, BrowseComp-VL
Self-Evolving Deep Research via Joint Generation and Evaluation2026/06/03Qwen2.5-7B-Instruct, Qwen2.5-72B-Instruct, Llama-3.1-8B-InstructGRPO, REINFORCELocal Retrieval, Web SearchSingle-AgentReddit-derived query setDeepResearch Bench, DeepResearchEval
Deep Research as Rubric for Reinforcement Learning2026/05/31 GitHub starsQwen3-8B, Qwen3-14B, Qwen3-30B-A3BSFT, GRPOLocal RetrievalSingle-AgentResearchQA, RaR-Science, HealthBench, RaR-MedicineResearchQA, DeepResearchBench, LocalSearchBench, GPQA, MMLU-Pro, MMLU
SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search2026/05/28 GitHub starsQwen2.5-3B-Instruct, Qwen2.5-7B-Instruct, Qwen3-4B-InstructGRPOLocal RetrievalSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle
VeriTrace: Evolving Mental Models for Deep Research Agents2026/05/25Qwen3.5-27B, DeepSeekPrompting–––DeepResearch Bench, DeepConsult
QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks2026/05/22 GitHub starsQwen3.5-35B-A3B, Qwen3-30B-A3BMid-training, SFT, RLWeb SearchSingle-AgentSynthetic tasks (rubric trees)BrowseComp, Mind2Web 2, HLE, BrowseComp-Plus, WideSearch, GAIA, DeepResearch Bench, LiveResearchBench
Argus: Evidence Assembly for Scalable Deep Research Agents2026/05/15Qwen3.5-35B-A3BSFT, GRPOWeb SearchMulti-Agent–BrowseComp, BrowseComp-ZH, GAIA, SEAL-0, xbench-DeepSearch-2510, HLE, FrontierScience-Olympiad, FrontierScience-Research
GRASP: Graph Agentic Search over Propositions for Multi-hop Question Answering2026/05/15Gemini-3-Flash-PreviewPromptingLocal RetrievalMulti-Agent–MuSiQue, 2WikiMultihopQA, HotpotQA, LongBench
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG2026/05/12 GitHub starsQwen2.5-3B, Qwen2.5-7B, Llama-3.2-3B-BaseGRPOLocal Retrieval, Web SearchSingle-Agent–NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle
Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?2026/05/11 GitHub starsgpt-5.5PromptingLocal RetrievalSingle-Agent–BrowseComp-Plus
LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG2026/05/07Qwen2.5-3B, Qwen2.5-7BSFTLocal RetrievalSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle
LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents2026/05/06 GitHub starsQwen3-30B-A3BSFTWeb SearchSingle-AgentOpenSeekerBrowseComp, BrowseComp-ZH, xbench-2505, GAIA-text
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories2026/05/05 GitHub starsQwen3-30B-A3B-Thinking-2507SFT–Single-Agent–BrowseComp, BrowseComp-ZH, HLE, xbench-DeepSearch
SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning2026/05/02Qwen3-8BSFT, GRPOWeb SearchMulti-AgentSciResearcherQA, TRQA, SciBenchHLE-Bio/Chem-Gold, SuperGPQA-Hard-Biology, TRQA-Literature
DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data2026/04/21 GitHub starsQwen3-4B-Thinking-2507SFT, RL (IGPO)Web SearchSingle-AgentREDSearcherBrowseComp, BrowseComp-ZH, GAIA, xbench-DeepSearch, DeepSearchQA
LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent2026/04/20 GitHub starsQwen3-4B-Thinking-2507SFT, GRPOLocal RetrievalSingle-AgentMiroRL, ASearcher, TaskCraftGAIA, BrowseComp, HLE, Frames, WebWalker, Seal-0, Xbench-DeepSearch
CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search2026/04/19 GitHub starsQwen2.5-7B-Instruct, Qwen2.5-3B-InstructGRPOLocal RetrievalSingle-AgentSearch-R1 training setNQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle
Mind DeepResearch Technical Report2026/04/16Qwen3-32B, Qwen3-30B-A3BSFT, GRPO, GSPO, DAPO, DPOWeb Search, Local RetrievalMulti-Agent–BrowseComp, BrowseComp-ZH, xbench-DS, GAIA-DS, WideSearch, DeepResearch Bench, MindDR Bench
Towards Long-horizon Agentic Multimodal Search2026/04/14 GitHub starsQwen3-VL-Thinking-30A3B, MiroThinker-1.7-miniSFT, Model MergingWeb SearchSingle-AgentFVQA, LiveVQA, REDSearcher-MM, REDSearcher-TextMM-BrowseComp, MMSearch-Plus, VisBrowse, MMSearch
EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning Tools2026/04/09 GitHub starsGPT-4.1-mini, GPT-4.1, GPT-5.1, Minimax M2.5PromptingWeb SearchMulti-Agent–SimpleQA-Verified, FRAMES, WebWalkerQA, XBench DeepSearch
Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents2026/04/06 GitHub starsQwen3-0.6B, Qwen3-1.7B, Qwen3-4B, Qwen3-8B, Llama-3.2-1B, Llama-3.2-3B, Qwen3-32B (teacher)SFT, Distillation, On-Policy Distillation, Rejection Fine-TuningLocal RetrievalSingle-AgentHotpotQAHotpotQA, 2WikiMultihopQA, Bamboogle, MuSiQue, BrowseComp-Plus, Frames, LongSeAL
OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search2026/04/04Qwen2.5-7B-Instruct, Qwen2.5-14B-Instruct, Qwen2.5-32B-InstructPPO, RLVRLocal RetrievalSingle-AgentHotpotQA, 2WikiMultihopQANQ, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle
InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information Seeking2026/04/03 GitHub starsGPT-5.1, GPT-5-miniPromptingWeb SearchMulti-Agent–WideSearch, BrowseComp-ZH
CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery2026/04/02 GitHub starsClaude (agent backbone)Evolutionary Search (heartbeat-guided)–Multi-Agent–10 math/algorithmic/systems benchmarks (incl. Anthropic kernel-engineering)
Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design2026/03/30 GitHub starsQwen3-8BSFT, GRPOWeb SearchSingle-Agent2WikiMultihopQA, BeerQA, ASearcher, DeepDive, synthesized QA (12K)BrowseComp, BrowseComp-ZH, GAIA, xBench-DeepSearch, WebWalkerQA, DeepSearchQA
Gen-Searcher: Reinforcing Agentic Search for Image Generation2026/03/30 GitHub starsQwen-ImageSFT, GRPOWeb SearchSingle-AgentGen-Searcher-SFT-10k, Gen-Searcher-RL-6kKnowGen, WISE
OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis2026/03/17 GitHub starsNVIDIA-Nemotron-3-Nano-30B-A3B-Base, GPT-OSS-120B (teacher)SFTLocal RetrievalSingle-AgentMiroVerse-v0.1 (97K synthesized trajectories)BrowseComp-Plus, BrowseComp, GAIA, xbench-DeepSearch
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data2026/03/16 GitHub starsQwen3-30B-A3B-Thinking-2507SFT–Single-AgentOpenSeeker-v1-DataBrowseComp, BrowseComp-ZH, xbench-DeepSearch, WideSearch
Meta-Reinforcement Learning with Self-Reflection for Agentic Search2026/03/11 GitHub starsQwen2.5-3B-Base, Qwen2.5-7B-BaseMeta-RL, RLOOLocal RetrievalSingle-AgentNQ, HotpotQA, ASearcherNQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, ASearcher
UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking2026/03/09PanGu-38B, Qwen3-32BSFT, RFTWeb SearchMulti-Agent–UIS-QA, GAIA, BrowseComp-zh, FinSearchComp
SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic Plans2026/03/09 GitHub starsQwen3-8B, Qwen3-4B, Qwen3-32BSFT, GRPOWeb SearchSingle-AgentHotpotQA, 2WikiMultihopQA, MuSiQue, MultiHop-RAG, SuperGPQA, WebWalker-SilverHotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle, GPQA, WebWalkerQA, GAIA
AgentIR: Reasoning-Aware Retrieval for Deep Research Agents2026/03/04Qwen3-Embedding-4B, Tongyi-DeepResearch, gpt-oss-120B, GLM-4.7Contrastive Learning, LoRALocal RetrievalSingle-AgentDR-Synth, WebShaperBrowseComp-Plus
MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline2026/03/01 GitHub starsQwen2.5-VL-7B-Instruct, Qwen3-VL-8B-Instruct, Qwen3-VL-32B-InstructSFT, GRPOWeb Search, Local RetrievalSingle-AgentHyper-Search-3K, DR-TTS-10K, InfoSeek, FVQASimpleVQA, MMSearch, LiveVQA, FVQA, InfoSeek, BrowseComp-VL
DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent2026/03/01 GitHub starsQwen2.5-3B, Llama3.2-3BSFT, PPO, GRPOWeb Search, Local RetrievalSingle-AgentDeepResearch-9KDeepResearch-9K, BrowseComp-Plus
ProductResearch: Training E-Commerce Deep Research Agents via Multi-Agent Synthetic Trajectory Distillation2026/02/27Qwen3-30B-A3B-Thinking-2507SFTWeb Search, Local RetrievalMulti-AgentProductResearch synthetic trajectories (e-commerce user logs)ProductResearch held-out test set
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization2026/02/26 GitHub starsQwen3-30B-A3B-Instruct-2507SFT, RL (RLOO)Web SearchSingle-AgentSMTL-Dataset, TaskCraftBrowseComp, GAIA, xbench-DeepSearch, WebWalkerQA, FRAMES, SEAL-0, DeepResearch Bench
MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks2026/02/26 GitHub starsGPT-5, Claude 3.7 Sonnet, MiroThinker v1.0-72BPromptingWeb SearchMulti-Agent–GAIA, BrowseComp-EN, BrowseComp-ZH, HLE, xBench-DeepSearch, FutureX
How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R12026/02/23Qwen2.5-7B, Qwen2.5-3BREINFORCE, PPO, GRPOLocal RetrievalSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle
W&D:Scaling Parallel Tool Calling for Efficient Deep Research Agents2026/02/07GPT-5, Gemini 3.0 Pro, Claude 4.5 Sonnet, DeepSeek-V3.2, Qwen3-235BPromptingWeb SearchSingle-Agent–BrowseComp, HLE, GAIA
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research2026/02/06 GitHub starsMiniCPM4.1-8BSFT, RLLocal RetrievalSingle-Agent–DeepResearch Bench, DeepConsult, DeepResearch Gym
RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents2026/02/02 GitHub starsQwen3-4B-Instruct, Tongyi-DeepResearch-30B-A3B, GLM-4.7, GPT-5, o3, Claude-4.5-Sonnet, DeepSeek-V3.2Prompting, SFTWeb SearchSingle-Agent–BrowseComp, BrowseComp-ZH, GAIA, XBench, HLE
Yunque DeepResearch Technical Report2026/01/27 GitHub starsGemini-3-Pro, DeepSeek-V3.2, Kimi K2 ThinkingPromptingWeb SearchMulti-Agent–GAIA, BrowseComp, BrowseComp-ZH, HLE
OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents2026/01/26 GitHub starsOffSeeker-8BSFT, DPOWeb SearchSingle-AgentDeepForge synthetic data (66k QA pairs, 33k SFT trajectories, 21k DPO pairs)GAIA, BrowseComp-en, BrowseComp-zh, HLE, XBench-DeepSearch, WebWalkerQA
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification2026/01/22 GitHub starsClaude-3.7-Sonnet, Claude-3.5-Sonnet, GPT-4.1, Qwen3-8BSFT, Test-Time VerificationWeb SearchMulti-AgentDeepVerifier-4K, WebAggregatorQAGAIA, XBench-DeepSearch, BrowseComp
Agentic-R: Learning to Retrieve for Agentic Search2026/01/17 GitHub starsQwen2.5-7B-Base, E5-base-v2, Qwen2.5-72B-InstructPPO, Contrastive LearningLocal RetrievalSingle-AgentHotpotQA, TriviaQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle
ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking Agents2026/01/17Qwen2.5-7B-Instruct, Qwen2.5-32B-Instruct, Qwen3-14B, Qwen3-32B, DeepSeek-v3.2, GPT-OSS-120BPrompting, SFTWeb SearchSingle-Agent–HotpotQA, GAIA, xbench-DeepSearch, BrowseComp, BrowseComp-ZH
Dr. Zero: Self-Evolving Search Agents without Training Data2026/01/11 GitHub starsQwen2.5-3B-Instruct, Qwen2.5-7B-InstructHRPOWeb SearchMulti-Agent–NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA (2WikiMQA), MuSiQue, Bamboogle
Over-Searching in Search-Augmented Large Language Models2026/01/09 GitHub starsFrontier + Open-source LLMsPrompting (Evaluation & Mitigation)Web Search, Local RetrievalSingle-Agent–OverSearchQA
LEAPS: An LLM-Empowered Adaptive Plugin for Taobao AI Search2026/01/09Qwen3-14BREINFORCE++, GRPO, GSPOLocal RetrievalSingle-Agent––
SmartSearch: Process Reward-Guided Query Refinement for Search Agents2026/01/08 GitHub starsQwen2.5-3B-InstructSFT, DPO, GRPOWeb SearchSingle-AgentAsearcher-Base2WikiMultihopQA, HotpotQA, Bamboogle, MuSiQue, GAIA, WebWalker
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL2026/01/07 GitHub starsQwen-2.5-72B-InstructGRPOWeb SearchMulti-AgentZhihu-KOL, WideSearch, ELI5DeepResearch Bench, DeepResearchGym
WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning2026/01/06WebSailor-3B/7B, Tongyi-DR-30B, Qwen-2.5-72BGRPOLocal RetrievalSingle-Agent–BrowseComp-en, BrowseComp-zh, XBench-DeepSearch, GAIA
Budget-Aware Tool-Use Enables Effective Agent Scaling2025/11/21Gemini-2.5-Flash, Gemini-2.5-Pro, Claude-Sonnet-4PromptingWeb SearchSingle-Agent––
AutoTool: Efficient Tool Selection for Large Language Model Agents2025/11/18 GitHub starsLlama4-Scout-17BPromptingWeb SearchSingle-Agent–AlfWorld, ScienceWorld, ToolQuery-Academia
Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO2025/11/17 GitHub starsQwen3-30B-A3BM-GRPOWeb SearchMulti-Agent–GAIA, XBench-DeepSearch, WebWalkerQA
ToolScope: An Agentic Framework for Vision-Guided and Long-Horizon Tool Use2025/10/31GPT-4o, Gemini-2.5, Qwen2.5-VL, Llama-3.2-VisionPromptingLocal RetrievalMulti-Agent––
TOOLRM: Towards Agentic Tool-Use Reward Modeling2025/10/30 GitHub starsQwen3-4B, Qwen3-8BRLWeb SearchSingle-AgentToolPref-Pairwise-30KTRBench, ACEBench
Tongyi DeepResearch Technical Report2025/10/28 GitHub starsQwen3-30B-A3B-BaseSFT, RLWeb SearchSingle-Agent–HLE, BrowseComp, BrowseComp-ZH, GAIA, XBench-DeepSearch, WebWalkerQA, FRAMES, XBench-DeepSearch-2510
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection2025/10/21 GitHub starsQwen-2.5-14B, Qwen-3-14BRL (cold start + RL; self-reflection)Web SearchSingle-Agent–HotpotQA, SimpleQA
Enterprise Deep Research: Steerable MultiAgent Deep Research for Enterprise Analytics2025/10/20 GitHub stars–PromptingWeb SearchMulti-Agent–DeepResearch Bench, DeepConsult
Stop-RAG: Value-Based Retrieval Control for Iterative RAG2025/10/16 GitHub starsLlama-3.1-8B-InstructFine-tuningLocal RetrievalSingle-AgentMuSiQue, HotpotQA, 2WikiMultihopQAHotpotQA, MuSiQue, 2WikiMultihopQA
Towards Agentic Self-Learning LLMs in Search Environment2025/10/16 GitHub starsQwen-2.5-7B-InstructRLWeb SearchMulti-Agent–NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle
GOAT: A Training Framework for Goal-Oriented Agent with Tools2025/10/14Qwen-2-7B, Llama-3-8B-Instruct, Llama-3-70B-InstructFine-tuningWeb SearchSingle-Agent–GOATBench
ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents2025/10/14 GitHub starsgpt-4.1, gpt-4.1-mini, o4-mini, Llama-3.3-70BPromptingWeb SearchSingle-Agent–GAIA
HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation2025/10/09 GitHub starsQwen2.5-3B-Instruct, Qwen2.5-7B-Instruct, Llama-3.2-3B-InstructPPO, GRPOWeb SearchSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2Wiki, MuSiQue, Bamboogle
A2SEARCH: Ambiguity-Aware Question Answering with Reinforcement Learning2025/10/09 GitHub starsQwen-2.5 familyRLWeb SearchSingle-AgentNQMuSiQue, HotpotQA, 2Wiki, Bamboogle, NQ, TriviaQA, PopQA, AmbigQA
ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards2025/10/01Qwen2.5-7B-Instruct, Qwen2.5-3B-InstructGRPOWeb Search, Local RetrievalSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMQA, MuSiQue, Bamboogle, FictionalHot
Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents2025/09/17Qwen3-8B, Qwen2.5-Omni-7BRLLocal RetrievalSingle-AgentΟ„-bench, APIGen-MTΟ„-bench
ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization2025/09/16 GitHub starsQwen3-30B-A3B-ThinkingGRPO, SFTWeb SearchSingle-AgentSailorFog-QABrowseComp-en/zh
WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research2025/09/16 GitHub starsQwen3-30B-A3B-InstructSFTWeb SearchSingle-AgentWebWeaver-3kBrowseComp-en/zh, GAIA, XBench-DeepSearch
WebResearcher: Unleashing Unbounded Reasoning Capability in Long-Horizon Agents2025/09/16 GitHub starsQwen3-30B-A3BRFT, RLWeb SearchMulti-AgentWebFrontierBrowseComp-en/zh, GAIA, WebWalkerQA, FRAMES, HotpotQA, MuSiQue, 2WikiMultiHopQA
WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable RL2025/09/16 GitHub starsQwen3-30B-A3BSFT, RLWeb Search, Local RetrievalSingle-AgentSailorFog-QA-V2BrowseComp-EN, BrowseComp-ZH, HLE
WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents2025/09/08 GitHub starsQwen3-8BGRPO, SFTWeb SearchSingle-AgentWebExplorer-QABrowseComp-en/zh, GAIA, WebWalkerQA, FRAMES, XBench-DeepSearch, HLE
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward2025/08/18 GitHub starsQwen2.5-7BRL(GRPO)Web SearchSingle-AgentNQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAGBamboogle, NQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAG
MMSearch-R1: Incentivizing LMMs to Search2025/06/25 GitHub starsQwen2.5-VL-7BRL(GRPO)Web SearchSingle-AgentVQA, MetaClip, FVQA, InfoSeekFVQA-test, InfoSeek, MMSearch, SimpleVQA, LiveVQA
VideoDeepResearch: Long Video Understanding With Agentic Tool Using2025/06/12 GitHub starsGPT-4o, Gemini1.5-pro, Qwen2.5-VL-72B-InstructPromptingLocal RetrievalMulti-Agent–MLVU, Video-MME, LVBench, LongVideoBench
Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework2025/06/03Claude3.7-Sonnet, GPT-4o-mini, Qwen3-235B-A22B, Qwen2.5-VL-72B-InstructPromptingWeb SearchMulti-Agent–Pew Research, Our World in Data, Open Knowledge Foundation
RAG-Gym: Systematic Optimization of Language Agents for Retrieval-Augmented Generation2025/05/31 GitHub starsLlama3.1-8B-Instruct, Qwen2.5-7B-Instruct, GPT-4o-miniSFT, RL(PPO, DPO)Local RetrievalSingle-AgentHotpotQA, MedQAHotpotQA, 2Wiki, Bamboogle, MedQA
MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability2025/05/27 GitHub starsLlama3.1-8B, Llama3.2-3B, Llama3.2-1B, Llama3, Qwen2.5-7B, Qwen2.5-3B, Qwen2.5-1.5B, Qwen2.5SFT, RL(DAPO)Local RetrievalMulti-AgentHotpotQAHotpotQA, FanoutQA, Musique, 2WikiMultiHopQA, Bamboogle, FreshQA
SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesis2025/05/25 GitHub starsQwen2.5-7B-Instruct, Qwen2.5-32B-Instruct, DeepseekDistilled-Qwen2.5-32B, QwQ-32BSFTWeb SearchSingle-AgentNQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAGBamboogle, FRAMES, GAIA, NQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAG
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning2025/05/22 GitHub starsQwen2.5-3B, Llama3.1-8BSFT, RL(M-GRPO)Web SearchSingle-AgentWebArena-Lite, WebArenaWebArena-Lite, WebArena
R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning2025/05/22 GitHub starsQwen2.5-7B-InstructSFT, RLLocal RetrievalSingle-AgentHotpotQA, 2WikiMultiHopQAHotpotQA, 2WikiMultiHopQA, Musique, Bamboogle
Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning2025/05/22 GitHub starsQwen2.5-7B-InstructRL(DPO)Local RetrievalSingle-AgentPopQA, HotpotQA, 2WikiMultihopQAPopQA, HotpotQA, 2WikiMultiHopQA, Bamboogle, MuSiQue
s3 - Efficient Yet Effective Search Agent Training via RL2025/05/20 GitHub starsQwen2.5-7B-InstructRL(PPO)Local RetrievalSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2wiki, Musique, MedQA-US, MedMCQA, PubMedQA, BioASQ-Y/N, MMLU-Med
Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents2025/05/17 GitHub starsQwen2.5-14B, Qwen2.5-7BPromptingLocal RetrievalSingle-Agent–Musique, NQ, 2WikiMultiHopQA, HotpotQA, Bamboogle, StrategyQA
Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search Agent2025/05/12 GitHub starsQwen2.5-3B-Instruct, Qwen2.5-7B-InstructRL(GRPO)Local RetrievalSingle-AgentNQ, HotpotQAPopQA, 2WikiMultihopQA
ZeroSearch: Incentivize the Search Capability of LLMs without Searching2025/05/07 GitHub starsQwen2.5-3B-Base, Qwen2.5-7B-Base, Qwen2.5-7B-Instruct, Qwen2.5-3B-Instruct, Llama3.2-3B-Instruct, Llama3.2-3B-BaseRL(Reinforce, GRPO, PPO)Web SearchSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle
Webthinker: Empowering large reasoning models with deep research capability2025/04/30 GitHub starsGPT-o1, GPT-o3, Deepseek-R1, QwQ-32B, Qwen2.5-32B-InstructRL(DPO)Web SearchSingle-AgentSuperGPQA, WebWalkerQA, OpenThoughts, NaturalReasoning, NuminaMathGPQA, GAIA, WebWalkerQA, Humanity’s Last Exam
Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs2025/04/11 GitHub starsPangu Ultra-135BSFT, RLLocal RetrievalSingle-Agent––
Open Deep Search: Democratizing Search with Open-source Reasoning Agents2025/03/26 GitHub starsLlama3.1-70B, Deepseek-R1PromptingWeb SearchSingle-Agent–SimpleQA, FRAME
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments2025/03/26 GitHub starsQwen2.5-7B-InstructRL(GRPO)Web SearchMulti-AgentNQ, TQ, HotpotQA, 2WikiMultiHopQAMuSiQue, Bamboogle, PopQA, NQ, TQ, HotpotQA, 2WikiMultiHopQA
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning2025/03/25 GitHub starsQwen2.5-7B-Instruct, Qwen2.5-32B-InstructRL(GRPO)Web SearchSingle-AgentMuSiQueHotpotQA, 2WikiMultiHopQA, Musique, Bamboogle
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning2025/03/12 GitHub starsQwen2.5-7B-Instruct, Qwen2.5-7B-Base, Qwen2.5-3B-Instruct, Qwen2.5-3B-BaseRL(PPO, GRPO)Web SearchSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle
Beyond Outlining: Heterogeneous Recursive Planning for Adaptive Long-form Writing with Language Models2025/03/11 GitHub starsGPT-4o, Claude3.5-SonnetPromptingWeb SearchMulti-Agent–TELL ME A STORY, WildSeek
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning2025/03/07 GitHub starsQwen2.5-7B-Base, Llama3.1-8B-InstructSFT, RL(GRPO, Reinforce++)Web Search, Local RetrievalSingle-AgentHotpotQA, 2WikiMultiHopQAHotpotQA, 2WikiMultiHopQA, Musique, Bamboogle
AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents2025/02/18 GitHub starsClaude3.5-SonnetPromptingWeb SearchMulti-Agent–GAIA
Agentic Reasoning: Reasoning LLMs with Tools for the Deep Research2025/02/07 GitHub starsN/APromptingWeb SearchMulti-Agent–GPQA
Search-o1: Agentic Search-Enhanced Large Reasoning Models2025/01/09 GitHub starsQwQ-32B-PreviewPromptingWeb SearchSingle-Agent–GPQA, MATH500, AMC2023, AIME2024, LiveCodeBench, NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle

Benchmarks and Applications

Benchmarks Plot

  • REFUTE: Benchmark for scientific critique and epistemic calibration on recent (2025–2026) science summaries, separating critique skill from calibrated truthfulness [Report] [Data] [Leaderboard]
  • Humanity's Last Exam [Paper] [Code] GitHub Repo stars
  • BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents [Paper] [Code] GitHub Repo stars
  • BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese '[Paper]' [Code] GitHub Repo stars
  • DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents [Paper] [Code] GitHub Repo stars
  • MedBrowseComp: Benchmarking Medical Deep Research and Computer Use [Paper] [Code] GitHub Repo stars
  • Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge [Paper] [Code] GitHub Repo stars
  • PerspectiveGap: A Benchmark for Multi-Agent Orchestration Prompting [Paper] [Code] GitHub Repo stars
  • Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus [Paper] [Code] GitHub Repo stars
  • GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces [Paper] [Code] GitHub Repo stars
  • MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments [Paper] [Code] GitHub Repo stars
  • DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math? [Paper]
  • LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know? [Paper] [Code]
  • MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents [Paper] [Code] GitHub Repo stars
  • EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge [Paper] [Code]
  • AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery [Paper] [Code] GitHub Repo stars
  • Total Recall QA: A Verifiable Evaluation Suite for Deep Research Agents [Paper] [Code] GitHub Repo stars
  • TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents [Paper]
  • LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling [Paper] [Code]
  • SeekerGym: A Benchmark for Reliable Information Seeking [Paper]
  • DRΒ³-Eval: Towards Realistic and Reproducible Deep Research Evaluation [Paper] [Code] GitHub Repo stars
  • MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome [Paper] [Code] GitHub Repo stars
  • BrowseComp-VΒ³: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents [Paper] [Code] GitHub Repo stars
  • DeepStress: Stress-Testing Deep Search Agents [Paper]
  • DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [Paper]
  • Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark [Paper] [Code] GitHub Repo stars

Contributing and Citations

🀝 We welcome contributions to expand this comprehensive collection of Agentic Deep Research resources!

πŸ“ How to Contribute

Adding New Research Papers and Benchmarks:

  • Submit an issue with the paper details (title, arXiv link, all the categories in our paper table, and GitHub repo if available)
  • Or create a pull request with the paper added to the research papers table or the benchmarks section

Adding New Open-Source Implementations and New Products:

  • Submit an issue with the repository details (name, description, release data, GitHub link if available)
  • Or create a pull request with the implementation added to the open-source and products section

πŸ“– Citation

πŸ”₯πŸ”₯πŸ”₯ If you find this repository useful, please cite our papers:

@article{zhang2025web,
  title={From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents},
  author={Zhang, Weizhi and Li, Yangning and Bei, Yuanchen and Luo, Junyu and Wan, Guancheng and Yang, Liangwei and Xie, Chenxuan and Yang, Yuyao and Huang, Wei-Chieh and Miao, Chunyu and others},
  journal={arXiv preprint arXiv:2506.18959},
  year={2025}
}

@article{li2025towards,
  title={Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems in LLMs},
  author={Li, Yangning and Zhang, Weizhi and Yang, Yuyao and Huang, Wei-Chieh and Wu, Yaozu and Luo, Junyu and Bei, Yuanchen and Zou, Henry Peng and Luo, Xiao and Zhao, Yusheng and others},
  journal={arXiv preprint arXiv:2507.09477},
  year={2025}
}
agentic-ai
agentic-rag
deep-research
deep-research-agent
large-language-models
llms
rag
reasoning
reasoning-agent
search-agent

Contributors

DavidZWZ

71 commits

Jasonya

10 commits

doctadg

1 commits

DavidZWZ/Awesome-Deep-Research

[ACL 2026 KnowFM] Awesome Agentic Deep Research Resources

867

89 commits

updated Jul 23, 2026

See the code

README

πŸ€– Awesome Agentic Deep Research Resources

Awesome arXiv Maintenance Contribution Welcome Code

Oryx Video-ChatGPT

Welcome to Awesome-Deep-Research! πŸš€ This repository serves as your comprehensive guide to the cutting-edge world of Agentic Deep Research. We've meticulously curated a collection of resources for you.

DeepResearch Framework

Whether you're a researcher, developer, or enthusiast, this repository is your gateway to exploring the fascinating intersection of artificial intelligence and autonomous agents. For a detailed analysis of the changing paradigm in information search, check out our position paper: From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents πŸ“„, which outlines existing domain trends and future directions. For researchers interested in the broader intersection of RAG and Reasoning, we also recommend exploring our comprehensive collection at Awesome-RAG-Reasoning πŸ”₯πŸ”₯πŸ”₯.

Table of Contents

Industry-Leading Products

  • Gemini Deep Research: Google's advanced research assistant for deep analysis (December 11, 2024)
  • Deep Research: OpenAI's deep research platform [API Guide] (February 2, 2025)
  • Perplexity Deep Research: Perplexity's product for in-depth research and analysis (February 14, 2025)
  • Grok Agents: xAI's autonomous DeepSearch agents powered by Grok-3 (February 19, 2025)
  • Copilot Researcher: Researcher and Analyst in Microsoft 365 Copilot (March 25, 2025)
  • Research: Anthropic's research platform to find and reason with information (April 15, 2025)
  • Manus: Advanced research and analysis platform (March 6, 2025)
  • 🦌 DeerFlow: ByteDance's research and analysis solution (May 9, 2025)
  • Deep Research: Alibaba's Qwen-powered research assistant (May 14, 2025)
  • Kimi-Researcher: Moonshot's research assistant powered by Kimi (June 20, 2025)
  • Not Human Search: Search engine for AI agents. Available as MCP server for tool discovery.
  • SearchHive: API platform for web scraping, search, and AI-powered deep research.

Open-Source Implementations

Latest Research Papers

πŸ”₯πŸ”₯πŸ”₯ This section showcases the most recent and impactful research papers in the field of Agentic Deep Research. Each paper represents a significant advancement in the development of autonomous research agents, search capabilities, and reasoning frameworks. The papers are organized chronologically, with the most recent publications at the top. Key areas covered include:

  • πŸ€– Agentic frameworks for deep research
  • πŸ” Search-enhanced reasoning models
  • 🌐 Web agents for deep research
  • πŸ”„ Reasoning and retrieval-augmented generation
  • πŸ“Š Multimodal deep research

πŸš€πŸš€πŸš€ Stay tuned for the hottest breakthroughs in the field!

TitleDate & CodeBase modelOptimizationSearch EngineAgent ArchitectureTraining DatasetEvaluation Dataset
STAMP: Provenance-Guided Credit Assignment for Deep Search Agents2026/07/13Qwen3-30B-A3B-Thinking-2507SFT, GRPOWeb SearchSingle-AgentSynthesized bilingual Wikipedia QA (3K SFT, 2.6K RL)BrowseComp, BrowseComp-ZH, xbench-DS
WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search2026/07/09 GitHub starsGLM-4.5, Qwen3-32B, Qwen3.5-35B, Kimi-K2-ThinkingPromptingWeb Search, Local RetrievalMulti-Agent–BrowseComp-Plus, WideSearch, DeepWideSearch, GISA
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment2026/07/08Qwen3.5-9B-InstructSFT (self-distillation), GRPOWeb Search, Local RetrievalSingle-AgentDeepSearch-World (420K multi-hop Wikipedia QA)BrowseComp, BrowseComp-ZH, HLE, GAIA, xbench, HotpotQA, SearchQA, DeepSearch-Val
VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning2026/07/03 GitHub starsQwen3-VL-8B-InstructSFT, BiSPOWeb SearchSingle-AgentFVQA, DeepEyes, DeepEyesV2VideoSearch-QA, VideoDR, MMSearch, HR-MMSearch, FVQA, InfoSeek, SimpleVQA, LiveVQA, MMVU, TempCompass, VideoMMMU, VideoMathQA
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent2026/06/29 GitHub starsQwen3.5-35B-A3BSFT, GRPO, On-Policy DistillationWeb SearchSingle-AgentMLE-Dojo, Kaggle, NemotronSEAL-0, IFBench, BrowseComp, GAIA, SciCode, MLE-Bench-Lite, HLE, HiPhO, FrontierScience-Olympiad, LongBench V2, IFEval, τ²-Bench, VitaBench, MatTools, MolBench-Bind
RΒ²-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search2026/06/26 GitHub starsQwen2.5-3B-Base, Qwen2.5-7B, Qwen3-4BSFT, RL (RΒ²PO)Local RetrievalSingle-AgentHotpotQA, NQNQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle
ScaffoldAgent: Utility-Guided Dynamic Outline Optimization for Open-Ended Deep Research2026/06/18Qwen3-32B, DeepSeek-V3.2PromptingWeb SearchMulti-Agent–DeepResearch Bench, DeepResearch Gym
DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents2026/06/15Qwen3-8BSFT, GRPOWeb Search, Local RetrievalSingle-AgentDeepRubric (9K query-rubric pairs), Wikipedia, OpenScholarAstaBench-ScholarQA-CS2, ResearchQA, DeepResearch Bench
S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research Agents2026/06/13Qwen3-32BSFTWeb SearchSingle-AgentS1-DeepResearch-15KGAIA, BrowseComp, xBench-DeepSearch, HLE, DeepResearch Bench, DeepResearch Bench II, ComplexBench, GTA
Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals2026/06/09Qwen2.5-7B-Instruct, Qwen3-8BPPO, GRPO, SFT, LoRALocal RetrievalMulti-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle
Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training2026/06/09 GitHub starsQwen3-1.7B, Qwen3-4BSFT, GRPO, DAPOLocal RetrievalSingle-AgentSynthetic queries (DeepResearchGym/ClueWeb22)2WikiMultiHopQA, Bamboogle, HotpotQA, MuSiQue, Natural Questions, PopQA, TriviaQA, GAIA, HLE, WebWalkerQA
SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research2026/06/08 GitHub starsTongyi DeepResearch-30B-A3B, Qwen3-30B-A3B-Thinking-2507SFTWeb SearchMulti-Agent–BrowseComp, BrowseComp-ZH, GAIA, xbench-DeepSearch-2505
SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating2026/06/05 GitHub starsTongyi-DeepResearch-30B, Qwen3-30B-A3B-Instruct-2507SFT, GRPOWeb SearchSingle-AgentASearcher, TaskCraft, WebWalker, WebVoyager, WebShaper, REDSearcher, WebDancer, MegaScienceGAIA, BrowseComp, xbench-DeepSearch, HLE
Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking2026/06/05GPT-5, GPT-4.1, GPT-4o, Gemini-2.5-Pro, Gemini-2.5-FlashPrompting (training-free)Web SearchSingle-Agent–MM-BrowseComp, HLE-VL, BrowseComp-VL
Self-Evolving Deep Research via Joint Generation and Evaluation2026/06/03Qwen2.5-7B-Instruct, Qwen2.5-72B-Instruct, Llama-3.1-8B-InstructGRPO, REINFORCELocal Retrieval, Web SearchSingle-AgentReddit-derived query setDeepResearch Bench, DeepResearchEval
Deep Research as Rubric for Reinforcement Learning2026/05/31 GitHub starsQwen3-8B, Qwen3-14B, Qwen3-30B-A3BSFT, GRPOLocal RetrievalSingle-AgentResearchQA, RaR-Science, HealthBench, RaR-MedicineResearchQA, DeepResearchBench, LocalSearchBench, GPQA, MMLU-Pro, MMLU
SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search2026/05/28 GitHub starsQwen2.5-3B-Instruct, Qwen2.5-7B-Instruct, Qwen3-4B-InstructGRPOLocal RetrievalSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle
VeriTrace: Evolving Mental Models for Deep Research Agents2026/05/25Qwen3.5-27B, DeepSeekPrompting–––DeepResearch Bench, DeepConsult
QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks2026/05/22 GitHub starsQwen3.5-35B-A3B, Qwen3-30B-A3BMid-training, SFT, RLWeb SearchSingle-AgentSynthetic tasks (rubric trees)BrowseComp, Mind2Web 2, HLE, BrowseComp-Plus, WideSearch, GAIA, DeepResearch Bench, LiveResearchBench
Argus: Evidence Assembly for Scalable Deep Research Agents2026/05/15Qwen3.5-35B-A3BSFT, GRPOWeb SearchMulti-Agent–BrowseComp, BrowseComp-ZH, GAIA, SEAL-0, xbench-DeepSearch-2510, HLE, FrontierScience-Olympiad, FrontierScience-Research
GRASP: Graph Agentic Search over Propositions for Multi-hop Question Answering2026/05/15Gemini-3-Flash-PreviewPromptingLocal RetrievalMulti-Agent–MuSiQue, 2WikiMultihopQA, HotpotQA, LongBench
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG2026/05/12 GitHub starsQwen2.5-3B, Qwen2.5-7B, Llama-3.2-3B-BaseGRPOLocal Retrieval, Web SearchSingle-Agent–NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle
Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?2026/05/11 GitHub starsgpt-5.5PromptingLocal RetrievalSingle-Agent–BrowseComp-Plus
LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG2026/05/07Qwen2.5-3B, Qwen2.5-7BSFTLocal RetrievalSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle
LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents2026/05/06 GitHub starsQwen3-30B-A3BSFTWeb SearchSingle-AgentOpenSeekerBrowseComp, BrowseComp-ZH, xbench-2505, GAIA-text
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories2026/05/05 GitHub starsQwen3-30B-A3B-Thinking-2507SFT–Single-Agent–BrowseComp, BrowseComp-ZH, HLE, xbench-DeepSearch
SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning2026/05/02Qwen3-8BSFT, GRPOWeb SearchMulti-AgentSciResearcherQA, TRQA, SciBenchHLE-Bio/Chem-Gold, SuperGPQA-Hard-Biology, TRQA-Literature
DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data2026/04/21 GitHub starsQwen3-4B-Thinking-2507SFT, RL (IGPO)Web SearchSingle-AgentREDSearcherBrowseComp, BrowseComp-ZH, GAIA, xbench-DeepSearch, DeepSearchQA
LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent2026/04/20 GitHub starsQwen3-4B-Thinking-2507SFT, GRPOLocal RetrievalSingle-AgentMiroRL, ASearcher, TaskCraftGAIA, BrowseComp, HLE, Frames, WebWalker, Seal-0, Xbench-DeepSearch
CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search2026/04/19 GitHub starsQwen2.5-7B-Instruct, Qwen2.5-3B-InstructGRPOLocal RetrievalSingle-AgentSearch-R1 training setNQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle
Mind DeepResearch Technical Report2026/04/16Qwen3-32B, Qwen3-30B-A3BSFT, GRPO, GSPO, DAPO, DPOWeb Search, Local RetrievalMulti-Agent–BrowseComp, BrowseComp-ZH, xbench-DS, GAIA-DS, WideSearch, DeepResearch Bench, MindDR Bench
Towards Long-horizon Agentic Multimodal Search2026/04/14 GitHub starsQwen3-VL-Thinking-30A3B, MiroThinker-1.7-miniSFT, Model MergingWeb SearchSingle-AgentFVQA, LiveVQA, REDSearcher-MM, REDSearcher-TextMM-BrowseComp, MMSearch-Plus, VisBrowse, MMSearch
EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning Tools2026/04/09 GitHub starsGPT-4.1-mini, GPT-4.1, GPT-5.1, Minimax M2.5PromptingWeb SearchMulti-Agent–SimpleQA-Verified, FRAMES, WebWalkerQA, XBench DeepSearch
Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents2026/04/06 GitHub starsQwen3-0.6B, Qwen3-1.7B, Qwen3-4B, Qwen3-8B, Llama-3.2-1B, Llama-3.2-3B, Qwen3-32B (teacher)SFT, Distillation, On-Policy Distillation, Rejection Fine-TuningLocal RetrievalSingle-AgentHotpotQAHotpotQA, 2WikiMultihopQA, Bamboogle, MuSiQue, BrowseComp-Plus, Frames, LongSeAL
OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search2026/04/04Qwen2.5-7B-Instruct, Qwen2.5-14B-Instruct, Qwen2.5-32B-InstructPPO, RLVRLocal RetrievalSingle-AgentHotpotQA, 2WikiMultihopQANQ, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle
InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information Seeking2026/04/03 GitHub starsGPT-5.1, GPT-5-miniPromptingWeb SearchMulti-Agent–WideSearch, BrowseComp-ZH
CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery2026/04/02 GitHub starsClaude (agent backbone)Evolutionary Search (heartbeat-guided)–Multi-Agent–10 math/algorithmic/systems benchmarks (incl. Anthropic kernel-engineering)
Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design2026/03/30 GitHub starsQwen3-8BSFT, GRPOWeb SearchSingle-Agent2WikiMultihopQA, BeerQA, ASearcher, DeepDive, synthesized QA (12K)BrowseComp, BrowseComp-ZH, GAIA, xBench-DeepSearch, WebWalkerQA, DeepSearchQA
Gen-Searcher: Reinforcing Agentic Search for Image Generation2026/03/30 GitHub starsQwen-ImageSFT, GRPOWeb SearchSingle-AgentGen-Searcher-SFT-10k, Gen-Searcher-RL-6kKnowGen, WISE
OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis2026/03/17 GitHub starsNVIDIA-Nemotron-3-Nano-30B-A3B-Base, GPT-OSS-120B (teacher)SFTLocal RetrievalSingle-AgentMiroVerse-v0.1 (97K synthesized trajectories)BrowseComp-Plus, BrowseComp, GAIA, xbench-DeepSearch
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data2026/03/16 GitHub starsQwen3-30B-A3B-Thinking-2507SFT–Single-AgentOpenSeeker-v1-DataBrowseComp, BrowseComp-ZH, xbench-DeepSearch, WideSearch
Meta-Reinforcement Learning with Self-Reflection for Agentic Search2026/03/11 GitHub starsQwen2.5-3B-Base, Qwen2.5-7B-BaseMeta-RL, RLOOLocal RetrievalSingle-AgentNQ, HotpotQA, ASearcherNQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle, ASearcher
UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking2026/03/09PanGu-38B, Qwen3-32BSFT, RFTWeb SearchMulti-Agent–UIS-QA, GAIA, BrowseComp-zh, FinSearchComp
SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic Plans2026/03/09 GitHub starsQwen3-8B, Qwen3-4B, Qwen3-32BSFT, GRPOWeb SearchSingle-AgentHotpotQA, 2WikiMultihopQA, MuSiQue, MultiHop-RAG, SuperGPQA, WebWalker-SilverHotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle, GPQA, WebWalkerQA, GAIA
AgentIR: Reasoning-Aware Retrieval for Deep Research Agents2026/03/04Qwen3-Embedding-4B, Tongyi-DeepResearch, gpt-oss-120B, GLM-4.7Contrastive Learning, LoRALocal RetrievalSingle-AgentDR-Synth, WebShaperBrowseComp-Plus
MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline2026/03/01 GitHub starsQwen2.5-VL-7B-Instruct, Qwen3-VL-8B-Instruct, Qwen3-VL-32B-InstructSFT, GRPOWeb Search, Local RetrievalSingle-AgentHyper-Search-3K, DR-TTS-10K, InfoSeek, FVQASimpleVQA, MMSearch, LiveVQA, FVQA, InfoSeek, BrowseComp-VL
DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent2026/03/01 GitHub starsQwen2.5-3B, Llama3.2-3BSFT, PPO, GRPOWeb Search, Local RetrievalSingle-AgentDeepResearch-9KDeepResearch-9K, BrowseComp-Plus
ProductResearch: Training E-Commerce Deep Research Agents via Multi-Agent Synthetic Trajectory Distillation2026/02/27Qwen3-30B-A3B-Thinking-2507SFTWeb Search, Local RetrievalMulti-AgentProductResearch synthetic trajectories (e-commerce user logs)ProductResearch held-out test set
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization2026/02/26 GitHub starsQwen3-30B-A3B-Instruct-2507SFT, RL (RLOO)Web SearchSingle-AgentSMTL-Dataset, TaskCraftBrowseComp, GAIA, xbench-DeepSearch, WebWalkerQA, FRAMES, SEAL-0, DeepResearch Bench
MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks2026/02/26 GitHub starsGPT-5, Claude 3.7 Sonnet, MiroThinker v1.0-72BPromptingWeb SearchMulti-Agent–GAIA, BrowseComp-EN, BrowseComp-ZH, HLE, xBench-DeepSearch, FutureX
How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R12026/02/23Qwen2.5-7B, Qwen2.5-3BREINFORCE, PPO, GRPOLocal RetrievalSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle
W&D:Scaling Parallel Tool Calling for Efficient Deep Research Agents2026/02/07GPT-5, Gemini 3.0 Pro, Claude 4.5 Sonnet, DeepSeek-V3.2, Qwen3-235BPromptingWeb SearchSingle-Agent–BrowseComp, HLE, GAIA
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research2026/02/06 GitHub starsMiniCPM4.1-8BSFT, RLLocal RetrievalSingle-Agent–DeepResearch Bench, DeepConsult, DeepResearch Gym
RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents2026/02/02 GitHub starsQwen3-4B-Instruct, Tongyi-DeepResearch-30B-A3B, GLM-4.7, GPT-5, o3, Claude-4.5-Sonnet, DeepSeek-V3.2Prompting, SFTWeb SearchSingle-Agent–BrowseComp, BrowseComp-ZH, GAIA, XBench, HLE
Yunque DeepResearch Technical Report2026/01/27 GitHub starsGemini-3-Pro, DeepSeek-V3.2, Kimi K2 ThinkingPromptingWeb SearchMulti-Agent–GAIA, BrowseComp, BrowseComp-ZH, HLE
OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents2026/01/26 GitHub starsOffSeeker-8BSFT, DPOWeb SearchSingle-AgentDeepForge synthetic data (66k QA pairs, 33k SFT trajectories, 21k DPO pairs)GAIA, BrowseComp-en, BrowseComp-zh, HLE, XBench-DeepSearch, WebWalkerQA
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification2026/01/22 GitHub starsClaude-3.7-Sonnet, Claude-3.5-Sonnet, GPT-4.1, Qwen3-8BSFT, Test-Time VerificationWeb SearchMulti-AgentDeepVerifier-4K, WebAggregatorQAGAIA, XBench-DeepSearch, BrowseComp
Agentic-R: Learning to Retrieve for Agentic Search2026/01/17 GitHub starsQwen2.5-7B-Base, E5-base-v2, Qwen2.5-72B-InstructPPO, Contrastive LearningLocal RetrievalSingle-AgentHotpotQA, TriviaQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle
ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking Agents2026/01/17Qwen2.5-7B-Instruct, Qwen2.5-32B-Instruct, Qwen3-14B, Qwen3-32B, DeepSeek-v3.2, GPT-OSS-120BPrompting, SFTWeb SearchSingle-Agent–HotpotQA, GAIA, xbench-DeepSearch, BrowseComp, BrowseComp-ZH
Dr. Zero: Self-Evolving Search Agents without Training Data2026/01/11 GitHub starsQwen2.5-3B-Instruct, Qwen2.5-7B-InstructHRPOWeb SearchMulti-Agent–NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultihopQA (2WikiMQA), MuSiQue, Bamboogle
Over-Searching in Search-Augmented Large Language Models2026/01/09 GitHub starsFrontier + Open-source LLMsPrompting (Evaluation & Mitigation)Web Search, Local RetrievalSingle-Agent–OverSearchQA
LEAPS: An LLM-Empowered Adaptive Plugin for Taobao AI Search2026/01/09Qwen3-14BREINFORCE++, GRPO, GSPOLocal RetrievalSingle-Agent––
SmartSearch: Process Reward-Guided Query Refinement for Search Agents2026/01/08 GitHub starsQwen2.5-3B-InstructSFT, DPO, GRPOWeb SearchSingle-AgentAsearcher-Base2WikiMultihopQA, HotpotQA, Bamboogle, MuSiQue, GAIA, WebWalker
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL2026/01/07 GitHub starsQwen-2.5-72B-InstructGRPOWeb SearchMulti-AgentZhihu-KOL, WideSearch, ELI5DeepResearch Bench, DeepResearchGym
WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning2026/01/06WebSailor-3B/7B, Tongyi-DR-30B, Qwen-2.5-72BGRPOLocal RetrievalSingle-Agent–BrowseComp-en, BrowseComp-zh, XBench-DeepSearch, GAIA
Budget-Aware Tool-Use Enables Effective Agent Scaling2025/11/21Gemini-2.5-Flash, Gemini-2.5-Pro, Claude-Sonnet-4PromptingWeb SearchSingle-Agent––
AutoTool: Efficient Tool Selection for Large Language Model Agents2025/11/18 GitHub starsLlama4-Scout-17BPromptingWeb SearchSingle-Agent–AlfWorld, ScienceWorld, ToolQuery-Academia
Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO2025/11/17 GitHub starsQwen3-30B-A3BM-GRPOWeb SearchMulti-Agent–GAIA, XBench-DeepSearch, WebWalkerQA
ToolScope: An Agentic Framework for Vision-Guided and Long-Horizon Tool Use2025/10/31GPT-4o, Gemini-2.5, Qwen2.5-VL, Llama-3.2-VisionPromptingLocal RetrievalMulti-Agent––
TOOLRM: Towards Agentic Tool-Use Reward Modeling2025/10/30 GitHub starsQwen3-4B, Qwen3-8BRLWeb SearchSingle-AgentToolPref-Pairwise-30KTRBench, ACEBench
Tongyi DeepResearch Technical Report2025/10/28 GitHub starsQwen3-30B-A3B-BaseSFT, RLWeb SearchSingle-Agent–HLE, BrowseComp, BrowseComp-ZH, GAIA, XBench-DeepSearch, WebWalkerQA, FRAMES, XBench-DeepSearch-2510
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection2025/10/21 GitHub starsQwen-2.5-14B, Qwen-3-14BRL (cold start + RL; self-reflection)Web SearchSingle-Agent–HotpotQA, SimpleQA
Enterprise Deep Research: Steerable MultiAgent Deep Research for Enterprise Analytics2025/10/20 GitHub stars–PromptingWeb SearchMulti-Agent–DeepResearch Bench, DeepConsult
Stop-RAG: Value-Based Retrieval Control for Iterative RAG2025/10/16 GitHub starsLlama-3.1-8B-InstructFine-tuningLocal RetrievalSingle-AgentMuSiQue, HotpotQA, 2WikiMultihopQAHotpotQA, MuSiQue, 2WikiMultihopQA
Towards Agentic Self-Learning LLMs in Search Environment2025/10/16 GitHub starsQwen-2.5-7B-InstructRLWeb SearchMulti-Agent–NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle
GOAT: A Training Framework for Goal-Oriented Agent with Tools2025/10/14Qwen-2-7B, Llama-3-8B-Instruct, Llama-3-70B-InstructFine-tuningWeb SearchSingle-Agent–GOATBench
ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents2025/10/14 GitHub starsgpt-4.1, gpt-4.1-mini, o4-mini, Llama-3.3-70BPromptingWeb SearchSingle-Agent–GAIA
HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation2025/10/09 GitHub starsQwen2.5-3B-Instruct, Qwen2.5-7B-Instruct, Llama-3.2-3B-InstructPPO, GRPOWeb SearchSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2Wiki, MuSiQue, Bamboogle
A2SEARCH: Ambiguity-Aware Question Answering with Reinforcement Learning2025/10/09 GitHub starsQwen-2.5 familyRLWeb SearchSingle-AgentNQMuSiQue, HotpotQA, 2Wiki, Bamboogle, NQ, TriviaQA, PopQA, AmbigQA
ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards2025/10/01Qwen2.5-7B-Instruct, Qwen2.5-3B-InstructGRPOWeb Search, Local RetrievalSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMQA, MuSiQue, Bamboogle, FictionalHot
Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents2025/09/17Qwen3-8B, Qwen2.5-Omni-7BRLLocal RetrievalSingle-AgentΟ„-bench, APIGen-MTΟ„-bench
ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization2025/09/16 GitHub starsQwen3-30B-A3B-ThinkingGRPO, SFTWeb SearchSingle-AgentSailorFog-QABrowseComp-en/zh
WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research2025/09/16 GitHub starsQwen3-30B-A3B-InstructSFTWeb SearchSingle-AgentWebWeaver-3kBrowseComp-en/zh, GAIA, XBench-DeepSearch
WebResearcher: Unleashing Unbounded Reasoning Capability in Long-Horizon Agents2025/09/16 GitHub starsQwen3-30B-A3BRFT, RLWeb SearchMulti-AgentWebFrontierBrowseComp-en/zh, GAIA, WebWalkerQA, FRAMES, HotpotQA, MuSiQue, 2WikiMultiHopQA
WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable RL2025/09/16 GitHub starsQwen3-30B-A3BSFT, RLWeb Search, Local RetrievalSingle-AgentSailorFog-QA-V2BrowseComp-EN, BrowseComp-ZH, HLE
WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents2025/09/08 GitHub starsQwen3-8BGRPO, SFTWeb SearchSingle-AgentWebExplorer-QABrowseComp-en/zh, GAIA, WebWalkerQA, FRAMES, XBench-DeepSearch, HLE
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward2025/08/18 GitHub starsQwen2.5-7BRL(GRPO)Web SearchSingle-AgentNQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAGBamboogle, NQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAG
MMSearch-R1: Incentivizing LMMs to Search2025/06/25 GitHub starsQwen2.5-VL-7BRL(GRPO)Web SearchSingle-AgentVQA, MetaClip, FVQA, InfoSeekFVQA-test, InfoSeek, MMSearch, SimpleVQA, LiveVQA
VideoDeepResearch: Long Video Understanding With Agentic Tool Using2025/06/12 GitHub starsGPT-4o, Gemini1.5-pro, Qwen2.5-VL-72B-InstructPromptingLocal RetrievalMulti-Agent–MLVU, Video-MME, LVBench, LongVideoBench
Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework2025/06/03Claude3.7-Sonnet, GPT-4o-mini, Qwen3-235B-A22B, Qwen2.5-VL-72B-InstructPromptingWeb SearchMulti-Agent–Pew Research, Our World in Data, Open Knowledge Foundation
RAG-Gym: Systematic Optimization of Language Agents for Retrieval-Augmented Generation2025/05/31 GitHub starsLlama3.1-8B-Instruct, Qwen2.5-7B-Instruct, GPT-4o-miniSFT, RL(PPO, DPO)Local RetrievalSingle-AgentHotpotQA, MedQAHotpotQA, 2Wiki, Bamboogle, MedQA
MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability2025/05/27 GitHub starsLlama3.1-8B, Llama3.2-3B, Llama3.2-1B, Llama3, Qwen2.5-7B, Qwen2.5-3B, Qwen2.5-1.5B, Qwen2.5SFT, RL(DAPO)Local RetrievalMulti-AgentHotpotQAHotpotQA, FanoutQA, Musique, 2WikiMultiHopQA, Bamboogle, FreshQA
SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesis2025/05/25 GitHub starsQwen2.5-7B-Instruct, Qwen2.5-32B-Instruct, DeepseekDistilled-Qwen2.5-32B, QwQ-32BSFTWeb SearchSingle-AgentNQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAGBamboogle, FRAMES, GAIA, NQ, SimpleQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, MultiHopRAG
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning2025/05/22 GitHub starsQwen2.5-3B, Llama3.1-8BSFT, RL(M-GRPO)Web SearchSingle-AgentWebArena-Lite, WebArenaWebArena-Lite, WebArena
R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning2025/05/22 GitHub starsQwen2.5-7B-InstructSFT, RLLocal RetrievalSingle-AgentHotpotQA, 2WikiMultiHopQAHotpotQA, 2WikiMultiHopQA, Musique, Bamboogle
Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning2025/05/22 GitHub starsQwen2.5-7B-InstructRL(DPO)Local RetrievalSingle-AgentPopQA, HotpotQA, 2WikiMultihopQAPopQA, HotpotQA, 2WikiMultiHopQA, Bamboogle, MuSiQue
s3 - Efficient Yet Effective Search Agent Training via RL2025/05/20 GitHub starsQwen2.5-7B-InstructRL(PPO)Local RetrievalSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2wiki, Musique, MedQA-US, MedMCQA, PubMedQA, BioASQ-Y/N, MMLU-Med
Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents2025/05/17 GitHub starsQwen2.5-14B, Qwen2.5-7BPromptingLocal RetrievalSingle-Agent–Musique, NQ, 2WikiMultiHopQA, HotpotQA, Bamboogle, StrategyQA
Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search Agent2025/05/12 GitHub starsQwen2.5-3B-Instruct, Qwen2.5-7B-InstructRL(GRPO)Local RetrievalSingle-AgentNQ, HotpotQAPopQA, 2WikiMultihopQA
ZeroSearch: Incentivize the Search Capability of LLMs without Searching2025/05/07 GitHub starsQwen2.5-3B-Base, Qwen2.5-7B-Base, Qwen2.5-7B-Instruct, Qwen2.5-3B-Instruct, Llama3.2-3B-Instruct, Llama3.2-3B-BaseRL(Reinforce, GRPO, PPO)Web SearchSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle
Webthinker: Empowering large reasoning models with deep research capability2025/04/30 GitHub starsGPT-o1, GPT-o3, Deepseek-R1, QwQ-32B, Qwen2.5-32B-InstructRL(DPO)Web SearchSingle-AgentSuperGPQA, WebWalkerQA, OpenThoughts, NaturalReasoning, NuminaMathGPQA, GAIA, WebWalkerQA, Humanity’s Last Exam
Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs2025/04/11 GitHub starsPangu Ultra-135BSFT, RLLocal RetrievalSingle-Agent––
Open Deep Search: Democratizing Search with Open-source Reasoning Agents2025/03/26 GitHub starsLlama3.1-70B, Deepseek-R1PromptingWeb SearchSingle-Agent–SimpleQA, FRAME
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments2025/03/26 GitHub starsQwen2.5-7B-InstructRL(GRPO)Web SearchMulti-AgentNQ, TQ, HotpotQA, 2WikiMultiHopQAMuSiQue, Bamboogle, PopQA, NQ, TQ, HotpotQA, 2WikiMultiHopQA
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning2025/03/25 GitHub starsQwen2.5-7B-Instruct, Qwen2.5-32B-InstructRL(GRPO)Web SearchSingle-AgentMuSiQueHotpotQA, 2WikiMultiHopQA, Musique, Bamboogle
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning2025/03/12 GitHub starsQwen2.5-7B-Instruct, Qwen2.5-7B-Base, Qwen2.5-3B-Instruct, Qwen2.5-3B-BaseRL(PPO, GRPO)Web SearchSingle-AgentNQ, HotpotQANQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, Musique, Bamboogle
Beyond Outlining: Heterogeneous Recursive Planning for Adaptive Long-form Writing with Language Models2025/03/11 GitHub starsGPT-4o, Claude3.5-SonnetPromptingWeb SearchMulti-Agent–TELL ME A STORY, WildSeek
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning2025/03/07 GitHub starsQwen2.5-7B-Base, Llama3.1-8B-InstructSFT, RL(GRPO, Reinforce++)Web Search, Local RetrievalSingle-AgentHotpotQA, 2WikiMultiHopQAHotpotQA, 2WikiMultiHopQA, Musique, Bamboogle
AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents2025/02/18 GitHub starsClaude3.5-SonnetPromptingWeb SearchMulti-Agent–GAIA
Agentic Reasoning: Reasoning LLMs with Tools for the Deep Research2025/02/07 GitHub starsN/APromptingWeb SearchMulti-Agent–GPQA
Search-o1: Agentic Search-Enhanced Large Reasoning Models2025/01/09 GitHub starsQwQ-32B-PreviewPromptingWeb SearchSingle-Agent–GPQA, MATH500, AMC2023, AIME2024, LiveCodeBench, NQ, TriviaQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle

Benchmarks and Applications

Benchmarks Plot

  • REFUTE: Benchmark for scientific critique and epistemic calibration on recent (2025–2026) science summaries, separating critique skill from calibrated truthfulness [Report] [Data] [Leaderboard]
  • Humanity's Last Exam [Paper] [Code] GitHub Repo stars
  • BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents [Paper] [Code] GitHub Repo stars
  • BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese '[Paper]' [Code] GitHub Repo stars
  • DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents [Paper] [Code] GitHub Repo stars
  • MedBrowseComp: Benchmarking Medical Deep Research and Computer Use [Paper] [Code] GitHub Repo stars
  • Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge [Paper] [Code] GitHub Repo stars
  • PerspectiveGap: A Benchmark for Multi-Agent Orchestration Prompting [Paper] [Code] GitHub Repo stars
  • Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus [Paper] [Code] GitHub Repo stars
  • GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces [Paper] [Code] GitHub Repo stars
  • MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments [Paper] [Code] GitHub Repo stars
  • DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math? [Paper]
  • LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know? [Paper] [Code]
  • MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents [Paper] [Code] GitHub Repo stars
  • EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge [Paper] [Code]
  • AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery [Paper] [Code] GitHub Repo stars
  • Total Recall QA: A Verifiable Evaluation Suite for Deep Research Agents [Paper] [Code] GitHub Repo stars
  • TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents [Paper]
  • LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling [Paper] [Code]
  • SeekerGym: A Benchmark for Reliable Information Seeking [Paper]
  • DRΒ³-Eval: Towards Realistic and Reproducible Deep Research Evaluation [Paper] [Code] GitHub Repo stars
  • MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome [Paper] [Code] GitHub Repo stars
  • BrowseComp-VΒ³: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents [Paper] [Code] GitHub Repo stars
  • DeepStress: Stress-Testing Deep Search Agents [Paper]
  • DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [Paper]
  • Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark [Paper] [Code] GitHub Repo stars

Contributing and Citations

🀝 We welcome contributions to expand this comprehensive collection of Agentic Deep Research resources!

πŸ“ How to Contribute

Adding New Research Papers and Benchmarks:

  • Submit an issue with the paper details (title, arXiv link, all the categories in our paper table, and GitHub repo if available)
  • Or create a pull request with the paper added to the research papers table or the benchmarks section

Adding New Open-Source Implementations and New Products:

  • Submit an issue with the repository details (name, description, release data, GitHub link if available)
  • Or create a pull request with the implementation added to the open-source and products section

πŸ“– Citation

πŸ”₯πŸ”₯πŸ”₯ If you find this repository useful, please cite our papers:

@article{zhang2025web,
  title={From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents},
  author={Zhang, Weizhi and Li, Yangning and Bei, Yuanchen and Luo, Junyu and Wan, Guancheng and Yang, Liangwei and Xie, Chenxuan and Yang, Yuyao and Huang, Wei-Chieh and Miao, Chunyu and others},
  journal={arXiv preprint arXiv:2506.18959},
  year={2025}
}

@article{li2025towards,
  title={Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems in LLMs},
  author={Li, Yangning and Zhang, Weizhi and Yang, Yuyao and Huang, Wei-Chieh and Wu, Yaozu and Luo, Junyu and Bei, Yuanchen and Zou, Henry Peng and Luo, Xiao and Zhao, Yusheng and others},
  journal={arXiv preprint arXiv:2507.09477},
  year={2025}
}
agentic-ai
agentic-rag
deep-research
deep-research-agent
large-language-models
llms
rag
reasoning
reasoning-agent
search-agent

Contributors

DavidZWZ

71 commits

Jasonya

10 commits

doctadg

1 commits