A curated collection of research papers on LLM-based agents and agent training methodologies.
| Title | Venue | Date | Code | Stars |
|---|---|---|---|---|
| A Practitioner's Guide to Multi-Turn Agentic Reinforcement Learning | arXiv | 2025-10 | GitHub | |
| A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning | arXiv | 2025-07 | GitHub | |
| Done Is Better Than Perfect: Unlocking Efficient Reasoning by Structured Multi-Turn Decomposition | arXiv | 2025-05 | - | - |
| Title | Venue | Date | Code | Stars |
|---|---|---|---|---|
| Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents | ICLR 2026 under review | 2025-09 | - | - |
| Agentic Reinforced Policy Optimization (ARPO) | arXiv | 2025-07 | GitHub | |
| Group-in-Group Policy Optimization for LLM Agent Training | NeurIPS 2025 | 2025-05 | GitHub | |
| Direct Multi-Turn Preference Optimization for Language Agents | EMNLP 2024 | 2024-06 | GitHub | |
| INFORMATION GAIN-BASED POLICY OPTIMIZATION: A SIMPLE AND EFFECTIVE APPROACH FOR MULTITURN LLM AGENTS | ICLR2026 Under Review | 2024-06 | - | - |
| Title | Venue | Date | Code | Stars |
|---|---|---|---|---|
| Agentdistill: training-free agent distillation withgeneralizable mcp boxes | arXiv | 2025-06 | - | - |
| Get Experience from Practice: LLM Agents with Record & Replay | arXiv | 2025-05 | - | - |
| AFlow: Automating Agentic Workflow Generation | ICLR 2025 | 2024-10 | GitHub | |
| Agent Workflow Memory | arXiv | 2024-09 | GitHub | |
| Agent KB: Leveraging Cross-Domain Experience for Agentic Problem Solving | ICML 2025 | 2024-07 | GitHub |
| Title | Venue | Date | Code | Stars |
|---|---|---|---|---|
| MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools | arXiv | 2025-09 | - | - |
| GitTaskBench: A Benchmark for Code Agents | arXiv | 2025-08 | GitHub | |
| MLE-bench: Evaluating Machine Learning Agents on ML Engineering | ICLR 2025 | 2024-10 | GitHub | |
| WorFBench: Benchmarking Agentic Workflow Generation | ICLR 2025 | 2024-10 | GitHub | |
| Agent-SafetyBench: Evaluating the Safety of LLM Agents | CoRR 2024 | 2024-12 | GitHub | |
| CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation | ACL 2024 | 2024-01 | GitHub | |
| AgentBench: Evaluating LLMs as Agents | ICLR 2024 | 2023-08 | GitHub |
A curated collection of research papers on LLM-based agents and agent training methodologies.
| Title | Venue | Date | Code | Stars |
|---|---|---|---|---|
| A Practitioner's Guide to Multi-Turn Agentic Reinforcement Learning | arXiv | 2025-10 | GitHub | |
| A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning | arXiv | 2025-07 | GitHub | |
| Done Is Better Than Perfect: Unlocking Efficient Reasoning by Structured Multi-Turn Decomposition | arXiv | 2025-05 | - | - |
| Title | Venue | Date | Code | Stars |
|---|---|---|---|---|
| Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents | ICLR 2026 under review | 2025-09 | - | - |
| Agentic Reinforced Policy Optimization (ARPO) | arXiv | 2025-07 | GitHub | |
| Group-in-Group Policy Optimization for LLM Agent Training | NeurIPS 2025 | 2025-05 | GitHub | |
| Direct Multi-Turn Preference Optimization for Language Agents | EMNLP 2024 | 2024-06 | GitHub | |
| INFORMATION GAIN-BASED POLICY OPTIMIZATION: A SIMPLE AND EFFECTIVE APPROACH FOR MULTITURN LLM AGENTS | ICLR2026 Under Review | 2024-06 | - | - |
| Title | Venue | Date | Code | Stars |
|---|---|---|---|---|
| Agentdistill: training-free agent distillation withgeneralizable mcp boxes | arXiv | 2025-06 | - | - |
| Get Experience from Practice: LLM Agents with Record & Replay | arXiv | 2025-05 | - | - |
| AFlow: Automating Agentic Workflow Generation | ICLR 2025 | 2024-10 | GitHub | |
| Agent Workflow Memory | arXiv | 2024-09 | GitHub | |
| Agent KB: Leveraging Cross-Domain Experience for Agentic Problem Solving | ICML 2025 | 2024-07 | GitHub |
| Title | Venue | Date | Code | Stars |
|---|---|---|---|---|
| MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools | arXiv | 2025-09 | - | - |
| GitTaskBench: A Benchmark for Code Agents | arXiv | 2025-08 | GitHub | |
| MLE-bench: Evaluating Machine Learning Agents on ML Engineering | ICLR 2025 | 2024-10 | GitHub | |
| WorFBench: Benchmarking Agentic Workflow Generation | ICLR 2025 | 2024-10 | GitHub | |
| Agent-SafetyBench: Evaluating the Safety of LLM Agents | CoRR 2024 | 2024-12 | GitHub | |
| CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation | ACL 2024 | 2024-01 | GitHub | |
| AgentBench: Evaluating LLMs as Agents | ICLR 2024 | 2023-08 | GitHub |