Must-read papers on Repository-level Code Generation & Issue Resolution π₯
331
181 commits
updated Aug 21, 2026
π A curated list of awesome repository-level code generation research papers and resources. If you want to contribute to this list (please do), feel free to send me a pull request. π If you have any further questions, feel free to contact Yuling Shi or Xiaodong Gu (SJTU).
Repo0: Design-Driven Zero-to-All Code Generation [2026-08-arXiv] [π paper] [π repo]
Persistent Cross-Attempt State Optimization for Repository-Level Code Generation [2026-04-arXiv] [π paper]
Toward Executable Repository-Level Code Generation via Environment Alignment [2026-04-arXiv] [π paper]
Executing as You Generate: Hiding Execution Latency in Code Completion [2026-04-arXiv] [π paper]
CodeRAG: Supportive Code Retrieval on Bigraph for Real-World Code Generation [2025-04-arXiv] [π paper]
RTLRepoCoder: Repository-Level RTL Code Completion through the Combination of Fine-Tuning and Retrieval Augmentation [2025-04-arXiv] [π paper]
What to Retrieve for Effective Retrieval-Augmented Code Generation? An Empirical Study and Beyond [2025-03-arXiv] [π paper]
Improving FIM Code Completions via Context & Curriculum Based Learning [2024-12-arXiv] [π paper]
ContextModule: Improving Code Completion via Repository-level Contextual Information [2024-12-arXiv] [π paper]
RepoGenReflex: Enhancing Repository-Level Code Completion with Verbal Reinforcement and Retrieval-Augmented Generation [2024-09-arXiv] [π paper]
RAMBO: Enhancing RAG-based Repository-Level Method Body Completion [2024-09-arXiv] [π paper] [π repo]
RLCoder: Reinforcement Learning for Repository-Level Code Completion [2024-07-arXiv] [π paper] [π repo]
STALL+: Boosting LLM-based Repository-level Code Completion with Static Analysis [2024-06-arXiv] [π paper]
GraphCoder: Enhancing Repository-Level Code Completion via Code Context Graph-based Retrieval and Language Model [2024-06-arXiv] [π paper]
Enhancing Repository-Level Code Generation with Integrated Contextual Information [2024-06-arXiv] [π paper]
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models [2024-06-arXiv] [π paper]
Natural Language to Class-level Code Generation by Iterative Tool-augmented Reasoning over Repository [2024-05-arXiv] [π paper] [π repo]
Iterative Refinement of Project-Level Code Context for Precise Code Generation with Compiler Feedback [2024-03-arXiv] [π paper] [π repo]
Repoformer: Selective Retrieval for Repository-Level Code Completion [2024-03-arXiv] [π paper] [π repo]
RepoHyper: Search-Expand-Refine on Semantic Graphs for Repository-Level Code Completion [2024-03-arXiv] [π paper] [π repo]
RepoFusion: Training Code Models to Understand Your Repository [2023-06-arXiv] [π paper] [π repo]
Enhancing Project-Specific Code Completion by Inferring Internal API Information [2025-07-TSE] [π paper] [π repo]
CodexGraph: Bridging Large Language Models and Code Repositories via Code Graph Databases [2025-04-NAACL] [π paper]
Hierarchical Context Pruning: Optimizing Real-World Code Completion with Repository-Level Pretrained Code LLMs [2025-04-AAAI] [π paper] [π repo]
REPOFILTER: Adaptive Retrieval Context Trimming for Repository-Level Code Completion [2025-04-OpenReview] [π paper]
A^3-CodGen: A Repository-Level Code Generation Framework for Code Reuse With Local-Aware, Global-Aware, and Third-Party-Library-Aware [2024-12-TSE] [π paper]
RepoMinCoder: Improving Repository-Level Code Generation Based on Information Loss Screening [2024-07-Internetware] [π paper]
CodePlan: Repository-Level Coding using LLMs and Planning [2024-07-FSE] [π paper] [π repo]
DraCo: Dataflow-Guided Retrieval Augmentation for Repository-Level Code Completion [2024-05-ACL] [π paper] [π repo]
RepoCoder: Repository-Level Code Completion Through Iterative Retrieval and Generation [2023-10-EMNLP] [π paper] [π repo]
Monitor-Guided Decoding of Code LMs with Static Analysis of Repository Context [2023-09-NeurIPS] [π paper] [π repo]
Repository-Level Prompt Generation for Large Language Models of Code [2023-06-ICML] [π paper] [π repo]
Fully Autonomous Programming with Large Language Models [2023-06-GECCO] [π paper] [π repo]
RepoChat Arena [2025-Blog] [π repo]
RepoChat: An LLM-Powered Chatbot for GitHub Repository Question-Answering [MSR-2025] [π repo]
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution [2026-05-arXiv] [π paper] [π repo]
FastCode: Fast and Cost-Efficient Code Understanding and Reasoning [2026-03-arXiv] [π paper]
SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding [2026-ACL] [π paper] [π repo]
SWE-QA: Can Language Models Answer Repository-level Code Questions? [2025-09-arXiv] [π paper] [π repo]
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging [2025-08-arXiv] [π paper] [π repo]
Decompositional Reasoning for Graph Retrieval with Large Language Models [2025-06-arXiv] [π paper]
LongCodeBench: Evaluating Coding LLMs at 1M Context Windows [2025-05-arXiv] [π paper]
LocAgent: Graph-Guided LLM Agents for Code Localization [2025-03-arXiv] [π paper] [π repo]
CoReQA: Uncovering Potentials of Language Models in Code Repository Question Answering [2025-01-arXiv] [π paper]
CodeQueries: A Dataset of Semantic Queries over Code [2022-09-arXiv] [π paper]
SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios [2025-12-arXiv] [π paper]
Are Benchmark Tests Strong Enough? STING Framework for Enhanced SWE-bench Testing [2026-04-arXiv] [π paper]
SWE-CI: Evaluating Agent Capabilities in Maintaining CI Pipelines [2026-04-arXiv] [π paper]
BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing? [2026-03-arXiv] [π paper] [π repo]
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators [2025-08-arXiv] [π paper] [π repo]
SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents [2024-06-arXiv] [π paper] [πΈοΈ website]
OmniCode: A Benchmark for Evaluating Software Engineering Agents [2026-02-arXiv] [π paper]
SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories [2025-12-arXiv] [π paper]
Multi-Docker-Eval: A βShovel of the Gold Rushβ Benchmark on Automatic Environment Building for Software Engineering? [2025-12-arXiv] [π paper]
CodeClash: CodeClash: Benchmarking Goal-Oriented Software Engineering [2025-11-arXiv] [π paper] [π repo]
SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads? [2025-11-arXiv] [π paper]
SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models [2025-11-arXiv] [π paper]
SWE-Sharp-Bench: A Reproducible Benchmark for C# Software Engineering Tasks [2025-11-arXiv] [π paper]
ImpossibleBench: Measuring LLMsβ Propensity of Exploiting Test Cases [2025-10-arXiv] [π paper]
SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement [2025-10-arXiv] [π paper]
Vibe Checker: Aligning Code Evaluation with Human Preference [2025-10-arXiv] [π paper]
SWE-QA: Can Language Models Answer Repository-level Code Questions? [2025-09-arXiv] [π paper] [π repo]
RECODE-H: A Benchmark for Research Code Development with Interactive Human Feedback [2025-09-arXiv] [π paper]
MULocBench: A Benchmark for Localizing Code and Non-Code Issues in Software Projects [2025-09-arXiv] [π paper] [πΈοΈ website]
SecureAgentBench: Benchmarking Secure Code Generation under Realistic Vulnerability Scenarios [2025-09-arXiv] [π paper]
SWE-bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks? [2025-09] [π paper] [π repo]
AgentIssue-Bench: Can Agents Fix Agent Issues? [2025-08-arXiv] [π paper] [π repo]
LiveRepoReflection: Turning the Tide: Repository-based Code Reflection [2025-07-arXiv] [π paper] [π repo]
SWE-Perf: SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories? [2025-07-arXiv] [π paper] [π repo]
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance [2025-07-arXiv] [π paper]
ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code [2025-06-arXiv] [π paper] [π repo]
SWE-Factory: Your Automated Factory for Issue Resolution Training Data and Evaluation Benchmarks [2025-06-arXiv] [π paper] [π repo]
OmniGIRL: OmniGIRL: A Multilingual and Multimodal Benchmark for GitHub Issue Resolution [2025-05-arXiv] [π paper] [π repo]
SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents [2025-05-arXiv] [π paper] [πΈοΈ website]
SWE-bench-Live: A Live Benchmark for Repository-Level Issue Resolution [2025-05-arXiv] [π paper] [π repo]
SWE-Dev: SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development [2025-05-arXiv] [π paper] [π repo]
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation [2025-04-arXiv] [π paper] [π repo]
SWE-Smith: Scaling Data for Software Engineering Agents [2025-04-arXiv] [π paper] [π repo]
SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs [2025-04-arXiv] [π paper] [π repo]
SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents [2025-04-arXiv] [π paper] [π repo]
Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving [2025-04-arXiv] [π paper] [π repo]
Are "Solved Issues" in SWE-bench Really Solved Correctly? An Empirical Study [2025-03-arXiv] [π paper]
Unveiling Pitfalls: Understanding Why AI-driven Code Agents Fail at GitHub Issue Resolution [2025-03-arXiv] [π paper]
SWEE-Bench & SWA-Bench: Automated Benchmark Generation for Repository-Level Coding Tasks [2025-03-arXiv] [π paper]
REPOST-TRAIN: Scalable Repository-Level Coding Environment Construction with Sandbox Testing [2025-03-arXiv] [π paper] [π repo]
Loc-Bench: Graph-Guided LLM Agents for Code Localization [2025-03-arXiv] [π paper] [π repo]
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments [2025-02-arXiv] [π paper] [π repo]
SWE-Lancer: Can Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering? [2025-02-arXiv] [π paper] [π repo]
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation [2025-02-arXiv] [π paper] [π repo]
Evaluating Agent-based Program Repair at Google [2025-01-arXiv] [π paper]
SWE-Gym: Training Software Engineering Agents and Verifiers with SWE-Gym [2024-12-arXiv] [π paper] [π repo]
RepoTransBench: RepoTransBench: A Real-World Benchmark for Repository-Level Code Translation [2024-12-arXiv] [π paper] [π repo]
Visual SWE-bench: Issue Resolving with Visual Data [2024-12-arXiv] [π paper] [π repo]
ExecRepoBench: Multi-level Executable Code Completion Evaluation [2024-12-arXiv] [π paper] [π site]
REPOCOD: Can Language Models Replace Programmers? REPOCOD Says 'Not Yet' [2024-10-arXiv] [π paper] [π repo]
M2RC-EVAL: M2rc-Eval: Massively Multilingual Repository-level Code Completion Evaluation [2024-10-arXiv] [π paper] [π repo]
SWE-bench+: Enhanced Coding Benchmark for LLMs [2024-10-arXiv] [π paper]
SWE-bench Multimodal: Multimodal Software Engineering Benchmark [2024-10-arXiv] [π paper] [π site]
Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion? [2024-10-arXiv] [π paper] [π repo]
CodeRAG-Bench: Can Retrieval Augment Code Generation? [2024-06-arXiv] [π paper] [π repo]
R2C2-Bench: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models [2024-06-arXiv] [π paper]
RepoClassBench: Class-Level Code Generation from Natural Language Using Iterative, Tool-Enhanced Reasoning over Repository [2024-05-arXiv] [π paper] [π repo]
Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions [ICLR-2025 Oral] [π paper] [π repo]
UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench [ACL-2025] [π paper]
SWE-Flow: Synthesizing Software Engineering Data in a Test-Driven Manner [ICML-2025] [π paper] [π repo]
SWE-Lancer: Can Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering? [2025-arXiv] [π paper] [π repo]
FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature Implementation [2025-05-ACL] [π paper] [π repo]
OmniGIRL: A Multilingual and Multimodal Benchmark for GitHub Issue Resolution [2025-05-ISSTA] [π paper]
LibEvolutionEval: A Benchmark and Study for Version-Specific Code Generation [2025-04-NAACL] [π paper][π Website]
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation [2025 ACL-Findings] [π paper] [π repo]
HumanEvo: An Evolution-aware Benchmark for More Realistic Evaluation of Repository-level Code Generation [2025-ICSE] [π paper] [π repo]
RepoExec: On the Impacts of Contexts on Repository-Level Code Generation [2025-NAACL] [π paper] [π repo]
DevEval: Evaluating Code Generation in Practical Software Projects [2024-ACL-Findings] [π paper] [π repo]
CodAgentBench: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges [2024-ACL] [π paper]
RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems [2024-ICLR] [π paper] [π repo]
SWE-bench: Can Language Models Resolve Real-World GitHub Issues? [2024-ICLR] [π paper] [π repo]
CrossCodeLongEval: Repoformer: Selective Retrieval for Repository-Level Code Completion [2024-ICML] [π paper] [π repo]
R2E-Eval: Turning Any GitHub Repository into a Programming Agent Test Environment [2024-ICML] [π paper] [π repo]
RepoEval: Repository-Level Code Completion Through Iterative Retrieval and Generation [2023-EMNLP] [π paper] [π repo]
CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion [2023-NeurIPS] [π paper] [π site]
Skeleton-Guided-Translation: A Benchmarking Framework for Code Repository Translation with Fine-Grained Quality Evaluation [2025-01-arxiv] [π paper] [π repo]
Must-read papers on Repository-level Code Generation & Issue Resolution π₯
331
181 commits
updated Aug 21, 2026
π A curated list of awesome repository-level code generation research papers and resources. If you want to contribute to this list (please do), feel free to send me a pull request. π If you have any further questions, feel free to contact Yuling Shi or Xiaodong Gu (SJTU).
Repo0: Design-Driven Zero-to-All Code Generation [2026-08-arXiv] [π paper] [π repo]
Persistent Cross-Attempt State Optimization for Repository-Level Code Generation [2026-04-arXiv] [π paper]
Toward Executable Repository-Level Code Generation via Environment Alignment [2026-04-arXiv] [π paper]
Executing as You Generate: Hiding Execution Latency in Code Completion [2026-04-arXiv] [π paper]
CodeRAG: Supportive Code Retrieval on Bigraph for Real-World Code Generation [2025-04-arXiv] [π paper]
RTLRepoCoder: Repository-Level RTL Code Completion through the Combination of Fine-Tuning and Retrieval Augmentation [2025-04-arXiv] [π paper]
What to Retrieve for Effective Retrieval-Augmented Code Generation? An Empirical Study and Beyond [2025-03-arXiv] [π paper]
Improving FIM Code Completions via Context & Curriculum Based Learning [2024-12-arXiv] [π paper]
ContextModule: Improving Code Completion via Repository-level Contextual Information [2024-12-arXiv] [π paper]
RepoGenReflex: Enhancing Repository-Level Code Completion with Verbal Reinforcement and Retrieval-Augmented Generation [2024-09-arXiv] [π paper]
RAMBO: Enhancing RAG-based Repository-Level Method Body Completion [2024-09-arXiv] [π paper] [π repo]
RLCoder: Reinforcement Learning for Repository-Level Code Completion [2024-07-arXiv] [π paper] [π repo]
STALL+: Boosting LLM-based Repository-level Code Completion with Static Analysis [2024-06-arXiv] [π paper]
GraphCoder: Enhancing Repository-Level Code Completion via Code Context Graph-based Retrieval and Language Model [2024-06-arXiv] [π paper]
Enhancing Repository-Level Code Generation with Integrated Contextual Information [2024-06-arXiv] [π paper]
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models [2024-06-arXiv] [π paper]
Natural Language to Class-level Code Generation by Iterative Tool-augmented Reasoning over Repository [2024-05-arXiv] [π paper] [π repo]
Iterative Refinement of Project-Level Code Context for Precise Code Generation with Compiler Feedback [2024-03-arXiv] [π paper] [π repo]
Repoformer: Selective Retrieval for Repository-Level Code Completion [2024-03-arXiv] [π paper] [π repo]
RepoHyper: Search-Expand-Refine on Semantic Graphs for Repository-Level Code Completion [2024-03-arXiv] [π paper] [π repo]
RepoFusion: Training Code Models to Understand Your Repository [2023-06-arXiv] [π paper] [π repo]
Enhancing Project-Specific Code Completion by Inferring Internal API Information [2025-07-TSE] [π paper] [π repo]
CodexGraph: Bridging Large Language Models and Code Repositories via Code Graph Databases [2025-04-NAACL] [π paper]
Hierarchical Context Pruning: Optimizing Real-World Code Completion with Repository-Level Pretrained Code LLMs [2025-04-AAAI] [π paper] [π repo]
REPOFILTER: Adaptive Retrieval Context Trimming for Repository-Level Code Completion [2025-04-OpenReview] [π paper]
A^3-CodGen: A Repository-Level Code Generation Framework for Code Reuse With Local-Aware, Global-Aware, and Third-Party-Library-Aware [2024-12-TSE] [π paper]
RepoMinCoder: Improving Repository-Level Code Generation Based on Information Loss Screening [2024-07-Internetware] [π paper]
CodePlan: Repository-Level Coding using LLMs and Planning [2024-07-FSE] [π paper] [π repo]
DraCo: Dataflow-Guided Retrieval Augmentation for Repository-Level Code Completion [2024-05-ACL] [π paper] [π repo]
RepoCoder: Repository-Level Code Completion Through Iterative Retrieval and Generation [2023-10-EMNLP] [π paper] [π repo]
Monitor-Guided Decoding of Code LMs with Static Analysis of Repository Context [2023-09-NeurIPS] [π paper] [π repo]
Repository-Level Prompt Generation for Large Language Models of Code [2023-06-ICML] [π paper] [π repo]
Fully Autonomous Programming with Large Language Models [2023-06-GECCO] [π paper] [π repo]
RepoChat Arena [2025-Blog] [π repo]
RepoChat: An LLM-Powered Chatbot for GitHub Repository Question-Answering [MSR-2025] [π repo]
SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution [2026-05-arXiv] [π paper] [π repo]
FastCode: Fast and Cost-Efficient Code Understanding and Reasoning [2026-03-arXiv] [π paper]
SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding [2026-ACL] [π paper] [π repo]
SWE-QA: Can Language Models Answer Repository-level Code Questions? [2025-09-arXiv] [π paper] [π repo]
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging [2025-08-arXiv] [π paper] [π repo]
Decompositional Reasoning for Graph Retrieval with Large Language Models [2025-06-arXiv] [π paper]
LongCodeBench: Evaluating Coding LLMs at 1M Context Windows [2025-05-arXiv] [π paper]
LocAgent: Graph-Guided LLM Agents for Code Localization [2025-03-arXiv] [π paper] [π repo]
CoReQA: Uncovering Potentials of Language Models in Code Repository Question Answering [2025-01-arXiv] [π paper]
CodeQueries: A Dataset of Semantic Queries over Code [2022-09-arXiv] [π paper]
SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios [2025-12-arXiv] [π paper]
Are Benchmark Tests Strong Enough? STING Framework for Enhanced SWE-bench Testing [2026-04-arXiv] [π paper]
SWE-CI: Evaluating Agent Capabilities in Maintaining CI Pipelines [2026-04-arXiv] [π paper]
BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing? [2026-03-arXiv] [π paper] [π repo]
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators [2025-08-arXiv] [π paper] [π repo]
SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents [2024-06-arXiv] [π paper] [πΈοΈ website]
OmniCode: A Benchmark for Evaluating Software Engineering Agents [2026-02-arXiv] [π paper]
SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories [2025-12-arXiv] [π paper]
Multi-Docker-Eval: A βShovel of the Gold Rushβ Benchmark on Automatic Environment Building for Software Engineering? [2025-12-arXiv] [π paper]
CodeClash: CodeClash: Benchmarking Goal-Oriented Software Engineering [2025-11-arXiv] [π paper] [π repo]
SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads? [2025-11-arXiv] [π paper]
SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models [2025-11-arXiv] [π paper]
SWE-Sharp-Bench: A Reproducible Benchmark for C# Software Engineering Tasks [2025-11-arXiv] [π paper]
ImpossibleBench: Measuring LLMsβ Propensity of Exploiting Test Cases [2025-10-arXiv] [π paper]
SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement [2025-10-arXiv] [π paper]
Vibe Checker: Aligning Code Evaluation with Human Preference [2025-10-arXiv] [π paper]
SWE-QA: Can Language Models Answer Repository-level Code Questions? [2025-09-arXiv] [π paper] [π repo]
RECODE-H: A Benchmark for Research Code Development with Interactive Human Feedback [2025-09-arXiv] [π paper]
MULocBench: A Benchmark for Localizing Code and Non-Code Issues in Software Projects [2025-09-arXiv] [π paper] [πΈοΈ website]
SecureAgentBench: Benchmarking Secure Code Generation under Realistic Vulnerability Scenarios [2025-09-arXiv] [π paper]
SWE-bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks? [2025-09] [π paper] [π repo]
AgentIssue-Bench: Can Agents Fix Agent Issues? [2025-08-arXiv] [π paper] [π repo]
LiveRepoReflection: Turning the Tide: Repository-based Code Reflection [2025-07-arXiv] [π paper] [π repo]
SWE-Perf: SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories? [2025-07-arXiv] [π paper] [π repo]
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance [2025-07-arXiv] [π paper]
ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code [2025-06-arXiv] [π paper] [π repo]
SWE-Factory: Your Automated Factory for Issue Resolution Training Data and Evaluation Benchmarks [2025-06-arXiv] [π paper] [π repo]
OmniGIRL: OmniGIRL: A Multilingual and Multimodal Benchmark for GitHub Issue Resolution [2025-05-arXiv] [π paper] [π repo]
SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents [2025-05-arXiv] [π paper] [πΈοΈ website]
SWE-bench-Live: A Live Benchmark for Repository-Level Issue Resolution [2025-05-arXiv] [π paper] [π repo]
SWE-Dev: SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development [2025-05-arXiv] [π paper] [π repo]
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation [2025-04-arXiv] [π paper] [π repo]
SWE-Smith: Scaling Data for Software Engineering Agents [2025-04-arXiv] [π paper] [π repo]
SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs [2025-04-arXiv] [π paper] [π repo]
SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents [2025-04-arXiv] [π paper] [π repo]
Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving [2025-04-arXiv] [π paper] [π repo]
Are "Solved Issues" in SWE-bench Really Solved Correctly? An Empirical Study [2025-03-arXiv] [π paper]
Unveiling Pitfalls: Understanding Why AI-driven Code Agents Fail at GitHub Issue Resolution [2025-03-arXiv] [π paper]
SWEE-Bench & SWA-Bench: Automated Benchmark Generation for Repository-Level Coding Tasks [2025-03-arXiv] [π paper]
REPOST-TRAIN: Scalable Repository-Level Coding Environment Construction with Sandbox Testing [2025-03-arXiv] [π paper] [π repo]
Loc-Bench: Graph-Guided LLM Agents for Code Localization [2025-03-arXiv] [π paper] [π repo]
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments [2025-02-arXiv] [π paper] [π repo]
SWE-Lancer: Can Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering? [2025-02-arXiv] [π paper] [π repo]
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation [2025-02-arXiv] [π paper] [π repo]
Evaluating Agent-based Program Repair at Google [2025-01-arXiv] [π paper]
SWE-Gym: Training Software Engineering Agents and Verifiers with SWE-Gym [2024-12-arXiv] [π paper] [π repo]
RepoTransBench: RepoTransBench: A Real-World Benchmark for Repository-Level Code Translation [2024-12-arXiv] [π paper] [π repo]
Visual SWE-bench: Issue Resolving with Visual Data [2024-12-arXiv] [π paper] [π repo]
ExecRepoBench: Multi-level Executable Code Completion Evaluation [2024-12-arXiv] [π paper] [π site]
REPOCOD: Can Language Models Replace Programmers? REPOCOD Says 'Not Yet' [2024-10-arXiv] [π paper] [π repo]
M2RC-EVAL: M2rc-Eval: Massively Multilingual Repository-level Code Completion Evaluation [2024-10-arXiv] [π paper] [π repo]
SWE-bench+: Enhanced Coding Benchmark for LLMs [2024-10-arXiv] [π paper]
SWE-bench Multimodal: Multimodal Software Engineering Benchmark [2024-10-arXiv] [π paper] [π site]
Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion? [2024-10-arXiv] [π paper] [π repo]
CodeRAG-Bench: Can Retrieval Augment Code Generation? [2024-06-arXiv] [π paper] [π repo]
R2C2-Bench: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models [2024-06-arXiv] [π paper]
RepoClassBench: Class-Level Code Generation from Natural Language Using Iterative, Tool-Enhanced Reasoning over Repository [2024-05-arXiv] [π paper] [π repo]
Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions [ICLR-2025 Oral] [π paper] [π repo]
UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench [ACL-2025] [π paper]
SWE-Flow: Synthesizing Software Engineering Data in a Test-Driven Manner [ICML-2025] [π paper] [π repo]
SWE-Lancer: Can Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering? [2025-arXiv] [π paper] [π repo]
FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature Implementation [2025-05-ACL] [π paper] [π repo]
OmniGIRL: A Multilingual and Multimodal Benchmark for GitHub Issue Resolution [2025-05-ISSTA] [π paper]
LibEvolutionEval: A Benchmark and Study for Version-Specific Code Generation [2025-04-NAACL] [π paper][π Website]
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation [2025 ACL-Findings] [π paper] [π repo]
HumanEvo: An Evolution-aware Benchmark for More Realistic Evaluation of Repository-level Code Generation [2025-ICSE] [π paper] [π repo]
RepoExec: On the Impacts of Contexts on Repository-Level Code Generation [2025-NAACL] [π paper] [π repo]
DevEval: Evaluating Code Generation in Practical Software Projects [2024-ACL-Findings] [π paper] [π repo]
CodAgentBench: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges [2024-ACL] [π paper]
RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems [2024-ICLR] [π paper] [π repo]
SWE-bench: Can Language Models Resolve Real-World GitHub Issues? [2024-ICLR] [π paper] [π repo]
CrossCodeLongEval: Repoformer: Selective Retrieval for Repository-Level Code Completion [2024-ICML] [π paper] [π repo]
R2E-Eval: Turning Any GitHub Repository into a Programming Agent Test Environment [2024-ICML] [π paper] [π repo]
RepoEval: Repository-Level Code Completion Through Iterative Retrieval and Generation [2023-EMNLP] [π paper] [π repo]
CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion [2023-NeurIPS] [π paper] [π site]
Skeleton-Guided-Translation: A Benchmarking Framework for Code Repository Translation with Fine-Grained Quality Evaluation [2025-01-arxiv] [π paper] [π repo]