A comprehensive code domain benchmark review of LLM researches.
245
141 commits
updated Sep 16, 2026
A comprehensive code domain benchmark review of LLM researches.
This list organizes code benchmarks by primary capability and software-engineering workflow. Each benchmark entry includes compact metadata for task type, granularity, interaction pattern, and evaluation method.
| Dimension | Values |
|---|---|
| Granularity | Function, API, Query / Database, File, Project, UI, Repository, Workflow |
| Interaction | Single-turn, Multi-turn, Agentic, Async, Multi-agent |
| Evaluation | Unit Tests, Execution, Performance, Human, LLM-as-Judge, Security Exploit, Economic |
| Environment | None, Sandbox, Terminal, Browser, IDE, CI |
| Freshness | Static, Dynamic, Held-out, Contamination-resistant |
Software Development Life Cycle Perspective A Survey of Benchmarks for Code Large Language Models and Agents from Xi’an Jiaotong University
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks from Zhejiang University
A Survey on Large Language Model Benchmarks from Shenzhen Key Laboratory for High Performance Data Mining
task: End-to-end project development - granularity: Project / Repository - interaction: Agentic - evaluation: Unit Tests / LLM-as-Judge - Githubtask: Hardware repository bug repair - granularity: Repository - interaction: Agentic - evaluation: Executiontask: Reward hacking / spec compliance - granularity: Systems-level task (JSON parser → OS kernel) - interaction: Agentic - evaluation: Held-out vs visible tests - Githubtask: IDE-native software engineering - granularity: Repository / Workflow - interaction: Agentic - evaluation: Unit Tests / Executiontask: End-to-end microservice repository generation - granularity: Project / Repository - interaction: Agentic - evaluation: Unit Tests / Execution / Deployment - Githubtask: Repository-level refactoring - granularity: Repository - interaction: Single-turn / Agentic - evaluation: Compilation / Unit Tests / Static Analysistask: Context reuse across related coding tasks - granularity: Repository / Workflow - interaction: Multi-turn / Agentic - evaluation: Unit Tests / Execution / Costtask: Industrial mobile application development - granularity: Repository / Workflow - interaction: Multimodal / Agentic - evaluation: Unit Tests / Execution - 🌐Websitetask: Repository modernization / migration - granularity: Project / Repository - interaction: Agentic - evaluation: Black-box Tests / Execution - Githubtask: Agentic repository-level code understanding - granularity: Repository - interaction: Agentic - evaluation: QA Accuracy / Executiontask: Sequential software evolution - granularity: Repository / Workflow - interaction: Multi-turn / Agentic - evaluation: Unit Tests / Execution / Static Analysistask: Repository generation from scratch - granularity: Project / Repository - interaction: Agentic - evaluation: Black-box Tests / Executiontask: Visual spec-to-web-app development - granularity: Project / Workflow - interaction: Multimodal / Agentic - evaluation: Browser Tests / Visual Similarity / DOM Matching - Github 🌐Website 🤗Datasettask: Production runtime assessment - granularity: Project / Workflow - interaction: Agentic - evaluation: Execution / Runtime / Cost - 🌐Websitetask: Agent harness evaluation for issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution / Cost - Github 🤗Datasettask: Dialogue-driven issue resolving - granularity: Repository / Workflow - interaction: Multi-turn / Agentic - evaluation: Unit Tests / Dialogue Qualitytask: Future-oriented repository task synthesis - granularity: Repository - interaction: Agentic - evaluation: Semantic Matching / Executiontask: Freelance software engineering - granularity: Repository / Workflow - interaction: Agentic - evaluation: Execution / Human / Economic - Githubtask: Multilingual issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Long-horizon issue resolving - granularity: Repository / Workflow - interaction: Agentic - evaluation: Unit Tests / Executiontask: PRD-driven project development - granularity: Project / Repository - interaction: Agentic - evaluation: Execution / LLM-as-Judgetask: Long-context code comprehension and repair - granularity: Repository - interaction: Single-turn / Agentic - evaluation: Unit Tests / Execution / LLM-as-Judge - 🤗Datasettask: Repository-level bug fixing and feature requests - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Scientific repository development - granularity: Repository / Workflow - interaction: Agentic - evaluation: Executiontask: Repository-level issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Repository-level software engineering - granularity: Repository / Workflow - interaction: Agentic - evaluation: Execution - Githubtask: Repository-level coding tasks - granularity: Repository / Workflow - interaction: Agentic - evaluation: Execution - Githubtask: Multi-turn code assistance - granularity: Function / Repository / Workflow - interaction: Multi-turn / Agentic - evaluation: Human / LLM-as-Judgetask: Feature-driven software development - granularity: Repository / Workflow - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Test-driven incremental development - granularity: Repository / Workflow - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Long-context software engineering workflows - granularity: Repository / Workflow - interaction: Multi-turn / Agentic - evaluation: Execution / Tool-use Metrics / LLM-as-Judgetask: Iterative test generation - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: CI failure diagnosis and repair - granularity: Repository / Workflow - interaction: Agentic - evaluation: CI / Executiontask: ArkTS automated program repair - granularity: Project / Repository - interaction: Single-turn / Agentic - evaluation: Unit Tests / Executiontask: Robust automated program repair - granularity: Function - interaction: Single-turn - evaluation: Unit Tests / Executiontask: Test fixture classification and generation - granularity: Function / File - interaction: Agentic - evaluation: Unit Tests / Executiontask: Requirement-based REST API test generation - granularity: API / Workflow - interaction: Single-turn / Multi-turn - evaluation: Mutation Testing / Executiontask: Quantum software debugging and repair - granularity: File / Project - interaction: Multi-agent - evaluation: Simulation / Executiontask: Web accessibility repair - granularity: Project / Repository - interaction: Agentic - evaluation: Browser Tests / Executiontask: LLM-agent bug repair - granularity: File / Project - interaction: Agentic - evaluation: Unit Tests / Executiontask: Hardware repository bug repair - granularity: Repository - interaction: Agentic - evaluation: Simulation / Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - 🤗Datasettask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Build and compilation repair - granularity: Repository / Workflow - interaction: Agentic - evaluation: Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Linktask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - 🤗Datasettask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Secure code generation - granularity: Repository - interaction: Single-turn / Agentic - evaluation: SecurePass / SAST / Executiontask: Hardware and firmware secure code generation - granularity: Function / Project - interaction: Single-turn / Agentic - evaluation: Unit Tests / Security Exploit / Executiontask: Secure-vs-vulnerable code selection - granularity: Function / Snippet - interaction: Single-turn - evaluation: Security Scoretask: Secure code generation and remediation pipeline evaluation - granularity: Function / Workflow - interaction: Multi-agent - evaluation: SAST / Security Exploit / Executiontask: Vulnerability detection in real-world code - granularity: Repository - interaction: Single-turn / Agentic - evaluation: Vulnerability Detection / F-score - 🌐Websitetask: Code hallucination detection - granularity: Function / File - interaction: Single-turn - evaluation: Compilation / Execution / Human - Githubtask: Long-horizon software security bug hunting - granularity: Repository / Workflow - interaction: Agentic - evaluation: PoC / Oracle / Executiontask: Agent evaluation-integrity robustness - granularity: Project / Workflow - interaction: Agentic - evaluation: Integrity / Runtime / Executiontask: Reliability / hallucination / robustness - granularity: Function / API - interaction: Single-turn - evaluation: Execution - Githubtask: Reliability / hallucination / robustness - granularity: Function / API - interaction: Single-turn - evaluation: Execution - Githubtask: Reliability / hallucination / robustness - granularity: Function / API - interaction: Single-turn - evaluation: Execution - Githubtask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - 🌐Websitetask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Executiontask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Executiontask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Githubtask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Githubtask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - 🤗Datasettask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Githubtask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Executiontask: Reliability / hallucination / robustness - granularity: Function / API - interaction: Single-turn - evaluation: Executiontask: Reliability / hallucination / robustness - granularity: Function / API - interaction: Single-turn - evaluation: Execution - 🤗Datasettask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Githubtask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github Datasettask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Dataset 🌐Websitetask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Pull request review - granularity: Repository / Workflow - interaction: Single-turn / Agentic - evaluation: LLM-as-Judge / Humantask: Repository-level code understanding - granularity: Repository - interaction: Agentic - evaluation: QA Accuracy / Executiontask: Repository-level code QA - granularity: Repository - interaction: Agentic - evaluation: LLM-as-Judge / Humantask: Repository-aware code retrieval - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Retrieval Metricstask: Code retrieval and reranking - granularity: Function / Repository - interaction: Single-turn - evaluation: nDCG / Retrieval Metricstask: Robust code search - granularity: Function / Repository - interaction: Single-turn - evaluation: Retrieval Metrics - 🤗Datasettask: Real-world code reasoning - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / Accuracytask: Code reasoning quality evaluation - granularity: Function / File - interaction: Single-turn - evaluation: Human / LLM-as-Judge - Githubtask: Code behavior reasoning - granularity: Function / API - interaction: Single-turn - evaluation: Accuracy / Feature Analysistask: Formal software logic reasoning - granularity: Function / Program - interaction: Agentic - evaluation: Formal Verification / Accuracytask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Github task: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Github task: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - 🤗Datasettask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judgetask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Github task: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judgetask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judgetask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judgetask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judgetask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: End-to-end code review - granularity: Repository / Workflow - interaction: Agentic - evaluation: LLM-as-Judge / Humantask: Fine-grained code review - granularity: File / Repository - interaction: Single-turn / Agentic - evaluation: LLM-as-Judge / Humantask: Code judging / evaluation - granularity: Function / Repository - interaction: Single-turn - evaluation: LLM-as-Judge / Human - 🤗Datasettask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Github task: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Github task: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Code Datasettask: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performancetask: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performancetask: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performancetask: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - 🤗Dataset task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github 🌐Websitetask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judgetask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github 🤗Datasettask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judgetask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judgetask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judgetask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Structured output generation / format conversion - granularity: File / UI - interaction: Single-turn - evaluation: Execution / Structural Validation / VQA - GitHub 🌐Website 🤗Dataset.task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: File / UI - interaction: Single-turn - evaluation: Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Version-specific code completion - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - 🤗Datasettask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - 🤗Datasettask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github 🌐Websitetask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Data science code generation - granularity: Project / Workflow - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Text-to-SQL - granularity: Query / Database - interaction: Single-turn - evaluation: Execution - Github task: Code translation / migration - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Research code generation - granularity: Project / Repository - interaction: Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Domain-specific code generation - granularity: Project / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Domain-specific code generation - granularity: Project / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github Datasettask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Data science code generation - granularity: Project / Workflow - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Text-to-SQL - granularity: Query / Database - interaction: Single-turn - evaluation: Execution - Github task: Code translation / migration - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Github task: Domain-specific code generation - granularity: Project / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code translation / migration - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Github(deprecated) Github(new) A comprehensive code domain benchmark review of LLM researches.
245
141 commits
updated Sep 16, 2026
A comprehensive code domain benchmark review of LLM researches.
This list organizes code benchmarks by primary capability and software-engineering workflow. Each benchmark entry includes compact metadata for task type, granularity, interaction pattern, and evaluation method.
| Dimension | Values |
|---|---|
| Granularity | Function, API, Query / Database, File, Project, UI, Repository, Workflow |
| Interaction | Single-turn, Multi-turn, Agentic, Async, Multi-agent |
| Evaluation | Unit Tests, Execution, Performance, Human, LLM-as-Judge, Security Exploit, Economic |
| Environment | None, Sandbox, Terminal, Browser, IDE, CI |
| Freshness | Static, Dynamic, Held-out, Contamination-resistant |
Software Development Life Cycle Perspective A Survey of Benchmarks for Code Large Language Models and Agents from Xi’an Jiaotong University
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks from Zhejiang University
A Survey on Large Language Model Benchmarks from Shenzhen Key Laboratory for High Performance Data Mining
task: End-to-end project development - granularity: Project / Repository - interaction: Agentic - evaluation: Unit Tests / LLM-as-Judge - Githubtask: Hardware repository bug repair - granularity: Repository - interaction: Agentic - evaluation: Executiontask: Reward hacking / spec compliance - granularity: Systems-level task (JSON parser → OS kernel) - interaction: Agentic - evaluation: Held-out vs visible tests - Githubtask: IDE-native software engineering - granularity: Repository / Workflow - interaction: Agentic - evaluation: Unit Tests / Executiontask: End-to-end microservice repository generation - granularity: Project / Repository - interaction: Agentic - evaluation: Unit Tests / Execution / Deployment - Githubtask: Repository-level refactoring - granularity: Repository - interaction: Single-turn / Agentic - evaluation: Compilation / Unit Tests / Static Analysistask: Context reuse across related coding tasks - granularity: Repository / Workflow - interaction: Multi-turn / Agentic - evaluation: Unit Tests / Execution / Costtask: Industrial mobile application development - granularity: Repository / Workflow - interaction: Multimodal / Agentic - evaluation: Unit Tests / Execution - 🌐Websitetask: Repository modernization / migration - granularity: Project / Repository - interaction: Agentic - evaluation: Black-box Tests / Execution - Githubtask: Agentic repository-level code understanding - granularity: Repository - interaction: Agentic - evaluation: QA Accuracy / Executiontask: Sequential software evolution - granularity: Repository / Workflow - interaction: Multi-turn / Agentic - evaluation: Unit Tests / Execution / Static Analysistask: Repository generation from scratch - granularity: Project / Repository - interaction: Agentic - evaluation: Black-box Tests / Executiontask: Visual spec-to-web-app development - granularity: Project / Workflow - interaction: Multimodal / Agentic - evaluation: Browser Tests / Visual Similarity / DOM Matching - Github 🌐Website 🤗Datasettask: Production runtime assessment - granularity: Project / Workflow - interaction: Agentic - evaluation: Execution / Runtime / Cost - 🌐Websitetask: Agent harness evaluation for issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution / Cost - Github 🤗Datasettask: Dialogue-driven issue resolving - granularity: Repository / Workflow - interaction: Multi-turn / Agentic - evaluation: Unit Tests / Dialogue Qualitytask: Future-oriented repository task synthesis - granularity: Repository - interaction: Agentic - evaluation: Semantic Matching / Executiontask: Freelance software engineering - granularity: Repository / Workflow - interaction: Agentic - evaluation: Execution / Human / Economic - Githubtask: Multilingual issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Long-horizon issue resolving - granularity: Repository / Workflow - interaction: Agentic - evaluation: Unit Tests / Executiontask: PRD-driven project development - granularity: Project / Repository - interaction: Agentic - evaluation: Execution / LLM-as-Judgetask: Long-context code comprehension and repair - granularity: Repository - interaction: Single-turn / Agentic - evaluation: Unit Tests / Execution / LLM-as-Judge - 🤗Datasettask: Repository-level bug fixing and feature requests - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Scientific repository development - granularity: Repository / Workflow - interaction: Agentic - evaluation: Executiontask: Repository-level issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Repository-level software engineering - granularity: Repository / Workflow - interaction: Agentic - evaluation: Execution - Githubtask: Repository-level coding tasks - granularity: Repository / Workflow - interaction: Agentic - evaluation: Execution - Githubtask: Multi-turn code assistance - granularity: Function / Repository / Workflow - interaction: Multi-turn / Agentic - evaluation: Human / LLM-as-Judgetask: Feature-driven software development - granularity: Repository / Workflow - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Test-driven incremental development - granularity: Repository / Workflow - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Long-context software engineering workflows - granularity: Repository / Workflow - interaction: Multi-turn / Agentic - evaluation: Execution / Tool-use Metrics / LLM-as-Judgetask: Iterative test generation - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: CI failure diagnosis and repair - granularity: Repository / Workflow - interaction: Agentic - evaluation: CI / Executiontask: ArkTS automated program repair - granularity: Project / Repository - interaction: Single-turn / Agentic - evaluation: Unit Tests / Executiontask: Robust automated program repair - granularity: Function - interaction: Single-turn - evaluation: Unit Tests / Executiontask: Test fixture classification and generation - granularity: Function / File - interaction: Agentic - evaluation: Unit Tests / Executiontask: Requirement-based REST API test generation - granularity: API / Workflow - interaction: Single-turn / Multi-turn - evaluation: Mutation Testing / Executiontask: Quantum software debugging and repair - granularity: File / Project - interaction: Multi-agent - evaluation: Simulation / Executiontask: Web accessibility repair - granularity: Project / Repository - interaction: Agentic - evaluation: Browser Tests / Executiontask: LLM-agent bug repair - granularity: File / Project - interaction: Agentic - evaluation: Unit Tests / Executiontask: Hardware repository bug repair - granularity: Repository - interaction: Agentic - evaluation: Simulation / Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - 🤗Datasettask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Build and compilation repair - granularity: Repository / Workflow - interaction: Agentic - evaluation: Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Linktask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - 🤗Datasettask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Github task: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Executiontask: Bug fixing / issue resolving - granularity: Repository - interaction: Agentic - evaluation: Unit Tests / Execution - Githubtask: Secure code generation - granularity: Repository - interaction: Single-turn / Agentic - evaluation: SecurePass / SAST / Executiontask: Hardware and firmware secure code generation - granularity: Function / Project - interaction: Single-turn / Agentic - evaluation: Unit Tests / Security Exploit / Executiontask: Secure-vs-vulnerable code selection - granularity: Function / Snippet - interaction: Single-turn - evaluation: Security Scoretask: Secure code generation and remediation pipeline evaluation - granularity: Function / Workflow - interaction: Multi-agent - evaluation: SAST / Security Exploit / Executiontask: Vulnerability detection in real-world code - granularity: Repository - interaction: Single-turn / Agentic - evaluation: Vulnerability Detection / F-score - 🌐Websitetask: Code hallucination detection - granularity: Function / File - interaction: Single-turn - evaluation: Compilation / Execution / Human - Githubtask: Long-horizon software security bug hunting - granularity: Repository / Workflow - interaction: Agentic - evaluation: PoC / Oracle / Executiontask: Agent evaluation-integrity robustness - granularity: Project / Workflow - interaction: Agentic - evaluation: Integrity / Runtime / Executiontask: Reliability / hallucination / robustness - granularity: Function / API - interaction: Single-turn - evaluation: Execution - Githubtask: Reliability / hallucination / robustness - granularity: Function / API - interaction: Single-turn - evaluation: Execution - Githubtask: Reliability / hallucination / robustness - granularity: Function / API - interaction: Single-turn - evaluation: Execution - Githubtask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - 🌐Websitetask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Executiontask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Executiontask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Githubtask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Githubtask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - 🤗Datasettask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Githubtask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Executiontask: Reliability / hallucination / robustness - granularity: Function / API - interaction: Single-turn - evaluation: Executiontask: Reliability / hallucination / robustness - granularity: Function / API - interaction: Single-turn - evaluation: Execution - 🤗Datasettask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Githubtask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github Datasettask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Dataset 🌐Websitetask: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Security / vulnerability handling - granularity: Repository - interaction: Agentic - evaluation: Security Exploit / Execution - Github task: Pull request review - granularity: Repository / Workflow - interaction: Single-turn / Agentic - evaluation: LLM-as-Judge / Humantask: Repository-level code understanding - granularity: Repository - interaction: Agentic - evaluation: QA Accuracy / Executiontask: Repository-level code QA - granularity: Repository - interaction: Agentic - evaluation: LLM-as-Judge / Humantask: Repository-aware code retrieval - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Retrieval Metricstask: Code retrieval and reranking - granularity: Function / Repository - interaction: Single-turn - evaluation: nDCG / Retrieval Metricstask: Robust code search - granularity: Function / Repository - interaction: Single-turn - evaluation: Retrieval Metrics - 🤗Datasettask: Real-world code reasoning - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / Accuracytask: Code reasoning quality evaluation - granularity: Function / File - interaction: Single-turn - evaluation: Human / LLM-as-Judge - Githubtask: Code behavior reasoning - granularity: Function / API - interaction: Single-turn - evaluation: Accuracy / Feature Analysistask: Formal software logic reasoning - granularity: Function / Program - interaction: Agentic - evaluation: Formal Verification / Accuracytask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Github task: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Github task: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - 🤗Datasettask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judgetask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Github task: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judgetask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judgetask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judgetask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judgetask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: End-to-end code review - granularity: Repository / Workflow - interaction: Agentic - evaluation: LLM-as-Judge / Humantask: Fine-grained code review - granularity: File / Repository - interaction: Single-turn / Agentic - evaluation: LLM-as-Judge / Humantask: Code judging / evaluation - granularity: Function / Repository - interaction: Single-turn - evaluation: LLM-as-Judge / Human - 🤗Datasettask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Github task: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Github task: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Code understanding / reasoning / search - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution / LLM-as-Judge - Githubtask: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Code Datasettask: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performancetask: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performancetask: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performancetask: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Performance optimization - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution / Performance - Github task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - 🤗Dataset task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github 🌐Websitetask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judgetask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github 🤗Datasettask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judgetask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judgetask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judgetask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Structured output generation / format conversion - granularity: File / UI - interaction: Single-turn - evaluation: Execution / Structural Validation / VQA - GitHub 🌐Website 🤗Dataset.task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Github task: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: Project / UI - interaction: Multi-turn / Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Frontend / visual-interactive generation - granularity: File / UI - interaction: Single-turn - evaluation: Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Version-specific code completion - granularity: Function / Repository - interaction: Single-turn - evaluation: Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - 🤗Datasettask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - 🤗Datasettask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github 🌐Websitetask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Data science code generation - granularity: Project / Workflow - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Text-to-SQL - granularity: Query / Database - interaction: Single-turn - evaluation: Execution - Github task: Code translation / migration - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Research code generation - granularity: Project / Repository - interaction: Agentic - evaluation: Execution / LLM-as-Judge - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Executiontask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Githubtask: Domain-specific code generation - granularity: Project / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Domain-specific code generation - granularity: Project / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github Datasettask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Data science code generation - granularity: Project / Workflow - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Text-to-SQL - granularity: Query / Database - interaction: Single-turn - evaluation: Execution - Github task: Code translation / migration - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Github task: Domain-specific code generation - granularity: Project / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Githubtask: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code generation / completion - granularity: Function / Repository - interaction: Single-turn / Multi-turn - evaluation: Unit Tests / Execution - Github task: Code translation / migration - granularity: Function / Repository - interaction: Single-turn / Agentic - evaluation: Execution - Github(deprecated) Github(new)