Jiaaqiliu/Awesome-Training-Ecosystem-for-E2E-AD

A curated collection of papers on E2E-AD, aimed at researchers, engineers, and enthusiasts in the field of autonomous driving systems. This repository provides a comprehensive selection of papers, focusing primarily on the training methods and ecosystems that drive the development of intelligent autonomous vehicles.

101

88 commits

updated Jun 3, 2026

See the code

README

A Survey on End-to-End Autonomous Driving Training from the Perspectives of Data, Strategy, and Platform

TechRxiv Contribution Welcome GitHub star chart License

Welcome to this curated collection of papers on End-to-End Autonomous Driving (E2E-AD), aimed at researchers, engineers, and enthusiasts in the field of autonomous driving systems. This repository provides a comprehensive selection of papers, focusing primarily on the training methods and ecosystems that drive the development of intelligent autonomous vehicles.

In particular, we focus on the Data-Strategy-Platform framework for E2E-AD systems, offering insights into:

  • Data Layer: Addressing data collection, coverage, and governance practices.
  • Strategy Layer: Exploring imitation learning, reinforcement learning, and generative approaches.
  • Platform Layer: Understanding scalable training infrastructures and cloud-edge collaborations.

Each paper in this repository has been selected for its relevance and contribution to the field, and we hope it serves as a valuable resource for anyone working in or learning about autonomous driving technology.


📰 News

🎉 2026.05.20Our survey was accepted by IEEE Transactions on Intelligent Transportation Systems (TITS).
🔄 2026.05.22Repository updated with the latest E2E-AD training ecosystem papers and resources.

🤝 Contributions Are Welcome

We warmly welcome pull requests and suggestions for adding new papers, benchmarks, datasets, and useful resources.

If you find this repository helpful, please consider citing our survey, starring this repository ⭐, and sharing it with the community.


📌 Framework

Framework Overview

Table of Contents


📚Survey Papers

TitleYearCategoriesProject
End-to-end Autonomous Driving: Challenges and FrontiersTPAMI 2025End to EndProject
A Survey of World Models for Autonomous DrivingarXiv 2025World ModelProject / Benchmark
Generative AI for Autonomous Driving: Frontiers and OpportunitiesarXiv 2025Generative AIProject
A Survey on Vision-Language-Action Models for Autonomous DrivingarXiv 2025Vision-Language-ActionProject
World models for autonomous driving: An initial surveyTIV 2024World Model
Synthetic datasets for autonomous driving: A surveyTIV 2023Datasets
Explainable AI for safe and trustworthy autonomous driving: A systematic reviewTITS 2024XAI
On the Prospects of Incorporating Large Language Models (LLMs) in Automated Planning and SchedulingICAPS 2024Large Language ModelsProject
Prospective role of foundation models in advancing autonomous vehiclesResearch 2024Foundation Models
Large models for intelligent transportation systems and autonomous vehicles: A surveyAEI 2024Foundation Models
Vision language models in autonomous driving: A survey and outlookIV 2024Foundation ModelsProject
A Survey on Multimodal Large Language Models for Autonomous DrivingWACV 2024Foundation Models
A survey for foundation models in autonomous drivingarXiv 2024Foundation Models
Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and OpportunitiesarXiv 2024Foundation Models
Llm4drive: A survey of large language models for autonomous drivingarXiv 2023Large Language ModelsProject
V2X cooperative perception for autonomous driving: Recent advances and challengesarXiv 2023Datasets
Learning-based 3D Reconstruction in Autonomous Driving: A Comprehensive SurveyarXiv 2025Datasets

📄Research Papers

Data Layer

Sources and Scenario Coverage

TitleAbstractYearProject
Closed Loop Dynamic Driving Data Mixture for Real-Synthetic Co-Training
Details Proposes AutoScale, a closed-loop data engine that optimizes real-synthetic driving data mixtures with scene representations, cluster reweighting, retrieval, training, and evaluation feedback.
arXiv 2026
4DLidarOpen: An Open 4D FMCW Lidar Dataset for Motion-Aware Autonomous Driving
Details Introduces a multi-modal 4D FMCW LiDAR dataset with point-wise velocity, multi-LiDAR and camera streams, 3D boxes, tracks, and benchmarks for detection, BEV flow, forecasting, and planning.
arXiv 2026
XWOD: A Real-World Benchmark for Object Detection under Extreme Weather Conditions
Details Builds an extreme-weather object-detection benchmark with real traffic images across rain, snow, fog, flooding, tornado, wildfire, and other adverse conditions.
arXiv 2026
ScenePilot-Bench: A Large-Scale Dataset and Benchmark for Evaluation of Vision-Language Models in Autonomous Driving
Details Provides a first-person driving VLM benchmark built on ScenePilot-4K, evaluating scene understanding, spatial perception, motion planning, safety reasoning, and regional generalization.
arXiv 2026Dataset
VR-Drive: Viewpoint-Robust End-to-End Driving with Feed-Forward 3D Gaussian Splatting
Details Uses feed-forward 3D Gaussian Splatting to synthesize viewpoint-robust driving observations, improving end-to-end policy robustness under camera pose and viewpoint changes.
NeurIPS 2025Project
WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios
Details Adapts Waymo Open Dataset into an end-to-end driving benchmark emphasizing challenging long-tail scenes for planning-oriented policy evaluation.
arXiv 2025Project
SimScale: Learning to Drive via Real-World Simulation at Scale
Details Scales real-world simulation for closed-loop end-to-end driving by converting large-scale logs into interactive training environments for policy learning and evaluation.
CVPR 2026 OralProject / Code
SynAD: Enhancing Real-World End-to-End Autonomous Driving Models through Synthetic Data
Details Studies synthetic-data augmentation for real-world end-to-end driving models, targeting better robustness and generalization under data scarcity and long-tail scenarios.
ICCV 2025
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
Details
WACV 2025Project
Argoverse 2: Next generation datasets for self-driving perception and forecasting
Details
arXiv 2023Project
WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving
Details
ICML 2025Code / Project
nuscenes: A multimodal dataset for autonomous driving
Details
CVPR 2020Project
One million scenes for autonomous driving: Once dataset
Details
arXiv 2021Project
Scalability in perception for autonomous driving: Waymo open dataset
Details Introduces the Waymo Open Dataset for scalable autonomous-driving perception research, including synchronized LiDAR, camera, labels, and benchmarks for detection and tracking.
CVPR 2020Project
Zenseact Open Dataset: A Large-Scale and Diverse Multimodal Dataset for Autonomous Driving
Details Introduces a large-scale multimodal autonomous-driving dataset with diverse European driving scenes and annotations for perception, prediction, and planning research.
ICCV 2023Project
Scaling out-of-distribution detection for real-world settings
Details
PMLR 2022Code
SHIFT: a synthetic driving dataset for continuous multi-task domain adaptation
Details Introduces a synthetic driving dataset for continuous domain adaptation across weather, time, and scene changes, supporting multiple perception tasks.
CVPR 2022Project
V2x-vit: Vehicle-to-everything cooperative perception with vision transformer
Details
ECCV 2022Code
Deepaccident: A motion and accident prediction benchmark for v2x autonomous driving
Details Provides a V2X benchmark for accident and motion prediction, focusing on safety-critical cooperative driving scenarios.
AAAI 2024
Bdd100k: A diverse driving dataset for heterogeneous multitask learning
Details
CVPR 2020Project
The apolloscape dataset for autonomous driving
Details
CVPR 2018Project
Tumtraf v2x cooperative perception dataset
Details
CVPR 2024Project
Tumtraf intersection dataset: All you need for urban 3d camera-lidar roadside perception
Details Presents an urban roadside camera-LiDAR dataset for 3D perception at intersections, supporting infrastructure-side cooperative perception research.
ITSC 2023Code / Project
V2v4real: A real-world large-scale dataset for vehicle-to-vehicle cooperative perception
Details Introduces a real-world V2V cooperative perception dataset with synchronized multi-vehicle sensing for studying collaboration under realistic communication and viewpoint constraints.
CVPR 2023Project
Rope3d: The roadside perception dataset for autonomous driving and monocular 3d object detection task
Details
CVPR 2022Project
Cooperative perception for 3D object detection in driving scenarios using infrastructure sensors
Details
TITS 2020
Lumpi: The leibniz university multi-perspective intersection dataset
Details
IV 2022Project
An automated driving systems data acquisition and analytics platform
Details
TRC 2023
S-nerf++: Autonomous driving simulation via neural reconstruction and generation
Details
TPAMI 2025Code
ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration
Details Builds driving world models for scene reconstruction through online restoration, improving reconstruction quality and temporal consistency for simulation and data generation.
CVPR 2025
Scene reconstruction techniques for autonomous driving: a review of 3D Gaussian splatting
Details
AIR
Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving
Details
CVPR 2024Code / Project
Scenecontrol: Diffusion for controllable traffic scene generation
Details
ICRA 2024
Diffscene: Diffusion-based safety-critical scenario generation for autonomous vehicles
Details
AAAI 2025
Simulation-based reinforcement learning for real-world autonomous driving
Details
ICRA 2020

Supervision and Alignment of Labels

Data Valuation and Governance

TitleAbstractYearProject
ScenePilot: Controllable Boundary-Driven Critical Scenario Generation for Autonomous Driving
Details Generates controllable safety-critical driving scenarios by modeling boundary conditions, enabling targeted stress testing for autonomous-driving policies.
arXiv 2026
Guiding Neuro-Symbolic Scenario Generation with Spatio-Temporal Logic
Details Combines neural generation with spatio-temporal logic constraints to synthesize driving scenarios that satisfy explicit temporal and safety specifications.
arXiv 2026
Learning Responsibility-Attributed Adversarial Scenarios for Testing Autonomous Vehicles
Details Constructs adversarial testing scenarios with responsibility attribution, helping diagnose which agents or interactions induce autonomous-driving failures.
arXiv 2026
PCASim: Promptable Closed-loop Adversarial Simulation for Urban Traffic Environment
Details Introduces a promptable closed-loop adversarial simulator for urban traffic, enabling language-guided generation of challenging test cases.
arXiv 2026
Diversified Critical-Scenario-Search for Defect Detection of Autonomous Driving System
Details
TIV 2024
Boosting offline reinforcement learning for autonomous driving with hierarchical latent skills
Details
ICRA 2024
A scenario distribution model for effective and efficient testing of autonomous driving systems
Details
ASE 2022
Did we test all scenarios for automated and autonomous driving systems?
Details
ITSC 2019
Steerable Adversarial Scenario Generation through Test-Time Preference Alignment
Details
arXiv 2025Project
Llm-attacker: Enhancing closed-loop adversarial scenario generation for autonomous driving with large language models
Details
arXiv 2025
Embedding synthetic off-policy experience for autonomous driving via zero-shot curricula
Details
CRL 2023
Quantitative representation of autonomous driving scenario difficulty based on adversarial policy search
Details
Research 2025Project
King: Generating safety-critical driving scenarios for robust imitation via kinematics gradients
Details
ECCV 2022
Mitigating bias of deep neural networks for trustworthy traffic perception in autonomous systems
Details
IV 2024
Privacy-preserved federated learning for autonomous driving
Details
TITS 2021
ADD: An automatic desensitization fisheye dataset for autonomous driving
Details
EAAI 2023
Federated vehicular transformers and their federations: Privacy-preserving computing and cooperation for autonomous driving
Details
TIV 2022

Strategy Layer

Imitation Learning

TitleAbstractYearProject
CLOVER: Closed-Loop Value Estimation & Ranking for End-to-End Autonomous Driving Planning
Details Ranks candidate plans with closed-loop value estimation, improving planning selection by considering downstream interactive outcomes rather than only open-loop trajectory error.
arXiv 2026Code
Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives
Details Improves imitation-based driving by mining hard negative behaviors and training the policy to avoid unsafe actions in challenging scenarios.
arXiv 2026
Causality-Aware End-to-End Autonomous Driving via Ego-Centric Joint Scene Modeling
Details Models ego-centric scene causality jointly with driving policy learning, aiming to separate causal factors from spurious correlations for safer end-to-end planning.
arXiv 2026
Temporal Sampling Frequency Matters: A Capacity-Aware Study of End-to-End Driving Trajectory Prediction
Details Analyzes how temporal sampling frequency interacts with model capacity in trajectory prediction, offering guidance for data construction and policy training.
arXiv 2026
Future-Aware End-to-End Driving: Bidirectional Modeling of Trajectory Planning and Scene Evolution
Details Jointly models future scene evolution and ego trajectory planning, using bidirectional interactions between prediction and planning to improve driving decisions.
NeurIPS 2025Code
Perception in Plan: Coupled Perception and Planning for End-to-End Autonomous Driving
Details Couples perception and planning in a single end-to-end framework so planning supervision can shape perception features toward driving-relevant scene understanding.
AAAI 2026
Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and Planning
Details Uses historical prediction and future planning jointly, bridging temporal context and planning targets for stronger end-to-end driving performance.
CVPR 2025Code
Don't Shake the Wheel: Momentum-Aware Planning in End-to-End Autonomous Driving
Details Introduces momentum-aware planning to reduce unstable steering and improve trajectory smoothness while preserving planning accuracy.
CVPR 2025Code
Planning-oriented autonomous driving
Details
CVPR 2023Code
Transfuser: Imitation with transformer-based sensor fusion for autonomous driving
Details
TPAMI 2022Code
Safety-enhanced autonomous driving using interpretable sensor fusion transformer
Details
CoRL 2022Code
Reasonnet: End-to-end driving with temporal and global reasoning
Details
CVPR 2023Code
Ppad: Iterative interactions of prediction and planning for end-to-end autonomous driving
Details
ECCV 2024Code
Multi-modal fusion transformer for end-to-end autonomous driving
Details
CVPR 2021Code
Think twice before driving: Towards scalable decoders for end-to-end autonomous driving
Details
CVPR 2023Code
Learning from all vehicles
Details
CVPR 2022Code
Neat: Neural attention fields for end-to-end autonomous driving
Details
ICCV 2021Code
Learning to steer by mimicking features from heterogeneous auxiliary networks
Details
AAAI 2019Code
Driving on Registers
Details Investigates register-like internal representations for end-to-end driving, improving how models store and use scene context for planning.
arXiv 2026

Reinforcement Learning

TitleAbstractYearProject
Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving
Details Combines cognitive reasoning distillation with physical action learning, using reinforcement learning to align high-level foresight with low-level control.
arXiv 2026
MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving
Details Introduces latent multi-agent play to train end-to-end driving policies against interactive agents, improving robustness in socially complex traffic.
arXiv 2026
MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning
Details Uses transformer-based 3D affordance representations with reinforcement learning to improve robust urban driving under multi-modal sensory inputs.
arXiv 2026
DriveDPO: Policy Learning via Safety DPO For End-to-End Autonomous Driving
Details Applies safety-oriented Direct Preference Optimization to end-to-end driving policy learning, aligning planner outputs with safe trajectory preferences.
NeurIPS 2025
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
Details Trains end-to-end driving policies in large-scale 3D Gaussian Splatting environments, using reinforcement learning to bridge realistic simulation and closed-loop driving.
NeurIPS 2025Project / Code
Sim2Real-AD: A Modular Sim-to-Real Framework for Deploying VLM-Guided Reinforcement Learning in Real-World Autonomous Driving
Details Builds a modular sim-to-real pipeline for VLM-guided reinforcement learning, targeting deployable autonomous-driving policies beyond simulation.
arXiv 2026
DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving
Details Adapts latent world-model reinforcement learning to autonomous driving, reducing environment interaction cost through imagined rollouts.
arXiv 2026
DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving
Details Uses VLM-derived semantic rewards during offline training through a dual-pathway design, then removes VLM inference at deployment for real-time driving.
arXiv 2026Project
CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving
Details Models planning as a propose-evaluate-correct loop over motion tokens, using a collision critic and model-based RL to recover from unsafe candidate actions.
arXiv 2026
TADPO: Reinforcement Learning Goes Off-road
Details Off-road autonomous driving presents sparse-reward and high-risk exploration challenges; TADPO proposes an RL optimization scheme tailored for off-road robustness and safety trade-offs.
arXiv 2026
ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving
Details Combines chain-of-thought supervision with progressive reinforcement fine-tuning to align driving reasoning, intent, and trajectory planning.
arXiv 2026
Effective Learning Mechanism Based on Reward-Oriented Hierarchies for Sim-to-Real Adaption in Autonomous Driving Systems
Details
TITS 2025
Safe-state enhancement method for autonomous driving via direct hierarchical reinforcement learning
Details
TITS 2023
Imitation is not enough: Robustifying imitation with reinforcement learning for challenging driving scenarios
Details
IROS 2023
Safe reinforcement learning for autonomous vehicle using monte carlo tree search
Details
TITS 2021
Uncertainty-aware model-based reinforcement learning: Methodology and application in autonomous driving
Details
TIV 2022
Safety-aware causal representation for trustworthy offline reinforcement learning in autonomous driving
Details
RAL 2024
Improving generalization of transfer learning across domains using spatio-temporal features in autonomous driving
Details
arXiv 2021
Towards socially responsive autonomous vehicles: A reinforcement learning framework with driving priors and coordination awareness
Details
TIV 2023
Uncertainty-aware model-based offline reinforcement learning for automated driving
Details
RAL 2023
Towards safe and robust autonomous vehicle platooning: A self-organizing cooperative control framework
Details
arXiv 2024Project
Reinforced Refinement with Self-Aware Expansion for End-to-End Autonomous Driving
Details
TPAMI 2026

Diffusion Policy

TitleAbstractYearProject
DriveSafer: End-to-End Autonomous Driving with Safety Guidance
Details Adds explicit safety guidance to end-to-end driving, steering trajectory generation toward safer behavior in complex traffic scenes.
arXiv 2026
MISTY: High-Throughput Motion Planning via Mixer-based Single-step Drifting
Details Uses mixer-based single-step trajectory generation to accelerate motion planning while preserving multi-modal planning quality.
arXiv 2026
FeaXDrive: Feasibility-aware Trajectory-Centric Diffusion Planning for End-to-End Autonomous Driving
Details Introduces feasibility-aware diffusion planning centered on trajectory generation, improving the physical and driving-rule validity of predicted plans.
arXiv 2026
RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework
Details Scales reinforcement learning with a generator-discriminator framework, targeting stronger policy optimization for autonomous driving.
arXiv 2026
HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving
Details Combines hierarchical diffusion planning with metric-decoupled reinforcement learning to improve safety, comfort, and task progress separately.
arXiv 2026
Temporally Decoupled Diffusion Planning for Autonomous Driving
Details Decouples temporal components in diffusion-based planning, enabling more flexible long-horizon trajectory generation for autonomous driving.
arXiv 2026
DiffRefiner: Coarse to Fine Trajectory Planning via Diffusion Refinement with Semantic Interaction for End to End Autonomous Driving
Details Refines coarse trajectory proposals through diffusion with semantic interaction modeling, improving fine-grained planning in end-to-end driving.
AAAI 2026
Driving with Advice: Large Model as Motion Advisor for Joint Planning
Details Uses a large model as a motion advisor to guide joint planning, injecting high-level semantic advice into trajectory generation.
AAAI 2026
DiffE2E: Rethinking End-to-End Driving with a Hybrid Action Diffusion and Supervised Policy
Details Combines action diffusion with supervised policy learning, balancing generative trajectory diversity with stable end-to-end driving behavior.
NeurIPS 2025Project
WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
Details Generates future waypoints through parallel coarse-to-fine discrete flow matching and further optimizes closed-loop behavior with simulator-guided rewards.
CVPR 2026Code
Dichotomous Diffusion Policy Optimization
Details Proposes DIPOLE, a stable RL method for diffusion policies that decomposes policy improvement into reward-maximizing and reward-minimizing branches, enabling controllable inference and VLA driving experiments on NAVSIM.
ICLR 2026Project / Code
Diffusiondrive: Truncated diffusion model for end-to-end autonomous driving
Details
CVPR 2025Code
Diffvla: Vision-language guided diffusion planning for autonomous driving
Details
arXiv 2025
DiffAD: A Unified Diffusion Modeling Approach for Autonomous Driving
Details
arXiv 2025
A Knowledge-Driven Diffusion Policy for End-to-End Autonomous Driving Based on Expert Routing
Details
arXiv 2025Code / Project
Diffusion-based planning for autonomous driving with flexible guidance
Details
arXiv 2025
Diffusion-ES: Gradient-free planning with diffusion for autonomous and instruction-guided driving
Details
CVPR 2024
Uncertainty-Based Alternative Diffusion Policy for Safe Autonomous Driving
Details
TITS 2025
Recogdrive: A reinforced cognitive framework for end-to-end autonomous driving
Details
arXiv 2025
FlowDrive: Energy Flow Field for End-to-End Autonomous Driving
Details
arXiv 2025Project
Diffusion-based planning for autonomous driving with flexible guidance
Details
arXiv 2025

Multimodal Large Language Model

TitleAbstractYearProject
Lost in Fog: Sensor Perturbations Expose Reasoning Fragility in Driving VLAs
Details Evaluates driving VLA robustness under sensor perturbations such as fog, showing how perception degradation can expose fragile reasoning and planning behavior.
arXiv 2026
SafeAlign-VLA: A Negative-Enhanced Safe Alignment Framework for Risk-Aware Autonomous Driving
Details Aligns VLA driving behavior with safety preferences by emphasizing negative examples and risk-aware supervision during training.
arXiv 2026
CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving
Details Optimizes prompts in latent space with contrastive objectives, improving end-to-end driving policy adaptation without heavy model retraining.
arXiv 2026
MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving
Details Introduces a unified streaming VLA architecture for autonomous driving, integrating perception, language understanding, and action generation in an online setting.
arXiv 2026
OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
Details Performs one-step latent reasoning for planning while producing vision-language explanations, reducing multi-step reasoning overhead in VLA driving.
arXiv 2026Project
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
Details Unifies multiple driving paradigms in a VLA framework, connecting perception, reasoning, and action generation across different supervision modes.
arXiv 2026Code
SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model
Details Improves VLA driving through efficient action bridging and negative-recovery samples, helping policies learn to recover from unsafe or suboptimal actions.
arXiv 2026
UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
Details Unifies scene understanding, perception, and action planning in a VLA architecture for end-to-end autonomous driving.
arXiv 2026Code
ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving
Details Evaluates and improves instruction-conditioned driving robustness with counterfactual language and scene perturbations.
arXiv 2026
Vega: Learning to Drive with Natural Language Instructions
Details Trains driving policies conditioned on natural language instructions, connecting high-level command following with trajectory-level planning.
arXiv 2026
NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning
Details Shows that a data-efficient VLA policy can drive effectively without explicit chain-of-thought reasoning, reducing inference cost for deployment.
CVPR 2026Project
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
Details Adds cross-view geometric grounding to VLMs, improving spatial understanding and planning reliability in multi-view autonomous driving.
CVPR 2026Project / Code
FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
Details Proposes ReconPruner, a plug-and-play MAE-style visual token pruner that preserves foreground driving information; introduces nuScenes-FG with 241K image-mask pairs and improves nuScenes open-loop planning across pruning ratios.
AAAI 2026
VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
Details Adapts pretrained VLMs to safety-critical dashcam events with metadata captions, LLM descriptions, VQA pairs, and CoT supervision, improving collision and near-collision detection with interpretable reasoning traces.
arXiv 2026
Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning
Details Aligns VLM reasoning with end-to-end policy learning to reduce decision/planning inconsistency and improve reliability in complex driving scenes.
arXiv 2026
SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving
Details Proposes a scene-adaptive MoE VLA architecture that routes computation by scene context for stronger robustness and efficiency in end-to-end driving.
arXiv 2026
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
Details Introduces latent spatio-temporal reasoning for driving VLA models to improve long-horizon planning quality and robustness under complex scene dynamics.
arXiv 2026
Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models
Details Analyzes narrow-policy collapse in driving VLAs and proposes exploration-centric training to improve robustness in long-tail scenarios.
arXiv 2026
Modular Autonomy with Conversational Interaction: An LLM-driven Framework for Decision Making in Autonomous Driving
Details Connects an LLM-based conversational interface to modular autonomy software, translating passenger commands into validated driving-system actions.
IV 2026
SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving
Details Structures VLM driving cognition into scene, agent, and goal levels, producing compact representations for trajectory planning.
arXiv 2026
LatentVLA: Efficient Vision-Language Models for Autonomous Driving via Latent Action Prediction
Details Uses self-supervised latent action prediction and distillation to build efficient VLA driving policies with reduced language-annotation dependence.
arXiv 2026
A Vision-Language-Action Model with Visual Prompt for OFF-Road Autonomous Driving
Details Introduces OFF-EMMA, an off-road VLA driving model that uses visual prompts and self-consistent reasoning to improve trajectory planning on rough terrain.
arXiv 2026
FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder
Details
WACV 2026 Workshop
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
Details Adds counterfactual self-reflection to VLA driving, allowing the model to revise planned actions before trajectory generation in challenging scenes.
arXiv 2025
KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System
Details Combines driving knowledge retrieval with a value model to guide interpretable, value-aligned trajectory assessment and planning.
arXiv 2025
FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
Details
arXiv 2025Code
ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
Details
arXiv 2025Project / Code
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
Details
arXiv 2025Project
DSDrive: Distilling Large Language Model for Lightweight End-to-End Autonomous Driving with Unified Reasoning and Planning
Details
arXiv 2025
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
Details Develops a large vision-language-action model for end-to-end autonomous driving, connecting multi-view perception, language reasoning, and trajectory output.
AAAI 2026Code
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
Details Releases open weights and open data for driving VLA models, supporting reproducible research on language-conditioned autonomous driving.
arXiv 2025Code / Project
Towards Human-Centric Autonomous Driving: A Fast-Slow Architecture Integrating Large Language Model Guidance with Reinforcement Learning
Details Combines fast low-level control with slower LLM-guided reasoning and reinforcement learning to improve human-centric driving decisions.
ITSC 2025Project
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
Details Develops a vision-language reasoning model for cross-task autonomous driving, connecting perception, reasoning, and planning tasks.
arXiv 2025Project
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
Details Uses vision-language guidance to condition diffusion-based trajectory planning, combining semantic reasoning with generative action prediction.
arXiv 2025
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
Details Combines adaptive reasoning with reinforcement fine-tuning in a VLA driving model to improve planning under complex scene context.
NeurIPS 2025Code / Project
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
Details Extends large vision-language models to interactive autonomous-driving tasks such as question answering, decision support, and scene-grounded reasoning.
arXiv 2025
X-Driver: Explainable Autonomous Driving with Vision-Language Models
Details Uses vision-language models to produce explainable driving decisions, connecting visual evidence with action-level reasoning.
arXiv 2025
AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
Details Combines VLM reasoning with reinforcement learning to improve autonomous-driving decisions under complex scene context.
arXiv 2025Code
Sce2DriveX: A Generalized MLLM Framework for Scene-to-Drive Learning
Details Builds a generalized MLLM framework for translating scene understanding into driving decisions and trajectories.
arXiv 2025
VLM-MPC: Vision Language Foundation Model (VLM)-Guided Model Predictive Controller (MPC) for Autonomous Driving
Details Guides model predictive control with VLM-derived scene understanding and driving intent for autonomous driving.
ICML 2025
VLM-E2E: Enhancing End-to-End Autonomous Driving with Multi-modal Driver Attention Fusion
Details Fuses driver attention with multi-modal VLM features to enhance end-to-end autonomous-driving prediction and planning.
arXiv 2025
VLM-Assisted Continual learning for Visual Question Answering in Self-Driving
Details Uses VLM assistance for continual learning in self-driving visual question answering, reducing forgetting across driving domains.
arXiv 2025
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
Details
arXiv 2024Code / Project
CALMM-Drive: Confidence-Aware Autonomous Driving with Large Multimodal Model
Details Uses confidence-aware multimodal reasoning to improve reliability in end-to-end autonomous-driving decisions.
arXiv 2024
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
Details
WACV 2025Code
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
Details
arXiv 2024
TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning
Details Introduces text-guided SoftSort pooling to improve multi-view driving reasoning in VLMs.
arXiv 2025
LightEMMA: Lightweight End-to-End Multimodal Model for Autonomous Driving
Details Builds a lightweight multimodal end-to-end driving model for efficient planning and reasoning.
arXiv 2025Code
DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model
Details
RAL 2024Project
ADAPT: Action-aware Driving Caption Transformer
Details
ICRA 2023Code
Continuously Learning, Adapting, and Improving: A Dual-Process Approach to Autonomous Driving
Details
NeurIPS 2024Code
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
Details
arXiv 2024Project
LingoQA: Visual Question Answering for Autonomous Driving
Details
ECCV 2024Code
Training-Free Open-Ended Object Detection and Segmentation via Attention as Prompts
Details
NeurIPS 2024
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
Details Generates driving actions from vision-language instructions in a holistic end-to-end autonomous-driving framework.
arXiv 2025Code
Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving
Details Uses 3D vision-language pre-training to support generative trajectory planning for end-to-end autonomous driving.
arXiv 2025
FutureSightDrive: Visualizing Trajectory Planning with Spatio-Temporal CoT for Autonomous Driving
Details Uses spatio-temporal chain-of-thought visualization to make trajectory planning more interpretable and reasoning-aware.
arXiv 2025Code
Drive-R1: Bridging Reasoning and Planning in VLMs for Autonomous Driving with Reinforcement Learning
Details Uses reinforcement learning to bridge VLM reasoning and trajectory planning for autonomous driving.
arXiv 2025
ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
Details Introduces a reinforced cognitive framework that aligns perception, reasoning, and planning in end-to-end driving.
arXiv 2025Project / Code
ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving
Details Uses cognitive latent reasoning for hierarchical parallel trajectory planning in driving VLA models.
arXiv 2025Project
Large Multimodal Models for Embodied Intelligent Driving: The Next Frontier in Self-Driving?
Details Discusses embodied intelligent driving with large multimodal models, combining semantic understanding with policy optimization for continuous decision learning.
arXiv 2026

World Model

🔗Refer to Link

TitleAbstractYearProject
HEAT: Heterogeneous End-to-End Autonomous Driving via Trajectory-Guided World Models
Details Uses trajectory-guided world modeling to connect heterogeneous sensor inputs with end-to-end planning for autonomous driving.
arXiv 2026
Xiaomi EV World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving
Details Integrates scene reconstruction and future generation in a joint driving world model, supporting both representation learning and planning-oriented simulation.
arXiv 2026
EponaV2: Driving World Model with Comprehensive Future Reasoning
Details Extends driving world modeling with comprehensive future reasoning, improving long-horizon scene prediction and planning awareness.
arXiv 2026
The DAWN of World-Action Interactive Models
Details Studies world-action interaction models that jointly learn how actions affect future scene evolution, bridging prediction and control.
arXiv 2026
DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
Details Unifies video generation and driving planning with a geometry-grounded world-action model for action-conditioned future simulation.
arXiv 2026
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
Details Trains a latent world-action model that predicts action-conditioned future dynamics for end-to-end autonomous driving.
arXiv 2026
Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation
Details Unifies visual scene generation and motion planning representations so generated futures can directly support driving decisions.
arXiv 2026
Risk-Aware World Model Predictive Control for Generalizable End-to-End Autonomous Driving
Details Combines world-model prediction with risk-aware MPC to improve generalization and safety in end-to-end driving.
arXiv 2026
ResWorld: Temporal Residual World Model for End-to-End Autonomous Driving
Details Uses temporal residual world modeling to improve future scene prediction and planning-relevant representation learning.
ICLR 2026Code
Learning Vision-Language-Action World Models for Autonomous Driving
Details Builds a VLA world model that learns action-conditioned future prediction and planning-relevant representations from driving data.
CVPR 2026 FindingsProject
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
Details Connects multimodal scene understanding with generative world modeling, using future generation to support end-to-end driving.
arXiv 2026
ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving
Details Combines dense world modeling with exploration-oriented training to improve VLA driving performance in diverse scenarios.
arXiv 2026
Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving
Details Interleaves world modeling and planning in a unified VLA framework so imagined futures and actions can refine each other.
arXiv 2026
OccSim: Multi-kilometer Simulation with Long-horizon Occupancy World Models
Details Uses long-horizon occupancy world models to simulate multi-kilometer driving scenes for scalable evaluation and training.
arXiv 2026
AutoWorld: Scaling Multi-Agent Traffic Simulation with Self-Supervised World Models
Details Scales multi-agent traffic simulation with self-supervised world models, enabling realistic interaction modeling for driving policy training.
arXiv 2026
DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving
Details Uses dual latent world models for Gaussian-centric pre-training, aligning perception, reconstruction, and future prediction in autonomous driving.
arXiv 2026
Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception
Details Builds roadside infrastructure-centric world models that combine long temporal context with broad spatial coverage for cooperative perception.
arXiv 2026
DriveVA: Video Action Models are Zero-Shot Drivers
Details Explores whether video action models can act as zero-shot drivers by mapping visual context directly to driving actions.
arXiv 2026
Latent Chain-of-Thought World Modeling for End-to-End Driving
Details Introduces latent chain-of-thought reasoning inside driving world models to improve future prediction and downstream planning.
arXiv 2025
GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
Details Uses 4D occupancy guidance for physics-aware driving video generation, improving spatial and temporal consistency in world-model rollouts.
arXiv 2025
X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving
Details Builds a controllable ego-centric multi-camera world model to scale closed-loop evaluation and training for end-to-end driving policies.
arXiv 2026
DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving
Details Introduces a flow-based dynamic world model to better capture multi-modal future scene evolution for robust planning.
arXiv 2026Code
Latent World Models for Automated Driving: A Unified Taxonomy, Evaluation Framework, and Open Challenges
Details Provides a structured taxonomy and evaluation framework for latent driving world models, highlighting open challenges for reliable deployment.
arXiv 2026
Kinematics-Aware Latent World Models for Data-Efficient Autonomous Driving
Details Introduces kinematics-aware latent world modeling for improved data efficiency and physically consistent planning in autonomous driving.
arXiv 2026
MAD: Motion Appearance Decoupling for efficient Driving World Models
Details Decouples structured motion learning from appearance synthesis, adapting video diffusion models into controllable driving world models more efficiently.
arXiv 2026Project
WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving
Details Aligns latent world-model representation learning with planning through hierarchical decomposition and reinforcement fine-tuning for safer end-to-end driving.
AAAI 2026
Other Vehicle Trajectories Are Also Needed: A Driving World Model Unifies Ego-Other Vehicle Trajectories in Video Latent Space
Details Unifies ego and surrounding-vehicle trajectory modeling in video latent space, improving interaction-aware driving world prediction.
AAAI 2026
InDRiVE: Reward-Free World-Model Pretraining for Autonomous Driving via Latent Disagreement
Details Uses latent ensemble disagreement as intrinsic motivation for reward-free world-model pretraining, enabling reusable exploration policies for driving.
arXiv 2025
DriveLaW:Unifying Planning and Video Generation in a Latent Driving World
Details Unifies video generation and motion planning by sharing latent world representations between future prediction and trajectory generation.
arXiv 2025
3D-VLA: A 3D Vision-Language-Action Generative World Model
Details
ICML 2024Code
CarDreamer: Open-source learning platform for world-model-based autonomous driving
Details Provides an open-source learning platform for autonomous-driving research with world-model-based simulation and policy training.
IOTJ 2025Code
VL-SAFE: Vision-Language Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving
Details
arXiv 2025Project
Dual-Mind World Models: A General Framework for Learning in Dynamic Wireless Networks
Details
arXiv 2025
Addressing Corner Cases in Autonomous Driving: A World Model-based Approach with Mixture of Experts and LLMs
Details
arXiv 2025
From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction
Details Predicts collaborative future states and actions with a policy world model, linking multi-agent forecasting to planning.
NeurIPS 2025Code
Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
Details
arXiv 2025Project
SparseWorld: A Flexible, Adaptive, and Efficient 4D Occupancy World Model Powered by Sparse and Dynamic Queries
Details
arXiv 2025Code
OmniNWM: Omniscient Driving Navigation World Models
Details
arXiv 2025Project
DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
Details
arXiv 2025Code
IRL-VLA: Training a Vision-Language-Action Policy via Reward World Model
Details Trains a VLA policy with a reward world model, using learned future feedback to guide action optimization.
arXiv 2025Project / Code
TeraSim-World: Worldwide Safety-Critical Data Synthesis for End-to-End Autonomous Driving
Details
arXiv 2025Project
World4Drive: End-to-end autonomous driving via intention-aware physical latent world model
Details Uses an intention-aware physical latent world model to connect future dynamics prediction with end-to-end trajectory planning.
ICCV 2025Code
World model-based end-to-end scene generation for accident anticipation in autonomous driving
Details
arXiv 2025
DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation
Details
AAAI 2025Project
GAIA-1: A Generative World Model for Autonomous Driving
Details
arXiv 2023
Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving
Details
CVPR 2024Code / Project.
TrafficBots: Towards World Models for Autonomous Driving Simulation and Motion Prediction
Details
ICRA 2023Code
MaskGWM: A Generalizable Driving World Model with Video Mask Reconstruction
Details Learns a generalizable driving world model through video mask reconstruction, improving future generation and representation transfer.
CVPR 2025Project / Code
DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation
Details Uses world models as 4D data machines to generate temporally consistent driving scene representations for downstream perception tasks.
CVPR 2025Project
X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability
Details Generates large-scale driving scenes with high fidelity and flexible controls, supporting simulation, data synthesis, and policy evaluation.
NeurIPS 2025Project
Epona: Autoregressive Diffusion World Model for Autonomous Driving
Details Builds an autoregressive diffusion world model for autonomous driving, generating future scene rollouts conditioned on prior context.
ICCV 2025Project / Code
SceneDiffuser++: City-Scale Traffic Simulation via a Generative World Model
Details Uses a generative world model for city-scale traffic simulation, enabling controllable multi-agent scenario synthesis.
CVPR 2025
ReSim: Reliable World Simulation for Autonomous Driving
Details Provides a reliable world simulation framework for autonomous driving that emphasizes realistic closed-loop behavior and policy evaluation.
NeurIPS 2025Project / Code
End-to-end driving with online trajectory evaluation via BEV world model
Details Uses a BEV world model to evaluate trajectories online, improving end-to-end driving decisions through future-scene assessment.
ICCV 2025Code
Raw2Drive: Reinforcement Learning with Aligned World Models for End-to-End Autonomous Driving (in CARLA v2)
Details Aligns world models with reinforcement learning in CARLA v2, training end-to-end policies from raw observations through imagined and closed-loop feedback.
NeurIPS 2025
Semi-supervised vision-centric 3d occupancy world model for autonomous driving
Details
ICLR 2025
VL-SAFE: Vision-Language Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving
Details
arXiv 2025Project
AdaWM: Adaptive World-Model-Based Planning for Autonomous Driving
Details Uses adaptive world-model-based planning to improve future prediction and trajectory selection in autonomous driving.
ICLR 2025
Genad: Generative end-to-end autonomous driving
Details
ECCV 2024Code
COME: Adding Scene-Centric Forecasting Control to Occupancy World Model
Details Adds scene-centric forecasting control to occupancy world models, improving controllable future prediction for autonomous driving.
NeurIPS 2025Code
UniWorld: Autonomous Driving Pre-training via World Models
Details
arXiv 2023
Occ-LLM: Enhancing Autonomous Driving with Occupancy-Based Large Language Models
Details
ICRA 2025
UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving
Details Unifies VLM-based scene understanding, trajectory planning, and trajectory-conditioned future image generation within one driving world model.
arXiv 2026Project

Platform Layer

Distributed and Parallel Training Platform

TitleAbstractYearProject
OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models
Details Uses CPU-GPU memory swapping to reduce out-of-memory failures when training or serving large vision-language-action models.
arXiv 2026
X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference
Details Introduces cross-chunk block caching to accelerate inference for few-step autoregressive world models while preserving temporal consistency.
arXiv 2026
Object detection, distributed cloud computing and parallelization techniques for autonomous driving systems
Details
Applied sciences 2021
Memory-efficient pipeline-parallel dnn training
Details
ICML 2021
Efficient large-scale language model training on gpu clusters using megatron-lm
Details
SC 2021
Tesseract: Parallelize the tensor parallelism efficiently
Details
ICPP 2022
Adapipe: Optimizing pipeline parallelism with adaptive recomputation and partitioning
Details
ASPLOS 2024
Bpipe: Memory-balanced pipeline parallelism for training large language models
Details
ICML 2023
Hanayo: Harnessing wave-like pipeline parallelism for enhanced large model training efficiency
Details
SC 2023
Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models
Details
arXiv 2023Code / Project
Towards efficient generative large language model serving: A survey from algorithms to systems
Details
ACM Computing Surveys 2025
Llamafactory: Unified efficient fine-tuning of 100+ language models
Details
arXiv 2024Code / Project
Found in the middle: How language models use long contexts better via plug-and-play positional encoding
Details
NeurIPS 2024
Gshard: Scaling giant models with conditional computation and automatic sharding
Details
arXiv 2020
Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale
Details
ICML 2022Project
Zero: Memory optimizations toward training trillion parameter models
Details
SC 2020

Testing and Evaluation Platform

TitleAbstractYearProject
WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World
Details Evaluates driving world models across generation, reconstruction, action following, downstream usefulness, and human preference in real-world scenes.
CVPR 2026 OralProject / Code
Bench2Drive-Robust: Benchmarking Closed-Loop Autonomous Driving under Deployment Perturbations
Details Extends closed-loop driving evaluation with deployment perturbations such as sensor failures, ego-state noise, and compute-induced control delays.
arXiv 2026
MDrive: Benchmarking Closed-Loop Cooperative Driving for End-to-End Multi-agent Systems
Details Benchmarks closed-loop cooperative driving for end-to-end multi-agent systems, covering perception sharing, negotiation, and V2X interaction.
arXiv 2026
HiDrive: A Closed-Loop Benchmark for High-Level Autonomous Driving
Details Evaluates high-level driving capabilities including rule compliance, ethical reasoning, emergency response, and rare-object interaction in closed loop.
arXiv 2026Code
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
Details Tests ego-motion understanding in vision-centric foundation models, diagnosing physical grounding and temporal reasoning for autonomous driving.
arXiv 2026
STADA: Specification-based Testing for Autonomous Driving Agents
Details Introduces a specification-driven testing framework to systematically probe failure modes of autonomous driving agents and improve evaluation rigor.
arXiv 2026
Testing of autonomous driving systems: where are we and where should we go?
Details
ESEC/FSE 2022
ADEPT: A testing platform for simulated autonomous driving
Details
ASE 2022
Lgsvl simulator: A high fidelity simulator for autonomous driving
Details
ITSC 2020
Autonomous Vehicle Simulation
Details
Project
Metadrive: Composing diverse driving scenarios for generalizable reinforcement learning
Details
TPAMI 2022Code / Project
OpenCDA-ROS: Enabling seamless integration of simulation and real-world cooperative driving automation
Details
TIV 2023Code
On the real-world adversarial robustness of real-time semantic segmentation models for autonomous driving
Details
TNNLS 2023
A study on the driving performance analysis for autonomous vehicles through the real-road field operational test platform
Details
IJPEM 2024
Autonomous driving test system under hybrid reality: The role of digital twin technology
Details
IoT 2024
Is ego status all you need for open-loop end-to-end autonomous driving?
Details
CVPR 2024
Toward fair and thrilling autonomous racing: Governance rules and performance metrics for the autonomous one
Details
TIV 2023
Safebench: A benchmarking platform for safety evaluation of autonomous vehicles
Details
NeurIPS 2022

📊Datasets & Benchmarks

  • nuScenes : A large-scale multimodal dataset widely used for various AD tasks, including 3D object detection, tracking, and prediction. It features data from cameras, LiDAR, and radar, along with full sensor suites and map information. Several works like LightEMMA , OpenDriveVLA , and GPT-Driver utilize nuScenes for evaluation or data generation. It is also used for tasks like BEV retrieval and dense captioning.
  • 4DLidarOpen : An open multi-modal autonomous driving dataset centered on 4D FMCW LiDAR, providing point-wise radial velocity, multiple LiDAR types, surround-view cameras, ego poses, 3D boxes, track IDs, and benchmarks for detection, BEV segmentation, flow prediction, motion forecasting, and planning.
  • XWOD : Extreme Weather Object Detection benchmark with real-world traffic images across rain, snow, fog, haze/sand/dust, flooding, tornado, and wildfire conditions for studying weather-robust autonomous driving perception.
  • ScenePilot-Bench : A first-person driving VLM benchmark built on ScenePilot-4K, evaluating scene understanding, spatial perception, motion planning, and safety-aware reasoning across large-scale driving videos.
  • Bench2Drive-Robust : A closed-loop robustness benchmark for E2E-AD under deployment perturbations such as camera-stream failures, ego-state errors, and compute-induced control delay.
  • MDrive : A closed-loop cooperative driving benchmark for end-to-end multi-agent systems, covering V2X perception sharing, negotiation, Real2Sim conversion, and human-in-the-loop simulation.
  • HiDrive : A closed-loop benchmark emphasizing high-level and long-tail driving capabilities such as rule compliance, ethical reasoning, emergency response, and rare-object interaction.
  • EgoDyn-Bench : A diagnostic benchmark for evaluating ego-motion understanding and physical grounding in VLMs, MLLMs, and driving VLA models.
  • WorldLens : A full-spectrum benchmark for driving world models, evaluating generation, reconstruction, action-following, downstream-task usefulness, and human preference with WorldLens-26K annotations.
  • BDD-X (Berkeley DeepDrive eXplanation) : This dataset provides textual explanations for driving actions, making it particularly relevant for training and evaluating interpretable AD models. DriveGPT4 and ADAPT are evaluated on BDD-X. It contains video sequences with corresponding control signals and natural language narrations/reasoning.
  • Waymo Open Dataset (WOMD) : A large and diverse dataset with high-resolution sensor data, including LiDAR and camera imagery. Used in works like OmniDrive for Q&A data generation and by LLMs Powered Context-aware Motion Prediction. Also used for scene simulation in ChatSim. WOMD-Reasoning is a language dataset built upon WOMD focusing on interaction descriptions and driving intentions.
  • DriveLM : A benchmark and dataset focusing on driving with graph visual question answering. TS-VLM is evaluated on DriveLM. It aims to assess perception, prediction, and planning reasoning through QA pairs in a directed graph, with versions for CARLA and nuScenes.
  • LingoQA : A benchmark and dataset specifically designed for video question answering in autonomous driving. It contains over 419k QA pairs from 28k unique video scenarios, covering driving reasoning, object recognition, action justification, and scene description. It also proposes the Lingo-Judge evaluation metric.
  • DriveAction : DriveAction leverages real-world driving data actively collected by users of production-level autonomous vehicles to ensure broad and representative scenario coverage, provides high-level discrete behavior labels collected directly from users' actual driving operations, and implements a behavior-based tree-structured evaluation framework that explicitly links vision, language, and behavioral tasks to support comprehensive and task-specific evaluation.
  • CARLA Simulator & Datasets : While a simulator, CARLA is extensively used to generate data and evaluate AD models in closed-loop settings. Works like LeapAD , LMDrive , and LangProp use CARLA for experiments and data collection. DriveLM-Carla is a specific dataset generated using CARLA.
  • Argoverse : A dataset suite with a focus on motion forecasting, 3D tracking, and HD maps. Argoverse 2 is used in challenges like 3D Occupancy Forecasting.
  • KITTI : One of the pioneering datasets for autonomous driving, still used for tasks like 3D object detection and tracking.
  • Cityscapes : Focuses on semantic understanding of urban street scenes, primarily for semantic segmentation.
  • UCU Dataset (In-Cabin User Command Understanding) : Part of the LLVM-AD Workshop, this dataset contains 1,099 labeled user commands for autonomous vehicles, designed for training models to understand human instructions within the vehicle.
  • MAPLM (Large-Scale Vision-Language Dataset for Map and Traffic Scene Understanding) : Also from the LLVM-AD Workshop, MAPLM combines point cloud BEV and panoramic images for rich road scenario images and multi-level scene description data, used for QA tasks.
  • NuPrompt : A large-scale language prompt set based on nuScenes for driving scenes, consisting of 3D object-text pairs, used in Prompt4Driving.
  • nuDesign : A large-scale dataset (2300k sentences) constructed upon nuScenes via a rule-based auto-labeling methodology for 3D dense captioning.
  • LaMPilot : An interactive environment and dataset designed for evaluating LLM-based agents in a driving context, containing scenes for command tracking tasks.
  • DRAMA (Joint Risk Localization and Captioning in Driving) : Provides linguistic descriptions (with a focus on reasons) of driving risks associated with important objects.
  • Rank2Tell : A multimodal ego-centric dataset for ranking importance levels of objects/events and generating textual reasons for the importance.
  • HighwayEnv : A collection of environments for autonomous driving and tactical decision-making research, often used for RL-based approaches and LLM decision-making evaluations (e.g., by DiLu, MTD-GPT).

🧾Other Awesome Lists

These repositories offer broader collections of resources that may overlap with or complement the focus of this list.

Citation

If you find this repository helpful, a citation to our paper would be greatly appreciated:

@ARTICLE{xu2026survey,
  author={Xu, Chengkai and Cui, Yiming and Liu, Jiaqi and Guo, Yicheng and Qin, Cheng and Zhang, Geyuan and Dong, Xinwei and Fang, Shiyu and Hang, Peng and Sun, Jian},
  journal={IEEE Transactions on Intelligent Transportation Systems}, 
  title={A Survey on End-to-End Autonomous Driving Training From the Perspectives of Data, Strategy, and Platform}, 
  year={2026},
  volume={},
  number={},
  pages={1-20},
  keywords={Modeling;Training;Optimization;Autonomous driving;Safety;Surveys;Vehicles;Testing;Learning (artificial intelligence);Reinforcement learning;Autonomous vehicle;end-to-end;artificial intelligence;intelligent transportation system},
  doi={10.1109/TITS.2026.3695999}
}

Jiaaqiliu/Awesome-Training-Ecosystem-for-E2E-AD

A curated collection of papers on E2E-AD, aimed at researchers, engineers, and enthusiasts in the field of autonomous driving systems. This repository provides a comprehensive selection of papers, focusing primarily on the training methods and ecosystems that drive the development of intelligent autonomous vehicles.

101

88 commits

updated Jun 3, 2026

See the code

README

A Survey on End-to-End Autonomous Driving Training from the Perspectives of Data, Strategy, and Platform

TechRxiv Contribution Welcome GitHub star chart License

Welcome to this curated collection of papers on End-to-End Autonomous Driving (E2E-AD), aimed at researchers, engineers, and enthusiasts in the field of autonomous driving systems. This repository provides a comprehensive selection of papers, focusing primarily on the training methods and ecosystems that drive the development of intelligent autonomous vehicles.

In particular, we focus on the Data-Strategy-Platform framework for E2E-AD systems, offering insights into:

  • Data Layer: Addressing data collection, coverage, and governance practices.
  • Strategy Layer: Exploring imitation learning, reinforcement learning, and generative approaches.
  • Platform Layer: Understanding scalable training infrastructures and cloud-edge collaborations.

Each paper in this repository has been selected for its relevance and contribution to the field, and we hope it serves as a valuable resource for anyone working in or learning about autonomous driving technology.


📰 News

🎉 2026.05.20Our survey was accepted by IEEE Transactions on Intelligent Transportation Systems (TITS).
🔄 2026.05.22Repository updated with the latest E2E-AD training ecosystem papers and resources.

🤝 Contributions Are Welcome

We warmly welcome pull requests and suggestions for adding new papers, benchmarks, datasets, and useful resources.

If you find this repository helpful, please consider citing our survey, starring this repository ⭐, and sharing it with the community.


📌 Framework

Framework Overview

Table of Contents


📚Survey Papers

TitleYearCategoriesProject
End-to-end Autonomous Driving: Challenges and FrontiersTPAMI 2025End to EndProject
A Survey of World Models for Autonomous DrivingarXiv 2025World ModelProject / Benchmark
Generative AI for Autonomous Driving: Frontiers and OpportunitiesarXiv 2025Generative AIProject
A Survey on Vision-Language-Action Models for Autonomous DrivingarXiv 2025Vision-Language-ActionProject
World models for autonomous driving: An initial surveyTIV 2024World Model
Synthetic datasets for autonomous driving: A surveyTIV 2023Datasets
Explainable AI for safe and trustworthy autonomous driving: A systematic reviewTITS 2024XAI
On the Prospects of Incorporating Large Language Models (LLMs) in Automated Planning and SchedulingICAPS 2024Large Language ModelsProject
Prospective role of foundation models in advancing autonomous vehiclesResearch 2024Foundation Models
Large models for intelligent transportation systems and autonomous vehicles: A surveyAEI 2024Foundation Models
Vision language models in autonomous driving: A survey and outlookIV 2024Foundation ModelsProject
A Survey on Multimodal Large Language Models for Autonomous DrivingWACV 2024Foundation Models
A survey for foundation models in autonomous drivingarXiv 2024Foundation Models
Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and OpportunitiesarXiv 2024Foundation Models
Llm4drive: A survey of large language models for autonomous drivingarXiv 2023Large Language ModelsProject
V2X cooperative perception for autonomous driving: Recent advances and challengesarXiv 2023Datasets
Learning-based 3D Reconstruction in Autonomous Driving: A Comprehensive SurveyarXiv 2025Datasets

📄Research Papers

Data Layer

Sources and Scenario Coverage

TitleAbstractYearProject
Closed Loop Dynamic Driving Data Mixture for Real-Synthetic Co-Training
Details Proposes AutoScale, a closed-loop data engine that optimizes real-synthetic driving data mixtures with scene representations, cluster reweighting, retrieval, training, and evaluation feedback.
arXiv 2026
4DLidarOpen: An Open 4D FMCW Lidar Dataset for Motion-Aware Autonomous Driving
Details Introduces a multi-modal 4D FMCW LiDAR dataset with point-wise velocity, multi-LiDAR and camera streams, 3D boxes, tracks, and benchmarks for detection, BEV flow, forecasting, and planning.
arXiv 2026
XWOD: A Real-World Benchmark for Object Detection under Extreme Weather Conditions
Details Builds an extreme-weather object-detection benchmark with real traffic images across rain, snow, fog, flooding, tornado, wildfire, and other adverse conditions.
arXiv 2026
ScenePilot-Bench: A Large-Scale Dataset and Benchmark for Evaluation of Vision-Language Models in Autonomous Driving
Details Provides a first-person driving VLM benchmark built on ScenePilot-4K, evaluating scene understanding, spatial perception, motion planning, safety reasoning, and regional generalization.
arXiv 2026Dataset
VR-Drive: Viewpoint-Robust End-to-End Driving with Feed-Forward 3D Gaussian Splatting
Details Uses feed-forward 3D Gaussian Splatting to synthesize viewpoint-robust driving observations, improving end-to-end policy robustness under camera pose and viewpoint changes.
NeurIPS 2025Project
WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios
Details Adapts Waymo Open Dataset into an end-to-end driving benchmark emphasizing challenging long-tail scenes for planning-oriented policy evaluation.
arXiv 2025Project
SimScale: Learning to Drive via Real-World Simulation at Scale
Details Scales real-world simulation for closed-loop end-to-end driving by converting large-scale logs into interactive training environments for policy learning and evaluation.
CVPR 2026 OralProject / Code
SynAD: Enhancing Real-World End-to-End Autonomous Driving Models through Synthetic Data
Details Studies synthetic-data augmentation for real-world end-to-end driving models, targeting better robustness and generalization under data scarcity and long-tail scenarios.
ICCV 2025
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
Details
WACV 2025Project
Argoverse 2: Next generation datasets for self-driving perception and forecasting
Details
arXiv 2023Project
WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving
Details
ICML 2025Code / Project
nuscenes: A multimodal dataset for autonomous driving
Details
CVPR 2020Project
One million scenes for autonomous driving: Once dataset
Details
arXiv 2021Project
Scalability in perception for autonomous driving: Waymo open dataset
Details Introduces the Waymo Open Dataset for scalable autonomous-driving perception research, including synchronized LiDAR, camera, labels, and benchmarks for detection and tracking.
CVPR 2020Project
Zenseact Open Dataset: A Large-Scale and Diverse Multimodal Dataset for Autonomous Driving
Details Introduces a large-scale multimodal autonomous-driving dataset with diverse European driving scenes and annotations for perception, prediction, and planning research.
ICCV 2023Project
Scaling out-of-distribution detection for real-world settings
Details
PMLR 2022Code
SHIFT: a synthetic driving dataset for continuous multi-task domain adaptation
Details Introduces a synthetic driving dataset for continuous domain adaptation across weather, time, and scene changes, supporting multiple perception tasks.
CVPR 2022Project
V2x-vit: Vehicle-to-everything cooperative perception with vision transformer
Details
ECCV 2022Code
Deepaccident: A motion and accident prediction benchmark for v2x autonomous driving
Details Provides a V2X benchmark for accident and motion prediction, focusing on safety-critical cooperative driving scenarios.
AAAI 2024
Bdd100k: A diverse driving dataset for heterogeneous multitask learning
Details
CVPR 2020Project
The apolloscape dataset for autonomous driving
Details
CVPR 2018Project
Tumtraf v2x cooperative perception dataset
Details
CVPR 2024Project
Tumtraf intersection dataset: All you need for urban 3d camera-lidar roadside perception
Details Presents an urban roadside camera-LiDAR dataset for 3D perception at intersections, supporting infrastructure-side cooperative perception research.
ITSC 2023Code / Project
V2v4real: A real-world large-scale dataset for vehicle-to-vehicle cooperative perception
Details Introduces a real-world V2V cooperative perception dataset with synchronized multi-vehicle sensing for studying collaboration under realistic communication and viewpoint constraints.
CVPR 2023Project
Rope3d: The roadside perception dataset for autonomous driving and monocular 3d object detection task
Details
CVPR 2022Project
Cooperative perception for 3D object detection in driving scenarios using infrastructure sensors
Details
TITS 2020
Lumpi: The leibniz university multi-perspective intersection dataset
Details
IV 2022Project
An automated driving systems data acquisition and analytics platform
Details
TRC 2023
S-nerf++: Autonomous driving simulation via neural reconstruction and generation
Details
TPAMI 2025Code
ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration
Details Builds driving world models for scene reconstruction through online restoration, improving reconstruction quality and temporal consistency for simulation and data generation.
CVPR 2025
Scene reconstruction techniques for autonomous driving: a review of 3D Gaussian splatting
Details
AIR
Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving
Details
CVPR 2024Code / Project
Scenecontrol: Diffusion for controllable traffic scene generation
Details
ICRA 2024
Diffscene: Diffusion-based safety-critical scenario generation for autonomous vehicles
Details
AAAI 2025
Simulation-based reinforcement learning for real-world autonomous driving
Details
ICRA 2020

Supervision and Alignment of Labels

Data Valuation and Governance

TitleAbstractYearProject
ScenePilot: Controllable Boundary-Driven Critical Scenario Generation for Autonomous Driving
Details Generates controllable safety-critical driving scenarios by modeling boundary conditions, enabling targeted stress testing for autonomous-driving policies.
arXiv 2026
Guiding Neuro-Symbolic Scenario Generation with Spatio-Temporal Logic
Details Combines neural generation with spatio-temporal logic constraints to synthesize driving scenarios that satisfy explicit temporal and safety specifications.
arXiv 2026
Learning Responsibility-Attributed Adversarial Scenarios for Testing Autonomous Vehicles
Details Constructs adversarial testing scenarios with responsibility attribution, helping diagnose which agents or interactions induce autonomous-driving failures.
arXiv 2026
PCASim: Promptable Closed-loop Adversarial Simulation for Urban Traffic Environment
Details Introduces a promptable closed-loop adversarial simulator for urban traffic, enabling language-guided generation of challenging test cases.
arXiv 2026
Diversified Critical-Scenario-Search for Defect Detection of Autonomous Driving System
Details
TIV 2024
Boosting offline reinforcement learning for autonomous driving with hierarchical latent skills
Details
ICRA 2024
A scenario distribution model for effective and efficient testing of autonomous driving systems
Details
ASE 2022
Did we test all scenarios for automated and autonomous driving systems?
Details
ITSC 2019
Steerable Adversarial Scenario Generation through Test-Time Preference Alignment
Details
arXiv 2025Project
Llm-attacker: Enhancing closed-loop adversarial scenario generation for autonomous driving with large language models
Details
arXiv 2025
Embedding synthetic off-policy experience for autonomous driving via zero-shot curricula
Details
CRL 2023
Quantitative representation of autonomous driving scenario difficulty based on adversarial policy search
Details
Research 2025Project
King: Generating safety-critical driving scenarios for robust imitation via kinematics gradients
Details
ECCV 2022
Mitigating bias of deep neural networks for trustworthy traffic perception in autonomous systems
Details
IV 2024
Privacy-preserved federated learning for autonomous driving
Details
TITS 2021
ADD: An automatic desensitization fisheye dataset for autonomous driving
Details
EAAI 2023
Federated vehicular transformers and their federations: Privacy-preserving computing and cooperation for autonomous driving
Details
TIV 2022

Strategy Layer

Imitation Learning

TitleAbstractYearProject
CLOVER: Closed-Loop Value Estimation & Ranking for End-to-End Autonomous Driving Planning
Details Ranks candidate plans with closed-loop value estimation, improving planning selection by considering downstream interactive outcomes rather than only open-loop trajectory error.
arXiv 2026Code
Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives
Details Improves imitation-based driving by mining hard negative behaviors and training the policy to avoid unsafe actions in challenging scenarios.
arXiv 2026
Causality-Aware End-to-End Autonomous Driving via Ego-Centric Joint Scene Modeling
Details Models ego-centric scene causality jointly with driving policy learning, aiming to separate causal factors from spurious correlations for safer end-to-end planning.
arXiv 2026
Temporal Sampling Frequency Matters: A Capacity-Aware Study of End-to-End Driving Trajectory Prediction
Details Analyzes how temporal sampling frequency interacts with model capacity in trajectory prediction, offering guidance for data construction and policy training.
arXiv 2026
Future-Aware End-to-End Driving: Bidirectional Modeling of Trajectory Planning and Scene Evolution
Details Jointly models future scene evolution and ego trajectory planning, using bidirectional interactions between prediction and planning to improve driving decisions.
NeurIPS 2025Code
Perception in Plan: Coupled Perception and Planning for End-to-End Autonomous Driving
Details Couples perception and planning in a single end-to-end framework so planning supervision can shape perception features toward driving-relevant scene understanding.
AAAI 2026
Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and Planning
Details Uses historical prediction and future planning jointly, bridging temporal context and planning targets for stronger end-to-end driving performance.
CVPR 2025Code
Don't Shake the Wheel: Momentum-Aware Planning in End-to-End Autonomous Driving
Details Introduces momentum-aware planning to reduce unstable steering and improve trajectory smoothness while preserving planning accuracy.
CVPR 2025Code
Planning-oriented autonomous driving
Details
CVPR 2023Code
Transfuser: Imitation with transformer-based sensor fusion for autonomous driving
Details
TPAMI 2022Code
Safety-enhanced autonomous driving using interpretable sensor fusion transformer
Details
CoRL 2022Code
Reasonnet: End-to-end driving with temporal and global reasoning
Details
CVPR 2023Code
Ppad: Iterative interactions of prediction and planning for end-to-end autonomous driving
Details
ECCV 2024Code
Multi-modal fusion transformer for end-to-end autonomous driving
Details
CVPR 2021Code
Think twice before driving: Towards scalable decoders for end-to-end autonomous driving
Details
CVPR 2023Code
Learning from all vehicles
Details
CVPR 2022Code
Neat: Neural attention fields for end-to-end autonomous driving
Details
ICCV 2021Code
Learning to steer by mimicking features from heterogeneous auxiliary networks
Details
AAAI 2019Code
Driving on Registers
Details Investigates register-like internal representations for end-to-end driving, improving how models store and use scene context for planning.
arXiv 2026

Reinforcement Learning

TitleAbstractYearProject
Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving
Details Combines cognitive reasoning distillation with physical action learning, using reinforcement learning to align high-level foresight with low-level control.
arXiv 2026
MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving
Details Introduces latent multi-agent play to train end-to-end driving policies against interactive agents, improving robustness in socially complex traffic.
arXiv 2026
MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning
Details Uses transformer-based 3D affordance representations with reinforcement learning to improve robust urban driving under multi-modal sensory inputs.
arXiv 2026
DriveDPO: Policy Learning via Safety DPO For End-to-End Autonomous Driving
Details Applies safety-oriented Direct Preference Optimization to end-to-end driving policy learning, aligning planner outputs with safe trajectory preferences.
NeurIPS 2025
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
Details Trains end-to-end driving policies in large-scale 3D Gaussian Splatting environments, using reinforcement learning to bridge realistic simulation and closed-loop driving.
NeurIPS 2025Project / Code
Sim2Real-AD: A Modular Sim-to-Real Framework for Deploying VLM-Guided Reinforcement Learning in Real-World Autonomous Driving
Details Builds a modular sim-to-real pipeline for VLM-guided reinforcement learning, targeting deployable autonomous-driving policies beyond simulation.
arXiv 2026
DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving
Details Adapts latent world-model reinforcement learning to autonomous driving, reducing environment interaction cost through imagined rollouts.
arXiv 2026
DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving
Details Uses VLM-derived semantic rewards during offline training through a dual-pathway design, then removes VLM inference at deployment for real-time driving.
arXiv 2026Project
CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving
Details Models planning as a propose-evaluate-correct loop over motion tokens, using a collision critic and model-based RL to recover from unsafe candidate actions.
arXiv 2026
TADPO: Reinforcement Learning Goes Off-road
Details Off-road autonomous driving presents sparse-reward and high-risk exploration challenges; TADPO proposes an RL optimization scheme tailored for off-road robustness and safety trade-offs.
arXiv 2026
ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving
Details Combines chain-of-thought supervision with progressive reinforcement fine-tuning to align driving reasoning, intent, and trajectory planning.
arXiv 2026
Effective Learning Mechanism Based on Reward-Oriented Hierarchies for Sim-to-Real Adaption in Autonomous Driving Systems
Details
TITS 2025
Safe-state enhancement method for autonomous driving via direct hierarchical reinforcement learning
Details
TITS 2023
Imitation is not enough: Robustifying imitation with reinforcement learning for challenging driving scenarios
Details
IROS 2023
Safe reinforcement learning for autonomous vehicle using monte carlo tree search
Details
TITS 2021
Uncertainty-aware model-based reinforcement learning: Methodology and application in autonomous driving
Details
TIV 2022
Safety-aware causal representation for trustworthy offline reinforcement learning in autonomous driving
Details
RAL 2024
Improving generalization of transfer learning across domains using spatio-temporal features in autonomous driving
Details
arXiv 2021
Towards socially responsive autonomous vehicles: A reinforcement learning framework with driving priors and coordination awareness
Details
TIV 2023
Uncertainty-aware model-based offline reinforcement learning for automated driving
Details
RAL 2023
Towards safe and robust autonomous vehicle platooning: A self-organizing cooperative control framework
Details
arXiv 2024Project
Reinforced Refinement with Self-Aware Expansion for End-to-End Autonomous Driving
Details
TPAMI 2026

Diffusion Policy

TitleAbstractYearProject
DriveSafer: End-to-End Autonomous Driving with Safety Guidance
Details Adds explicit safety guidance to end-to-end driving, steering trajectory generation toward safer behavior in complex traffic scenes.
arXiv 2026
MISTY: High-Throughput Motion Planning via Mixer-based Single-step Drifting
Details Uses mixer-based single-step trajectory generation to accelerate motion planning while preserving multi-modal planning quality.
arXiv 2026
FeaXDrive: Feasibility-aware Trajectory-Centric Diffusion Planning for End-to-End Autonomous Driving
Details Introduces feasibility-aware diffusion planning centered on trajectory generation, improving the physical and driving-rule validity of predicted plans.
arXiv 2026
RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework
Details Scales reinforcement learning with a generator-discriminator framework, targeting stronger policy optimization for autonomous driving.
arXiv 2026
HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving
Details Combines hierarchical diffusion planning with metric-decoupled reinforcement learning to improve safety, comfort, and task progress separately.
arXiv 2026
Temporally Decoupled Diffusion Planning for Autonomous Driving
Details Decouples temporal components in diffusion-based planning, enabling more flexible long-horizon trajectory generation for autonomous driving.
arXiv 2026
DiffRefiner: Coarse to Fine Trajectory Planning via Diffusion Refinement with Semantic Interaction for End to End Autonomous Driving
Details Refines coarse trajectory proposals through diffusion with semantic interaction modeling, improving fine-grained planning in end-to-end driving.
AAAI 2026
Driving with Advice: Large Model as Motion Advisor for Joint Planning
Details Uses a large model as a motion advisor to guide joint planning, injecting high-level semantic advice into trajectory generation.
AAAI 2026
DiffE2E: Rethinking End-to-End Driving with a Hybrid Action Diffusion and Supervised Policy
Details Combines action diffusion with supervised policy learning, balancing generative trajectory diversity with stable end-to-end driving behavior.
NeurIPS 2025Project
WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
Details Generates future waypoints through parallel coarse-to-fine discrete flow matching and further optimizes closed-loop behavior with simulator-guided rewards.
CVPR 2026Code
Dichotomous Diffusion Policy Optimization
Details Proposes DIPOLE, a stable RL method for diffusion policies that decomposes policy improvement into reward-maximizing and reward-minimizing branches, enabling controllable inference and VLA driving experiments on NAVSIM.
ICLR 2026Project / Code
Diffusiondrive: Truncated diffusion model for end-to-end autonomous driving
Details
CVPR 2025Code
Diffvla: Vision-language guided diffusion planning for autonomous driving
Details
arXiv 2025
DiffAD: A Unified Diffusion Modeling Approach for Autonomous Driving
Details
arXiv 2025
A Knowledge-Driven Diffusion Policy for End-to-End Autonomous Driving Based on Expert Routing
Details
arXiv 2025Code / Project
Diffusion-based planning for autonomous driving with flexible guidance
Details
arXiv 2025
Diffusion-ES: Gradient-free planning with diffusion for autonomous and instruction-guided driving
Details
CVPR 2024
Uncertainty-Based Alternative Diffusion Policy for Safe Autonomous Driving
Details
TITS 2025
Recogdrive: A reinforced cognitive framework for end-to-end autonomous driving
Details
arXiv 2025
FlowDrive: Energy Flow Field for End-to-End Autonomous Driving
Details
arXiv 2025Project
Diffusion-based planning for autonomous driving with flexible guidance
Details
arXiv 2025

Multimodal Large Language Model

TitleAbstractYearProject
Lost in Fog: Sensor Perturbations Expose Reasoning Fragility in Driving VLAs
Details Evaluates driving VLA robustness under sensor perturbations such as fog, showing how perception degradation can expose fragile reasoning and planning behavior.
arXiv 2026
SafeAlign-VLA: A Negative-Enhanced Safe Alignment Framework for Risk-Aware Autonomous Driving
Details Aligns VLA driving behavior with safety preferences by emphasizing negative examples and risk-aware supervision during training.
arXiv 2026
CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving
Details Optimizes prompts in latent space with contrastive objectives, improving end-to-end driving policy adaptation without heavy model retraining.
arXiv 2026
MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving
Details Introduces a unified streaming VLA architecture for autonomous driving, integrating perception, language understanding, and action generation in an online setting.
arXiv 2026
OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
Details Performs one-step latent reasoning for planning while producing vision-language explanations, reducing multi-step reasoning overhead in VLA driving.
arXiv 2026Project
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
Details Unifies multiple driving paradigms in a VLA framework, connecting perception, reasoning, and action generation across different supervision modes.
arXiv 2026Code
SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model
Details Improves VLA driving through efficient action bridging and negative-recovery samples, helping policies learn to recover from unsafe or suboptimal actions.
arXiv 2026
UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
Details Unifies scene understanding, perception, and action planning in a VLA architecture for end-to-end autonomous driving.
arXiv 2026Code
ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving
Details Evaluates and improves instruction-conditioned driving robustness with counterfactual language and scene perturbations.
arXiv 2026
Vega: Learning to Drive with Natural Language Instructions
Details Trains driving policies conditioned on natural language instructions, connecting high-level command following with trajectory-level planning.
arXiv 2026
NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning
Details Shows that a data-efficient VLA policy can drive effectively without explicit chain-of-thought reasoning, reducing inference cost for deployment.
CVPR 2026Project
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
Details Adds cross-view geometric grounding to VLMs, improving spatial understanding and planning reliability in multi-view autonomous driving.
CVPR 2026Project / Code
FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
Details Proposes ReconPruner, a plug-and-play MAE-style visual token pruner that preserves foreground driving information; introduces nuScenes-FG with 241K image-mask pairs and improves nuScenes open-loop planning across pruning ratios.
AAAI 2026
VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
Details Adapts pretrained VLMs to safety-critical dashcam events with metadata captions, LLM descriptions, VQA pairs, and CoT supervision, improving collision and near-collision detection with interpretable reasoning traces.
arXiv 2026
Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning
Details Aligns VLM reasoning with end-to-end policy learning to reduce decision/planning inconsistency and improve reliability in complex driving scenes.
arXiv 2026
SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving
Details Proposes a scene-adaptive MoE VLA architecture that routes computation by scene context for stronger robustness and efficiency in end-to-end driving.
arXiv 2026
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
Details Introduces latent spatio-temporal reasoning for driving VLA models to improve long-horizon planning quality and robustness under complex scene dynamics.
arXiv 2026
Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models
Details Analyzes narrow-policy collapse in driving VLAs and proposes exploration-centric training to improve robustness in long-tail scenarios.
arXiv 2026
Modular Autonomy with Conversational Interaction: An LLM-driven Framework for Decision Making in Autonomous Driving
Details Connects an LLM-based conversational interface to modular autonomy software, translating passenger commands into validated driving-system actions.
IV 2026
SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving
Details Structures VLM driving cognition into scene, agent, and goal levels, producing compact representations for trajectory planning.
arXiv 2026
LatentVLA: Efficient Vision-Language Models for Autonomous Driving via Latent Action Prediction
Details Uses self-supervised latent action prediction and distillation to build efficient VLA driving policies with reduced language-annotation dependence.
arXiv 2026
A Vision-Language-Action Model with Visual Prompt for OFF-Road Autonomous Driving
Details Introduces OFF-EMMA, an off-road VLA driving model that uses visual prompts and self-consistent reasoning to improve trajectory planning on rough terrain.
arXiv 2026
FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder
Details
WACV 2026 Workshop
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
Details Adds counterfactual self-reflection to VLA driving, allowing the model to revise planned actions before trajectory generation in challenging scenes.
arXiv 2025
KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System
Details Combines driving knowledge retrieval with a value model to guide interpretable, value-aligned trajectory assessment and planning.
arXiv 2025
FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
Details
arXiv 2025Code
ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
Details
arXiv 2025Project / Code
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
Details
arXiv 2025Project
DSDrive: Distilling Large Language Model for Lightweight End-to-End Autonomous Driving with Unified Reasoning and Planning
Details
arXiv 2025
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
Details Develops a large vision-language-action model for end-to-end autonomous driving, connecting multi-view perception, language reasoning, and trajectory output.
AAAI 2026Code
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
Details Releases open weights and open data for driving VLA models, supporting reproducible research on language-conditioned autonomous driving.
arXiv 2025Code / Project
Towards Human-Centric Autonomous Driving: A Fast-Slow Architecture Integrating Large Language Model Guidance with Reinforcement Learning
Details Combines fast low-level control with slower LLM-guided reasoning and reinforcement learning to improve human-centric driving decisions.
ITSC 2025Project
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
Details Develops a vision-language reasoning model for cross-task autonomous driving, connecting perception, reasoning, and planning tasks.
arXiv 2025Project
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
Details Uses vision-language guidance to condition diffusion-based trajectory planning, combining semantic reasoning with generative action prediction.
arXiv 2025
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
Details Combines adaptive reasoning with reinforcement fine-tuning in a VLA driving model to improve planning under complex scene context.
NeurIPS 2025Code / Project
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
Details Extends large vision-language models to interactive autonomous-driving tasks such as question answering, decision support, and scene-grounded reasoning.
arXiv 2025
X-Driver: Explainable Autonomous Driving with Vision-Language Models
Details Uses vision-language models to produce explainable driving decisions, connecting visual evidence with action-level reasoning.
arXiv 2025
AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
Details Combines VLM reasoning with reinforcement learning to improve autonomous-driving decisions under complex scene context.
arXiv 2025Code
Sce2DriveX: A Generalized MLLM Framework for Scene-to-Drive Learning
Details Builds a generalized MLLM framework for translating scene understanding into driving decisions and trajectories.
arXiv 2025
VLM-MPC: Vision Language Foundation Model (VLM)-Guided Model Predictive Controller (MPC) for Autonomous Driving
Details Guides model predictive control with VLM-derived scene understanding and driving intent for autonomous driving.
ICML 2025
VLM-E2E: Enhancing End-to-End Autonomous Driving with Multi-modal Driver Attention Fusion
Details Fuses driver attention with multi-modal VLM features to enhance end-to-end autonomous-driving prediction and planning.
arXiv 2025
VLM-Assisted Continual learning for Visual Question Answering in Self-Driving
Details Uses VLM assistance for continual learning in self-driving visual question answering, reducing forgetting across driving domains.
arXiv 2025
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
Details
arXiv 2024Code / Project
CALMM-Drive: Confidence-Aware Autonomous Driving with Large Multimodal Model
Details Uses confidence-aware multimodal reasoning to improve reliability in end-to-end autonomous-driving decisions.
arXiv 2024
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
Details
WACV 2025Code
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
Details
arXiv 2024
TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning
Details Introduces text-guided SoftSort pooling to improve multi-view driving reasoning in VLMs.
arXiv 2025
LightEMMA: Lightweight End-to-End Multimodal Model for Autonomous Driving
Details Builds a lightweight multimodal end-to-end driving model for efficient planning and reasoning.
arXiv 2025Code
DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model
Details
RAL 2024Project
ADAPT: Action-aware Driving Caption Transformer
Details
ICRA 2023Code
Continuously Learning, Adapting, and Improving: A Dual-Process Approach to Autonomous Driving
Details
NeurIPS 2024Code
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
Details
arXiv 2024Project
LingoQA: Visual Question Answering for Autonomous Driving
Details
ECCV 2024Code
Training-Free Open-Ended Object Detection and Segmentation via Attention as Prompts
Details
NeurIPS 2024
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
Details Generates driving actions from vision-language instructions in a holistic end-to-end autonomous-driving framework.
arXiv 2025Code
Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving
Details Uses 3D vision-language pre-training to support generative trajectory planning for end-to-end autonomous driving.
arXiv 2025
FutureSightDrive: Visualizing Trajectory Planning with Spatio-Temporal CoT for Autonomous Driving
Details Uses spatio-temporal chain-of-thought visualization to make trajectory planning more interpretable and reasoning-aware.
arXiv 2025Code
Drive-R1: Bridging Reasoning and Planning in VLMs for Autonomous Driving with Reinforcement Learning
Details Uses reinforcement learning to bridge VLM reasoning and trajectory planning for autonomous driving.
arXiv 2025
ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
Details Introduces a reinforced cognitive framework that aligns perception, reasoning, and planning in end-to-end driving.
arXiv 2025Project / Code
ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving
Details Uses cognitive latent reasoning for hierarchical parallel trajectory planning in driving VLA models.
arXiv 2025Project
Large Multimodal Models for Embodied Intelligent Driving: The Next Frontier in Self-Driving?
Details Discusses embodied intelligent driving with large multimodal models, combining semantic understanding with policy optimization for continuous decision learning.
arXiv 2026

World Model

🔗Refer to Link

TitleAbstractYearProject
HEAT: Heterogeneous End-to-End Autonomous Driving via Trajectory-Guided World Models
Details Uses trajectory-guided world modeling to connect heterogeneous sensor inputs with end-to-end planning for autonomous driving.
arXiv 2026
Xiaomi EV World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving
Details Integrates scene reconstruction and future generation in a joint driving world model, supporting both representation learning and planning-oriented simulation.
arXiv 2026
EponaV2: Driving World Model with Comprehensive Future Reasoning
Details Extends driving world modeling with comprehensive future reasoning, improving long-horizon scene prediction and planning awareness.
arXiv 2026
The DAWN of World-Action Interactive Models
Details Studies world-action interaction models that jointly learn how actions affect future scene evolution, bridging prediction and control.
arXiv 2026
DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
Details Unifies video generation and driving planning with a geometry-grounded world-action model for action-conditioned future simulation.
arXiv 2026
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
Details Trains a latent world-action model that predicts action-conditioned future dynamics for end-to-end autonomous driving.
arXiv 2026
Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation
Details Unifies visual scene generation and motion planning representations so generated futures can directly support driving decisions.
arXiv 2026
Risk-Aware World Model Predictive Control for Generalizable End-to-End Autonomous Driving
Details Combines world-model prediction with risk-aware MPC to improve generalization and safety in end-to-end driving.
arXiv 2026
ResWorld: Temporal Residual World Model for End-to-End Autonomous Driving
Details Uses temporal residual world modeling to improve future scene prediction and planning-relevant representation learning.
ICLR 2026Code
Learning Vision-Language-Action World Models for Autonomous Driving
Details Builds a VLA world model that learns action-conditioned future prediction and planning-relevant representations from driving data.
CVPR 2026 FindingsProject
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
Details Connects multimodal scene understanding with generative world modeling, using future generation to support end-to-end driving.
arXiv 2026
ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving
Details Combines dense world modeling with exploration-oriented training to improve VLA driving performance in diverse scenarios.
arXiv 2026
Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving
Details Interleaves world modeling and planning in a unified VLA framework so imagined futures and actions can refine each other.
arXiv 2026
OccSim: Multi-kilometer Simulation with Long-horizon Occupancy World Models
Details Uses long-horizon occupancy world models to simulate multi-kilometer driving scenes for scalable evaluation and training.
arXiv 2026
AutoWorld: Scaling Multi-Agent Traffic Simulation with Self-Supervised World Models
Details Scales multi-agent traffic simulation with self-supervised world models, enabling realistic interaction modeling for driving policy training.
arXiv 2026
DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving
Details Uses dual latent world models for Gaussian-centric pre-training, aligning perception, reconstruction, and future prediction in autonomous driving.
arXiv 2026
Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception
Details Builds roadside infrastructure-centric world models that combine long temporal context with broad spatial coverage for cooperative perception.
arXiv 2026
DriveVA: Video Action Models are Zero-Shot Drivers
Details Explores whether video action models can act as zero-shot drivers by mapping visual context directly to driving actions.
arXiv 2026
Latent Chain-of-Thought World Modeling for End-to-End Driving
Details Introduces latent chain-of-thought reasoning inside driving world models to improve future prediction and downstream planning.
arXiv 2025
GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
Details Uses 4D occupancy guidance for physics-aware driving video generation, improving spatial and temporal consistency in world-model rollouts.
arXiv 2025
X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving
Details Builds a controllable ego-centric multi-camera world model to scale closed-loop evaluation and training for end-to-end driving policies.
arXiv 2026
DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving
Details Introduces a flow-based dynamic world model to better capture multi-modal future scene evolution for robust planning.
arXiv 2026Code
Latent World Models for Automated Driving: A Unified Taxonomy, Evaluation Framework, and Open Challenges
Details Provides a structured taxonomy and evaluation framework for latent driving world models, highlighting open challenges for reliable deployment.
arXiv 2026
Kinematics-Aware Latent World Models for Data-Efficient Autonomous Driving
Details Introduces kinematics-aware latent world modeling for improved data efficiency and physically consistent planning in autonomous driving.
arXiv 2026
MAD: Motion Appearance Decoupling for efficient Driving World Models
Details Decouples structured motion learning from appearance synthesis, adapting video diffusion models into controllable driving world models more efficiently.
arXiv 2026Project
WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving
Details Aligns latent world-model representation learning with planning through hierarchical decomposition and reinforcement fine-tuning for safer end-to-end driving.
AAAI 2026
Other Vehicle Trajectories Are Also Needed: A Driving World Model Unifies Ego-Other Vehicle Trajectories in Video Latent Space
Details Unifies ego and surrounding-vehicle trajectory modeling in video latent space, improving interaction-aware driving world prediction.
AAAI 2026
InDRiVE: Reward-Free World-Model Pretraining for Autonomous Driving via Latent Disagreement
Details Uses latent ensemble disagreement as intrinsic motivation for reward-free world-model pretraining, enabling reusable exploration policies for driving.
arXiv 2025
DriveLaW:Unifying Planning and Video Generation in a Latent Driving World
Details Unifies video generation and motion planning by sharing latent world representations between future prediction and trajectory generation.
arXiv 2025
3D-VLA: A 3D Vision-Language-Action Generative World Model
Details
ICML 2024Code
CarDreamer: Open-source learning platform for world-model-based autonomous driving
Details Provides an open-source learning platform for autonomous-driving research with world-model-based simulation and policy training.
IOTJ 2025Code
VL-SAFE: Vision-Language Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving
Details
arXiv 2025Project
Dual-Mind World Models: A General Framework for Learning in Dynamic Wireless Networks
Details
arXiv 2025
Addressing Corner Cases in Autonomous Driving: A World Model-based Approach with Mixture of Experts and LLMs
Details
arXiv 2025
From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction
Details Predicts collaborative future states and actions with a policy world model, linking multi-agent forecasting to planning.
NeurIPS 2025Code
Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
Details
arXiv 2025Project
SparseWorld: A Flexible, Adaptive, and Efficient 4D Occupancy World Model Powered by Sparse and Dynamic Queries
Details
arXiv 2025Code
OmniNWM: Omniscient Driving Navigation World Models
Details
arXiv 2025Project
DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
Details
arXiv 2025Code
IRL-VLA: Training a Vision-Language-Action Policy via Reward World Model
Details Trains a VLA policy with a reward world model, using learned future feedback to guide action optimization.
arXiv 2025Project / Code
TeraSim-World: Worldwide Safety-Critical Data Synthesis for End-to-End Autonomous Driving
Details
arXiv 2025Project
World4Drive: End-to-end autonomous driving via intention-aware physical latent world model
Details Uses an intention-aware physical latent world model to connect future dynamics prediction with end-to-end trajectory planning.
ICCV 2025Code
World model-based end-to-end scene generation for accident anticipation in autonomous driving
Details
arXiv 2025
DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation
Details
AAAI 2025Project
GAIA-1: A Generative World Model for Autonomous Driving
Details
arXiv 2023
Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving
Details
CVPR 2024Code / Project.
TrafficBots: Towards World Models for Autonomous Driving Simulation and Motion Prediction
Details
ICRA 2023Code
MaskGWM: A Generalizable Driving World Model with Video Mask Reconstruction
Details Learns a generalizable driving world model through video mask reconstruction, improving future generation and representation transfer.
CVPR 2025Project / Code
DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation
Details Uses world models as 4D data machines to generate temporally consistent driving scene representations for downstream perception tasks.
CVPR 2025Project
X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability
Details Generates large-scale driving scenes with high fidelity and flexible controls, supporting simulation, data synthesis, and policy evaluation.
NeurIPS 2025Project
Epona: Autoregressive Diffusion World Model for Autonomous Driving
Details Builds an autoregressive diffusion world model for autonomous driving, generating future scene rollouts conditioned on prior context.
ICCV 2025Project / Code
SceneDiffuser++: City-Scale Traffic Simulation via a Generative World Model
Details Uses a generative world model for city-scale traffic simulation, enabling controllable multi-agent scenario synthesis.
CVPR 2025
ReSim: Reliable World Simulation for Autonomous Driving
Details Provides a reliable world simulation framework for autonomous driving that emphasizes realistic closed-loop behavior and policy evaluation.
NeurIPS 2025Project / Code
End-to-end driving with online trajectory evaluation via BEV world model
Details Uses a BEV world model to evaluate trajectories online, improving end-to-end driving decisions through future-scene assessment.
ICCV 2025Code
Raw2Drive: Reinforcement Learning with Aligned World Models for End-to-End Autonomous Driving (in CARLA v2)
Details Aligns world models with reinforcement learning in CARLA v2, training end-to-end policies from raw observations through imagined and closed-loop feedback.
NeurIPS 2025
Semi-supervised vision-centric 3d occupancy world model for autonomous driving
Details
ICLR 2025
VL-SAFE: Vision-Language Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving
Details
arXiv 2025Project
AdaWM: Adaptive World-Model-Based Planning for Autonomous Driving
Details Uses adaptive world-model-based planning to improve future prediction and trajectory selection in autonomous driving.
ICLR 2025
Genad: Generative end-to-end autonomous driving
Details
ECCV 2024Code
COME: Adding Scene-Centric Forecasting Control to Occupancy World Model
Details Adds scene-centric forecasting control to occupancy world models, improving controllable future prediction for autonomous driving.
NeurIPS 2025Code
UniWorld: Autonomous Driving Pre-training via World Models
Details
arXiv 2023
Occ-LLM: Enhancing Autonomous Driving with Occupancy-Based Large Language Models
Details
ICRA 2025
UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving
Details Unifies VLM-based scene understanding, trajectory planning, and trajectory-conditioned future image generation within one driving world model.
arXiv 2026Project

Platform Layer

Distributed and Parallel Training Platform

TitleAbstractYearProject
OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models
Details Uses CPU-GPU memory swapping to reduce out-of-memory failures when training or serving large vision-language-action models.
arXiv 2026
X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference
Details Introduces cross-chunk block caching to accelerate inference for few-step autoregressive world models while preserving temporal consistency.
arXiv 2026
Object detection, distributed cloud computing and parallelization techniques for autonomous driving systems
Details
Applied sciences 2021
Memory-efficient pipeline-parallel dnn training
Details
ICML 2021
Efficient large-scale language model training on gpu clusters using megatron-lm
Details
SC 2021
Tesseract: Parallelize the tensor parallelism efficiently
Details
ICPP 2022
Adapipe: Optimizing pipeline parallelism with adaptive recomputation and partitioning
Details
ASPLOS 2024
Bpipe: Memory-balanced pipeline parallelism for training large language models
Details
ICML 2023
Hanayo: Harnessing wave-like pipeline parallelism for enhanced large model training efficiency
Details
SC 2023
Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models
Details
arXiv 2023Code / Project
Towards efficient generative large language model serving: A survey from algorithms to systems
Details
ACM Computing Surveys 2025
Llamafactory: Unified efficient fine-tuning of 100+ language models
Details
arXiv 2024Code / Project
Found in the middle: How language models use long contexts better via plug-and-play positional encoding
Details
NeurIPS 2024
Gshard: Scaling giant models with conditional computation and automatic sharding
Details
arXiv 2020
Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale
Details
ICML 2022Project
Zero: Memory optimizations toward training trillion parameter models
Details
SC 2020

Testing and Evaluation Platform

TitleAbstractYearProject
WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World
Details Evaluates driving world models across generation, reconstruction, action following, downstream usefulness, and human preference in real-world scenes.
CVPR 2026 OralProject / Code
Bench2Drive-Robust: Benchmarking Closed-Loop Autonomous Driving under Deployment Perturbations
Details Extends closed-loop driving evaluation with deployment perturbations such as sensor failures, ego-state noise, and compute-induced control delays.
arXiv 2026
MDrive: Benchmarking Closed-Loop Cooperative Driving for End-to-End Multi-agent Systems
Details Benchmarks closed-loop cooperative driving for end-to-end multi-agent systems, covering perception sharing, negotiation, and V2X interaction.
arXiv 2026
HiDrive: A Closed-Loop Benchmark for High-Level Autonomous Driving
Details Evaluates high-level driving capabilities including rule compliance, ethical reasoning, emergency response, and rare-object interaction in closed loop.
arXiv 2026Code
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
Details Tests ego-motion understanding in vision-centric foundation models, diagnosing physical grounding and temporal reasoning for autonomous driving.
arXiv 2026
STADA: Specification-based Testing for Autonomous Driving Agents
Details Introduces a specification-driven testing framework to systematically probe failure modes of autonomous driving agents and improve evaluation rigor.
arXiv 2026
Testing of autonomous driving systems: where are we and where should we go?
Details
ESEC/FSE 2022
ADEPT: A testing platform for simulated autonomous driving
Details
ASE 2022
Lgsvl simulator: A high fidelity simulator for autonomous driving
Details
ITSC 2020
Autonomous Vehicle Simulation
Details
Project
Metadrive: Composing diverse driving scenarios for generalizable reinforcement learning
Details
TPAMI 2022Code / Project
OpenCDA-ROS: Enabling seamless integration of simulation and real-world cooperative driving automation
Details
TIV 2023Code
On the real-world adversarial robustness of real-time semantic segmentation models for autonomous driving
Details
TNNLS 2023
A study on the driving performance analysis for autonomous vehicles through the real-road field operational test platform
Details
IJPEM 2024
Autonomous driving test system under hybrid reality: The role of digital twin technology
Details
IoT 2024
Is ego status all you need for open-loop end-to-end autonomous driving?
Details
CVPR 2024
Toward fair and thrilling autonomous racing: Governance rules and performance metrics for the autonomous one
Details
TIV 2023
Safebench: A benchmarking platform for safety evaluation of autonomous vehicles
Details
NeurIPS 2022

📊Datasets & Benchmarks

  • nuScenes : A large-scale multimodal dataset widely used for various AD tasks, including 3D object detection, tracking, and prediction. It features data from cameras, LiDAR, and radar, along with full sensor suites and map information. Several works like LightEMMA , OpenDriveVLA , and GPT-Driver utilize nuScenes for evaluation or data generation. It is also used for tasks like BEV retrieval and dense captioning.
  • 4DLidarOpen : An open multi-modal autonomous driving dataset centered on 4D FMCW LiDAR, providing point-wise radial velocity, multiple LiDAR types, surround-view cameras, ego poses, 3D boxes, track IDs, and benchmarks for detection, BEV segmentation, flow prediction, motion forecasting, and planning.
  • XWOD : Extreme Weather Object Detection benchmark with real-world traffic images across rain, snow, fog, haze/sand/dust, flooding, tornado, and wildfire conditions for studying weather-robust autonomous driving perception.
  • ScenePilot-Bench : A first-person driving VLM benchmark built on ScenePilot-4K, evaluating scene understanding, spatial perception, motion planning, and safety-aware reasoning across large-scale driving videos.
  • Bench2Drive-Robust : A closed-loop robustness benchmark for E2E-AD under deployment perturbations such as camera-stream failures, ego-state errors, and compute-induced control delay.
  • MDrive : A closed-loop cooperative driving benchmark for end-to-end multi-agent systems, covering V2X perception sharing, negotiation, Real2Sim conversion, and human-in-the-loop simulation.
  • HiDrive : A closed-loop benchmark emphasizing high-level and long-tail driving capabilities such as rule compliance, ethical reasoning, emergency response, and rare-object interaction.
  • EgoDyn-Bench : A diagnostic benchmark for evaluating ego-motion understanding and physical grounding in VLMs, MLLMs, and driving VLA models.
  • WorldLens : A full-spectrum benchmark for driving world models, evaluating generation, reconstruction, action-following, downstream-task usefulness, and human preference with WorldLens-26K annotations.
  • BDD-X (Berkeley DeepDrive eXplanation) : This dataset provides textual explanations for driving actions, making it particularly relevant for training and evaluating interpretable AD models. DriveGPT4 and ADAPT are evaluated on BDD-X. It contains video sequences with corresponding control signals and natural language narrations/reasoning.
  • Waymo Open Dataset (WOMD) : A large and diverse dataset with high-resolution sensor data, including LiDAR and camera imagery. Used in works like OmniDrive for Q&A data generation and by LLMs Powered Context-aware Motion Prediction. Also used for scene simulation in ChatSim. WOMD-Reasoning is a language dataset built upon WOMD focusing on interaction descriptions and driving intentions.
  • DriveLM : A benchmark and dataset focusing on driving with graph visual question answering. TS-VLM is evaluated on DriveLM. It aims to assess perception, prediction, and planning reasoning through QA pairs in a directed graph, with versions for CARLA and nuScenes.
  • LingoQA : A benchmark and dataset specifically designed for video question answering in autonomous driving. It contains over 419k QA pairs from 28k unique video scenarios, covering driving reasoning, object recognition, action justification, and scene description. It also proposes the Lingo-Judge evaluation metric.
  • DriveAction : DriveAction leverages real-world driving data actively collected by users of production-level autonomous vehicles to ensure broad and representative scenario coverage, provides high-level discrete behavior labels collected directly from users' actual driving operations, and implements a behavior-based tree-structured evaluation framework that explicitly links vision, language, and behavioral tasks to support comprehensive and task-specific evaluation.
  • CARLA Simulator & Datasets : While a simulator, CARLA is extensively used to generate data and evaluate AD models in closed-loop settings. Works like LeapAD , LMDrive , and LangProp use CARLA for experiments and data collection. DriveLM-Carla is a specific dataset generated using CARLA.
  • Argoverse : A dataset suite with a focus on motion forecasting, 3D tracking, and HD maps. Argoverse 2 is used in challenges like 3D Occupancy Forecasting.
  • KITTI : One of the pioneering datasets for autonomous driving, still used for tasks like 3D object detection and tracking.
  • Cityscapes : Focuses on semantic understanding of urban street scenes, primarily for semantic segmentation.
  • UCU Dataset (In-Cabin User Command Understanding) : Part of the LLVM-AD Workshop, this dataset contains 1,099 labeled user commands for autonomous vehicles, designed for training models to understand human instructions within the vehicle.
  • MAPLM (Large-Scale Vision-Language Dataset for Map and Traffic Scene Understanding) : Also from the LLVM-AD Workshop, MAPLM combines point cloud BEV and panoramic images for rich road scenario images and multi-level scene description data, used for QA tasks.
  • NuPrompt : A large-scale language prompt set based on nuScenes for driving scenes, consisting of 3D object-text pairs, used in Prompt4Driving.
  • nuDesign : A large-scale dataset (2300k sentences) constructed upon nuScenes via a rule-based auto-labeling methodology for 3D dense captioning.
  • LaMPilot : An interactive environment and dataset designed for evaluating LLM-based agents in a driving context, containing scenes for command tracking tasks.
  • DRAMA (Joint Risk Localization and Captioning in Driving) : Provides linguistic descriptions (with a focus on reasons) of driving risks associated with important objects.
  • Rank2Tell : A multimodal ego-centric dataset for ranking importance levels of objects/events and generating textual reasons for the importance.
  • HighwayEnv : A collection of environments for autonomous driving and tactical decision-making research, often used for RL-based approaches and LLM decision-making evaluations (e.g., by DiLu, MTD-GPT).

🧾Other Awesome Lists

These repositories offer broader collections of resources that may overlap with or complement the focus of this list.

Citation

If you find this repository helpful, a citation to our paper would be greatly appreciated:

@ARTICLE{xu2026survey,
  author={Xu, Chengkai and Cui, Yiming and Liu, Jiaqi and Guo, Yicheng and Qin, Cheng and Zhang, Geyuan and Dong, Xinwei and Fang, Shiyu and Hang, Peng and Sun, Jian},
  journal={IEEE Transactions on Intelligent Transportation Systems}, 
  title={A Survey on End-to-End Autonomous Driving Training From the Perspectives of Data, Strategy, and Platform}, 
  year={2026},
  volume={},
  number={},
  pages={1-20},
  keywords={Modeling;Training;Optimization;Autonomous driving;Safety;Surveys;Vehicles;Testing;Learning (artificial intelligence);Reinforcement learning;Autonomous vehicle;end-to-end;artificial intelligence;intelligent transportation system},
  doi={10.1109/TITS.2026.3695999}
}