Bowen12137/Awesome-World-Models

This repository is the collection of World model Papers

326

11 commits

updated Apr 8, 2026

See the code

README

🌍 Awesome World Models

Awesome Papers PRs Welcome

The Most Comprehensive Collection of World Models Research

Awesome Generative World Models: Video, 3D, Robotics & Driving

Spanning Video Generation, 3D/4D Modeling, Autonomous Driving, Embodied AI, and Beyond

🌳 World Models Evolutionary Tree

🔥 News & Updates

  • [2026-03-06] 🎉 Repository launched! Unified collection of 489 papers from four major World Models repositories
  • [2026-03-06] 🆕 Added 11 latest papers from arXiv 2026 (LaST-VLA, ResWorld, DriveWorld-VLA, etc.)
  • [2026-03-06] 📊 Added comprehensive statistics and visualizations: 74 starred papers, 195 with code
  • [2026-03-06] 🗂️ Introduced a strict paper-only research taxonomy plus dedicated resource sections
  • [2026-03-06] 🤖 Integrated learning resources: talks, courses, tutorials, and datasets

📖 Table of Contents


💡 What are World Models?

World Models are AI systems that learn internal representations of their environment to predict future states, simulate scenarios, and enable intelligent decision-making. They bridge perception and action by building a mental model of how the world works.

Key Concepts

  • Predictive Modeling: Learning to forecast future observations from current state and actions
  • Latent Representations: Compressing high-dimensional sensory data into meaningful internal states
  • Simulation: Generating synthetic experiences for planning, training, and evaluation
  • Generalization: Transferring learned world knowledge to new scenarios and tasks

Why World Models Matter

  1. Data Efficiency: Learn from fewer real-world interactions by leveraging simulated experience
  2. Safety: Test dangerous scenarios in simulation before deployment
  3. Interpretability: Explicit world representations enable better understanding of AI decisions
  4. Generalization: Transfer knowledge across tasks and domains
  5. Planning: Enable look-ahead reasoning for complex decision-making

🗺️ Taxonomy

This repository uses a strict two-track information architecture:

Track 1: Research taxonomy (paper-only)

All entries under Research are papers only, and each paper appears in exactly one canonical place:

  • Surveys & Reviews
  • Theory & Foundations
  • Benchmarks & Evaluation
  • Primary Research by Domain
    • General / Foundational
    • Autonomous Driving
    • Embodied AI & Robotics
    • Interactive Digital Environments
    • Social / Multi-Agent
    • Scientific World Models

Track 2: Resource taxonomy (non-paper)

Non-paper resources are preserved in dedicated sections:

  • Learning Resources: talks, tutorials, and courses
  • Practical Resources: datasets, benchmarks, tools, libraries, and simulators
  • Community: workshops, challenges, research groups, and discussion spaces

For paper classification, labels such as VLA, navigation, locomotion, planning/RL, simulation, and web-agent are treated as tags, not canonical top-level categories.

📖 For the authoritative classification rules, see docs/research/taxonomy.md


📚 Research

Surveys & Reviews

Comprehensive surveys and review papers on world models:

PaperVenueResources
The Role of World Models in Shaping Autonomous Driving: A Comprehensive SurveyarXiv 25.02arXiv
Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AITMECH 25arXiv Code
3D and 4D World Modeling: A SurveyarXiv 25.09arXiv
A Comprehensive Survey on World Models for Embodied AIarXiv 25.10arXiv
A Step Toward World Models: A Survey on Robotic ManipulationarXiv 25.11arXiv
A Survey of Embodied World Models25.09Paper
A Survey on Future Physical World Generation for Autonomous DrivingMMAsia 25Paper
The Safety Challenge of World Models for Embodied AI Agents: A ReviewarXiv 25.10arXiv
Progressive Robustness-Aware World Models in Autonomous Driving: A Review and OutlooktechrXiv 25.11Paper
A Path Towards Autonomous Machine IntelligenceOpenReviewOpenReview Video
A Survey of World Models for Autonomous Driving-arXiv
World Models for Autonomous Driving: An Initial Survey-arXiv
Interplay Between Video Generation and World Models in Autonomous Driving-arXiv
World Models and Physical Simulation-arXiv Website

Theory & Foundations

Conceptual, analytical, and foundational papers on world models.

PaperVenueResources
Inductive Biases in TransformersarXiv 2026arXiv
Physical Grounding in World ModelsarXiv 2026arXiv

Benchmarks & Evaluation

Benchmark, dataset, and evaluation papers for assessing world models.

PaperVenueResources
DrivingDojo DatasetIPS 2024arXiv Website
WorldLens-arXiv Website
DrivingGen-arXiv Website
Melting Pot: Multi-Agent RL Evaluation-Website

Primary Research by Domain

🌐 General / Foundational

Primary research papers whose core contribution is broadly reusable across domains.

PaperVenueResources
Agent Learning via Early Experience-arXiv
General agents Contain World Models-arXiv
Persistent Embodied World Models-arXiv
Self-Improving Embodied Foundation Models-arXiv
World Models as Data EnginearXiv 2025arXiv
Dreamerv4-arXiv Website
UWM-arXiv Website
UVA-arXiv Website Code
DiWA-arXiv Code
LVP-arXiv Website
LDA-1B-arXiv Website Code

🚗 Autonomous Driving

World models for scene prediction, planning, simulation, and control in self-driving systems.

PaperVenueResources
LaST-VLA: Latent Spatio-Temporal VLA for Autonomous DrivingarXiv 2026arXiv
Hyper Diffusion Planner: End-to-End Autonomous Driving with Real-Vehicle DeploymentarXiv 2026arXiv
ResWorld: Temporal Residual World Model for Dynamic Object ModelingarXiv 2026arXiv
DriveWorld-VLA: Unifying World Modeling and Planning in Latent SpacearXiv 2026arXiv
RaWMPC: Risk-aware World Model Predictive ControlarXiv 2026arXiv
DiffusionHarmonizer: Online Generative Enhancement for Driving SimulationarXiv 2026arXiv
Cosmos-Drive-Dreams-arXiv Code Website
Drive-OccWorldAAAI 2025arXiv Code Website
DriveDreamer-2AAAI 2025arXiv Code Website
DriveDreamer4DCVPR 2025arXiv Code Website
MagicDrive-V2ICCV 2025arXiv Website
SubjectDriveAAAI 2025arXiv Website
DriveDreamerECCV 2024arXiv Code Website
DriveWorldCVPR 2024arXiv
DrivingDiffusionECCV 2024arXiv Code Website
MagicDriveICLR 2024arXiv Code Website
AdaptiveDriver-arXiv Code
Dream to Drive-arXiv
Dream4Drive-arXiv Website
Drive-JEPA-arXiv
DriveGenVLM-arXiv
DrivePhysica-arXiv Code Website
DriveVLA-W0-arXiv
DrivingGPT-arXiv Website
GAIA-2-arXiv Website
STAGE-arXiv
Dreamland-arXiv Website
LongDWM-arXiv Website
GeoDrive-arXiv Code
FutureSightDrive-arXiv Code
Raw2Drive-arXiv
VL-SAFE-arXiv Website
PosePilot-arXiv
DriVerse-arXiv
MiLA-arXiv Website
SimWorld-arXiv Website
UniFuture-arXiv Website
EOT-WM-arXiv
MaskGWM-arXiv
HERMES-arXiv
AdaWM-arXiv
AD-L-JEPA-arXiv
DrivingWorld-arXiv Code Website
GEM-arXiv Website
GaussianWorld-arXiv Code
Doe-1-arXiv Website Code
InfiniCube-arXiv Website
InfinityDrive-arXiv Website
ReconDreamer-arXiv Website
Imagine-2-Drive-arXiv Website
DynamicCity-arXiv Website Code
DOME-arXiv Website
SSR-arXiv Code
LatentDriver-arXiv Code
RenderWorld-arXiv
OccLLaMA-arXiv
CarFormer-arXiv Code
BEVWorld-arXiv Code
TOKEN-arXiv
SimGen-arXiv Code
UnO-arXiv Code
LAW-arXiv Code
Delphi-arXiv Code
OccSora-arXiv Code
MagicDrive3D-arXiv Code
CarDreamer-arXiv Code
DriveSim-arXiv Code
LidarDM-arXiv Code
GenAD (End-to-End)-arXiv Code
Drive-WM-arXiv Code
Cam4DOCC-arXiv Code
Panacea-arXiv Code
OccWorld-arXiv Code
SafeDreamer-OpenReview Code
SEM2-Paper
MoVieDrive-arXiv
Think Before You Drive-arXiv
Think2Drive-arXiv
TrafficBots-arXiv Code
UniDrive-WM-arXiv Website
World4Drive-arXiv
GenieDrive-arXiv Website
ImagiDrive-arXiv Code
ReSim-arXiv Code Website
Vista-arXiv Code
GenAD-arXiv Website
ViDAR-arXiv Code

🤖 Embodied AI & Robotics

World models for manipulation, navigation, locomotion, VLA systems, and robot policy learning.

PaperVenueResources
Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand GesturesarXiv 2026arXiv Website
GaussTwin: Unified Simulation and Correction with Gaussian Splatting for Robotic Digital TwinsarXiv 2026arXiv
"Learning Primitive Embodied World Models: Towards Scalable Robotic Learning"-arXiv Website
EmbodieDreamer-arXiv Code Website
Embodied AI Agents: Modeling the World-arXiv
PhysicalAgent-arXiv
Video Agent-arXiv Website
DreamDojoarXiv 2026arXiv Website
View-Consistent 4D World ModelarXiv 2026arXiv
World Models as Reliable SimulatorsarXiv 2026arXiv
"Multi-Task Interactive Robot Fleet Learning with Visual World Models"-arXiv Code Website
Object-Centric World Model for Language-Guided Manipulation-arXiv
Robotic World Model-arXiv
Genie Envisioner-arXiv Website Code
WoW-arXiv Website Code
UnifoLM-WMA-0-Website Code
iVideoGPT-arXiv Website Code
PointWorld-arXiv Website
Dex-WM-arXiv Website
FLARE-arXiv Website
Enerverse-arXiv Website
AgiBot-World-arXiv Website Code
DyWA-arXiv Website Code
TesserAct-arXiv Website Code
DreamGen-arXiv Website Code
HiP-arXiv Website Code
PAR-arXiv Website Code
iMoWM-arXiv Website
WristWorld-Website Code
EMMA-arXiv Website
PhysTwin-arXiv Website Code
KeyWorld-arXiv
World4RL-arXiv Website
SAMPO-arXiv
GWM-arXiv Website Code
Flow-as-Action-arXiv
RoboScape-arXiv Code
ParticleFormer-arXiv Website
ManiGaussian++-arXiv Code
GAF-arXiv Website
3DFlowAction-arXiv Code
ORV-arXiv Code Website
WoMAP-arXiv Website
OSVI-WM-arXiv
LaDi-WM-arXiv Website Code
FlowDreamer-arXiv Website Code
PIN-WM-arXiv Website Code
RoboMaster-arXiv Website Code
ManipDreamer-arXiv Website
AdaWorld-arXiv Website Code
EVA-arXiv Website Code
DexSim2Real²-arXiv Code
LUMOS-arXiv Website Code
DEMO³-arXiv Website Code
RoboHorizon-arXiv
Dream to Manipulate-arXiv Website
RoboDreamer-arXiv Code Website
Vidar-arXiv
ManiGaussian-arXiv Code Website
WHALE-arXiv
VisualPredicator-arXiv
PIVOT-R-arXiv Website Code
Video2Action-arXiv Website Code
Diffuser-arXiv Website Code
Decision Diffuser-arXiv Code
NWM (Navigation World Models)-arXiv Website
MindJourney-arXiv Website
NavMorph-arXiv Code
Unified World Models-arXiv Code
RECON-arXiv Website
WMNav-arXiv Website
NaVi-WM-arXiv Website
AIF-arXiv
X-MOBILITY-arXiv
MWM-arXiv Website Code
Ego-VCP-arXiv Website Code
RWM-O-arXiv
DWL-arXiv
HRSSM-arXiv Code
WMP-arXiv Website
TrajWorld-arXiv Code
Puppeteer-arXiv Code
ProTerrain-arXiv
Occupancy World Model-arXiv
Humanoid World Models-arXiv
Ego-Agent-arXiv
D²PO-arXiv
COMBO-arXiv Website Code
CoT-VLA-arXiv Website
UP-VLA-arXiv Code
VPP-arXiv Website
MinD-arXiv Website
DreamVLA-arXiv Code Website
WorldVLA-arXiv Code
3D-VLA-arXiv
LAWM-arXiv Code
UniVLA-arXiv Code
dVLA-arXiv
UD-VLA-arXiv Code Website
Goal-VLA-arXiv Website
Vidarc-arXiv
VideoVLA-arXiv Website
Motus-arXiv Website
mimic-video-arXiv Website
Ctrl-World-arXiv Website Code
VLA-RFT-arXiv
World-Env-arXiv
GigaBrain-0.5M-arXiv Website Code
RISE-arXiv Website
GigaBrain-0-arXiv Website
WMPO-arXiv Website
DreamZeroarXiv 2026arXiv Website Code
Fast-WAMarXiv 2026arXiv Website Code
LingBot-VA-arXiv Website Code

🎮 Interactive Digital Environments

World models for games, browser environments, web agents, and other interactive virtual settings.

PaperVenueResources
Is Sora a World Simulator-arXiv Website
Matrix-Game-arXiv Code
Matrix-Game 2.0-arXiv Code Website
AnimeGamer-arXiv Website
GameFactory-arXiv Code Website
Hunyuan-GameCraft-2-arXiv Website
Interactive Generative Video as Next-Generation Game Engine-arXiv
GameNGen-arXiv Website Code
DIAMOND-arXiv Website Code
MineWorld-arXiv
HunyuanWorld 1.0-arXiv Website
Oasis-arXiv Website Code
Genie-arXiv Website
WorldCrafter-arXiv Website Code
Web World ModelsarXiv 2025arXiv Website
Large-Scale World Model for Web AgentarXiv 2026arXiv
World-Model-Augmented Web AgentsarXiv 2026arXiv
Multiplayer Video World Model in MinecraftarXiv 2026arXiv
Web Agents with World Models-arXiv

👥 Social / Multi-Agent

World models centered on social interaction, collective behavior, or multi-agent reasoning.

PaperVenueResources
Social World Models-arXiv
Social World Model-Augmented Mechanism Design-arXiv
SocioVerse-arXiv Code
FreeAskWorldFrameworkCode
Model-Based Social NavigationNavigationCode
SOMA: Socio-physical Model of ActivitiesActivity ModelCode
Mini-Genie: Multi-Agent World ModelMulti-AgentCode
Social World Model SimulationSimulationCode
MotionLM: Multi-Agent Motion ForecastingPredictionWebsite

🔬 Scientific World Models

World models applied to scientific simulation, medicine, biology, and related domains.

PaperVenueResources
World Models for Clinical Prediction-arXiv
CellFlux-arXiv Website
CheXWorld-arXiv Code
EchoWorld-arXiv Code
ODesign-arXiv Website
SFP-arXiv
Xray2Xray-arXiv
Medical World Model-arXiv
Surgical Vision World Model-arXiv

🎓 Learning Resources

📺 Talks & Presentations

Key talks and presentations on world models:

TitleSpeakerVenueResources
A Path Towards Autonomous Machine IntelligenceYann LeCunMeta AIVideo Paper
World Models for Autonomous DrivingAshok ElluswamyTesla AI Day 2024Video
GAIA-1: A Generative World Model for Autonomous DrivingWayve TeamNVIDIA GTC 2023Website
NVIDIA Cosmos: Physical AI with World Foundation ModelsNVIDIA TeamGTC 2025Website
Genie: Generative Interactive EnvironmentsDeepMind TeamTech Talk 2024Website

📺 For complete list of talks (50+), see docs/learning/talks.md


🎓 Courses & Tutorials

New to world models? Start with the beginner path below instead of jumping straight into papers or large codebases.

Beginner Journey:

  1. Build intuitionWorld Models and A Path Towards Autonomous Machine Intelligence
  2. Learn the core loopCS285: Deep Reinforcement Learning and DreamerV3
  3. Pick a track — model-based RL, autonomous driving, or embodied AI / robotics

Choose your first track:

  • General / Model-Based RL — start with Dreamer-style latent dynamics and planning
  • Autonomous Driving — start with CARLA, then driving world-model papers and benchmarks
  • Embodied AI / Robotics — start with CALVIN / LIBERO, then VLA and WAM systems

🎓 For the full beginner-friendly learning path, curated tracks, and hands-on starting points, see docs/learning/tutorials.md


🔧 Practical Resources

📊 Datasets

Autonomous Driving:

  • nuScenes - 1000 scenes with camera, LiDAR, radar Website Paper
  • Waymo Open Dataset - 1000 segments, 200k frames Website
  • KITTI - Classic autonomous driving benchmark Website
  • Argoverse 2 - 1000 scenarios, forecasting Website
  • Occ3D - 16k frames for occupancy prediction Website
  • CARLA - Open-source driving simulator Website

Robotics:

  • CALVIN - 24k manipulation trajectories Website Code
  • RoboNet - 15M robot manipulation frames Website
  • RoboCasa - 100k kitchen manipulation trajectories Website
  • Open X-Embodiment - 1M+ multi-robot trajectories Website
  • Habitat-Matterport 3D - 90 indoor scenes Website

Games:

  • Minecraft - Procedural 3D environments
  • Atari 2600 - Classic RL benchmark (57 games)
  • MineRL - 60M frames of Minecraft gameplay Website

📊 For complete list of datasets (50+), see docs/resources/datasets.md


🎯 Benchmarks & Leaderboards

Driving:

  • WorldLens - Full-spectrum evaluation for driving world models arXiv
  • DrivingGen - Benchmark for generative video world models in autonomous driving arXiv
  • NAVSIM - End-to-end planning benchmark for autonomous driving arXiv

Embodied / Robotics:

  • LIBERO - Knowledge transfer benchmark for lifelong robot learning arXiv
  • CALVIN - Language-conditioned manipulation benchmark arXiv
  • RoboCasa - Everyday manipulation benchmark in realistic simulation arXiv
  • RoboTwin 2.0 - Bimanual manipulation benchmark with strong domain randomization arXiv

Video & World Generation:

  • WorldScore - Unified benchmark for world generation arXiv
  • VBench - Video generation quality evaluation arXiv
  • FVD / LPIPS / PSNR / SSIM - Common quality metrics for rollout fidelity and perceptual realism

Multi-Agent:

  • Melting Pot - Generalization-oriented multi-agent RL evaluation suite arXiv

🎯 For complete benchmark suites, metrics, and leaderboards, see docs/resources/benchmarks.md


🛠️ Tools & Libraries

Frameworks:

  • DreamerV3 - State-of-the-art model-based RL Code
  • Stable Baselines3 - RL baselines and integration utilities Code
  • PyTorch3D - 3D deep learning library Website

Simulation:

  • CARLA - Open-source driving simulator Website
  • Isaac Sim - NVIDIA robotics simulator Website
  • MuJoCo - Physics engine for robotics Code

🛠️ For complete tools, libraries, and simulators, see docs/resources/tools.md


🌐 Community

🏆 Workshops & Challenges

  • CVPR 2025 Workshop on World Models Website
  • ICCV 2025 Workshop on 4D World Models - Bridging Generation and Reconstruction
  • OpenDriveLab Challenges - Annual autonomous driving competitions

🏆 For a fuller list of workshops and challenge venues, see docs/community/workshops.md


👥 Research Groups

Leading Labs:

  • NVIDIA Toronto AI Lab - Cosmos, GAIA series
  • Wayve - End-to-end driving with world models
  • Tesla AI - FSD world model development
  • UC Berkeley RAIL - Model-based RL research
  • DeepMind - Genie, DreamerV3

👥 For a fuller list of research groups and labs, see docs/community/research-groups.md


💬 Discussion Spaces

  • r/MachineLearning - Broad ML discussion and paper sharing
  • Hugging Face Forums - Model discussion and implementation questions
  • Papers with Code - Benchmark and code discovery

💬 For additional communities and curated hubs, see docs/community/communities.md


🤝 Contributing

Please use the contributor guide for submission rules, taxonomy requirements, and PR templates.


📜 Citation

If you find this repository useful, please consider citing:

@misc{awesome-world-models-2026,
  title={Awesome World Models: A Comprehensive Collection},
  author={Jing, Bowen},
  year={2026},
  howpublished={\url{https://github.com/Bowen12137/Awesome-World-Models}}
}

⭐ Star History

Star History Chart


📊 Repository Statistics

Overview

  • Total Papers: 269
  • Starred Papers: 88
  • Papers with Code: 111 (41%)
  • Year Range: 2021 - 2026
  • Top Venues: AAAI (3), CVPR (2), ECCV (2)

Visualizations

Papers by Year

Papers by Year

Top Venues

Top Venues

Category Distribution

Category Distribution

Resource Availability

Resource Availability

Last Updated: March 6, 2026


Made with ❤️ by the World Models community

⬆ Back to Top

Contributors

Bowen12137

10 commits

NTUYWANG103

1 commits

Bowen12137/Awesome-World-Models

This repository is the collection of World model Papers

326

11 commits

updated Apr 8, 2026

See the code

README

🌍 Awesome World Models

Awesome Papers PRs Welcome

The Most Comprehensive Collection of World Models Research

Awesome Generative World Models: Video, 3D, Robotics & Driving

Spanning Video Generation, 3D/4D Modeling, Autonomous Driving, Embodied AI, and Beyond

🌳 World Models Evolutionary Tree

🔥 News & Updates

  • [2026-03-06] 🎉 Repository launched! Unified collection of 489 papers from four major World Models repositories
  • [2026-03-06] 🆕 Added 11 latest papers from arXiv 2026 (LaST-VLA, ResWorld, DriveWorld-VLA, etc.)
  • [2026-03-06] 📊 Added comprehensive statistics and visualizations: 74 starred papers, 195 with code
  • [2026-03-06] 🗂️ Introduced a strict paper-only research taxonomy plus dedicated resource sections
  • [2026-03-06] 🤖 Integrated learning resources: talks, courses, tutorials, and datasets

📖 Table of Contents


💡 What are World Models?

World Models are AI systems that learn internal representations of their environment to predict future states, simulate scenarios, and enable intelligent decision-making. They bridge perception and action by building a mental model of how the world works.

Key Concepts

  • Predictive Modeling: Learning to forecast future observations from current state and actions
  • Latent Representations: Compressing high-dimensional sensory data into meaningful internal states
  • Simulation: Generating synthetic experiences for planning, training, and evaluation
  • Generalization: Transferring learned world knowledge to new scenarios and tasks

Why World Models Matter

  1. Data Efficiency: Learn from fewer real-world interactions by leveraging simulated experience
  2. Safety: Test dangerous scenarios in simulation before deployment
  3. Interpretability: Explicit world representations enable better understanding of AI decisions
  4. Generalization: Transfer knowledge across tasks and domains
  5. Planning: Enable look-ahead reasoning for complex decision-making

🗺️ Taxonomy

This repository uses a strict two-track information architecture:

Track 1: Research taxonomy (paper-only)

All entries under Research are papers only, and each paper appears in exactly one canonical place:

  • Surveys & Reviews
  • Theory & Foundations
  • Benchmarks & Evaluation
  • Primary Research by Domain
    • General / Foundational
    • Autonomous Driving
    • Embodied AI & Robotics
    • Interactive Digital Environments
    • Social / Multi-Agent
    • Scientific World Models

Track 2: Resource taxonomy (non-paper)

Non-paper resources are preserved in dedicated sections:

  • Learning Resources: talks, tutorials, and courses
  • Practical Resources: datasets, benchmarks, tools, libraries, and simulators
  • Community: workshops, challenges, research groups, and discussion spaces

For paper classification, labels such as VLA, navigation, locomotion, planning/RL, simulation, and web-agent are treated as tags, not canonical top-level categories.

📖 For the authoritative classification rules, see docs/research/taxonomy.md


📚 Research

Surveys & Reviews

Comprehensive surveys and review papers on world models:

PaperVenueResources
The Role of World Models in Shaping Autonomous Driving: A Comprehensive SurveyarXiv 25.02arXiv
Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AITMECH 25arXiv Code
3D and 4D World Modeling: A SurveyarXiv 25.09arXiv
A Comprehensive Survey on World Models for Embodied AIarXiv 25.10arXiv
A Step Toward World Models: A Survey on Robotic ManipulationarXiv 25.11arXiv
A Survey of Embodied World Models25.09Paper
A Survey on Future Physical World Generation for Autonomous DrivingMMAsia 25Paper
The Safety Challenge of World Models for Embodied AI Agents: A ReviewarXiv 25.10arXiv
Progressive Robustness-Aware World Models in Autonomous Driving: A Review and OutlooktechrXiv 25.11Paper
A Path Towards Autonomous Machine IntelligenceOpenReviewOpenReview Video
A Survey of World Models for Autonomous Driving-arXiv
World Models for Autonomous Driving: An Initial Survey-arXiv
Interplay Between Video Generation and World Models in Autonomous Driving-arXiv
World Models and Physical Simulation-arXiv Website

Theory & Foundations

Conceptual, analytical, and foundational papers on world models.

PaperVenueResources
Inductive Biases in TransformersarXiv 2026arXiv
Physical Grounding in World ModelsarXiv 2026arXiv

Benchmarks & Evaluation

Benchmark, dataset, and evaluation papers for assessing world models.

PaperVenueResources
DrivingDojo DatasetIPS 2024arXiv Website
WorldLens-arXiv Website
DrivingGen-arXiv Website
Melting Pot: Multi-Agent RL Evaluation-Website

Primary Research by Domain

🌐 General / Foundational

Primary research papers whose core contribution is broadly reusable across domains.

PaperVenueResources
Agent Learning via Early Experience-arXiv
General agents Contain World Models-arXiv
Persistent Embodied World Models-arXiv
Self-Improving Embodied Foundation Models-arXiv
World Models as Data EnginearXiv 2025arXiv
Dreamerv4-arXiv Website
UWM-arXiv Website
UVA-arXiv Website Code
DiWA-arXiv Code
LVP-arXiv Website
LDA-1B-arXiv Website Code

🚗 Autonomous Driving

World models for scene prediction, planning, simulation, and control in self-driving systems.

PaperVenueResources
LaST-VLA: Latent Spatio-Temporal VLA for Autonomous DrivingarXiv 2026arXiv
Hyper Diffusion Planner: End-to-End Autonomous Driving with Real-Vehicle DeploymentarXiv 2026arXiv
ResWorld: Temporal Residual World Model for Dynamic Object ModelingarXiv 2026arXiv
DriveWorld-VLA: Unifying World Modeling and Planning in Latent SpacearXiv 2026arXiv
RaWMPC: Risk-aware World Model Predictive ControlarXiv 2026arXiv
DiffusionHarmonizer: Online Generative Enhancement for Driving SimulationarXiv 2026arXiv
Cosmos-Drive-Dreams-arXiv Code Website
Drive-OccWorldAAAI 2025arXiv Code Website
DriveDreamer-2AAAI 2025arXiv Code Website
DriveDreamer4DCVPR 2025arXiv Code Website
MagicDrive-V2ICCV 2025arXiv Website
SubjectDriveAAAI 2025arXiv Website
DriveDreamerECCV 2024arXiv Code Website
DriveWorldCVPR 2024arXiv
DrivingDiffusionECCV 2024arXiv Code Website
MagicDriveICLR 2024arXiv Code Website
AdaptiveDriver-arXiv Code
Dream to Drive-arXiv
Dream4Drive-arXiv Website
Drive-JEPA-arXiv
DriveGenVLM-arXiv
DrivePhysica-arXiv Code Website
DriveVLA-W0-arXiv
DrivingGPT-arXiv Website
GAIA-2-arXiv Website
STAGE-arXiv
Dreamland-arXiv Website
LongDWM-arXiv Website
GeoDrive-arXiv Code
FutureSightDrive-arXiv Code
Raw2Drive-arXiv
VL-SAFE-arXiv Website
PosePilot-arXiv
DriVerse-arXiv
MiLA-arXiv Website
SimWorld-arXiv Website
UniFuture-arXiv Website
EOT-WM-arXiv
MaskGWM-arXiv
HERMES-arXiv
AdaWM-arXiv
AD-L-JEPA-arXiv
DrivingWorld-arXiv Code Website
GEM-arXiv Website
GaussianWorld-arXiv Code
Doe-1-arXiv Website Code
InfiniCube-arXiv Website
InfinityDrive-arXiv Website
ReconDreamer-arXiv Website
Imagine-2-Drive-arXiv Website
DynamicCity-arXiv Website Code
DOME-arXiv Website
SSR-arXiv Code
LatentDriver-arXiv Code
RenderWorld-arXiv
OccLLaMA-arXiv
CarFormer-arXiv Code
BEVWorld-arXiv Code
TOKEN-arXiv
SimGen-arXiv Code
UnO-arXiv Code
LAW-arXiv Code
Delphi-arXiv Code
OccSora-arXiv Code
MagicDrive3D-arXiv Code
CarDreamer-arXiv Code
DriveSim-arXiv Code
LidarDM-arXiv Code
GenAD (End-to-End)-arXiv Code
Drive-WM-arXiv Code
Cam4DOCC-arXiv Code
Panacea-arXiv Code
OccWorld-arXiv Code
SafeDreamer-OpenReview Code
SEM2-Paper
MoVieDrive-arXiv
Think Before You Drive-arXiv
Think2Drive-arXiv
TrafficBots-arXiv Code
UniDrive-WM-arXiv Website
World4Drive-arXiv
GenieDrive-arXiv Website
ImagiDrive-arXiv Code
ReSim-arXiv Code Website
Vista-arXiv Code
GenAD-arXiv Website
ViDAR-arXiv Code

🤖 Embodied AI & Robotics

World models for manipulation, navigation, locomotion, VLA systems, and robot policy learning.

PaperVenueResources
Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand GesturesarXiv 2026arXiv Website
GaussTwin: Unified Simulation and Correction with Gaussian Splatting for Robotic Digital TwinsarXiv 2026arXiv
"Learning Primitive Embodied World Models: Towards Scalable Robotic Learning"-arXiv Website
EmbodieDreamer-arXiv Code Website
Embodied AI Agents: Modeling the World-arXiv
PhysicalAgent-arXiv
Video Agent-arXiv Website
DreamDojoarXiv 2026arXiv Website
View-Consistent 4D World ModelarXiv 2026arXiv
World Models as Reliable SimulatorsarXiv 2026arXiv
"Multi-Task Interactive Robot Fleet Learning with Visual World Models"-arXiv Code Website
Object-Centric World Model for Language-Guided Manipulation-arXiv
Robotic World Model-arXiv
Genie Envisioner-arXiv Website Code
WoW-arXiv Website Code
UnifoLM-WMA-0-Website Code
iVideoGPT-arXiv Website Code
PointWorld-arXiv Website
Dex-WM-arXiv Website
FLARE-arXiv Website
Enerverse-arXiv Website
AgiBot-World-arXiv Website Code
DyWA-arXiv Website Code
TesserAct-arXiv Website Code
DreamGen-arXiv Website Code
HiP-arXiv Website Code
PAR-arXiv Website Code
iMoWM-arXiv Website
WristWorld-Website Code
EMMA-arXiv Website
PhysTwin-arXiv Website Code
KeyWorld-arXiv
World4RL-arXiv Website
SAMPO-arXiv
GWM-arXiv Website Code
Flow-as-Action-arXiv
RoboScape-arXiv Code
ParticleFormer-arXiv Website
ManiGaussian++-arXiv Code
GAF-arXiv Website
3DFlowAction-arXiv Code
ORV-arXiv Code Website
WoMAP-arXiv Website
OSVI-WM-arXiv
LaDi-WM-arXiv Website Code
FlowDreamer-arXiv Website Code
PIN-WM-arXiv Website Code
RoboMaster-arXiv Website Code
ManipDreamer-arXiv Website
AdaWorld-arXiv Website Code
EVA-arXiv Website Code
DexSim2Real²-arXiv Code
LUMOS-arXiv Website Code
DEMO³-arXiv Website Code
RoboHorizon-arXiv
Dream to Manipulate-arXiv Website
RoboDreamer-arXiv Code Website
Vidar-arXiv
ManiGaussian-arXiv Code Website
WHALE-arXiv
VisualPredicator-arXiv
PIVOT-R-arXiv Website Code
Video2Action-arXiv Website Code
Diffuser-arXiv Website Code
Decision Diffuser-arXiv Code
NWM (Navigation World Models)-arXiv Website
MindJourney-arXiv Website
NavMorph-arXiv Code
Unified World Models-arXiv Code
RECON-arXiv Website
WMNav-arXiv Website
NaVi-WM-arXiv Website
AIF-arXiv
X-MOBILITY-arXiv
MWM-arXiv Website Code
Ego-VCP-arXiv Website Code
RWM-O-arXiv
DWL-arXiv
HRSSM-arXiv Code
WMP-arXiv Website
TrajWorld-arXiv Code
Puppeteer-arXiv Code
ProTerrain-arXiv
Occupancy World Model-arXiv
Humanoid World Models-arXiv
Ego-Agent-arXiv
D²PO-arXiv
COMBO-arXiv Website Code
CoT-VLA-arXiv Website
UP-VLA-arXiv Code
VPP-arXiv Website
MinD-arXiv Website
DreamVLA-arXiv Code Website
WorldVLA-arXiv Code
3D-VLA-arXiv
LAWM-arXiv Code
UniVLA-arXiv Code
dVLA-arXiv
UD-VLA-arXiv Code Website
Goal-VLA-arXiv Website
Vidarc-arXiv
VideoVLA-arXiv Website
Motus-arXiv Website
mimic-video-arXiv Website
Ctrl-World-arXiv Website Code
VLA-RFT-arXiv
World-Env-arXiv
GigaBrain-0.5M-arXiv Website Code
RISE-arXiv Website
GigaBrain-0-arXiv Website
WMPO-arXiv Website
DreamZeroarXiv 2026arXiv Website Code
Fast-WAMarXiv 2026arXiv Website Code
LingBot-VA-arXiv Website Code

🎮 Interactive Digital Environments

World models for games, browser environments, web agents, and other interactive virtual settings.

PaperVenueResources
Is Sora a World Simulator-arXiv Website
Matrix-Game-arXiv Code
Matrix-Game 2.0-arXiv Code Website
AnimeGamer-arXiv Website
GameFactory-arXiv Code Website
Hunyuan-GameCraft-2-arXiv Website
Interactive Generative Video as Next-Generation Game Engine-arXiv
GameNGen-arXiv Website Code
DIAMOND-arXiv Website Code
MineWorld-arXiv
HunyuanWorld 1.0-arXiv Website
Oasis-arXiv Website Code
Genie-arXiv Website
WorldCrafter-arXiv Website Code
Web World ModelsarXiv 2025arXiv Website
Large-Scale World Model for Web AgentarXiv 2026arXiv
World-Model-Augmented Web AgentsarXiv 2026arXiv
Multiplayer Video World Model in MinecraftarXiv 2026arXiv
Web Agents with World Models-arXiv

👥 Social / Multi-Agent

World models centered on social interaction, collective behavior, or multi-agent reasoning.

PaperVenueResources
Social World Models-arXiv
Social World Model-Augmented Mechanism Design-arXiv
SocioVerse-arXiv Code
FreeAskWorldFrameworkCode
Model-Based Social NavigationNavigationCode
SOMA: Socio-physical Model of ActivitiesActivity ModelCode
Mini-Genie: Multi-Agent World ModelMulti-AgentCode
Social World Model SimulationSimulationCode
MotionLM: Multi-Agent Motion ForecastingPredictionWebsite

🔬 Scientific World Models

World models applied to scientific simulation, medicine, biology, and related domains.

PaperVenueResources
World Models for Clinical Prediction-arXiv
CellFlux-arXiv Website
CheXWorld-arXiv Code
EchoWorld-arXiv Code
ODesign-arXiv Website
SFP-arXiv
Xray2Xray-arXiv
Medical World Model-arXiv
Surgical Vision World Model-arXiv

🎓 Learning Resources

📺 Talks & Presentations

Key talks and presentations on world models:

TitleSpeakerVenueResources
A Path Towards Autonomous Machine IntelligenceYann LeCunMeta AIVideo Paper
World Models for Autonomous DrivingAshok ElluswamyTesla AI Day 2024Video
GAIA-1: A Generative World Model for Autonomous DrivingWayve TeamNVIDIA GTC 2023Website
NVIDIA Cosmos: Physical AI with World Foundation ModelsNVIDIA TeamGTC 2025Website
Genie: Generative Interactive EnvironmentsDeepMind TeamTech Talk 2024Website

📺 For complete list of talks (50+), see docs/learning/talks.md


🎓 Courses & Tutorials

New to world models? Start with the beginner path below instead of jumping straight into papers or large codebases.

Beginner Journey:

  1. Build intuitionWorld Models and A Path Towards Autonomous Machine Intelligence
  2. Learn the core loopCS285: Deep Reinforcement Learning and DreamerV3
  3. Pick a track — model-based RL, autonomous driving, or embodied AI / robotics

Choose your first track:

  • General / Model-Based RL — start with Dreamer-style latent dynamics and planning
  • Autonomous Driving — start with CARLA, then driving world-model papers and benchmarks
  • Embodied AI / Robotics — start with CALVIN / LIBERO, then VLA and WAM systems

🎓 For the full beginner-friendly learning path, curated tracks, and hands-on starting points, see docs/learning/tutorials.md


🔧 Practical Resources

📊 Datasets

Autonomous Driving:

  • nuScenes - 1000 scenes with camera, LiDAR, radar Website Paper
  • Waymo Open Dataset - 1000 segments, 200k frames Website
  • KITTI - Classic autonomous driving benchmark Website
  • Argoverse 2 - 1000 scenarios, forecasting Website
  • Occ3D - 16k frames for occupancy prediction Website
  • CARLA - Open-source driving simulator Website

Robotics:

  • CALVIN - 24k manipulation trajectories Website Code
  • RoboNet - 15M robot manipulation frames Website
  • RoboCasa - 100k kitchen manipulation trajectories Website
  • Open X-Embodiment - 1M+ multi-robot trajectories Website
  • Habitat-Matterport 3D - 90 indoor scenes Website

Games:

  • Minecraft - Procedural 3D environments
  • Atari 2600 - Classic RL benchmark (57 games)
  • MineRL - 60M frames of Minecraft gameplay Website

📊 For complete list of datasets (50+), see docs/resources/datasets.md


🎯 Benchmarks & Leaderboards

Driving:

  • WorldLens - Full-spectrum evaluation for driving world models arXiv
  • DrivingGen - Benchmark for generative video world models in autonomous driving arXiv
  • NAVSIM - End-to-end planning benchmark for autonomous driving arXiv

Embodied / Robotics:

  • LIBERO - Knowledge transfer benchmark for lifelong robot learning arXiv
  • CALVIN - Language-conditioned manipulation benchmark arXiv
  • RoboCasa - Everyday manipulation benchmark in realistic simulation arXiv
  • RoboTwin 2.0 - Bimanual manipulation benchmark with strong domain randomization arXiv

Video & World Generation:

  • WorldScore - Unified benchmark for world generation arXiv
  • VBench - Video generation quality evaluation arXiv
  • FVD / LPIPS / PSNR / SSIM - Common quality metrics for rollout fidelity and perceptual realism

Multi-Agent:

  • Melting Pot - Generalization-oriented multi-agent RL evaluation suite arXiv

🎯 For complete benchmark suites, metrics, and leaderboards, see docs/resources/benchmarks.md


🛠️ Tools & Libraries

Frameworks:

  • DreamerV3 - State-of-the-art model-based RL Code
  • Stable Baselines3 - RL baselines and integration utilities Code
  • PyTorch3D - 3D deep learning library Website

Simulation:

  • CARLA - Open-source driving simulator Website
  • Isaac Sim - NVIDIA robotics simulator Website
  • MuJoCo - Physics engine for robotics Code

🛠️ For complete tools, libraries, and simulators, see docs/resources/tools.md


🌐 Community

🏆 Workshops & Challenges

  • CVPR 2025 Workshop on World Models Website
  • ICCV 2025 Workshop on 4D World Models - Bridging Generation and Reconstruction
  • OpenDriveLab Challenges - Annual autonomous driving competitions

🏆 For a fuller list of workshops and challenge venues, see docs/community/workshops.md


👥 Research Groups

Leading Labs:

  • NVIDIA Toronto AI Lab - Cosmos, GAIA series
  • Wayve - End-to-end driving with world models
  • Tesla AI - FSD world model development
  • UC Berkeley RAIL - Model-based RL research
  • DeepMind - Genie, DreamerV3

👥 For a fuller list of research groups and labs, see docs/community/research-groups.md


💬 Discussion Spaces

  • r/MachineLearning - Broad ML discussion and paper sharing
  • Hugging Face Forums - Model discussion and implementation questions
  • Papers with Code - Benchmark and code discovery

💬 For additional communities and curated hubs, see docs/community/communities.md


🤝 Contributing

Please use the contributor guide for submission rules, taxonomy requirements, and PR templates.


📜 Citation

If you find this repository useful, please consider citing:

@misc{awesome-world-models-2026,
  title={Awesome World Models: A Comprehensive Collection},
  author={Jing, Bowen},
  year={2026},
  howpublished={\url{https://github.com/Bowen12137/Awesome-World-Models}}
}

⭐ Star History

Star History Chart


📊 Repository Statistics

Overview

  • Total Papers: 269
  • Starred Papers: 88
  • Papers with Code: 111 (41%)
  • Year Range: 2021 - 2026
  • Top Venues: AAAI (3), CVPR (2), ECCV (2)

Visualizations

Papers by Year

Papers by Year

Top Venues

Top Venues

Category Distribution

Category Distribution

Resource Availability

Resource Availability

Last Updated: March 6, 2026


Made with ❤️ by the World Models community

⬆ Back to Top

Contributors

Bowen12137

10 commits

NTUYWANG103

1 commits