minnie-lin/Awesome-Physics-Cognition-based-Video-Generation

A comprehensive list of papers investigating physical cognition in video generation, including papers, codes, and related websites.

327

96 commits

updated Jun 23, 2026

See the code

README

Awesome-Physics-Cognition-based-Video-Generation

πŸš€πŸš€πŸš€ This is a repository for organizing papers, codes, and other resources related to physics cognition-based video generation. This repo is being actively updated, please stay tuned! For more detailed information, please refer to our survey paper: Exploring the Evolution of Physics Cognition in Video Generation: A Survey.

This paper list covers T2V, V2V, and dynamic 3D and 4D generation based on physics, and includes some world models and world simulators.

If you find this repository useful, please consider giving us a star 🌟 and a cite.

⚑ Contributing

We welcome feedback, suggestions, and contributions that can help improve this survey and repository and make them valuable resources for the entire community. We will actively maintain this repository by incorporating new research as it emerges. If you have any suggestions about our taxonomy, please take a look at any missed papers, or update any preprint arXiv paper that has been accepted to some venue.

If you want to add your work or model to this list, please do not hesitate to pull requests.

Markdown format:

 * Paper Name. [[Paper]](link) [[Code]](link) [[Website]](link) [**Name of Conference or Journal + Year**]

πŸ“– Table of Contents

Workshops

TitleWebsiteDate
Building Physically Plausible World ModelsWebsiteICML 2025 Workshop, Vancouver Saturday, July 19 (Whole-Day Workshop)
1st Workshop on Vision Meets Physics: Synergizing Physical Simulation and Computer VisionWebsiteCVPR 2025 Workshop, June 12 (full day), 2025

Surveys

Basic Schematic Perception for Generation

TitlearXivGithubWebSitePub. & Date
Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction ModelsarXiv-WebsiteNov., 2025
Geometry-aware 4D Video Generation for Robot ManipulationarXivStarWebsiteJul., 2025
CoCo4D: Comprehensive and Complex 4D Scene GenerationarXivStarWebsiteJun., 2025
Generative Blocks World: Moving Things Around in PicturesarXiv--Jun., 2025
UniRelight: Learning Joint Decomposition and Synthesis for Video RelightingarXiv-WebsiteJun., 2025
IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video GenerationarXivStarWebsiteJun., 2025
MotionPro: A Precise Motion Controller for Image-to-Video GenerationarXivStarWebsiteMay, 2025, CVPR
ReVision: High-Quality, Low-Cost Video Generation with Explicit 3D Physics Modeling for Complex Motion and InteractionarXiv-WebsiteApr., 2025
Any2Caption:Interpreting Any Condition to Caption for Controllable Video GenerationarXivStarWebsiteMar., 2025
Towards Physical Understanding in Video Generation: A 3D Point Regularization ApproacharXiv-WebsiteFeb, 2025
SG-I2V: Self-Guided Trajectory Control in Image-to-Video GenerationarXivStarWebsiteICLR, 2025
TrackGo: A Flexible and Efficient Method for Controllable Video GenerationarXiv--AAAI, 2025
3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video GenerationarXivStarWebsiteICLR, 2025
Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image SynthesisarXivStarWebsiteCVPR, 2025
Lux Post Facto: Learning Portrait Performance Relighting with Conditional Video Diffusion and a Hybrid DatasetarXivWebsiteCVPR,2025
Identity-Preserving Text-to-Video Generation by Frequency DecompositionarXivStarWebsiteCVPR, 2025
Motion Modes: What Could Happen Next?arXiv-WebsiteCVPR, 2025
Motion Prompting: Controlling Video Generation with Motion TrajectoriesarXiv-WebsiteCVPR, 2025 (Oral)
Spectral Motion Alignment for Video Motion Transfer using Diffusion ModelsarXivStarWebsiteAAAI, 2025
Video Creation by DemonstrationarXiv-WebsiteDec., 2024
InterDyn: Controllable Interactive Dynamics with Video Diffusion ModelsarXiv-WebsiteDec., 2024,CVPR 25
LeviTor: 3D Trajectory Oriented Image-to-Video SynthesisarXivStarWebsiteDec., 2024
GenLit: Reformulating Single-Image Relighting as Video GenerationarXiv-WebsiteDec., 2024
Motion Dreamer: Realizing Physically Coherent Video Generation through Scene-Aware Motion Reasoning arXivStarWebsiteNov., 2024.
AnimateAnything: Consistent and Controllable Animation for Video GenerationarXivStarWebsiteNov., 2024
InTraGen: Trajectory-controlled Video Generation for Object InteractionsarXivStar-Nov., 2024
DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion ControlarXiv-WebsiteOct., 2024
LumiSculpt: A Consistency Lighting Control Network for Video GenerationarXiv--Oct., 2024
Tora: Trajectory-oriented Diffusion Transformer for Video GenerationarXivStarWebsiteJul., 2024
UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image AnimationarXivStarWebsiteJun., 2024
Image Conductor: Precision Control for Interactive Video SynthesisarXivStarWebsiteJun., 2024
Motion Inversion for Video CustomizationarXivStarWebsiteMar., 2024
VMC: Video Motion Customization using Temporal Attention Adaption for Text-to-Video Diffusion ModelsarXivStarWebsiteCVPR, 2024
MotionDirector: Motion Customization of Text-to-Video Diffusion ModelsarXivStarWebsiteECCV, 2024, Oral
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video SynthesisarXiv-WebsiteCVPR, 2024, Highlight
Generative Image DynamicsarXivStarWebsiteCVPR, 2024, Best Paper Award
MotionCtrl: A Unified and Flexible Motion Controller for Video GenerationarXivStarWebsiteSIGGRAPH, 2024
MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion ModelarXivStarWebsiteECCV, 2024
Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion ModelingarXivStarWebsiteSIGGRAPH, 2024
DragAnything: Motion Control for Anything using Entity RepresentationarXivStarWebsiteECCV, 2024
FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editingarXivStarWebsiteICLR, 2024
Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character AnimationarXivStarWebsiteCVPR, 2024
Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object MotionarXivStarWebsiteSIGGRAPH, 2024
Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion ModelingarXiv-WebsiteSIGGRAPH, 2024
Compositional 3D-aware Video Generation with LLM DirectorarXiv-WebsiteNIPS, 2024
TC4D: Trajectory-Conditioned Text-to-4D GenerationarXivStarWebsiteECCV, 2024
DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and TrajectoryarXiv-WebsiteAug., 2023
Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback LearninarXivStarWebsiteMay., 2023
VideoComposer: Compositional Video Synthesis with Motion ControllabilityarXivStarWebsiteNeurIPS, 2023
Adding Conditional Control to Text-to-Image Diffusion ModelsarXivStar-ICCV, 2023, Best Paper Award

Passive Cognition of Physical Knowledge for Generation

TitlearXivGithubWebSitePub. & Date
OptiWorld: Optimal Control for Video World Generation under Physical ConstraintsarXiv-WebsiteJun., 2026
NEWTON: Agentic Planning for Physically Grounded Video GenerationarXiv-WebsiteMay, 2026
TelePhysics: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time InteractionarXivWebsiteMay, 2026
PhysVid: Physics Aware Local Conditioning for Generative Video ModelsarXiv--CVPR 2026
MotionPhysics: Learnable Motion Distillation for Text-Guided SimulationarXivStarWebsiteAAAI, 2026
Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video DiffusionarXiv-WebsiteMar., 2026
PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation AlignmentarXiv-WebsiteMar., 2026
Physical Simulator In-the-Loop Video GenerationarXivStarWebsiteCVPR, 2026
PhysVideo: Physically Plausible Video Generation with Cross-View Geometry GuidancearXiv-WebsiteMar., 2026
Chain of Event-Centric Causal Thought for Physically Plausible Video GenerationarXiv--CVPR, 2026
RealWonder: Real-Time Physical Action-Conditioned Video GenerationarXivStarWebsiteMar., 2026
Goal Force: Teaching Video Models To Accomplish Physics-Conditioned GoalsarXivStarWebsiteCVPR, 2026
PI-Light: Physics-Inspired Diffusion for Full-Image RelightingarXivStar-ICLR 2026
Self-Refining Video SamplingarXivStarWebsiteJan., 2026
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in VideosarXivStarWebsiteDec., 2025
VDAWorld: World Modelling via VLM-Directed Abstraction and SimulationarXiv-WebsiteDec., 2025
Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-RefinementarXiv--ICCV 2025 Physics-IQ Challenge Third Place
ProPhy: Progressive Physical Alignment for Dynamic World SimulationarXiv-WebsiteDec., 2025
Planning with Sketch-Guided Verification for Physics-Aware Video GenerationarXivStarWebsiteNov., 2025
Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-RefinementarXiv--Nov., ICCV 2025 Physics-IQ Challenge Third Place Solution
CP4D: Compositional physics-aware 4D scene generation---Oct., 2025
3DPhysVideo: 3D Scene Reconstruction and Physical Animation Leveraging a Video Generation Model via Consistency-Guided Flow SDE---Oct., 2025
PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM---Oct., 2025
DiffuPhyGS: Text-to-Video Generation with 3D Gaussians and Learnable Physical Properties via Diffusion Priors---Oct., 2025
Fracture-GS: Dynamic Fracture Simulation with Physics-Integrated Gaussian Splatting---Oct., 2025
PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Generation---Oct., 2025
Learning to Generate Object Interactions with Physics-Guided Video DiffusionarXiv-WebsiteOct., 2025
CONTROLHAIR: Physically-based Video Diffusion for Controllable Dynamic Hair RenderingarXiv-WebsiteSep., 2025
NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian DynamicsarXivStar-Sep., 2025
PIRF: Physics-Informed Reward Fine-Tuning for Diffusion ModelsarXivStar-Sep., 2025
PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation--WebsiteNeurIPS, 2025
PhysGM: Large Physical Gaussian Model for Feed-Forward 4D SynthesisarXiv-WebsiteAug., 2025
Physics-Grounded Motion Forecasting via Equation Discovery for Trajectory-Guided Image-to-Video GenerationarXiv--Jul., 2025
Dreamland: Controllable World Creation with Simulator and Generative ModelsarXiv-WebsiteJun., 2025
Vid2Sim: Generalizable, Video-based Reconstruction of Appearance, Geometry and Physics for Mesh-free SimulationarXiv-WebsiteJun., 2025, CVPR
Physics-Guided Motion Loss for Video Generation ModelarXiv--Jun., 2025
Think Before You Diffuse: LLMs-Guided Physics-Aware Video GenerationarXiv-WebsiteMay, 2025
Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control SignalsarXivStarWebsiteMay, 2025
WonderPlay: Dynamic 3D Scene Generation from a Single Image and ActionsarXiv-WebsiteMay, 2025
MAGIC: Motion-Aware Generative Inference via Confidence-Guided LLMarXiv--May, 2025
UniPhy: Learning a Unified Constitutive Model for Inverse Physics SimulationarXivStarWebsiteMay, 2025, CVPR
FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal GuidancearXivStarWebsiteMay, 2025, CVPR
Generating Physically Stable and Buildable LEGO Designs from TextarXivStarWebsiteMay, 2025
ReVision: High-Quality, Low-Cost Video Generation with Explicit 3D Physics Modeling for Complex Motion and InteractionarXiv-WebsiteApr., 2025
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement LearningarXiv--Apr., 2025
VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical PriorarXivStarWebsiteMar., 2025
Articulated Kinematics Distillation from Video Diffusion ModelsarXiv-WebsiteApr., 2025; CVPR, 2025
RainyGS: Efficient Rain Synthesis with Physically-Based Gaussian SplattingarXiv-WebsiteMar., 2025; CVPR, 2025
PhysGen3D: Crafting a Miniature Interactive World from a Single ImagearXivStarWebsiteMar., 2025; CVPR, 2025
AccidentSim: Generating Physically Realistic Vehicle Collision Videos from Real-World Accident ReportsarXiv-WebsiteMar., 2025
Synthetic Video Enhances Physical Fidelity in Video SynthesisarXiv-WebsiteMar., 2025
PhysTwin: Physics-Informed Reconstruction and Simulation of Deformable Objects from VideosarXivStarWebsiteMar., 2025
C-Drag: Chain-of-Thought Driven Motion Controller for Video GenerationarXivStar-Feb., 2025
PhysAnimator: Physics-Guided Generative Cartoon AnimationarXiv--Jan., 2025
OmniPhysGS: 3D Constitutive Gaussians for General Physics-Based Dynamics GenerationarXiv--ICLR, 2025
AutoVFX: Physically Realistic Video Editing from Natural Language InstructionsarXivStarWebsite3DV, 2025
Gaussian Splashing: Unified Particles for Versatile Motion Synthesis and RenderingarXiv-WebsiteCVPR, 2025
Unleashing the potential of multi-modal foundation models and video diffusion for 4d dynamic physical scene simulationarXiv-WebsiteCVPR, 2025
FluidNexus: 3D Fluid Reconstruction and Prediction from a Single VideoarXiv-WebsiteCVPR, 2025
OmniPhysGS: 3D Constitutive Gaussians for General Physics-Based Dynamics GenerationarXivStarWebsiteICLR,2025
DreamPhysics: Learning Physical Properties of Dynamic 3D Gaussians with Video Diffusion PriorsarXivStar-AAAI, 2025
GauSim: Registering Elastic Objects into Digital World by Gaussian SimulatorarXiv-WebsiteDec., 2024
GaussianProperty: Integrating Physical Properties to 3D Gaussians with LMMsarXivStarWebsiteDec., 2024
Phys4DGen: A Physics-Driven Framework for Controllable and Efficient 4D Content Generation from a Single ImagearXiv-WebsiteNov., 2024
Teaching Video Diffusion Model with Latent Physical Phenomenon KnowledgearXivStarWebsiteNov., 2024
Llmphy: Complex physical reasoning using large language models and world modelsarXiv--Nov., 2024
Automated 3D Physical Simulation of Open-world Scene with Gaussian SplattingarXiv-WebsiteNov., 2024
Enhancing Sketch Animation: Text-to-Video Diffusion Models with Temporal Consistency and Rigidity ConstraintsarXiv--Nov., 2024
PhysMotion: Physics-Grounded Dynamics From a Single ImagearXiv-WebsiteNov., 2024
Trans4D: Realistic Geometry-Aware Transition for Compositional Text-to-4D SynthesisarXivStar-Oct., 2024
Phy124: Fast Physics-Driven 4D Content Generation from a Single ImagearXiv--Sep., 2024
Kubrick: Multimodal Agent Collaborations for Synthetic Video GenerationarXiv--Aug., 2024
Physics3D: Learning Physical Properties of 3D Gaussians via Video DiffusionarXivStarWebsiteJun., 2024
Sync4D: Video Guided Controllable Dynamics for Physics-Based 4D GenerationarXiv-WebsiteMay., 2024
ElastoGen: 4D Generative ElastodynamicsarXiv-WebsiteMay, 2024
MotionCraft: Physics-based Zero-Shot Video GenerationarXivStarWebsiteNips, 2024
PhysGen: Rigid-Body Physics-Grounded Image-to-Video GenerationarXivStarWebsiteECCV, 2024
PhysDreamer: Physics-Based Interaction with 3D Objects via Video GenerationarXivStarWebsiteECCV, 2024 Oral
Video2Game: Real-time, Interactive, Realistic and Browser-Compatible Environment from a Single VideoarXivStarWebsiteCVPR, 2024
PIE-NeRF: Physics-based Interactive Elastodynamics with NeRFarXivStarWebsiteCVPR, 2024
VR-GS: A Physical Dynamics-Aware Interactive Gaussian Splatting System in Virtual RealityarXiv-WebsiteSIGGRAPH, 2024
PhysGaussian: Physics-Integrated 3D Gaussians for Generative Dynamics arXivStarWebsiteCVPR, 2024
Feature Splatting: Language-Driven Physics-Based Scene Synthesis and EditingarXivStarWebsiteECCV, 2024
Neural Material Adaptor for Visual Grounding of Intrinsic DynamicsarXivStarWebsiteNIPS, 2024
Dynamic 3D Gaussians: Tracking by Persistent Dynamic View SynthesisarXivStarWebsite3DV, 2024
LLM-grounded Video Diffusion ModelsarXivStarWebsiteICLR, 2024
Compositional 3D-aware Video Generation with LLM DirectorarXiv-WebsiteNIPS, 2024
GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT PlanningarXivStarWebsiteCVPR, 2024, workshop
DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object ManipulationarXivStarWebsiteWAFR 2024
Learning Neural Constitutive Laws From Motion Observations for Generalizable PDE DynamicsarXivStarWebsiteICML, 2023
Pac-nerf: Physics Augmented Continuum Neural Radiance Fields for Geometry-Agnostic System IdentificationarXivStarWebsiteICLR, 2023, Spotlight

Active Cognition for World Simulation

TitlearXivGithubWebSitePub. & Date
PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video GenerationarXiv--ECCV, 2026
Toward Physically Consistent Driving Video World Models under Challenging TrajectoriesarXivStarWebsiteMar., 2026
PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video GenerationarXiv--Mar., 2026
ABot-PhysWorld-Star-Mar., 2026
Can vision language models learn intuitive physics from interaction?arXiv--Feb., 2026
Inference-time Physics Alignment of Video Generative Models with Latent World ModelsarXiv--PhysicsIQ Challenge, ICCV 2025
PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative ModelsarXiv--Jan., 2026
Improving the Physics of Video Generation with VJEPA-2 Reward SignalarXiv--PhysicsIQ Challenge, ICCV 2025
What about gravity in video generation? Post-Training Newton’s Laws with Verifiable RewardsarXivStarWebsiteNov., 2025
PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference SelectionarXiv--NoV,. 2025
World Simulation with Video Foundation Models for Physical AIarXivStarWebsiteOct., 2025
PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning---Oct., 2025
PhysWorld: From Real Videos to World Models of Deformable Objects via Physics-Aware Demonstration Synthesis---Oct., 2025
Enhancing Physical Plausibility in Video Generation by Reasoning the ImplausibilityarXiv--Sep., 2025
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video GenerationarXiv-WebsiteAug., 2025
Genie 3: A new frontier for world models--WebsiteAug., 2025
Matrix-Game: Interactive World Foundation ModelarXivStarWebsiteJun., 2025
RoboScape: Physics-informed Embodied World ModelarXivStar-Jun., 2025
RDPO: Real Data Preference Optimization for Physics Consistency Video GenerationarXiv-WebsiteJun., 2025
DeepVerse: 4D Autoregressive Video Generation as a World ModelarXivStarWebsiteJun., 2025
VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation ModelsarXivStarWebsiteMay, 2025
Learning World Models for Interactive Video GenerationarXiv--May, 2025
EnerVerse-AC: Envisioning Embodied Environments with Action ConditionarXivStarWebsiteMay, 2025
MirrorVerse: Pushing Diffusion Models to Realistically Reflect the WorldarXiv-WebsiteCVPR, 2025
Science-T2I: Addressing Scientific Illusions in Image SynthesisarXivStarWebsiteCVPR, 2025
Aether: Geometric-Aware Unified World ModelingarXivStarWebsiteMar., 2025
AdaWorld: Learning Adaptable World Models with Latent ActionsarXivStarWebsiteMar., 2025
Pisa experiments: Exploring physics post-training for video diffusion models by watching stuff droparXivStarWebsiteMar., 2025
Wisa: World simulator assistant for physics-aware text-to-video generationarXivStarWebsiteMar., 2025
Ipo: Iterative preference optimization for text-to-video generationarXivStar-Feb, 2025
Do generative video models learn physical principles from watching videos?arXivStarWebsiteJan., 2025
Cosmos world foundation model platform for physical aiarXivStar Website Jan., 2025
Improving video generation with human feedbackarXivStarWebsiteJan., 2025
Phyt2v: Llm-guided iterative self-refinement for physics-grounded text-to-video generationarXivStar-CVPR, 2025
Dream to manipulate: Compositional world models empowering robot imitation learning with imaginationarXivStarWebsiteICLR, 2025
MagicTime: Time-lapse Video Generation Models as Metamorphic SimulatorsarXivStarWebsiteTPAMI, 2025
ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic ManipulationarXiv-WebsiteECCV, 2025
Improving Dynamic Object Interactions in Text-to-Video Generation with AI FeedbackarXiv-WebsiteDec., 2024
Physical informed driving world modelarXiv-WebsiteDec., 2024
How far is video generation from world model: A physical law perspectivearXivStarWebsiteNov., 2024
Video generation models as world simulators--WebsiteOct., 2024
Videoagent: Self-improving video generationarXivStarWebsiteOct., 2024
Gen-drive: Enhancing diffusion generative driving policies with reward modeling and reinforcement learning fine-tuningarXiv-WebsiteOct, 2024
Drivedreamer4d: World models are effective data machines for 4d driving scene representationarXivStarWebsiteOct, 2024
Open-sora: Democratizing efficient video production for allarXivStarWebsiteDec., 2024
Imagen 3arXiv-WebsiteAug., 2024
Genie 2: A large-scale foundation world model--Website2024
Genie: Β¨ Generative interactive environmentsarXiv-WebsiteFeb., 2024
Worlddreamer: Towards general world models for video generation via predicting masked tokensarXivStarWebsiteJan., 2024
Learning interactive real-world simulatorsarXiv-WebsiteICLR, 2024, Outstanding Paper Award
Physically embodied gaussian splatting: A visually learnt and physically grounded 3d representation for robotics--WebsiteCoRL, 2024
Gaia-1: A generative world model for autonomous drivingarXiv-WebsiteSep., 2023

Datasets, Benchmarks and Metrics

TitlearXivGithubWebsitePub. & Date
PhysInOne: Visual Physics Learning and Reasoning in One SuitearXivStarWebsiteCVPR, 2026
Physion-Eval: Evaluating Physical Realism in Generated Video via Human ReasoningarXiv-WebsiteMar., 2026
VisPhyWorld: Probing Physical Reasoning via Code-Driven Video ReconstructionarXivStarWebsiteFeb., 2026
Beyond Rigid: Benchmarking Non-Rigid Video EditingarXiv--Jan., 2026
Rethinking Video Generation Model for the Embodied WorldarXivStarWebsiteJan., 2026
FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and ReasoningarXivStar-
MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video SynthesisarXivStar-Dec., 2025
What about gravity in video generation? Post-Training Newton’s Laws with Verifiable RewardsarXivStarWebsiteNov., 2025
LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood PreferencearXivStar-Oct., 2025
CoPhyBench: Benchmarking Physical Reasoning from Conditional Video Observation---Oct., 2025
Cosmos-Eval: Towards Explainable Evaluation of Physics and Semantics in Text-to-Video Models---Oct., 2025
VideoVerse: How Far is Your T2V Generator from a World Model?arXiv-WebsiteOct., 2025
TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics ImplausibilityarXivStarWebsiteOct., 2025
Does Physics Knowledge Emerge in Frontier Models?arXiv--Oct., 2025
VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic FaithfulnessarXivStarWebsiteAug., 2025
Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation ModelarXivStarWebsiteJul., 2025
PhyWorldBench: A Comprehensive Evaluation of Physical Realism in Text-to-Video ModelsarXiv--Jul., 2025
Dex1B: Learning with 1B Demonstrations for Dexterous ManipulationarXiv-WebsiteJun., RSS, 2025
GenWorld: Towards Detecting AI-generated Real-world Simulation VideosarXivStarWebsiteJun., 2025
IntPhys 2: Benchmarking Intuitive Physics Understanding In Complex Synthetic EnvironmentsarXivStarWebsiteJun., 2025
Think Before You Diffuse: LLMs-Guided Physics-Aware Video GenerationarXiv-WebsiteMay, 2025
PhysGaia: A Physics-Aware Dataset of Multi-Body Interactions for Dynamic Novel View SynthesisarXivStarWebsiteJun., 2025
Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoTarXivStarWebsiteMay, 2025
Universal Visuo-Tactile Video Understanding for Embodied InteractionarXiv--May, 2025
T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video GenerationarXiv--May, 2025
Direct Motion Models for Assessing Generated VideosarXivStarWebsiteApr., 2025
Morpheus: Benchmarking Physical Reasoning of Video Generative Models with Real Physical ExperimentsarXiv--Apr., 2025
A Unified Evaluation Benchmark for World GenerationarXivStarWebsiteApr., 2025
HOIGen-1M: A Large-scale Dataset for Human-Object Interaction Video GenerationarXiv-WebsiteMar., 2025; CVPR, 2025
Cognitive Science-Inspired Evaluation of Core Capabilities for Object Understanding in AIarXiv--Mar., 2025
Pisa:experiments: Exploring physics post-training for video diffusion models by watching stuff droparXivStar-Mar., 2025
Impossible VideosarXivStarWebsiteMar., 2025
Wisa: World simulator assistant for physics-aware text-to-video generationarXivStarWebsiteMar., 2025
VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video GenerationarXivStarWebsiteMar., 2025
A physical coherence benchmark for evaluating video generation models via optical flow-guided frame predictionarXivStar-Feb., 2025
Do generative video models learn physical principles from watching videos?arXivStarWebsiteJan., 2025
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video GenerationarXivStarWebsiteNeurIPS, 2024, Spotlight
PhysGame: Uncovering Physical Commonsense Violations in Gameplay VideosarXivStarWebsiteDec., 2024
Llmphy: Complex physical reasoning using large language models and world modelsarXiv--Nov., 2024
What You See Is What Matters: A Novel Visual and Physics-Based Metric for Evaluating Video Generation QualityarXiv--Nov., 2024
Towards world simulator: Crafting physical commonsense-based benchmark for video generationarXivStarWebsiteOct., 2024
WorldSimBench: Towards Video Generation Models as World SimulatorsarXiv-WebsiteOct., 2024
Phybench: A physical commonsense benchmark for evaluating text-to-image modelarXiv--Jun., 2024
Videophy: Evaluating physical commonsense for video generationarXivStarWebsiteJun., 2024
Videocon: Robust video-language alignment via contrast captionsarXivStarWebsiteCVPR, 2024
Physion++: Evaluating physical scene understanding that requires online inference of different physical propertiesarXiv-WebsiteNips, 2023
Craft: A benchmark for causal reasoning about forces and interactionsarXivStarWebsiteACL, 2022
Physion: Evaluating physical prediction from vision in humans and machinesarXivStarWebsiteNips, 2021

Physical Understanding

VLMs, LLMs, MLLMs on Physical Understanding

Benchmarks

β™₯️ Star History

πŸ“‘ Citation

Please consider citing πŸ“‘ our papers if our repository is helpful to your work, thanks sincerely!

@misc{lin2025exploringevolutionphysicscognition,
      title={Exploring the Evolution of Physics Cognition in Video Generation: A Survey}, 
      author={Minghui Lin and Xiang Wang and Yishan Wang and Shu Wang and Fengqi Dai and Pengxiang Ding and Cunxiang Wang and Zhengrong Zuo and Nong Sang and Siteng Huang and Donglin Wang},
      year={2025},
      eprint={2503.21765},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2503.21765}, 
}
3d
4d
embodied-ai
physics
survey
t2v
v2v
video-generation
world-models
world-simulator

Contributors

minnie-lin

92 commits

SHYuanBest

4 commits

minnie-lin/Awesome-Physics-Cognition-based-Video-Generation

A comprehensive list of papers investigating physical cognition in video generation, including papers, codes, and related websites.

327

96 commits

updated Jun 23, 2026

See the code

README

Awesome-Physics-Cognition-based-Video-Generation

πŸš€πŸš€πŸš€ This is a repository for organizing papers, codes, and other resources related to physics cognition-based video generation. This repo is being actively updated, please stay tuned! For more detailed information, please refer to our survey paper: Exploring the Evolution of Physics Cognition in Video Generation: A Survey.

This paper list covers T2V, V2V, and dynamic 3D and 4D generation based on physics, and includes some world models and world simulators.

If you find this repository useful, please consider giving us a star 🌟 and a cite.

⚑ Contributing

We welcome feedback, suggestions, and contributions that can help improve this survey and repository and make them valuable resources for the entire community. We will actively maintain this repository by incorporating new research as it emerges. If you have any suggestions about our taxonomy, please take a look at any missed papers, or update any preprint arXiv paper that has been accepted to some venue.

If you want to add your work or model to this list, please do not hesitate to pull requests.

Markdown format:

 * Paper Name. [[Paper]](link) [[Code]](link) [[Website]](link) [**Name of Conference or Journal + Year**]

πŸ“– Table of Contents

Workshops

TitleWebsiteDate
Building Physically Plausible World ModelsWebsiteICML 2025 Workshop, Vancouver Saturday, July 19 (Whole-Day Workshop)
1st Workshop on Vision Meets Physics: Synergizing Physical Simulation and Computer VisionWebsiteCVPR 2025 Workshop, June 12 (full day), 2025

Surveys

Basic Schematic Perception for Generation

TitlearXivGithubWebSitePub. & Date
Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction ModelsarXiv-WebsiteNov., 2025
Geometry-aware 4D Video Generation for Robot ManipulationarXivStarWebsiteJul., 2025
CoCo4D: Comprehensive and Complex 4D Scene GenerationarXivStarWebsiteJun., 2025
Generative Blocks World: Moving Things Around in PicturesarXiv--Jun., 2025
UniRelight: Learning Joint Decomposition and Synthesis for Video RelightingarXiv-WebsiteJun., 2025
IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video GenerationarXivStarWebsiteJun., 2025
MotionPro: A Precise Motion Controller for Image-to-Video GenerationarXivStarWebsiteMay, 2025, CVPR
ReVision: High-Quality, Low-Cost Video Generation with Explicit 3D Physics Modeling for Complex Motion and InteractionarXiv-WebsiteApr., 2025
Any2Caption:Interpreting Any Condition to Caption for Controllable Video GenerationarXivStarWebsiteMar., 2025
Towards Physical Understanding in Video Generation: A 3D Point Regularization ApproacharXiv-WebsiteFeb, 2025
SG-I2V: Self-Guided Trajectory Control in Image-to-Video GenerationarXivStarWebsiteICLR, 2025
TrackGo: A Flexible and Efficient Method for Controllable Video GenerationarXiv--AAAI, 2025
3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video GenerationarXivStarWebsiteICLR, 2025
Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image SynthesisarXivStarWebsiteCVPR, 2025
Lux Post Facto: Learning Portrait Performance Relighting with Conditional Video Diffusion and a Hybrid DatasetarXivWebsiteCVPR,2025
Identity-Preserving Text-to-Video Generation by Frequency DecompositionarXivStarWebsiteCVPR, 2025
Motion Modes: What Could Happen Next?arXiv-WebsiteCVPR, 2025
Motion Prompting: Controlling Video Generation with Motion TrajectoriesarXiv-WebsiteCVPR, 2025 (Oral)
Spectral Motion Alignment for Video Motion Transfer using Diffusion ModelsarXivStarWebsiteAAAI, 2025
Video Creation by DemonstrationarXiv-WebsiteDec., 2024
InterDyn: Controllable Interactive Dynamics with Video Diffusion ModelsarXiv-WebsiteDec., 2024,CVPR 25
LeviTor: 3D Trajectory Oriented Image-to-Video SynthesisarXivStarWebsiteDec., 2024
GenLit: Reformulating Single-Image Relighting as Video GenerationarXiv-WebsiteDec., 2024
Motion Dreamer: Realizing Physically Coherent Video Generation through Scene-Aware Motion Reasoning arXivStarWebsiteNov., 2024.
AnimateAnything: Consistent and Controllable Animation for Video GenerationarXivStarWebsiteNov., 2024
InTraGen: Trajectory-controlled Video Generation for Object InteractionsarXivStar-Nov., 2024
DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion ControlarXiv-WebsiteOct., 2024
LumiSculpt: A Consistency Lighting Control Network for Video GenerationarXiv--Oct., 2024
Tora: Trajectory-oriented Diffusion Transformer for Video GenerationarXivStarWebsiteJul., 2024
UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image AnimationarXivStarWebsiteJun., 2024
Image Conductor: Precision Control for Interactive Video SynthesisarXivStarWebsiteJun., 2024
Motion Inversion for Video CustomizationarXivStarWebsiteMar., 2024
VMC: Video Motion Customization using Temporal Attention Adaption for Text-to-Video Diffusion ModelsarXivStarWebsiteCVPR, 2024
MotionDirector: Motion Customization of Text-to-Video Diffusion ModelsarXivStarWebsiteECCV, 2024, Oral
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video SynthesisarXiv-WebsiteCVPR, 2024, Highlight
Generative Image DynamicsarXivStarWebsiteCVPR, 2024, Best Paper Award
MotionCtrl: A Unified and Flexible Motion Controller for Video GenerationarXivStarWebsiteSIGGRAPH, 2024
MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion ModelarXivStarWebsiteECCV, 2024
Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion ModelingarXivStarWebsiteSIGGRAPH, 2024
DragAnything: Motion Control for Anything using Entity RepresentationarXivStarWebsiteECCV, 2024
FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editingarXivStarWebsiteICLR, 2024
Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character AnimationarXivStarWebsiteCVPR, 2024
Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object MotionarXivStarWebsiteSIGGRAPH, 2024
Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion ModelingarXiv-WebsiteSIGGRAPH, 2024
Compositional 3D-aware Video Generation with LLM DirectorarXiv-WebsiteNIPS, 2024
TC4D: Trajectory-Conditioned Text-to-4D GenerationarXivStarWebsiteECCV, 2024
DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and TrajectoryarXiv-WebsiteAug., 2023
Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback LearninarXivStarWebsiteMay., 2023
VideoComposer: Compositional Video Synthesis with Motion ControllabilityarXivStarWebsiteNeurIPS, 2023
Adding Conditional Control to Text-to-Image Diffusion ModelsarXivStar-ICCV, 2023, Best Paper Award

Passive Cognition of Physical Knowledge for Generation

TitlearXivGithubWebSitePub. & Date
OptiWorld: Optimal Control for Video World Generation under Physical ConstraintsarXiv-WebsiteJun., 2026
NEWTON: Agentic Planning for Physically Grounded Video GenerationarXiv-WebsiteMay, 2026
TelePhysics: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time InteractionarXivWebsiteMay, 2026
PhysVid: Physics Aware Local Conditioning for Generative Video ModelsarXiv--CVPR 2026
MotionPhysics: Learnable Motion Distillation for Text-Guided SimulationarXivStarWebsiteAAAI, 2026
Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video DiffusionarXiv-WebsiteMar., 2026
PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation AlignmentarXiv-WebsiteMar., 2026
Physical Simulator In-the-Loop Video GenerationarXivStarWebsiteCVPR, 2026
PhysVideo: Physically Plausible Video Generation with Cross-View Geometry GuidancearXiv-WebsiteMar., 2026
Chain of Event-Centric Causal Thought for Physically Plausible Video GenerationarXiv--CVPR, 2026
RealWonder: Real-Time Physical Action-Conditioned Video GenerationarXivStarWebsiteMar., 2026
Goal Force: Teaching Video Models To Accomplish Physics-Conditioned GoalsarXivStarWebsiteCVPR, 2026
PI-Light: Physics-Inspired Diffusion for Full-Image RelightingarXivStar-ICLR 2026
Self-Refining Video SamplingarXivStarWebsiteJan., 2026
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in VideosarXivStarWebsiteDec., 2025
VDAWorld: World Modelling via VLM-Directed Abstraction and SimulationarXiv-WebsiteDec., 2025
Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-RefinementarXiv--ICCV 2025 Physics-IQ Challenge Third Place
ProPhy: Progressive Physical Alignment for Dynamic World SimulationarXiv-WebsiteDec., 2025
Planning with Sketch-Guided Verification for Physics-Aware Video GenerationarXivStarWebsiteNov., 2025
Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-RefinementarXiv--Nov., ICCV 2025 Physics-IQ Challenge Third Place Solution
CP4D: Compositional physics-aware 4D scene generation---Oct., 2025
3DPhysVideo: 3D Scene Reconstruction and Physical Animation Leveraging a Video Generation Model via Consistency-Guided Flow SDE---Oct., 2025
PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM---Oct., 2025
DiffuPhyGS: Text-to-Video Generation with 3D Gaussians and Learnable Physical Properties via Diffusion Priors---Oct., 2025
Fracture-GS: Dynamic Fracture Simulation with Physics-Integrated Gaussian Splatting---Oct., 2025
PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Generation---Oct., 2025
Learning to Generate Object Interactions with Physics-Guided Video DiffusionarXiv-WebsiteOct., 2025
CONTROLHAIR: Physically-based Video Diffusion for Controllable Dynamic Hair RenderingarXiv-WebsiteSep., 2025
NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian DynamicsarXivStar-Sep., 2025
PIRF: Physics-Informed Reward Fine-Tuning for Diffusion ModelsarXivStar-Sep., 2025
PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation--WebsiteNeurIPS, 2025
PhysGM: Large Physical Gaussian Model for Feed-Forward 4D SynthesisarXiv-WebsiteAug., 2025
Physics-Grounded Motion Forecasting via Equation Discovery for Trajectory-Guided Image-to-Video GenerationarXiv--Jul., 2025
Dreamland: Controllable World Creation with Simulator and Generative ModelsarXiv-WebsiteJun., 2025
Vid2Sim: Generalizable, Video-based Reconstruction of Appearance, Geometry and Physics for Mesh-free SimulationarXiv-WebsiteJun., 2025, CVPR
Physics-Guided Motion Loss for Video Generation ModelarXiv--Jun., 2025
Think Before You Diffuse: LLMs-Guided Physics-Aware Video GenerationarXiv-WebsiteMay, 2025
Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control SignalsarXivStarWebsiteMay, 2025
WonderPlay: Dynamic 3D Scene Generation from a Single Image and ActionsarXiv-WebsiteMay, 2025
MAGIC: Motion-Aware Generative Inference via Confidence-Guided LLMarXiv--May, 2025
UniPhy: Learning a Unified Constitutive Model for Inverse Physics SimulationarXivStarWebsiteMay, 2025, CVPR
FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal GuidancearXivStarWebsiteMay, 2025, CVPR
Generating Physically Stable and Buildable LEGO Designs from TextarXivStarWebsiteMay, 2025
ReVision: High-Quality, Low-Cost Video Generation with Explicit 3D Physics Modeling for Complex Motion and InteractionarXiv-WebsiteApr., 2025
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement LearningarXiv--Apr., 2025
VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical PriorarXivStarWebsiteMar., 2025
Articulated Kinematics Distillation from Video Diffusion ModelsarXiv-WebsiteApr., 2025; CVPR, 2025
RainyGS: Efficient Rain Synthesis with Physically-Based Gaussian SplattingarXiv-WebsiteMar., 2025; CVPR, 2025
PhysGen3D: Crafting a Miniature Interactive World from a Single ImagearXivStarWebsiteMar., 2025; CVPR, 2025
AccidentSim: Generating Physically Realistic Vehicle Collision Videos from Real-World Accident ReportsarXiv-WebsiteMar., 2025
Synthetic Video Enhances Physical Fidelity in Video SynthesisarXiv-WebsiteMar., 2025
PhysTwin: Physics-Informed Reconstruction and Simulation of Deformable Objects from VideosarXivStarWebsiteMar., 2025
C-Drag: Chain-of-Thought Driven Motion Controller for Video GenerationarXivStar-Feb., 2025
PhysAnimator: Physics-Guided Generative Cartoon AnimationarXiv--Jan., 2025
OmniPhysGS: 3D Constitutive Gaussians for General Physics-Based Dynamics GenerationarXiv--ICLR, 2025
AutoVFX: Physically Realistic Video Editing from Natural Language InstructionsarXivStarWebsite3DV, 2025
Gaussian Splashing: Unified Particles for Versatile Motion Synthesis and RenderingarXiv-WebsiteCVPR, 2025
Unleashing the potential of multi-modal foundation models and video diffusion for 4d dynamic physical scene simulationarXiv-WebsiteCVPR, 2025
FluidNexus: 3D Fluid Reconstruction and Prediction from a Single VideoarXiv-WebsiteCVPR, 2025
OmniPhysGS: 3D Constitutive Gaussians for General Physics-Based Dynamics GenerationarXivStarWebsiteICLR,2025
DreamPhysics: Learning Physical Properties of Dynamic 3D Gaussians with Video Diffusion PriorsarXivStar-AAAI, 2025
GauSim: Registering Elastic Objects into Digital World by Gaussian SimulatorarXiv-WebsiteDec., 2024
GaussianProperty: Integrating Physical Properties to 3D Gaussians with LMMsarXivStarWebsiteDec., 2024
Phys4DGen: A Physics-Driven Framework for Controllable and Efficient 4D Content Generation from a Single ImagearXiv-WebsiteNov., 2024
Teaching Video Diffusion Model with Latent Physical Phenomenon KnowledgearXivStarWebsiteNov., 2024
Llmphy: Complex physical reasoning using large language models and world modelsarXiv--Nov., 2024
Automated 3D Physical Simulation of Open-world Scene with Gaussian SplattingarXiv-WebsiteNov., 2024
Enhancing Sketch Animation: Text-to-Video Diffusion Models with Temporal Consistency and Rigidity ConstraintsarXiv--Nov., 2024
PhysMotion: Physics-Grounded Dynamics From a Single ImagearXiv-WebsiteNov., 2024
Trans4D: Realistic Geometry-Aware Transition for Compositional Text-to-4D SynthesisarXivStar-Oct., 2024
Phy124: Fast Physics-Driven 4D Content Generation from a Single ImagearXiv--Sep., 2024
Kubrick: Multimodal Agent Collaborations for Synthetic Video GenerationarXiv--Aug., 2024
Physics3D: Learning Physical Properties of 3D Gaussians via Video DiffusionarXivStarWebsiteJun., 2024
Sync4D: Video Guided Controllable Dynamics for Physics-Based 4D GenerationarXiv-WebsiteMay., 2024
ElastoGen: 4D Generative ElastodynamicsarXiv-WebsiteMay, 2024
MotionCraft: Physics-based Zero-Shot Video GenerationarXivStarWebsiteNips, 2024
PhysGen: Rigid-Body Physics-Grounded Image-to-Video GenerationarXivStarWebsiteECCV, 2024
PhysDreamer: Physics-Based Interaction with 3D Objects via Video GenerationarXivStarWebsiteECCV, 2024 Oral
Video2Game: Real-time, Interactive, Realistic and Browser-Compatible Environment from a Single VideoarXivStarWebsiteCVPR, 2024
PIE-NeRF: Physics-based Interactive Elastodynamics with NeRFarXivStarWebsiteCVPR, 2024
VR-GS: A Physical Dynamics-Aware Interactive Gaussian Splatting System in Virtual RealityarXiv-WebsiteSIGGRAPH, 2024
PhysGaussian: Physics-Integrated 3D Gaussians for Generative Dynamics arXivStarWebsiteCVPR, 2024
Feature Splatting: Language-Driven Physics-Based Scene Synthesis and EditingarXivStarWebsiteECCV, 2024
Neural Material Adaptor for Visual Grounding of Intrinsic DynamicsarXivStarWebsiteNIPS, 2024
Dynamic 3D Gaussians: Tracking by Persistent Dynamic View SynthesisarXivStarWebsite3DV, 2024
LLM-grounded Video Diffusion ModelsarXivStarWebsiteICLR, 2024
Compositional 3D-aware Video Generation with LLM DirectorarXiv-WebsiteNIPS, 2024
GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT PlanningarXivStarWebsiteCVPR, 2024, workshop
DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object ManipulationarXivStarWebsiteWAFR 2024
Learning Neural Constitutive Laws From Motion Observations for Generalizable PDE DynamicsarXivStarWebsiteICML, 2023
Pac-nerf: Physics Augmented Continuum Neural Radiance Fields for Geometry-Agnostic System IdentificationarXivStarWebsiteICLR, 2023, Spotlight

Active Cognition for World Simulation

TitlearXivGithubWebSitePub. & Date
PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video GenerationarXiv--ECCV, 2026
Toward Physically Consistent Driving Video World Models under Challenging TrajectoriesarXivStarWebsiteMar., 2026
PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video GenerationarXiv--Mar., 2026
ABot-PhysWorld-Star-Mar., 2026
Can vision language models learn intuitive physics from interaction?arXiv--Feb., 2026
Inference-time Physics Alignment of Video Generative Models with Latent World ModelsarXiv--PhysicsIQ Challenge, ICCV 2025
PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative ModelsarXiv--Jan., 2026
Improving the Physics of Video Generation with VJEPA-2 Reward SignalarXiv--PhysicsIQ Challenge, ICCV 2025
What about gravity in video generation? Post-Training Newton’s Laws with Verifiable RewardsarXivStarWebsiteNov., 2025
PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference SelectionarXiv--NoV,. 2025
World Simulation with Video Foundation Models for Physical AIarXivStarWebsiteOct., 2025
PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning---Oct., 2025
PhysWorld: From Real Videos to World Models of Deformable Objects via Physics-Aware Demonstration Synthesis---Oct., 2025
Enhancing Physical Plausibility in Video Generation by Reasoning the ImplausibilityarXiv--Sep., 2025
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video GenerationarXiv-WebsiteAug., 2025
Genie 3: A new frontier for world models--WebsiteAug., 2025
Matrix-Game: Interactive World Foundation ModelarXivStarWebsiteJun., 2025
RoboScape: Physics-informed Embodied World ModelarXivStar-Jun., 2025
RDPO: Real Data Preference Optimization for Physics Consistency Video GenerationarXiv-WebsiteJun., 2025
DeepVerse: 4D Autoregressive Video Generation as a World ModelarXivStarWebsiteJun., 2025
VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation ModelsarXivStarWebsiteMay, 2025
Learning World Models for Interactive Video GenerationarXiv--May, 2025
EnerVerse-AC: Envisioning Embodied Environments with Action ConditionarXivStarWebsiteMay, 2025
MirrorVerse: Pushing Diffusion Models to Realistically Reflect the WorldarXiv-WebsiteCVPR, 2025
Science-T2I: Addressing Scientific Illusions in Image SynthesisarXivStarWebsiteCVPR, 2025
Aether: Geometric-Aware Unified World ModelingarXivStarWebsiteMar., 2025
AdaWorld: Learning Adaptable World Models with Latent ActionsarXivStarWebsiteMar., 2025
Pisa experiments: Exploring physics post-training for video diffusion models by watching stuff droparXivStarWebsiteMar., 2025
Wisa: World simulator assistant for physics-aware text-to-video generationarXivStarWebsiteMar., 2025
Ipo: Iterative preference optimization for text-to-video generationarXivStar-Feb, 2025
Do generative video models learn physical principles from watching videos?arXivStarWebsiteJan., 2025
Cosmos world foundation model platform for physical aiarXivStar Website Jan., 2025
Improving video generation with human feedbackarXivStarWebsiteJan., 2025
Phyt2v: Llm-guided iterative self-refinement for physics-grounded text-to-video generationarXivStar-CVPR, 2025
Dream to manipulate: Compositional world models empowering robot imitation learning with imaginationarXivStarWebsiteICLR, 2025
MagicTime: Time-lapse Video Generation Models as Metamorphic SimulatorsarXivStarWebsiteTPAMI, 2025
ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic ManipulationarXiv-WebsiteECCV, 2025
Improving Dynamic Object Interactions in Text-to-Video Generation with AI FeedbackarXiv-WebsiteDec., 2024
Physical informed driving world modelarXiv-WebsiteDec., 2024
How far is video generation from world model: A physical law perspectivearXivStarWebsiteNov., 2024
Video generation models as world simulators--WebsiteOct., 2024
Videoagent: Self-improving video generationarXivStarWebsiteOct., 2024
Gen-drive: Enhancing diffusion generative driving policies with reward modeling and reinforcement learning fine-tuningarXiv-WebsiteOct, 2024
Drivedreamer4d: World models are effective data machines for 4d driving scene representationarXivStarWebsiteOct, 2024
Open-sora: Democratizing efficient video production for allarXivStarWebsiteDec., 2024
Imagen 3arXiv-WebsiteAug., 2024
Genie 2: A large-scale foundation world model--Website2024
Genie: Β¨ Generative interactive environmentsarXiv-WebsiteFeb., 2024
Worlddreamer: Towards general world models for video generation via predicting masked tokensarXivStarWebsiteJan., 2024
Learning interactive real-world simulatorsarXiv-WebsiteICLR, 2024, Outstanding Paper Award
Physically embodied gaussian splatting: A visually learnt and physically grounded 3d representation for robotics--WebsiteCoRL, 2024
Gaia-1: A generative world model for autonomous drivingarXiv-WebsiteSep., 2023

Datasets, Benchmarks and Metrics

TitlearXivGithubWebsitePub. & Date
PhysInOne: Visual Physics Learning and Reasoning in One SuitearXivStarWebsiteCVPR, 2026
Physion-Eval: Evaluating Physical Realism in Generated Video via Human ReasoningarXiv-WebsiteMar., 2026
VisPhyWorld: Probing Physical Reasoning via Code-Driven Video ReconstructionarXivStarWebsiteFeb., 2026
Beyond Rigid: Benchmarking Non-Rigid Video EditingarXiv--Jan., 2026
Rethinking Video Generation Model for the Embodied WorldarXivStarWebsiteJan., 2026
FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and ReasoningarXivStar-
MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video SynthesisarXivStar-Dec., 2025
What about gravity in video generation? Post-Training Newton’s Laws with Verifiable RewardsarXivStarWebsiteNov., 2025
LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood PreferencearXivStar-Oct., 2025
CoPhyBench: Benchmarking Physical Reasoning from Conditional Video Observation---Oct., 2025
Cosmos-Eval: Towards Explainable Evaluation of Physics and Semantics in Text-to-Video Models---Oct., 2025
VideoVerse: How Far is Your T2V Generator from a World Model?arXiv-WebsiteOct., 2025
TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics ImplausibilityarXivStarWebsiteOct., 2025
Does Physics Knowledge Emerge in Frontier Models?arXiv--Oct., 2025
VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic FaithfulnessarXivStarWebsiteAug., 2025
Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation ModelarXivStarWebsiteJul., 2025
PhyWorldBench: A Comprehensive Evaluation of Physical Realism in Text-to-Video ModelsarXiv--Jul., 2025
Dex1B: Learning with 1B Demonstrations for Dexterous ManipulationarXiv-WebsiteJun., RSS, 2025
GenWorld: Towards Detecting AI-generated Real-world Simulation VideosarXivStarWebsiteJun., 2025
IntPhys 2: Benchmarking Intuitive Physics Understanding In Complex Synthetic EnvironmentsarXivStarWebsiteJun., 2025
Think Before You Diffuse: LLMs-Guided Physics-Aware Video GenerationarXiv-WebsiteMay, 2025
PhysGaia: A Physics-Aware Dataset of Multi-Body Interactions for Dynamic Novel View SynthesisarXivStarWebsiteJun., 2025
Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoTarXivStarWebsiteMay, 2025
Universal Visuo-Tactile Video Understanding for Embodied InteractionarXiv--May, 2025
T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video GenerationarXiv--May, 2025
Direct Motion Models for Assessing Generated VideosarXivStarWebsiteApr., 2025
Morpheus: Benchmarking Physical Reasoning of Video Generative Models with Real Physical ExperimentsarXiv--Apr., 2025
A Unified Evaluation Benchmark for World GenerationarXivStarWebsiteApr., 2025
HOIGen-1M: A Large-scale Dataset for Human-Object Interaction Video GenerationarXiv-WebsiteMar., 2025; CVPR, 2025
Cognitive Science-Inspired Evaluation of Core Capabilities for Object Understanding in AIarXiv--Mar., 2025
Pisa:experiments: Exploring physics post-training for video diffusion models by watching stuff droparXivStar-Mar., 2025
Impossible VideosarXivStarWebsiteMar., 2025
Wisa: World simulator assistant for physics-aware text-to-video generationarXivStarWebsiteMar., 2025
VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video GenerationarXivStarWebsiteMar., 2025
A physical coherence benchmark for evaluating video generation models via optical flow-guided frame predictionarXivStar-Feb., 2025
Do generative video models learn physical principles from watching videos?arXivStarWebsiteJan., 2025
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video GenerationarXivStarWebsiteNeurIPS, 2024, Spotlight
PhysGame: Uncovering Physical Commonsense Violations in Gameplay VideosarXivStarWebsiteDec., 2024
Llmphy: Complex physical reasoning using large language models and world modelsarXiv--Nov., 2024
What You See Is What Matters: A Novel Visual and Physics-Based Metric for Evaluating Video Generation QualityarXiv--Nov., 2024
Towards world simulator: Crafting physical commonsense-based benchmark for video generationarXivStarWebsiteOct., 2024
WorldSimBench: Towards Video Generation Models as World SimulatorsarXiv-WebsiteOct., 2024
Phybench: A physical commonsense benchmark for evaluating text-to-image modelarXiv--Jun., 2024
Videophy: Evaluating physical commonsense for video generationarXivStarWebsiteJun., 2024
Videocon: Robust video-language alignment via contrast captionsarXivStarWebsiteCVPR, 2024
Physion++: Evaluating physical scene understanding that requires online inference of different physical propertiesarXiv-WebsiteNips, 2023
Craft: A benchmark for causal reasoning about forces and interactionsarXivStarWebsiteACL, 2022
Physion: Evaluating physical prediction from vision in humans and machinesarXivStarWebsiteNips, 2021

Physical Understanding

VLMs, LLMs, MLLMs on Physical Understanding

Benchmarks

β™₯️ Star History

πŸ“‘ Citation

Please consider citing πŸ“‘ our papers if our repository is helpful to your work, thanks sincerely!

@misc{lin2025exploringevolutionphysicscognition,
      title={Exploring the Evolution of Physics Cognition in Video Generation: A Survey}, 
      author={Minghui Lin and Xiang Wang and Yishan Wang and Shu Wang and Fengqi Dai and Pengxiang Ding and Cunxiang Wang and Zhengrong Zuo and Nong Sang and Siteng Huang and Donglin Wang},
      year={2025},
      eprint={2503.21765},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2503.21765}, 
}
3d
4d
embodied-ai
physics
survey
t2v
v2v
video-generation
world-models
world-simulator

Contributors

minnie-lin

92 commits

SHYuanBest

4 commits