people-robots/Awesome-Video-Generation-Post-Training

[TMLR] Video Generation Models: A Survey of Post-Training and Alignment | 🔥 A continuously updated collection of papers, datasets, and benchmarks on post-training and alignment for video generation.

189

172 commits

updated Jul 20, 2026

See the code

README

Awesome Video Generation Post Training

🔥 A continuously updated repository of research on post-training and alignment for video generation.

License: MIT PDF Last Update GitHub stars

Video Generation Models: A Survey of Post-Training and Alignment

Chaoyu Li1,†,✉️, Xiaoyi Gu2,†, Yogesh Kulkarni1, Eun Woo Im1, Mohammadmahdi Honarmand3, Zeyu Wang4, Juntong Song5, Fei Du6, Xilin Jiang7, Kexin Zheng8, Tianzhi Li9, Fei Tao5, Pooyan Fazli1,✉️

1Arizona State University · 2Twitch · 3Stanford University · 4eBay · 5NewsBreak · 6Microsoft · 7Columbia University · 8University of Southern California · 9Carnegie Mellon University

Equal contribution. ✉️Corresponding author: Chaoyu Li , Pooyan Fazli.

timeline


[!IMPORTANT] We welcome your help in improving the repository and paper. Please feel free to submit a pull request to:

  • Add a relevant paper not yet included.
  • Suggest a more suitable category.
  • Update the information.
  • Ask for clarification about any content.

🔥 News

  • [2026.06.09] Our survey paper has been accepted to TMLR 🚀.
  • [2026.06.09] Added papers accepted to ICML 2026.
  • [2026.06.09] Added papers accepted to CVPR 2026.
  • [2026.03.23] Added papers accepted to ICLR 2026.
  • [2026.02.23] The v1 survey is now published! We have also initialized the repository.

🎯 Motivation

teaser While large-scale pretraining has significantly improved video generation models, aligning them with human intent, physical constraints, and deployment requirements remains a major challenge. As a result, post-training and alignment techniques have rapidly become a central research focus in modern video generation.

In our survey paper, we systematically review recent progress in supervised fine-tuning, self-training and distillation, preference-based optimization, and inference-time alignment methods.

This repository serves as a companion resource to the survey.
It aims to:

  • 📚 Curate recent papers on post-training and alignment for video generation
  • 📊 Collect datasets and evaluation benchmarks related to post-training and alignment

We hope this repository provides researchers and practitioners with a convenient, up-to-date reference for exploring the evolving landscape of post-training and alignment in video generation models.

📌 Citation

If you find our paper or this resource helpful, please consider cite:

@article{li2026video,
  title={Video Generation Models: A Survey of Post-Training and Alignment},
  author={Chaoyu Li and Xiaoyi Gu and Yogesh Kulkarni and Eun Woo Im and Mohammadmahdi Honarmand and Zeyu Wang and Juntong Song and Fei Du and Xilin Jiang and Kexin Zheng and Tianzhi Li and Fei Tao and Pooyan Fazli},
  journal={Transactions on Machine Learning Research},
  issn={2835-8856},
  year={2026},
  url={https://openreview.net/forum?id=YlUEWLESIu},
}

📚 Content


Datasets

DatasetYearLinks
NeurIPS ChronoMagic-Pro2024Paper · GitHub · Website · Dataset
NeurIPS SafeSora2024Paper · GitHub · Website · Dataset
ICCV TIP-I2V2025Paper · GitHub · Website · Dataset
ICCV SynFMC2025Paper · GitHub · Website · Dataset
CVPR CookGen2025Paper · Website · Dataset
CVPR HOIGen-1M2025Paper · Website · Dataset
CVPR OpenHumanVid2025Paper · GitHub · Website
ICML PhyWorld2025Paper · GitHub · Website · Dataset
NeurIPS WISA-80K2025Paper · GitHub · Website · Dataset
NeurIPS VideoUFO2025Paper · GitHub · Dataset
NeurIPS TalkCuts2025Paper · GitHub · Website · Dataset
NeurIPS EgoVid-5M2025Paper · GitHub · Website · Dataset
NeurIPS OpenS2V-5M2025Paper · GitHub · Website · Dataset
PMLR GRADEO-Instruct2025Paper
arXiv PNData2025Paper
arXiv PairFS-4K2025Paper · GitHub · Website
arXiv MMVideo2025Paper · GitHub · Website
arXiv DAVID-X2025Paper
arXiv Dprim2025Paper
CVPR CI-VID2026Paper · GitHub · Dataset
arXiv GB3DV-25k2026Paper · Website · Dataset
arXiv MuSS2026Paper · GitHub

Benchmarks

BenchmarkYearLinks
NeurIPS FETV2023Paper · GitHub · Dataset
NeurIPS StoryBench2023Paper · GitHub
NeurIPS ChronoMagic-Bench2024Paper · GitHub · Website · Dataset
CVPR EvalCrafter2024Paper · GitHub · Website · Dataset
CVPR VBench2024Paper · GitHub · Website · Dataset
NeurIPS T2VSafetyBench2024Paper · GitHub
ICCV MTBench2025Paper · GitHub · Website · Dataset
ICCV FiVE2025Paper · GitHub · Website · Dataset
ICCV VEG-Bench2025Paper · GitHub · Website · Dataset
ICCV VMBench2025Paper · GitHub · Website · Dataset
CVPR T2V-CompBench2025Paper · GitHub · Website · Dataset
CVPR StoryEval2025Paper · GitHub · Website · Dataset
CVPR MC-Bench2025Paper · GitHub · Website · Dataset
CVPR Video-Bench2025Paper · GitHub
NeurIPS MJ-BENCH-VIDEO2025Paper · GitHub · Website · Dataset
NeurIPS OpenS2V-Eval2025Paper · GitHub · Website · Dataset
NeurIPS VideoGen-RewardBench2025Paper · GitHub · Website · Dataset
NeurIPS AIGC-LipSync2025Paper · Website · Dataset
NeurIPS WorldModelBench2025Paper · GitHub · Website · Dataset
ACM MM VIP-200K2025Paper · Website · Dataset
ACM MM RGCD2025Paper · GitHub · Dataset
ACM MM RecipeGen2025Paper · Dataset
ACM MM HVEval2025Paper
EMNLP Doc2Present2025Paper · GitHub · Dataset
ACL VidCapBench2025Paper · GitHub · Dataset
ICLR VideoPhy2025Paper · GitHub · Dataset
ICML PhyGenBench2025Paper · GitHub · Website · Dataset
arXiv Paper2Video2025Paper · GitHub · Website · Dataset
arXiv PhyWorldBench2025Paper · GitHub · Dataset
arXiv SeqBench2025Paper · GitHub · Website · Dataset
arXiv VideoVerse2025Paper · GitHub · Website · Dataset
arXiv MMMC2025Paper · GitHub · Website · Dataset
arXiv DynamicEval2025Paper · GitHub · Website · Dataset
arXiv V-ReasonBench2025Paper · GitHub · Website · Dataset
arXiv RGCD (alternate)2025Paper · GitHub · Dataset
arXiv VIPER2025Paper · GitHub · Dataset
arXiv Video Reality Test2025Paper · GitHub · Website · Dataset
arXiv WYD2025Paper · GitHub
arXiv GenVidBench2025Paper
arXiv DIVE2025Paper
arXiv UI2V-Bench2025Paper
arXiv PhysVidBench2025Paper
arXiv SurgVeo2025Paper
arXiv PAI-Bench2025Paper
arXiv MEve2025Paper
ICML SafeMVDrive2026Paper · GitHub · Website · Dataset
ICML AIGVE-60K2026Paper · GitHub · Dataset
ICML T2AV-Compass2026Paper · Dataset
ICML LoCoT2V-Bench2026Paper
WACV GeneVA2026Paper · Website · Dataset
WACV PhyEduVideo2026Paper · GitHub · Website
arXiv DrivingGen2026Paper · Website · Dataset
arXiv RISE-Video2026Paper · GitHub · Dataset
arXiv RBench2026Paper · GitHub · Website · Dataset
arXiv VC-Bench2026Paper · Website · Dataset
arXiv CoW-Bench2026Paper · GitHub · Dataset
arXiv MTAVG-Bench2026Paper
arXiv MSVBench2026Paper
arXiv SafeGen-Bench2026Paper
arXiv DirectorBench2026Paper · GitHub · Dataset
arXiv EvalVerse2026Paper
arXiv EntityBench2026Paper · GitHub · Website
arXiv MechVerse2026Paper · Website
arXiv WorldReasonBench2026Paper · GitHub · Website
arXiv WorldJen2026Paper · GitHub · Website · Dataset
arXiv BRITE2026Paper
arXiv WorldMark2026Paper · Website

Conference Papers

TitleYearLinks
CVPR FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance2026Paper · GitHub · Website
CVPR GenHOI: Towards Object-Consistent Hand–Object Interaction with Temporally Balanced and Spatially Selective Object Injection2026Paper · GitHub · Website
CVPR GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling2026Paper
CVPR Plenoptic Video Generation2026Paper · GitHub · Website
CVPR SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models2026Paper · GitHub
CVPR EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses2026Paper · GitHub · Website
CVPR Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation2026Paper
CVPR TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models2026Paper · GitHub · Website
CVPR TGT: Text-Grounded Trajectories for Locally Controlled Video Generation2026Paper · Website
CVPR Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization2026Paper · GitHub · Website
CVPR Lynx: Towards High-Fidelity Personalized Video Generation2026Paper · GitHub · Website
CVPR ORV: 4D Occupancy-centric Robot Video Generation2026Paper · GitHub · Website
ICML Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models2026Paper
ICML World-R1: Reinforcing 3D Constraints for Text-to-Video Generation2026Paper · GitHub · Website
ICML WorldCompass: Reinforcement Learning for Long-Horizon World Models2026Paper · GitHub · Website
ICML Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation2026Paper · GitHub · Website
ICML VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation2026Paper · GitHub · Website
ICML TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment2026Paper
ICML Mitigating Surgical Data Imbalance with Dual-Prediction Video Diffusion Model2026Paper
ICML RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space2026Paper · GitHub · Website
ICML LayerT2V: Interactive Multi-Object Trajectory Layering for Video Generation2026Paper · GitHub · Website
ICML Physics-Guided Motion Loss for Video Generation Model2026Paper
ICML SafeMVDrive: Multi-view Safety-Critical Driving Video Synthesis in the Real World Domain2026Paper · GitHub · Website
ICLR Neodragon: Mobile Video Generation using Diffusion Transformer2026Paper · Website
ICLR The Quest for Generalizable Motion Generation: Data, Model, and Evaluation2026Paper · GitHub
ICLR MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models2026Paper
ICLR Stable Video Infinity: Infinite-Length Video Generation with Error Recycling2026Paper
ICLR Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency2026Paper
ICLR MATRIX: Mask Track Alignment for Interaction-aware Video Generation2026Paper
ICLR Arbitrary Generative Video Interpolation2026Paper
ICLR Rolling Forcing: Autoregressive Long Video Diffusion in Real Time2026Paper · GitHub · Website
ICLR BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models2026Paper · GitHub · Website
ICLR MoSA: Motion-Coherent Human Video Generation via Structure-Appearance Decoupling2026Paper · GitHub · Website
ICLR Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration2026Paper · GitHub · Website
ICLR DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing2026Paper
ICLR Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling2026Paper · GitHub · Website
ICLR Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control2026Paper · GitHub · Website
ICLR Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks2026Paper · GitHub
ICLR MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement2026Paper · GitHub · Website
ICLR Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model2026Paper · Website
ICLR UNIC: Unified In-Context Video Editing2026Paper · Website
ICLR EffiVMT: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning2026Paper · Website
ICLR EasyCreator: Empowering 4D Creation through Video Inpainting2026Paper · Website
AAAI PanFlow: Decoupled Motion Control for Panoramic Video Generation2026Paper · GitHub · Website
AAAI Phased One-Step Adversarial Equilibrium for Video Diffusion Models2026Paper · Website
AAAI Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation2026Paper · GitHub · Website
WACV Show Me: Unifying Instructional Image and Video Generation with Diffusion Models2026Paper · GitHub · Website
WACV UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models2026Paper · GitHub
NeurIPS Controllable Human-centric Keyframe Interpolation with Generative Prior2025Paper · GitHub · Website
NeurIPS RoboScape: Physics-informed Embodied World Model2025Paper · GitHub
NeurIPS Aligning What Matters: Masked Latent Adaptation for Text-to-Audio-Video Generation2025Paper
NeurIPS Audio-Sync Video Generation with Multi-Stream Temporal Control2025Paper · GitHub · Website
NeurIPS Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation2025Paper · Website
NeurIPS DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models2025Paper · Website
NeurIPS EchoShot: Multi-Shot Portrait Video Generation2025Paper · GitHub · Website
NeurIPS Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models2025Paper · GitHub · Website
NeurIPS Frame In-N-Out: Unbounded Controllable Image-to-Video Generation2025Paper · GitHub · Website
NeurIPS GeoVideo: Introducing Geometric Regularization into Video Generation Model2025Paper · GitHub · Website
NeurIPS Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation2025Paper · Website
NeurIPS Imagine360: Immersive 360 Video Generation from Perspective Anchor2025Paper · GitHub · Website
NeurIPS Improving Video Generation with Human Feedback2025Paper · GitHub · Website
NeurIPS MoCha: Towards Movie-Grade Talking Character Generation2025Paper · GitHub · Website
NeurIPS PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement2025Paper · Website
NeurIPS Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation2025Paper · GitHub · Website
NeurIPS RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation2025Paper
NeurIPS Temporal In-Context Fine-Tuning for Versatile Control of Video Diffusion Models2025Paper · GitHub · Website
NeurIPS VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models2025Paper · GitHub · Website
NeurIPS Virtual Fitting Room: Generating Arbitrarily Long Videos of Virtual Try-On from a Single Image2025Paper · Website
NeurIPS Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance2025Paper · GitHub · Website
NeurIPS WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation2025Paper · GitHub · Website
NeurIPS WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception2025Paper · Website
NeurIPS Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion2025Paper · GitHub
EMNLP VC4VG: Optimizing Video Captions for Text-to-Video Generation2025Paper · GitHub
ACM MM AICL: Action In-Context Learning for Video Diffusion Model2025Paper
ACM MM Improving Identity Preservation in Video Generation with Multi-Branch Models2025Paper
ACM MM M2PE-DIFF: Music-to-Pose Encoder for Dance Video Generation Leveraging Latent Diffusion Framework.2025Paper
ACM MM SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation2025Paper
ACM MM Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation2025Paper · Website
ACM MM AnimeColor: Reference-based Animation Colorization with Diffusion Transformers2025Paper · GitHub
ICCV Causal-Entity Reflected Egocentric Traffic Accident Video Synthesis2025Paper · GitHub · Website
ICCV Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models2025Paper · GitHub · Website
ICCV AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction2025Paper · Website
ICCV Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis2025Paper
ICCV Decouple and Track: Benchmarking and Improving Video Diffusion Transformers For Motion Transfer2025Paper · GitHub · Website
ICCV DiTaiListener: Controllable High Fidelity Listener Video Generation with Diffusion2025Paper · Website
ICCV DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization2025Paper · Website
ICCV Dual-Expert Consistency Model for Efficient and High-Quality Video Generation2025Paper · GitHub · Website
ICCV DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization2025Paper · GitHub · Website
ICCV EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models2025Paper · GitHub
ICCV Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video Generation2025Paper · GitHub · Website
ICCV I2VControl: Disentangled and Unified Video Motion Synthesis Control2025Paper · Website
ICCV LayerAnimate: Layer-level Control for Animation2025Paper · GitHub · Website
ICCV Learning Few-Step Diffusion Models by Trajectory Distribution Matching2025Paper · GitHub · Website
ICCV LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion2025Paper · Website
ICCV Long Context Tuning for Video Generation2025Paper · Website
ICCV MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization2025Paper · GitHub · Website
ICCV MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers2025Paper · GitHub
ICCV MagicMotion: Controllable Video Generation with Dense-to-Sparse Trajectory Guidance2025Paper · GitHub · Website
ICCV Mobile Video Diffusion2025Paper · Website
ICCV MotionAgent: Fine-grained Controllable Video Generation via Motion Field Agent2025Paper · GitHub
ICCV PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation2025Paper · GitHub · Website
ICCV Phantom: Subject-Consistent Video Generation via Cross-Modal Alignment2025Paper · GitHub · Website
ICCV Precise Action-to-Video Generation Through Visual Action Prompts2025Paper · Website
ICCV Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM2025Paper · GitHub
ICCV Puppet-Master: Scaling Interactive Video Generation as a Motion Prior for Part-Level Dynamics2025Paper · GitHub · Website
ICCV Reangle-A-Video: 4D Video Generation as Video-to-Video Translation2025Paper · GitHub · Website
ICCV RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control2025Paper · GitHub · Website
ICCV STAR: Spatial-Temporal Augmentation with Text-to-Video Models for Real-World Video Super-Resolution2025Paper · GitHub · Website
ICCV TACO: Taming Diffusion for in-the-wild Video Amodal Completion2025Paper · GitHub · Website
ICCV V.I.P.: Iterative Online Preference Distillation for Efficient Video Diffusion Models2025Paper · Website
ICCV VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation2025Paper · GitHub · Website
ICCV Versatile Transition Generation with Image-to-Video Diffusion2025Paper · Website
ICCV VideoAuteur: Towards Long Narrative Video Generation2025Paper · GitHub · Website
IJCAI FLAP: Fully-controllable Audio-driven Portrait Video Generation through 3D head conditioned diffusion model2025Paper
ICML FrameBridge: Improving Image-to-Video Generation with Bridge Models2025Paper · Website
ICML Diffusion Adversarial Post-Training for One-Step Video Generation2025Paper · Website
CVPR Identity-Preserving Text-to-Video Generation by Frequency Decomposition2025Paper · GitHub · Website
CVPR AKiRa: Augmentation Kit on Rays for Optical Video Generation2025Paper · GitHub · Website
CVPR AnyMoLe: Any Character Motion In-betweening Leveraging Video Diffusion Models2025Paper · GitHub · Website
CVPR Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think2025Paper · GitHub
CVPR FlipSketch: Flipping Static Drawings to Text-Guided Sketch Animations2025Paper · GitHub
CVPR MotionPro: A Precise Motion Controller for Image-to-Video Generation2025Paper · GitHub · Website
CVPR FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal Guidance2025Paper · GitHub · Website
CVPR From Slow Bidirectional to Fast Autoregressive Video Diffusion Models2025Paper · GitHub · Website
CVPR Go-with-the-Flow: Motion-Controllable Video Diffusion Models Using Real-Time Warped Noise2025Paper · GitHub · Website
CVPR GS-DiT: Advancing Video Generation with Dynamic 3D Gaussian Fields through Efficient Dense 3D Point Tracking2025Paper · GitHub · Website
CVPR High-Fidelity Relightable Monocular Portrait Animation with Lighting-Controllable Video Diffusion Model2025Paper · GitHub · Website
CVPR HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation2025Paper · GitHub · Website
CVPR InterDyn: Controllable Interactive Dynamics with Video Diffusion Models2025Paper · GitHub · Website
CVPR Lux Post Facto: Learning Portrait Performance Relighting with Conditional Video Diffusion and a Hybrid Dataset2025Paper · Website
CVPR Mind the Time: Temporally-Controlled Multi-Event Video Generation2025Paper · Website
CVPR Silence is Golden: Leveraging Adversarial Examples to Nullify Audio Control in LDM-based Talking-Head Generation2025Paper · GitHub
CVPR MotiF: Making Text Count in Image Animation with Motion Focal Loss2025Paper · Website
CVPR One-Minute Video Generation with Test-Time Training2025Paper · GitHub · Website
CVPR ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-Tuning2025Paper · Website
CVPR ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models2025Paper · Website
CVPR TASTE-Rob: Advancing Video Generation of Task-Oriented Hand-Object Interaction for Generalizable Robotic Manipulation2025Paper · GitHub · Website
CVPR TransPixeler: Advancing Text-to-Video Generation with Transparency2025Paper · GitHub · Website
CVPR VideoDPO: Omni-Preference Alignment for Video Diffusion Generation2025Paper · GitHub · Website
ICLR Boosting Camera Motion Control for Video Diffusion Transformers2025Paper · GitHub · Website
ICLR CameraCtrl: Enabling Camera Control for Video Diffusion Models2025Paper · GitHub · Website
ICLR Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model2025Paper · GitHub · Website
ICLR Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models2025Paper · GitHub
ICLR SePPO: Semi-Policy Preference Optimization for Diffusion Alignment2025Paper · GitHub
ICLR Trajectory attention for fine-grained video motion control2025Paper · GitHub · Website
ICLR VADER: Video Diffusion Alignment via Reward Gradients2025Paper · GitHub · Website
ICLR VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control2025Paper · GitHub · Website
WACV Fine-Grained Controllable Video Generation via Object Appearance and Context2025Paper · Website
WACV MagicStick: Controllable Video Editing via Control Handle Transformations2025Paper · GitHub · Website
WACV TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models2025Paper · GitHub
AAAI CAGE: Unsupervised Visual Composition and Animation for Controllable Video Generation2025Paper · GitHub · Website
AAAI CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities2025Paper · GitHub · Website
AAAI CustomTTT: Motion and Appearance Customized Video Generation via Test-Time Training2025Paper · GitHub · Website
AAAI DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation2025Paper · GitHub · Website
AAAI Enhancing Identity-Deformation Disentanglement in StyleGAN for One-Shot Face Video Re-Enactment2025Paper · GitHub · Website
AAAI Modular-Cam: Modular Dynamic Camera-view Video Generation with LLM2025Paper · GitHub · Website
AAAI Occlusion-Insensitive Talking Head Video Generation via Facelet Compensation2025Paper
AAAI PanoDiT: Panoramic Videos Generation with Diffusion Transformer2025Paper
AAAI TrackGo: A Flexible and Efficient Method for Controllable Video Generation2025Paper · Website
AAAI UFO: Enhancing Diffusion-Based Video Generation with a Uniform Frame Organizer2025Paper · GitHub
SIGGRAPH Asia Shape-for-Motion: Precise and Consistent Video Editing with 3D Proxy2025Paper · GitHub · Website
SIGGRAPH Asia FairyGen: Storied Cartoon Video from a Single Child-Drawn Character2025Paper · GitHub · Website
SIGGRAPH Asia CamCloneMaster: Enabling Reference-based Camera Control for Video Generation2025Paper · GitHub · Website
MICCAI Mission Balance: Generating Under-represented Class Samples using Video Diffusion Models2025Paper
MICCAI Ophora: A Large-Scale Data-Driven Text-Guided Ophthalmic Surgical Video Generation Model2025Paper · GitHub
ECCV Animate Your Motion: Turning Still Images into Dynamic Videos2024Paper · GitHub · Website
ECCV DragVideo: Interactive Drag-style Video Editing2024Paper · GitHub · Website
ECCV MEVG : Multi-event Video Generation with Text-to-Video Models2024Paper · GitHub · Website
ECCV MoVideo: Motion-Aware Video Generation with Diffusion Models2024Paper · Website
ECCV SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models2024Paper · GitHub · Website
ECCV Stable Video Portraits2024Paper · Website
ECCV TCAN: Animating Human Images with Temporally Consistent Pose Guidance using Diffusion Models2024Paper · GitHub · Website
ECCV Video Editing via Factorized Diffusion Distillation2024Paper · Website
ECCV VideoStudio: Generating Consistent-Content and Multi-Scene Videos2024Paper · GitHub · Website
COLM VideoDirectorGPT: Consistent Multi-Scene Video Generation via LLM-Guided Planning2024Paper · GitHub · Website
NeurIPS Exo2Ego-V: Exocentric-to-Egocentric Video Generation2024Paper · GitHub · GitHub
NeurIPS MotionBooth: Motion-Aware Customized Text-to-Video Generation2024Paper · GitHub · Website
NeurIPS SF-V: Single Forward Video Generation Model2024Paper · GitHub · Website
NeurIPS T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback2024Paper · GitHub · Website
NeurIPS Vivid-ZOO: Multi-View Video Generation with Diffusion Model2024Paper · GitHub · Website
EMNLP VIDEOSCORE: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation2024Paper · GitHub · Website
EMNLP VIMI: Grounding Video Generation through Multi-modal Instruction2024Paper · GitHub · Website
ACM MM DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control2024Paper · GitHub
ACM MM DragEntity: Trajectory Guided Video Generation using Entity and Positional Relationships2024Paper
ICLR Efficient Video Diffusion Models via Content-Frame Motion-Latent Decomposition2024Paper · Website
ICLR SEINE: Short-to-Long Video Diffusion Model for Generative Transition and Prediction2024Paper · GitHub · Website
ICLR VersVideo: Leveraging Enhanced Temporal Diffusion Models for Versatile Video Generation2024Paper · Website
CVPR InstructVideo: Instructing Video Diffusion Models with Human Feedback2024Paper · GitHub · Website
CVPR SimDA: Simple Diffusion Adapter for Efficient Video Generation2024Paper · GitHub · Website
CVPR VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models2024Paper · GitHub · Website
AAAI Follow Your Pose: Pose-Guided Text-to-Video Generation Using Pose-Free Videos2024Paper · GitHub · Website
NeurIPS VideoComposer: Compositional Video Synthesis with Motion Controllability2023Paper · GitHub · Website
ACM MM MobileVidFactory: Automatic Diffusion-Based Social Media Video Generation for Mobile Devices from Text2023Paper
ICCV DreamPose: Fashion Video Synthesis with Stable Diffusion2023Paper · GitHub · Website
ICCV Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models2023Paper · Website
ICCV Structure and Content-Guided Video Synthesis with Diffusion Models2023Paper · GitHub · Website
ICCV Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation2023Paper · GitHub · Website

arXiv Papers

TitleYearLinks
arXiv Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions2026Paper · Website
arXiv Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation2026Paper · Website
arXiv Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control2026Paper
arXiv Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment2026Paper
arXiv Real2SAM2Real: Generative 3D Caches as Complementary Context for Video Diffusion2026Paper · Website
arXiv minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models2026Paper · GitHub
arXiv DeltaCam: Differential Intrinsic Camera Modeling for Video Generation2026Paper
arXiv Geo-Align: Video Generation Alignment via Metric Geometry Reward2026Paper · Website
arXiv SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models2026Paper · GitHub · Website
arXiv CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration2026Paper · Website
arXiv CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition2026Paper · Website
arXiv Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls2026Paper
arXiv PhyWorld: Physics-Faithful World Model for Video Generation2026Paper
arXiv GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation2026Paper · GitHub · Website
arXiv Video Models Can Reason with Verifiable Rewards2026Paper · Website
arXiv RefDecoder: Enhancing Visual Generation with Conditional Video Decoding2026Paper
arXiv RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO2026Paper · Website
arXiv DriveCtrl: Conditioned Sim-to-Real Driving Video Generation2026Paper
arXiv EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration2026Paper · Website
arXiv SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer2026Paper · Website
arXiv Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation2026Paper · Website
arXiv CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL2026Paper
arXiv PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation2026Paper · Website
arXiv CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation2026Paper
arXiv CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating2026Paper
arXiv TIE: Time Interval Encoding for Video Generation over Events2026Paper · GitHub · Website
arXiv Improving Human Image Animation via Semantic Representation Alignment2026Paper
arXiv From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation2026Paper
arXiv Alice v1: Distillation-Enhanced Video Generation Surpassing Closed-Source Models2026Paper · GitHub
arXiv Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers2026Paper
arXiv Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation2026Paper · Website
arXiv PhyCo: Learning Controllable Physical Priors for Generative Motion2026Paper · Website
arXiv AesRM: Improving Video Aesthetics with Expert-Level Feedback2026Paper · Website
arXiv A Systematic Post-Train Framework for Video Generation2026Paper
arXiv MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation2026Paper
arXiv Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation2026Paper
arXiv Not all tokens contribute equally to diffusion learning2026Paper
arXiv HumANDiff: Articulated Noise Diffusion for Motion-Consistent Human Video Generation2026Paper · Website
arXiv OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models2026Paper
arXiv MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling2026Paper · Website
arXiv Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion2026Paper · GitHub · Website
arXiv ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation2026Paper · Website
arXiv Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning2026Paper
arXiv TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets2026Paper · Website
arXiv LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model2026Paper · Website
arXiv VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward2026Paper · Website
arXiv DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation2026Paper
arXiv RefAlign: Representation Alignment for Reference-to-Video Generation2026Paper · GitHub
arXiv ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment2026Paper · GitHub
arXiv Manifold-Aware Exploration for Reinforcement Learning in Video Generation2026Paper · Website
arXiv PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models2026Paper · GitHub
arXiv Helios: Real Real-Time Long Video Generation Model2026Paper · GitHub · Website
arXiv 3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model2026Paper · GitHub · Website
arXiv AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization2026Paper
arXiv Anchor Forcing: Anchor Memory and Tri-Region RoPE for Interactive Streaming Video Diffusion2026Paper · GitHub · Website
arXiv ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation2026Paper
arXiv Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints2026Paper
arXiv DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning2026Paper · Website
arXiv Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards2026Paper · GitHub · Website
arXiv EraseAnything++: Enabling Concept Erasure in Rectified Flow Transformers Leveraging Multi-Object Optimization2026Paper
arXiv FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation2026Paper
arXiv InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions2026Paper
arXiv LibraGen: Playing a Balance Game in Subject-Driven Video Generation2026Paper · GitHub · Website
arXiv Making Video Models Adhere to User Intent with Minor Adjustments2026Paper · GitHub · Website
arXiv MosaicMem: Hybrid Spatial Memory for Controllable Video World Models2026Paper · Website
arXiv Motion Forcing: A Decoupled Framework for Robust Video Generation in Motion Dynamics2026Paper · GitHub · Website
arXiv SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation2026Paper
arXiv SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation2026Paper · GitHub · Website
arXiv SPIRAL: A Closed-Loop Framework for Self-Improving Action World Models via Reflective Planning Agents2026Paper
arXiv ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation2026Paper · GitHub · Website
arXiv VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment2026Paper · Website
arXiv ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer2026Paper · GitHub
arXiv AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories2026Paper · GitHub · Website
arXiv High-Fidelity Causal Video Diffusion Models for Real-Time Ultra-Low-Bitrate Semantic Communication2026Paper
arXiv EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation2026Paper
arXiv Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing2026Paper
arXiv Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing2026Paper · GitHub · Website
arXiv ALIVE: Animate Your World with Lifelike Audio-Video Generation2026Paper · GitHub · Website
arXiv PISCO: Precise Video Instance Insertion with Sparse Control2026Paper · GitHub · Website
arXiv TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation2026Paper · GitHub
arXiv Optimizing Few-Step Generation with Adaptive Matching Distillation2026Paper
arXiv Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving2026Paper · Website
arXiv LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation2026Paper · GitHub
arXiv Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics2026Paper · GitHub
arXiv BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks2026Paper · Website
arXiv Unified Personalized Reward Model for Vision Generation2026Paper · GitHub · Website
arXiv PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards2026Paper
arXiv Latent Temporal Discrepancy as Motion Prior: A Loss-Weighting Strategy for Dynamic Fidelity in T2V2026Paper
arXiv Reward-Forcing: Autoregressive Video Generation with Reward Feedback2026Paper · GitHub · Website
arXiv Walk through Paintings: Egocentric World Models from Internet Priors2026Paper · GitHub · Website
arXiv Human detectors are surprisingly powerful reward models2026Paper
arXiv PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models2026Paper · Website
arXiv Inference-time Physics Alignment of Video Generative Models with Latent World Models2026Paper
arXiv Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation2026Paper · Website
arXiv Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models2026Paper
arXiv Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models2026Paper
arXiv Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model2026Paper
arXiv DreamLoop: Controllable Cinemagraph Generation from a Single Photograph2026Paper · Website
arXiv Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding2026Paper
arXiv PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation2025Paper · GitHub · Website
arXiv LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation2025Paper · GitHub
arXiv Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion2025Paper · Website
arXiv Characterizing Motion Encoding in Video Diffusion Timesteps2025Paper
arXiv ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision2025Paper
arXiv DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation2025Paper · Website
arXiv Few-Shot-Based Modular Image-to-Video Adapter for Diffusion Models2025Paper · GitHub · Website
arXiv StoryMem: Multi-shot Long Video Storytelling with Memory2025Paper · GitHub · Website
arXiv CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization2025Paper · Website
arXiv Animate Any Character in Any World2025Paper · GitHub · Website
arXiv InsertAnywhere: Bridging 4D Scene Geometry and Diffusion Models for Realistic Video Object Insertion2025Paper · Website
arXiv The World is Your Canvas: Painting Promptable Events with Reference Images, Trajectories, and Text2025Paper · GitHub · Website
arXiv Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models2025Paper · GitHub · Website
arXiv LongVie 2: Multimodal Controllable Ultra-Long Video World Model2025Paper · GitHub · Website
arXiv SneakPeek: Future-Guided Instructional Streaming Video Generation2025Paper
arXiv What Happens Next? Next Scene Prediction with a Unified Video Model2025Paper
arXiv GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation2025Paper · GitHub · Website
arXiv STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative2025Paper
arXiv SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation2025Paper
arXiv BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models2025Paper · Website
arXiv Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation2025Paper · Website
arXiv AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation2025Paper · Website
arXiv ReCamDriving: LiDAR-Free Camera-Controlled Novel Trajectory Video Generation2025Paper · GitHub · Website
arXiv In-Context Sync-LoRA for Portrait Video Editing2025Paper · GitHub · Website
arXiv Progressive Image Restoration via Text-Conditioned Video Generation2025Paper
arXiv Generative Video Motion Editing with 3D Point Tracks2025Paper · Website
arXiv SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation2025Paper
arXiv DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models2025Paper · Website
arXiv Low-Bitrate Video Compression through Semantic-Conditioned Diffusion2025Paper
arXiv AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement2025Paper · GitHub · Website
arXiv BlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generation2025Paper · GitHub · Website
arXiv WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation2025Paper · GitHub · Website
arXiv CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion2025Paper · GitHub · Website
arXiv MotionV2V: Editing Motion in a Video2025Paper · GitHub · Website
arXiv Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis2025Paper
arXiv SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation2025Paper · GitHub · Website
arXiv Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation2025Paper
arXiv View-Consistent Diffusion Representations for 3D-Consistent Video Generation2025Paper · Website
arXiv Eevee: Towards Close-up High-resolution Video-based Virtual Try-on2025Paper · GitHub
arXiv STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution2025Paper · GitHub · Website
arXiv Point-to-Point: Sparse Motion Guidance for Controllable Video Editing2025Paper
arXiv CamC2V: Context-aware Controllable Video Generation2025Paper · GitHub
arXiv MultiShotMaster: A Controllable Multi-Shot Video Generation Framework2025Paper · GitHub · Website
arXiv LoVoRA: Text-guided and Mask-free Video Object Removal and Addition with Learnable Object-aware Localization2025Paper · GitHub · Website
arXiv Taming Camera-Controlled Video Generation with Verifiable Geometry Reward2025Paper
arXiv IC-World: In-Context Generation for Shared World Modeling2025Paper · GitHub
arXiv Objects in Generated Videos Are Slower Than They Appear: Models Suffer Sub-Earth Gravity and Make Objects Move Slower Than in Reality2025Paper · Website
arXiv What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards2025Paper · GitHub · Website
arXiv InstanceV: Instance-Level Video Generation2025Paper · GitHub · Website
arXiv McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning2025Paper · GitHub · Website
arXiv One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer2025Paper · GitHub · Website
arXiv MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training2025Paper · Website
arXiv Video Generation Models Are Good Latent Reward Models2025Paper · Website
arXiv MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models2025Paper
arXiv Growing with the Generator: Self-paced GRPO for Video Generation2025Paper
arXiv Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation2025Paper
arXiv Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO2025Paper · GitHub · Website
arXiv First Frame Is the Place to Go for Video Content Customization2025Paper · GitHub · Website
arXiv Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation2025Paper · GitHub
arXiv Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models2025Paper
arXiv ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation2025Paper
arXiv LiteAttention: A Temporal Sparse Attention for Diffusion Transformers2025Paper · GitHub · Website
arXiv EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation2025Paper · Website
arXiv Video Text Preservation with Synthetic Text-Rich Videos2025Paper
arXiv RISE-T2V: Rephrasing and Injecting Semantics with LLM for Expansive Text-to-Video Generation2025Paper · Website
arXiv PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection2025Paper
arXiv UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions2025Paper · GitHub · Website
arXiv ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation2025Paper · GitHub · Website
arXiv Fine-Tuning Open Video Generators for Cinematic Scene Synthesis: A Small-Data Pipeline with LoRA and Wan2.1 I2V2025Paper · Website
arXiv VC4VG: Optimizing Video Captions for Text-to-Video Generation2025Paper · GitHub · Website
arXiv CoMo: Compositional Motion Customization for Text-to-Video Generation2025Paper · Website
arXiv Epipolar Geometry Improves Video Generation Models2025Paper · GitHub · Website
arXiv In-Context Learning with Unpaired Clips for Instruction-based Video Editing2025Paper · GitHub
arXiv Identity-GRPO: Optimizing Multi-Human Identity-preserving Video Generation via Reinforcement Learning2025Paper · GitHub · Website
arXiv Virtually Being: Customizing Camera-Controllable Video Diffusion Models with Multi-View Performance Captures2025Paper · Website
arXiv PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning2025Paper
arXiv MVP4D: Multi-View Portrait Video Diffusion for Animatable 4D Avatars2025Paper
arXiv Real-Time Motion-Controllable Autoregressive Video Diffusion2025Paper
arXiv PickStyle: Video-to-Video Style Transfer with Context-Style Adapters2025Paper
arXiv Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report2025Paper
arXiv Character Mixing for Video Generation2025Paper · GitHub
arXiv FlashI2V: Fourier-Guided Latent Shifting Prevents Conditional Image Leakage in Image-to-Video Generation2025Paper · GitHub · Website
arXiv DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder2025Paper · GitHub · Website
arXiv PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion2025Paper · Website
arXiv Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer2025Paper · Website
arXiv Reinforcement Learning with Inverse Rewards for World Model Post-training2025Paper
arXiv Echo-Path: Pathology-Conditioned Echo Video Generation2025Paper · GitHub
arXiv VidCLearn: A Continual Learning Approach for Text-to-Video Generation2025Paper
arXiv OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data2025Paper
arXiv PanoLora: Bridging Perspective and Panoramic Video Generation with LoRA Adaptation2025Paper · Website
arXiv Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis2025Paper · Website
arXiv Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders2025Paper · Website
arXiv RewardDance: Reward Scaling in Visual Generation2025Paper
arXiv HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning2025Paper · GitHub · Website
arXiv Zero-shot 3D-Aware Trajectory-Guided image-to-video generation via Test-Time Training2025Paper · GitHub · Website
arXiv UniVerse-1: Unified Audio-Video Generation via Stitching of Experts2025Paper · GitHub · Website
arXiv DevilSight: Augmenting Monocular Human Avatar Reconstruction through a Virtual Perspective2025Paper
arXiv Realistic and Controllable 3D Gaussian-Guided Object Editing for Driving Video Generation2025Paper
arXiv Learning Primitive Embodied World Models: Towards Scalable Robotic Learning2025Paper · GitHub · Website
arXiv MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation2025Paper · Website
arXiv ControlEchoSynth: Boosting Ejection Fraction Estimation Models via Controlled Video Diffusion2025Paper
arXiv SSG-Dit: A Spatial Signal Guided Framework for Controllable Video Generation2025Paper
arXiv Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation2025Paper
arXiv WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception2025Paper
arXiv 4DNeX: Feed-Forward 4D Generative Modeling Made Easy2025Paper · GitHub · Website
arXiv Physical Autoregressive Model for Robotic Manipulation without Action Pretraining2025Paper · GitHub · Website
arXiv From Large Angles to Consistent Faces: Identity-Preserving Video Generation via Mixture of Facial Experts2025Paper · GitHub · Website
arXiv Animate-X++: Universal Character Image Animation with Dynamic Backgrounds2025Paper · GitHub · Website
arXiv SketchAnimator: Animate Sketch via Motion Customization of Text-to-Video Diffusion Models2025Paper
arXiv SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment2025Paper
arXiv DreamVE: Unified Instruction-based Image and Video Editing2025Paper · Website
arXiv PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation2025Paper
arXiv Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm2025Paper
arXiv LongVie: Multimodal-Guided Controllable Ultra-Long Video Generation2025Paper · GitHub · Website
arXiv Macro-from-Micro Planning for High-Quality and Parallelized Autoregressive Long Video Generation2025Paper · GitHub · Website
arXiv DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework2025Paper · GitHub · Website
arXiv Compositional Video Synthesis by Temporal Object-Centric Learning2025Paper
arXiv Enhancing Scene Transition Awareness in Video Generation via Post-Training2025Paper
arXiv Zero-Shot Dynamic Concept Personalization with Grid-Based LoRA2025Paper · Website
arXiv Navigating Large-Pose Challenge for High-Fidelity Face Reenactment with Video Diffusion Model2025Paper · GitHub
arXiv PUSA V1.0: Surpassing Wan-I2V with $500 Training Cost by Vectorized Timestep Adaptation2025Paper · GitHub · Website
arXiv Conditional Video Generation for High-Efficiency Video Compression2025Paper
arXiv StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation2025Paper · Website
arXiv Geometry-aware 4D Video Generation for Robot Manipulation2025Paper · GitHub · Website
arXiv Populate-A-Scene: Affordance-Aware Human Video Generation2025Paper · Website
arXiv TextMesh4D: High-Quality Text-to-4D Mesh Generation2025Paper
arXiv SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation2025Paper · Website
arXiv MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation2025Paper
arXiv Video Virtual Try-on with Conditional Diffusion Transformer Inpainter2025Paper
arXiv DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing2025Paper · GitHub · Website
arXiv Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router2025Paper · GitHub · Website
arXiv AnimaX: Animating the Inanimate in 3D with Joint Video-Pose Diffusion Models2025Paper · GitHub · Website
arXiv RDPO: Real Data Preference Optimization for Physics Consistency Video Generation2025Paper · Website
arXiv FramePrompt: In-context Controllable Animation with Zero Structural Changes2025Paper · Website
arXiv DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning2025Paper
arXiv Causally Steered Diffusion for Automated Video Counterfactual Generation2025Paper · GitHub · Website
arXiv iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer2025Paper
arXiv PlayerOne: Egocentric World Simulator2025Paper · GitHub · Website
arXiv LoRA-Edit: Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning2025Paper · GitHub · Website
arXiv DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers2025Paper · Website
arXiv GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning2025Paper
arXiv AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation2025Paper · Website
arXiv Enhancing Motion Dynamics of Image-to-Video Models via Adaptive Low-Pass Guidance2025Paper · GitHub · Website
arXiv HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation2025Paper
arXiv Seedance 1.0: Exploring the Boundaries of Video Generation Models2025Paper · Website
arXiv Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models2025Paper · GitHub · Website
arXiv Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models2025Paper · GitHub · Website
arXiv Consistent Video Editing as Flow-Driven Image-to-Video Generation2025Paper
arXiv From Generation to Generalization: Emergent Few-Shot Learning in Video Diffusion Models2025Paper · GitHub · Website
arXiv Restereo: Diffusion stereo video generation and restoration2025Paper
arXiv FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers2025Paper · Website
arXiv Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers2025Paper · GitHub
arXiv OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation2025Paper
arXiv Respond Beyond Language: A Benchmark for Video Generation in Response to Realistic User Intents2025Paper
arXiv Playing with Transformer at 30+ FPS via Next-Frame Diffusion2025Paper · Website
arXiv DeepVerse: 4D Autoregressive Video Generation as a World Model2025Paper · GitHub · Website
arXiv Temporal In-Context Fine-Tuning for Versatile Control of Video Diffusion Models2025Paper · GitHub · Website
arXiv SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers2025Paper · Website
arXiv Video Signature: Implicit Watermarking for Video Diffusion Models2025Paper
arXiv Ctrl-Crash: Controllable Diffusion for Realistic Car Crashes2025Paper · GitHub · Website
arXiv ATI: Any Trajectory Instruction for Controllable Video Generation2025Paper · GitHub · Website
arXiv FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing2025Paper · Website
arXiv EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance2025Paper · GitHub · Website
arXiv Think Before You Diffuse: Infusing Physical Rules into Video Diffusion2025Paper · Website
arXiv HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters2025Paper · GitHub · Website
arXiv Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM2025Paper
arXiv DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation2025Paper · GitHub · Website
arXiv T2VUnlearning: A Concept Erasing Method for Text-to-Video Diffusion Models2025Paper · GitHub
arXiv MTVCrafter: 4D Motion Tokenization for Open-World Human Image Animation2025Paper · GitHub · Website
arXiv ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images2025Paper
arXiv HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation2025Paper · GitHub · Website
arXiv A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation2025Paper
arXiv VIDSTAMP: A Temporally-Aware Watermark for Ownership and Integrity in Video Diffusion Models2025Paper · Website
arXiv ReVision: High-Quality, Low-Cost Video Generation with Explicit 3D Physics Modeling for Complex Motion and Interaction2025Paper · Website
arXiv ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual Guidance2025Paper
arXiv Subject-driven Video Generation via Disentangled Identity and Motion2025Paper · GitHub · Website
arXiv Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning2025Paper
arXiv UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer2025Paper · GitHub
arXiv Taming Consistency Distillation for Accelerated Human Image Animation2025Paper
arXiv Aligning Anime Video Generation with Human Feedback2025Paper · GitHub
arXiv I Want It That Way! Specifying Nuanced Camera Motions in Video Editing2025Paper
arXiv Discriminator-Free Direct Preference Optimization for Video Diffusion2025Paper
arXiv EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion Model2025Paper
arXiv RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism2025Paper · GitHub
arXiv MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators2024Paper · GitHub · Website
arXiv VideoFactory: Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation2023Paper

📄 License

This project is licensed under the MIT License - see the LICENSE file for details.


🧑‍💻 Contributors

👏 Thanks to these contributors for this excellent work!

✉️ Contact

For questions, suggestions, or collaboration opportunities, please feel free to reach out:

✉️ Email: chaoyuli@asu.edu, pooyan@asu.edu

✨ Star History

Star History Chart

Contributors

CyL97

148 commits

Alleria1809

9 commits

SHYuanBest

7 commits

JasperYuu

5 commits

people-robots/Awesome-Video-Generation-Post-Training

[TMLR] Video Generation Models: A Survey of Post-Training and Alignment | 🔥 A continuously updated collection of papers, datasets, and benchmarks on post-training and alignment for video generation.

189

172 commits

updated Jul 20, 2026

See the code

README

Awesome Video Generation Post Training

🔥 A continuously updated repository of research on post-training and alignment for video generation.

License: MIT PDF Last Update GitHub stars

Video Generation Models: A Survey of Post-Training and Alignment

Chaoyu Li1,†,✉️, Xiaoyi Gu2,†, Yogesh Kulkarni1, Eun Woo Im1, Mohammadmahdi Honarmand3, Zeyu Wang4, Juntong Song5, Fei Du6, Xilin Jiang7, Kexin Zheng8, Tianzhi Li9, Fei Tao5, Pooyan Fazli1,✉️

1Arizona State University · 2Twitch · 3Stanford University · 4eBay · 5NewsBreak · 6Microsoft · 7Columbia University · 8University of Southern California · 9Carnegie Mellon University

Equal contribution. ✉️Corresponding author: Chaoyu Li , Pooyan Fazli.

timeline


[!IMPORTANT] We welcome your help in improving the repository and paper. Please feel free to submit a pull request to:

  • Add a relevant paper not yet included.
  • Suggest a more suitable category.
  • Update the information.
  • Ask for clarification about any content.

🔥 News

  • [2026.06.09] Our survey paper has been accepted to TMLR 🚀.
  • [2026.06.09] Added papers accepted to ICML 2026.
  • [2026.06.09] Added papers accepted to CVPR 2026.
  • [2026.03.23] Added papers accepted to ICLR 2026.
  • [2026.02.23] The v1 survey is now published! We have also initialized the repository.

🎯 Motivation

teaser While large-scale pretraining has significantly improved video generation models, aligning them with human intent, physical constraints, and deployment requirements remains a major challenge. As a result, post-training and alignment techniques have rapidly become a central research focus in modern video generation.

In our survey paper, we systematically review recent progress in supervised fine-tuning, self-training and distillation, preference-based optimization, and inference-time alignment methods.

This repository serves as a companion resource to the survey.
It aims to:

  • 📚 Curate recent papers on post-training and alignment for video generation
  • 📊 Collect datasets and evaluation benchmarks related to post-training and alignment

We hope this repository provides researchers and practitioners with a convenient, up-to-date reference for exploring the evolving landscape of post-training and alignment in video generation models.

📌 Citation

If you find our paper or this resource helpful, please consider cite:

@article{li2026video,
  title={Video Generation Models: A Survey of Post-Training and Alignment},
  author={Chaoyu Li and Xiaoyi Gu and Yogesh Kulkarni and Eun Woo Im and Mohammadmahdi Honarmand and Zeyu Wang and Juntong Song and Fei Du and Xilin Jiang and Kexin Zheng and Tianzhi Li and Fei Tao and Pooyan Fazli},
  journal={Transactions on Machine Learning Research},
  issn={2835-8856},
  year={2026},
  url={https://openreview.net/forum?id=YlUEWLESIu},
}

📚 Content


Datasets

DatasetYearLinks
NeurIPS ChronoMagic-Pro2024Paper · GitHub · Website · Dataset
NeurIPS SafeSora2024Paper · GitHub · Website · Dataset
ICCV TIP-I2V2025Paper · GitHub · Website · Dataset
ICCV SynFMC2025Paper · GitHub · Website · Dataset
CVPR CookGen2025Paper · Website · Dataset
CVPR HOIGen-1M2025Paper · Website · Dataset
CVPR OpenHumanVid2025Paper · GitHub · Website
ICML PhyWorld2025Paper · GitHub · Website · Dataset
NeurIPS WISA-80K2025Paper · GitHub · Website · Dataset
NeurIPS VideoUFO2025Paper · GitHub · Dataset
NeurIPS TalkCuts2025Paper · GitHub · Website · Dataset
NeurIPS EgoVid-5M2025Paper · GitHub · Website · Dataset
NeurIPS OpenS2V-5M2025Paper · GitHub · Website · Dataset
PMLR GRADEO-Instruct2025Paper
arXiv PNData2025Paper
arXiv PairFS-4K2025Paper · GitHub · Website
arXiv MMVideo2025Paper · GitHub · Website
arXiv DAVID-X2025Paper
arXiv Dprim2025Paper
CVPR CI-VID2026Paper · GitHub · Dataset
arXiv GB3DV-25k2026Paper · Website · Dataset
arXiv MuSS2026Paper · GitHub

Benchmarks

BenchmarkYearLinks
NeurIPS FETV2023Paper · GitHub · Dataset
NeurIPS StoryBench2023Paper · GitHub
NeurIPS ChronoMagic-Bench2024Paper · GitHub · Website · Dataset
CVPR EvalCrafter2024Paper · GitHub · Website · Dataset
CVPR VBench2024Paper · GitHub · Website · Dataset
NeurIPS T2VSafetyBench2024Paper · GitHub
ICCV MTBench2025Paper · GitHub · Website · Dataset
ICCV FiVE2025Paper · GitHub · Website · Dataset
ICCV VEG-Bench2025Paper · GitHub · Website · Dataset
ICCV VMBench2025Paper · GitHub · Website · Dataset
CVPR T2V-CompBench2025Paper · GitHub · Website · Dataset
CVPR StoryEval2025Paper · GitHub · Website · Dataset
CVPR MC-Bench2025Paper · GitHub · Website · Dataset
CVPR Video-Bench2025Paper · GitHub
NeurIPS MJ-BENCH-VIDEO2025Paper · GitHub · Website · Dataset
NeurIPS OpenS2V-Eval2025Paper · GitHub · Website · Dataset
NeurIPS VideoGen-RewardBench2025Paper · GitHub · Website · Dataset
NeurIPS AIGC-LipSync2025Paper · Website · Dataset
NeurIPS WorldModelBench2025Paper · GitHub · Website · Dataset
ACM MM VIP-200K2025Paper · Website · Dataset
ACM MM RGCD2025Paper · GitHub · Dataset
ACM MM RecipeGen2025Paper · Dataset
ACM MM HVEval2025Paper
EMNLP Doc2Present2025Paper · GitHub · Dataset
ACL VidCapBench2025Paper · GitHub · Dataset
ICLR VideoPhy2025Paper · GitHub · Dataset
ICML PhyGenBench2025Paper · GitHub · Website · Dataset
arXiv Paper2Video2025Paper · GitHub · Website · Dataset
arXiv PhyWorldBench2025Paper · GitHub · Dataset
arXiv SeqBench2025Paper · GitHub · Website · Dataset
arXiv VideoVerse2025Paper · GitHub · Website · Dataset
arXiv MMMC2025Paper · GitHub · Website · Dataset
arXiv DynamicEval2025Paper · GitHub · Website · Dataset
arXiv V-ReasonBench2025Paper · GitHub · Website · Dataset
arXiv RGCD (alternate)2025Paper · GitHub · Dataset
arXiv VIPER2025Paper · GitHub · Dataset
arXiv Video Reality Test2025Paper · GitHub · Website · Dataset
arXiv WYD2025Paper · GitHub
arXiv GenVidBench2025Paper
arXiv DIVE2025Paper
arXiv UI2V-Bench2025Paper
arXiv PhysVidBench2025Paper
arXiv SurgVeo2025Paper
arXiv PAI-Bench2025Paper
arXiv MEve2025Paper
ICML SafeMVDrive2026Paper · GitHub · Website · Dataset
ICML AIGVE-60K2026Paper · GitHub · Dataset
ICML T2AV-Compass2026Paper · Dataset
ICML LoCoT2V-Bench2026Paper
WACV GeneVA2026Paper · Website · Dataset
WACV PhyEduVideo2026Paper · GitHub · Website
arXiv DrivingGen2026Paper · Website · Dataset
arXiv RISE-Video2026Paper · GitHub · Dataset
arXiv RBench2026Paper · GitHub · Website · Dataset
arXiv VC-Bench2026Paper · Website · Dataset
arXiv CoW-Bench2026Paper · GitHub · Dataset
arXiv MTAVG-Bench2026Paper
arXiv MSVBench2026Paper
arXiv SafeGen-Bench2026Paper
arXiv DirectorBench2026Paper · GitHub · Dataset
arXiv EvalVerse2026Paper
arXiv EntityBench2026Paper · GitHub · Website
arXiv MechVerse2026Paper · Website
arXiv WorldReasonBench2026Paper · GitHub · Website
arXiv WorldJen2026Paper · GitHub · Website · Dataset
arXiv BRITE2026Paper
arXiv WorldMark2026Paper · Website

Conference Papers

TitleYearLinks
CVPR FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance2026Paper · GitHub · Website
CVPR GenHOI: Towards Object-Consistent Hand–Object Interaction with Temporally Balanced and Spatially Selective Object Injection2026Paper · GitHub · Website
CVPR GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling2026Paper
CVPR Plenoptic Video Generation2026Paper · GitHub · Website
CVPR SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models2026Paper · GitHub
CVPR EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses2026Paper · GitHub · Website
CVPR Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation2026Paper
CVPR TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models2026Paper · GitHub · Website
CVPR TGT: Text-Grounded Trajectories for Locally Controlled Video Generation2026Paper · Website
CVPR Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization2026Paper · GitHub · Website
CVPR Lynx: Towards High-Fidelity Personalized Video Generation2026Paper · GitHub · Website
CVPR ORV: 4D Occupancy-centric Robot Video Generation2026Paper · GitHub · Website
ICML Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models2026Paper
ICML World-R1: Reinforcing 3D Constraints for Text-to-Video Generation2026Paper · GitHub · Website
ICML WorldCompass: Reinforcement Learning for Long-Horizon World Models2026Paper · GitHub · Website
ICML Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation2026Paper · GitHub · Website
ICML VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation2026Paper · GitHub · Website
ICML TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment2026Paper
ICML Mitigating Surgical Data Imbalance with Dual-Prediction Video Diffusion Model2026Paper
ICML RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space2026Paper · GitHub · Website
ICML LayerT2V: Interactive Multi-Object Trajectory Layering for Video Generation2026Paper · GitHub · Website
ICML Physics-Guided Motion Loss for Video Generation Model2026Paper
ICML SafeMVDrive: Multi-view Safety-Critical Driving Video Synthesis in the Real World Domain2026Paper · GitHub · Website
ICLR Neodragon: Mobile Video Generation using Diffusion Transformer2026Paper · Website
ICLR The Quest for Generalizable Motion Generation: Data, Model, and Evaluation2026Paper · GitHub
ICLR MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models2026Paper
ICLR Stable Video Infinity: Infinite-Length Video Generation with Error Recycling2026Paper
ICLR Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency2026Paper
ICLR MATRIX: Mask Track Alignment for Interaction-aware Video Generation2026Paper
ICLR Arbitrary Generative Video Interpolation2026Paper
ICLR Rolling Forcing: Autoregressive Long Video Diffusion in Real Time2026Paper · GitHub · Website
ICLR BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models2026Paper · GitHub · Website
ICLR MoSA: Motion-Coherent Human Video Generation via Structure-Appearance Decoupling2026Paper · GitHub · Website
ICLR Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration2026Paper · GitHub · Website
ICLR DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing2026Paper
ICLR Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling2026Paper · GitHub · Website
ICLR Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control2026Paper · GitHub · Website
ICLR Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks2026Paper · GitHub
ICLR MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement2026Paper · GitHub · Website
ICLR Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model2026Paper · Website
ICLR UNIC: Unified In-Context Video Editing2026Paper · Website
ICLR EffiVMT: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning2026Paper · Website
ICLR EasyCreator: Empowering 4D Creation through Video Inpainting2026Paper · Website
AAAI PanFlow: Decoupled Motion Control for Panoramic Video Generation2026Paper · GitHub · Website
AAAI Phased One-Step Adversarial Equilibrium for Video Diffusion Models2026Paper · Website
AAAI Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation2026Paper · GitHub · Website
WACV Show Me: Unifying Instructional Image and Video Generation with Diffusion Models2026Paper · GitHub · Website
WACV UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models2026Paper · GitHub
NeurIPS Controllable Human-centric Keyframe Interpolation with Generative Prior2025Paper · GitHub · Website
NeurIPS RoboScape: Physics-informed Embodied World Model2025Paper · GitHub
NeurIPS Aligning What Matters: Masked Latent Adaptation for Text-to-Audio-Video Generation2025Paper
NeurIPS Audio-Sync Video Generation with Multi-Stream Temporal Control2025Paper · GitHub · Website
NeurIPS Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation2025Paper · Website
NeurIPS DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models2025Paper · Website
NeurIPS EchoShot: Multi-Shot Portrait Video Generation2025Paper · GitHub · Website
NeurIPS Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models2025Paper · GitHub · Website
NeurIPS Frame In-N-Out: Unbounded Controllable Image-to-Video Generation2025Paper · GitHub · Website
NeurIPS GeoVideo: Introducing Geometric Regularization into Video Generation Model2025Paper · GitHub · Website
NeurIPS Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation2025Paper · Website
NeurIPS Imagine360: Immersive 360 Video Generation from Perspective Anchor2025Paper · GitHub · Website
NeurIPS Improving Video Generation with Human Feedback2025Paper · GitHub · Website
NeurIPS MoCha: Towards Movie-Grade Talking Character Generation2025Paper · GitHub · Website
NeurIPS PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement2025Paper · Website
NeurIPS Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation2025Paper · GitHub · Website
NeurIPS RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation2025Paper
NeurIPS Temporal In-Context Fine-Tuning for Versatile Control of Video Diffusion Models2025Paper · GitHub · Website
NeurIPS VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models2025Paper · GitHub · Website
NeurIPS Virtual Fitting Room: Generating Arbitrarily Long Videos of Virtual Try-On from a Single Image2025Paper · Website
NeurIPS Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance2025Paper · GitHub · Website
NeurIPS WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation2025Paper · GitHub · Website
NeurIPS WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception2025Paper · Website
NeurIPS Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion2025Paper · GitHub
EMNLP VC4VG: Optimizing Video Captions for Text-to-Video Generation2025Paper · GitHub
ACM MM AICL: Action In-Context Learning for Video Diffusion Model2025Paper
ACM MM Improving Identity Preservation in Video Generation with Multi-Branch Models2025Paper
ACM MM M2PE-DIFF: Music-to-Pose Encoder for Dance Video Generation Leveraging Latent Diffusion Framework.2025Paper
ACM MM SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation2025Paper
ACM MM Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation2025Paper · Website
ACM MM AnimeColor: Reference-based Animation Colorization with Diffusion Transformers2025Paper · GitHub
ICCV Causal-Entity Reflected Egocentric Traffic Accident Video Synthesis2025Paper · GitHub · Website
ICCV Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models2025Paper · GitHub · Website
ICCV AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction2025Paper · Website
ICCV Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis2025Paper
ICCV Decouple and Track: Benchmarking and Improving Video Diffusion Transformers For Motion Transfer2025Paper · GitHub · Website
ICCV DiTaiListener: Controllable High Fidelity Listener Video Generation with Diffusion2025Paper · Website
ICCV DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization2025Paper · Website
ICCV Dual-Expert Consistency Model for Efficient and High-Quality Video Generation2025Paper · GitHub · Website
ICCV DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization2025Paper · GitHub · Website
ICCV EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models2025Paper · GitHub
ICCV Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video Generation2025Paper · GitHub · Website
ICCV I2VControl: Disentangled and Unified Video Motion Synthesis Control2025Paper · Website
ICCV LayerAnimate: Layer-level Control for Animation2025Paper · GitHub · Website
ICCV Learning Few-Step Diffusion Models by Trajectory Distribution Matching2025Paper · GitHub · Website
ICCV LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion2025Paper · Website
ICCV Long Context Tuning for Video Generation2025Paper · Website
ICCV MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization2025Paper · GitHub · Website
ICCV MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers2025Paper · GitHub
ICCV MagicMotion: Controllable Video Generation with Dense-to-Sparse Trajectory Guidance2025Paper · GitHub · Website
ICCV Mobile Video Diffusion2025Paper · Website
ICCV MotionAgent: Fine-grained Controllable Video Generation via Motion Field Agent2025Paper · GitHub
ICCV PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation2025Paper · GitHub · Website
ICCV Phantom: Subject-Consistent Video Generation via Cross-Modal Alignment2025Paper · GitHub · Website
ICCV Precise Action-to-Video Generation Through Visual Action Prompts2025Paper · Website
ICCV Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM2025Paper · GitHub
ICCV Puppet-Master: Scaling Interactive Video Generation as a Motion Prior for Part-Level Dynamics2025Paper · GitHub · Website
ICCV Reangle-A-Video: 4D Video Generation as Video-to-Video Translation2025Paper · GitHub · Website
ICCV RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control2025Paper · GitHub · Website
ICCV STAR: Spatial-Temporal Augmentation with Text-to-Video Models for Real-World Video Super-Resolution2025Paper · GitHub · Website
ICCV TACO: Taming Diffusion for in-the-wild Video Amodal Completion2025Paper · GitHub · Website
ICCV V.I.P.: Iterative Online Preference Distillation for Efficient Video Diffusion Models2025Paper · Website
ICCV VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation2025Paper · GitHub · Website
ICCV Versatile Transition Generation with Image-to-Video Diffusion2025Paper · Website
ICCV VideoAuteur: Towards Long Narrative Video Generation2025Paper · GitHub · Website
IJCAI FLAP: Fully-controllable Audio-driven Portrait Video Generation through 3D head conditioned diffusion model2025Paper
ICML FrameBridge: Improving Image-to-Video Generation with Bridge Models2025Paper · Website
ICML Diffusion Adversarial Post-Training for One-Step Video Generation2025Paper · Website
CVPR Identity-Preserving Text-to-Video Generation by Frequency Decomposition2025Paper · GitHub · Website
CVPR AKiRa: Augmentation Kit on Rays for Optical Video Generation2025Paper · GitHub · Website
CVPR AnyMoLe: Any Character Motion In-betweening Leveraging Video Diffusion Models2025Paper · GitHub · Website
CVPR Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think2025Paper · GitHub
CVPR FlipSketch: Flipping Static Drawings to Text-Guided Sketch Animations2025Paper · GitHub
CVPR MotionPro: A Precise Motion Controller for Image-to-Video Generation2025Paper · GitHub · Website
CVPR FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal Guidance2025Paper · GitHub · Website
CVPR From Slow Bidirectional to Fast Autoregressive Video Diffusion Models2025Paper · GitHub · Website
CVPR Go-with-the-Flow: Motion-Controllable Video Diffusion Models Using Real-Time Warped Noise2025Paper · GitHub · Website
CVPR GS-DiT: Advancing Video Generation with Dynamic 3D Gaussian Fields through Efficient Dense 3D Point Tracking2025Paper · GitHub · Website
CVPR High-Fidelity Relightable Monocular Portrait Animation with Lighting-Controllable Video Diffusion Model2025Paper · GitHub · Website
CVPR HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation2025Paper · GitHub · Website
CVPR InterDyn: Controllable Interactive Dynamics with Video Diffusion Models2025Paper · GitHub · Website
CVPR Lux Post Facto: Learning Portrait Performance Relighting with Conditional Video Diffusion and a Hybrid Dataset2025Paper · Website
CVPR Mind the Time: Temporally-Controlled Multi-Event Video Generation2025Paper · Website
CVPR Silence is Golden: Leveraging Adversarial Examples to Nullify Audio Control in LDM-based Talking-Head Generation2025Paper · GitHub
CVPR MotiF: Making Text Count in Image Animation with Motion Focal Loss2025Paper · Website
CVPR One-Minute Video Generation with Test-Time Training2025Paper · GitHub · Website
CVPR ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-Tuning2025Paper · Website
CVPR ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models2025Paper · Website
CVPR TASTE-Rob: Advancing Video Generation of Task-Oriented Hand-Object Interaction for Generalizable Robotic Manipulation2025Paper · GitHub · Website
CVPR TransPixeler: Advancing Text-to-Video Generation with Transparency2025Paper · GitHub · Website
CVPR VideoDPO: Omni-Preference Alignment for Video Diffusion Generation2025Paper · GitHub · Website
ICLR Boosting Camera Motion Control for Video Diffusion Transformers2025Paper · GitHub · Website
ICLR CameraCtrl: Enabling Camera Control for Video Diffusion Models2025Paper · GitHub · Website
ICLR Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model2025Paper · GitHub · Website
ICLR Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models2025Paper · GitHub
ICLR SePPO: Semi-Policy Preference Optimization for Diffusion Alignment2025Paper · GitHub
ICLR Trajectory attention for fine-grained video motion control2025Paper · GitHub · Website
ICLR VADER: Video Diffusion Alignment via Reward Gradients2025Paper · GitHub · Website
ICLR VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control2025Paper · GitHub · Website
WACV Fine-Grained Controllable Video Generation via Object Appearance and Context2025Paper · Website
WACV MagicStick: Controllable Video Editing via Control Handle Transformations2025Paper · GitHub · Website
WACV TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models2025Paper · GitHub
AAAI CAGE: Unsupervised Visual Composition and Animation for Controllable Video Generation2025Paper · GitHub · Website
AAAI CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities2025Paper · GitHub · Website
AAAI CustomTTT: Motion and Appearance Customized Video Generation via Test-Time Training2025Paper · GitHub · Website
AAAI DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation2025Paper · GitHub · Website
AAAI Enhancing Identity-Deformation Disentanglement in StyleGAN for One-Shot Face Video Re-Enactment2025Paper · GitHub · Website
AAAI Modular-Cam: Modular Dynamic Camera-view Video Generation with LLM2025Paper · GitHub · Website
AAAI Occlusion-Insensitive Talking Head Video Generation via Facelet Compensation2025Paper
AAAI PanoDiT: Panoramic Videos Generation with Diffusion Transformer2025Paper
AAAI TrackGo: A Flexible and Efficient Method for Controllable Video Generation2025Paper · Website
AAAI UFO: Enhancing Diffusion-Based Video Generation with a Uniform Frame Organizer2025Paper · GitHub
SIGGRAPH Asia Shape-for-Motion: Precise and Consistent Video Editing with 3D Proxy2025Paper · GitHub · Website
SIGGRAPH Asia FairyGen: Storied Cartoon Video from a Single Child-Drawn Character2025Paper · GitHub · Website
SIGGRAPH Asia CamCloneMaster: Enabling Reference-based Camera Control for Video Generation2025Paper · GitHub · Website
MICCAI Mission Balance: Generating Under-represented Class Samples using Video Diffusion Models2025Paper
MICCAI Ophora: A Large-Scale Data-Driven Text-Guided Ophthalmic Surgical Video Generation Model2025Paper · GitHub
ECCV Animate Your Motion: Turning Still Images into Dynamic Videos2024Paper · GitHub · Website
ECCV DragVideo: Interactive Drag-style Video Editing2024Paper · GitHub · Website
ECCV MEVG : Multi-event Video Generation with Text-to-Video Models2024Paper · GitHub · Website
ECCV MoVideo: Motion-Aware Video Generation with Diffusion Models2024Paper · Website
ECCV SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models2024Paper · GitHub · Website
ECCV Stable Video Portraits2024Paper · Website
ECCV TCAN: Animating Human Images with Temporally Consistent Pose Guidance using Diffusion Models2024Paper · GitHub · Website
ECCV Video Editing via Factorized Diffusion Distillation2024Paper · Website
ECCV VideoStudio: Generating Consistent-Content and Multi-Scene Videos2024Paper · GitHub · Website
COLM VideoDirectorGPT: Consistent Multi-Scene Video Generation via LLM-Guided Planning2024Paper · GitHub · Website
NeurIPS Exo2Ego-V: Exocentric-to-Egocentric Video Generation2024Paper · GitHub · GitHub
NeurIPS MotionBooth: Motion-Aware Customized Text-to-Video Generation2024Paper · GitHub · Website
NeurIPS SF-V: Single Forward Video Generation Model2024Paper · GitHub · Website
NeurIPS T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback2024Paper · GitHub · Website
NeurIPS Vivid-ZOO: Multi-View Video Generation with Diffusion Model2024Paper · GitHub · Website
EMNLP VIDEOSCORE: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation2024Paper · GitHub · Website
EMNLP VIMI: Grounding Video Generation through Multi-modal Instruction2024Paper · GitHub · Website
ACM MM DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control2024Paper · GitHub
ACM MM DragEntity: Trajectory Guided Video Generation using Entity and Positional Relationships2024Paper
ICLR Efficient Video Diffusion Models via Content-Frame Motion-Latent Decomposition2024Paper · Website
ICLR SEINE: Short-to-Long Video Diffusion Model for Generative Transition and Prediction2024Paper · GitHub · Website
ICLR VersVideo: Leveraging Enhanced Temporal Diffusion Models for Versatile Video Generation2024Paper · Website
CVPR InstructVideo: Instructing Video Diffusion Models with Human Feedback2024Paper · GitHub · Website
CVPR SimDA: Simple Diffusion Adapter for Efficient Video Generation2024Paper · GitHub · Website
CVPR VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models2024Paper · GitHub · Website
AAAI Follow Your Pose: Pose-Guided Text-to-Video Generation Using Pose-Free Videos2024Paper · GitHub · Website
NeurIPS VideoComposer: Compositional Video Synthesis with Motion Controllability2023Paper · GitHub · Website
ACM MM MobileVidFactory: Automatic Diffusion-Based Social Media Video Generation for Mobile Devices from Text2023Paper
ICCV DreamPose: Fashion Video Synthesis with Stable Diffusion2023Paper · GitHub · Website
ICCV Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models2023Paper · Website
ICCV Structure and Content-Guided Video Synthesis with Diffusion Models2023Paper · GitHub · Website
ICCV Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation2023Paper · GitHub · Website

arXiv Papers

TitleYearLinks
arXiv Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions2026Paper · Website
arXiv Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation2026Paper · Website
arXiv Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control2026Paper
arXiv Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment2026Paper
arXiv Real2SAM2Real: Generative 3D Caches as Complementary Context for Video Diffusion2026Paper · Website
arXiv minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models2026Paper · GitHub
arXiv DeltaCam: Differential Intrinsic Camera Modeling for Video Generation2026Paper
arXiv Geo-Align: Video Generation Alignment via Metric Geometry Reward2026Paper · Website
arXiv SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models2026Paper · GitHub · Website
arXiv CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration2026Paper · Website
arXiv CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition2026Paper · Website
arXiv Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls2026Paper
arXiv PhyWorld: Physics-Faithful World Model for Video Generation2026Paper
arXiv GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation2026Paper · GitHub · Website
arXiv Video Models Can Reason with Verifiable Rewards2026Paper · Website
arXiv RefDecoder: Enhancing Visual Generation with Conditional Video Decoding2026Paper
arXiv RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO2026Paper · Website
arXiv DriveCtrl: Conditioned Sim-to-Real Driving Video Generation2026Paper
arXiv EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration2026Paper · Website
arXiv SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer2026Paper · Website
arXiv Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation2026Paper · Website
arXiv CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL2026Paper
arXiv PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation2026Paper · Website
arXiv CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation2026Paper
arXiv CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating2026Paper
arXiv TIE: Time Interval Encoding for Video Generation over Events2026Paper · GitHub · Website
arXiv Improving Human Image Animation via Semantic Representation Alignment2026Paper
arXiv From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation2026Paper
arXiv Alice v1: Distillation-Enhanced Video Generation Surpassing Closed-Source Models2026Paper · GitHub
arXiv Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers2026Paper
arXiv Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation2026Paper · Website
arXiv PhyCo: Learning Controllable Physical Priors for Generative Motion2026Paper · Website
arXiv AesRM: Improving Video Aesthetics with Expert-Level Feedback2026Paper · Website
arXiv A Systematic Post-Train Framework for Video Generation2026Paper
arXiv MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation2026Paper
arXiv Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation2026Paper
arXiv Not all tokens contribute equally to diffusion learning2026Paper
arXiv HumANDiff: Articulated Noise Diffusion for Motion-Consistent Human Video Generation2026Paper · Website
arXiv OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models2026Paper
arXiv MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling2026Paper · Website
arXiv Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion2026Paper · GitHub · Website
arXiv ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation2026Paper · Website
arXiv Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning2026Paper
arXiv TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets2026Paper · Website
arXiv LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model2026Paper · Website
arXiv VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward2026Paper · Website
arXiv DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation2026Paper
arXiv RefAlign: Representation Alignment for Reference-to-Video Generation2026Paper · GitHub
arXiv ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment2026Paper · GitHub
arXiv Manifold-Aware Exploration for Reinforcement Learning in Video Generation2026Paper · Website
arXiv PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models2026Paper · GitHub
arXiv Helios: Real Real-Time Long Video Generation Model2026Paper · GitHub · Website
arXiv 3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model2026Paper · GitHub · Website
arXiv AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization2026Paper
arXiv Anchor Forcing: Anchor Memory and Tri-Region RoPE for Interactive Streaming Video Diffusion2026Paper · GitHub · Website
arXiv ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation2026Paper
arXiv Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints2026Paper
arXiv DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning2026Paper · Website
arXiv Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards2026Paper · GitHub · Website
arXiv EraseAnything++: Enabling Concept Erasure in Rectified Flow Transformers Leveraging Multi-Object Optimization2026Paper
arXiv FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation2026Paper
arXiv InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions2026Paper
arXiv LibraGen: Playing a Balance Game in Subject-Driven Video Generation2026Paper · GitHub · Website
arXiv Making Video Models Adhere to User Intent with Minor Adjustments2026Paper · GitHub · Website
arXiv MosaicMem: Hybrid Spatial Memory for Controllable Video World Models2026Paper · Website
arXiv Motion Forcing: A Decoupled Framework for Robust Video Generation in Motion Dynamics2026Paper · GitHub · Website
arXiv SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation2026Paper
arXiv SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation2026Paper · GitHub · Website
arXiv SPIRAL: A Closed-Loop Framework for Self-Improving Action World Models via Reflective Planning Agents2026Paper
arXiv ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation2026Paper · GitHub · Website
arXiv VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment2026Paper · Website
arXiv ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer2026Paper · GitHub
arXiv AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories2026Paper · GitHub · Website
arXiv High-Fidelity Causal Video Diffusion Models for Real-Time Ultra-Low-Bitrate Semantic Communication2026Paper
arXiv EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation2026Paper
arXiv Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing2026Paper
arXiv Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing2026Paper · GitHub · Website
arXiv ALIVE: Animate Your World with Lifelike Audio-Video Generation2026Paper · GitHub · Website
arXiv PISCO: Precise Video Instance Insertion with Sparse Control2026Paper · GitHub · Website
arXiv TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation2026Paper · GitHub
arXiv Optimizing Few-Step Generation with Adaptive Matching Distillation2026Paper
arXiv Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving2026Paper · Website
arXiv LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation2026Paper · GitHub
arXiv Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics2026Paper · GitHub
arXiv BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks2026Paper · Website
arXiv Unified Personalized Reward Model for Vision Generation2026Paper · GitHub · Website
arXiv PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards2026Paper
arXiv Latent Temporal Discrepancy as Motion Prior: A Loss-Weighting Strategy for Dynamic Fidelity in T2V2026Paper
arXiv Reward-Forcing: Autoregressive Video Generation with Reward Feedback2026Paper · GitHub · Website
arXiv Walk through Paintings: Egocentric World Models from Internet Priors2026Paper · GitHub · Website
arXiv Human detectors are surprisingly powerful reward models2026Paper
arXiv PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models2026Paper · Website
arXiv Inference-time Physics Alignment of Video Generative Models with Latent World Models2026Paper
arXiv Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation2026Paper · Website
arXiv Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models2026Paper
arXiv Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models2026Paper
arXiv Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model2026Paper
arXiv DreamLoop: Controllable Cinemagraph Generation from a Single Photograph2026Paper · Website
arXiv Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding2026Paper
arXiv PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation2025Paper · GitHub · Website
arXiv LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation2025Paper · GitHub
arXiv Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion2025Paper · Website
arXiv Characterizing Motion Encoding in Video Diffusion Timesteps2025Paper
arXiv ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision2025Paper
arXiv DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation2025Paper · Website
arXiv Few-Shot-Based Modular Image-to-Video Adapter for Diffusion Models2025Paper · GitHub · Website
arXiv StoryMem: Multi-shot Long Video Storytelling with Memory2025Paper · GitHub · Website
arXiv CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization2025Paper · Website
arXiv Animate Any Character in Any World2025Paper · GitHub · Website
arXiv InsertAnywhere: Bridging 4D Scene Geometry and Diffusion Models for Realistic Video Object Insertion2025Paper · Website
arXiv The World is Your Canvas: Painting Promptable Events with Reference Images, Trajectories, and Text2025Paper · GitHub · Website
arXiv Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models2025Paper · GitHub · Website
arXiv LongVie 2: Multimodal Controllable Ultra-Long Video World Model2025Paper · GitHub · Website
arXiv SneakPeek: Future-Guided Instructional Streaming Video Generation2025Paper
arXiv What Happens Next? Next Scene Prediction with a Unified Video Model2025Paper
arXiv GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation2025Paper · GitHub · Website
arXiv STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative2025Paper
arXiv SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation2025Paper
arXiv BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models2025Paper · Website
arXiv Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation2025Paper · Website
arXiv AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation2025Paper · Website
arXiv ReCamDriving: LiDAR-Free Camera-Controlled Novel Trajectory Video Generation2025Paper · GitHub · Website
arXiv In-Context Sync-LoRA for Portrait Video Editing2025Paper · GitHub · Website
arXiv Progressive Image Restoration via Text-Conditioned Video Generation2025Paper
arXiv Generative Video Motion Editing with 3D Point Tracks2025Paper · Website
arXiv SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation2025Paper
arXiv DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models2025Paper · Website
arXiv Low-Bitrate Video Compression through Semantic-Conditioned Diffusion2025Paper
arXiv AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement2025Paper · GitHub · Website
arXiv BlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generation2025Paper · GitHub · Website
arXiv WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation2025Paper · GitHub · Website
arXiv CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion2025Paper · GitHub · Website
arXiv MotionV2V: Editing Motion in a Video2025Paper · GitHub · Website
arXiv Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis2025Paper
arXiv SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation2025Paper · GitHub · Website
arXiv Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation2025Paper
arXiv View-Consistent Diffusion Representations for 3D-Consistent Video Generation2025Paper · Website
arXiv Eevee: Towards Close-up High-resolution Video-based Virtual Try-on2025Paper · GitHub
arXiv STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution2025Paper · GitHub · Website
arXiv Point-to-Point: Sparse Motion Guidance for Controllable Video Editing2025Paper
arXiv CamC2V: Context-aware Controllable Video Generation2025Paper · GitHub
arXiv MultiShotMaster: A Controllable Multi-Shot Video Generation Framework2025Paper · GitHub · Website
arXiv LoVoRA: Text-guided and Mask-free Video Object Removal and Addition with Learnable Object-aware Localization2025Paper · GitHub · Website
arXiv Taming Camera-Controlled Video Generation with Verifiable Geometry Reward2025Paper
arXiv IC-World: In-Context Generation for Shared World Modeling2025Paper · GitHub
arXiv Objects in Generated Videos Are Slower Than They Appear: Models Suffer Sub-Earth Gravity and Make Objects Move Slower Than in Reality2025Paper · Website
arXiv What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards2025Paper · GitHub · Website
arXiv InstanceV: Instance-Level Video Generation2025Paper · GitHub · Website
arXiv McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning2025Paper · GitHub · Website
arXiv One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer2025Paper · GitHub · Website
arXiv MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training2025Paper · Website
arXiv Video Generation Models Are Good Latent Reward Models2025Paper · Website
arXiv MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models2025Paper
arXiv Growing with the Generator: Self-paced GRPO for Video Generation2025Paper
arXiv Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation2025Paper
arXiv Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO2025Paper · GitHub · Website
arXiv First Frame Is the Place to Go for Video Content Customization2025Paper · GitHub · Website
arXiv Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation2025Paper · GitHub
arXiv Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models2025Paper
arXiv ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation2025Paper
arXiv LiteAttention: A Temporal Sparse Attention for Diffusion Transformers2025Paper · GitHub · Website
arXiv EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation2025Paper · Website
arXiv Video Text Preservation with Synthetic Text-Rich Videos2025Paper
arXiv RISE-T2V: Rephrasing and Injecting Semantics with LLM for Expansive Text-to-Video Generation2025Paper · Website
arXiv PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection2025Paper
arXiv UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions2025Paper · GitHub · Website
arXiv ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation2025Paper · GitHub · Website
arXiv Fine-Tuning Open Video Generators for Cinematic Scene Synthesis: A Small-Data Pipeline with LoRA and Wan2.1 I2V2025Paper · Website
arXiv VC4VG: Optimizing Video Captions for Text-to-Video Generation2025Paper · GitHub · Website
arXiv CoMo: Compositional Motion Customization for Text-to-Video Generation2025Paper · Website
arXiv Epipolar Geometry Improves Video Generation Models2025Paper · GitHub · Website
arXiv In-Context Learning with Unpaired Clips for Instruction-based Video Editing2025Paper · GitHub
arXiv Identity-GRPO: Optimizing Multi-Human Identity-preserving Video Generation via Reinforcement Learning2025Paper · GitHub · Website
arXiv Virtually Being: Customizing Camera-Controllable Video Diffusion Models with Multi-View Performance Captures2025Paper · Website
arXiv PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning2025Paper
arXiv MVP4D: Multi-View Portrait Video Diffusion for Animatable 4D Avatars2025Paper
arXiv Real-Time Motion-Controllable Autoregressive Video Diffusion2025Paper
arXiv PickStyle: Video-to-Video Style Transfer with Context-Style Adapters2025Paper
arXiv Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report2025Paper
arXiv Character Mixing for Video Generation2025Paper · GitHub
arXiv FlashI2V: Fourier-Guided Latent Shifting Prevents Conditional Image Leakage in Image-to-Video Generation2025Paper · GitHub · Website
arXiv DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder2025Paper · GitHub · Website
arXiv PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion2025Paper · Website
arXiv Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer2025Paper · Website
arXiv Reinforcement Learning with Inverse Rewards for World Model Post-training2025Paper
arXiv Echo-Path: Pathology-Conditioned Echo Video Generation2025Paper · GitHub
arXiv VidCLearn: A Continual Learning Approach for Text-to-Video Generation2025Paper
arXiv OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data2025Paper
arXiv PanoLora: Bridging Perspective and Panoramic Video Generation with LoRA Adaptation2025Paper · Website
arXiv Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis2025Paper · Website
arXiv Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders2025Paper · Website
arXiv RewardDance: Reward Scaling in Visual Generation2025Paper
arXiv HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning2025Paper · GitHub · Website
arXiv Zero-shot 3D-Aware Trajectory-Guided image-to-video generation via Test-Time Training2025Paper · GitHub · Website
arXiv UniVerse-1: Unified Audio-Video Generation via Stitching of Experts2025Paper · GitHub · Website
arXiv DevilSight: Augmenting Monocular Human Avatar Reconstruction through a Virtual Perspective2025Paper
arXiv Realistic and Controllable 3D Gaussian-Guided Object Editing for Driving Video Generation2025Paper
arXiv Learning Primitive Embodied World Models: Towards Scalable Robotic Learning2025Paper · GitHub · Website
arXiv MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation2025Paper · Website
arXiv ControlEchoSynth: Boosting Ejection Fraction Estimation Models via Controlled Video Diffusion2025Paper
arXiv SSG-Dit: A Spatial Signal Guided Framework for Controllable Video Generation2025Paper
arXiv Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation2025Paper
arXiv WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception2025Paper
arXiv 4DNeX: Feed-Forward 4D Generative Modeling Made Easy2025Paper · GitHub · Website
arXiv Physical Autoregressive Model for Robotic Manipulation without Action Pretraining2025Paper · GitHub · Website
arXiv From Large Angles to Consistent Faces: Identity-Preserving Video Generation via Mixture of Facial Experts2025Paper · GitHub · Website
arXiv Animate-X++: Universal Character Image Animation with Dynamic Backgrounds2025Paper · GitHub · Website
arXiv SketchAnimator: Animate Sketch via Motion Customization of Text-to-Video Diffusion Models2025Paper
arXiv SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment2025Paper
arXiv DreamVE: Unified Instruction-based Image and Video Editing2025Paper · Website
arXiv PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation2025Paper
arXiv Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm2025Paper
arXiv LongVie: Multimodal-Guided Controllable Ultra-Long Video Generation2025Paper · GitHub · Website
arXiv Macro-from-Micro Planning for High-Quality and Parallelized Autoregressive Long Video Generation2025Paper · GitHub · Website
arXiv DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework2025Paper · GitHub · Website
arXiv Compositional Video Synthesis by Temporal Object-Centric Learning2025Paper
arXiv Enhancing Scene Transition Awareness in Video Generation via Post-Training2025Paper
arXiv Zero-Shot Dynamic Concept Personalization with Grid-Based LoRA2025Paper · Website
arXiv Navigating Large-Pose Challenge for High-Fidelity Face Reenactment with Video Diffusion Model2025Paper · GitHub
arXiv PUSA V1.0: Surpassing Wan-I2V with $500 Training Cost by Vectorized Timestep Adaptation2025Paper · GitHub · Website
arXiv Conditional Video Generation for High-Efficiency Video Compression2025Paper
arXiv StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation2025Paper · Website
arXiv Geometry-aware 4D Video Generation for Robot Manipulation2025Paper · GitHub · Website
arXiv Populate-A-Scene: Affordance-Aware Human Video Generation2025Paper · Website
arXiv TextMesh4D: High-Quality Text-to-4D Mesh Generation2025Paper
arXiv SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation2025Paper · Website
arXiv MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation2025Paper
arXiv Video Virtual Try-on with Conditional Diffusion Transformer Inpainter2025Paper
arXiv DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing2025Paper · GitHub · Website
arXiv Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router2025Paper · GitHub · Website
arXiv AnimaX: Animating the Inanimate in 3D with Joint Video-Pose Diffusion Models2025Paper · GitHub · Website
arXiv RDPO: Real Data Preference Optimization for Physics Consistency Video Generation2025Paper · Website
arXiv FramePrompt: In-context Controllable Animation with Zero Structural Changes2025Paper · Website
arXiv DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning2025Paper
arXiv Causally Steered Diffusion for Automated Video Counterfactual Generation2025Paper · GitHub · Website
arXiv iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer2025Paper
arXiv PlayerOne: Egocentric World Simulator2025Paper · GitHub · Website
arXiv LoRA-Edit: Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning2025Paper · GitHub · Website
arXiv DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers2025Paper · Website
arXiv GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning2025Paper
arXiv AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation2025Paper · Website
arXiv Enhancing Motion Dynamics of Image-to-Video Models via Adaptive Low-Pass Guidance2025Paper · GitHub · Website
arXiv HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation2025Paper
arXiv Seedance 1.0: Exploring the Boundaries of Video Generation Models2025Paper · Website
arXiv Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models2025Paper · GitHub · Website
arXiv Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models2025Paper · GitHub · Website
arXiv Consistent Video Editing as Flow-Driven Image-to-Video Generation2025Paper
arXiv From Generation to Generalization: Emergent Few-Shot Learning in Video Diffusion Models2025Paper · GitHub · Website
arXiv Restereo: Diffusion stereo video generation and restoration2025Paper
arXiv FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers2025Paper · Website
arXiv Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers2025Paper · GitHub
arXiv OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation2025Paper
arXiv Respond Beyond Language: A Benchmark for Video Generation in Response to Realistic User Intents2025Paper
arXiv Playing with Transformer at 30+ FPS via Next-Frame Diffusion2025Paper · Website
arXiv DeepVerse: 4D Autoregressive Video Generation as a World Model2025Paper · GitHub · Website
arXiv Temporal In-Context Fine-Tuning for Versatile Control of Video Diffusion Models2025Paper · GitHub · Website
arXiv SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers2025Paper · Website
arXiv Video Signature: Implicit Watermarking for Video Diffusion Models2025Paper
arXiv Ctrl-Crash: Controllable Diffusion for Realistic Car Crashes2025Paper · GitHub · Website
arXiv ATI: Any Trajectory Instruction for Controllable Video Generation2025Paper · GitHub · Website
arXiv FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing2025Paper · Website
arXiv EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance2025Paper · GitHub · Website
arXiv Think Before You Diffuse: Infusing Physical Rules into Video Diffusion2025Paper · Website
arXiv HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters2025Paper · GitHub · Website
arXiv Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM2025Paper
arXiv DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation2025Paper · GitHub · Website
arXiv T2VUnlearning: A Concept Erasing Method for Text-to-Video Diffusion Models2025Paper · GitHub
arXiv MTVCrafter: 4D Motion Tokenization for Open-World Human Image Animation2025Paper · GitHub · Website
arXiv ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images2025Paper
arXiv HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation2025Paper · GitHub · Website
arXiv A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation2025Paper
arXiv VIDSTAMP: A Temporally-Aware Watermark for Ownership and Integrity in Video Diffusion Models2025Paper · Website
arXiv ReVision: High-Quality, Low-Cost Video Generation with Explicit 3D Physics Modeling for Complex Motion and Interaction2025Paper · Website
arXiv ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual Guidance2025Paper
arXiv Subject-driven Video Generation via Disentangled Identity and Motion2025Paper · GitHub · Website
arXiv Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning2025Paper
arXiv UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer2025Paper · GitHub
arXiv Taming Consistency Distillation for Accelerated Human Image Animation2025Paper
arXiv Aligning Anime Video Generation with Human Feedback2025Paper · GitHub
arXiv I Want It That Way! Specifying Nuanced Camera Motions in Video Editing2025Paper
arXiv Discriminator-Free Direct Preference Optimization for Video Diffusion2025Paper
arXiv EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion Model2025Paper
arXiv RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism2025Paper · GitHub
arXiv MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators2024Paper · GitHub · Website
arXiv VideoFactory: Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation2023Paper

📄 License

This project is licensed under the MIT License - see the LICENSE file for details.


🧑‍💻 Contributors

👏 Thanks to these contributors for this excellent work!

✉️ Contact

For questions, suggestions, or collaboration opportunities, please feel free to reach out:

✉️ Email: chaoyuli@asu.edu, pooyan@asu.edu

✨ Star History

Star History Chart

Contributors

CyL97

148 commits

Alleria1809

9 commits

SHYuanBest

7 commits

JasperYuu

5 commits