| 2025 | arXiv | Audio | MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control | - |
| 2025 | arXiv | Audio | MoEE: Mixture of Emotion Experts for Audio-Driven Portrait Animation | - |
| 2025 | arXiv | Audio | FREAK: Frequency-modulated High-fidelity and Real-time Audio-driven Talking Portrait Synthesis | - |
| 2025 | arXiv | Multimodal | MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice | Code |
| 2025 | arXiv | Audio | StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation | - |
| 2025 | arXiv | Diffusion | Unlock Pose Diversity: Accurate and Efficient Implicit Keypoint-based Spatiotemporal Diffusion for Audio-driven Talking Portrait | Code |
| 2025 | arXiv | Diffusion | DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion Model | Code |
| 2025 | arXiv | Diffusion | EMO2: End-Effector Guided Audio-Driven Avatar Video Generation | - |
| 2025 | arXiv | Diffusion | Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model | - |
| 2025 | arXiv | 3D Model | EmoTalkingGaussian: Continuous Emotion-conditioned Talking Head Synthesis | - |
| 2025 | arXiv | 3D Model | SyncAnimation: A Real-Time End-to-End Framework for Audio-Driven Human Pose and Talking Head Animation | Code |
| 2025 | arXiv | 3D Model | PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation | - |
| 2025 | AAAI | Diffusion | MoDiTalker: Motion-Disentangled Diffusion Model for High-Fidelity Talking Head Generation | - |
| 2025 | WACV | Audio | EmoVOCA: Speech-Driven Emotional 3D Talking Heads | - |
| 2025 | ICPR | Audio | StableTalk: Advancing Audio-to-Talking Face Generation with Stable Diffusion and Vision Transformer | - |
| 2025 | ICCV | Audio | FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait | Code |
| 2025 | ICCV | Audio | DGTalker:Disentangled Generative Latent Space Learning for Audio-Driven Gaussian Talking Heads | Code |
| 2025 | TMM | Multimodal | AdaMesh: Personalized Facial Expressions and Head Poses for Adaptive Speech-Driven 3D Facial Animation | Code |
| 2025 | CVPR | Diffusion | EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion | Code |
| 2025 | CVPR | 3D Model | InsTaG: Learning Personalized 3D Talking Head from Few-Second Video | Code |
| 2025 | CVPR | Audio | Towards High-fidelity 3D Talking Avatar with Personalized Dynamic Texture | Code |
| 2025 | CVPR | Audio | VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis | Code |
| 2025 | CVPR | Audio | KeyFace: Expressive Audio-Driven Facial Animation for Long Sequences via KeyFrame Interpolation | - |
| 2025 | ICME | Diffusion | DiffusionTalker: Efficient and Compact Speech-Driven 3D Talking Head via Personalizer-Guided Distillation | Code |
| 2025 | NIPS | 3D Model | MimicTalk: Mimicking a personalized and expressive 3D talking face in minutes | Code |
| 2025 | ICASSP | Audio | Identity-Preserving Video Dubbing Using Motion Warping | - |
| 2025 | ICASSP | Audio | SPEAK: Speech-Driven Pose and Emotion-Adjustable Talking Head Generation | Code |
| 2025 | ICASSP | Audio | SwapTalk: Audio-Driven Talking Face Generation with One-Shot Customization in Latent Space | Code |
| 2025 | ICASSP | 3D Model | DEGSTalk: Decomposed Per-Embedding Gaussian Fields for Hair-Preserving Talking Face Synthesis | Code |
| 2025 | ICASSP | 3D Model | NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis | Code |
| 2025 | AAAI | VQ-VAE | DEEPTalk: Dynamic Emotion Embedding for Probabilistic Speech-Driven 3D Face Animation | - |
| 2025 | AAAI | Diffusion | GoHD: Gaze-oriented and Highly Disentangled Portrait Animation with Rhythmic Poses and Realistic Expression | Code |
| 2024 | arXiv | Diffusion | UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control | - |
| 2024 | arXiv | Diffusion | LatentSync: Audio Conditioned Latent Diffusion Models for Lip Sync | - |
| 2024 | arXiv | 3D Model | Audio-Driven Emotional 3D Talking-Head Generation | - |
| 2024 | arXiv | 3D Model | Diverse Code Query Learning for Speech-Driven Facial Animation | - |
| 2024 | arXiv | 3D Model | JambaTalk: Speech-Driven 3D Talking Head Generation Based on Hybrid Transformer-Mamba Model | - |
| 2024 | arXiv | 3D Model | LES-Talker: Fine-Grained Emotion Editing for Talking Head Generation in Linear Emotion Space | - |
| 2024 | arXiv | 3D Model | 3D-GS Talker: 3D Gaussian Based Audio-Driven Real-Time Talking Head Generation | - |
| 2024 | arXiv | Diffusion | JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation | Code |
| 2024 | arXiv | Audio | DAWN: Dynamic Frame Avatar with Non-autoregressive Diffusion Framework for Talking Head Video Generation | Code |
| 2024 | arXiv | Audio | MuseTalk: Real-Time High Quality Lip Synchronization with Latent Space Inpainting | - |
| 2024 | arXiv | Audio | LaDTalk: Latent Denoising for Synthesizing Talking Head Videos with High Frequency Details | - |
| 2024 | arXiv | Diffusion | DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis | - |
| 2024 | arXiv | KAN | KAN-Based Fusion of Dual-Domain for Audio-Driven Facial Landmarks Generation | - |
| 2024 | arXiv | Diffusion | SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model | - |
| 2024 | arXiv | Diffusion | PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation | Code |
| 2024 | arXiv | Audio | JambaTalk: Speech-Driven 3D Talking Head Generation Based on Hybrid Transformer-Mamba Model | - |
| 2024 | arXiv | Audio | EmoFace: Emotion-Content Disentangled Speech-Driven 3D Talking Face with Mesh Attention | - |
| 2024 | arXiv | Audio | Meta-Learning Empowered Meta-Face: Personalized Speaking Style Adaptation for Audio-Driven 3D Talking Face Animation | - |
| 2024 | arXiv | VQ-VAE | GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer | - |
| 2024 | arXiv | Diffusion | High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model | - |
| 2024 | arXiv | Diffusion | Style-Preserving Lip Sync via Audio-Aware Style Reference | - |
| 2024 | arXiv | Diffusion | Text-based Talking Video Editing with Cascaded Conditional Diffusion | - |
| 2024 | arXiv | Audio | RealTalk: Real-time and Realistic Audio-driven Face Generation with 3D Facial Prior-guided Identity Alignment Network | - |
| 2024 | arXiv | Audio | Emotional Conversation: Empowering Talking Faces with Cohesive Expression, Gaze and Pose Generation | - |
| 2024 | arXiv | Audio | Controllable Talking Face Generation by Implicit Facial Keypoints Editing | Code |
| 2024 | arXiv | Audio | OpFlowTalker: Realistic and Natural Talking Face Generation via Optical Flow Guidance | - |
| 2024 | arXiv | 3D Model | NeRFFaceSpeech: One-shot Audio-driven 3D Talking Head Synthesis via Generative Prior | Code |
| 2024 | arXiv | 3D Model | GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting | - |
| 2024 | arXiv | 3D Model | GaussianTalker: Speaker-specific Talking Head Synthesis via 3D Gaussian Splatting | Code |
| 2024 | arXiv | Audio | AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animations | Code |
| 2024 | arXiv | Audio | Talk3D: High-Fidelity Talking Portrait Synthesis via Personalized 3D Generative Prior | Code |
| 2024 | arXiv | Diffusion | Context-aware Talking Face Video Generation | - |
| 2024 | arXiv | Audio | EmoSpeaker: One-shot Fine-grained Emotion-Controlled Talking Face Generation | - |
| 2024 | arXiv | Diffusion | EMOdiffhead: Continuously Emotional Control in Talking Head Generation via Diffusion | - |
| 2024 | PRICAI | 3D Model | NLDF: Neural Light Dynamic Fields for Efficient 3D Talking Head Generation | - |
| 2024 | ICME | Audio | Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN | - |
| 2024 | TVCG | 3D Model | Learn2Talk: 3D Talking Face Learns from 2D Talking Face | Code |
| 2024 | FG | 3D Model | Embedded Representation Learning Network for Animating Styled Video Portrait | - |
| 2024 | ECCV | Audio | Emote Portrait Alive: Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions | Code |
| 2024 | TCSVT | Multimodal | Multimodal Emotional Talking Face Generation based on Action Units | - |
| 2024 | TVCG | Audio | Pose-aware 3D talking face synthesis using geometry-guided audio-vertices attention | Code |
| 2024 | TVCG | 3D Model | High-Fidelity and High-Efficiency Talking Portrait Synthesis With Detail-Aware Neural Radiance Fields | Code |
| 2024 | ICIP | Audio | Personatalk: Preserving Personalized Dynamic Speech Style In Talking Face Generation | - |
| 2024 | NIPS oral | Audio | VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time | Code |
| 2024 | NIPS | 3D Model | MimicTalk: Mimicking a personalized and expressive 3D talking face in minutes | Code |
| 2024 | SIGGRAPH | Multimodal | Media2Face: Co-speech Facial Animation Generation With Multi-Modality Guidance | - |
| 2024 | SIGGRAPH | Audio | ProbTalk3D: Non-Deterministic Emotion Controllable Speech-Driven 3D Facial Animation Synthesis Using VQ-VAE | Code |
| 2024 | BMVC | 3D Model | JEAN: Joint Expression and Audio-guided NeRF-based Talking Face Generation | Code |
| 2024 | ACM MM | 3D Model | GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting | Code |
| 2024 | ACM MM | Audio | AniTalker: Animate Vivid and Diverse Talking Faces through Identity-Decoupled Facial Motion Encoding | Code |
| 2024 | ACM MM | Diffusion | ConsistentAvatar: Learning to Diffuse Fully Consistent Talking Head Avatar with Temporal Guidance | - |
| 2024 | ACM MM | Audio | SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing | - |
| 2024 | ACM MM | GANs | SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing | - |
| 2024 | ACM MM | Diffusion | FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model | Code |
| 2024 | ACM MM | Multimodal | SyncTalklip: Highly Synchronized Lip-Readable Speaker Generation with Multi-Task Learning | Code |
| 2024 | VR | Audio | EmoFace: Audio-driven Emotional 3D Face Animation | Code |
| 2024 | ECCV | Diffusion | EMO: Emote Portrait Alive Generating Expressive Portrait Videos with Audio2Video Diffusion Model Under Weak Conditions | - |
| 2024 | ECCV | Audio | Audio-driven Talking Face Generation with Stabilized Synchronization Loss | - |
| 2024 | ECCV | Diffusion | Stable Video Portraits | Code |
| 2024 | ECCV | 3D Model | S^3D-NeRF: Single-Shot Speech-Driven Neural Radiance Field for High Fidelity Talking Head Synthesis | - |
| 2024 | ECCV | Audio | KMTalk: Speech-Driven 3D Facial Animation with Key Motion Embedding | Code |
| 2024 | ECCV | 3D Model | TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian Splatting | Code |
| 2024 | ECCV | Audio | EDTalk: Efficient Disentanglement for Emotional Talking Head Synthesis | Code |
| 2024 | IJCV | Audio | ReliTalk: Relightable Talking Portrait Generation from a Single Video | Code |
| 2024 | TCSVT | Audio | Audio-Semantic Enhanced Pose-Driven Talking Head Generation | Code |
| 2024 | TCSVT | Audio | OSM-Net: One-to-Many One-shot Talking Head Generation with Spontaneous Head Motions | - |
| 2024 | IF | 3D Model | ER-NeRF++: Efficient region-aware Neural Radiance Fields for high-fidelity talking portrait synthesis | - |
| 2024 | ICLR | 3D Model | Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis | Code |
| 2024 | ICLR | Diffusion | GAIA: ZERO-SHOT TALKING AVATAR GENERATION | Code |
| 2024 | T-PAMI | Multimodal | StyleTalk++: A Unified Framework for Controlling the Speaking Styles of Talking Heads | - |
| 2024 | ICASSP | Diffusion | EmoTalker: Emotionally Editable Talking Face Generation via Diffusion Model | - |
| 2024 | ICASSP | Text | Text-Driven Talking Face Synthesis by Reprogramming Audio-Driven Models | - |
| 2024 | ICASSP | Audio | Speech-Driven Emotional 3d Talking Face Animation Using Emotional Embeddings | - |
| 2024 | ICASSP | Audio | Exploring Phonetic Context-Aware Lip-Sync for Talking Face Generation | - |
| 2024 | ICASSP | Audio | Talking Face Generation for Impression Conversion Considering Speech Semantics | - |
| 2024 | ICASSP | 3D Model | NeRF-AD: Neural Radiance Field with Attention-based Disentanglement for Talking Face Synthesis | Code |
| 2024 | ICASSP | 3D Model | DT-NeRF: Decomposed Triplane-Hash Neural Radiance Fields For High-Fidelity Talking Portrait Synthesis | - |
| 2024 | ICASSP | Multimodal | Talking Face Generation for Impression Conversion Considering Speech Semantics | - |
| 2024 | ICAART | Diffusion | DiT-Head: High-Resolution Talking Head Synthesis using Diffusion Transformers | - |
| 2024 | WACV | Audio | THInImg: Cross-Modal Steganography for Presenting Talking Heads in Images | - |
| 2024 | WACV | Diffusion | Diffused Heads: Diffusion Models Beat GANs on Talking-Face Generation | Code |
| 2024 | WACV | Audio | DR2: Disentangled Recurrent Representation Learning for Data-Efficient Speech Video Synthesis | - |
| 2024 | WACV | Audio | RADIO: Reference-Agnostic Dubbing Video Synthesis | - |
| 2024 | WACV | Audio | Diff2Lip: Audio Conditioned Diffusion Models for Lip-Synchronization | Code |
| 2024 | CVPR | Text | FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models | Code |
| 2024 | CVPR | Text | Faces that Speak: Jointly Synthesising Talking Face and Speech from Text | Code |
| 2024 | CVPR | Diffusion | DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures | - |
| 2024 | CVPR | Audio | FaceChain-ImagineID: Freely Crafting High-Fidelity Diverse Talking Faces from Disentangled Audio | Code |
| 2024 | CVPR | Audio | FlowVQTalker: High-Quality Emotional Talking Face Generation through Normalizing Flow and Quantization | - |
| 2024 | CVPR | Text | Faces that Speak: Jointly Synthesising Talking Face and Speech from Text | Code |
| 2024 | CVPR | 3D Model | SyncTalk: The Devil is in the Synchronization for Talking Head Synthesis | Code |
| 2024 | CVPR | 3D Model | Learning Dynamic Tetrahedra for High-Quality Talking Head Synthesis | Code |
| 2024 | CVPRW | 3D Model | NeRFFaceSpeech: One-shot Audio-driven 3D Talking Head Synthesis via Generative Prior | Code |
| 2024 | AAAI | 3D Model | AE-NeRF: Audio Enhanced Neural Radiance Field for Few Shot Talking Head Synthesis | - |
| 2024 | AAAI | 3D Model | Mimic: Speaking Style Disentanglement for Speech-Driven 3D Facial Animation | Code |
| 2024 | AAAI | Audio | Style2Talker: High-Resolution Talking Head Generation with Emotion Style and Art Style | - |
| 2024 | AAAI | Audio | AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head | - |
| 2024 | AAAI | Audio | Say Anything with Any Style | - |
| 2023 | arXiv | Audio | GMTalker: Gaussian Mixture based Emotional talking video Portraits | Code |
| 2023 | arXiv | Diffusion | DREAM-Talk: Diffusion-based Realistic Emotional Audio-driven Method for Single Image Talking Face Generation | Code |
| 2023 | arXiv | Diffusion | DreamTalk: When Expressive Talking Head Generation Meets Diffusion Probabilistic Models | Code |
| 2023 | arXiv | Text | TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles | - |
| 2023 | CVPR | Multimodal | High-Fidelity Generalized Emotional Talking Face Generation With Multi-Modal Emotion Space Learning | - |
| 2023 | CVPR | Multimodal | LipFormer: High-fidelity and Generalizable Talking Face Generation with A Pre-learned Facial Codebook | - |
| 2023 | CVPR | Audio | Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation | Code |
| 2023 | CVPR | Audio | Seeing What You Said: Talking Face Generation Guided by a Lip Reading Expert | - |
| 2023 | ICCV | Audio | Speech2Lip: High-fidelity Speech to Lip Generation by Learning from a Short Video | Code |
| 2023 | ICCV | Audio | EMMN: Emotional Motion Memory Network for Audio-driven Emotional Talking Face Generation | - |
| 2023 | TNNLS | Audio | Talking Face Generation With Audio-Deduced Emotional Landmarks | - |
| 2023 | ICASSP | Audio | Memory-augmented contrastive learning for talking head generation | Code |
| 2023 | CVPR | Audio | Identity-Preserving Talking Face Generation with Landmark and Appearance Priors | Code |
| 2023 | TCSVT | Audio | Stochastic Latent Talking Face Generation Towards Emotional Expressions and Head Poses | - |
| 2023 | ICCV | Audio | Efficient Emotional Adaptation for Audio-Driven Talking-Head Generation | Code |
| 2023 | Displays | Audio | Talking face generation driven by time–frequency domain features of speech audio | - |
| 2023 | ICCV | Diffusion | Talking Head Generation with Probabilistic Audio-to-Visual Diffusion Priors | Code |
| 2023 | ICCV | Audio | SPACE : Speech-driven Portrait Animation with Controllable Expression | Code |
| 2023 | ICCV | 3D Model | EmoTalk: Speech-Driven Emotional Disentanglement for 3D Face Animation | Code |
| 2023 | Displays | Multimodal | Flow2Flow: Audio-visual cross-modality generation for talking face videos with rhythmic head | Code |
| 2023 | ACM MM | Diffusion | DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder | Code |
| 2022 | CVPR | Multimodal | Expressive Talking Head Generation with Granular Audio-Visual Control | - |
| 2022 | TMM | Multimodal | Multimodal Learning for Temporally Coherent Talking Face Generation With Articulator Synergy | Code |
| 2022 | CVPR | Text | Talking Face Generation with Multilingual TTS | Code |
| 2022 | ECCV | Audio | Learning Dynamic Facial Radiance Fields for Few-Shot Talking Head Synthesis | Code |
| 2021 | ICCV | Audio | FACIAL: Synthesizing Dynamic Talking Face with Implicit Attribute Learning | Code |
| 2021 | CVPR | Multimodal | Pose-Controllable Talking Face Generation by Implicitly Modularized Audio-Visual Representation | Code |
| 2021 | ICCV | 3D Model | AD-NeRF: Audio Driven Neural Radiance Fields for Talking Head Synthesis | Code |
| 2021 | CVPR | Audio | Audio-driven emotional video portraits | Code |
| 2020 | ICMR | Audio | A Lip Sync Expert Is All You Need for Speech to Lip Generatio In The Wild | Code |
| 2020 | ACM TOG | Audio | MakeItTalk: Speaker-Aware Talking-Head Animation | Code |