Talking Face Generation with Expression-Tailored Generative Adversarial Network
Dan Zeng, Han Liu, Hui Lin, Shiming Ge
摘要
A key of automatically generating vivid talking faces is to synthesize identity-preserving natural facial expressions beyond audio-lip synchronization, which usually need to disentangle the informative features from multiple modals and then fuse them together. In this paper, we propose an end-to-end Expression-Tailored Generative Adversarial Network (ET-GAN) to generate an expression enriched talking face video of arbitrary identity. Different from talking face generation based on identity image and audio, an expressional video of arbitrary identity serves as the expression source in our approach. Expression encoder is proposed to disentangle expression-tailored representation from the guiding expressional video, while audio encoder disentangles audio-lip representation. Instead of using single image as identity input, multi-image identity encoder is proposed by learning different views of faces and merging a unified representation. Multiple discriminators are exploited to keep both image-aware and the video-aware realistic details, including a spatial-temporal discriminator for visual continuity of expression synthesis and facial movements. We conduct extensive experimental evaluations on quantitative metrics, expression retention quality and audio-visual synchronization. The results show the effectiveness of our ET-GAN in generating high quality expressional talking face videos against existing state-of-the-arts.
问问这篇 Paper
问问你的智能体。
Lune 读过与它相关的顶会 Paper,每个回答都会注明依据哪几篇。
引用它的顶会 Paper6
- FaceFormer: Speech-Driven 3D Facial Animation with TransformersYingruo Fan, Zhaojiang Lin, Jun Saito, Wenping Wang 等CVPR 2022 · 被引用 218 次
- Imitating Arbitrary Talking Style for Realistic Audio-Driven Talking Face SynthesisHaozhe Wu, Jia Jia, Haoyu Wang, Yishun Dou 等ACM MM 2021 · 被引用 50 次
- Sparse to Dense Dynamic 3D Facial Expression GenerationNaima Otberdout, Claudio Ferrari, Mohamed Daoudi, Stefano Berretti 等CVPR 2022 · 被引用 28 次
- Parametric Reshaping of Portraits in VideosXiangjun Tang, Wenxin Sun, Yong-Liang Yang, Xiaogang JinACM MM 2021 · 被引用 4 次
- Improving the Training of the GANs with Limited Data via Dual Adaptive Noise InjectionZhaoyu Zhang, Yang Hua, Guanxiong Sun, Hui Wang 等ACM MM 2024 · 被引用 3 次
相关 Paper
- FACIAL: Synthesizing Dynamic Talking Face with Implicit Attribute LearningChenxu Zhang, Yifan Zhao, Yifei Huang, Ming Zeng 等ICCV 2021 · 被引用 149 次
- That's What I Said: Fully-Controllable Talking Face GenerationYoungjoon Jang, Kyeongha Rho, Jong-Bin Woo, Hyeongkeun Lee 等ACM MM 2023 · 被引用 7 次
- SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local EditingLingyu Xiong, Xize Cheng, Jintao Tan, Xianjia Wu 等ACM MM 2024 · 被引用 10 次
- HeadGAN: One-shot Neural Head Synthesis and EditingMichail Christos Doukas, Stefanos Zafeiriou, Viktoriia SharmanskaICCV 2021 · 被引用 164 次
- MoDiTalker: Motion-Disentangled Diffusion Model for High-Fidelity Talking Head GenerationSeyeon Kim, Siyoon Jin, Jihye Park, Kihong Kim 等AAAI 2025 · 被引用 12 次
