Cafe-Talk: Generating 3D Talking Face Animation with Multimodal Coarse- and Fine-grained Control
Hejia Chen, Haoxian Zhang, Shoulong Zhang, Xiaoqiang Liu, Sisi Zhuang, Yuan Zhang, Pengfei Wan, Di Zhang, Shuai Li
2025年份
5顶会引用
摘要
3 Zhongguancun Laboratory ♣ Equal contribution ♠ Intern at Kuaishou Technology ♡ Corresponding author "Angry" & "A senior actor" "Laugh" … how to gh! <mute> Ha! Ha! Something like this? laucoarse ctrl speech render video fine ctrl language portrait label Figure 1: Adding multimodal coarse-and fine-grained control enables more flexible animations: Scenario: A senior actor is arguing with the director about how to smile. Action: The actor responds with anger and concludes with a sudden sarcastic laugh.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- OmniSync: Towards Universal Lip Synchronization via Diffusion TransformersZiqiao Peng, Jiwen Liu, Haoxian Zhang, Xiaoqiang Liu 等NeurIPS 2025 · 被引用 30 次
- EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking HeadChang Liu, Tianjiao Jing, Chengcheng Ma, Xuanqi Zhou 等CVPR 2026 · 被引用 1 次
- DualTalk: Dual-Speaker Interaction for 3D Talking Head ConversationsZiqiao Peng, Yanbo Fan, Haoyu Wu, Xuan Wang 等CVPR 2025
- From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative BootstrappingXu He, Haoxian Zhang, Hejia Chen, Changyuan Zheng 等ICML 2026
- A Focused Human Body Model for Accurate Anthropometric Measurements ExtractionShuhang Chen, Xianliang Huang, Zhizhou Zhong, Juhong Guan 等CVPR 2025
它引用的顶会 Paper27
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- wav2vec 2.0: A Framework for Self-Supervised Learning of Speech RepresentationsAlexei Baevski, Yuhao Zhou, Abdelrahman Mohamed, Michael AuliNeurIPS 2020 · 被引用 9,451 次
- Adding Conditional Control to Text-to-Image Diffusion ModelsLvmin Zhang, Anyi Rao, Maneesh AgrawalaICCV 2023 · 被引用 6,759 次
- Scalable Diffusion Models with TransformersWilliam Peebles, Saining XieICCV 2023 · 被引用 5,568 次
相关 Paper
- MMHead: Towards Fine-grained Multi-modal 3D Facial AnimationSijing Wu, Yunhao Li, Yichao Yan, Huiyu Duan 等ACM MM 2024 · 被引用 17 次
- MoCha: Towards Movie-Grade Talking Character GenerationCong Wei, Bo Sun, Haoyu Ma, Ji Hou 等NeurIPS 2025 · 被引用 2 次
- MERMAID: Multi-perspective Self-reflective Agents with Generative Augmentation for Emotion RecognitionZhongyu Yang, Junhao Song, Siyang Song, Wei Pang 等EMNLP 2025
- Sentiment and Emotion help Sarcasm? A Multi-task Learning Framework for Multi-Modal Sarcasm, Sentiment and Emotion AnalysisDushyant Singh Chauhan, Dhanush S. R, Asif Ekbal, Pushpak BhattacharyyaACL 2020 · 被引用 131 次
- Predict and Use: Harnessing Predicted Gaze to Improve Multimodal Sarcasm DetectionDivyank Tiwari, Diptesh Kanojia, Anupama Ray, Apoorva Nunna 等EMNLP 2023 · 被引用 12 次
