ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping
Youxin Pang, Ruizhi Shao, Jiajun Zhang, Hanzhang Tu, Yun Liu, Boyao Zhou, Hongwen Zhang, Yebin Liu
摘要
Occlusion-free normal maps Occlusion confidence maps Confidence occlusion occlusion-free Unseen objects Generated results Human-centered results Segmentation Figure 1. ManiVideo: We propose a novel framework for generalizable and dexterous hand-object manipulation video generation. Left: Given several reference images of unseen objects, our method generates realistic and plausible manipulation videos driven by hand-object signals. By integrating multiple datasets, ManiVideo supports applications such as human-centered manipulation video generation. Right:
To ensure hand-object consistency, we introduce a multi-layer occlusion representation capable of learning 3D occlusion relationships from occlusion-free normal maps and occlusion confidence maps.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper1
问问它们各自怎么用它它引用的顶会 Paper37
- Diffusion Models Beat GANs on Image SynthesisPrafulla Dhariwal, Alexander Quinn NicholNeurIPS 2021 · 被引用 13,211 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Adding Conditional Control to Text-to-Image Diffusion ModelsLvmin Zhang, Anyi Rao, Maneesh AgrawalaICCV 2023 · 被引用 6,759 次
- Hand-Object Contact Consistency Reasoning for Human Grasps GenerationHanwen Jiang, Shaowei Liu, Jiashun Wang, Xiaolong WangICCV 2021 · 被引用 242 次
- Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion ModelsFei Shen, Hu Ye, Jun Zhang, Cong Wang 等ICLR 2024 · 被引用 133 次
相关 Paper
- Diffusion-Guided Reconstruction of Everyday Hand-Object Interaction ClipsYufei Ye, Poorvi Hebbar, Abhinav Gupta, Shubham TulsianiICCV 2023 · 被引用 80 次
- InterDyn: Controllable Interactive Dynamics with Video Diffusion ModelsRick Akkerman, Haiwen Feng, Michael J. Black, Dimitrios Tzionas 等CVPR 2025
- Hand Avatar: Free-Pose Hand Animation and Rendering from Monocular VideoXingyu Chen, Baoyuan Wang, Heung-Yeung ShumCVPR 2023
- MIMIC: Mask-Injected Manipulation Video Generation with Interaction ControlTianxiao Chen, Jintao Rong, Huajin Chen, Jingya Wang 等ICLR 2026
- Mask2IV: Interaction-Centric Video Generation via Mask TrajectoriesGen Li, Bo Zhao, Jianfei Yang, Laura Sevilla-LaraAAAI 2026 · 被引用 6 次
