Instruction-based Image Manipulation by Watching How Things Move
Mingdeng Cao, Xuaner Zhang, Yinqiang Zheng, Zhihao Xia
2025年份
6顶会引用
摘要
2 Adobe Change the view to the side Lower the horse's head Make the man look angry Close the dog's eyes Have the man look at the side Move the camera to the left
Figure 1. We propose InstructMove, an instruction-based image editing model trained on frame pairs from videos with instructions generated by Multimodal LLMs. Our model excels at non-rigid editing, such as adjusting subject poses, expressions, and altering viewpoints, while maintaining content consistency. Additionally, our method supports precise, localized edits through the integration of masks, human poses, and other control mechanisms.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper6
- Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion TransformerZechuan Zhang, Ji Xie, Yu Lu, Zongxin Yang 等NeurIPS 2025 · 被引用 18 次
- Edicho: Consistent Image Editing in the WildQingyan Bai, Hao Ouyang, Yinghao Xu, Qiuyu Wang 等ICCV 2025 · 被引用 10 次
- PhotoFramer: Multi-modal Image Composition InstructionZhiyuan You, Ke Wang, He Zhang, Xin Cai 等CVPR 2026 · 被引用 8 次
- PICABench: How Far are We from Physical Realistic Image Editing?Yuandong Pu, Le Zhuo, Songhao Han, Jinbo Xing 等ICLR 2026 · 被引用 7 次
- Anchor Token Matching: Implicit Structure Locking for Training-Free AR Image EditingTaihang Hu, Linxuan Li, Kai Wang, Yaxing Wang 等ICCV 2025 · 被引用 1 次
它引用的顶会 Paper27
- Language Models are Few-Shot LearnersTom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah 等NeurIPS 2020 · 被引用 64,255 次
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Directly Denoising Diffusion ModelsDan Zhang, Jingjing Wang, Feng LuoICML 2024 · 被引用 11,724 次
相关 Paper
- Guiding Instruction-based Image Editing via Multimodal Large Language ModelsTsu-Jui Fu, Wenze Hu, Xianzhi Du, William Yang Wang 等ICLR 2024 · 被引用 173 次
- MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and EditingXueyun Tian, Wei Li, Bingbing Xu, Yige Yuan 等ACM MM 2025 · 被引用 4 次
- AnyEdit: Mastering Unified High-Quality Image Editing for Any IdeaQifan Yu, Wei Chow, Zhongqi Yue, Kaihang Pan 等CVPR 2025
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image EditingYucheng Liao, Jiajun Liang, Kaiqian Cui, Baoquan Zhao 等CVPR 2026 · 被引用 6 次
- Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-TuningChenjian Gao, Lihe Ding, Xin Cai, Zhanpeng Huang 等ICLR 2026 · 被引用 24 次
