VerbDiff: Text-Only Diffusion Models with Enhanced Interaction Awareness
SeungJu Cha, Kwanyoung Lee, Ye-Chan Kim, Hyunwoo Oh, Dong-Jin Kim
2025年份
7顶会引用
摘要
A photo of a man walking a bicycle on the street, carrying an umbrella" "A basketball player jumping and throwing a basketball and a man blocking the ball" Stable Diffusion GLIGEN InteractDiffusion VerbDiff (Ours) Real Figure 1. Generated samples illustrating multiple human-object interactions. Each color represents distinct humans, objects, and interaction words. GLIGEN [15] and InteractDiffusion [10] use grounding boxes as additional conditions, whereas Stable Diffusion [25] and VerbDiff rely solely on text.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper7
- SIDA: Synthetic Image Driven Zero-shot Domain AdaptationYe-Chan Kim, SeungJu Cha, Si-Woo Kim, Taewhan Kim 等ACM MM 2025 · 被引用 4 次
- SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video CaptioningYe-Chan Kim, SeungJu Cha, Si-Woo Kim, minju Jeon 等CVPR 2026 · 被引用 1 次
- Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video CaptioningMinJu Jeon, Si-Woo Kim, Ye-Chan Kim, HyunGee Kim 等EMNLP 2025
- CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image GenerationHyunwoo Oh, SeungJu Cha, Kwanyoung Lee, Si-Woo Kim 等ACM MM 2025
- SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image CaptioningSi-Woo Kim, MinJu Jeon, Ye-Chan Kim, Soeun Lee 等ACM MM 2025
它引用的顶会 Paper20
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Swin Transformer: Hierarchical Vision Transformer using Shifted WindowsZe Liu, Yutong Lin, Yue Cao, Han Hu 等ICCV 2021 · 被引用 31,683 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Denoising Diffusion Implicit ModelsJiaming Song, Chenlin Meng, Stefano ErmonICLR 2021 · 被引用 11,743 次
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 被引用 11,349 次
相关 Paper
- InteractDiffusion: Interaction Control in Text-to-Image Diffusion ModelsJiun Tian Hoe, Xudong Jiang, Chee Seng Chan, Yap-Peng Tan 等CVPR 2024
- Enhancing Compositional Text-to-Image Generation with Reliable Random SeedsShuangqi Li, Hieu Le, Jingyi Xu, Mathieu SalzmannICLR 2025
- Template Free Reconstruction of Human-object Interaction with Procedural Interaction GenerationXianghui Xie, Bharat Lal Bhatnagar, Jan Eric Lenssen, Gerard Pons-MollCVPR 2024 · 被引用 6 次
- VODiff: Controlling Object Visibility Order in Text-to-Image GenerationDong Liang, Jinyuan Jia, Yuhao Liu, Zhanghan Ke 等CVPR 2025
- Open-vocabulary Object Segmentation with Diffusion ModelsZiyi Li, Qinye Zhou, Xiaoyun Zhang, Ya Zhang 等ICCV 2023 · 被引用 98 次
