Human-Like Controllable Image Captioning With Verb-Specific Semantic Roles
Long Chen, Zhihong Jiang, Jun Xiao, Wei Liu
2021年份
15顶会引用
摘要
Cap: a man riding a wave on a surfboard. CS: Cap: a man riding a wave on a surfboard in his hand in the sky. CS: level 3 (15-19) Cap: a group of people sitting next to each other in front of a tree. CS: level 4 (20-25) Cap: a group of men and two boys are standing in front of a refrigerator in front of a house.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper15
- Generating Visual Spatial Description via Holistic 3D Scene UnderstandingYu Zhao, Hao Fei, Wei Ji, Jianguo Wei 等ACL 2023 · 被引用 40 次
- DeeCap: Dynamic Early Exiting for Efficient Image CaptioningZhengcong Fei, Xu Yan, Shuhui Wang, Qi TianCVPR 2022 · 被引用 39 次
- Classification-Then-Grounding: Reformulating Video Scene Graphs as Temporal Bipartite GraphsKaifeng Gao, Long Chen, Yulei Niu, Jian Shao 等CVPR 2022 · 被引用 34 次
- Learning Distinct and Representative Modes for Image CaptioningQi Chen, Chaorui Deng, Qi WuNeurIPS 2022 · 被引用 27 次
- Collaborative Transformers for Grounded Situation RecognitionJunhyeong Cho, Youngseok Yoon, Suha KwakCVPR 2022 · 被引用 23 次
它引用的顶会 Paper8
- Learning to Collocate Neural Modules for Image CaptioningXu Yang, Hanwang Zhang, Jianfei CaiICCV 2019 · 被引用 84 次
- Sequential Latent Spaces for Modeling the Intention During Diverse Image CaptioningJyoti Aneja, Harsh Agrawal, Dhruv Batra, Alexander G. SchwingICCV 2019 · 被引用 71 次
- Generating Diverse and Descriptive Image Captions Using Visual ParaphrasesLixin Liu, Jiajun Tang, Xiaojun Wan, Zongming GuoICCV 2019 · 被引用 48 次
- Mixture-Kernel Graph Attention Network for Situation RecognitionMohammed Suhail, Leonid SigalICCV 2019 · 被引用 32 次
- Controllable Video Captioning with an Exemplar SentenceYitian Yuan, Lin Ma, Jingwen Wang, Wenwu ZhuACM MM 2020 · 被引用 21 次
相关 Paper
- GRES: Generalized Referring Expression SegmentationChang Liu, Henghui Ding, Xudong JiangCVPR 2023
- ArtAdapter: Text-to-Image Style Transfer using Multi-Level Style Encoder and Explicit AdaptationDar-Yen Chen, Hamish Tennent, Ching-Wen HsuCVPR 2024
- ReGenHOI: Unifying Reconstruction and Generation for 3D Human-Object Interaction UnderstandingMiao Xu, Xiangyu Zhu, Zidu Wang, Xusheng Liang 等CVPR 2026
- CapHuman: Capture Your Moments in Parallel UniversesChao Liang, Fan Ma, Linchao Zhu, Yingying Deng 等CVPR 2024
- Collaborative Diffusion for Multi-Modal Face Generation and EditingZiqi Huang, Kelvin C. K. Chan, Yuming Jiang, Ziwei LiuCVPR 2023
