Dynamic Position-aware Network for Fine-grained Image Recognition
Shijie Wang, Haojie Li, Zhihui Wang, Wanli Ouyang
摘要
Most weakly supervised fine-grained image recognition (WF-GIR) approaches predominantly focus on learning the discriminative details which contain the visual variances and position clues. The position clues can be indirectly learnt by utilizing context information of discriminative visual content. However, this will cause the selected discriminative regions containing some non-discriminative information introduced by the position clues. These analysis motivates us to directly introduce position clues into visual content to only focus on the visual variances, achieving more precise discriminative region localization. Though important, position modelling usually requires significant pixel/region annotations and therefore is labor-intensive. To address this issue, we propose an end-to-end Dynamic Position-aware Network (DP-Net) to directly incorporate the position clues into visual content and dynamically align them without extra annotations, which eliminates the effect of position information for discriminative variances among subcategories. In particular, the DP-Net consists of: 1) Position Encoding Module, which learns a set of position-aware parts by directly adding the learnable position information into the horizontal/vertical visual content of images; 2) Position-vision Aligning Module, which dynamically aligns both visual content and learnable position information via performing graph convolution on position-aware parts; 3) Position-vision Reorganization Module, which projects the aligned position clues and visual content into the Euclidean space to construct a position-aware feature maps. Finally, the position-aware feature maps are used which is implicitly applied the aligned visual content and position clues for more accurate discriminative regions localization. Extensive experiments verify that DP-Net yields the best performance under the same settings with most competitive approaches, on CUB Bird, Stanford-Cars, and FGVC Aircraft datasets.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper6
- SIM-Trans: Structure Information Modeling Transformer for Fine-grained Visual CategorizationHongbo Sun, Xiangteng He, Yuxin PengACM MM 2022 · 被引用 128 次
- Fine-Grained Retrieval Prompt TuningShijie Wang, Jianlong Chang, Zhihui Wang, Haojie Li 等AAAI 2023 · 被引用 27 次
- Learning to Parameterize Visual Attributes for Open-set Fine-grained RetrievalShijie Wang, Jianlong Chang, Haojie Li, Zhihui Wang 等NeurIPS 2023 · 被引用 13 次
- Category-Specific Nuance Exploration Network for Fine-Grained Object RetrievalShijie Wang, Zhihui Wang, Haojie Li, Wanli OuyangAAAI 2022 · 被引用 12 次
- Learning Fine-grained Domain Generalization via Hyperbolic State Space HallucinationQi Bi, Jingjun Yi, Haolan Zhan, Wei Ji 等AAAI 2025 · 被引用 8 次
它引用的顶会 Paper8
- Selective Sparse Sampling for Fine-Grained Image RecognitionYao Ding, Yanzhao Zhou, Yi Zhu, Qixiang Ye 等ICCV 2019 · 被引用 227 次
- Graph-Propagation Based Correlation Learning for Weakly Supervised Fine-Grained Image ClassificationZhuhui Wang, Shijie Wang, Haojie Li, Zhi Dou 等AAAI 2020 · 被引用 107 次
- Category-specific Semantic Coherency Learning for Fine-grained Image RecognitionShijie Wang, Zhihui Wang, Haojie Li, Wanli OuyangACM MM 2020 · 被引用 23 次
- Cars Can't Fly Up in the Sky: Improving Urban-Scene Segmentation via Height-Driven Attention NetworksSungha Choi, Joanne Taery Kim, Jaegul ChooCVPR 2020
- Look-Into-Object: Self-Supervised Structure Modeling for Object RecognitionMohan Zhou, Yalong Bai, Wei Zhang, Tiejun Zhao 等CVPR 2020
相关 Paper
- Weakly Supervised Fine-Grained Image Classification via Guassian Mixture Model Oriented Discriminative LearningZhihui Wang, Shijie Wang, Shuhui Yang, Haojie Li 等CVPR 2020
- E2Net: Excitative-Expansile Learning for Weakly Supervised Object LocalizationZhiwei Chen, Liujuan Cao, Yunhang Shen, Feihong Lian 等ACM MM 2021 · 被引用 13 次
- Learning Attentive Pairwise Interaction for Fine-Grained ClassificationPeiqin Zhuang, Yali Wang, Yu QiaoAAAI 2020 · 被引用 392 次
- Filtration and Distillation: Enhancing Region Attention for Fine-Grained Visual CategorizationChuanbin Liu, Hongtao Xie, Zheng-Jun Zha, Lingfeng Ma 等AAAI 2020 · 被引用 179 次
- Context-aware Attentional Pooling (CAP) for Fine-grained Visual ClassificationArdhendu Behera, Zachary Wharton, Pradeep R. P. G. Hewage, Asish BeraAAAI 2021 · 被引用 142 次
