Dynamic Position-aware Network for Fine-grained Image Recognition
Shijie Wang, Haojie Li, Zhihui Wang, Wanli Ouyang
Abstract
Most weakly supervised fine-grained image recognition (WF-GIR) approaches predominantly focus on learning the discriminative details which contain the visual variances and position clues. The position clues can be indirectly learnt by utilizing context information of discriminative visual content. However, this will cause the selected discriminative regions containing some non-discriminative information introduced by the position clues. These analysis motivates us to directly introduce position clues into visual content to only focus on the visual variances, achieving more precise discriminative region localization. Though important, position modelling usually requires significant pixel/region annotations and therefore is labor-intensive. To address this issue, we propose an end-to-end Dynamic Position-aware Network (DP-Net) to directly incorporate the position clues into visual content and dynamically align them without extra annotations, which eliminates the effect of position information for discriminative variances among subcategories. In particular, the DP-Net consists of: 1) Position Encoding Module, which learns a set of position-aware parts by directly adding the learnable position information into the horizontal/vertical visual content of images; 2) Position-vision Aligning Module, which dynamically aligns both visual content and learnable position information via performing graph convolution on position-aware parts; 3) Position-vision Reorganization Module, which projects the aligned position clues and visual content into the Euclidean space to construct a position-aware feature maps. Finally, the position-aware feature maps are used which is implicitly applied the aligned visual content and position clues for more accurate discriminative regions localization. Extensive experiments verify that DP-Net yields the best performance under the same settings with most competitive approaches, on CUB Bird, Stanford-Cars, and FGVC Aircraft datasets.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 56f7633f-c942-4a54-b6be-edac5d2a4f84Cited by top-tier papers6
- SIM-Trans: Structure Information Modeling Transformer for Fine-grained Visual CategorizationHongbo Sun, Xiangteng He, Yuxin PengACM MM 2022 · 128 citations
- Fine-Grained Retrieval Prompt TuningShijie Wang, Jianlong Chang, Zhihui Wang, Haojie Li et al.AAAI 2023 · 27 citations
- Learning to Parameterize Visual Attributes for Open-set Fine-grained RetrievalShijie Wang, Jianlong Chang, Haojie Li, Zhihui Wang et al.NeurIPS 2023 · 13 citations
- Category-Specific Nuance Exploration Network for Fine-Grained Object RetrievalShijie Wang, Zhihui Wang, Haojie Li, Wanli OuyangAAAI 2022 · 12 citations
- Learning Fine-grained Domain Generalization via Hyperbolic State Space HallucinationQi Bi, Jingjun Yi, Haolan Zhan, Wei Ji et al.AAAI 2025 · 8 citations
Builds on8
- Selective Sparse Sampling for Fine-Grained Image RecognitionYao Ding, Yanzhao Zhou, Yi Zhu, Qixiang Ye et al.ICCV 2019 · 227 citations
- Graph-Propagation Based Correlation Learning for Weakly Supervised Fine-Grained Image ClassificationZhuhui Wang, Shijie Wang, Haojie Li, Zhi Dou et al.AAAI 2020 · 107 citations
- Category-specific Semantic Coherency Learning for Fine-grained Image RecognitionShijie Wang, Zhihui Wang, Haojie Li, Wanli OuyangACM MM 2020 · 23 citations
- Cars Can't Fly Up in the Sky: Improving Urban-Scene Segmentation via Height-Driven Attention NetworksSungha Choi, Joanne Taery Kim, Jaegul ChooCVPR 2020
- Look-Into-Object: Self-Supervised Structure Modeling for Object RecognitionMohan Zhou, Yalong Bai, Wei Zhang, Tiejun Zhao et al.CVPR 2020
Related papers
- Weakly Supervised Fine-Grained Image Classification via Guassian Mixture Model Oriented Discriminative LearningZhihui Wang, Shijie Wang, Shuhui Yang, Haojie Li et al.CVPR 2020
- E2Net: Excitative-Expansile Learning for Weakly Supervised Object LocalizationZhiwei Chen, Liujuan Cao, Yunhang Shen, Feihong Lian et al.ACM MM 2021 · 13 citations
- Learning Attentive Pairwise Interaction for Fine-Grained ClassificationPeiqin Zhuang, Yali Wang, Yu QiaoAAAI 2020 · 392 citations
- Filtration and Distillation: Enhancing Region Attention for Fine-Grained Visual CategorizationChuanbin Liu, Hongtao Xie, Zheng-Jun Zha, Lingfeng Ma et al.AAAI 2020 · 179 citations
- Context-aware Attentional Pooling (CAP) for Fine-grained Visual ClassificationArdhendu Behera, Zachary Wharton, Pradeep R. P. G. Hewage, Asish BeraAAAI 2021 · 142 citations
