Discrete Latent Perspective Learning for Segmentation and Detection
Deyi Ji, Feng Zhao, Lanyun Zhu, Wenwei Jin, Hongtao Lu, Jieping Ye
摘要
In this paper, we address the challenge of Perspective-Invariant Learning in machine learning and computer vision, which involves enabling a network to understand images from varying perspectives to achieve consistent semantic interpretation. While standard approaches rely on the labor-intensive collection of multi-view images or limited data augmentation techniques, we propose a novel framework, Discrete Latent Perspective Learning (DLPL), for latent multi-perspective fusion learning using conventional single-view images. DLPL comprises three main modules: Perspective Discrete Decomposition (PDD), Perspective Homography Transformation (PHT), and Perspective Invariant Attention (PIA), which work together to discretize visual features, transform perspectives, and fuse multi-perspective semantic information, respectively. DLPL is a universal perspective learning framework applicable to a variety of scenarios and vision tasks. Extensive experiments demonstrate that DLPL significantly enhances the network's capacity to depict images across diverse scenarios (daily photos, UAV, auto-driving) and tasks (detection, segmentation).
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper6
- Hybrid Mamba for Few-Shot SegmentationQianxiong Xu, Xuanyi Liu, Lanyun Zhu, Guosheng Lin 等NeurIPS 2024 · 被引用 49 次
- Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal RetrievalLanyun Zhu, Deyi Ji, Tianrun Chen, Haiyang Wu 等NeurIPS 2025 · 被引用 12 次
- Generating Negative Samples for Multi-Modal RecommendationYanbiao Ji, Dan Luo, Chang Liu, Shaokai Wu 等ACM MM 2025 · 被引用 2 次
- FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component AnalysisJiangtong Tan, Hu Yu, Jie Huang, Jie Xiao 等CVPR 2025
- SkySense-O: Towards Open-World Remote Sensing Interpretation with Vision-Centric Visual-Language ModelingQi Zhu, Jiangwei Lao, Deyi Ji, Junwei Luo 等CVPR 2025
它引用的顶会 Paper16
- Segment AnythingAlexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao 等ICCV 2023 · 被引用 13,211 次
- SegFormer: Simple and Efficient Design for Semantic Segmentation with TransformersEnze Xie, Wenhai Wang, Zhiding Yu, Anima Anandkumar 等NeurIPS 2021 · 被引用 9,661 次
- Unsupervised Learning of Visual Features by Contrasting Cluster AssignmentsMathilde Caron, Ishan Misra, Julien Mairal, Priya Goyal 等NeurIPS 2020 · 被引用 5,249 次
- CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image ClassificationChun-Fu (Richard) Chen, Quanfu Fan, Rameswar PandaICCV 2021 · 被引用 2,072 次
- MetaFormer is Actually What You Need for VisionWeihao Yu, Mi Luo, Pan Zhou, Chenyang Si 等CVPR 2022 · 被引用 1,114 次
相关 Paper
- UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware PreservationXingyuan Li, Songcheng Du, Yang Zou, Haoyuan Xu 等CVPR 2026 · 被引用 6 次
- UniMLVG: Unified Framework for Multi-View Long Video Generation with Comprehensive Control Capabilities for Autonomous DrivingRui Chen, Zehuan Wu, Yichen Liu, Yuxin Guo 等ICCV 2025 · 被引用 2 次
- Generalizable Multi-Camera 3D Object Detection from a Single Source via Fourier Cross-View LearningXue Zhao, Qinying Gu, Xinbing Wang, Chenghu Zhou 等ICML 2025
- VISTA: Boosting 3D Object Detection via Dual Cross-VIew SpaTial AttentionShengheng Deng, Zhihao Liang, Lin Sun, Kui JiaCVPR 2022 · 被引用 92 次
- UniDrive: Towards Universal Driving Perception Across Camera ConfigurationsYe Li, Wenzhao Zheng, Xiaonan Huang, Kurt KeutzerICLR 2025
