Detection Hub: Unifying Object Detection Datasets via Query Adaptation on Language Embedding
Lingchen Meng, Xiyang Dai, Yinpeng Chen, Pengchuan Zhang, Dongdong Chen, Mengchen Liu, Jianfeng Wang, Zuxuan Wu, Lu Yuan, Yu-Gang Jiang
摘要
Combining multiple datasets enables performance boost on many computer vision tasks. But similar trend has not been witnessed in object detection when combining multiple datasets due to two inconsistencies among detection datasets: taxonomy difference and domain gap. In this paper, we address these challenges by a new design (named Detection Hub) that is dataset-aware and category-aligned. It not only mitigates the dataset inconsistency but also provides coherent guidance for the detector to learn across multiple datasets. In particular, the dataset-aware design is achieved by learning a dataset embedding that is used to adapt object queries as well as convolutional kernels in detection heads. The categories across datasets are semantically aligned into a unified space by replacing one-hot category representations with word embedding and leveraging the semantic coherence of language embedding. Detection Hub fulfills the benefits of large data on object detection. Experiments demonstrate that joint training on multiple datasets achieves significant performance gains over training on each dataset alone. Detection Hub further achieves SoTA performance on UODB benchmark with wide variety of datasets.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper14
- X-Paste: Revisiting Scalable Copy-Paste for Instance Segmentation using CLIP and StableDiffusionHanqing Zhao, Dianmo Sheng, Jianmin Bao, Dongdong Chen 等ICML 2023 · 被引用 67 次
- Multi-Prompt Alignment for Multi-Source Unsupervised Domain AdaptationHaoran Chen, Xintong Han, Zuxuan Wu, Yu-Gang JiangNeurIPS 2023 · 被引用 55 次
- DaTaSeg: Taming a Universal Multi-Dataset Multi-Task Segmentation ModelXiuye Gu, Yin Cui, Jonathan Huang, Abdullah Rashwan 等NeurIPS 2023 · 被引用 40 次
- Learning from Rich Semantics and Coarse Locations for Long-tailed Object DetectionLingchen Meng, Xiyang Dai, Jianwei Yang, Dongdong Chen 等NeurIPS 2023 · 被引用 23 次
- One for All: Multi-Domain Joint Training for Point Cloud Based 3D Object DetectionZhenyu Wang, Yali Li, Hengshuang Zhao, Shengjin WangNeurIPS 2024 · 被引用 13 次
它引用的顶会 Paper22
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Swin Transformer: Hierarchical Vision Transformer using Shifted WindowsZe Liu, Yutong Lin, Yue Cao, Han Hu 等ICCV 2021 · 被引用 31,683 次
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn 等ICLR 2021 · 被引用 21,477 次
- Deformable DETR: Deformable Transformers for End-to-End Object DetectionXizhou Zhu, Weijie Su, Lewei Lu, Bin Li 等ICLR 2021 · 被引用 7,353 次
- FCOS: Fully Convolutional One-Stage Object DetectionZhi Tian, Chunhua Shen, Hao Chen, Tong HeICCV 2019 · 被引用 6,042 次
相关 Paper
- Simple Multi-dataset DetectionXingyi Zhou, Vladlen Koltun, Philipp KrähenbühlCVPR 2022 · 被引用 85 次
- Uni2Det: Unified and Universal Framework for Prompt-Guided Multi-dataset 3D DetectionYubin Wang, Zhikang Zou, Xiaoqing Ye, Xiao Tan 等ICLR 2025
- LMSeg: Language-guided Multi-dataset SegmentationQiang Zhou, Yuang Liu, Chaohui Yu, Jingliang Li 等ICLR 2023 · 被引用 2 次
- CSDA: Learning Category-Scale Joint Feature for Domain Adaptive Object DetectionChanglong Gao, Chengxu Liu, Yujie Dun, Xueming QianICCV 2023 · 被引用 25 次
- Mind the Gap: Transferring Labels to Align Object Detection DatasetsMikhail Kennerley, Angelica I Aviles-Rivero, Carola-Bibiane Schönlieb, Robby T. TanCVPR 2026
