Cosmo: contrastive fusion learning with small data for multimodal human activity recognition
Xiaomin Ouyang, Xian Shuai, Jiayu Zhou, Ivy Wang Shi, Zhiyuan Xie, Guoliang Xing, Jianwei Huang
摘要
Human activity recognition (HAR) is a key enabling technology for a wide range of emerging applications. Although multimodal sensing systems are essential for capturing complex and dynamic human activities in real-world settings, they bring several new challenges including limited labeled multimodal data. In this paper, we propose Cosmo, a new system for contrastive fusion learning with small data in multimodal HAR applications. Cosmo features a novel two-stage training strategy that leverages both unlabeled data on the cloud and limited labeled data on the edge. By integrating novel fusion-based contrastive learning and quality-guided attention mechanisms, Cosmo can effectively extract both consistent and complementary information across different modalities for efficient fusion. Our evaluation on a cloud-edge testbed using two public datasets and a new multimodal HAR dataset shows that Cosmo delivers significant improvement over state-of-the-art baselines in both recognition accuracy and convergence delay.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper12
- Practically Adopting Human Activity RecognitionHuatao Xu, Pengfei Zhou, Rui Tan, Mo LiMobiCom 2023 · 被引用 53 次
- ADMarker: A Multi-Modal Federated Learning System for Monitoring Digital Biomarkers of Alzheimer's DiseaseXiaomin Ouyang, Xian Shuai, Yang Li, Li Pan 等MobiCom 2024 · 被引用 41 次
- FreqMAE: Frequency-Aware Masked Autoencoder for Multi-Modal IoT SensingDenizhan Kara, Tomoyoshi Kimura, Shengzhong Liu, Jinyang Li 等WWW 2024 · 被引用 27 次
- ContrastSense: Domain-invariant Contrastive Learning for In-the-Wild Wearable SensingGaole Dai, Huatao Xu, Hyungjun Yoon, Mo Li 等UbiComp 2025 · 被引用 11 次
- Learning Disentangled Representation for Multi-Modal Time-Series Sensing SignalsRuichu Cai, Zhifan Jiang, Kaitao Zheng, Zijian Li 等WWW 2025 · 被引用 8 次
它引用的顶会 Paper12
- What Makes for Good Views for Contrastive Learning?Yonglong Tian, Chen Sun, Ben Poole, Dilip Krishnan 等NeurIPS 2020 · 被引用 1,631 次
- Self-Supervised Learning by Cross-Modal Audio-Video ClusteringHumam Alwassel, Dhruv Mahajan, Bruno Korbar, Lorenzo Torresani 等NeurIPS 2020 · 被引用 483 次
- Contrastive Predictive Coding for Human Activity RecognitionHarish Haresamudram, Irfan A. Essa, Thomas PlötzUbiComp 2021 · 被引用 149 次
- SelfHAR: Improving Human Activity Recognition through Self-training with Unlabeled DataChi Ian Tang, Ignacio Perez-Pozuelo, Dimitris Spathis, Søren Brage 等UbiComp 2021 · 被引用 130 次
- Multimodal Clustering Networks for Self-supervised Learning from Unlabeled VideosBrian Chen, Andrew Rouditchenko, Kevin Duarte, Hilde Kuehne 等ICCV 2021 · 被引用 98 次
相关 Paper
- TS2ACT: Few-Shot Human Activity Sensing with Cross-Modal Co-LearningKang Xia, Wenzhong Li, Shiwei Gan, Sanglu LuUbiComp 2024 · 被引用 18 次
- Adapting Pretrained Large Vision Models for Sensor-based Activity RecognitionYize Cai, Rui Feng, Kunlin Cai, Yunhuai Liu 等UbiComp 2026
- Generalizable Low-Resource Activity Recognition with Diverse and Discriminative Representation LearningXin Qin, Jindong Wang, Shuo Ma, Wang Lu 等KDD 2023 · 被引用 20 次
- MMTSA: Multi-Modal Temporal Segment Attention Network for Efficient Human Activity RecognitionZiqi Gao, Yuntao Wang, Jianguo Chen, Junliang Xing 等UbiComp 2023 · 被引用 22 次
- MultiHGR: Multi-Task Hand Gesture Recognition with Cross-Modal Wrist-Worn DevicesMengxia Lyu, Hao Zhou, Kaiwen Guo, Wangqiu Zhou 等INFOCOM 2024 · 被引用 4 次
