Cosmo: contrastive fusion learning with small data for multimodal human activity recognition
Xiaomin Ouyang, Xian Shuai, Jiayu Zhou, Ivy Wang Shi, Zhiyuan Xie, Guoliang Xing, Jianwei Huang
Abstract
Human activity recognition (HAR) is a key enabling technology for a wide range of emerging applications. Although multimodal sensing systems are essential for capturing complex and dynamic human activities in real-world settings, they bring several new challenges including limited labeled multimodal data. In this paper, we propose Cosmo, a new system for contrastive fusion learning with small data in multimodal HAR applications. Cosmo features a novel two-stage training strategy that leverages both unlabeled data on the cloud and limited labeled data on the edge. By integrating novel fusion-based contrastive learning and quality-guided attention mechanisms, Cosmo can effectively extract both consistent and complementary information across different modalities for efficient fusion. Our evaluation on a cloud-edge testbed using two public datasets and a new multimodal HAR dataset shows that Cosmo delivers significant improvement over state-of-the-art baselines in both recognition accuracy and convergence delay.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext bc0dcfff-ff05-47e3-aeeb-94e8deeaa9b7Cited by top-tier papers12
- Practically Adopting Human Activity RecognitionHuatao Xu, Pengfei Zhou, Rui Tan, Mo LiMobiCom 2023 · 53 citations
- ADMarker: A Multi-Modal Federated Learning System for Monitoring Digital Biomarkers of Alzheimer's DiseaseXiaomin Ouyang, Xian Shuai, Yang Li, Li Pan et al.MobiCom 2024 · 41 citations
- FreqMAE: Frequency-Aware Masked Autoencoder for Multi-Modal IoT SensingDenizhan Kara, Tomoyoshi Kimura, Shengzhong Liu, Jinyang Li et al.WWW 2024 · 27 citations
- ContrastSense: Domain-invariant Contrastive Learning for In-the-Wild Wearable SensingGaole Dai, Huatao Xu, Hyungjun Yoon, Mo Li et al.UbiComp 2025 · 11 citations
- Learning Disentangled Representation for Multi-Modal Time-Series Sensing SignalsRuichu Cai, Zhifan Jiang, Kaitao Zheng, Zijian Li et al.WWW 2025 · 8 citations
Builds on12
- What Makes for Good Views for Contrastive Learning?Yonglong Tian, Chen Sun, Ben Poole, Dilip Krishnan et al.NeurIPS 2020 · 1,631 citations
- Self-Supervised Learning by Cross-Modal Audio-Video ClusteringHumam Alwassel, Dhruv Mahajan, Bruno Korbar, Lorenzo Torresani et al.NeurIPS 2020 · 483 citations
- Contrastive Predictive Coding for Human Activity RecognitionHarish Haresamudram, Irfan A. Essa, Thomas PlötzUbiComp 2021 · 149 citations
- SelfHAR: Improving Human Activity Recognition through Self-training with Unlabeled DataChi Ian Tang, Ignacio Perez-Pozuelo, Dimitris Spathis, Søren Brage et al.UbiComp 2021 · 130 citations
- Multimodal Clustering Networks for Self-supervised Learning from Unlabeled VideosBrian Chen, Andrew Rouditchenko, Kevin Duarte, Hilde Kuehne et al.ICCV 2021 · 98 citations
Related papers
- TS2ACT: Few-Shot Human Activity Sensing with Cross-Modal Co-LearningKang Xia, Wenzhong Li, Shiwei Gan, Sanglu LuUbiComp 2024 · 18 citations
- Adapting Pretrained Large Vision Models for Sensor-based Activity RecognitionYize Cai, Rui Feng, Kunlin Cai, Yunhuai Liu et al.UbiComp 2026
- Generalizable Low-Resource Activity Recognition with Diverse and Discriminative Representation LearningXin Qin, Jindong Wang, Shuo Ma, Wang Lu et al.KDD 2023 · 20 citations
- MMTSA: Multi-Modal Temporal Segment Attention Network for Efficient Human Activity RecognitionZiqi Gao, Yuntao Wang, Jianguo Chen, Junliang Xing et al.UbiComp 2023 · 22 citations
- MultiHGR: Multi-Task Hand Gesture Recognition with Cross-Modal Wrist-Worn DevicesMengxia Lyu, Hao Zhou, Kaiwen Guo, Wangqiu Zhou et al.INFOCOM 2024 · 4 citations
