FreqMAE: Frequency-Aware Masked Autoencoder for Multi-Modal IoT Sensing
Denizhan Kara, Tomoyoshi Kimura, Shengzhong Liu, Jinyang Li, Dongxin Liu, Tianshi Wang, Ruijie Wang, Yizhuo Chen, Yigong Hu, Tarek F. Abdelzaher
Abstract
This paper presents FreqMAE, a novel self-supervised learning framework that synergizes masked autoencoding (MAE) with physicsinformed insights to capture feature patterns in multi-modal IoT sensor data. FreqMAE enhances latent space representation of sensor data, reducing reliance on data labeling and improving accuracy for AI tasks. Differing from data augmentation-based methods like contrastive learning, FreqMAE's approach eliminates the need for handcrafted transformations. Adapting MAE for IoT sensing signals, we present three contributions from frequency domain insights: First, a Temporal-Shifting Transformer (TS-T) encoder that enables temporal interactions while distinguishing different frequency bands; Second, a factorized multi-modal fusion mechanism for leveraging cross-modal correlations and preserving unique modality features; Third, a hierarchically weighted loss function that emphasizes important frequency components and high Signalto-Noise Ratio (SNR) samples. Comprehensive evaluations on two sensing applications validate FreqMAE's proficiency in reducing labeling needs and enhancing resilience against domain shifts. CCS CONCEPTS • Computing methodologies → Artificial intelligence.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext e91ac5f2-ef94-4702-9428-ae751197d401Cited by top-tier papers4
- Fine-grained Control of Generative Data Augmentation in IoT SensingTianshi Wang, Qikai Yang, Ruijie Wang, Dachun Sun et al.NeurIPS 2024 · 13 citations
- Learning Disentangled Representation for Multi-Modal Time-Series Sensing SignalsRuichu Cai, Zhifan Jiang, Kaitao Zheng, Zijian Li et al.WWW 2025 · 8 citations
- AdaTS: Learning Adaptive Time Series Representations via Dynamic Soft ContrastsDenizhan Kara, Tomoyoshi Kimura, Jinyang Li, Bowen He et al.NeurIPS 2025 · 3 citations
- InfoMAE: Pair-Efficient Cross-Modal Alignment for Multimodal Time-Series Sensing SignalsTomoyoshi Kimura, Xinlin Li, Osama A. Hanna, Yatong Chen et al.WWW 2025 · 3 citations
Builds on16
- Swin Transformer: Hierarchical Vision Transformer using Shifted WindowsZe Liu, Yutong Lin, Yue Cao, Han Hu et al.ICCV 2021 · 31,683 citations
- A Simple Framework for Contrastive Learning of Visual RepresentationsTing Chen, Simon Kornblith, Mohammad Norouzi, Geoffrey E. HintonICML 2020 · 24,064 citations
- Bootstrap Your Own Latent - A New Approach to Self-Supervised LearningJean-Bastien Grill, Florian Strub, Florent Altché, Corentin Tallec et al.NeurIPS 2020 · 9,171 citations
- BEiT: BERT Pre-Training of Image TransformersHangbo Bao, Li Dong, Songhao Piao, Furu WeiICLR 2022 · 3,632 citations
- SimMIM: a Simple Framework for Masked Image ModelingZhenda Xie, Zheng Zhang, Yue Cao, Yutong Lin et al.CVPR 2022 · 1,129 citations
Related papers
- Temporal-Frequency Masked Autoencoders for Time Series Anomaly DetectionYuchen Fang, Jiandong Xie, Yan Zhao, Lu Chen et al.ICDE 2024 · 45 citations
- Modality-Agnostic Self-Supervised Learning with Meta-Learned Masked Auto-EncoderHuiwon Jang, Jihoon Tack, Daewon Choi, Jongheon Jeong et al.NeurIPS 2023 · 9 citations
- TS-MTM: Temporal-Spectral Masked Time-Series Modeling for ForecastingPengcheng Zhang, Xiaocao Ouyang, Xin Li, Fan Yang et al.KDD 2026
- FAT: Frequency-Aware Pretraining for Enhanced Time-Series Representation LearningRui Cheng, Xiangfei Jia, Qing Li, Rong Xing et al.KDD 2025 · 2 citations
- OpenMAE: Efficient Masked Autoencoder for Vibration Sensing with Open-domain Data EnrichmentChenzhi Hu, Yatong Chen, Denizhan Kara, Shengzhong Liu et al.UbiComp 2025 · 4 citations
