TouchFormer: A Robust Transformer-based Framework for Multimodal Material Perception
Kailin Lyu, Long Xiao, Jianing Zeng, Junhao Dong, Xuexin Liu, Zhuojun Zou, Haoyue Yang, Lin Shu, Jie Hao
摘要
Traditional vision-based material perception methods often experience substantial performance degradation under visually impaired conditions, thereby motivating the shift toward non-visual multimodal material perception. Despite this, existing approaches frequently perform naive fusion of multimodal inputs, overlooking key challenges such as modality-specific noise, missing modalities common in real-world scenarios, and the dynamically varying importance of each modality depending on the task. These limitations lead to suboptimal performance across several benchmark tasks. In this paper, we propose a robust multimodal fusion framework, TouchFormer. Specifically, we employ a Modality-Adaptive Gating (MAG) mechanism and intra- and inter-modality attention mechanisms to adaptively integrate cross-modal features, enhancing model robustness. Additionally, we introduce a Cross-Instance Embedding Regularization(CER) strategy, which significantly improves classification accuracy in fine-grained subcategory material recognition tasks. Experimental results demonstrate that, compared to existing non-visual methods, the proposed TouchFormer framework achieves classification accuracy improvements of 2.48% and 6.83% on SSMC and USMC tasks, respectively. Furthermore, real-world robotic experiments validate TouchFormer's effectiveness in enabling robots to better perceive and interpret their environment, paving the way for its deployment in safety-critical applications such as emergency response and industrial automation.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper6
- Learning Audio-Visual Speech Representation by Masked Multimodal Cluster PredictionBowen Shi, Wei-Ning Hsu, Kushal Lakhotia, Abdelrahman MohamedICLR 2022 · 被引用 460 次
- Product1M: Towards Weakly Supervised Instance-Level Product Retrieval via Cross-Modal PretrainingXunlin Zhan, Yangxin Wu, Xiao Dong, Yunchao Wei 等ICCV 2021 · 被引用 84 次
- Fused Acoustic and Text Encoding for Multimodal Bilingual Pretraining and Speech TranslationRenjie Zheng, Jun-Kun Chen, Mingbo Ma, Liang HuangICML 2021 · 被引用 74 次
- ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot PerceiverWenxuan Song, Ziyang Zhou, Han Zhao, Jiayi Chen 等AAAI 2026 · 被引用 36 次
- Improving Adversarially Robust Few-shot Image Classification with Generalizable RepresentationsJunhao Dong, Yuan Wang, Jianhuang Lai, Xiaohua XieCVPR 2022 · 被引用 30 次
相关 Paper
- RobustVisH: Robust Visual-Haptic Cross-Modal Recognition under Transmission InterferenceRouqi Zhang, Chengdi Lu, Hancheng Lu, Yang Cao 等ACM MM 2025 · 被引用 2 次
- SGFormer: Semantic-Geometry Fusion Transformer for Multi-modal 3D Panoptic SegmentationHongqi Yu, Sixian Chan, Xiaolong Zhou, Xiaoqin ZhangAAAI 2025 · 被引用 3 次
- Multi-modal Gait Recognition via Effective Spatial-Temporal Feature FusionYufeng Cui, Yimei KangCVPR 2023
- Visual Tactile Fusion Object ClusteringTao Zhang, Yang Cong, Gan Sun, Qianqian Wang 等AAAI 2020 · 被引用 22 次
- DQ-Former: Querying Transformer with Dynamic Modality Priority for Cognitive-aligned Multimodal Emotion Recognition in ConversationJing Ye, Xinpei ZhaoACM MM 2024 · 被引用 10 次
