Can Natural Image Autoencoders Compactly Tokenize fMRI Volumes for Long-Range Dynamics Modeling?
Peter Yongho Kim, Juhyeon Park, Jungwoo Park, Jubin Choi, Jungwoo Seo, Jiook Cha, Taesup Moon
摘要
Modeling long-range spatiotemporal dynamics in functional Magnetic Resonance Imaging (fMRI) remains a key challenge due to the high dimensionality of the four-dimensional signals. Prior voxel-based models, although demonstrating excellent performance and interpretation capabilities, are constrained by prohibitive memory demands and thus can only capture limited temporal windows. To address this, we propose TABLeT (Two-dimensionally Autoencoded Brain Latent Transformer), a novel approach that tokenizes fMRI volumes using a pre-trained 2D natural image autoencoder. Each 3D fMRI volume is compressed into a compact set of continuous tokens, enabling long-sequence modeling with a simple Transformer encoder with limited VRAM. Across large-scale benchmarks including the UK-Biobank (UKB), Human Connectome Project (HCP), and ADHD-200 datasets, TABLeT outperforms existing models in multiple tasks, while demonstrating substantial gains in computational and memory efficiency over the state-of-the-art voxel-based method given the same input. Furthermore, we develop a self-supervised masked token modeling approach to pre-train TABLeT, which improves the model's performance for various downstream tasks. Our findings suggest a promising approach for scalable and interpretable spatiotemporal modeling of brain activity. Our code is available at https://github.com/beotborry/TABLeT.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper8
- VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-TrainingZhan Tong, Yibing Song, Jue Wang, Limin WangNeurIPS 2022 · 被引用 2,336 次
- SimMIM: a Simple Framework for Masked Image ModelingZhenda Xie, Zheng Zhang, Yue Cao, Yutong Lin 等CVPR 2022 · 被引用 1,129 次
- Brain Network TransformerXuan Kan, Wei Dai, Hejie Cui, Zilong Zhang 等NeurIPS 2022 · 被引用 272 次
- BrainLM: A foundation model for brain activity recordingsJosue Ortega Caro, Antonio Henrique de Oliveira Fonseca, Syed Asad Rizvi, Matteo Rosati 等ICLR 2024 · 被引用 109 次
- Brain-JEPA: Brain Dynamics Foundation Model with Gradient Positioning and Spatiotemporal MaskingZijian Dong, Ruilin Li, Yilei Wu, Thuan Tinh Nguyen 等NeurIPS 2024 · 被引用 96 次
相关 Paper
- SwiFT: Swin 4D fMRI TransformerPeter Yongho Kim, Junbeom Kwon, Sunghwan Joo, Sangyoon Bae 等NeurIPS 2023 · 被引用 68 次
- Scaling Vision Transformers for Functional MRI with Flat MapsConnor Lane, Mihir Tripathy, Leema K Murali, Ratna Grandhi 等ICML 2026 · 被引用 3 次
- MnemoDyn: Learning Resting State Dynamics from K FMRI sequencesSourav Pal, Viet Luong, Hoseok Lee, Tingting Dan 等ICLR 2026
- Brain Harmony: A Multimodal Foundation Model Unifying Morphology and Function into 1D TokensZijian Dong, Ruilin Li, Joanna Su Xian Chong, Niousha Dehestani 等NeurIPS 2025 · 被引用 24 次
- Beyond Grid-Locked Voxels: Neural Response Functions for Continuous Brain EncodingHaomiao Chen, Keith W Jamison, Mert R. Sabuncu, Amy KuceyeskiICLR 2026 · 被引用 1 次
