Neurons: Emulating the Human Visual Cortex Improves Fidelity and Interpretability in fMRI-to-Video Reconstruction
Haonan Wang, Qixiang Zhang, Lehan Wang, Xuanqi Huang, Xiaomeng Li
Abstract
Decoding visual stimuli from neural activity is essential for understanding the human brain. While fMRI methods have successfully reconstructed static images, fMRI-to-video reconstruction faces challenges due to the need for capturing spatiotemporal dynamics like motion and scene transitions. Recent approaches have improved semantic and perceptual alignment but struggle to integrate coarse fMRI data with detailed visual features. Inspired by the hierarchical organization of the visual system, we propose NEURONS, a novel framework that decouples learning into four correlated sub-tasks: key object segmentation, concept recognition, scene description, and blurry video reconstruction. This approach simulates the visual cortex's functional specialization, allowing the model to capture diverse video content. In the inference stage, NEURONS generates robust conditioning signals for a pre-trained text-to-video diffusion model to reconstruct the videos. Extensive experiments demonstrate that NEURONS outperforms state-of-the-art baselines, achieving solid improvements in video consistency (26.6%) and semantic-level accuracy (19.1%). Notably, NEURONS shows a strong functional correlation with the visual cortex, highlighting its potential for brain-computer interfaces and clinical applications. Code and model weights are available at: https://github.com/xmed-lab/NEURONS.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext c6a166f4-bc36-499f-82e4-ad490a4cb04aCited by top-tier papers8
- ZEBRA: Towards Zero-Shot Cross-Subject Generalization for Universal Brain Visual DecodingHaonan Wang, Jingyu Lu, Hongrui Li, Xiaomeng LiNeurIPS 2025 · 8 citations
- A Cognitive Process-Inspired Architecture for Subject-Agnostic Brain Visual DecodingJingyu Lu, Haonan Wang, Qixiang Zhang, Xiaomeng LiICLR 2026 · 3 citations
- More Natural, More Real: Object-aware Gaussian Splatting for 3D Visual Decoding from Human BrainHaodong Jing, Dongyao Jiang, Jixin Wang, Junhao Jia et al.CVPR 2026
- CineBrain: A Large-Scale Multi-Modal Audiovisual Brain Dataset for Brain-Conditioned Video GenerationJianxiong Gao, Yichang Liu, Baofeng Yang, Jianfeng Feng et al.CVPR 2026
- Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video ReconstructionYujie Wei, Chenglong Ma, Jianxiong Gao, Chenhui Wang et al.CVPR 2026
Builds on15
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 35,902 citations
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser et al.CVPR 2022 · 13,123 citations
- Directly Denoising Diffusion ModelsDan Zhang, Jingjing Wang, Feng LuoICML 2024 · 11,724 citations
- VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-TrainingZhan Tong, Yibing Song, Jue Wang, Limin WangNeurIPS 2022 · 2,336 citations
Related papers
- NeuroClips: Towards High-fidelity and Smooth fMRI-to-Video ReconstructionZixuan Gong, Guangyin Bao, Qi Zhang, Zhongwei Wan et al.NeurIPS 2024 · 39 citations
- SemVideo: Reconstructs What You Watch from Brain Activity via Hierarchical Semantic GuidanceMinghan Yang, LAN YANG, Ke Li, Honggang Zhang et al.CVPR 2026
- NeuralFlix: A Simple While Effective Framework for Semantic Decoding of Videos from Non-invasive Brain RecordingsJingyuan Sun, Mingxiao Li, Marie-Francine MoensAAAI 2025 · 9 citations
- NEED: Cross-Subject and Cross-Task Generalization for Video and Image Reconstruction from EEG SignalsShuai Huang, Huan Luo, Haodong Jing, Qixian Zhang et al.NeurIPS 2025 · 17 citations
- Cinematic Mindscapes: High-quality Video Reconstruction from Brain ActivityZijiao Chen, Jiaxin Qing, Juan Helen ZhouNeurIPS 2023 · 109 citations
