Neurons: Emulating the Human Visual Cortex Improves Fidelity and Interpretability in fMRI-to-Video Reconstruction
Haonan Wang, Qixiang Zhang, Lehan Wang, Xuanqi Huang, Xiaomeng Li
摘要
Decoding visual stimuli from neural activity is essential for understanding the human brain. While fMRI methods have successfully reconstructed static images, fMRI-to-video reconstruction faces challenges due to the need for capturing spatiotemporal dynamics like motion and scene transitions. Recent approaches have improved semantic and perceptual alignment but struggle to integrate coarse fMRI data with detailed visual features. Inspired by the hierarchical organization of the visual system, we propose NEURONS, a novel framework that decouples learning into four correlated sub-tasks: key object segmentation, concept recognition, scene description, and blurry video reconstruction. This approach simulates the visual cortex's functional specialization, allowing the model to capture diverse video content. In the inference stage, NEURONS generates robust conditioning signals for a pre-trained text-to-video diffusion model to reconstruct the videos. Extensive experiments demonstrate that NEURONS outperforms state-of-the-art baselines, achieving solid improvements in video consistency (26.6%) and semantic-level accuracy (19.1%). Notably, NEURONS shows a strong functional correlation with the visual cortex, highlighting its potential for brain-computer interfaces and clinical applications. Code and model weights are available at: https://github.com/xmed-lab/NEURONS.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper8
- ZEBRA: Towards Zero-Shot Cross-Subject Generalization for Universal Brain Visual DecodingHaonan Wang, Jingyu Lu, Hongrui Li, Xiaomeng LiNeurIPS 2025 · 被引用 8 次
- A Cognitive Process-Inspired Architecture for Subject-Agnostic Brain Visual DecodingJingyu Lu, Haonan Wang, Qixiang Zhang, Xiaomeng LiICLR 2026 · 被引用 3 次
- More Natural, More Real: Object-aware Gaussian Splatting for 3D Visual Decoding from Human BrainHaodong Jing, Dongyao Jiang, Jixin Wang, Junhao Jia 等CVPR 2026
- CineBrain: A Large-Scale Multi-Modal Audiovisual Brain Dataset for Brain-Conditioned Video GenerationJianxiong Gao, Yichang Liu, Baofeng Yang, Jianfeng Feng 等CVPR 2026
- Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video ReconstructionYujie Wei, Chenglong Ma, Jianxiong Gao, Chenhui Wang 等CVPR 2026
它引用的顶会 Paper15
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Directly Denoising Diffusion ModelsDan Zhang, Jingjing Wang, Feng LuoICML 2024 · 被引用 11,724 次
- VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-TrainingZhan Tong, Yibing Song, Jue Wang, Limin WangNeurIPS 2022 · 被引用 2,336 次
相关 Paper
- NeuroClips: Towards High-fidelity and Smooth fMRI-to-Video ReconstructionZixuan Gong, Guangyin Bao, Qi Zhang, Zhongwei Wan 等NeurIPS 2024 · 被引用 39 次
- SemVideo: Reconstructs What You Watch from Brain Activity via Hierarchical Semantic GuidanceMinghan Yang, LAN YANG, Ke Li, Honggang Zhang 等CVPR 2026
- NeuralFlix: A Simple While Effective Framework for Semantic Decoding of Videos from Non-invasive Brain RecordingsJingyuan Sun, Mingxiao Li, Marie-Francine MoensAAAI 2025 · 被引用 9 次
- NEED: Cross-Subject and Cross-Task Generalization for Video and Image Reconstruction from EEG SignalsShuai Huang, Huan Luo, Haodong Jing, Qixian Zhang 等NeurIPS 2025 · 被引用 17 次
- Cinematic Mindscapes: High-quality Video Reconstruction from Brain ActivityZijiao Chen, Jiaxin Qing, Juan Helen ZhouNeurIPS 2023 · 被引用 109 次
