VideoSeg-R1: Reasoning Video Object Segmentation via Reinforcement Learning
Zishan Xu, Yifu Guo, Yuquan Lu, Fengyu Yang, Junxin Li, Lihua Cai
摘要
Traditional video reasoning segmentation methods rely on supervised fine-tuning, which limits generalization to out-ofdistribution scenarios and lacks explicit reasoning. To address this, we propose VideoSeg-R1, the first framework to introduce reinforcement learning into video reasoning segmentation. It adopts a decoupled architecture that formulates the task as joint referring image segmentation and video mask propagation. It comprises three stages: (1) A hierarchical text-guided frame sampler to emulate human attention; (2) A reasoning model that produces spatial cues along with explicit reasoning chains; and (3) A segmentationpropagation stage using SAM2 and XMem. A task difficultyaware mechanism adaptively controls reasoning length for better efficiency and accuracy. Extensive evaluations on multiple benchmarks demonstrate that VideoSeg-R1 achieves state-of-the-art performance in complex video reasoning and segmentation tasks. The code will be publicly available at https://github.com/euyis1019/VideoSeg-R1 . * Equal contribution.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper4
- GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited EnvironmentsEnjun Du, Xunkai Li, Tian Jin, Zhihan Zhang 等NeurIPS 2025 · 被引用 25 次
- Seg-ReSearch: Segmentation with Interleaved Reasoning and External SearchTianming Liang, Qirui Du, Jian-Fang Hu, Haichao Jiang 等ICML 2026 · 被引用 5 次
- Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise SupervisionGe Chang, Jinbo Su, Jiacheng Liu, Pengfei Yang 等ACL 2026 · 被引用 1 次
- VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object SegmentationMing Dai, Sen Yang, Boqiang Duan, Boyuan Tong 等ICML 2026
它引用的顶会 Paper26
- InstructBLIP: Towards General-purpose Vision-Language Models with Instruction TuningWenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong 等NeurIPS 2023 · 被引用 4,013 次
- Let's Verify Step by StepHunter Lightman, Vineet Kosaraju, Yuri Burda, Harrison Edwards 等ICLR 2024 · 被引用 3,045 次
- VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric TasksWenhai Wang, Zhe Chen, Xiaokang Chen, Jiannan Wu 等NeurIPS 2023 · 被引用 725 次
- Vision-Language Transformer and Query Generation for Referring SegmentationHenghui Ding, Chang Liu, Suchen Wang, Xudong JiangICCV 2021 · 被引用 359 次
- CRIS: CLIP-Driven Referring Image SegmentationZhaoqing Wang, Yu Lu, Qiang Li, Xunqiang Tao 等CVPR 2022 · 被引用 337 次
相关 Paper
- Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object MemoryZhengtong Zhu, Jiaqing Fan, Zhixuan Liu, Fanzhang LiAAAI 2026 · 被引用 1 次
- Reinforcing Video Reasoning Segmentation to Think Before It SegmentsSitong Gong, Yunzhi Zhuge, Lu Zhang, Jiazuo Yu 等CVPR 2026 · 被引用 16 次
- SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement LearningJiaqi Huang, Zunnan Xu, Jun Zhou, Ting Liu 等NeurIPS 2025 · 被引用 33 次
- VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal SegmentationJihwan Hong, Jaeyoung DoCVPR 2026 · 被引用 2 次
- Decomposed Attention Fusion in MLLMs for Training-free Video Reasoning SegmentationSu Ho Han, Jeongseok Hyun, Pilhyeon Lee, Minho Shim 等ICLR 2026 · 被引用 2 次
