Learning Spatial-Aware Manipulation Ordering
Yuxiang Yan, Zhiyuan Zhou, Xin Gao, Guanghao Li, Shenglin Li, Jiaqi Chen, Qunyan Pu, Jian Pu
摘要
Manipulation in cluttered environments is challenging due to spatial dependencies among objects, where an improper manipulation order can cause collisions or blocked access. Existing approaches often overlook these spatial relationships, limiting their flexibility and scalability. To address these limitations, we propose OrderMind, a unified spatial-aware manipulation ordering framework that directly learns object manipulation priorities based on spatial context. Our architecture integrates a spatial context encoder with a temporal priority structuring module. We construct a spatial graph using k-Nearest Neighbors to aggregate geometric information from the local layout and encode both object-object and object-manipulator interactions to support accurate manipulation ordering in real-time. To generate physically and semantically plausible supervision signals, we introduce a spatial prior labeling method that guides a vision-language model to produce reasonable manipulation orders for distillation. We evaluate OrderMind on our Manipulation Ordering Benchmark, comprising 163,222 samples of varying difficulty. Extensive experiments in both simulation and real-world environments demonstrate that our method significantly outperforms prior approaches in effectiveness and efficiency, enabling robust manipulation in cluttered scenes.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper6
- CausalVAD: De-confounding End-to-End Autonomous Driving via Causal InterventionJiacheng Tang, Zhiyuan Zhou, Zhuolin He, Jia Zhang 等CVPR 2026 · 被引用 8 次
- GIFT: Global Irreplaceability Frame Targeting for Efficient Video UnderstandingJunpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao 等CVPR 2026 · 被引用 7 次
- DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous DrivingZhuolin He, Jing Li, Guanghao Li, Xiaolei Chen 等CVPR 2026 · 被引用 5 次
- MacTok: Robust Continuous Tokenization for Image GenerationHengyu Zeng, Xin Gao, Guanghao Li, Yuxiang Yan 等CVPR 2026 · 被引用 2 次
- Decoupling Scene Perception and Ego Status: A Multi-Context Fusion Approach for Enhanced Generalization in End-to-End Autonomous DrivingJiacheng Tang, Mingyue Feng, Jiachao Liu, Yaonong Wang 等AAAI 2026 · 被引用 2 次
它引用的顶会 Paper7
- Segment AnythingAlexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao 等ICCV 2023 · 被引用 13,211 次
- PaLM-E: An Embodied Multimodal Language ModelDanny Driess, Fei Xia, Mehdi S. M. Sajjadi, Corey Lynch 等ICML 2023 · 被引用 2,601 次
- UniDet3D: Multi-dataset Indoor 3D Object DetectionMaksim Kolodiazhnyi, Anna Vorontsova, Matvey Skripkin, Danila Rukhovich 等AAAI 2025 · 被引用 7 次
- Dark-ISP: Enhancing RAW Image Processing for Low-Light Object DetectionJiasheng Guo, Xin Gao, Yuxiang Yan, Guanghao Li 等ICCV 2025 · 被引用 5 次
- ManipulaTHOR: A Framework for Visual Object ManipulationKiana Ehsani, Winson Han, Alvaro Herrasti, Eli VanderBilt 等CVPR 2021
相关 Paper
- RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for RoboticsChan Hee Song, Valts Blukis, Jonathan Tremblay, Stephen Tyree 等CVPR 2025
- HumanVLA: Towards Vision-Language Directed Object Rearrangement by Physical HumanoidXinyu Xu, Yizheng Zhang, Yonglu Li, Lei Han 等NeurIPS 2024 · 被引用 29 次
- PASG: A Closed-Loop Framework for Automated Geometric Primitive Extraction and Semantic Anchoring in Robotic ManipulationZhihao Zhu, Yifan Zheng, Siyu Pan, Yaohui Jin 等ICCV 2025
- VLP: Vision-Language Preference Learning for Embodied ManipulationRunze Liu, Chenjia Bai, Jiafei Lyu, Shengjie Sun 等EMNLP 2025 · 被引用 1 次
- Spatial Understanding from Videos: Structured Prompts Meet Simulation DataHaoyu Zhang, Meng Liu, Zaijing Li, Haokun Wen 等NeurIPS 2025 · 被引用 31 次
