CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning
Ji Qi, Ming Ding, Weihan Wang, Yushi Bai, Qingsong Lv, Wenyi Hong, Bin Xu, Lei Hou, Juanzi Li, Yuxiao Dong, Jie Tang
2025年份
12顶会引用
摘要
In circle O with radius of 5.0, the length of chord AB is 8.0, then the distance from the O to AB is? CogCoM: Draw a straight line with LINE([[(54, 43 ), (13,70)]]) to obtain a new image after drawing.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper12
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual DrawingJunfei Wu, Jian Guan, Kaituo Feng, Qiang Liu 等NeurIPS 2025 · 被引用 153 次
- Thinking in 360deg: Humanoid Visual Search in the WildHeyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin 等CVPR 2026 · 被引用 16 次
- CoFFT: Chain of Foresight-Focus Thought for Visual Language ModelsXinyu Zhang, Yuxuan Dong, Lingling Zhang, Chengyou Jia 等NeurIPS 2025 · 被引用 7 次
- Vision-aligned Latent Reasoning for Multi-modal Large Language ModelByungwoo Jeon, Yoonwoo Jeong, Hyunseok Lee, Minsu Cho 等ICML 2026 · 被引用 7 次
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement LearningAlex Su, Haozhe Wang, Weiming Ren, Fangzhen Lin 等NeurIPS 2025 · 被引用 6 次
它引用的顶会 Paper21
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 被引用 11,349 次
- BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language ModelsJunnan Li, Dongxu Li, Silvio Savarese, Steven C. H. HoiICML 2023 · 被引用 7,873 次
- Flamingo: a Visual Language Model for Few-Shot LearningJean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech 等NeurIPS 2022 · 被引用 6,707 次
- Scaling Up Visual and Vision-Language Representation Learning With Noisy Text SupervisionChao Jia, Yinfei Yang, Ye Xia, Yi-Ting Chen 等ICML 2021 · 被引用 5,401 次
- InstructBLIP: Towards General-purpose Vision-Language Models with Instruction TuningWenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong 等NeurIPS 2023 · 被引用 4,013 次
相关 Paper
- GeoUni: A Unified Model for Generating Geometry Diagrams, Problems and Problem SolutionsJo-Ku Cheng, Zeren Zhang, Ran Chen, Jingyang Deng 等ACM MM 2025 · 被引用 2 次
- Do Large Language Models Truly Understand Geometric Structures?Xiaofeng Wang, Yiming Wang, Wenhong Zhu, Rui WangICLR 2025
- Static and Streaming Data Structures for Fréchet Distance QueriesArnold Filtser, Omrit FiltserSODA 2021 · 被引用 2 次
- EAR-Oracle: On Efficient Indexing for Distance Queries between Arbitrary Points on Terrain SurfaceBo Huang, Victor Junqiu Wei, Raymond Chi-Wing Wong, Bo TangSIGMOD 2023 · 被引用 4 次
- LCOT: Linear Circular Optimal TransportRocio Diaz Martin, Ivan Vladimir Medri, Yikun Bai, Xinran Liu 等ICLR 2024 · 被引用 1 次
