Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
Yunze Man, De-An Huang, Guilin Liu, Shiwei Sheng, Shilong Liu, Liang-Yan Gui, Jan Kautz, Yu-Xiong Wang, Zhiding Yu
2025年份
21顶会引用
摘要
Room is filled with stuffed animal toys. closest silver SUV. man carrying bag of bottles. <box_1> <box_2> Liquid color in the glass on the table? <box> → ctx-token:color is green Figure 1. Visual question answering, grounding, and chain-of-thought reasoning with Argus. "ctx-token" is short for context token.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper21
- Latent Visual ReasoningBangzheng Li, Ximeng Sun, Jiang Liu, Ze Wang 等ICLR 2026 · 被引用 80 次
- ACTIVE-o3 : Empowering MLLMs with Active Perception via Pure Reinforcement LearningMuzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du 等ICML 2026 · 被引用 35 次
- RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement LearningSicheng Feng, Kaiwen Tuo, Song Wang, Lingdong Kong 等ICLR 2026 · 被引用 28 次
- Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent PlanningChi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen 等CVPR 2026 · 被引用 24 次
- Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language ModelsJiaqi Liu, Lang Sun, Ronghao Fu, Bo YangICLR 2026 · 被引用 22 次
它引用的顶会 Paper34
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Chain-of-Thought Prompting Elicits Reasoning in Large Language ModelsJason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma 等NeurIPS 2022 · 被引用 22,562 次
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn 等ICLR 2021 · 被引用 21,477 次
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 被引用 11,349 次
- Large Language Models are Zero-Shot ReasonersTakeshi Kojima, Shixiang Shane Gu, Machel Reid, Yutaka Matsuo 等NeurIPS 2022 · 被引用 8,168 次
相关 Paper
- Action-Sketcher: From Reasoning to Action via Visual Sketches for Robotic ManipulationHuajie Tan, Peterson Co, Yijie Xu, Shanyu Rong 等CVPR 2026
- V*: Guided Visual Search as a Core Mechanism in Multimodal LLMsPenghao Wu, Saining XieCVPR 2024 · 被引用 32 次
- MARVEL-40M+: Multi-Level Visual Elaboration for High-Fidelity Text-to-3D Content CreationSankalp Sinha, Mohammad Sadil Khan, Muhammad Usama, Shino Sam 等CVPR 2025
- Vision‑Language‑Vision Auto‑Encoder: Scalable Knowledge Distillation from Diffusion ModelsTiezheng Zhang, Yitong Li, Yu-Cheng Chou, Jieneng Chen 等NeurIPS 2025 · 被引用 5 次
- VIRES: Video Instance Repainting via Sketch and Text Guided GenerationShuchen Weng, Haojie Zheng, Peixuan Zhang, Yuchen Hong 等CVPR 2025
