WorldSimBench: Towards Video Generation Models as World Simulators
Yiran Qin, Zhelun Shi, Jiwen Yu, Xijun Wang, Enshen Zhou, Lijun Li, Zhenfei Yin, Xihui Liu, Lu Sheng, Jing Shao, Lei Bai, Ruimao Zhang
2025年份
6顶会引用
摘要
P re d ic ti o n : T e xt T e xt + O b se rv a ti o n T e xt + O b se rv a ti o n P re d ic ti o n : Im a g e T e xt + O b se rv a ti o n P re d ic ti o n : V id e o T e xt + O b se rv a ti o n P re d ic ti o n : A ct io n a b le V id e o
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper6
- AGFSync: Leveraging AI-Generated Feedback for Preference Optimization in Text-to-Image GenerationJingkun An, Yinghao Zhu, Zongjian Li, Enshen Zhou 等AAAI 2025 · 被引用 10 次
- MAD: Motion Appearance Decoupling for efficient Driving World ModelsAhmad Rahimi, Valentin Gerard, Eloi Zablocki, Matthieu Cord 等CVPR 2026 · 被引用 7 次
- Rethinking Visual Intelligence: Insights from Video PretrainingPablo Acuaviva, Aram Davtyan, Mariam Hassan, Sebastian Stapf 等ICML 2026 · 被引用 4 次
- Physics in 2-Steps: Locking Motion Priors Before Visual Refinement Erases ThemWoojung Han, Seil Kang, Youngjun Jun, Min-Hung Chen 等ICML 2026 · 被引用 2 次
- Ref4D-VideoBench: Four-Dimensional Reference-Based Evaluation of Text-to-Video Generative ModelsJiajia Wei, YuJia He, Yuhan Hou, Hang Qi 等CVPR 2026
它引用的顶会 Paper7
- PaLM-E: An Embodied Multimodal Language ModelDanny Driess, Fei Xia, Mehdi S. M. Sajjadi, Corey Lynch 等ICML 2023 · 被引用 2,601 次
- Learning Universal Policies via Text-Guided Video GenerationYilun Du, Sherry Yang, Bo Dai, Hanjun Dai 等NeurIPS 2023 · 被引用 742 次
- Zero-Shot Robotic Manipulation with Pre-Trained Image-Editing Diffusion ModelsKevin Black, Mitsuhiko Nakamoto, Pranav Atreya, Homer Rich Walke 等ICLR 2024 · 被引用 284 次
- Video Language PlanningYilun Du, Sherry Yang, Pete Florence, Fei Xia 等ICLR 2024 · 被引用 161 次
- ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic ManipulationXiaoqi Li, Mingxu Zhang, Yiran Geng, Haoran Geng 等CVPR 2024
相关 Paper
- HandWorld: Hand-Centric Unified Video Action GenerationZhihao Sun, Zhiying Du, Xitong Yang, Zuxuan WuCVPR 2026 · 被引用 1 次
- Continual Predictive Learning from VideosGeng Chen, Wendong Zhang, Han Lu, Siyu Gao 等CVPR 2022 · 被引用 5 次
- VTLayout: A Multi-Modal Approach for Video Text LayoutYuxuan Zhao, Jin Ma, Zhongang Qi, Zehua Xie 等ACM MM 2023 · 被引用 1 次
- Learned Single-Pass Multitasking Perceptual Graphics for Immersive DisplaysDoga Yilmaz, He Wang, Towaki Takikawa, Duygu Ceylan 等ACM MM 2025
- Mind the Time: Temporally-Controlled Multi-Event Video GenerationZiyi Wu, Aliaksandr Siarohin, Willi Menapace, Ivan Skorokhodov 等CVPR 2025
