WorldSimBench: Towards Video Generation Models as World Simulators
Yiran Qin, Zhelun Shi, Jiwen Yu, Xijun Wang, Enshen Zhou, Lijun Li, Zhenfei Yin, Xihui Liu, Lu Sheng, Jing Shao, Lei Bai, Ruimao Zhang
2025Year
6Top-tier citations
Abstract
P re d ic ti o n : T e xt T e xt + O b se rv a ti o n T e xt + O b se rv a ti o n P re d ic ti o n : Im a g e T e xt + O b se rv a ti o n P re d ic ti o n : V id e o T e xt + O b se rv a ti o n P re d ic ti o n : A ct io n a b le V id e o
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers6
- AGFSync: Leveraging AI-Generated Feedback for Preference Optimization in Text-to-Image GenerationJingkun An, Yinghao Zhu, Zongjian Li, Enshen Zhou et al.AAAI 2025 · 10 citations
- MAD: Motion Appearance Decoupling for efficient Driving World ModelsAhmad Rahimi, Valentin Gerard, Eloi Zablocki, Matthieu Cord et al.CVPR 2026 · 7 citations
- Rethinking Visual Intelligence: Insights from Video PretrainingPablo Acuaviva, Aram Davtyan, Mariam Hassan, Sebastian Stapf et al.ICML 2026 · 4 citations
- Physics in 2-Steps: Locking Motion Priors Before Visual Refinement Erases ThemWoojung Han, Seil Kang, Youngjun Jun, Min-Hung Chen et al.ICML 2026 · 2 citations
- Ref4D-VideoBench: Four-Dimensional Reference-Based Evaluation of Text-to-Video Generative ModelsJiajia Wei, YuJia He, Yuhan Hou, Hang Qi et al.CVPR 2026
Builds on7
- PaLM-E: An Embodied Multimodal Language ModelDanny Driess, Fei Xia, Mehdi S. M. Sajjadi, Corey Lynch et al.ICML 2023 · 2,601 citations
- Learning Universal Policies via Text-Guided Video GenerationYilun Du, Sherry Yang, Bo Dai, Hanjun Dai et al.NeurIPS 2023 · 742 citations
- Zero-Shot Robotic Manipulation with Pre-Trained Image-Editing Diffusion ModelsKevin Black, Mitsuhiko Nakamoto, Pranav Atreya, Homer Rich Walke et al.ICLR 2024 · 284 citations
- Video Language PlanningYilun Du, Sherry Yang, Pete Florence, Fei Xia et al.ICLR 2024 · 161 citations
- ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic ManipulationXiaoqi Li, Mingxu Zhang, Yiran Geng, Haoran Geng et al.CVPR 2024
Related papers
- HandWorld: Hand-Centric Unified Video Action GenerationZhihao Sun, Zhiying Du, Xitong Yang, Zuxuan WuCVPR 2026 · 1 citation
- Continual Predictive Learning from VideosGeng Chen, Wendong Zhang, Han Lu, Siyu Gao et al.CVPR 2022 · 5 citations
- VTLayout: A Multi-Modal Approach for Video Text LayoutYuxuan Zhao, Jin Ma, Zhongang Qi, Zehua Xie et al.ACM MM 2023 · 1 citation
- Learned Single-Pass Multitasking Perceptual Graphics for Immersive DisplaysDoga Yilmaz, He Wang, Towaki Takikawa, Duygu Ceylan et al.ACM MM 2025
- Mind the Time: Temporally-Controlled Multi-Event Video GenerationZiyi Wu, Aliaksandr Siarohin, Willi Menapace, Ivan Skorokhodov et al.CVPR 2025
