CatVTON: Concatenation Is All You Need for Virtual Try-On with Diffusion Models
Zheng Chong, Xiao Dong, Haoxiang Li, Shiyue Zhang, Wenqing Zhang, Hanqing Zhao, Xujie Zhang, Dongmei Jiang, Xiaodan Liang
2025Year
40Top-tier citations
Abstract
Published as a conference paper at ICLR 2025 pared to other diffusion-based methods. Extensive experiments demonstrate that CatVTON achieves superior qualitative and quantitative results compared to baseline methods and demonstrates strong generalization performance in in-the-wild scenarios, despite being trained solely on public datasets with 73K samples.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers40
- OmniTry: Virtual Try-On Anything without MasksYutong Feng, Linlin Zhang, Hengyuan Cao, Yiming Chen et al.NeurIPS 2025 · 16 citations
- Any2anytryon: Leveraging Adaptive Position Embeddings for Versatile Virtual Clothing TasksHailong Guo, Bohan Zeng, Yiren Song, Wentao Zhang et al.ICCV 2025 · 13 citations
- MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image GenerationYuta Oshima, Daiki Miyake, Kohsei Matsutani, Yusuke Iwasawa et al.CVPR 2026 · 10 citations
- Inverse Virtual Try-On: Generating Multi-Category Product-Style Images from Clothed IndividualsDavide Lobba, Fulvio Sanguigni, Bin Ren, Marcella Cornia et al.ICLR 2026 · 7 citations
- MIRAGE: Towards AI-Generated Image Detection in the WildOucheng Huang, Manxi Lin, Jiexiang Tan, Xiaoxiong Du et al.AAAI 2026 · 6 citations
Builds on23
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn et al.ICLR 2021 · 21,477 citations
- LoRA: Low-Rank Adaptation of Large Language ModelsEdward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu et al.ICLR 2022 · 18,833 citations
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser et al.CVPR 2022 · 13,123 citations
- Adding Conditional Control to Text-to-Image Diffusion ModelsLvmin Zhang, Anyi Rao, Maneesh AgrawalaICCV 2023 · 6,759 citations
Related papers
- IFCSR: Inference-Free Fidelity-Realism Control for One-Step Diffusion-based Real-World Image Super-ResolutionJonghee Back, Jongju Kim, Jeong-Uk Kim, Eunjin Kim et al.CVPR 2026
- ObjectStitch: Object Compositing with Diffusion ModelYizhi Song, Zhifei Zhang, Zhe Lin, Scott Cohen et al.CVPR 2023
- One Algorithm to Align Them AllBoyi Pang, Savva Ignatyev, Vladimir Ippolitov, Ramil Khafizov et al.CVPR 2026
- Dream Video: Composing Your Dream Videos with Customized Subject and MotionYujie Wei, Shiwei Zhang, Zhiwu Qing, Hangjie Yuan et al.CVPR 2024
- Spatially-Invariant Style-Codes Controlled Makeup TransferHan Deng, Chu Han, Hongmin Cai, Guoqiang Han et al.CVPR 2021
