WMarkGPT: Watermarked Image Understanding via Multimodal Large Language Models
Songbai Tan, Xuerui Qiu, Yao Shu, Gang Xu, Linrui Xu, Xiangyu Xu, Huiping Zhuang, Ming Li, Fei Richard Yu
Abstract
WMarkGPT WMarkGPT: The watermark in the image is centrally oriented, covering a significant portion of the scene. It partially overlaps with the vase and the potted plant, extending across their surfaces and coming close to their edges. The watermark appears as a circular or patterned texture with a moderately visible presence, blending somewhat with the image's elements without being overly intrusive. The watermark visibility is: moderate. The watermark visibility is: <level>. level weight Invisible 9.32e-5 Faint 1.42e-4 Moderate 7.61e-1 Visible 1.87e-1 Obvious 5.22e-2 Score: 2.71 Weight avg.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers4
- OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Modelstengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li et al.CVPR 2026 · 4 citations
- Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual CuesWenjin Hou, Xiaoxiao Sun, Hehe FanCVPR 2026 · 1 citation
- Sharpness-aware Model Merging with Salience Recovery for LLM-based Cross-Domain Sequential RecommendationHuwei Ji, Jiajie Su, Yuyuan Li, Xiaohua Feng et al.KDD 2026 · 1 citation
- Hi-Lo Prune: Look at What You'll Lose before Pruning with Hierarchical Token SelectionZixun Sun, Yubo Dong, Hehe Fan, Yi YangCVPR 2026
Builds on17
- Segment AnythingAlexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao et al.ICCV 2023 · 13,211 citations
- Visual Instruction TuningHaotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae LeeNeurIPS 2023 · 11,349 citations
- BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language ModelsJunnan Li, Dongxu Li, Silvio Savarese, Steven C. H. HoiICML 2023 · 7,873 citations
- Flamingo: a Visual Language Model for Few-Shot LearningJean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech et al.NeurIPS 2022 · 6,707 citations
- MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language ModelsDeyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li et al.ICLR 2024 · 3,079 citations
Related papers
- STMark: Watermarking Scalar and Textual Data Robustly Using Frequency StatisticsJiongyang Ji, Yanguo Peng, Zhen Lv, Gengquan Guo et al.CCS 2026
- UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in RLRui Tian, Mingfei Gao, Haiming Gang, Jiasen Lu et al.CVPR 2026
- NotaryMark: Multi-Bit Watermarking for Black-Box Dataset Usage Auditing in Text-to-Image Diffusion ModelsXinyi Yu, Linkang Du, Zhou Su, Min Chen et al.CCS 2026
- XAttnMark: Learning Robust Audio Watermarking with Cross-AttentionYixin Liu, Lie Lu, Jihui Jin, Lichao Sun et al.ICML 2025
- Optimizing Watermarks for Large Language ModelsBram WoutersICML 2024 · 25 citations
