Hiding Video in Audio via Reversible Generative Models
Hyukryul Yang, Hao Ouyang, Vladlen Koltun, Qifeng Chen
摘要
We present a method for hiding video content inside audio files while preserving the perceptual fidelity of the cover audio. This is a form of cross-modal steganography and is particularly challenging due to the high bitrate of video. Our scheme uses recent advances in flow-based generative models, which enable mapping audio to latent codes such that nearby codes correspond to perceptually similar signals. We show that compressed video data can be concealed in the latent codes of audio sequences while preserving the fidelity of both the hidden video and the cover audio. We can embed 128x128 video inside same-duration audio, or higher-resolution video inside longer audio sequences. Quantitative experiments show that our approach outperforms relevant baselines in steganographic capacity and fidelity.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- StegaNeRF: Embedding Invisible Information within Neural Radiance FieldsChenxin Li, Brandon Y. Feng, Zhiwen Fan, Panwang Pan 等ICCV 2023 · 被引用 57 次
- IICNet: A Generic Framework for Reversible Image ConversionKa Leong Cheng, Yueqi Xie, Qifeng ChenICCV 2021 · 被引用 30 次
- Images that Sound: Composing Images and Sounds on a Single CanvasZiyang Chen, Daniel Geng, Andrew OwensNeurIPS 2024 · 被引用 22 次
- Embedding Novel Views in a Single JPEG ImageYue Wu, Guotao Meng, Qifeng ChenICCV 2021 · 被引用 16 次
- Restorable Image Operators with Quasi-Invertible NetworksHao Ouyang, Tengfei Wang, Qifeng ChenAAAI 2022 · 被引用 7 次
相关 Paper
- MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video GenerationMingzhen Sun, Weining Wang, Yanyuan Qiao, Jiahui Sun 等ACM MM 2024 · 被引用 4 次
- VAFlow: Video-to-Audio Generation with Cross-Modality Flow MatchingXihua Wang, Xin Cheng, Yuyue Wang, Ruihua Song 等ICCV 2025 · 被引用 6 次
- Aligning What Matters: Masked Latent Adaptation for Text-to-Audio-Video GenerationJiyang Zheng, Siqi Pan, Yu Yao, Zhaoqing Wang 等NeurIPS 2025 · 被引用 6 次
- Leveraging Real Talking Faces via Self-Supervision for Robust Forgery DetectionAlexandros Haliassos, Rodrigo Mira, Stavros Petridis, Maja PanticCVPR 2022 · 被引用 138 次
- AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video GenerationMoayed Haji-Ali, Willi Menapace, Aliaksandr Siarohin, Ivan Skorokhodov 等ICCV 2025 · 被引用 3 次
