DOC2PPT: Automatic Presentation Slides Generation from Scientific Documents
Tsu-Jui Fu, William Yang Wang, Daniel McDuff, Yale Song
摘要
Creating presentation materials requires complex multimodal reasoning skills to summarize key concepts and arrange them in a logical and visually pleasing manner. Can machines learn to emulate this laborious process? We present a novel task and approach for document-to-slide generation. Solving this involves document summarization, image and text retrieval, slide structure and layout prediction to arrange key elements in a form suitable for presentation. We propose a hierarchical sequence-to-sequence approach to tackle our task in an end-to-end manner. Our approach exploits the inherent structures within documents and slides and incorporates paraphrasing and layout prediction modules to generate slides. To help accelerate research in this domain, we release a dataset about 6K paired documents and slide decks used in our experiments. We show that our approach outperforms strong baselines and produces slides with rich content and aligned imagery.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper18
- LayoutGPT: Compositional Visual Planning and Generation with Large Language ModelsWeixi Feng, Wanrong Zhu, Tsu-Jui Fu, Varun Jampani 等NeurIPS 2023 · 被引用 462 次
- SlideVQA: A Dataset for Document Visual Question Answering on Multiple ImagesRyota Tanaka, Kyosuke Nishida, Kosuke Nishida, Taku Hasegawa 等AAAI 2023 · 被引用 178 次
- Slide4N: Creating Presentation Slides from Computational Notebooks with Human-AI CollaborationFengjie Wang, Xuye Liu, Oujing Liu, Ali Neshati 等CHI 2023 · 被引用 37 次
- LessonPlanner: Assisting Novice Teachers to Prepare Pedagogy-Driven Lesson Plans with Large Language ModelsHaoxiang Fan, Guanzheng Chen, Xingbo Wang, Zhenhui PengUIST 2024 · 被引用 35 次
- From Paper to Card: Transforming Design Implications with Generative AIDonghoon Shin, Lucy Lu Wang, Gary HsiehCHI 2024 · 被引用 28 次
它引用的顶会 Paper7
- PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive SummarizationJingqing Zhang, Yao Zhao, Mohammad Saleh, Peter J. LiuICML 2020 · 被引用 2,453 次
- Semi-Supervised Learning with Normalizing FlowsPavel Izmailov, Polina Kirichenko, Marc Finzi, Andrew Gordon WilsonICML 2020 · 被引用 134 次
- Multimodal Summarization with Guidance of Multimodal ReferenceJunnan Zhu, Yu Zhou, Jiajun Zhang, Haoran Li 等AAAI 2020 · 被引用 113 次
- An Effective Transition-based Model for Discontinuous NERXiang Dai, Sarvnaz Karimi, Ben Hachey, Cécile ParisACL 2020 · 被引用 78 次
- VMSMO: Learning to Generate Multimodal Summary for Video-based News ArticlesMingzhe Li, Xiuying Chen, Shen Gao, Zhangming Chan 等EMNLP 2020 · 被引用 65 次
相关 Paper
- Deep Submodular Optimization and LLM for Multimodal Content Extraction and Automatic Poster Generation from Long DocumentVijay Jaisankar, Sambaran Bandyopadhyay, Kalp Vyas, Varre Suman Chaitanya 等AAAI 2025 · 被引用 1 次
- Semantic Document Derendering: SVG Reconstruction via Vision-Language ModelingAdam Hazimeh, Ke Wang, Mark Collier, Gilles Baechler 等AAAI 2026
- Telling Stories from Computational Notebooks: AI-Assisted Presentation Slides Creation for Presenting Data Science WorkChengbo Zheng, Dakuo Wang, April Yi Wang, Xiaojuan MaCHI 2022 · 被引用 53 次
- SlideCoder: Layout-aware RAG-enhanced Hierarchical Slide Generation from DesignWenxin Tang, Jingyu Xiao, Wenxuan Jiang, Xi Xiao 等EMNLP 2025 · 被引用 2 次
- SlideTailor: Personalized Presentation Slide Generation for Scientific PapersWenzheng Zeng, Mingyu Ouyang, Langyuan Cui, Hwee Tou NgAAAI 2026 · 被引用 3 次
