OpenAsp: A Benchmark for Multi-document Open Aspect-based Summarization
Shmuel Amar, Liat Schiff, Ori Ernst, Asi Shefer, Ori Shapira, Ido Dagan
Abstract
The performance of automatic summarization models has improved dramatically in recent years. Yet, there is still a gap in meeting specific information needs of users in real-world scenarios, particularly when a targeted summary is sought, such as in the useful aspectbased summarization setting targeted in this paper. Previous datasets and studies for this setting have predominantly concentrated on a limited set of pre-defined aspects, focused solely on single document inputs, or relied on synthetic data. To advance research on more realistic scenarios, we introduce OPENASP, a benchmark for multi-document open aspect-based summarization. This benchmark is created using a novel and cost-effective annotation protocol, by which an open aspect dataset is derived from existing generic multi-document summarization datasets. We analyze the properties of OPENASP showcasing its high-quality content. Further, we show that the realistic open-aspect setting realized in OPENASP poses a challenge for current state-of-the-art summarization models, as well as for large language models. * Equal contribution. † Part of the research was conducted during an internship at One AI.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext c50f5dc1-ffef-4722-a422-c3b8eabcbf82Cited by top-tier papers2
- GlobeSumm: A Challenging Benchmark Towards Unifying Multi-lingual, Cross-lingual and Multi-document News SummarizationYangfan Ye, Xiachong Feng, Xiaocheng Feng, Weitao Ma et al.EMNLP 2024 · 8 citations
- Enhancing Event-centric News Cluster Summarization via Data Sharpening and Localization InsightsLongyin Zhang, Bowei Zou, AiTi AwACL 2025 · 1 citation
Builds on5
- BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and ComprehensionMike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad et al.ACL 2020 · 1,224 citations
- PRIMERA: Pyramid-based Masked Sentence Pre-training for Multi-document SummarizationWen Xiao, Iz Beltagy, Giuseppe Carenini, Arman CohanACL 2022 · 147 citations
- SQuALITY: Building a Long-Document Summarization Dataset the Hard WayAlex Wang, Richard Yuanzhe Pang, Angelica Chen, Jason Phang et al.EMNLP 2022 · 19 citations
- ASPECTNEWS: Aspect-Oriented Summarization of News DocumentsOjas Ahuja, Jiacheng Xu, Akshay Gupta, Kevin Horecka et al.ACL 2022
- Aspect-Controllable Opinion SummarizationReinald Kim Amplayo, Stefanos Angelidis, Mirella LapataEMNLP 2021
Related papers
- From Information to Insight: Leveraging LLMs for Open Aspect-Based Educational SummarizationYang Zhong, Diane J. LitmanACL 2025
- QuerySum: A Multi-Document Query-Focused Summarization Dataset Augmented with Similar Query ClustersYushan Liu, Zili Wang, Ruifeng YuanAAAI 2024 · 14 citations
- Towards Multi-dimensional Evaluation of LLM Summarization across Domains and LanguagesHyangsuk Min, Yuho Lee, Minjeong Ban, Jiaqi Deng et al.ACL 2025 · 8 citations
- EntSUM: A Data Set for Entity-Centric Extractive SummarizationMounica Maddela, Mayank Kulkarni, Daniel Preotiuc-PietroACL 2022 · 2 citations
- TracSum: A New Benchmark for Aspect-Based Summarization with Sentence-Level Traceability in Medical DomainBohao Chu, Meijie Li, Sameh Frihat, Chengyu Gu et al.EMNLP 2025
