Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization
Weixuan Wang, Minghao Wu, Barry Haddow, Alexandra Birch
摘要
Long document summarization remains a significant challenge for current large language models (LLMs), as existing approaches commonly struggle with information loss, factual inconsistencies, and coherence issues when processing excessively long documents. We propose SUMMQ, a novel adversarial multi-agent framework that addresses these limitations through collaborative intelligence between specialized agents operating in two complementary domains: summarization and quizzing. Our approach employs summary generators and reviewers that work collaboratively to create and evaluate comprehensive summaries, while quiz generators and reviewers create comprehension questions that serve as continuous quality checks for the summarization process. This adversarial dynamic, enhanced by an examinee agent that validates whether the generated summary contains the information needed to answer the quiz questions, enables iterative refinement through multifaceted feedback mechanisms. We evaluate SUMMQ on three widely used long document summarization benchmarks. Experimental results demonstrate that our framework significantly outperforms existing state-ofthe-art methods across ROUGE and BERTScore metrics, as well as in LLM-as-a-Judge and human evaluations. Our comprehensive analyses reveal the effectiveness of the multi-agent collaboration dynamics, the influence of different agent configurations, and the impact of the quizzing mechanism. This work establishes a new approach for long document summarization that uses adversarial agentic collaboration to improve summarization quality. In addition, we release the code to foster research along this line. 1 Recent large language models (LLMs) have shown promising results for summarization tasks (Pu et al., 2023; Laban et al., 2023; Keswani et al., 2024) . However, existing methods struggle with long documents, often leading to significant information loss, factual inconsistencies, and difficulty maintaining coherence across lengthy texts (Koh et al., 2023). Current approaches often fail to † Equal contribution.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper1
问问它们各自怎么用它它引用的顶会 Paper11
- BERTScore: Evaluating Text Generation with BERTTianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger 等ICLR 2020 · 被引用 8,443 次
- Big Bird: Transformers for Longer SequencesManzil Zaheer, Guru Guruganesh, Kumar Avinava Dubey, Joshua Ainslie 等NeurIPS 2020 · 被引用 3,159 次
- Improving Factuality and Reasoning in Language Models through Multiagent DebateYilun Du, Shuang Li, Antonio Torralba, Joshua B. Tenenbaum 等ICML 2024 · 被引用 1,562 次
- Train Short, Test Long: Attention with Linear Biases Enables Input Length ExtrapolationOfir Press, Noah A. Smith, Mike LewisICLR 2022 · 被引用 1,168 次
- Unlimiformer: Long-Range Transformers with Unlimited Length InputAmanda Bertsch, Uri Alon, Graham Neubig, Matthew GormleyNeurIPS 2023 · 被引用 176 次
相关 Paper
- LONGAGENT: Achieving Question Answering for 128k-Token-Long Documents through Multi-Agent CollaborationJun Zhao, Can Zu, Xu Hao, Yi Lu 等EMNLP 2024 · 被引用 5 次
- DocAgent: An Agentic Framework for Multi-Modal Long-Context Document UnderstandingLi Sun, Liu He, Shuyue Jia, Yangfan He 等EMNLP 2025 · 被引用 1 次
- Chain of Agents: Large Language Models Collaborating on Long-Context TasksYusen Zhang, Ruoxi Sun, Yanfei Chen, Tomas Pfister 等NeurIPS 2024 · 被引用 297 次
- NexusSum: Hierarchical LLM Agents for Long-Form Narrative SummarizationHyuntak Kim, Byung-Hak KimACL 2025
- When Does Divide and Conquer Work for Long Context LLM? A Noise Decomposition FrameworkZach Xu, Shang Zhu, Jue Wang, Junlin Wang 等ICLR 2026 · 被引用 9 次
