SPOR: A Comprehensive and Practical Evaluation Method for Compositional Generalization in Data-to-Text Generation
Ziyao Xu, Houfeng Wang
Abstract
Compositional generalization is an important ability of language models and has many different manifestations. For data-to-text generation, previous research on this ability is limited to a single manifestation called Systematicity and lacks consideration of large language models (LLMs), which cannot fully cover practical application scenarios. In this work, we propose SPOR, a comprehensive and practical evaluation method for compositional generalization in data-to-text generation. SPOR includes four aspects of manifestations (Systematicity, Productivity, Order invariance, and Rule learnability) and allows high-quality evaluation without additional manual annotations based on existing datasets. We demonstrate SPOR on two different datasets and evaluate some existing language models including LLMs. We find that the models are deficient in various aspects of the evaluation and need further improvement. Our work shows the necessity for comprehensive research on different manifestations of compositional generalization in data-to-text generation and provides a framework for evaluation. The dataset and code are available at https://github.com/xzy-xzy/SPOR .
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext e9caed86-6fa3-400b-a274-0dc415598072Cited by top-tier papers4
- Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones?Zhe Yang, Yichang Zhang, Tianyu Liu, Jian Yang et al.EMNLP 2024 · 2 citations
- Paraphrasing as Zero-shot Translation with Feature-guided Diversity EnhancementZiyue Yan, Hongying Zan, Xinglin Lyu, Hongfei XuACL 2026
- Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation PerspectiveZiyao Xu, Cong Wang, Houfeng WangACL 2026
- From A and B to A+B: Can Large Language Models Solve Compositional Math Problems?Xisheng Xiao, Hanlin ZhaoEMNLP 2025
Builds on6
- LoRA: Low-Rank Adaptation of Large Language ModelsEdward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu et al.ICLR 2022 · 18,833 citations
- BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and ComprehensionMike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad et al.ACL 2020 · 1,224 citations
- COGS: A Compositional Generalization Challenge Based on Semantic InterpretationNajoung Kim, Tal LinzenEMNLP 2020 · 149 citations
- Making Transformers Solve Compositional TasksSantiago Ontañón, Joshua Ainslie, Zachary Fisher, Vaclav CvicekACL 2022 · 87 citations
- Improving Compositional Generalization with Self-Training for Data-to-Text GenerationSanket Vaibhav Mehta, Jinfeng Rao, Yi Tay, Mihir Kale et al.ACL 2022 · 34 citations
Related papers
- Benchmarking and Improving Compositional Generalization of Multi-aspect Controllable Text GenerationTianqi Zhong, Zhaoyi Li, Quan Wang, Linqi Song et al.ACL 2024
- @ CREPE: Can Vision-Language Foundation Models Reason Compositionally?Zixian Ma, Jerry Hong, Mustafa Omer Gul, Mona Gandhi et al.CVPR 2023
- The Paradox of the Compositionality of Natural Language: A Neural Machine Translation Case StudyVerna Dankers, Elia Bruni, Dieuwke HupkesACL 2022
- Compositional Generalization for Multi-Label Text Classification: A Data-Augmentation ApproachYuyang Chai, Zhuang Li, Jiahui Liu, Lei Chen et al.AAAI 2024 · 18 citations
- Can Models Learn Skill Composition from Examples?Haoyu Zhao, Simran Kaur, Dingli Yu, Anirudh Goyal et al.NeurIPS 2024 · 20 citations
