HAUSER: Towards Holistic and Automatic Evaluation of Simile Generation
Qianyu He, Yikai Zhang, Jiaqing Liang, Yuncheng Huang, Yanghua Xiao, Yunwen Chen
摘要
Similes play an imperative role in creative writing such as story and dialogue generation. Proper evaluation metrics are like a beacon guiding the research of simile generation (SG). However, it remains under-explored as to what criteria should be considered, how to quantify each criterion into metrics, and whether the metrics are effective for comprehensive, efficient, and reliable SG evaluation. To address the issues, we establish HAUSER, a holistic and automatic evaluation system for the SG task, which consists of five criteria from three perspectives and automatic metrics for each criterion. Through extensive experiments, we verify that our metrics are significantly more correlated with human ratings from each perspective compared with prior automatic metrics. Resources of HAUSER are publicly available at https://github.com/Abbey4799/HAUSER .
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper2
- Evaluating Text Creativity across Diverse Domains: a Dataset and Large Language Model EvaluatorQian Cao, Xiting Wang, Yuzhuo Yuan, Yahui Liu 等ICLR 2026 · 被引用 11 次
- Metaphor Reasoning is Meta-reasoningQianyu He, Junting Lu, Yikai Zhang, Siyu Yuan 等ACL 2026
它引用的顶会 Paper6
- BERTScore: Evaluating Text Generation with BERTTianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger 等ICLR 2020 · 被引用 8,443 次
- Towards Holistic and Automatic Evaluation of Open-Domain Dialogue GenerationBo Pang, Erik Nijkamp, Wenjuan Han, Linqi Zhou 等ACL 2020 · 被引用 69 次
- Generating similes effortlessly like a Pro: A Style Transfer Approach for Simile GenerationTuhin Chakrabarty, Smaranda Muresan, Nanyun PengEMNLP 2020 · 被引用 46 次
- Writing Polishment with Simile: Task, Dataset and A Neural ApproachJiayi Zhang, Zhi Cui, Xiaoqiang Xia, Yalong Guo 等AAAI 2021 · 被引用 20 次
- MAPS-KB: A Million-Scale Probabilistic Simile Knowledge BaseQianyu He, Xintao Wang, Jiaqing Liang, Yanghua XiaoAAAI 2023 · 被引用 4 次
相关 Paper
- Fantastic Expressions and Where to Find Them: Chinese Simile Generation with Multiple ConstraintsKexin Yang, Dayiheng Liu, Wenqiang Lei, Baosong Yang 等ACL 2023 · 被引用 3 次
- OpenMEVA: A Benchmark for Evaluating Open-ended Story Generation MetricsJian Guan, Zhexin Zhang, Zhuoer Feng, Zitao Liu 等ACL 2021
- Learning to Compare for Better Training and Evaluation of Open Domain Natural Language Generation ModelsWangchunshu Zhou, Ke XuAAAI 2020 · 被引用 49 次
- Towards a Unified Multi-Dimensional Evaluator for Text GenerationMing Zhong, Yang Liu, Da Yin, Yuning Mao 等EMNLP 2022 · 被引用 103 次
- RoMe: A Robust Metric for Evaluating Natural Language GenerationMd Rashad Al Hasan Rony, Liubov Kovriguina, Debanjan Chaudhuri, Ricardo Usbeck 等ACL 2022 · 被引用 15 次
