Extracting Cultural Commonsense Knowledge at Scale
Tuan-Phong Nguyen, Simon Razniewski, Aparna S. Varde, Gerhard Weikum
摘要
Structured knowledge is important for many AI applications. Commonsense knowledge, which is crucial for robust human-centric AI, is covered by a small number of structured knowledge projects. However, they lack knowledge about human traits and behaviors conditioned on socio-cultural contexts, which is crucial for situative AI. This paper presents Candle, an end-to-end methodology for extracting high-quality cultural commonsense knowledge (CCSK) at scale. Candle extracts CCSK assertions from a huge web corpus and organizes them into coherent clusters, for 3 domains of subjects (geography, religion, occupation) and several cultural facets (food, drinks, clothing, traditions, rituals, behaviors). Candle includes judicious techniques for classification-based filtering and scoring of interestingness. Experimental evaluations show the superiority of the Candle CCSK collection over prior works, and an extrinsic use case demonstrates the benefits of CCSK for the GPT-3 language model. Code and data can be accessed at https://candle.mpi-inf.mpg.de/ .
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper25
- CultureLLM: Incorporating Cultural Differences into Large Language ModelsCheng Li, Mengzhuo Chen, Jindong Wang, Sunayana Sitaram 等NeurIPS 2024 · 被引用 101 次
- CulturePark: Boosting Cross-cultural Understanding in Large Language ModelsCheng Li, Damien Teney, Linyi Yang, Qingsong Wen 等NeurIPS 2024 · 被引用 34 次
- Culture is Not Trivia: Sociocultural Theory for Cultural NLPNaitian Zhou, David Bamman, Isaac L. BleamanACL 2025 · 被引用 33 次
- Benchmarking Vision Language Models for Cultural UnderstandingShravan Nayak, Kanishk Jain, Rabiul Awal, Siva Reddy 等EMNLP 2024 · 被引用 26 次
- Towards Measuring and Modeling "Culture" in LLMs: A SurveyMuhammad Farid Adilazuarda, Sagnik Mukherjee, Pradhyumna Lavania, Siddhant Singh 等EMNLP 2024 · 被引用 21 次
它引用的顶会 Paper7
- Language Models are Few-Shot LearnersTom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah 等NeurIPS 2020 · 被引用 64,255 次
- BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and ComprehensionMike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad 等ACL 2020 · 被引用 1,224 次
- ASER: A Large-scale Eventuality Knowledge GraphHongming Zhang, Xin Liu, Haojie Pan, Yangqiu Song 等WWW 2020 · 被引用 183 次
- Visually Grounded Reasoning across Languages and CulturesFangyu Liu, Emanuele Bugliarello, Edoardo Maria Ponti, Siva Reddy 等EMNLP 2021 · 被引用 87 次
- Advanced Semantics for Commonsense Knowledge ExtractionTuan-Phong Nguyen, Simon Razniewski, Gerhard WeikumWWW 2021 · 被引用 46 次
相关 Paper
- CANDLE: Iterative Conceptualization and Instantiation Distillation from Large Language Models for Commonsense ReasoningWeiqi Wang, Tianqing Fang, Chunyang Li, Haochen Shi 等ACL 2024 · 被引用 10 次
- Vera: A General-Purpose Plausibility Estimation Model for Commonsense StatementsJiacheng Liu, Wenya Wang, Dianzhuo Wang, Noah A. Smith 等EMNLP 2023 · 被引用 9 次
- CAT: A Contextualized Conceptualization and Instantiation Framework for Commonsense ReasoningWeiqi Wang, Tianqing Fang, Baixuan Xu, Chun Yi Louis Bo 等ACL 2023 · 被引用 13 次
- GLUCOSE: GeneraLized and COntextualized Story ExplanationsNasrin Mostafazadeh, Aditya Kalyanpur, Lori Moon, David W. Buchanan 等EMNLP 2020 · 被引用 7 次
- CORECODE: A Common Sense Annotated Dialogue Dataset with Benchmark Tasks for Chinese Large Language ModelsDan Shi, Chaobin You, Jiantao Huang, Taihao Li 等AAAI 2024 · 被引用 3 次
