Optimized Feature Generation for Tabular Data via LLMs with Decision Tree Reasoning
Jaehyun Nam, Kyuyoung Kim, Seunghyuk Oh, Jihoon Tack, Jaehyung Kim, Jinwoo Shin
摘要
In tabular prediction tasks, tree-based models combined with automated feature engineering methods often outperform deep learning approaches that rely on learned representations. While these feature engineering techniques are effective, they typically depend on a pre-defined search space and primarily use validation scores for feature selection, thereby missing valuable insights from previous experiments. To address these limitations, we propose a novel tabular learning framework that utilizes large language models (LLMs), termed Optimizing Column feature generator with decision Tree reasoning (OCTree). Our key idea is to leverage the reasoning capabilities of LLMs to identify effective feature generation rules without manually specifying the search space and provide language-based reasoning information highlighting past experiments as feedback for iterative rule improvements. We use decision trees to convey this reasoning information, as they can be easily represented in natural language, effectively providing knowledge from prior experiments (i.e., the impact of the generated features on performance) to the LLMs. Our empirical results demonstrate that OCTree consistently enhances the performance of various prediction models across diverse benchmarks, outperforming competing automated feature engineering methods. Code is available at https://github.com/jaehyun513/OCTree.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper12
- MLE-STAR: Machine Learning Engineering Agent via Search and Targeted RefinementJaehyun Nam, Jinsung Yoon, Jiefeng Chen, Jinwoo Shin 等NeurIPS 2025 · 被引用 58 次
- LLM Meeting Decision Trees on Tabular DataHangting Ye, Jinmeng Li, He Zhao, Dandan Guo 等NeurIPS 2025 · 被引用 8 次
- 'Oh LLM, I'm Asking Thee, Please Give Me a Decision Tree': Zero-Shot Decision Tree Induction and Embedding with Large Language ModelsRicardo Knauer, Mario Koddenbrock, Raphael Wallsberger, Nicholas M. Brisson 等KDD 2025 · 被引用 3 次
- Influence-Guided Symbolic Regression: Scientific Discovery via LLM-Driven Equation Search with Granular FeedbackEvgeny S. Saveliev, Samuel Holt, Nabeel Seedat, David Bentley 等ICML 2026 · 被引用 3 次
- LLM as an Algorithmist: Enhancing Anomaly Detectors via Programmatic SynthesisHangting Ye, Jinmeng Li, He Zhao, Mingchen Zhuge 等ICLR 2026 · 被引用 2 次
它引用的顶会 Paper18
- Language Models are Few-Shot LearnersTom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah 等NeurIPS 2020 · 被引用 64,255 次
- Multitask Prompted Training Enables Zero-Shot Task GeneralizationVictor Sanh, Albert Webson, Colin Raffel, Stephen H. Bach 等ICLR 2022 · 被引用 1,976 次
- Revisiting Deep Learning Models for Tabular DataYury Gorishniy, Ivan Rubachev, Valentin Khrulkov, Artem BabenkoNeurIPS 2021 · 被引用 1,847 次
- Large Language Models as OptimizersChengrun Yang, Xuezhi Wang, Yifeng Lu, Hanxiao Liu 等ICLR 2024 · 被引用 817 次
- Promptbreeder: Self-Referential Self-Improvement via Prompt EvolutionChrisantha Fernando, Dylan Banarse, Henryk Michalewski, Simon Osindero 等ICML 2024 · 被引用 432 次
相关 Paper
- AutoCT: Automating Interpretable Clinical Trial Prediction with LLM AgentsFengze Liu, Haoyu Wang, Joonhyuk Cho, Dan Roth 等EMNLP 2025 · 被引用 1 次
- TabLoft: Tabular Data Generation Based on LLM with Ordered FeaturesLuyu Chen, Changhao Wu, Jingyi Li, Sen Liu 等ICDE 2026
- CoFE: Collaborative Feature Engineering via Semantically-Guided Exploration and Diagnostic-Driven RefinementWeihao Jiang, Ziang Nan, Zhihui Shi, Ya Cong 等KDD 2026
- Large Language Models Can Automatically Engineer Features for Few-Shot Tabular LearningSungwon Han, Jinsung Yoon, Sercan Ö. Arik, Tomas PfisterICML 2024 · 被引用 81 次
- Human-LLM Collaborative Feature Engineering for Tabular DataZhuoyan Li, Aditya Bansal, Jinzhao Li, Shishuang He 等ICLR 2026 · 被引用 2 次
