INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
Haohang Li, Yupeng Cao, Yangyang Yu, Shashidhar Reddy Javaji, Zhiyang Deng, Yueru He, Yuechen Jiang, Zining Zhu, K. P. Subbalakshmi, Jimin Huang, Lingfei Qian, Xueqing Peng
摘要
Recent advancements have underscored the potential of large language model (LLM)-based agents in financial decision-making. Despite this progress, the field currently encounters two main challenges: (1) the lack of a comprehensive LLM agent framework adaptable to a variety of financial tasks, and (2) the absence of standardized benchmarks and consistent datasets for assessing agent performance. To tackle these issues, we introduce INVESTOR-BENCH, the first benchmark specifically designed for evaluating LLM-based agents in diverse financial decision-making contexts. IN-VESTORBENCH enhances the versatility of LLM-enabled agents by providing a comprehensive suite of tasks applicable to different financial products, including single equities like stocks, cryptocurrencies and exchange-traded funds (ETFs). Additionally, we assess the reasoning and decision-making capabilities of our agent framework using thirteen different LLMs as backbone models, across various market environments and tasks. Furthermore, we have curated a diverse collection of open-source, multimodal datasets and developed a comprehensive suite of environments for financial decisionmaking. This establishes a highly accessible platform for evaluating financial agents' performance across various scenarios. The code is available at Github Repo: https://github. com/felis33/INVESTOR-BENCH
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper7
- FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and ReasoningLiang Hu, Jianpeng Jiao, Jiashuo Liu, Dongyuan Mutu 等ICLR 2026 · 被引用 29 次
- MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial ApplicationXueqing Peng, Lingfei Qian, Yan Wang, Ruoyu Xiang 等ACL 2026 · 被引用 6 次
- Understanding Structured Financial Data with LLMs: A Case Study on Fraud DetectionXuwei Tan, Yao Ma, Xueru ZhangACL 2026 · 被引用 3 次
- FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance DomainTiansheng Hu, Tongyan Hu, Liuyang Bai, Yilun Zhao 等EMNLP 2025 · 被引用 2 次
- Plutus: Benchmarking Large Language Models in Low-Resource Greek FinanceXueqing Peng, Triantafillos Papadopoulos, Efstathia Soufleri, Polydoros Giannouris 等EMNLP 2025 · 被引用 2 次
它引用的顶会 Paper5
- Generative Agents: Interactive Simulacra of Human BehaviorJoon Sung Park, Joseph C. O'Brien, Carrie Jun Cai, Meredith Ringel Morris 等UIST 2023 · 被引用 1,882 次
- Adaptive Quantitative Trading: An Imitative Deep Reinforcement Learning ApproachYang Liu, Qi Liu, Hongke Zhao, Zhen Pan 等AAAI 2020 · 被引用 157 次
- When FLUE Meets FLANG: Benchmarks and Large Pretrained Language Model for Financial DomainRaj Sanjay Shah, Kunal Chawla, Dheeraj Eidnani, Agam Shah 等EMNLP 2022 · 被引用 63 次
- CryptoTrade: A Reflective LLM-based Agent to Guide Zero-shot Cryptocurrency TradingYuan Li, Bingqiao Luo, Qian Wang, Nuo Chen 等EMNLP 2024 · 被引用 5 次
- DeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree SearchHuajian Xin, Z. Z. Ren, Junxiao Song, Zhihong Shao 等ICLR 2025
相关 Paper
- AgentBench: Evaluating LLMs as AgentsXiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu 等ICLR 2024 · 被引用 748 次
- AlphaBench: Benchmarking Large Language Models in Formulaic Alpha Factor MiningHaochen Luo, Ho Tin Ko, Jiandong Chen, David Q. Sun 等ICLR 2026 · 被引用 8 次
- InfiAgent-DABench: Evaluating Agents on Data Analysis TasksXueyu Hu, Ziyu Zhao, Shuang Wei, Ziwei Chai 等ICML 2024 · 被引用 110 次
- SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security TasksHwiwon Lee, Ziqi Zhang, Hanxiao Lu, Lingming ZhangNeurIPS 2025 · 被引用 86 次
- CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use AgentsJiayu Liu, Cheng Qian, Zhaochen Su, Qing Zong 等ACL 2026 · 被引用 19 次
