TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel Planning
Soumyabrata Chaudhuri, Pranav Purkar, Ritwik Raghav, Shubhojit Mallick, Manish Gupta, Abhik Jana, Shreya Ghosh
摘要
Recent studies on probing Large Language Models (LLMs) have explored their latent potential as personalized travel planning agents, yet existing benchmarks remain limited in realworld applicability. Existing datasets, such as TravelPlanner and TravelPlanner+, suffer from semi-synthetic data reliance, spatial inconsistencies, and a lack of key travel constraints, making them inadequate for practical itinerary generation. To address these gaps, we introduce TripCraft, a spatio-temporally coherent travel planning dataset that integrates real-world constraints, including public transit schedules, event availability, diverse attraction categories, and user personas for enhanced personalization. To evaluate LLM-generated plans beyond existing binary validation methods, we propose five continuous evaluation metrics, namely Temporal Meal Score, Temporal Attraction Score, Spatial Score, Ordering Score, and Persona Score-which assess itinerary quality across multiple dimensions. Our parameter-informed setting significantly enhances meal scheduling, improving the Temporal Meal Score from 61% to 80% in a 7-day scenario. TripCraft 1 establishes a new benchmark for LLM-driven personalized travel planning, offering a more realistic, constraint-aware framework for itinerary generation.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper3
- Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMsJingyao Wang, Wenwen Qiang, Zeen Song, Changwen Zheng 等NeurIPS 2025 · 被引用 13 次
- TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel PlanningHang Ni, Fan Liu, Xinyu Ma, Lixin Su 等EMNLP 2025 · 被引用 1 次
- SMAP: Semantic Route Planning with Map-Grounded Multimodal AlignmentWenjie Zhang, Chen Yang, Xin Lu, Zhen Wang 等CVPR 2026
它引用的顶会 Paper4
- Chain-of-Thought Prompting Elicits Reasoning in Large Language ModelsJason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma 等NeurIPS 2022 · 被引用 22,562 次
- LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language ModelsChan Hee Song, Brian M. Sadler, Jiaman Wu, Wei-Lun Chao 等ICCV 2023 · 被引用 685 次
- TravelPlanner: A Benchmark for Real-World Planning with Language AgentsJian Xie, Kai Zhang, Jiangjie Chen, Tinghui Zhu 等ICML 2024 · 被引用 376 次
- ReAct: Synergizing Reasoning and Acting in Language ModelsShunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du 等ICLR 2023
相关 Paper
- Beyond Itinerary Planning - A Real-World Benchmark for Multi-Turn and Tool-Using Travel TasksXiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu 等ACL 2026 · 被引用 4 次
- ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel PlanningJihye Choi, Jinsung Yoon, Jiefeng Chen, Somesh Jha 等ICLR 2026 · 被引用 18 次
- RETAIL: Towards Real-world Travel Planning for Large Language ModelsBin Deng, Yizhe Feng, Zeming Liu, Qing Wei 等EMNLP 2025
- NL Schedule: Evaluate Multitask Scheduling Capability of Large Language ModelsWenrui Liao, Weihong Du, Yi Li, Hongru Liang 等ACL 2026
- TourismMinds: A Geo-augmented LLM Framework for Semantic-aware Trajectory Analytics and GenerationZhuohan Ye, Xiaolin Su, Ding He, Zijing Zhang 等UbiComp 2026 · 被引用 2 次
