TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel Planning
Soumyabrata Chaudhuri, Pranav Purkar, Ritwik Raghav, Shubhojit Mallick, Manish Gupta, Abhik Jana, Shreya Ghosh
Abstract
Recent studies on probing Large Language Models (LLMs) have explored their latent potential as personalized travel planning agents, yet existing benchmarks remain limited in realworld applicability. Existing datasets, such as TravelPlanner and TravelPlanner+, suffer from semi-synthetic data reliance, spatial inconsistencies, and a lack of key travel constraints, making them inadequate for practical itinerary generation. To address these gaps, we introduce TripCraft, a spatio-temporally coherent travel planning dataset that integrates real-world constraints, including public transit schedules, event availability, diverse attraction categories, and user personas for enhanced personalization. To evaluate LLM-generated plans beyond existing binary validation methods, we propose five continuous evaluation metrics, namely Temporal Meal Score, Temporal Attraction Score, Spatial Score, Ordering Score, and Persona Score-which assess itinerary quality across multiple dimensions. Our parameter-informed setting significantly enhances meal scheduling, improving the Temporal Meal Score from 61% to 80% in a 7-day scenario. TripCraft 1 establishes a new benchmark for LLM-driven personalized travel planning, offering a more realistic, constraint-aware framework for itinerary generation.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext fde4245a-06b0-43a4-8302-77bae35e2887Cited by top-tier papers3
- Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMsJingyao Wang, Wenwen Qiang, Zeen Song, Changwen Zheng et al.NeurIPS 2025 · 13 citations
- TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel PlanningHang Ni, Fan Liu, Xinyu Ma, Lixin Su et al.EMNLP 2025 · 1 citation
- SMAP: Semantic Route Planning with Map-Grounded Multimodal AlignmentWenjie Zhang, Chen Yang, Xin Lu, Zhen Wang et al.CVPR 2026
Builds on4
- Chain-of-Thought Prompting Elicits Reasoning in Large Language ModelsJason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma et al.NeurIPS 2022 · 22,562 citations
- LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language ModelsChan Hee Song, Brian M. Sadler, Jiaman Wu, Wei-Lun Chao et al.ICCV 2023 · 685 citations
- TravelPlanner: A Benchmark for Real-World Planning with Language AgentsJian Xie, Kai Zhang, Jiangjie Chen, Tinghui Zhu et al.ICML 2024 · 376 citations
- ReAct: Synergizing Reasoning and Acting in Language ModelsShunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du et al.ICLR 2023
Related papers
- Beyond Itinerary Planning - A Real-World Benchmark for Multi-Turn and Tool-Using Travel TasksXiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu et al.ACL 2026 · 4 citations
- ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel PlanningJihye Choi, Jinsung Yoon, Jiefeng Chen, Somesh Jha et al.ICLR 2026 · 18 citations
- RETAIL: Towards Real-world Travel Planning for Large Language ModelsBin Deng, Yizhe Feng, Zeming Liu, Qing Wei et al.EMNLP 2025
- NL Schedule: Evaluate Multitask Scheduling Capability of Large Language ModelsWenrui Liao, Weihong Du, Yi Li, Hongru Liang et al.ACL 2026
- TourismMinds: A Geo-augmented LLM Framework for Semantic-aware Trajectory Analytics and GenerationZhuohan Ye, Xiaolin Su, Ding He, Zijing Zhang et al.UbiComp 2026 · 2 citations
