MultiVis-Agent: A Multi-Agent Framework with Logic Rules for Reliable and Comprehensive Cross-Modal Data Visualization
Jinwei Lu, Yuanfeng Song, Chen Zhang, Raymond Chi-Wing Wong
摘要
Real-world visualization tasks involve complex, multi-modal requirements that extend beyond simple text-to-chart generation, requiring reference images, code examples, and iterative refinement. Current systems exhibit fundamental limitations: single-modality input, one-shot generation, and rigid workflows. While LLM-based approaches show potential for these complex requirements, they introduce reliability challenges including catastrophic failures and infinite loop susceptibility. To address this gap, we propose MultiVis-Agent, a logic rule-enhanced multi-agent framework for reliable multi-modal and multi-scenario visualization generation. Our approach introduces a four-layer logic rule framework that provides mathematical guarantees for system reliability while maintaining flexibility. Unlike traditional rule-based systems, our logic rules are mathematical constraints that guide LLM reasoning rather than replacing it. We formalize the MultiVis task spanning four scenarios from basic generation to iterative refinement, and develop MultiVis-Bench, a benchmark with over 1,000 cases for multi-modal visualization evaluation. Extensive experiments demonstrate that our approach achieves 75.63% visualization score on challenging tasks, significantly outperforming baselines (57.54-62.79%), with task completion rates of 99.58% and code execution success rates of 94.56% (vs. 74.48% and 65.10% without logic rules), successfully addressing both complexity and reliability challenges in automated visualization generation.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper17
- Natural Language to Visualization by Neural Machine TranslationYuyu Luo, Nan Tang, Guoliang Li, Jiawei Tang 等IEEE VIS 2021 · 被引用 145 次
- ReAcTable: Enhancing ReAct for Table Question AnsweringYunjia Zhang, Jordan Henkel, Avrilia Floratou, Joyce Cahoon 等VLDB 2024 · 被引用 120 次
- Synthesizing Natural Language to Visualization (NL2VIS) Benchmarks from NL2SQL BenchmarksYuyu Luo, Nan Tang, Guoliang Li, Chengliang Chai 等SIGMOD 2021 · 被引用 90 次
- InChorus: Designing Consistent Multimodal Interactions for Data Visualization on Tablet DevicesArjun Srinivasan, Bongshin Lee, Nathalie Henry Riche, Steven Mark Drucker 等CHI 2020 · 被引用 78 次
- Towards Natural Language-Based Visualization AuthoringYun Wang, Zhitao Hou, Leixian Shen, Tongshuang Wu 等IEEE VIS 2022 · 被引用 74 次
相关 Paper
- CoDA: Agentic Systems for Collaborative Data VisualizationZichen Chen, Jiefeng Chen, Sercan O Arik, Misha Sra 等ICLR 2026 · 被引用 14 次
- nvAgent: Automated Data Visualization from Natural Language via Collaborative Agent WorkflowGeliang Ouyang, Jingyao Chen, Zhihe Nie, Yi Gui 等ACL 2025 · 被引用 22 次
- Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from TextMizanur Rahman, Md. Tahmid Rahman Laskar, Shafiq Joty, Enamul HoqueEMNLP 2025 · 被引用 1 次
- From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical VisualizationHaonian Ji, Shi Qiu, Siyang Xin, Siwei Han 等ICLR 2026 · 被引用 6 次
- ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question AnsweringRachneet Kaur, Nishan Srishankar, Zhen Zeng, Sumitra GaneshACL 2026 · 被引用 5 次
