EMMA: Extracting Multiple physical parameters from Multimodal Data
Farhat Shaikh, Ayan Banerjee, Sandeep Gupta
Abstract
We introduce EMMA, a physics-informed multimodal framework that recovers all identifiable dynamical parameters of a system directly from raw video, audio, and image-based time-series observations. Unlike prior video-only approaches that struggle with occluded states, hidden actuation inputs, or assumptions about known initial conditions and coordinate frames, EMMA performs joint inference of explicit parameters, implicit dynamical components, and calibration invariants within a unified continuous-time model. EMMA leverages a Liquid Time-Constant (LTC) network to learn latent dynamics from heterogeneous modalities while a physics-constrained loss enforces consistency with the governing differential equations. A unified feature pipeline enables consistent alignment across video trajectories, acoustic signatures, and chart-derived measurements, allowing EMMA to estimate parameters under forced, implicit, and multivariate dynamics without requiring segmentation masks, differentiable rendering, or specialized sensors. Across 100+ scenarios including five standard dynamical benchmarks (75 Delfys videos), real-world rover and quadrotor systems with hidden inputs, and simulation-chart case studies spanning biological and chaotic systems EMMA delivers robust multi-parameter recovery and significantly outperforms existing single-modality and equation-discovery baselines. Our results establish EMMA as a general, scalable solution for physics-consistent model extraction from opportunistic multimodal data.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext c4ceecc0-b8f2-4503-9952-673f2f1998dfBuilds on4
- Liquid Time-constant NetworksRamin M. Hasani, Mathias Lechner, Alexander Amini, Daniela Rus et al.AAAI 2021 · 399 citations
- Physics-as-Inverse-Graphics: Unsupervised Physical Parameter Estimation from VideoMiguel Jaques, Michael Burke, Timothy M. HospedalesICLR 2020 · 58 citations
- RISP: Rendering-Invariant State Predictor with Differentiable Simulation and Rendering for Cross-Domain Parameter EstimationPingchuan Ma, Tao Du, Joshua B. Tenenbaum, Wojciech Matusik et al.ICLR 2022 · 36 citations
- Learning Physics From Video: Unsupervised Physical Parameter Estimation for Continuous Dynamical SystemsAlejandro Castañeda Garcia, Jan Warchocki, Jan van Gemert, Daan Brinks et al.CVPR 2025
Related papers
- Physics from Video: Identifiability of Time-Invariant Second-Order ODEs under Minimal Trajectory ConditionsYuanyuan Wang, Wenjie Wang, Kun Zhang, Mingming GongICML 2026
- Pixel2Phys: Distilling Governing Laws from Visual DynamicsRuikun Li, Jun Yao, Yingfan Hua, Shixiang Tang et al.CVPR 2026 · 2 citations
- Learning Physics Constrained Dynamics Using AutoencodersTsung-Yen Yang, Justinian Rosca, Karthik Narasimhan, Peter J. RamadgeNeurIPS 2022 · 39 citations
- Multitask Multimodal Prompted Training for Interactive Embodied Task CompletionGeorgios Pantazopoulos, Malvina Nikandrou, Amit Parekh, Bhathiya Hemanthage et al.EMNLP 2023 · 1 citation
- Symplectic ODE-Net: Learning Hamiltonian Dynamics with ControlYaofeng Desmond Zhong, Biswadip Dey, Amit ChakrabortyICLR 2020 · 319 citations
