Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering
Inter-3D VQA:用于3D时空视觉问答的路侧多模态基准
机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院)
专题命中 视觉问答 :visual question answering(title,abstract);VLM(summary_cn,abstract_cn);MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 本文提出用于交叉口3D时空视觉问答的路侧多模态基准Inter-3D VQA,构建含40.7万问答对的数据集,提出基线模型Inter-Geo与评估框架Inter-Metrics,实验显示Inter-Geo在接地时空推理任务上优于基于图像的VLM。
Comments Accepted to EMNLP 2026 main conference