ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China
ChinaHeritaQA:面向中国世界遗产地的文化基础视觉问答数据集
Yi Zhang, Bolei Ma, Yong Cao, Chengyan Wu, Daniel Hershcovich, Anna-Carolina Haensch
机构
*
LMU Munich(慕尼黑大学)
;
FAU Erlangen-Nuremberg(埃尔朗根-纽伦堡大学)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
University of Tübingen & Tübingen AI Center(图宾根大学与图宾根人工智能中心)
;
Sun Yat-sen University(中山大学)
;
University of Copenhagen(哥本哈根大学)
;
University of Maryland, College Park(马里兰大学帕克分校)
OmniTraffic: A Controllable Generation Pipeline and Benchmark for Spatio-Temporal Traffic Reasoning
OmniTraffic:面向时空交通推理的可控生成流水线与基准
Maonan Wang, Zhengyan Huang, Kemou Jiang, Yuhang Fu, Jiayue Zhu, Yuxin Cai, Xingchen Zou, Qiaosheng Zhang, Yi Yu, Ding Wang, Xi Chen, Ben M. Chen, Yuxuan Liang, Zhiyong Cui, Man On Pun, Yirong Chen
机构
*
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shanghai AI Lab(上海人工智能实验室)
;
Beihang University(北京航空航天大学)
;
Nanyang Technological University(南洋理工大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
The Chinese University of Hong Kong(香港中文大学)
SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity
SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解
Tianchen Guo, Chen Liu, Ling Chen, Xin Yu
机构
*
The University of Queensland(昆士兰大学)
;
Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所)
;
University of Technology Sydney(悉尼科技大学)
;
Follow Me AI Pty LTD(Follow Me AI有限公司)
专题命中
视觉问答
:MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV
Diagnosing Dense Same-Class Attribute Misbinding in Large Vision-Language Models
诊断大视觉语言模型中的密集同类属性绑定错误
Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Yuteng Xiao, Sixue Lin
机构
*
Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))
;
China Telecom Digital Intelligence Technology Co., Ltd.(中国电信数字智能科技有限公司)
;
Shenyang Aerospace University(沈阳航空航天大学)
;
University of Nottingham Ningbo China(宁波诺丁汉大学)
ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
ProMSA: 渐进式多模态搜索智能体用于基于知识的视觉问答
ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang
机构
*
OPPO AI Center, OPPO Inc. China(OPPO AI中心,OPPO公司)
;
The Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Nanyang Technological University, Singapore(新加坡南洋理工大学)
机构
*
University at Buffalo(布法罗大学)
;
NEC Laboratories America(美国 NEC 实验室)
;
Adobe Research(奥多比研究院)
;
Iowa State University(爱荷华州立大学)
;
New York University(纽约大学)