Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures
Rahul Raja, Arpita Vats
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
Boston University(波士顿大学)
专题命中
视觉问答
:grounding(abstract);分类 cs.CV、cs.LG
CommentsIn Proceedings of the 2nd ACM Workshop in AI-powered Question and Answering Systems (AIQAM '25), October 27-28, 2025, Dublin, Ireland. ACM, New York, NY, USA, 8 pages. https://doi.org/10.1145/3746274.3760393
机构
*
New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别实验室)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Kling Team, Kuaishou Technology(快手科技 Kling 团队)
;
Peking University(北京大学)
;
Nanjing University(南京大学)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.CV、cs.AI
Warehouse Spatial Question Answering with LLM Agent
Hsiang-Wei Huang, Jen-Hao Cheng, Kuang-Ming Chen, Cheng-Yen Yang, Bahaa Alattar, Yi-Ru Lin, Pyongkun Kim, Sangwon Kim, Kwangju Kim, Chung-I Huang, Jenq-Neng Hwang
机构
*
Information Processing Lab, University of Washington, USA(华盛顿大学信息处理实验室)
;
Electronics and Telecommunications Research Institute, South Korea(韩国电子电信研究院)
;
National Center for High-performance Computing, Taiwan(台湾高性能计算国家研究中心)
专题命中
视觉问答
:MLLM(abstract);分类 cs.CV、cs.AI
Comments1st Place Solution of the 9th AI City Challenge Track 3
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
Yan Zhang, Gangyan Zeng, Daiqing Wu, Huawen Shen, Binbin Li, Yu Zhou, Can Ma, Xiaojun Bi
机构
*
Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences Beijing China
;
School of Cyber Science
;
Engineering, Nanjing University of Science
;
VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University Tianjin China
;
Key Laboratory of Ethnic Language Intelligent Analysis
;
Security Governance of MOE, Minzu University of China Beijing China
;
Institute of Information Engineering, Chinese Academy of Sciences
;
School of Cyber Security, University of Chinese Academy of Sciences
;
VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University
;
Security Governance of MOE, Minzu University of China
Unifying Biomedical Vision-Language Expertise: Towards a Generalist Foundation Model via Multi-CLIP Knowledge Distillation
Shansong Wang, Zhecheng Jin, Mingzhe Hu, Mojtaba Safari, Feng Zhao, Chih-Wei Chang, Richard LJ Qiu, Justin Roper, David S. Yu, Xiaofeng Yang
机构
*
Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院)
;
Department of Biomedical Engineering, College of Engineering, Georgia Institute of Technology(生物医学工程系,工程学院,佐治亚理工学院)
;
Department of Computer Science and Mathematics, Laney Graduate School, Emory University(计算机科学与数学系,兰尼研究生院,埃默里大学)
;
School of Electrical and Computer Engineering, College of Engineering, Georgia Institute of Technology(电气与计算机工程系,工程学院,佐治亚理工学院)
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
School of Computer Science, Fudan University(复旦大学计算机学院)
;
National Biomedical Imaging Center, College of Future Technology, Peking University(北京大学未来技术学院生物医学成像中心)
;
Ruijin Hospital, Shanghai Jiaotong University School of Medicine(上海交通大学医学院瑞金医院)
;
Department of Pathology, State Key Laboratory of Cancer Biology, Xijing Hospital(西京医院病理科,癌症生物学国家重点实验室)
;
Department of Computer Science, Rutgers University(罗格斯大学计算机科学系)