ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
ProMSA: 渐进式多模态搜索智能体用于基于知识的视觉问答
ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang
机构
*
OPPO AI Center, OPPO Inc. China(OPPO AI中心,OPPO公司)
;
The Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Nanyang Technological University, Singapore(新加坡南洋理工大学)
机构
*
School of Computer Science, Peking University(北京大学计算机科学学院)
;
School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)
;
School of Information, Renmin University of China(中国人民大学信息学院)
;
School of Integrated Circuit Science and Engineering, Beihang University(北京航空航天大学集成电路科学与工程学院)
机构
*
School of Computing and Communications(计算与通信学校)
;
Lancaster University(兰卡斯特大学)
;
Lancaster Medical School(兰卡斯特医学院)
;
PUC-Rio(里约热内卢联邦大学)
;
Puc-Behring Institute for AI(人工智能皮克林研究所)
机构
*
University of Macau(澳门大学)
;
UESTC(电子科技大学)
;
Purdue University(普渡大学)
;
McGill University(麦吉尔大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
University of Washington(华盛顿大学)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
机构
*
Division of Applied Chemistry, Faculty of Engineering, Hokkaido University(北海道大学工学部应用化学科)
;
Graduate School of Chemical Sciences and Engineering, Hokkaido University(北海道大学研究生院化学科学和工程学系)
;
Graduate School of Information Science and Technology, Hokkaido University(北海道大学研究生院信息科学和技术学系)
;
Quantum Nexus, Inc.
Representation geometry shapes task performance in vision-language modeling for CT enterography
表征几何形状任务性能在CT结肠镜视觉-语言建模中的作用
Cristian Minoccheri, Emily Wittrup, Kayvan Najarian, Ryan Stidham
机构
*
Gilbert S. Omenn Department of Computational Medicine and Bioinformatics(Gilbert S. Omenn 计算医学与生物信息学部门)
;
Department of Gastroenterology(消化内科部门)
;
Department of Emergency Medicine(急诊医学部门)
;
Department of Electrical Engineering and Computer Science(电气工程与计算机科学部门)
Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
Yuyang Hong, Jiaqi Gu, Qi Yang, Lubin Fan, Yue Wu, Ying Wang, Kun Ding, Shiming Xiang, Jieping Ye
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
;
Alibaba Cloud Computing(阿里巴巴云计算)
CommentsAccepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Tool Demonstration and Data Showcase Track
EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval
EvoGraph-R1:用于智能检索的自进化多模态知识超图
Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He
机构
*
Northwestern Polytechnical University(西北工业大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The University of Hong Kong(香港大学)
;
Monash University(莫纳什大学)
;
The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))
Evaluating Multimodal Large Language Models on Educational Textbook Question Answering
Hessa A. Alawwad, Anas Zafar, Areej Alhothali, Usman Naseem, Ali Alkhathlan, Amani Jamal
机构
*
Faculty of Computing and Information Technology(计算与信息科技学院)
;
King Abdulaziz University(阿卜杜勒阿齐兹大学)
;
FAST School of Computing(快速计算学院)
;
National University of Computer and Emerging Sciences(国家计算机与新兴科学大学)
;
School of Computing(计算学院)
;
Macquarie University(麦考瑞大学)
;
Center of Research Excellence in AI and Data Science(人工智能与数据科学卓越研究中心)
Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval
解锁多模态文档智能:从当前成就到视觉文档检索的未来前沿
Yibo Yan, Jiahao Huo, Guanbo Feng, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Yuanhuiyi Lyu, Yu Huang, Jungang Li, Kening Zheng, Xu Zheng, Philip S. Yu, James Kwok, Xuming Hu
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Alibaba Cloud Computing(阿里云计算)
;
Hong Kong University of Science and Technology(香港科技大学)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World
务实型机器人:通过体验现实世界学习任务规划
Kaixian Qu, Guowei Lan, René Zurbrügg, Changan Chen, Christopher E. Mower, Haitham Bou-Ammar, Marco Hutter
机构
*
Robotic Systems Lab, ETH Zürich(瑞士联邦理工学院机器人系统实验室)
;
ETH AI Center, ETH Zürich(瑞士联邦理工学院人工智能中心)
;
Huawei Noah’s Ark Lab, London, UK(华为诺亚实验室,伦敦,英国)
;
UCL Centre for AI, London, UK(伦敦大学学院人工智能中心)