机构
*
Tsinghua University(清华大学)
;
Hefei University of Technology(合肥工业大学)
;
University of Arizona(亚利桑那大学)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
通过交错多模态推理的视觉-反图形代理
Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang, Chenyang Wang, Xiuyu Li, Michael J. Black, Trevor Darrell, Angjoo Kanazawa, Haiwen Feng
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)
;
Impossible, Inc.(Impossible公司)
Evidence-based diagnostic reasoning with multi-agent copilot for human pathology
基于多智能体助手的证据驱动诊断推理
Luca L. Weishaupt, Chengkuan Chen, Drew F. K. Williamson, Richard J. Chen, Guillaume Jaume, Tong Ding, Bowen Chen, Anurag Vaidya, Long Phi Le, Guillaume Jaume, Ming Y. Lu, Faisal Mahmood
机构
*
Health Sciences and Technology, Harvard-MIT(哈佛-MIT健康科学与技术)
;
Department of Pathology, Massachusetts General Hospital, Harvard Medical School(麻省总医院病理科,哈佛医学院)
;
Cancer Program, Broad Institute of Harvard and MIT(哈佛-MIT博德研究所癌症项目)
;
Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院)
;
Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(麻省理工学院电气工程与计算机科学)
;
Harvard Data Science Initiative, Harvard University(哈佛大学数据科学计划)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
CommentsPlease cite the definitive, copyrighted, and peer-reviewed version of this article published in AAAI 2026, edited by Sven Koenig et al., AAAI Press, Vol. 40, No. 36, Technical Track, pp. 30726-30734, 2026. DOI: https://doi.org/10.1609/aaai.v40i36.40329
机构
*
Lehigh University(里海大学)
;
Squirrel Ai Learning(松鼠AI学习)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Michigan State University(密歇根州立大学)
专题命中
视觉推理
:visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
ReXInTheWild: A Unified Benchmark for Medical Photograph Understanding
ReXInTheWild:医疗照片理解的统一基准
Oishi Banerjee, Sung Eun Kim, Alexandra N. Willauer, Julius M. Kernbach, Abeer Rihan Alomaish, Reema Abdulwahab S. Alghamdi, Hassan Rayhan Alomaish, Mohammed Baharoon, Xiaoman Zhang, Julian Nicolas Acosta, Christine Zhou, Pranav Rajpurkar
机构
*
Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系)
;
National Strategic Technology Research Institute, Seoul National University Hospital(首尔国立大学医院国家战略技术研究所)
;
Department of Medicine, Division of Gastroenterology, Massachusetts General Hospital(麻省总医院内科与消化内科部门)
;
Department of Neuroradiology, Heidelberg University Hospital(海德堡大学医院神经放射科部门)
;
King Abdulaziz Medical City, National Guard Health Affairs(国王阿卜杜勒-阿齐兹医疗城,国民守卫健康事务局)
;
Division of Pulmonary, Critical Care, and Sleep Medicine, University of Cincinnati(辛辛那提大学肺科、重症医学及睡眠医学部门)
专题命中
视觉推理
:vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
Yejie Guo, Yunzhong Hou, Wufei Ma, Meng Tang, Ming-Hsuan Yang
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Beijing Institute of Technology(北京理工大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of California Merced(加州大学默塞德分校)
PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions
PoSh:利用场景图引导LLM-as-a-Judge进行详细图像描述
Amith Ananthram, Elias Stengel-Eskin, Lorena A. Bradford, Julia Demarest, Adam Purvis, Keith Krut, Robert Stein, Rina Elster Pantalony, Mohit Bansal, Kathleen McKeown
机构
*
Columbia University(哥伦比亚大学)
;
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
The National Gallery of Art(国家艺术馆)
;
UCLA(加州大学洛杉矶分校)
;
UNC Chapel Hill(北卡罗来纳大学教堂山分校)
SurGo-R1: Benchmarking and Modeling Contextual Reasoning for Operative Zone in Surgical Video
SurGo-R1:手术视频中操作区的上下文推理基准测试与建模
Guanyi Qin, Xiaozhen Wang, Zhu Zhuo, Chang Han Low, Yuancan Xiao, Yibing Fu, Haofeng Liu, Kai Wang, Chunjiang Li, Yueming Jin
机构
*
National University of Singapore, Singapore(新加坡国立大学)
;
Southern Medical University, China(南方医科大学)
;
Guangzhou Research Translation and Innovation Institute, National University of Singapore, China(广州研究翻译与创新研究院,新加坡国立大学,中国)
机构
*
College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海交通大学医学院健康科学与技术学院)
;
Fudan University, Shanghai, China(复旦大学)
;
Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
;
Tsinghua University, Beijing, China(清华大学)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)
;
The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)
;
Ruijin Hospital, Shanghai Jiaotong University, Shanghai, China(上海交通大学瑞金医院)
专题命中
视觉推理
:grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Chatting with Images for Introspective Visual Thinking
与图像对话以进行反思性视觉思维
Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan
机构
*
NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Nanjing University(南京大学)
UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science
UrbanGraphEmbeddings: 学习和评估空间导向的多模态嵌入用于城市科学
Jie Zhang, Xingtong Yu, Yuan Fang, Rudi Stouffs, Zdravko Trivic
机构
*
National University of Singapore Department of Architecture Singapore
;
The Chinese University of Hong Kong Dept of Systems Eng. \& Eng. Mgmt. China
;
Singapore Management University School of Computing \& Info. Systems Singapore
;
National University of Singapore
;
Department of Architecture
;
The Chinese University of Hong Kong
;
Singapore Management University