arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-25 至 2025-08-25 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2508.16148 2025-08-25 cs.IR cs.CL cs.MM 81%

Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering

Ao Zhou, Zebo Gu, Tenghao Sun, Jiawen Chen, Mingsheng Tu, Zifeng Cheng, Yafeng Yin, Zhiwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments This paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11695 2025-08-25 cs.CV cs.CL cs.MM 80%

Interpreting the linear structure of vision-language model embedding spaces

Isabel Papadimitriou, Huangyuan Su, Thomas Fel, Sham Kakade, Stephanie Gil

机构 * Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学自然与人工智能研究所) Department of Computer Science, Harvard University(哈佛大学计算机科学系)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16569 2025-08-25 eess.IV cs.AI cs.CV 62%

A Disease-Centric Vision-Language Foundation Model for Precision Oncology in Kidney Cancer

Yuhui Tao, Zhongwei Zhao, Zilong Wang, Xufang Luo, Feng Chen, Kang Wang, Chuanfu Wu, Xue Zhang, Shaoting Zhang, Jiaxi Yao, Xingwei Jin, Xinyang Jiang, Yifan Yang, Dongsheng Li, Lili Qiu, Zhiqiang Shao, Jianming Guo, Nengwang Yu, Shuo Wang, Ying Xiong

机构 * Digital Medical Research Center, School of Basic Medical Sciences, Fudan University, Shanghai, 200032, China(复旦大学基础医学学院数字医学研究中心) Shanghai Key Laboratory of Medical Imaging Computing and Computer Assisted Intervention, Shanghai, 200032, China(上海市医疗影像计算与计算机辅助干预重点实验室) Department of Urology, Qilu Hospital of Shandong University, Jinan, Shandong, 250012, China(山东大学齐鲁医院泌尿科) Microsoft Research Asia, Shanghai, 200232, China(微软亚洲研究院) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine, Hangzhou, 310006, China(浙江大学医学院附属第一医院放射科) Center of Health data science, Linyi People’s Hospital, Shandong, 276003, China(临沂人民医院健康数据科学中心) Shandong Open Laboratory of Data Innovation Application, Shandong, 276003, China(山东省数据创新应用开放实验室) Department of Radiology, the First People’s Hospital of Lianyungang, Lianyungang, 222002, China(连云港第一人民医院放射科) Department of Urology, Zhangye People’s Hospital affiliated to Hexi University, Zhangye, 734000, China(张掖人民医院(河西大学附属)泌尿科) Department of Urology, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, 200025, China(上海交通大学附属瑞金医院泌尿科) Department of Urology, Linyi People’s Hospital, Shandong, 276003, China(临沂人民医院泌尿科) Department of Urology, Zhongshan Hospital, Fudan University, Shanghai, 200032, China(复旦大学中山医院泌尿科)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01225 2025-08-25 cs.CV cs.AI 62%

Multi-Cache Enhanced Prototype Learning for Test-Time Generalization of Vision-Language Models

Xinyu Chen, Haotian Zhai, Can Zhang, Xiupeng Shi, Ruirui Li

机构 * Shanghai University(上海大学) Beijing University of Chemical Technology(北京化工大学) University of Minnesota(明尼苏达大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16292 2025-08-25 cs.AI cs.RO 57%

Do What? Teaching Vision-Language-Action Models to Reject the Impossible

Wen-Han Hsieh, Elvis Hsieh, Dantong Niu, Trevor Darrell, Roei Herzig, David M. Chan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏