arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-04 至 2025-11-04 共收录 25 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 25 篇

2511.01618 2025-11-04 cs.CV cs.CL 84%

Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models

Xiaoyu Zhan, Wenxuan Huang, Hao Sun, Xinyu Fu, Changfeng Ma, Shaosheng Cao, Bohan Jia, Shaohui Lin, Zhenfei Yin, Lei Bai, Wanli Ouyang, Yuanqi Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学) Xiaohongshu Inc.(小红书公司) East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00502 2025-11-04 cs.CV cs.CL 84%

ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers

Qianhao Yuan, Qingyu Zhang, Yanjiang Liu, Jiawei Chen, Yaojie Lu, Hongyu Lin, Jia Zheng, Xianpei Han, Le Sun

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

Comments Published as a conference paper at ICCV 2025. Project page: https://github.com/icip-cas/ShortV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00020 2025-11-04 cs.AI cs.CL cs.CV 82%

Multimodal Detection of Fake Reviews using BERT and ResNet-50

Suhasnadh Reddy Veluru, Sai Teja Erukude, Viswa Chaitanya Marella

机构 * College of Business Administration Kansas State University Manhattan, USA(商学院学院 华盛顿州立大学 曼哈顿 美国) Department of Computer Science Kansas State University Manhattan, USA(计算机科学系 华盛顿州立大学 曼哈顿 美国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Published in IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00004 2025-11-04 cs.CY cs.AI cs.CL cs.CV 82%

Multimodal Learning with Augmentation Techniques for Natural Disaster Assessment

Adrian-Dinu Urse, Dumitru-Clementin Cercel, Florin Pop

机构 * Romanian Hub for Artificial Intelligence - HRIA(罗马尼亚人工智能枢纽 - HRIA)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at 2025 IEEE 21st International Conference on Intelligent Computer Communication and Processing (ICCP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13063 2025-11-04 cs.CV cs.CL 81%

PRISM2: Unlocking Multi-Modal General Pathology AI with Clinical Dialogue

Eugene Vorontsov, George Shaikovski, Adam Casson, Julian Viret, Eric Zimmermann, Neil Tenenholtz, Yi Kan Wang, Jan H. Bernhard, Ran A. Godrich, Juan A. Retamero, Jinru Shia, Mithat Gonen, Martin R. Weiser, David S. Klimstra, Razik Yousfi, Nicolo Fusi, Thomas J. Fuchs, Kristen Severson, Siqi Liu

机构 * Paige, NYC, NY United States(美国纽约市帕伊公司) Microsoft Research, Cambridge, MA United States(微软研究院) Memorial Sloan Kettering Cancer Center, NYC, NY United States(纪念斯隆凯特林癌症中心) University of Yale, New Haven, CT United States(耶鲁大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01468 2025-11-04 cs.LG cs.AI 79%

DAMBench: A Multi-Modal Benchmark for Deep Learning-based Atmospheric Data Assimilation

Hao Wang, Zixuan Weng, Jindong Han, Wei Fan, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19954 2025-11-04 cs.AI cs.DB cs.LG 79%

RELATE: A Schema-Agnostic Perceiver Encoder for Multimodal Relational Graphs

Joe Meyer, Divyansha Lachi, Mahmoud Mohammadi, Roshan Reddy Upendra, Eva L. Dyer, Mark Li, Tom Palczewski

机构 * SAP Palo Alto, CA, USA(SAP帕洛阿尔托分校) University of Pennsylvania(宾夕法尼亚大学) SAP Seattle, WA, USA(SAP西雅图分校)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.AI

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01186 2025-11-04 cs.RO cs.CV 79%

LiDAR-VGGT: Cross-Modal Coarse-to-Fine Fusion for Globally Consistent and Metric-Scale Dense Mapping

Lijie Wang, Lianjie Guo, Ziyi Xu, Qianhao Wang, Fei Gao, Xieyuanli Chen

机构 * State Key Laboratory of Industrial Control Technology, Institute of Cyber-Systems and Control, Zhejiang University(工业控制技术国家重点实验室,系统与控制研究院,浙江大学) Differential Robot Technology Co., Ltd.(差分机器人技术有限公司) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00584 2025-11-04 cs.IR cs.CL 79%

Structurally Refined Graph Transformer for Multimodal Recommendation

Ke Shi, Yan Zhang, Miao Zhang, Lifan Chen, Jiali Yi, Kui Xiao, Xiaoju Hou, Zhifei Li

机构 * School of Computer Science, Hubei University(湖北大学计算机学院) Hubei Key Laboratory of Big Data Intelligent Analysis and Application, Hubei University(湖北大学大数据智能分析与应用重点实验室) Key Laboratory of Intelligent Sensing System and Security (Hubei University), Ministry of Education(智能传感系统与安全重点实验室(湖北大学)) Institute of Vocational Education, Guangdong Industry Polytechnic University(广东职业技术学院教育学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments Comment: 13 pages, 7 figures, accepted by IEEE Transactions on Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00424 2025-11-04 cs.AI 79%

A Multimodal Framework for Depression Detection during Covid-19 via Harvesting Social Media: A Novel Dataset and Method

Ashutosh Anshul, Gumpili Sai Pranav, Mohammad Zia Ur Rehman, Nagendra Kumar

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Journal ref IEEE Transactions on Computational Social Systems, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00389 2025-11-04 cs.CV 79%

Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond

Fan Zhang, Haoxuan Li, Shengju Qian, Xin Wang, Zheng Lian, Hao Wu, Zhihong Zhu, Yuan Gao, Qiankun Li, Yefeng Zheng, Zhouchen Lin, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tencent(腾讯) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Westlake University(西湖大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01406 2025-11-04 eess.SP 78%

AoI-Aware Machine Learning for Constrained Multimodal Sensing-Aided Communications

Abolfazl Zakeri, Nhan Thanh Nguyen, Ahmed Alkhateeb, Markku Juntti

专题命中 多模态评测 :multimodal(title,abstract)

Comments Submitted to an IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01318 2025-11-04 cs.CE 78%

CSMD: Curated Multimodal Dataset for Chinese Stock Analysis

Yu Liu, Zhuoying Li, Ruifeng Yang, Fengran Mo, Cen Chen

专题命中 多模态评测 :multimodal(title,abstract)

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22810 2025-11-04 cs.CV 70%

VidText: Towards Comprehensive Evaluation for Video Text Understanding

Zhoufaran Yang, Yan Shu, Jing Wang, Zhifei Yang, Yan Zhang, Yu Li, Keyang Lu, Gangyan Zeng, Shaohui Liu, Yu Zhou, Nicu Sebe

机构 * UNITN HIT(哈尔滨工业大学) SEU(上海电子大学) PKU(北京大学) IIE, CAS(中国科学院信息工程研究所) UCAS(中国科学院大学) BUAA(北京航空航天大学) NJUST(南京理工大学) NKU(宁夏大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08221 2025-11-04 cs.CV cs.AI cs.MM 67%

EgoBlind: Towards Egocentric Visual Assistance for the Blind

Junbin Xiao, Nanxin Huang, Hao Qiu, Zhulin Tao, Xun Yang, Richang Hong, Meng Wang, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Communication University of China(中国传媒大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technoloy(合肥工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments NeurIPS'25 (D&B Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17050 2025-11-04 cs.CL cs.AI cs.CE cs.CY cs.MM 67%

Towards Robust Evaluation of STEM Education: Leveraging MLLMs in Project-Based Learning

Xinyi Wu, Yanhao Jia, Qinglin Zhang, Yiran Qin, Luwei Xiao, Shuai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00509 2025-11-04 cs.AI cs.CL cs.LG 62%

Recitation over Reasoning: How Cutting-Edge Language Models Can Fail on Elementary School-Level Reasoning Problems?

Kai Yan, Yufei Xu, Zhengyin Du, Xuesong Yao, Zheyu Wang, Xiaowen Guo, Jiecao Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 3 figures, 13 tables. The paper is accepted at AACL-IJCNLP 2025 (main track), and the latest version adds modifications in camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01000 2025-11-04 cs.CV cs.LG 57%

Integrating Visual and X-Ray Machine Learning Features in the Study of Paintings by Goya

Hassan Ugail, Ismail Lujain Jaleel

机构 * Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心) University of Bradford(布拉德福德大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00598 2025-11-04 eess.IV cs.CV 57%

GDROS: A Geometry-Guided Dense Registration Framework for Optical-SAR Images under Large Geometric Transformations

Zixuan Sun, Shuaifeng Zhi, Ruize Li, Jingyuan Xia, Yongxiang Liu, Weidong Jiang

机构 * College of Electronic Science and Technology, National University of Defense Technology(电子科学与技术学院,国防科技大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

Comments To be published in IEEE Transactions on Geoscience and Remote Sensing (T-GRS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25173 2025-11-04 cs.CV 57%

D$^2$GS: Dense Depth Regularization for LiDAR-free Urban Scene Reconstruction

Kejing Xia, Jidong Jia, Ke Jin, Yucai Bai, Li Sun, Dacheng Tao, Youjian Zhang

机构 * Wuhan University(武汉大学) Shanghai Jiaotong University(上海交通大学) TongJi University(同济大学) Bosch(博世) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10797 2025-11-04 physics.med-ph cs.CV 57%

Modality-AGnostic Image Cascade (MAGIC) for Multi-Modality Cardiac Substructure Segmentation

Nicholas Summerfield, Qisheng He, Alex Kuo, Ahmed I. Ghanem, Simeng Zhu, Chase Ruff, Joshua Pan, Anudeep Kumar, Prashant Nagpal, Jiwei Zhao, Ming Dong, Carri K. Glide-Hurst

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07769 2025-11-04 cs.CV 57%

BiMediX2: Bio-Medical EXpert LMM for Diverse Medical Modalities

Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Sara Pieri, Saeed Yahya Alseiari, Shanavas Cholakkal, Khaled Aldahmani, Fahad Khan, Rao Anwer, Salman Khan, Timothy Baldwin, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence(Mohamed Bin Zayed大学人工智能学院) Linköping University(林肯大学) Shaikh Tahnoon bin Mohammed Medical City(Shaikh Tahnoon bin Mohammed医疗城) Tawam Hospital(Tawam医院) Sheikh Shakhbout Medical City(Sheikh Shakhbout医疗城) Govt Medical College Kozhikode(科钦政府医学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments Accepted to EMNLP 2025 (Findings)

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 14051-14071

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04944 2025-11-04 cs.RO cs.LG 50%

MarsLGPR: Mars Rover Localization with Ground Penetrating Radar

Anja Sheppard, Katherine A. Skinner

机构 * University of Michigan Robotics Department(密歇根大学机器人学系) University of Michigan Space Institute(密歇根大学太空研究所)

专题命中 多模态评测 :multi-modal(abstract)

Comments IEEE Transactions on Field Robotics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06289 2025-11-04 q-fin.PM cs.LG q-fin.PR 50%

Automate Strategy Finding with LLM in Quant Investment

Zhizhuo Kou, Holam Yu, Junyu Luo, Jingshu Peng, Xujia Li, Chengzhong Liu, Juntao Dai, Lei Chen, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00042 2025-11-04 cs.NE 50%

Bio-Inspired Neuron Synapse Optimization for Adaptive Learning and Smart Decision-Making

Sreeja Singh, Tamal Ghosh

专题命中 多模态评测 :multimodal(abstract)

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏