arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-26 至 2026-01-26 共收录 42 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2601.16218 2026-01-26 cs.CL cs.AI 81%

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

M3Kang: 评估视觉-语言模型在多语言多模态数学推理中的表现

Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 M3Kang是一个大规模多语言多模态数学推理数据集,用于评估视觉-语言模型在多语言数学推理中的表现,通过基准测试揭示模型在基础数学和图表推理上的不足,并展示多语言技术在多模态设置中的有效性。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16973 2026-01-26 cs.CV 74%

VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents

VisGym: 多模态代理的多样化、可定制化、可扩展环境

Zirui Wang, Junyi Zhang, Jiaxin Ge, Long Lian, Letian Fu, Lisa Dunlap, Ken Goldberg, XuDong Wang, Ion Stoica, David M. Chan, Sewon Min, Joseph E. Gonzalez

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 VisGym通过多样化环境评估多模态代理在多步视觉决策中的表现,揭示模型在长上下文处理和视觉化任务中的局限性。

Comments Project page: https://visgym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16394 2026-01-26 cs.CV cs.AI 73%

ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation

ResAgent:基于熵的先验点发现与视觉推理的指称表达分割

Yihao Wang, Jusheng Zhang, Ziyi Tang, Keze Wang, Meng Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 ResAgent通过熵引导的点发现和视觉推理方法,提升指称表达分割的准确性与效率。

Comments 23 pages, 7gigures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16895 2026-01-26 cs.CV cs.AI 62%

Evaluating Large Vision-language Models for Surgical Tool Detection

评估大型视觉-语言模型用于手术工具检测

Nakul Poudel, Richard Simon, Cristian A. Linte

机构 * Rochester Institute of Technology(罗切斯特理工大学) Center for Imaging Science(成像科学中心) Center for Imaging Science and Biomedical Engineering(成像科学与生物医学工程中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究评估了三种大型视觉-语言模型在手术工具检测任务中的性能,发现Qwen2.5在检测和泛化能力上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2601.16547 2026-01-26 cs.SD cs.AI eess.AS 81%

CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation

CORD:通过加权在线跨模态蒸馏弥合音频-文本推理差距

Jing Hu, Danxiang Zhu, Xianlong Luo, Dan Zhang, Shuwei He, Yishu Lei, Haitao Zheng, Shikun Feng, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.AI、eess.AS

AI总结 CORD通过加权在线跨模态蒸馏方法,有效弥合音频与文本推理之间的差距,提升音频条件推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16231 2026-01-26 cs.SD cs.AI cs.CL cs.LG eess.AS 80%

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19469 2026-01-26 cs.SD cs.MM 70%

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

MusiCRS:面向音频导向的对话推荐基准测试

Rohan Surana, Amit Namburi, Gagan Mundada, Abhay Lal, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego, USA(加州大学圣地亚哥分校)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM

AI总结 MusiCRS通过链接Reddit用户对话与音乐曲目,为音频导向的对话推荐提供首个基准测试,揭示了跨模态整合的局限性,并释放了相关数据集和代码以促进研究进展。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16225 2026-01-26 eess.AS cs.AI cs.SD 62%

ES4R: Speech Encoding Based on Prepositive Affective Modeling for Empathetic Response Generation

基于前置情感建模的语音编码用于共情响应生成

Zhuoyue Gao, Xiaohui Wang, Xiaocui Yang, Wen Zhang, Daling Wang, Shi Feng, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 ES4R通过前置情感建模和双层注意力机制,提升语音对话中的共情响应生成能力,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14357 2026-01-26 astro-ph.IM 50%

One Attempt at Building an Inclusive & Accessible Hybrid Astronomy Conference: FRB 2025

一次构建包容与可及性混合天文学会议的尝试:FRB 2025

Alice P. Curtin, Reshma Anna-Thomas, Amanda M. Cook, Carolina Cruz-Vinaccia, Jason Hessels, Robert Main, Inés Pastor Marazuela, Lauren Rhodes, Vishwangi Shah

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 FRB 2025会议通过混合模式、低费用和教育活动,为早期研究人员和欠资地区提供可及性,展示了低成本高包容性的会议可能性。

Comments 10 pages, 4 figures; Conference Reflection

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2601.16652 2026-01-26 cs.CV cs.NE 57%

Reliable Brain Tumor Segmentation Based on Spiking Neural Networks with Efficient Training

基于高效训练的脉冲神经网络的可靠脑肿瘤分割

Aurora Pia Ghiardelli, Guangzhi Tang, Tao Sun

机构 * Department of Advanced Computing Sciences, Maastricht University, Maastricht, The Netherlands(先进计算科学系,马斯特里赫特大学,马斯特里赫特,荷兰)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于高效训练的脉冲神经网络框架,用于可靠且节能的3D脑肿瘤分割,实验显示在准确性、不确定性校准和计算成本降低方面均表现优异。

Comments Accepted at ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16079 2026-01-26 cs.CV 57%

Masked Modeling for Human Motion Recovery Under Occlusions

遮蔽建模用于遮挡下的人体运动恢复

Zhiyin Qian, Siwei Zhang, Bharat Lal Bhatnagar, Federica Bogo, Siyu Tang

机构 * ETH Zürich(苏黎世联邦理工学院) Meta Reality Labs(Meta现实实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MoRo通过遮蔽建模方法,在遮挡条件下实现高效且鲁棒的人体运动恢复,结合多模态先验提升推理性能。

Comments Project page: https://mikeqzy.github.io/MoRo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08957 2026-01-26 cs.LG cs.AI 57%

LUMOS: Large User MOdels for User Behavior Prediction

LUMOS:大规模用户模型用于用户行为预测

Dhruv Nigam, Naman Agarwal, Krishna Murthy, Susmit Saha

机构 * Dream11 Dream Sports

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 LUMOS通过基于Transformer的架构,利用原始用户活动数据联合学习多个任务,实现用户行为预测的高效与准确,提升业务指标。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2410.02729 2026-01-26 cs.CL cs.AI cs.IR 81%

Unified Multimodal Interleaved Document Representation for Retrieval

统一多模态交错文档表示用于检索

Jaewoo Lee, Joonho Ko, Jinheon Baek, Soyeong Jeong, Sung Ju Hwang

机构 * University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校) KAIST(韩国科学技术院) DeepAuto

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出统一多模态交错文档表示方法,通过整合文本、图像和表格信息提升信息检索性能。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10004 2026-01-26 cs.AI cs.CL 62%

Exploring LLMs for Scientific Information Extraction Using The SciEx Framework

探索使用SciEx框架利用大语言模型进行科学信息提取

Sha Li, Ayush Sadekar, Nathan Self, Yiqi Su, Lars Andersland, Mira Chaplin, Annabel Zhang, Hyoju Yang, James B Henderson, Krista Wigginton, Linsey Marr, T. M. Murali, Naren Ramakrishnan

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SciEx框架,通过解耦关键组件提升科学信息提取的准确性和一致性,评估结果显示其在多科学领域中的有效性。

Comments Accepted to the KGML Bridge at AAAI 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16582 2026-01-26 cs.CV 57%

X-Aligner: Composed Visual Retrieval without the Bells and Whistles

X-Aligner:无需炫技的组合视觉检索

Yuqian Zheng, Mariana-Iuliana Georgescu

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 X-Aligner通过结合视觉和文本查询,提升视频检索性能,采用多阶段训练和交叉注意力模块实现更优的多模态表示对齐。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00243 2026-01-26 cs.CV 57%

VOCAL: Visual Odometry via ContrAstive Learning

基于对比学习的视觉里程计:VOCAL

Chi-Yao Huang, Zeel Bhatt, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 VOCAL通过对比学习将视觉里程计重新定义为标签排序问题,提升可解释性和灵活性,推动更通用的空间智能发展。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13223 2026-01-26 cs.LG 50%

Data Matters Most: Auditing Social Bias in Contrastive Vision Language Models

数据最为关键:审计对比视觉语言模型中的社会偏见

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦女王学院) Institut Jožef Stefan(Jožef Stefan研究所)

专题命中 跨模态检索 :image-text(abstract)

AI总结 研究通过对比CLIP和OpenCLIP模型,发现数据来源是偏见的主要驱动因素,不同去偏策略在不同模型和数据规模下效果各异。

Comments Published at TMLR; updated version

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2601.15876 2026-01-26 cs.AI 57%

EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience

EvoCUA:通过可扩展的合成经验学习来进化计算机使用代理

Taofeng Xue, Chong Peng, Mianqiu Huang, Linsen Guo, Tiancheng Han, Haozhe Wang, Jianing Wang, Xiaocheng Zhang, Xin Yang, Dengchang Zhao, Jinrui Ding, Xiandi Ma, Yuchen Xie, Peng Pei, Xunliang Cai, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 EvoCUA通过可扩展的合成经验学习进化计算机使用代理,实现更高性能和通用性。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19913 2026-01-26 cs.CV 57%

Coupled Physics-Gated Adaptation: Spatially Decoding Volumetric Photochemical Conversion in Complex 3D-Printed Objects

耦合物理门控适应:在复杂3D打印物体中空间解码体积分子转换

Maryam Eftekharifar, Churun Zhang, Jialiang Wei, Xudong Cao, Hossein Heidari

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出耦合物理门控适应方法,通过空间解码实现复杂3D打印物体中体积分子转换的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16639 2026-01-26 cs.HC cs.DB 50%

HapticMatch: An Exploration for Generative Material Haptic Simulation and Interaction

HapticMatch: 生成材料触觉模拟与交互的探索

Mingxin Zhang, Yu Yao, Yasutoshi Makino, Hiroyuki Shinoda, Masashi Sugiyama

专题命中 多模态生成 :multimodal(abstract)

AI总结 HapticMatch通过视觉到触觉的生成框架,利用新型数据集和条件生成模型,实现高保真的触觉模拟与交互,提升VR/AR中的沉浸体验。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 11 篇

2509.23927 2026-01-26 cs.CV 88%

FUSAR-KLIP: Towards Multimodal Foundation Models for Remote Sensing

FUSAR-KLIP:迈向遥感多模态基础模型

Yi Yang, Xiaokun Zhang, Qingchen Fang, Jing Liu, Ziqi Ye, Rui Li, Li Liu, Haipeng Wang

机构 * Key Laboratory for Information Science of Electromagnetic Waves (MoE), Fudan University(电磁波信息科学重点实验室(MoE),复旦大学) Institute of Zhejiang Laboratory(浙江实验室研究院) College of Electronic Science and Technology, NUDT(电子科学与技术学院,南大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);cross-modal(abstract);分类 cs.CV

AI总结 FUSAR-KLIP是首个针对SAR图像的多模态基础模型,通过构建大规模数据集、生成结构化文本、设计自洽优化机制和建立统一评估基准,解决遥感图像与通用视觉表示之间的认知不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09867 2026-01-26 cs.CV cs.AI cs.CL 85%

Hierarchy-Aware Multimodal Unlearning for Medical AI

层次感知的多模态反遗忘用于医疗AI

Fengli Wu, Vaidehi Patil, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MedForget提出一个层次感知的多模态反遗忘基准和CHIP方法,有效解决医疗数据中层次结构的遗忘问题,同时保持下游效用。

Comments Dataset and Code: https://github.com/fengli-wu/MedForget

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16520 2026-01-26 cs.CV cs.AI cs.CL 82%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16348 2026-01-26 cs.CV 79%

Coarse-to-Fine Non-rigid Multi-modal Image Registration for Historical Panel Paintings based on Crack Structures

基于裂缝结构的粗到细非刚性多模态图像配准用于历史面板绘画

Aline Sindel, Andreas Maier, Vincent Christlein

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃朗根-纽伦堡大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于裂缝结构的粗到细非刚性多模态图像配准方法,利用稀疏关键点和薄板样条实现高精度的历史面板绘画图像配准。

Comments Preprint, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13680 2026-01-26 cs.CL cs.LG 79%

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

VMMU:一个多任务多模态理解和推理基准

Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

机构 * KAIST(韩国科学技术院) MBZUAI(慕布扎伊大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16811 2026-01-26 cs.CV cs.AI 76%

Incorporating Eye-Tracking Signals Into Multimodal Deep Visual Models For Predicting User Aesthetic Experience In Residential Interiors

将眼动信号纳入多模态深度视觉模型以预测住宅内部空间的用户审美体验

Chen-Ying Chien, Po-Chih Kuo

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本研究提出双分支CNN-LSTM模型,融合眼动信号与视觉数据,提升对住宅室内空间审美体验的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11139 2026-01-26 cs.LG cs.AI cs.SC 74%

ViSymRe: Vision Multimodal Symbolic Regression

ViSymRe:视觉多模态符号回归

Da Li, Junping Yin, Jin Xu, Xinxin Li, Juan Zhang

机构 * Academy for Advanced Interdisciplinary Studies, Northeast Normal University(先进跨学科研究院,东北师范大学) Institute of Artificial Intelligence, Beihang University(人工智能研究院,北航) Institute of Applied Physics and Computational Mathematics(应用物理与计算数学研究院) National Key Laboratory of Computational Physics(计算物理国家重点实验室) School of Mathematical Sciences, East China Normal University(数学科学学院,华东师范大学) Shanghai Zhangjiang Institute of Mathematics(上海张江数学研究所)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 ViSymRe通过引入视觉模态提升基于Transformer的符号回归性能,采用多视图随机切片技术解决高维场景下的训练难题,实现高效且稳定的模型收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04744 2026-01-26 cs.SD cs.CL eess.AS 62%

WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning

WildScore: 多模态符号音乐推理在现实中的基准测试

Gagan Mundada, Yash Vishe, Amit Namburi, Xin Xu, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 WildScore是首个用于评估多模态大语言模型在现实世界中符号音乐推理能力的基准测试,通过真实音乐作品和用户生成问题,系统性评估模型在音乐学分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16970 2026-01-26 math.OC cs.AI 57%

BONO-Bench: A Comprehensive Test Suite for Bi-objective Numerical Optimization with Traceable Pareto Sets

BONO-Bench:面向双目标数值优化的综合性测试套件及其可追溯的帕累托集

Lennart Schäpermeier, Pascal Kerschke

机构 * University of Münster(穆斯特大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 BONO-Bench通过生成双目标数值优化问题,提供可追溯的帕累托集,支持可配置的测试问题属性,促进多目标优化的可重复基准测试。

Comments Accepted for publication in the Special Issue on Benchmarking in Multi-Criteria Optimization at ACM TELO

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16549 2026-01-26 cs.AI 57%

LLM is Not All You Need: A Systematic Evaluation of ML vs. Foundation Models for text and image based Medical Classification

LLM并非万能:对ML与基础模型在文本和图像医学分类中的系统评估

Meet Raval, Tejul Pandit, Dhvani Upadhyay

机构 * University of Southern California Los Angeles, USA(美国南加州大学) Dhirubhani Ambani University Gandhinagar, India(印度达尔布哈尼·阿班尼大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文系统评估了ML与基础模型在医学分类中的表现,发现传统ML模型在多数任务中表现优异,而PEFT方法的效果依赖于适应策略。

Comments 9 pages, 5 figures, 3 tables, paper accepted in AAIML'26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏