arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-10 至 2026-02-10 共收录 23 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 23 篇

2602.07081 2026-02-10 cs.MM cs.AI cs.CV 85%

Federated Prompt-Tuning with Heterogeneous and Incomplete Multimodal Client Data

联邦提示调优与异构且不完整多模态客户端数据

Thu Hang Phung, Duong M. Nguyen, Thanh Trung Huynh, Quoc Viet Hung Nguyen, Trong Nghia Hoang, Phi Le Nguyen

机构 * Institute of AI Innovation and Societal Impact, Hanoi University of Science and Technology(人工智能创新与社会影响研究院,河内科学技术大学) EPFL(瑞士联邦理工学院) Griffith University(格里菲斯大学) Washington State University(华盛顿州立大学)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出联邦提示调优框架,解决异构多模态数据中特征缺失分布不一致的问题,通过客户端调优与服务器聚合提升多模态提示调优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15897 2026-02-10 cs.CV 83%

ThermoSplat: Cross-Modal 3D Gaussian Splatting with Feature Modulation and Geometry Decoupling

ThermoSplat: 多模态3D高斯点云的特征调制与几何解耦

Zhaoqi Su, Shihai Chen, Xinyan Lin, Liqin Huang, Zhipeng Su, Xiaoqiang Lu

机构 * College of Physics and Information Engineering, Fuzhou University(物理与信息工程学院,福州大学)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 ThermoSplat通过特征调制和几何解耦实现多模态3D高斯点云的深度光谱感知重建,提升多光谱场景的渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11341 2026-02-10 cs.CV 83%

InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models

InternSVG:通过多模态大语言模型实现统一的SVG任务

Haomin Wang, Jinhui Yin, Qi Wei, Wenguang Zeng, Lixin Gu, Shenglong Ye, Zhangwei Gao, Yaohui Wang, Yanting Zhang, Yuanqi Li, Yanwen Guo, Wenhai Wang, Kai Chen, Yu Qiao, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 InternSVG通过多模态大语言模型实现统一的SVG任务建模,结合大规模数据集和两阶段训练策略,提升SVG理解、编辑和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07833 2026-02-10 cs.CV cs.AI cs.CL 82%

SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models

SPD-Faith Bench: 诊断和改进多模态大语言模型中的推理忠实性

Weijiang Lv, Yaoxuan Feng, Xiaobo Xia, Jiayu Wang, Yan Jing, Wenchao Chen, Bo Chen

机构 * Xidian University(西安电子科技大学) National University of Singapore(新加坡国立大学) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SPD-Faith Bench通过细粒度图像差异推理诊断并改进多模态大语言模型中的推理忠实性,揭示了感知盲区和感知-推理脱节的系统性失败模式,并提出SAGE框架提升视觉路由和推理与感知的一致性。

Comments 53 pages, 42 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07068 2026-02-10 eess.IV cs.AI cs.CV 81%

MRI Cross-Modal Synthesis: A Comparative Study of Generative Models for T1-to-T2 Reconstruction

MRI跨模态合成:生成模型在T1到T2重建中的比较研究

Ali Alqutayfi, Sadam Al-Azani

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文比较了Pix2Pix GAN、CycleGAN和VAE在T1到T2 MRI重建中的性能,发现CycleGAN在PSNR和SSIM上表现最佳,而VAE在潜在空间表示上有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08367 2026-02-10 cs.CL 79%

WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints

WorldTravel: 一个具有紧密耦合约束的现实多模态旅行规划基准

Zexuan Wang, Chenghao Yang, Yingqi Que, Zhenzhu Yang, Huaqing Yuan, Yiwen Wang, Zhengxuan Jiang, Shengjie Fang, Zhenhe Wu, Zhaohui Wang, Zhixin Yao, Jiashuo Liu, Jincheng Ren, Yuzhen Li, Yang Yang, Jiaheng Liu, Jian Yang, Zaiyuan Wang, Ge Zhang, Zhoufutu Wen, Wenhao Huang

机构 * ByteDance Seed(字节跳动种子)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CL

AI总结 WorldTravel提出一个现实多模态旅行规划基准,揭示了智能体在紧密耦合约束下的感知-行动差距和规划时间阈值问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00765 2026-02-10 cs.AI 79%

HouseTS: A Large-Scale, Multimodal Spatiotemporal U.S. Housing Dataset and Benchmark

HouseTS:一个大规模、多模态的美国住房时空数据集和基准

Shengkun Wang, Yanshen Sun, Fanglan Chen, Linhan Wang, Naren Ramakrishnan, Chang-Tien Lu, Yinlin Chen

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 HouseTS是一个大规模多模态美国住房时空数据集,用于提供长期房价预测的基准,涵盖超过6000个邮政编码的月度数据,并支持多种模型的评估与可解释性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10734 2026-02-10 cs.CV 79%

OmniHD-Scenes: A Next-Generation Multimodal Dataset for Autonomous Driving

OmniHD-Scenes:面向自动驾驶的下一代多模态数据集

Lianqing Zheng, Long Yang, Qunshu Lin, Wenjin Ai, Minghao Liu, Shouyi Lu, Jianan Liu, Hongze Ren, Jingyue Mo, Xiaokai Bai, Jie Bai, Zhixiong Ma, Xichan Zhu

机构 * School of Automotive Studies, Tongji University(同济大学汽车学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) AI Foundation(2077AI基金会) Momoni AI College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Information and Electrical Engineering, Hangzhou City University(杭州城市学院信息与电气工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 OmniHD-Scenes提出了一种大规模多模态数据集,结合多种传感器数据,用于提升自动驾驶的3D检测和语义预测性能。

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08112 2026-02-10 cs.CV cs.LG 79%

MMLSv2: A Multimodal Dataset for Martian Landslide Detection in Remote Sensing Imagery

MMLSv2:一种用于火星滑坡检测的多模态数据集

Sidike Paheding, Abel Reyes-Angulo, Leo Thomas Ramos, Angel D. Sappa, Rajaneesh A., Hiral P. B., Sajin Kumar K. S., Thomas Oommen

机构 * Fairfield University(费尔菲尔德大学) Michigan Technological University(密歇根技术大学) Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) ESPOL Polytechnic University(ESPOL多科大学) University of Kerala(喀拉拉大学) University of Mississippi(密西西比大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MMLSv2是一个用于火星滑坡检测的多模态数据集,包含七种波段的图像,用于评估模型在不同地理区域的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07978 2026-02-10 cs.CL 79%

Cross-Linguistic Persona-Driven Data Synthesis for Robust Multimodal Cognitive Decline Detection

跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测

Rui Feng, Zhiyao Luo, Liuyu Wu, Wei Wang, Yuting Song, Yong Liu, Kok Pin Ng, Jianqing Li, Xingyao Wang

机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20222 2026-02-10 cs.LG 78%

Decoupling and Damping: Structurally-Regularized Gradient Matching for Multimodal Graph Condensation

解耦与阻尼:用于多模态图压缩的结构正则化梯度匹配

Lian Shen, Zhendan Chen, Meijia Song, Yinhui jiang, Ziming Su, Juan Liu, Xiangrong Liu

机构 * Xiamen University(厦门大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出SR-GM框架,通过梯度解耦和结构阻尼正则化解决多模态图压缩中的语义错位和梯度噪声问题,实现高效稳定的图结构压缩。

Comments 12pages,7 figures,8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01318 2026-02-10 cs.HC 78%

AffectGPT-R1: Leveraging Reinforcement Learning for Open-Vocabulary Multimodal Emotion Recognition

AffectGPT-R1:利用强化学习进行开放词汇多模态情感识别

Zheng Lian, Fan Zhang, Yazhou Zhang, Jianhua Tao, Rui Liu, Haoyu Chen, Xiaobai Li, Bin He

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 AffectGPT-R1通过强化学习框架改进开放词汇多模态情感识别,利用奖励函数优化情绪度量并提升情绪理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17834 2026-02-10 cs.CV 74%

Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography

从多模态数据集构建通用基础模型用于三维计算机断层扫描

Ibrahim Ethem Hamamci, Sezgin Er, Chenyu Wang, Furkan Almas, Ayse Gulnihan Simsek, Sevval Nil Esirgun, Irem Dogan, Omer Faruk Durugol, Benjamin Hou, Suprosanna Shit, Weicheng Dai, Murong Xu, Hadrien Reynaud, Muhammed Furkan Dasdelen, Bastian Wittmann, Tamaz Amiranashvili, Enis Simsar, Mehmet Simsar, Emine Bensu Erdemir, Abdullah Alanbay, Anjany Sekuboyina, Berkan Lafci, Ahmet Kaplan, Zhiyong Lu, Malgorzata Polacin, Bernhard Kainz, Christian Bluethgen, Kayhan Batmanghelich, Mehmet Kemal Ozdemir, Bjoern Menze

机构 * Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) International School of Medicine, Istanbul Medipol University(伊斯坦布尔梅迪波尔大学国际医学院) Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Division of Intramural Research, National Institutes of Health(美国国立卫生研究院内部研究部) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Institute for Diagnostic and Interventional Radiology, University Hospital Zurich(苏黎世大学医院诊断与介入放射学研究所) Department Artificial Intelligence in Biomedical Engineering, FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡工业大学生物医学工程人工智能系)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出CT-RATE数据集及CT-CLIP和CT-CHAT模型,用于三维医学影像的通用基础模型研究,提升了多异常检测和病例检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07055 2026-02-10 cs.AI cs.CL cs.LG 73%

Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?

空间理论:基础模型能否通过主动探索构建空间信念?

Pingyue Zhang, Zihan Huang, Yue Wang, Jieyu Zhang, Letian Xue, Zihan Wang, Qineng Wang, Keshigeyan Chandrasegaran, Ruohan Zhang, Yejin Choi, Ranjay Krishna, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Cornell University(康奈尔大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出空间理论,探讨基础模型通过主动探索构建空间信念的挑战,发现主动-被动差距、探索低效和信念惯性等问题。

Comments published at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07014 2026-02-10 cs.CV cs.AI 73%

Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation

Vectra: 一种新的度量标准、数据集和模型用于电子商务图像中的图像翻译视觉质量评估

Qingyu Wu, Yuxuan Han, Haijun Li, Zhao Xu, Jianshan Zhao, Xu Jin, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Vectra提出了一种无参考、基于大语言模型的视觉质量评估框架,通过多维度量系统、数据集和模型提升电子商务图像翻译的视觉质量评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08588 2026-02-10 cs.DB 67%

MMTS-BENCH: A Comprehensive Benchmark for Time Series Understanding and Reasoning

MMTS-BENCH: 一个全面的时间序列理解和推理基准

Yao Yin, Zhenyu Xiao, Musheng Li, Yiwen Liu, Sutong Nan, Yiting He, Ruiqi Wang, Zhenwei Zhang, Qingmin Liao, Yuantao Gu

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 MMTS-BENCH通过多模态基准评估大语言模型在时间序列理解与推理中的表现,揭示了TS-LLMs在跨领域泛化和多模态整合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08107 2026-02-10 cs.CV cs.AI 62%

Hyperspectral Imaging

高光谱成像

Danfeng Hong, Chenyu Li, Naoto Yokoya, Bing Zhang, Xiuping Jia, Antonio Plaza, Paolo Gamba, Jon Atli Benediktsson, Jocelyn Chanussot

机构 * Southeast University(东南大学) University of Tokyo(东京大学) Chinese Academy of Sciences(中国科学院) University of New South Wales(新南威尔士大学) University of Extremadura(埃斯特雷马杜拉大学) University of Pavia(帕维亚大学) University of Iceland(冰岛大学) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了高光谱成像的原理、技术方法及应用,探讨了其在多领域中的潜力与挑战。

Comments Accepted by Nature Reviews Methods Primers

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08311 2026-02-10 cs.AI 57%

Moral Sycophancy in Vision Language Models

视觉语言模型中的道德趋炎奉承

Shadman Rabby, Md. Hefzul Hossain Papon, Sabbir Ahmed, Nokimul Hasan Arif, A. B. M. Ashikur Rahman, Irfan Ahmad

机构 * University of Dhaka(达卡大学) Daffodil International University(达福迪国际大学) Islamic University of Technology(伊斯兰技术大学) University of Central Florida(佛罗里达中央大学) King Fahad University of Petroleum and Minerals(国王法赫德石油与矿物大学) SDAIA - KFUPM Joint research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在道德决策中的趋炎奉承现象,发现模型在用户偏见下易产生道德错误回应,揭示了模型在伦理一致性与稳健性上的权衡问题。

Comments 13 pages, 6 figures, 8 tables, Submitted for review in ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22009 2026-02-10 cs.AI 57%

OpenPhone: Mobile Agentic Foundation Models

OpenPhone: 移动代理基础模型

Yangqin Jiang, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 OpenPhone通过设备-云协作提升移动GUI代理性能,结合设备端高效模型与云端强大能力,实现成本降低与性能提升的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07212 2026-02-10 cs.CV 57%

Understanding Real-World Traffic Safety through RoadSafe365 Benchmark

通过RoadSafe365基准理解现实世界交通安全

Xinyu Liu, Darryl C. Jacob, Yuxin Liu, Xinsong Du, Muchao Ye, Bolei Zhou, Pan He

机构 * Auburn University(阿伯拉罕大学) University of California, Los Angeles(加州大学洛杉矶分校) Harvard Medical School(哈佛医学院) The University of Iowa(爱荷华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 RoadSafe365通过细粒度分析和多模态数据集提升现实交通安全研究的可重复性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07054 2026-02-10 cs.LG cs.CV cs.HC 57%

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

AVERE: 通过偏好优化提升音频视觉情感推理

Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。

Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08999 2026-02-10 cs.RO 50%

CLUE: Crossmodal disambiguation via Language-vision Understanding with attEntion

CLUE: 通过语言-视觉理解进行跨模态歧义消除

Mouad Abrini, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所) Sorbonne Université Paris(索邦大学巴黎)

专题命中 多模态评测 :cross-modal(abstract)

AI总结 CLUE通过语言-视觉理解实现跨模态歧义消除,利用显式空间信号决定何时提问,提升人机交互的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07070 2026-02-10 cs.LG 50%

Hybrid Dual-Path Linear Transformations for Efficient Transformer Architectures

混合双路径线性变换用于高效的Transformer架构

Vladimer Khasia

机构 * Independent Researcher(独立研究者)

专题命中 多模态评测 :cross-modal(abstract)

AI总结 HDPL通过混合双路径线性变换提升Transformer架构效率与表示能力,减少参数量并优化上下文整合。

详情

展开后加载摘要…

URL PDF HTML 收藏