arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-05 至 2026-02-05 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 14 篇

2602.04739 2026-02-05 cs.CL cs.AI cs.HC 84%

Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases

多模态大语言模型中的对齐漂移:对八个模型版本的双阶段纵向评估

Casey Ford, Madison Van Doren, Emily Dix

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 研究通过双阶段评估揭示多模态大语言模型在不同模型版本中的安全性和对齐漂移问题,强调了持续多模态基准测试的重要性。

Comments under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04260 2026-02-05 cs.CV 83%

Decoupled Hierarchical Distillation for Multimodal Emotion Recognition

解耦层次蒸馏用于多模态情感识别

Yong Li, Yuanzhi Wang, Yi Ding, Shiqing Zhang, Ke Lu, Cuntai Guan

机构 * School of Computer Science and Engineering, and the Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University(计算机科学与工程学院,新一代人工智能技术及跨学科应用重点实验室,东南大学) School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) Institute of Intelligent Information Processing, Taizhou University(智能信息处理研究院,台州大学) School of Engineering Science, University of Chinese Academy of Sciences(工程科学学院,中国科学院大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出解耦层次多模态蒸馏框架,通过两阶段知识蒸馏提升跨模态特征对齐,有效提高多模态情感识别性能。

Comments arXiv admin note: text overlap with arXiv:2303.13802

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04416 2026-02-05 cs.CV cs.AI 81%

Med-MMFL: A Multimodal Federated Learning Benchmark in Healthcare

Med-MMFL:医疗领域的多模态联邦学习基准

Aavash Chhetri, Bibek Niroula, Pratik Shrestha, Yash Raj Shrestha, Lesley A Anderson, Prashnna K Gyawali, Loris Bazzani, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学) NepAl Applied Mathematics and Informatics Institute for research, Nepal(尼泊尔应用数学与信息学研究所) University of Lausanne(洛桑大学) West Virginia University(西弗吉尼亚大学) University of Verona(威尼斯大学) University College London(伦敦大学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Med-MMFL是首个医疗领域多模态联邦学习基准,涵盖多种模态和任务,评估六种先进算法以推动医疗多模态联邦学习的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04413 2026-02-05 cs.CL cs.AI cs.MM 80%

History-Guided Iterative Visual Reasoning with Self-Correction

基于历史的迭代视觉推理与自我校正

Xinglong Yang, Zhilin Peng, Zhanzhan Liu, Haochen Shi, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 H-GIVR框架通过迭代视觉推理与自我校正,显著提升多模态推理准确性并保持低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04290 2026-02-05 cs.CL 79%

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

引导验证器:通过动态过程监督实现协作多模态推理

Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04299 2026-02-05 cs.HC 78%

A Multimodal fNIRS-EEG Dataset for Unilateral Limb Motor Imagery

用于单侧肢体运动想象的多模态fNIRS-EEG数据集

Lufeng Feng, Baomin Xu, Haoran Zhang, Bihai Lin, Zuxuan Deng, Sidi Tao, Chenyu Liu, Shifan Jia, Li Duan, Ziyu Jia

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出MIND数据集,用于单侧肢体多方向运动想象,通过融合fNIRS和EEG数据提升BCI分类性能。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04365 2026-02-05 cs.LG 67%

EXaMCaP: Subset Selection with Entropy Gain Maximization for Probing Capability Gains of Large Chart Understanding Training Sets

EXaMCaP: 通过熵增最大化进行子集选择以探测大规模图表理解训练集的探测能力提升

Jiapeng Liu, Liang Li, Bing Li, Peng Fu, Xiyan Gao, Chengyang Fang, Xiaoshuai Hao, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyberspace Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) School of Computer and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

AI总结 EXaMCaP通过熵增最大化选择子集,以高效探测大规模图表理解训练集的能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13551 2026-02-05 cs.CL cs.AI 62%

Reading Between the Lines: Combining Pause Dynamics and Semantic Coherence for Automated Assessment of Thought Disorder

在言语间解读:结合停顿动态与语义连贯性用于自动评估思维障碍

Feng Chen, Weizhe Xu, Changye Li, Serguei Pakhomov, Alex Cohen, Simran Bhola, Sandy Yin, Sunny X Tang, Michael Mackinley, Lena Palaniyappan, Dror Ben-Zeev, Trevor Cohen

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过结合停顿动态与语义连贯性,提出了一种可扩展的多模态框架,用于自动评估思维障碍的严重程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04454 2026-02-05 cs.CV 57%

Seg-ReSearch: Segmentation with Interleaved Reasoning and External Search

Seg-ReSearch: 基于交织推理和外部搜索的分割

Tianming Liang, Qirui Du, Jian-Fang Hu, Haichao Jiang, Zicheng Lin, Wei-Shi Zheng

机构 * ISEE Lab, Sun Yat-sen University(中山大学ISEE实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 Seg-ReSearch通过交织推理和外部搜索提升分割系统处理动态开放世界查询的能力,有效克服现有方法的知识瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00843 2026-02-05 cs.AI cs.HC 57%

Benchmarking Large Language Models for Diagnosing Students' Cognitive Skills from Handwritten Math Work

对大型语言模型诊断学生手写数学作业认知技能的基准测试

Yoonsu Kim, Hyoungwook Jin, Hayeon Doh, Eunhye Kim, Dongyun Jung, Seungju Kim, Kiyoon Choi, Jinho Son, Juho Kim

机构 * School of Computing, KAIST, Daejeon, Republic of Korea(韩国庆熙大学计算机学院) University of Michigan, Ann Arbor, USA(美国密歇根大学) Ewha Womans University, Seoul, Republic of Korea(韩国成均馆大学) AlgorithmLabs, Seoul, Republic of Korea(韩国AlgorithmLabs公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文评估了18种大型语言模型在诊断学生手写数学作业认知技能时的表现,发现模型在模糊证据下表现不佳,揭示了模型在证据处理上的系统性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04154 2026-02-05 cs.CV 57%

Context Determines Optimal Architecture in Materials Segmentation

上下文决定材料分割的最佳架构

Mingjian Lu, Pawan K. Tripathi, Mark Shteyn, Debargha Ganguly, Roger H. French, Vipin Chaudhary, Yinghui Wu

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本研究提出跨模式评估框架,揭示材料图像分割中不同上下文对最佳架构的影响,并提供可解释性工具以提升材料表征的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03895 2026-02-05 cs.CV cs.LG 57%

Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs

面向视觉到大视觉语言模型的公平性无害基准测试

Xuwei Tan, Ziyu Hu, Xueru Zhang

机构 * The Ohio State University(俄亥俄州立大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 NH-Fair提出一个统一基准,评估视觉到大视觉语言模型的公平性无害性,通过系统调优和数据增强方法减少偏见,提升公平性和准确性。

Comments Accepted at ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02148 2026-02-05 cs.AI cs.LG 57%

OmniCellTOSG: The First Cell Text-Omic Signaling Graphs Dataset for Graph Language Foundation Modeling

OmniCellTOSG: 首个细胞文本-组学信号图谱数据集用于图语言基础建模

Heming Zhang, Tim Xu, Dekang Cao, Shunning Liang, Guntaas Shergill, Nicholas Hadas, Lars Schimmelpfennig, Levi Kaster, Di Huang, Guangfu Li, S. Peter Goedegebuure, David DeNardo, Li Ding, Ryan C. Fields, J Philip Miller, Pirooz Eghtesady, Carlos Cruchaga, William Buchser, Jonathan Cooper, Marco Sardiello, Patricia Dickson, Yixin Chen, Michael Province, Philip Payne, Fuhai Li

机构 * Institute for Informatics, Data Science and Biostatistics(信息学、数据科学与生物统计学研究所) Washington University in St. Louis(华盛顿大学圣路易斯分校) Department of Computer Science(计算机科学系) NeuroGenomics and Informatics Center(神经基因组学与信息学中心) Department of Genetics(遗传学系) Department of Surgery(外科医学系) Siteman Cancer Center(西门癌中心) Department of Medicine(医学系) Department of Pediatrics(儿科医学系) University of Connecticut(康涅狄格大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 OmniCellTOSG通过整合文本、组学和信号网络信息,提出CellTOSG-FM模型,在多种下游任务中超越现有组学基础模型,提供疾病相关靶点和信号通路的可解释分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26336 2026-02-05 cs.SE 50%

UniSage: A Unified and Post-Analysis-Aware Sampling for Microservices

UniSage: 一种统一且事后分析感知的微服务采样

Zhouruixing Zhu, Zhihan Jiang, Tianyi Yang, Pinjia He

专题命中 多模态评测 :multi-modal(abstract)

AI总结 UniSage通过整合追踪和日志,结合轻量级异常检测模块,实现事后分析感知的统一采样框架,显著提升数据保留率和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏