arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-02 至 2026-02-02 共收录 58 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 13 篇

2601.22575 2026-02-02 cs.CV cs.CL 73%

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

PhoStream:面向移动场景的多模态助手实时流基准测试

Xudong Lu, Huankang Guan, Yang Bo, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Peiwen Sun, Xueying Li, Wei Zhang, Xue Yang, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(CUHK 多模态实验室) Huawei Research(华为研究) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 PhoStream是首个面向移动场景的多模态助手实时流基准测试,通过统一屏幕内外场景评估视频、音频和时间推理能力,揭示了大语言模型在决定何时发言上的局限性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22483 2026-02-02 cs.CV 70%

Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage

头感知视觉裁剪:通过注意力引导的子图像增强细粒度VQA

Junfei Xie, Peng Pan, Xulong Zhang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 通过注意力引导的子图像增强细粒度VQA,提出无需训练的HAVC方法,利用优化的注意力头提升视觉定位精度。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22881 2026-02-02 cs.SE 67%

AnoMod: A Dataset for Anomaly Detection and Root Cause Analysis in Microservice Systems

AnoMod:一个用于微服务系统异常检测和根本原因分析的数据集

Ke Ping, Hamza Bin Mazhar, Yuqing Wang, Ying Song, Mika V. Mäntylä

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 AnoMod数据集通过多模态数据支持微服务系统中异常检测与根本原因分析的端到端研究。

Comments Accepted at the 23rd International Conference on Mining Software Repositories (MSR 2026). Dataset paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22930 2026-02-02 cs.RO cs.AI cs.LG 57%

MTDrive: Multi-turn Interactive Reinforcement Learning for Autonomous Driving

MTDrive: 多轮交互式强化学习用于自动驾驶

Xidong Li, Mingyu Guo, Chenchao Xu, Bailin Li, Wenjing Zhu, Yangang Zou, Rui Chen, Zehuan Wang

机构 * Li Auto Inc.(利汽车公司) NVIDIA(英伟达)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 MTDrive通过多轮交互式强化学习框架,结合多模态大语言模型与强化学习,提升自动驾驶轨迹规划的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22735 2026-02-02 cs.CL 57%

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

MM-THEBench: 多模态大语言模型是否能合理推理?

Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

机构 * KIRC, Institute for Artificial Intelligence, Tsinghua University, China(KIRC人工智能研究院,清华大学,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 MM-THEBench旨在评估推理MLLMs在中间推理过程中的幻觉问题,通过细粒度分类和多层次评估框架,揭示思考对多模态任务中幻觉和推理能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01017 2026-02-02 cs.AI 57%

ChartAnchor: Chart Grounding with Structural-Semantic Fidelity

ChartAnchor: 图表接地与结构-语义保真

Xinhang Li, Jingbo Zhou, Pengfei Luo, Yixiong Xiao, Tong Xu

机构 * Baidu Research(百度研究) USTC

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 ChartAnchor提出一个综合图表接地基准测试,通过图表到代码生成和受控表格重建任务,评估模型在结构和数值层面的保真度,揭示MLLMs在数值精度和代码合成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22218 2026-02-02 cs.CV cs.DL 57%

What Lies Beneath: A Call for Distribution-based Visual Question & Answer Datasets

表下之物:对基于分布的视觉问答数据集的呼吁

Jill P. Naiman, Daniel J. Evans, JooYoung Seo

机构 * Information Science(信息科学) University of Illinois(伊利诺伊大学) Urbana-Champaign(厄巴纳-香槟) Illinois, USA(伊利诺伊斯州,美国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文呼吁建立专门针对科学图表的VQA基准,通过生成合成图表并要求模型基于底层数据回答问题,以解决现有数据集未能捕捉的图表与数据间关系的推理挑战。

Comments Accepted to ACM/IEEE Joint Conference on Digital Libraries JCDL 2025, 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10909 2026-02-02 cs.AI 57%

PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature

PaperArena: 一个用于科学文献上工具增强代理推理的评估基准

Daoyu Wang, Mingyue Cheng, Shuo Yu, Zirui Liu, Ze Guo, Xin Li, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 PaperArena提出一个评估基准,用于评估基于LLM的代理在跨多篇论文整合信息并使用外部工具进行推理的能力,实验显示现有代理在复杂任务上的表现有限。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 4 篇

2601.22528 2026-02-02 cs.AI 70%

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22948 2026-02-02 cs.AI 57%

Alignment among Language, Vision and Action Representations

语言、视觉和动作表征的一致性

Nicola Milano, Stefano Nolfi

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 研究通过训练Transformer智能体执行自然语言指令,发现语言、视觉和动作表征在跨模态中呈现部分共享的语义结构,支持模态无关的语义组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04769 2026-02-02 cs.CV 57%

Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges

视觉-语言-动作(VLA)模型:概念、进展、应用与挑战

Ranjan Sapkota, Yang Cao, Konstantinos I. Roumeliotis, Manoj Karkee

机构 * Cornell University(康奈尔大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of the Peloponnese(希腊皮洛斯大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 本文综述了视觉-语言-动作(VLA)模型的概念、进展、应用与挑战,探讨了其在自动驾驶、医疗机器人等领域的应用及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18745 2026-02-02 cond-mat.mtrl-sci 50%

Spin defects in hexagonal boron nitride as two-dimensional strain sensors

六方氮化硼中的自旋缺陷作为二维应变传感器

Z. Mu, Z. Zhang, J. Fraunié, C. Robert, G. Seine, B. Gil, G. Cassabois, V. Jacques

专题命中 多模态Agent :multimodal(abstract)

AI总结 六方氮化硼中的硼空位色心被证实可作为高精度二维应变传感器,用于测量多层hBN晶片在应力下的拉曼模式位移,为范德瓦尔异质结构的应变计量提供新工具。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 14 篇

2510.25801 2026-02-02 cs.LG cs.AI cs.CL cs.CV 85%

Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start

Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习

Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Metis-SPECS通过基于偏好的自我蒸馏冷启动框架解耦多模态学习,提升泛化能力和下游RL表现。

Comments Published as a conference paper at ICLR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21280 2026-02-02 cs.CV 83%

Token Entropy Regularization for Multi-modal Antenna Affiliation Identification

基于令牌熵正则化的多模态天线归属识别

Dong Chen, Ruoyu Li, Xinyan Zhang, Jialei Xu, Ruosen Zhao, Zhikang Zhang, Lingyun Li, Zizhuang Wei

机构 * Huawei(华为) The University of Hong Kong(香港大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于令牌熵正则化的多模态天线归属识别方法,通过融合视频、几何特征和PCI信号,提升通信网络优化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22498 2026-02-02 cs.IR 82%

FITMM: Adaptive Frequency-Aware Multimodal Recommendation via Information-Theoretic Representation Learning

FITMM: 一种基于信息论的多模态推荐方法

Wei Yang, Rui Zhong, Yiqun Chen, Shixuan Li, Heng Ping, Chi Lu, Peng Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 FITMM通过频域信息论框架提升多模态推荐效果,采用频谱分解与信息瓶颈目标实现频带分离与融合,有效减少冗余并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06777 2026-02-02 cs.CV cs.AI 81%

MolX: Enhancing Large Language Models for Molecular Understanding With A Multi-Modal Extension

MolX: 通过多模态扩展增强大型语言模型的分子理解能力

Khiem Le, Zhichun Guo, Kaiwen Dong, Xiaobao Huang, Bozhao Nan, Roshni Iyer, Xiangliang Zhang, Olaf Wiest, Wei Wang, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame, IN, USA(诺丁汉大学) University of California, Los Angeles, CA, USA(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 MolX通过多模态扩展提升LLM对分子的理解能力,利用SMILES和分子图提取细粒度特征,并结合分子指纹提升性能,有效提升分子相关任务表现。

Comments MLoG-GenAI@KDD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22729 2026-02-02 cs.CV 79%

GaussianOcc3D: A Gaussian-Based Adaptive Multi-modal 3D Occupancy Prediction

GaussianOcc3D: 一种基于高斯的自适应多模态3D占用预测

A. Enes Doruk, Hasan F. Ates

机构 * Department of Artificial Intelligence and Data Engineering, Ozyegin University(人工智能与数据工程系,奥祖根大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 GaussianOcc3D通过高斯表示实现多模态3D占用预测,提升自动驾驶环境感知的鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17564 2026-02-02 eess.IV cs.CV cs.LG 79%

ModalTune: Fine-Tuning Slide-Level Foundation Models with Multi-Modal Information for Multi-task Learning in Digital Pathology

ModalTune: 通过多模态信息细调滑片级基础模型以实现数字病理学中的多任务学习

Vishwesh Ramanathan, Tony Xu, Pushpak Pati, Faruk Ahmed, Maged Goubran, Anne L. Martel

机构 * Sunnybrook Research Institute(辛普森布鲁斯研究所在) University of Toronto(多伦多大学) Google Research(谷歌研究)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 ModalTune通过引入多模态信息和大型语言模型,实现数字病理学中多任务学习的统一细调框架,提升癌症生存和亚型预测性能。

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22856 2026-02-02 cs.LG 75%

OptiMAG: Structure-Semantic Alignment via Unbalanced Optimal Transport

OptiMAG: 通过不平衡最优传输实现结构-语义对齐

Yilong Zuo, Xunkai Li, Zhihan Zhang, Qiangqiang Dai, Ronghua Li, Guoren Wang

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 OptiMAG通过不平衡最优传输解决多模态图中结构与语义不一致问题,提升节点表示学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22406 2026-02-02 cs.RO 71%

Accurate Pedestrian Tracking in Urban Canyons: A Multi-Modal Fusion Approach

城市峡谷中精确的人行道跟踪:一种多模态融合方法

Shahar Dubiner, Peng Ren, Roberto Manduchi

专题命中 多模态训练与对齐 :multi-modal(title)

AI总结 本文提出一种多模态融合方法,通过融合GNSS和惯性数据提升城市峡谷中行人定位精度,优于单独使用GNSS或惯性导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23004 2026-02-02 eess.AS 57%

Layer-Aware Early Fusion of Acoustic and Linguistic Embeddings for Cognitive Status Classification

面向层的语音与语言嵌入早期融合用于认知状态分类

Krystof Novotny, Laureano Moro-Velázquez, Jiri Mekyska

专题命中 多模态训练与对齐 :multimodal(abstract);分类 eess.AS

AI总结 本文提出通过语音与语言嵌入的早期融合,结合编码器层深度优化,提升认知状态分类性能,发现中等编码层效果最佳。

Comments 5 pages, 3 figures, paper accepted for ICASSP 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27647 2026-02-02 cs.CV 57%

NegoCollab: A Common Representation Negotiation Approach for Heterogeneous Collaborative Perception

NegoCollab: 一种用于异构协作感知的共同表示协商方法

Congzhang Shao, Quan Yuan, Guiyang Luo, Yue Hu, Danni Wang, Yilin Liu, Rui Pan, Bo Chen, Jinglin Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 NegoCollab通过协商共同表示方法解决异构协作感知中的领域差距问题,提升多智能体协作性能。

Comments 23 pages, Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22696 2026-02-02 cs.CV cs.LG 57%

Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding

Bi-MCQ:重新表述视觉-语言对齐以理解否定

Tae Hun Kim, Hyun Gyu Lee

机构 * Department of Electrical and Computer Engineering, Inha University, Republic of Korea(电气与计算机工程系,印哈大学,大韩民国) College of Medicine, Inha University, Republic of Korea(医学学院,印哈大学,大韩民国)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 Bi-MCQ通过重新表述视觉-语言对齐为条件语义比较,提升医学VLM对否定理解的性能。

Comments 15 pages, 4 figures, Submitted to ICPR 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03370 2026-02-02 q-bio.QM cs.AI cs.CE 57%

InstructPLM-mu: 1-Hour Fine-Tuning of ESM2 Beats ESM3 in Protein Mutation Predictions

InstructPLM-mu:在1小时内微调ESM2在蛋白质突变预测中优于ESM3

Junde Xu, Yapin Shi, Lijun Lang, Taoyong Cui, Zhiming Zhang, Guangyong Chen, Jiezhong Qiu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Hangzhou Institute of Medicine, CAS(杭州医学研究所,中国科学院) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究 institute,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学) Tianjin University(天津大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 InstructPLM-mu通过1小时微调ESM2在蛋白质突变预测中超越ESM3,揭示了结构输入对模型性能的关键影响。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14957 2026-02-02 cs.CV 57%

DF-LLaVA: Unlocking MLLMs for Synthetic Image Detection via Knowledge Injection and Conflict-Driven Self-Reflection

DF-LLaVA: 通过知识注入和冲突驱动的自我反思解锁MLLMs用于合成图像检测

Zhuokang Shen, Kaisen Zhang, Bohan Jia, Heming Jia, Yuan Fang, Zhou Yu, Shaohui Lin

机构 * East China Normal University(东华师范大学) Sanming University(三明大学) The 27th Research Institute of CETC(中国电子科技集团第27研究所)

专题命中 多模态训练与对齐 :MLLM(abstract);分类 cs.CV

AI总结 DF-LLaVA通过知识注入和冲突驱动的自我反思,提升MLLMs在合成图像检测中的准确性和可解释性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20321 2026-02-02 cs.RO 50%

TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation

TaF-VLA:面向力感知操控的视觉-语言-动作模型中的触觉-力对齐

Yuzhe Huang, Pei Lin, Wanlin Li, Daohan Li, Jiajun Li, Jiaming Jiang, Chenxi Xiao, Ziyuan Jiao

机构 * Beihang University(北航大学) ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 TaF-VLA通过触觉-力对齐提升视觉-语言-动作模型在力感知操控中的性能。

Comments 17pages,9fig

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 2 篇

2601.22342 2026-02-02 physics.ins-det 78%

High-resolution calorimetric sample platforms for cryogenic thermodynamic studies with multimodal synchrotron x-ray compatibility

高分辨率量热学样品平台用于低温热力学研究的多模式同步辐射X射线兼容性

U. Patel, H. Zheng, J. L. McChesney, U. Welp, Z. Islam, A. Miceli

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本研究提出了一种高分辨率量热学样品平台,用于低温热力学研究,支持多模式同步辐射X射线兼容性,适用于小样品量热测量和多种极端环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23184 2026-02-02 cs.CL 57%

ReGuLaR: Variational Latent Reasoning Guided by Rendered Chain-of-Thought

ReGuLaR: 基于渲染思维链的变分潜在推理

Fanmeng Wang, Haotian Liu, Guojiang Zhao, Hongteng Xu, Zhifeng Gao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CL

AI总结 ReGuLaR通过渲染思维链图像并利用视觉-语义表示正则化后验分布,实现高效的潜在推理,优于现有方法并在多模态推理中超越CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏