arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-30 至 2026-01-30 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2601.22155 2026-01-30 cs.CV cs.CL 84%

UEval: A Benchmark for Unified Multimodal Generation

UEval:一个统一多模态生成的评估基准

Bo Li, Yida Yin, Wenhao Chai, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 UEval是一个评估统一多模态生成模型的基准,通过专家精选问题和评分表系统,揭示推理能力对复杂任务的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19616 2026-01-30 cs.LG cs.AI cs.CV 84%

Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models

多模态大语言模型中模态干扰的诊断与缓解

Rui Cai, Bangzheng Li, Xiaofei Wen, Muhao Chen, Zhe Zhao

机构 * Department of Computer Science, University of California-Davis, Davis, CA, United States(计算机科学系,加州大学戴维斯分校)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种统一的微调框架,通过结合启发式和对抗性扰动的数据增强与输出一致性正则化,有效缓解多模态大语言模型中的模态干扰问题,提升模型的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21342 2026-01-30 cs.AI 83%

Ostrakon-VL: Towards Domain-Expert MLLM for Food-Service and Retail Stores

Ostrakon-VL:面向食品服务与零售商店的领域专家MLLM

Zhiyong Shen, Gongpeng Zhao, Jun Zhou, Li Yu, Guandong Kou, Jichen Li, Chuanlei Dong, Zuncheng Li, Kaimao Li, Bingkun Wei, Shicheng Hu, Wei Xia, Wenguo Duan

机构 * Rajax Network Technology (Taobao Shangou of Alibaba)(Rajax网络技术(淘宝商购的阿里巴巴))

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 Ostrakon-VL通过多阶段训练策略在FSRS场景中取得新突破,实现60.1的高分表现,超越现有模型并展示更高参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15260 2026-01-30 cs.CV 79%

DrivIng: A Large-Scale Multimodal Driving Dataset with Full Digital Twin Integration

DrivIng: 一个具有完整数字孪生集成的大规模多模态驾驶数据集

Dominik Rößle, Xujun Xie, Adithya Mohan, Venkatesh Thirugnana Sambandham, Daniel Cremers, Torsten Schön

机构 * Department of Computer Science and AImotion Bavaria, Technische Hochschule Ingolstadt(计算机科学系和AImotion巴伐利亚,因斯布鲁克大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DrivIng是一个具有完整数字孪生集成的大规模多模态驾驶数据集,提供高精度定位和多传感器数据,用于自动驾驶感知算法的评估和仿真到现实测试。

Comments Copyright 2026 IEEE. This is the accepted manuscript (postprint), not the final published version. For code and dataset, see https://github.com/cvims/DrivIng

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25851 2026-01-30 cs.CV 79%

MuSLR: Multimodal Symbolic Logical Reasoning

MuSLR:多模态符号逻辑推理

Jundong Xu, Hao Fei, Yuhui Zhang, Liangming Pan, Qijun Huang, Qian Liu, Preslav Nakov, Min-Yen Kan, William Yang Wang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) Peking University(北京大学) UniMelb(墨尔本大学) University of Auckland(奥克兰大学) MBZUAI(穆斯林人工智能研究所) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MuSLR提出了一种多模态符号逻辑推理基准,通过形式逻辑规则提升VLMs的推理能力,显著提升链式推理性能及复杂逻辑处理效果。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21829 2026-01-30 cs.RO 78%

GAZELOAD A Multimodal Eye-Tracking Dataset for Mental Workload in Industrial Human-Robot Collaboration

GAZELOAD:用于工业人机协作中心理负荷的多模态眼动数据集

Bsher Karbouj, Baha Eddin Gaaloul, Jorg Kruger

机构 * Department of industrial Automation Technology TU Berlin(工业自动化技术系 柏林技术大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 GAZELOAD数据集通过多模态眼动数据支持工业人机协作中心理负荷的估计与分析,包含眼动信号、环境数据及自我报告评分,用于算法开发与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21479 2026-01-30 cs.CV 74%

Hypernetwork-Based Adaptive Aggregation for Multimodal Multiple-Instance Learning in Predicting Coronary Calcium Debulking

基于超网络的自适应聚合用于多模态多实例学习在预测冠状动脉钙化去除中的应用

Kaito Shiku, Ichika Seo, Tetsuya Matoba, Rissei Hino, Yasuhiro Nakano, Ryoma Bise

机构 * Department of Advanced Information Technology, Kyushu University(九州大学先进信息技术系) Department of Cardiovascular Medicine, Kyushu University(九州大学心血管医学系)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出HyperAdAgFormer,通过超网络自适应聚合策略,用于多模态多实例学习预测冠状动脉钙化去除的必要性。

Comments Accepted to ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20847 2026-01-30 cs.CV cs.AI 62%

A New Dataset and Framework for Robust Road Surface Classification via Camera-IMU Fusion

基于相机-IMU融合的新型数据集与道路表面分类框架

Willams de Lima Costa, Thifany Ketuli Silva de Souza, Jonas Ferreira Silva, Carlos Gabriel Bezerra Pereira, Bruno Reis Vila Nova, Leonardo Silvino Brito, Rafael Raider Leoni, Juliano Silva Filho, Valter Ferreira, Sibele Miguel Soares Neto, Samantha Uehara, Daniel Giacometti Amaral, João Marcelo Teixeira, Veronica Teichrieb, Cristiano Coelho de Araújo

机构 * Voxar Labs(Voxar实验室) Centro de Informática(计算机中心) Universidade Federal de Pernambuco(佩纳布卢克联邦大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于相机-IMU融合的新型数据集和框架,通过多模态注意力机制提升道路表面分类的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22045 2026-01-30 cs.CV 57%

Urban Neural Surface Reconstruction from Constrained Sparse Aerial Imagery with 3D SAR Fusion

从受约束的稀疏航空影像中融合3D合成孔径雷达实现城市神经表面重建

Da Li, Chen Yao, Tong Mao, Jiacheng Bao, Houjun Sun

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出融合3D SAR与航空影像的城市神经表面重建框架,通过引入雷达空间约束提升稀疏视角下的重建精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21977 2026-01-30 cs.HC cs.AI cs.CY 57%

From Particles to Agents: Hallucination as a Metric for Cognitive Friction in Spatial Simulation

从粒子到代理:幻觉作为空间模拟中认知摩擦的度量

Javier Argota Sánchez-Vaquerizo, Luis Borunda Monsivais

机构 * Computational Social Science. ETH Zürich(ETH Zurich计算社会科学) Virginia Tech School of Architecture(弗吉尼亚理工大学建筑学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出代理环境模拟,通过认知摩擦度量揭示建筑空间的象征性模糊,挑战传统HCI范式,提出人类中心的认知编排框架。

Comments Paper selected for the workshop Human Cognition, AI, and the Future of HCI: Navigating the Disruptive and Wild Landscape of Large Language Models and Agentic AI as part of the Human-Computer Interaction (HCI) conference of the Alpine region (AlpCHI 2026) hosted at the Congressi Stefano Franscini, March 1st to March 5th, 2026 on Monte Verità in Ascona, Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24386 2026-01-30 cs.CV 57%

PCICF: A Pedestrian Crossing Identification and Classification Framework

PCICF:一种行人穿越识别与分类框架

Junyi Gu, Beatriz Cabrero-Daniel, Ali Nouri, Lydia Armini, Christian Berger

机构 * Chalmers University of Technology(楚德斯技术大学) University of Gothenburg(戈尔达堡大学) Volvo Cars(沃尔沃汽车公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 PCICF提出了一种基于空间填充曲线的行人穿越识别与分类框架,利用合成数据集和真实世界数据集进行系统性训练和评估,以支持运营设计领域事件分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21694 2026-01-30 cs.CV 57%

ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing

ChartE$^{3}$: 一个全面的端到端图表编辑基准

Shuo Li, Jiajun Sun, Zhekai Wang, Xiaoran Fan, Hui Li, Dingwen Yang, Zhiheng Xi, Yijun Wang, Zifei Shan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 ChartE$^{3}$提出一个端到端图表编辑基准,通过多模态大语言模型评估,揭示了现有技术在全局编辑任务上的性能差距。

Comments Our benchmark will be publicly available at https://github.com/galactic123/ChartE3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21022 2026-01-30 cs.CV 57%

AI-based Prediction of Biochemical Recurrence from Biopsy and Prostatectomy Samples

基于AI的生物化学复发预测:从活检和前列腺切除样本

Andrea Camilloni, Chiara Micoli, Nita Mulliqi, Erik Everett Palm, Thorgerdur Palsdottir, Kelvin Szolnoky, Xiaoyi Ji, Sol Erika Boman, Andrea Discacciati, Henrik Grönberg, Lars Egevad, Tobias Nordström, Kimmo Kartasalo, Martin Eklund

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于AI的模型,利用活检和前列腺切除样本预测生物化学复发风险,展示了AI在前列腺癌预后评估中的应用价值。

Comments 39 pages, 6 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18874 2026-01-30 cs.HC cs.AI cs.CR cs.CY 57%

When Ads Become Profiles: Uncovering the Invisible Risk of Web Advertising at Scale with LLMs

当广告成为资料:利用LLMs揭示大规模网络广告中的隐形风险

Baiyu Chen, Benjamin Tag, Hao Xue, Daniel Angus, Flora Salim

机构 * The University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Queensland University of Technology(昆士兰理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 利用LLMs揭示广告流中的隐私信息泄露风险,展示其在大规模数据中的高精度推断能力。

Comments The ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12588 2026-01-30 cs.LG cs.CL 57%

Plain Transformers Can be Powerful Graph Learners

原始变换器可以成为强大的图学习者

Liheng Ma, Soumyasundar Pal, Yingxue Zhang, Philip H. S. Torr, Mark Coates

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Huawei Noah’s Ark Lab, Montreal(华为诺亚实验室,蒙特利尔) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本研究证明原始变换器可通过简单修改成为强大图学习者,提出PPGT架构在图学习任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21126 2026-01-30 cs.MA cs.RO 50%

AI-Augmented Density-Driven Optimal Control (D2OC) for Decentralized Environmental Mapping

AI增强的密度驱动最优控制(D2OC)用于去中心化环境映射

Kooktae Lee, Julian Martinez

机构 * Department of Mechanical Engineering, New Mexico Institute of Mining and Technology(机械工程系,新墨西哥矿业与技术研究院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出AI增强的密度驱动最优控制方法,用于在传感和通信受限条件下实现多智能体环境映射,通过自适应机制提升密度估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏