arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-23 至 2025-12-23 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 17 篇

2512.18745 2025-12-23 cs.CV cs.CL cs.LG 87%

InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search

InSight-o3: 通过通用视觉搜索增强多模态基础模型

Kaican Li, Lewei Yao, Jiannan Wu, Tiezheng Yu, Jierun Chen, Haoli Bai, Lu Hou, Lanqing Hong, Wei Zhang, Nevin L. Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.CV、cs.CL

AI总结 InSight-o3通过通用视觉搜索任务提升多模态基础模型的推理能力,解决复杂视觉信息整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17911 2025-12-23 cs.CL cs.AI cs.LG 84%

Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models

面向多模态大语言模型的推理保留反学习

Hongji Li, Junchi yao, Manjiang Yu, Priyanka Singh, Xue Li, Di Wang, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) University of Queensland(昆士兰大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任人工智能与数据分析实验室) King Abdullah University of Science and Technology (KAUST)(卡塔尔科学与技术大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出R-MUSE框架,通过子空间指导和自适应引导,在推理过程中有效消除多模态大语言模型中的推理痕迹,同时保留通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18864 2025-12-23 cs.CV cs.MM 81%

Cross-modal Counterfactual Explanations: Uncovering Decision Factors and Dataset Biases in Subjective Classification

跨模态反事实解释:在主观分类中揭示决策因素和数据集偏见

Alina Elena Baia, Andrea Cavallaro

机构 * EPFL(瑞士联邦理工学院)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出DeX框架,通过跨模态分解和图像特定概念生成自然语言反事实解释,揭示主观分类中的决策因素和数据集偏见,提升模型公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19675 2025-12-23 econ.GN cs.CV cs.DL q-fin.EC 79%

Multimodal LLMs for Historical Dataset Construction from Archival Image Scans: German Patents (1877-1918)

多模态大语言模型用于从档案图像扫描中构建历史数据集:德国专利(1877-1918)

Niclas Griesshaber, Jochen Streb

机构 * University of Mannheim(曼海姆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出利用多模态大语言模型构建德国1877-1918年专利数据集,证明其在效率和质量上的优势,并开源相关工具和数据以促进经济史研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19354 2025-12-23 cs.CV 79%

ReasonCD: A Multimodal Reasoning Large Model for Implicit Change-of-Interest Semantic Mining

ReasonCD: 一种用于隐含兴趣语义挖掘的多模态推理大模型

Zhenyang Huang, Xiao Yu, Yi Zhang, Decheng Wang, Hang Ruan

机构 * Beijing Institute of Tracking and Telecommunications Technology(北京跟踪与电信技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ReasonCD通过利用预训练大语言模型的推理能力,挖掘用户隐含任务意图,实现更高效的变化检测与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19350 2025-12-23 cs.AI 79%

PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models

PENDULUM: 一个用于评估多模态大语言模型顺从性的基准

A. B. M. Ashikur Rahman, Saeed Anwar, Muhammad Usman, Irfan Ahmad, Ajmal Mian

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI 79%

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18947 2025-12-23 cs.AI cs.NE 79%

Clustering-based Transfer Learning for Dynamic Multimodal MultiObjective Evolutionary Algorithm

基于聚类的迁移学习用于动态多模态多目标进化算法

Li Yan, Bolun Liu, Chao Li, Jing Liang, Kunjie Yu, Caitong Yue, Xuzhao Chai, Boyang Qu

机构 * School of Automation and Electrical Engineering, Zhongyuan University of Technology(中原文理大学自动化与电气工程学院) School of Electrical Engineering, Zhengzhou University(郑州大学电气工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于聚类的自编码器预测机制,用于动态多模态多目标优化,通过构建基准测试函数和自适应尼奇策略,提升种群多样性和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00086 2025-12-23 cs.CV 79%

Multi-modal On-Device Learning for Monocular Depth Estimation on Ultra-low-power MCUs

多模态设备端学习用于超低功耗MCU上的单目深度估计

Davide Nadalini, Manuele Rusci, Elia Cereda, Luca Benini, Francesco Conti, Daniele Palossi

机构 * Department of Electrical, Electronic, and Information Engineering (DEI), University of Bologna(电气电子与信息工程系,博洛尼亚大学) Department of Control and Computer Engineering (DAUIN), Politecnico di Torino(控制与计算机工程系,托斯卡纳理工学院) Department of Electrical Engineering (ESAT) at KU Leuven(根特大学电子工程系) Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(达勒莫人工智能研究所(IDSIA),USI-SUPSI) Department of Information Technology and Electrical Engineering (D-ITET), ETH Zurich(信息科技与电气工程系,苏黎世联邦理工学院) Integrated Systems Laboratory, ETH Zurich(集成系统实验室,苏黎世联邦理工学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究提出了一种多模态设备端学习技术,用于在超低功耗MCU上实现单目深度估计,通过减少内存消耗和优化训练过程,显著提升精度和效率。

Comments 14 pages, 9 figures, 3 tables. Associated open-source release available at: https://github.com/idsia-robotics/ultralow-power-monocular-depth-ondevice-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02543 2025-12-23 cs.CV cs.HC cs.LG 79%

A Deep Learning-based Multimodal Depth-Aware Dynamic Hand Gesture Recognition System

基于深度学习的多模态深度感知动态手部姿态识别系统

Hasan Mahmud, Mashrur M. Morshed, Md. Kamrul Hasan

机构 * Systems \& Software Lab (SSL), Department of Computer Science

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于深度学习的多模态深度感知动态手部姿态识别系统,通过量化深度值和改进多模态融合CRNN架构,提高了识别准确性和参数效率。

Journal ref The Visual Computer, Springer Nature, January 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19021 2025-12-23 cs.CV cs.RO 57%

VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation

VLNVerse: 一个用于视觉语言导航的基准,具备多用途、具身体验、逼真模拟和评估

Sihao Lin, Zerui Li, Xunyi Zhao, Gengze Zhou, Liuyi Wang, Rong Wei, Rui Tang, Juncheng Li, Hanqing Wang, Jiangmiao Pang, Anton van den Hengel, Jiajun Liu, Qi Wu

机构 * Adelaide University(阿德莱德大学) Responsible AI Research Centre, Australian Institute for Machine Learning(负责任人工智能研究中心、澳大利亚机器学习研究所) Tongji University(同济大学) ManyCore Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) CSIRO Data61

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV

AI总结 VLNVerse是一个大规模、可扩展的视觉语言导航基准,通过多用途、具身体验和逼真模拟提升导航任务的泛化能力与研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12826 2025-12-23 cs.RO cs.CV 57%

UncAD: Towards Safe End-to-end Autonomous Driving via Online Map Uncertainty

UncAD: 向通过在线地图不确定性实现安全端到端自动驾驶迈进

Pengxuan Yang, Yupeng Zheng, Qichao Zhang, Kefei Zhu, Zebin Xing, Qiao Lin, Yun-Fu Liu, Zhiguo Su, Dongbin Zhao

机构 * Key Laboratory of Safety Intelligent Mining in Non-coal Open-pit Mines, National Mine safety Administration, Guangdong Guangzhou, 510000, China(安全智能采矿非煤矿山重点实验室,国家矿山安全监察局,广东广州,510000,中国) The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) EACON, Fujian, China(福建中国EACON)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 UncAD通过引入在线地图不确定性,提升自动驾驶安全性,减少碰撞和冲突率。

Journal ref 2025 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05277 2025-12-23 cs.CV 57%

Text to Blind Motion

文本到盲人运动

Hee Jae Kim, Kathakoli Sengupta, Masaki Kuribayashi, Hernisa Kacorri, Eshed Ohn-Bar

机构 * Boston University(波士顿大学) Waseda University(早稻田大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BlindWays,首个针对盲人行人的多模态运动基准,通过收集盲人真实环境中的3D运动数据及文本描述,评估现有3D运动模型在处理盲人独特运动模式时的不足,以提升自动驾驶等系统对多样化人类运动的推理能力。

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18563 2025-12-23 cs.CV 57%

OpenView: Empowering MLLMs with Out-of-view VQA

OpenView: 通过视图外视觉问答增强大规模语言模型

Qixiang Chen, Cheng Zhang, Chi-Wing Fu, Jingwen Ye, Jianfei Cai

机构 * Monash University(墨尔本大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 OpenView通过全景图像生成多选VQA,提升大规模语言模型在视图外视觉问答任务中的性能。

Comments Code: https://github.com/q1xiangchen/OpenView

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18197 2025-12-23 q-bio.QM cs.CV eess.IV 57%

Standardized Evaluation of Automatic Methods for Perivascular Spaces Segmentation in MRI -- MICCAI 2024 Challenge Results

自动方法在MRI中血管周围空间分割标准化评估——MICCAI 2024挑战结果

Yilei Wu, Yichi Zhang, Zijian Dong, Fang Ji, An Sen Tan, Gifford Tan, Sizhao Tang, Huijuan Chen, Zijiao Chen, Eric Kwun Kei Ng, Jose Bernal, Hang Min, Ying Xia, Ines Vati, Liz Cooper, Xiaoyu Hu, Yuchen Pei, Yutao Ma, Victor Nozais, Ami Tsuchida, Pierre-Yves Hervé, Philippe Boutinaud, Marc Joliot, Junghwa Kang, Wooseung Kim, Dayeon Bak, Rachika E. Hamadache, Valeriia Abramova, Xavier Lladó, Yuntao Zhu, Zhenyu Gong, Xin Chen, John McFadden, Pek Lan Khong, Roberto Duarte Coello, Hongwei Bran Li, Woon Puay Koh, Christopher Chen, Joanna M. Wardlaw, Maria del C. Valdés Hernández, Juan Helen Zhou

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MICCAI 2024 EPVS分割挑战,评估多种深度学习方法在多中心数据上的性能,揭示了跨站点泛化中的域转移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20162 2025-12-23 cs.CV 57%

TOMCAT: Test-time Comprehensive Knowledge Accumulation for Compositional Zero-Shot Learning

TOMCAT:测试时综合知识积累用于组合零样本学习

Xudong Yan, Songhe Feng

机构 * School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) Key Laboratory of Big Data and Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(交通运输大数据与人工智能重点实验室(北京交通大学),教育部)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 TOMCAT通过测试时积累文本和视觉知识,结合多模态协作学习,提升组合零样本学习的性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04226 2025-12-23 cs.CV cs.LG cs.NE stat.CO stat.ML 57%

Keep It Light! Simplifying Image Clustering Via Text-Free Adapters

保持简洁!通过无文本适配器简化图像聚类

Yicen Li, Haitz Sáez de Ocáriz Borde, Anastasis Kratsios, Paul D. McNicholas

机构 * Department of Mathematics and Statistics, McMaster University(数学与统计学系,麦斯特大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种无需文本信息的图像聚类方法SCP,通过简化训练流程在多个数据集上实现了与复杂方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏