arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2604.11671 2026-04-16 eess.SP cs.RO 50%

VLMaterial: Vision-Language Model-Based Camera-Radar Fusion for Physics-Grounded Material Identification

VLMaterial: 基于视觉-语言模型的相机-雷达融合用于物理基础的材料识别

Jiangyou Zhu, He Chen

机构 * Department of Inforation Engineering(信息工程系)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 本文提出VLMaterial框架,通过融合视觉语言模型与雷达知识实现物理基础的材料识别,采用双管道架构和上下文增强生成策略,提升跨模态融合性能,实验表明其在120余次真实实验中达到96.08%的识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12284 2026-04-15 cs.CR 50%

WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents

WebAgentGuard: 一种基于推理的守护模型,用于检测Web代理中的提示注入攻击

Yulin Chen, Tri Cao, Haoran Li, Yue Liu, Yibo Li, Yufei He, Le Minh Khoi, Yangqiu Song, Shuicheng Yan, Bryan Hooi

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出WebAgentGuard,一种基于推理的多模态守护模型,用于检测Web代理中的提示注入攻击。通过构建合成多模态数据集并采用推理密集型监督微调和强化学习,模型在多个基准测试中优于现有方法,同时保持代理的实用性,不引入额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06502 2026-04-09 cs.LG 50%

VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts

VLMShield: 有效且稳健的视觉语言模型对抗恶意提示防御

Peigui Qi, Kunsheng Tang, Yanpu Yu, Jialin Wu, Yide Song, Wenbo Zhou, Zhicong Huang, Cheng Hong, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) University of Washington(华盛顿大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出VLMShield,通过多模态聚合特征提取框架提升视觉语言模型对恶意提示的防御能力,实验显示其在鲁棒性、效率和实用性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05477 2026-04-09 cs.RO 50%

Trust Through Transparency: Explainable Social Navigation for Autonomous Mobile Robots via Vision-Language Models

通过透明实现信任:通过视觉语言模型实现自主移动机器人的可解释社交导航

Oluwadamilola Sotomi, Devika Kodi, Aliasghar Arab

机构 * New York University, Tandon School of Engineering(纽约大学坦登工程学院) General Autonomy Inc.(通用自主公司)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出一种多模态可解释模块,结合视觉语言模型和热图提升自主导航的透明度,通过自然语言总结使机器人感知、分析并表达观察结果,实验表明实时解释能提升用户信任和理解。

Comments Submitted to IEEE Conferences

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09746 2026-04-08 cs.MA 50%

Multi-Agent Cooperative Learning for Robust Vision-Language Alignment under OOD Concepts

多智能体协作学习用于应对异常概念下的鲁棒视觉语言对齐

Philip Xu

专题命中 图文多模态 :cross-modal(abstract)

AI总结 本文提出多智能体协作学习框架,通过结构化信息传递缓解模态不平衡,提升视觉语言模型在异常概念下的对齐性能,实验表明在少样本和零样本设置中精度提升1-5%。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03139 2026-04-06 cs.RO 50%

FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation

FSUNav: 一种用于快速、安全和通用零样本目标导向导航的脑皮层-小脑架构

Mingao Tan, Yiyang Li, Shanze Wang, Xinming Zhang, Wei Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) College of Information Science and Technology, Eastern Institute of Technology(东方理工学院信息科学与技术学院)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出FSUNav架构,通过整合视觉语言模型与小脑-脑皮层模块,实现跨异构平台的零样本目标导航,提升效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29474 2026-04-01 eess.SY cs.LG cs.SY 50%

From Big Data to Fast Data: Towards High-Quality Datasets for Machine Learning Applications from Closed-Loop Data Collection

从大数据到快数据:面向机器学习应用的高质量数据集设计:从闭环数据收集

Philipp Reis, Jacqueline Henle, Stefan Otten, Eric Sax

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出快数据概念,通过车辆实时决策优化数据采集,提升数据集相关性与信息密度,降低冗余数据成本,为现代机器学习算法提供高效数据采集基础。

Comments Submitted to IEEE ISSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27571 2026-03-31 cs.HC 50%

RAGent: Physics-Aware Agentic Reasoning for Training-Free mmWave Human Activity Recognition

RAGent:面向无训练毫米波人类活动识别的物理感知代理推理

Mingda Han, Huanqi Yang, Zehua Sun, Wenhao Li, Yanni Yang, Guoming Zhang, Yetong Cao, Weitao Xu, Pengfei Hu

专题命中 图文多模态 :cross-modal(abstract)

AI总结 RAGent通过物理感知代理推理实现无训练毫米波人类活动识别,利用雷达知识库进行证据驱动推理,无需领域特定训练或适应,实现跨领域鲁棒识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27091 2026-03-31 math.OC 50%

Meta-Contrastive Learning for Vision-Language Models via Task-Adaptive CLIP Training

通过任务自适应CLIP训练实现视觉语言模型的元对比学习

Merham Fouladvand, Peuroly Batra

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出一种域条件元对比学习框架,通过任务自适应CLIP训练提升视觉语言模型跨域泛化能力,引入域嵌入和交叉域对齐正则化,增强模型在域偏移下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02569 2026-03-30 cs.HC cs.RO 50%

Reframing Human-Robot Interaction Through Extended Reality: Unlocking Safer, Smarter, and More Empathic Interactions with Virtual Robots and Foundation Models

通过扩展现实重新定义人机交互:利用虚拟机器人和基础模型实现更安全、更智能和更具同理心的交互

Yuchong Zhang, Yong Ma, Danica Kragic

机构 * Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习部) Department of Clinical Medicine, University of Bergen(卑尔根大学临床医学系)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文探讨通过扩展现实技术,利用基础模型驱动的虚拟机器人实现更安全、智能和具同理心的人机交互,同时讨论多模态大模型在认知和情感交互中的应用及潜在风险。

Comments This paper is under review

Journal ref Empathic Computing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22800 2026-03-25 cs.RO 50%

CATNAV: Cached Vision-Language Traversability for Efficient Zero-Shot Robot Navigation

CATNAV:基于缓存的视觉-语言可 traversability 用于高效零样本机器人导航

Aditya Potnis, Francisco Affonso, Shreya Gummadi, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * Field Robotics Engineering and Science Hub (FRESH)(田纳西机器人工程与科学中心(FRESH))

专题命中 图文多模态 :multimodal(abstract)

AI总结 CATNAV通过多模态LLM生成零样本、体态感知的成本图,利用视觉语义缓存机制减少85.7%的在线VLM查询,结合基于VLM的轨迹选择模块,在五项导航任务中实现更高的目标到达率和更少的行为约束违规。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15977 2026-03-24 cs.HC 50%

Adaptive Captioning with Emotional Cues: Supporting DHH and Neurodivergent Learners in STEM

适应性字幕与情感提示:支持聋人及神经多样性学习者在STEM领域

Sunday David Ubur, Eugenia Ha Rim Rho, Denis Gracanin

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文探讨了四种嵌入情感和多模态提示的字幕原型,通过实验证明其能降低认知负荷并提升理解成绩,强调了为神经多样性用户定制字幕功能的重要性。

Comments Accepted and presented at Affective Computing and Intelligent Interaction (ACII) Conference 2025; final version to appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20607 2026-03-24 cs.RO cs.LG 50%

Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models

面向视觉-语言-动作模型的实用世界模型强化学习

Zhilong Zhang, Haoxiang Ren, Yihao Sun, Yifei Sheng, Haonan Wang, Haoxin Lin, Zhichao Wu, Pierre-Luc Bacon, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) Mila - Quebec AI Institute(魁北克AI研究所)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出VLA-MBPO框架,解决视觉-语言-动作模型在强化学习中的世界建模、多视角一致性及稀疏奖励下的误差累积问题,提升策略性能和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22579 2026-03-18 cs.RO cs.SE 50%

Metamorphic Testing of Vision-Language Action-Enabled Robots

视觉-语言-动作机器人元测试

Pablo Valle, Sergio Segura, Shaukat Ali, Aitor Arrieta

机构 * Mondragon University(蒙达龙大学) University of Seville(塞维利亚大学) Simula Research Laboratory(Simula研究实验室)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文探讨元测试能否缓解视觉-语言-动作机器人测试 oracle 问题,提出两种关系模式和五种关系,通过实验证明其有效性,并展示其在不同任务和机器人上的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18519 2026-03-17 cs.LG 50%

CHIPS: Efficient CLIP Adaptation via Curvature-aware Hybrid Influence-based Data Selection

CHIPS: 通过曲率感知的混合影响数据选择实现高效的CLIP适应

Xinlin Zhuang, Yichen Li, Xiwei Liu, Haolin Yang, Yifan Lu, Ziyun Zou, Yulong Li, Huifa Li, Dongliang Chen, Qinglei Wang, Weiyang Liu, Ying Qian, Jiangming Shi, Imran Razzak

专题命中 图文多模态 :image-text(abstract)

AI总结 本文提出CHIPS方法,通过曲率感知和混合影响数据选择,实现高效的CLIP垂直领域适应,在医疗和通用领域基准中均表现出色。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11920 2026-03-17 cs.RO 50%

H2R: A Human-to-Robot Data Augmentation for Robot Pre-training from Videos

H2R: 一种从视频中为机器人预训练的人到机器人的数据增强

Guangrun Li, Yaoxu Lyu, Zhuoyang Liu, Chengkai Hou, Jieyu Zhang, Shanghang Zhang

专题命中 图文多模态 :image-text(abstract)

AI总结 H2R通过将人类视角视频转换为机器人视角数据,弥合人机视觉差距,提升机器人预训练效果,实验显示在模拟和现实场景中均显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10436 2026-03-12 cs.RO cs.DC 50%

COHORT: Hybrid RL for Collaborative Large DNN Inference on Multi-Robot Systems Under Real-Time Constraints

COHORT: 基于混合强化学习的多机器人系统实时协同大规模深度神经网络推理

Mohammad Saeid Anwar, Anuradha Ravi, Indrajeet Ghosh, Gaurav Shinde, Carl Busart, Nirmalya Roy

专题命中 图文多模态 :multimodal(abstract)

AI总结 COHORT通过混合强化学习策略,优化多机器人系统在实时约束下的大规模DNN推理,降低能耗并提升GPU利用率。

Comments Recently accepted at 27th IEEE International Symposium on a World of Wireless, Mobile and Multimedia Networks ( IEEE WoWMoM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10158 2026-03-12 cs.RO 50%

Cross-Hand Latent Representation for Vision-Language-Action Models

跨手的潜在表示用于视觉-语言-动作模型

Guangqi Jiang, Yutong Liang, Jianglong Ye, Jia-Yang Huang, Changwei Jing, Rocky Duan, Pieter Abbeel, Xiaolong Wang, Xueyan Zou

专题命中 图文多模态 :multimodal(abstract)

AI总结 XL-VLA通过统一的潜在动作空间实现跨手灵巧操作的可扩展学习,提升视觉-语言-动作模型的训练效率和性能。

Comments Website: https://xl-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08495 2026-03-10 cs.LG stat.ML 50%

Efficient Credal Prediction through Decalibration

通过去校准实现高效的可信预测

Paul Hofman, Timo Löhr, Maximilian Muschalik, Yusuf Sale, Eyke Hüllermeier

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) DFKI (DSA)(德意志联邦防务研究所)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 本文提出了一种基于相对似然的高效可信预测方法,通过去校准技术实现对复杂模型的高效可信集生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08122 2026-03-10 cs.RO 50%

Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA

通过强化学习增强的遥控操作与混合的灵巧专家VLA实现人机操作

Tutian Tang, Xingyu Ji, Wanli Xing, Ce Hao, Wenqiang Xu, Lin Shao, Cewu Lu, Qiaojun Yu, Jiangmiao Pang, Kaifeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sharpa Shanghai AI Lab(上海人工智能实验室) Zhongguancun Academy(中关村学院) National University of Singapore(新加坡国立大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出IMCopilot和MoDE-VLA框架,通过强化学习和多模态融合提升机器人灵巧操作能力,实现接触丰富的手内任务性能提升。

Comments Project Homepage: https://sites.google.com/view/mode-vla

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18570 2026-03-10 cs.LG 50%

VISTA: Vision-Language Inference for Training-Free Stock Time-Series Analysis

VISTA:面向无训练股票时间序列分析的视觉-语言推理

Tina Khezresmaeilzadeh, Parsa Razmara, Seyedarmin Azizi, Mohammad Erfan Sadeghi, Erfan Baghaei Potraghloo

机构 * University of Southern California(南加州大学)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 VISTA通过结合文本和视觉信息,利用无训练的视觉-语言模型实现股票时间序列预测,实验结果显示其在预测精度上显著优于传统方法。

Comments Accepted to the CVPR 2025 Workshop on Transformers for Vision (T4V): accepted-papers" target="_blank" rel="noopener">https://sites.google.com/view/t4v-cvpr25/accepted-papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03942 2026-03-05 cs.RO 50%

Lightweight Visual Reasoning for Socially-Aware Robots

轻量级视觉推理用于社交感知机器人

Alessio Galatolo, Ronald Cumbal, Alexandros Rouchitsas, Katie Winkle, Didem Gürdür Broo, Ginevra Castellano

机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本研究提出了一种轻量级视觉推理模块,用于提升社交感知机器人在复杂人机交互中的表现,通过闭环反馈机制增强机器人对动态人类行为的理解和响应能力。

Comments ICRA26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25191 2026-03-05 cs.RO 50%

SoraNav: Adaptive UAV Task-Centric Navigation via Zeroshot VLM Reasoning

SoraNav: 通过零样本VLM推理实现适应性无人机任务导向导航

Hongyu Song, Rishabh Dev Yadav, Cheng Guo, Wei Pan

机构 * Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 SoraNav通过零样本VLM推理实现无人机任务导向导航,解决空间-语义差距问题,提升导航成功率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03527 2026-03-05 cs.LG 50%

Logit-Level Uncertainty Quantification in Vision-Language Models for Histopathology Image Analysis

视觉-语言模型在病理图像分析中的logit级不确定性量化

Betul Yurdem, Ferhat Ozgur Catak, Murat Kuzlu, Mehmet Kemal Gullu

机构 * Department of Electrical and Electronics Engineering, Izmir Bakircay University(电气与电子工程系,伊兹密尔巴克伊大学) Department of Electrical Engineering and Computer Science, University of Stavanger(电气工程与计算机科学系,斯塔万格大学) Batten College of Engineering and Technology, Old Dominion University(工程与技术学院,老奥布良大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本研究提出了一种基于VLMs的logit级不确定性量化框架,用于评估病理图像分析中模型的可靠性与安全性。

Comments 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01813 2026-03-03 cs.RO 50%

SSMG-Nav: Enhancing Lifelong Object Navigation with Semantic Skeleton Memory Graph

SSMG-Nav: 通过语义骨架记忆图增强终身物体导航

Haochen Niu, Lantao Zhang, Xingwu Ji, Rendong Ying, Peilin Liu, Fei Wen

机构 * Brain-Inspired Application Technology Center (BATC), Shanghai Jiao Tong University(脑启发应用技术中心(BATC),上海交通大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 SSMG-Nav通过语义骨架记忆图提升终身物体导航,整合多模态信息与持久记忆,优化路径效率与任务成功率。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05535 2026-02-27 cs.LG 50%

Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification

通过证据不确定性量化检测大视觉-语言模型的误行

Tao Huang, Rui Wang, Xiaofei Liu, Yi Qin, Li Duan, Liping Jing

机构 * State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室)

专题命中 图文多模态 :multimodal(abstract)

AI总结 通过证据不确定性量化检测大视觉-语言模型的误行,识别内部冲突和无知以提高模型可靠性。

Comments Accepted to ICLR 2026. Code is available at https://github.com/HT86159/EUQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13157 2026-02-17 eess.SP 50%

Seeing Radio: From Zero RF Priors to Explainable Modulation Recognition with Vision Language Models

看见无线电:从零RF先验到可解释的调制识别与视觉语言模型

Hang Zou, Bohao Wang, Yu Tian, Lina Bariah, Chongwen Huang, Samson Lasaulce, Mérouane Debbah

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出利用视觉语言模型直接感知无线电波信号并推断调制模式,通过转换IQ流为图像数据,提升模型准确性至90%,并实现可解释的调制识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07469 2026-02-10 astro-ph.IM 50%

Toward Vision-Language Assistants for Radio Astronomical Source Analysis

迈向射电天文源分析的视觉-语言助手

S. Riggi

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出radio-llava,一种针对射电天文的视觉-语言助手,通过指令微调提升多任务性能,但发现专用视觉模型仍更优,且微调导致通用任务性能下降。

Comments 5 pages, 3 figures, Proceedings IAU Symposium No. 397, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05325 2026-02-10 cs.RO 50%

RoboPaint: From Human Demonstration to Any Robot and Any View

RoboPaint:从人类示范到任何机器人和任何视角

Jiacheng Fan, Zhiyue Zhao, Yiqian Zhang, Chao Chen, Peide Wang, Hengdi Zhang, Zhengxue Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 RoboPaint通过真实-仿真-真实数据流程,将人类示范转化为机器人训练数据,实现高效、低成本的复杂灵巧操作训练。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03910 2026-02-05 eess.IV 50%

CONRep: Uncertainty-Aware Vision-Language Report Drafting Using Conformal Prediction

CONRep:基于置信预测的不确定性感知视觉-语言报告起草

Danial Elyassirad, Benyamin Gheiji, Mahsa Vatanparast, Amir Mahmoud Ahmadzadeh, Seyed Amir Asef Agah, Mana Moassefi, Meysam Tavakoli, Shahriar Faghani

专题命中 图文多模态 :image-text(abstract)

AI总结 CONRep通过置信预测为视觉语言模型生成的放射学报告提供不确定性量化,提升自动化报告系统的透明性和临床实用性。

Comments 17 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏