arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-03 至 2026-03-03 共收录 206 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 11 篇

2603.01415 2026-03-03 eess.AS 70%

The USTC-NERCSLIP Systems for the CHiME-9 MCoRec Challenge

USTC-NERCSLIP系统参加CHiME-9 MCoRec挑战

Ya Jiang, Ruoyu Wang, Jingxuan Zhang, Jun Du, Yi Han, Zihao Quan, Hang Chen, Yeran Yang, Kongzhi Zheng, Zhuo Chen, Yanhui Tu, Shutong Niu, Changfeng Xi, Mengzhi Wang, Zhongbin Wu, Jieru Chen, Henghui Zhi, Weiyi Shi, Shuhang Wu, Genshun Wan, Jia Pan, Jianqing Gao

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 USTC-NERCSLIP系统通过多模态级联方法和LLM技术,在CHiME-9 MCoRec挑战中实现15.70%的联合ASR-聚类错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01418 2026-03-03 cs.CV cs.MM cs.SD 62%

UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation

UniTalking: 一种统一的音频-视频框架用于说话肖像生成

Hebeizi Li, Zihao Liang, Benyuan Sun, Zihao Yin, Xiao Sha, Chenliang Wang, Yi Yang

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04134 2026-03-03 cs.CV cs.SD eess.AS 62%

UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation

UniCUE: 中国手语提示语音视频到语音生成统一识别与生成框架

Jinting Wang, Shan Yang, Chenxing Li, Dong Yu, Li Liu

机构 * HKUST-GZ(香港科技大学-珠海校区)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 UniCUE提出首个统一框架,直接从CS视频生成语音,无需中间文本,通过整合姿态感知视觉处理器、语义对齐池和VisioPhonetic适配器,提升语音生成精度。

Comments 13 pages, 12 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17568 2026-03-03 cs.CR cs.AI cs.SD eess.AS 62%

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

JALMBench: 对音频语言模型中越权攻击的基准测试

Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) University of North Texas(北卡罗来纳州立大学) University of Science and Technology of China(中国科学技术大学) Fujian Normal University(福建师范大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频多模态 20 篇

2509.25678 2026-03-03 cs.LG 88%

Massively Multimodal Foundation Models: A Framework for Capturing Interactions with Specialized Mixture-of-Experts

大规模多模态基础模型:一种捕捉交互的专用专家混合框架

Xing Han, Hsing-Huan Chung, Joydeep Ghosh, Paul Pu Liang, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title);cross-modal(abstract)

AI总结 本文提出了一种大规模多模态基础模型框架,通过量化模态间的时间依赖性,改进混合专家路由机制,提升跨模态交互处理能力。

Comments Published at International Conference on Learning Representations (ICLR) 2026 as a conference paper. 28 pages, 16 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24385 2026-03-03 cs.CV cs.AI 84%

Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy

Vid-LLM:一种基于视频的紧凑型3D多模态大语言模型,具有重建-推理协同效应

Haijier Chen, Bo Xu, Shoujian Zhang, Haoze Liu, Jiaxuan Lin, Jingrong Wang

机构 * School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Hubei Luojia Laboratory(湖北珞珈实验室) School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Vid-LLM通过基于视频的紧凑型3D多模态大语言模型,实现了重建与推理的协同效应,提升了三维场景理解的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04366 2026-03-03 cs.HC cs.MM 83%

Towards Aligning Multimodal LLMs with Human Experts: A Focus on Parent-Child Interaction

向人类专家对齐多模态大语言模型:聚焦亲子互动

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.MM

AI总结 本文探讨了如何通过两阶段提示方法使多模态大语言模型更有效地对齐语言治疗师在分析亲子互动中的联合注意,揭示了观察层与判断层对齐的差异及挑战。

Comments Accepted at CHI 2026 Full Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23359 2026-03-03 cs.CV 83%

VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion

VideoFusion: 一种用于多模态视频融合的时空协作网络

Linfeng Tang, Yeda Wang, Meiqi Gong, Zizhuo Li, Yuxin Deng, Xunpeng Yi, Chunyu Li, Han Xu, Hao Zhang, Jiayi Ma

机构 * School of Robotics, Wuhan University, Wuhan, China(机器人学院,武汉大学,武汉,中国) Electronic Information School, Wuhan University, Wuhan, China(电子信息学院,武汉大学,武汉,中国) Southeast University, Nanjing, China(东南大学,南京,中国)

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 VideoFusion通过时空协作网络实现多模态视频融合,利用跨模态互补性和时间动态性提升视频一致性。

Comments Accepted to CVPR 2026. The dataset and code are available at https://github.com/Linfeng-Tang/VideoFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00515 2026-03-03 cs.CV 83%

MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence

MLLM-4D: 向基于视觉的空间-时间智能迈进

Xingyilang Yin, Chengzhengxu Li, Jiahao Chang, Chi-Man Pun, Xiaodong Cun

机构 * University of Macau(澳门大学) Xi'an Jiaotong University(西安交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) GVC Lab, Great Bay University(大湾大学GVC实验室)

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 MLLM-4D通过改进的数据筛选和训练策略,实现了从2D输入中强大的空间-时间理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02075 2026-03-03 cs.DC 82%

Trident: Adaptive Scheduling for Heterogeneous Multimodal Data Pipelines

Trident:异构多模态数据流水线的自适应调度

Ding Pan, Zhuangzhuang Zhou, Long Qian, Binhang Yuan

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 Trident通过自适应调度框架提升异构多模态数据流水线的吞吐量,优化资源分配与配置转换,降低内存不足风险。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01701 2026-03-03 cs.DB cs.AI 79%

Beyond Single-Modal Analytics: A Framework for Integrating Heterogeneous LLM-Based Query Systems for Multi-Modal Data

超越单一模态分析:一种整合异构LLM查询系统的框架用于多模态数据

Ruyu Li, Tinghui Zhang, Haodi Ma, Daisy Zhe Wang, Yifan Wang

机构 * University of Hawaii at Manoa(夏威夷大学曼纳oa分校) University of Florida(佛罗里达大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出Meta Engine,一种整合异构LLM查询系统的框架,通过统一的语义查询引擎提升多模态数据处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00405 2026-03-03 cs.LG cs.AI 79%

UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings

UME-R1: 探索基于推理的生成多模态嵌入

Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) WeChat AI, Tencent Inc, China(腾讯公司微信AI部门) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 UME-R1通过生成嵌入和强化学习提升多模态嵌入性能,实现判别与生成嵌入的互补,展现生成嵌入在推理和下游任务中的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03905 2026-03-03 cs.CV 79%

EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human Animation

EchoMimicV3:13亿参数足矣实现统一的多模态和多任务人类动画

Rang Meng, Yan Wang, Weipeng Wu, Ruobing Zheng, Yuming Li, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 EchoMimicV3通过统一多任务和多模态人类动画,以13亿参数实现高效且稳定的多任务和多模态动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00110 2026-03-03 cs.RO 78%

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作

Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01284 2026-03-03 cs.CV 74%

FoSS: Modeling Long Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier State Space Integration

FoSS:通过傅里叶状态空间整合建模长距离依赖性和多模态不确定性在轨迹预测中

Yizhou Huang, Gengze Jiang, Yihua Cheng, Kezhi Wang

机构 * Brunel University of London(伦敦布鲁内尔大学) University of Birmingham(伯明翰大学)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 FoSS通过结合频域和时域建模,有效提升轨迹预测的准确性和效率,减少计算与参数消耗,实现多模态不确定性建模。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01441 2026-03-03 cs.CV cs.RO 70%

Unifying Language-Action Understanding and Generation for Autonomous Driving

统一语言-动作理解与生成以实现自动驾驶

Xinyang Wang, Qian Liu, Wenjie Ding, Zhao Yang, Wei Li, Chang Liu, Bailin Li, Kun Zhan, Xianpeng Lang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Li Auto

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 LinkVLA通过统一语言和动作令牌及两步生成方法,提升自动驾驶中语言-动作一致性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01694 2026-03-03 cs.CV cs.AI cs.LG 62%

MVR: Multi-view Video Reward Shaping for Reinforcement Learning

MVR:多视图视频奖励塑造用于强化学习

Lirui Luo, Guoxi Zhang, Hongming Xu, Yaodong Yang, Cong Fang, Qing Li

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01169 2026-03-03 cs.CV cs.AI cs.LG 62%

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

TripleSumm: 适应性三模态融合用于视频摘要

Sumin Kim, Hyemin Jeong, Mingu Kang, Yejin Kim, Yoori Oh, Joonseok Lee

机构 * Seoul National University(首尔国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 TripleSumm通过适应性三模态融合技术,在视频摘要任务中实现了最先进的性能,首次提出了多模态视频摘要的大型基准MoSu。

Comments Published as a Conference Paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01104 2026-03-03 cs.HC cs.AI cs.CV cs.CY 62%

Egocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AI

第一人称共驾:面向辅助第一人称AI的网页原生智能眼镜代理

Sicheng Yang, Yukai Huang, Weitong Cai, Shitong Sun, Fengyi Fang, You He, Yiqiao Xie, Jiankang Deng, Hang Zhang, Jifei Song, Zhensong Zhang

机构 * Shenzhen International Graduate School Tsinghua University Shenzhen China(深圳国际研究生院清华大学深圳中国) Independent Researcher London United Kingdom(独立研究者伦敦英国) Queen Mary University of London London United Kingdom(女王玛丽大学伦敦英国) Imperial College London London United Kingdom(帝国理工学院伦敦英国) University Of Surrey Guildford United Kingdom(Surrey大学Guildford英国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Egocentric Co-Pilot通过网页原生智能眼镜代理实现第一人称AI的持续辅助,结合神经符号框架和多模态意图层,展示了在日常生活中提升可及性和情境感知的实用路径。

Comments 14 pages, 6 figures, WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01926 2026-03-03 cs.IR cs.CV 57%

MealRec: Multi-granularity Sequential Modeling via Hierarchical Diffusion Models for Micro-Video Recommendation

MealRec: 基于分层扩散模型的多粒度序列建模用于微视频推荐

Xinxin Dong, Haokai Ma, Yuze Zheng, Yongfu Zha, Yonghui Yang, Xiaodong Wang

机构 * National University of Defense Technology(国防科技大学) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MealRec通过分层扩散模型实现多粒度序列建模,解决微视频推荐中的偏好无关表示和模态冲突问题,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01839 2026-03-03 cs.CV cs.RO 57%

LEAR: Learning Edge-Aware Representations for Event-to-LiDAR Localization

LEAR: 为事件到LiDAR定位学习边缘感知表示

Kuangyi Chen, Jun Zhang, Yuxi Hu, Yi Zhou, Friedrich Fraundorfer

机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,技术大学格拉茨) School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 LEAR通过联合估计边缘结构和密集事件深度流场,解决事件与LiDAR对齐难题,提升GPS受限环境下的定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01545 2026-03-03 cs.CV 57%

Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory

无需训练的时空解耦推理视频分割与自适应对象记忆

Zhengtong Zhu, Jiaqing Fan, Zhixuan Liu, Fanzhang Li

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出无需训练的时空解耦推理视频分割方法SDAM,通过自适应对象记忆模块和时空解耦技术实现稳定的时间传播,优于现有微调方法。

Comments Accept by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00467 2026-03-03 cs.CV 57%

High Dynamic Range Imaging Based on an Asymmetric Event-SVE Camera System

基于非对称事件-SVE相机系统的高动态范围成像

Pengju Sun, Banglei Guan, Jing Tao, Zhenbao Yu, Xuanyu Bai, Yang Shang, Qifeng Yu

机构 * College of Aerospace Science and Engineering(航空航天科学与工程学院) National University of Defense Technology(国防科技大学) Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation(湖南省图像测量与视觉导航重点实验室)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于非对称事件-SVE相机系统的高动态范围成像系统,通过跨模态对齐和计算融合技术提升高动态场景下的成像性能。

Comments This paper has been accepted by Optics Express

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20034 2026-03-03 cs.RO cs.CV 57%

Digital and Robotic Twinning for Validation of Proximity Operations and Formation Flying

数字与机器人双胞胎用于近距操作与编队飞行的验证

Z. Ahmed, E. Bates, P. Francesch Huc, S. Y. W. Low, A. Golan, T. Bell, A. Rizza, S. D'Amico

机构 * Stanford University(斯坦福大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种混合双胞胎框架,用于验证航天器GNC系统在近距操作和编队飞行中的性能。

Journal ref 2026 Rocky Mountain AAS GN&C Conference, Breckenridge, Colorado

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 跨模态检索 25 篇

2603.01082 2026-03-03 cs.CV cs.IR 85%

Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval

超越全局相似性:面向细粒度、多条件多模态检索

Xuan Lu, Kangle Li, Haohang Huang, Rui Meng, Wenjun Zeng, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23589 2026-03-03 cs.CV cs.AI 84%

Pseudo Contrastive Learning for Diagram Comprehension in Multimodal Models

伪对比学习用于多模态模型中的图表理解

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究机构有限公司)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出伪对比学习方法,通过生成合成图表增强多模态模型对图表的理解能力,实验表明在图像-文本匹配和视觉问答任务中优于传统CLIP方法。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00510 2026-03-03 cs.CV cs.AI 84%

What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models

视觉标记究竟编码了什么?揭示多模态大语言模型中的稀疏性与冗余性

Yingqi Fan, Junlong Tong, Anhao Zhao, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本研究揭示多模态大语言模型中视觉标记的稀疏性与冗余性,通过EmbedLens工具发现活跃标记在进入模型前已编码细粒度信息,并提出中层注入方法提升效率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00172 2026-03-03 cs.CR cs.AI 83%

Hidden in the Metadata: Stealth Poisoning Attacks on Multimodal Retrieval-Augmented Generation

元数据中的隐藏攻击:多模态检索增强生成中的隐秘污染攻击

Kennedy Edemacu, Mohammad Mahdi Shokri

机构 * The City University of New York, CSI, Staten Island, NY 10314, USA(纽约城市大学,CSI,史泰登岛分校) The City University of New York, Graduate Center, New York, NY 10016, USA(纽约城市大学研究生中心)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 本研究提出MM-MEPA,一种通过操纵多模态检索条目元数据来影响模型响应的隐秘污染攻击,展示了其在多模态RAG系统中的高攻击成功率和防御不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13061 2026-03-03 cs.CL cs.AI cs.CV cs.LG 82%

Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection

鲁棒适应大规模多模态模型用于检索增强的仇恨表情包检测

Jingbiao Mei, Jinghong Chen, Guangyu Yang, Weizhe Lin, Bill Byrne

机构 * Department of Engineering University of Cambridge(工程系剑桥大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种鲁棒适应框架,用于提升大规模多模态模型在检索增强的仇恨表情包检测中的性能与泛化能力,同时提高模型的可解释性。

Comments EMNLP 2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00500 2026-03-03 cs.RO 82%

Zero-Shot Robotic Manipulation via 3D Gaussian Splatting-Enhanced Multimodal Retrieval-Augmented Generation

通过3D高斯点云增强的多模态检索增强生成实现零样本机器人操作

Zilong Xie, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yuan Xie

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出RobMRAG框架,通过3D高斯点云增强多模态检索增强生成,提升零样本机器人操作的泛化能力和可解释性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏