arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-24 至 2026-08-24 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 4 篇

2608.20756 2026-08-24 cs.CV cs.AI 新提交 89%

Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation

Vis-Poison:多模态检索增强生成中的视觉知识投毒攻击

Rujin Liang, Zhongpu Chen, Yuhao Lei, Xin Miao

机构 * Southwestern University of Finance and Economics(西南财经大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Vis-Poison攻击,通过自动化多智能体方法构建视觉合理的被投毒图像,在黑盒设置下对多模态RAG系统实现40.16%-65.40%的攻击成功率,且对仅依赖参数知识的MLLM平均成功率超60%。

Comments Findings of EMNLP, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20886 2026-08-24 cs.CV cs.LG 新提交 79%

EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking

EviRank:用于多模态图像重排序的结构化相关性证据

Enjun Du, Siyi Liu, Zirong Chen, Xinyu Zuo, Jinwen Luo, Ruiwen Tao, Lisheng Duan, Haijin Liang, Jin Ma, Junfu Pu, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent Yuanbao(腾讯元宝) The University of Hong Kong(香港大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有多模态图像重排序器的不足,提出EviRank将查询解析为结构化证据包,通过证据条件验证实现重排序,在五个基准上达SOTA,蒸馏学生模型保留超90%能力且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01493 2026-08-24 cs.IR cs.AI cs.CV cs.MM 版本更新 67%

PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval

PhotoBench: 超越视觉匹配,迈向个性化意图驱动的图片检索

Tianyi Xu, Rong Shan, Junjie Wu, Jiadeng Huang, Teng Wang, Jiachen Zhu, Wenteng Chen, Minxin Tu, Quantao Dou, Zhaoxiang Wang, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 PhotoBench 是首个基于真实个人相册构建的基准,旨在通过多源意图驱动推理提升个性化图片检索能力。

Comments Accepted by KDD'26 Benchmark track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20840 2026-08-24 cs.IR cs.CV 新提交 57%

KoViDoRe: Korean Visual Document Retrieval

KoViDoRe:韩文视觉文档检索

Yongbin Choi, Yongwoo Song, Mujeen Sung

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对现有韩文视觉文档检索基准的不足,本文推出KoViDoRe基准及配套训练数据集Ko-VDR Train Public,评估发现现有模型难以处理该任务,为相关模型开发提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏