arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-06 至 2026-01-06 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2508.17215 2026-01-06 cs.LG cs.AI cs.CR 85%

How to make Medical AI Systems safer? Simulating Vulnerabilities, and Threats in Multimodal Medical RAG System

如何使医疗AI系统更安全?在多模态医疗RAG系统中模拟漏洞和威胁

Kaiwen Zuo, Zelin Liu, Raman Dutt, Ziyang Wang, Zhongtian Sun, Fan Mo, Pietro Liò

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出MedThreatRAG框架,通过模拟攻击环境揭示医疗RAG系统漏洞,展示跨模态冲突注入对系统性能的严重影响。

Comments Sumbitted to 2026 ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18770 2026-01-06 cs.CV cs.AI cs.IR 84%

Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships

通过利用一对一关系进行多模态对抗防御以提升视觉语言模型

Futa Waseda, Antonio Tejero-de-Pablos, Isao Echizen

机构 * The University of Tokyo(东京大学) CyberAgent National Institute of Informatics(信息处理研究所)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态对抗训练方法,通过利用图像与文本之间的一对多关系提升视觉语言模型的对抗鲁棒性。

Comments WACV 2026 Accepted. Code available at https://github.com/CyberAgentAILab/multimodal-adversarial-training

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02565 2026-01-06 cs.CV 79%

SJTU:Spatial judgments in multimodal models towards unified segmentation through coordinate detection

上海交通大学:通过坐标检测实现多模态模型中的空间判断以实现统一分割

Joongwon Chae, Zhenyu Wang, Peiwu Qin

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 SJTU通过坐标检测实现多模态模型中的空间判断,提升图像分割的准确性和实用性。

Comments A flaw was discovered in the experimental setup. Therefore, we are retracting the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06084 2026-01-06 cs.CV 77%

AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance

AdaptInfer: 用于视觉-语言模型推理的自适应令牌剪枝与动态文本引导

Weichen Zhang, Zhui Zhu, Ningbo Li, Shilong Tao, Kebin Liu, Yunhao Liu

机构 * Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) Department of Automation, Tsinghua University(清华大学自动化系) School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 AdaptInfer通过动态文本引导和自适应令牌剪枝,有效降低视觉-语言模型推理成本,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06240 2026-01-06 cs.RO cs.AI 70%

Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation

基于 affordance 的粗到细探索用于开放词汇移动操控中的基座放置

Tzu-Jung Lin, Jia-Fong Yeh, Hung-Ting Su, Chung-Yi Lin, Yi-Ting Chen, Winston H. Hsu

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于 affordance 的粗到细探索方法,通过结合视觉语言模型的语义理解和几何可行性,提升开放词汇移动操控中基座放置的成功率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09385 2026-01-06 cs.CV 70%

Towards Vision-Language Geo-Foundation Model: A Survey

迈向视觉-语言地理基础模型:一种综述

Yue Zhou, Zhihang Zhong, Xue Yang

机构 * School of GeoAI(地理人工智能学院) Hindon STAI Institute(Hindon STAI研究所) Key Laboratory of Geographic Information Science (Ministry of Education)(地理信息科学重点实验室) East China Normal University(华东师范大学) School of AI(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文综述了视觉-语言地理基础模型(VLGFMs),探讨其背景、核心技术和应用,旨在构建具备多样化地理感知能力的智能模型。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09040 2026-01-06 cs.CV cs.AI cs.CL 67%

Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better

自回归语义视觉重建有助于VLMs更好地理解

Dianyi Wang, Wei Song, Yikun Wang, Siyuan Wang, Kaicheng Yu, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) AutoLab, Westlake University(西湖大学AutoLab) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) University of Southern California(美国南加州大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 自回归语义视觉重建通过提升多模态理解能力,改进了VLMs对视觉信息的把握

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01798 2026-01-06 cs.CV cs.AI 62%

VerLM: Explaining Face Verification Using Natural Language

通过自然语言解释面部验证

Syed Abdul Hannan, Hazim Bukhari, Thomas Cantalapiedra, Eman Ansar, Massa Baali, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种视觉-语言模型用于面部验证,通过自然语言解释决策过程,提升验证的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14420 2026-01-06 cs.CV cs.AI 62%

DISCODE: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning

DISCODE:面向分布的评分解码器,用于鲁棒的图像描述评估

Nakamasa Inoue, Kanoko Goto, Masanari Oi, Martyna Gruszka, Mahiro Ukai, Takumi Hirose, Yusuke Sekikawa

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DISCODE是一种无需微调的鲁棒图像描述评估方法,通过自适应测试时损失和多领域基准提升评估鲁棒性。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏