arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-02 至 2026-02-02 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2412.06646 2026-02-02 cs.CV cs.LG 86%

The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models

窄门:原生多模态模型中的局部图像-文本通信

Alessandro Pietro Serra, Francesco Ortu, Emanuele Panizon, Lucrezia Valeriani, Lorenzo Basile, Alessio Ansuini, Diego Doimo, Alberto Cazzaniga

机构 * Area Science Park, Trieste, Italy(特里斯特科学公园) SISSA, Trieste, Italy(SISSA) University of Trieste, Trieste, Italy(特里斯特大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(title);分类 cs.CV

AI总结 研究揭示了原生多模态模型中图像与文本信息交互的机制,发现通过单个标记作为窄门影响图像理解性能,提出基于标记级干预的精细控制方法。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22492 2026-02-02 cs.CV 79%

PromptMAD: Cross-Modal Prompting for Multi-Class Visual Anomaly Localization

PromptMAD: 多类视觉异常定位的跨模态提示

Duncan McCain, Hossein Kashiani, Fatemeh Afghah

机构 * Holcombe Department of Electrical and Computer Engineering(电气与计算机工程系) Computer Engineering Clemson University(计算机工程学系 哥伦比亚大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 PromptMAD通过跨模态提示和Focal损失函数,在多类视觉异常检测中实现高精度像素级定位与高效性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20433 2026-02-02 cs.CV 79%

MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models

MARE: 多模态对齐与强化学习用于通过视觉-语言模型的可解释深度伪造检测

Wenbo Xu, Wei Lu, Xiangyang Luo, Jiantao Zhou

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University, Guangzhou 510006, China(计算机科学与工程学院,信息技术MOE实验室,广东省信息安全技术重点实验室,中山大学,广州510006,中国) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Department of Computer and Information Science, University of Macau.(计算机与信息科学系,澳门大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 MARE通过多模态对齐和强化学习提升视觉-语言模型在深度伪造检测中的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22398 2026-02-02 cs.CV cs.AI 76%

Jailbreaks on Vision Language Model via Multimodal Reasoning

通过多模态推理实现对视觉语言模型的逃逸攻击

Aarush Noheria, Yuguang Yao

机构 * Novi High School, MI, USA(诺维高中) Michigan State University, MI, USA(密歇根州立大学)

专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于多模态推理的逃逸攻击框架,通过训练后链式推理和自适应噪声机制提高对视觉语言模型的安全过滤器的绕过能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22654 2026-02-02 cs.CV cs.CL 62%

VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models

VScan:重新思考视觉标记减少以提高高效的大视觉-语言模型

Ce Zhang, Kaixin Ma, Tianqing Fang, Wenhao Yu, Hongming Zhang, Zhisong Zhang, Haitao Mi, Dong Yu

机构 * Carnegie Mellon University(卡内基梅隆大学) Tencent AI Lab(腾讯AI实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 VScan通过两阶段视觉标记减少框架提升大视觉-语言模型的推理效率,实现2.91倍预填充加速和10倍FLOPs减少,性能损失仅0.6%

Comments Accepted at TMLR 2026. Project page: https://zhangce01.github.io/VScan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23103 2026-02-02 eess.IV cs.CV 57%

Vision-Language Controlled Deep Unfolding for Joint Medical Image Restoration and Segmentation

视觉-语言控制的深度展开用于联合医学图像恢复与分割

Ping Chen, Zicheng Huang, Xiangming Wang, Yungeng Liu, Bingyu Liang, Haijin Zeng, Yongyong Chen

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Harvard University(哈佛大学) SUN YAT-SEN UNIVERSITY(中山大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VL-DUN通过联合优化和频率感知Mamba机制,实现医学图像恢复与分割的协同学习,提升PSNR和Dice系数,展示联合学习在复杂临床任务中的优势。

Comments 18 pages, medical image

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22738 2026-02-02 cs.CV 57%

StreamSense: Streaming Social Task Detection with Selective Vision-Language Model Routing

StreamSense: 基于选择性视觉-语言模型路由的流式社交任务检测

Han Wang, Deyi Ji, Lanyun Zhu, Jiebo Luo, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) University of Rochester(罗切斯特大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 StreamSense通过轻量级编码器与选择性路由结合VLM专家,提升流式社交任务检测的准确性和效率。

Comments 10 pages, 4 figures, The Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22570 2026-02-02 cs.CV cs.LG 57%

Leveraging Data to Say No: Memory Augmented Plug-and-Play Selective Prediction

利用数据说不:基于记忆的插拔式选择预测

Aditya Sarkar, Yi Li, Jiacheng Cheng, Shlok Mishra, Nuno Vasconcelos

机构 * University of Maryland, College Park(马里兰大学) University of California, San Diego(加州大学圣地亚哥分校) Qualcomm AI(高通人工智能) Yale University(耶鲁大学) Meta AI

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出基于记忆的插拔式选择预测方法,通过增强视觉语言嵌入来减少方差并改进分数校准,提升图像描述、匹配和细粒度分类性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏