arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4657 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2511.18787 2026-04-10 cs.CV cs.LG 57%

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01840 2026-04-09 cs.AI 57%

Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models

并非所有token都同等重要:基于感知的策略优化方法用于大型视觉-语言模型

Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于感知的策略优化方法PGPO,通过动态调整token级别的优势,提升多模态推理的鲁棒性与稳定性,实验显示在多个基准上提升18.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05900 2026-04-08 cs.CV 57%

AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis

AICA-Bench:全面评估VLMs在情感图像内容分析中的能力

Dong She, Xianrong Yao, Liqun Chen, Jinghe Yu, Yang Gao, Zhanpeng Jin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AICA-Bench基准,通过情感理解、推理和生成三个任务评估VLMs在情感图像分析中的能力,发现其在强度校准和描述深度方面存在不足,并提出GAT提示方法提升性能。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18117 2026-04-08 cs.CV 57%

Online In-Context Distillation for Low-Resource Vision Language Models

在线上下文蒸馏用于低资源视觉语言模型

Zhiqi Kang, Rahaf Aljundi, Vaggelis Dorovatas, Karteek Alahari

机构 * Inria(法国国家信息与自动化研究所) Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出在线上下文蒸馏方法,通过小模型与强教师模型协作,利用稀疏演示高效缩小性能差距,提升小模型性能达33%,在低资源条件下实现与零样本性能相当的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04579 2026-04-08 cs.CV 57%

Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation

Firebolt-VL: 通过跨模态调制实现高效的视觉-语言理解

Quoc-Huy Trinh, Mustapha Abdullahi, Bo Zhao, Debesh Jha

机构 * Aalto University(阿尔托大学) University of South Dakota(南达科他大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Firebolt-VL模型,通过替换Transformer解码器为液态基础模型解码器,并引入Token-Grid相关模块,提升视觉语义理解效率与精度。

Comments arXiv admin note: substantial text overlap with arXiv:2511.11177

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00727 2026-04-08 cs.LG cs.CR cs.CV 57%

Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP

扰动与恢复:用于从CLIP中有效移除后门的微调

Naman Deep Singh, Francesco Croce, Matthias Hein

机构 * University of Tübingen & Tübingen AI Center(蒂宾根大学 & 蒂宾根人工智能中心) EPFL(瑞士联邦理工学院洛桑)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出PAR机制,通过微调有效移除CLIP中的后门,实验表明其在不同编码器和攻击类型上均能保持良好性能,且无需真实训练数据。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04357 2026-04-07 cs.CV 57%

Spatially-Weighted CLIP for Street-View Geo-localization

基于空间加权的CLIP用于街景地理定位

Ting Han, Fengjiao Li, Chunsong Chen, Haoling Huang, Yiping Chen, Meiliu Wu

机构 * School of Geospatial Engineering and Science, Sun Yat-Sen University(中山大学地理科学与规划学院) School of Geographical and Earth Sciences, University of Glasgow(格拉斯哥大学地理与地球科学学院) School of System Science and Engineering, Sun Yat-Sen University(中山大学系统科学与工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出空间加权CLIP(SW-CLIP),通过引入空间自相关增强视觉-语言对比学习,改进街景地理定位的准确性与空间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17362 2026-04-07 cs.CV 57%

ATAC: Augmentation-Based Test-Time Adversarial Correction for CLIP

ATAC:基于增强的测试时间对抗修正用于CLIP

Linxiang Su, András Balogh

机构 * University of Szeged(塞格德大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出ATAC方法,通过在CLIP嵌入空间中计算增强诱导的漂移向量,修正嵌入以提高对抗鲁棒性,实验显示其鲁棒性显著优于现有方法。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02748 2026-04-06 cs.CV 57%

Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks

面向多样化脑部MRI任务的视觉指令微调语言模型

Jonghun Kim, Sinyoung Ra, Hyunjin Park

机构 * Sungkyunkwan University(成均馆大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Artificial Intelligence(人工智能系)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出LLaBIT模型,通过视觉指令微调提升语言模型在脑部MRI任务中的表现,通过特征图重用和文本数据生成提升性能,验证了其在报告生成、视觉问答、图像分割和图像翻译中的有效性。

Comments ICPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01987 2026-04-03 cs.CV cs.LG 57%

Curia-2: Scaling Self-Supervised Learning for Radiology Foundation Models

Curia-2:用于放射学基础模型的自监督学习扩展

Antoine Saporta, Baptiste Callard, Corentin Dancette, Julien Khlaut, Charles Corbière, Leo Butsanets, Amaury Prat, Pierre Manceron

机构 * Raidium Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP, Paris, France(巴黎欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) Faculté de Santé, Université Paris-Cité, Paris, France(巴黎西岱大学健康学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 Curia-2通过改进预训练策略和表征质量,提升了放射学数据的捕捉能力,首次实现了多模态CT和MRI基础模型的亿参数视觉变换器架构,并在两个新评估轨道中验证了其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01915 2026-04-03 cs.CV 57%

Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts

通过知识引导的空间提示增强医学视觉 grounding

Yifan Gao, Tao Zhou, Yi Zhou, Ke Zou, Yizhe Zhang, Huazhu Fu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Yong Yoo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出KnowMVG框架,通过知识增强提示和全局局部注意力机制提升医学视觉 grounding的精度,实验显示在四个基准上优于现有方法。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV 57%

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00820 2026-04-02 cs.CV 57%

Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis

遥感持续视觉-语言学习:基准测试与分析

Xingxing Weng, Ruifeng Ni, Chao Pang, XiangYu Hao, Yishan Wang, Xiaokang Zhang, Wei Xu, Gui-Song Xia

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出CLEaRS基准,评估遥感视觉-语言模型的持续学习能力,发现现有模型存在灾难性遗忘,需开发专用持续学习方法。

Comments 23 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00530 2026-04-02 cs.CV 57%

AceTone: Bridging Words and Colors for Conditional Image Grading

AceTone:连接词语与颜色的条件图像评分

Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance(字节跳动)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。

Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26984 2026-04-01 cs.CV 57%

A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models

一种可证明的能量引导测试时间防御提升大视觉-语言模型的对抗鲁棒性

Mujtaba Hussain Mirza, Antonio D'Orazio, Odelia Melamed, Iacopo Masi

机构 * OmnAI Lab, Computer Science Department, Sapienza University of Rome, Italy(罗马大学计算机科学系OmnAI实验室,意大利) Weizmann Institute of Science, Israel(魏茨曼科学研究所,以色列)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ET3,一种轻量且无需训练的防御方法,通过最小化输入样本的能量提升模型鲁棒性,实验显示其在分类和提升大视觉-语言模型鲁棒性方面表现优异。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28211 2026-03-31 cs.CV 57%

Explaining CLIP Zero-shot Predictions Through Concepts

通过概念解释CLIP零样本预测

Onat Ozdemir, Anders Christensen, Stephan Alaniz, Zeynep Akata, Emre Akbas

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) Orbital DTU Compute, Technical University of Denmark(丹麦技术大学DTU计算学院) Dept. of Biology, University of Copenhagen(哥本哈根大学生物系) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工学院巴黎电信学院LTCI实验室) Technical University of Munich (TUM)(慕尼黑工业大学) Helmholtz Munich(亥姆霍兹慕尼黑中心) MCML MDSI Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出EZPC方法,通过人类可理解的概念解释CLIP的零样本预测,保持分类精度并提供概念层面的解释。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28023 2026-03-31 cs.CV 57%

SegRGB-X: General RGB-X Semantic Segmentation Model

SegRGB-X: 通用RGB-X语义分割模型

Jiong Liu, Yingjie Xu, Xingcheng Zhou, Rui Song, Walter Zimmer, Alois Knoll, Hu Cao

机构 * Chair of Robotics, Artificial Intelligence and Real-time Systems, Technical University of Munich, Munich, Germany(慕尼黑工业大学机器人、人工智能与实时系统教席,德国慕尼黑)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SegRGB-X模型,通过三种创新解决多模态语义分割问题,实现跨模态统一分割,实验显示其在五个不同互补模态数据集上达到65.03%的mIoU性能。

Comments Submitted to IEEE TITS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27375 2026-03-31 cs.CV 57%

Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models

弥合可验证奖励下的视觉表征与强化学习在大视觉-语言模型中的应用

Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) Huawei(华为) HKUST (GZ)(香港科技大学(广州))

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出KAWHI机制,通过整合结构化视觉信息提升大视觉-语言模型的多模态推理性能,改进现有统一奖励优化方法。

Comments Homepage: \url{https://kawhiiiileo.github.io/KAWHI_PAGE/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24984 2026-03-31 cs.CV 57%

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

MoE-GRPO:通过强化学习优化基于专家混合的视觉-语言模型

Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MoE-GRPO,通过强化学习优化视觉-语言模型中的专家路由,提升专家选择多样性,缓解专家过拟合问题。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21356 2026-03-31 cs.CV 57%

ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models

ShotBench:视觉语言模型中的专家级电影叙事理解

Hongbo Liu, Jingwen He, Yi Jin, Dian Zheng, Yuhao Dong, Fan Zhang, Ziqi Huang, Yinan He, Yangguang Li, Weichao Chen, Yu Qiao, Wanli Ouyang, Shengjie Zhao, Ziwei Liu

机构 * Tongji University(同济大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ShotBench基准测试,用于评估视觉语言模型对电影叙事语言的理解能力,通过专家标注的3500多对问答数据揭示现有模型在细粒度视觉线索和复杂空间推理上的不足,并开发ShotVL模型在该基准上取得新突破。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26776 2026-03-31 cs.CV 57%

From Prediction to Diagnosis: Reasoning-Aware AI for Photovoltaic Defect Inspection

从预测到诊断:面向光伏缺陷检测的推理感知AI

Dev Mistry, Feng Qiu, Bo Chen, Feng Liu, Can Chen, Mohammad Shahidehpour, Ren Wang

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Argonne National Laboratory(阿贡国家实验室) Commonwealth Edison(联邦爱迪生公司) Drexel University(德雷塞尔大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出REVL-PV框架,通过融合电致发光、热成像和可见光图像,实现光伏缺陷的结构化诊断报告,提升检测准确性和可解释性。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26486 2026-03-30 cs.CV 57%

ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better

ClipTTT: CLIP引导的测试时间训练帮助LVLMs看得更清楚

Mriganka Nath, Anurag Das, Jiahao Xie, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出ClipTTT方法,通过CLIP模型的图像-文本对齐能力,在测试时引导LVLMs适应退化条件,减少幻觉并提升描述准确性。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02898 2026-03-30 cs.CV 57%

One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework

一个补丁即可描述它们全部:一种统一的零样本描述框架

Lorenzo Bianchi, Giacomo Pacini, Fabio Carrara, Nicola Messina, Giuseppe Amato, Fabrizio Falchi

机构 * ISTI-CNR, Italy(意大利国家研究委员会信息科学与技术研究所) University of Pisa, Italy(比萨大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出一种统一的零样本描述框架,从图像中心转向补丁中心范式,使能描述任意区域而不需区域级监督。通过将单个补丁视为原子描述单元,实现对任意区域的描述,实验表明有意义的密集视觉特征对多区域描述任务至关重要。

Comments IEEE CVF Conference on Computer Vision and Pattern Recognition 2026. Project page with code, models and examples: https://paciosoft.com/Patch-ioner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25537 2026-03-27 cs.CL 57%

Humans vs Vision-Language Models: A Unified Measure of Narrative Coherence

人类与视觉-语言模型:叙事连贯性的一种统一衡量方法

Nikolai Ilinykh, Hyewon Jang, Shalom Lappin, Asad Sayeed, Sharid Loáiciga

机构 * University of Gothenburg(哥德堡大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过比较人类写作与视觉语言模型生成的叙事,评估视觉基础故事中的叙事连贯性,发现模型在连贯性方面与人类存在系统性差异。

Comments 9 pages of content, 1 page of appendices, 9 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25533 2026-03-27 cs.CV 57%

BFMD: A Full-Match Badminton Dense Dataset for Dense Shot Captioning

BFMD:一款完整的羽毛球密集数据集用于密集击球标注

Ning Ding, Keisuke Fujii, Toru Tamaki

机构 * Nagoya Institute of Technology(名古屋工业大学) Nagoya University(名古屋大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BFMD数据集,包含19场完整比赛,提供密集多模态标注,采用VideoMAE框架结合语义反馈机制提升击球标注质量。

Comments CVSports2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25075 2026-03-27 cs.AI 57%

Sparse Visual Thought Circuits in Vision-Language Models

视觉语言模型中的稀疏视觉思维电路

Yunpeng Zhou

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究探讨了稀疏自编码器特征在推理中的模块化假设,发现干预任务选择性特征集能小幅提升推理准确率,但联合干预则导致预测漂移和精度下降,揭示了SAE特征组合的边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24454 2026-03-26 cs.CV 57%

Unleashing Vision-Language Semantics for Deepfake Video Detection

释放视觉-语言语义以进行深度伪造视频检测

Jiawen Zhu, Yunqi Miao, Xueyi Zhang, Jiankang Deng, Guansong Pang

机构 * Singapore Management University(新加坡管理学院) The University of Warwick(沃里克大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国理工学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VLAForge框架,通过ForgePerceiver增强视觉感知并引入身份感知VLA评分,利用跨模态语义提升深度伪造检测的判别能力。

Comments 14 pages, 7 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24224 2026-03-26 cs.CV 57%

RVLM: Recursive Vision-Language Models with Adaptive Depth

具有自适应深度的递归视觉-语言模型

Nicanor Mayumu, Zeenath Khan, Melodena Stephens, Patrick Mukala, Farhad Oroumchian

机构 * Department of Computer Science(计算机科学系) University of Wollongong in Dubai(迪拜沃林戈大学) Dubai Knowledge Park(迪拜知识园区) Mohammed Bin Rashid School of Government(穆罕默德·本·拉希德政府学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出RVLM,通过迭代生成-执行循环和自适应迭代深度控制器,解决医学AI系统在可解释性和推理深度上的限制,实验证明其在脑部MRI和胸部X光中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07659 2026-03-26 cs.CV 57%

Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework

通过自批评推理框架提升视觉-语言模型的测试时鲁棒性

Kaihua Tang, Jiaxin Qi, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Tongji University(同济大学) Computer Network Information Center, CAS(计算机网络信息中心,中国科学院) HIAS, University of Chinese Academy of Sciences(高等研究所,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出自批评推理框架,通过多轮反事实推理提升视觉-语言模型的鲁棒性,引入动态鲁棒性基准评估框架以应对语言偏差和敏感性问题,实验表明该方法在鲁棒性上优于基线方法。

Comments Accepted to CVPR 2026. Code: https://github.com/KaihuaTang/Self-Critical-Inference-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23914 2026-03-26 cs.CV cs.LG 57%

Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding

面向大视觉-语言模型的注意力感知推理优化

Fatih Ilhan, Gaowen Liu, Ramana Rao Kompella, Selim Furkan Tekin, Tiansheng Huang, Zachary Yahn, Yichang Xu, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Research(思科研究)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出AttentionPack框架,通过紧凑注意力机制和解压机制提升大视觉-语言模型解码效率,实验表明内存效率提升8倍,支持更大批次和更快推理,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏