arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 275 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 275 篇

2607.10610 2026-07-14 cs.CV cs.AI 新提交 62%

WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen

WasteAssistant:用于智能垃圾分类与可持续管理的监管引导视觉问答框架

Khush Kataruka, Harshit Maurya, Anuja Vats, Murari Mandal, Kiran Raja, Praveen Kumar Chandaliya

机构 * SVNIT(萨达尔·瓦拉巴伊·国家理工学院) NTNU(挪威科技大学) KIIT(卡林加工业技术学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对现有智能垃圾分类系统的不足,提出集成视觉语言模型和多模态大语言模型的框架,构建新数据集,经实验验证基于BLIP的模型效果更佳,提升了分类准确率,确保监管合规,推动多模态AI在垃圾管理中的应用。

Comments 12 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09526 2026-07-13 cs.CV cs.AI 新提交 62%

ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

ALICE:从视觉、视觉语言和玻片级专家学习通用病理学基础模型

Jiawen Li, Tian Guan, Huijuan Shi, Xitong Ling, Mingxi Fu, Anjia Han, Chao He, Yonghong He

机构 * Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学生物医药与健康工程研究院,清华大学深圳国际研究生院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Pathology, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院病理科) Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出通过多阶段凝聚蒸馏训练的ALICE统一基础模型,将多种教师模型知识整合到单个主干。它在大量图像上预训练,经多场景多任务评估,在任务匹配病理基础模型中平均排名最佳,证明凝聚蒸馏可整合能力用于广泛病理学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09443 2026-07-13 cs.CV cs.AI 新提交 62%

Parameter-Efficient Vision-Language Adaptation with Continuous Metadata Conditioning for Animal Re-Identification

基于连续元数据条件的参数高效视觉语言适配用于动物再识别

Anil Osman Tur, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen, Cigdem Beyan

机构 * Department of Computer Science, University of Verona(维罗纳大学计算机科学系) Institute of Marine Research(海洋研究所) University of Agder, Centre for Coastal Research(阿格德大学海岸研究中心)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对动物再识别中适应纵向生态环境的挑战,提出基于连续元数据条件的参数高效CLIP适配框架,通过保留元数据连续结构,在训练中平滑调制嵌入空间,提升了对外观变化和分布偏移的鲁棒性,实现纯视觉推理管道。

Comments This is the author's version of the paper accepted for publication in Expert Systems with Applications. The final authenticated version will be available from the publisher

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08745 2026-07-10 cs.AI cs.CV 新提交 62%

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) University of Michigan(密歇根大学) University of Notre Dame(圣母大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。

Comments CVPR Autopilot Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04548 2026-07-07 cs.CV cs.AI 新提交 62%

Explainable Novel Category Discovery in Semantic Concept Space

语义概念空间中的可解释新类别发现

Ifrat Ikhtear Uddin, Yang Zhou, KC Santosh, Longwei Wang

机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) Department of Computer Science and Software Engineering, Auburn University(奥本大学计算机科学与软件工程系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出xNCD框架,在结构化语义概念空间进行基于表示的发现和伪标签分配,通过视觉与语言先验对齐学习无标签概念表示,使发现类别可解释,实验证明其有强发现性能和内在解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04344 2026-07-07 cs.CV cs.AI 新提交 62%

IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation

IRIS:一种通过主题树和场景驱动的VQA生成用于眼表疾病的智能视觉语言系统

Hao Wei, Wenjin Qi, Dasen Dai, Minqing Zhang, Wu Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对眼表疾病领域缺乏多模态数据问题,引入IRIS系统。构建IRIS-120K数据集,提出协同数据生成范式,含主题发现树和场景驱动策略,使4B参数VLM性能达最优。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02575 2026-07-07 cs.CV cs.AI 新提交 62%

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

标准条件上下文学习:评估视觉语言模型中的标准转移适应性

Kaiyun Yang, Ruilin Yang, Zhimin Yao, J. Wang, Wei Ge

机构 * Megvii Technology Inc., Beijing, China(美科科技有限公司,北京,中国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出标准条件上下文学习(CC-ICL)新设置,模型需从上下文推断潜在标准并据此调整预测。为此提出两个评估指标,构建CC-Bench基准。实验发现多数模型有边界偏差,简单多标准训练可改善。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02490 2026-07-03 cs.CL cs.CV 新提交 62%

Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

基于强化学习的视觉语言模型视觉接地自反思

Liyan Tang, Fangcong Yin, Greg Durrett

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出VRRL框架,通过随机掩码轨迹前缀和缓冲回滚机制,增强视觉语言模型在分布外场景下的视觉接地自反思能力,显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00784 2026-07-02 cs.CV cs.AI 新提交 62%

LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives

LeVLJEPA:无负样本的端到端视觉语言预训练

Lukas Kuhn, Giuseppe Serra, Randall Balestriero, Florian Buettner

机构 * German Cancer Research Center(德国癌症研究中心) German Cancer Consortium(德国癌症联盟) Goethe University Frankfurt(法兰克福大学) Brown University(布朗大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出首个完全非对比的端到端视觉语言预训练方法LeVLJEPA,通过跨模态预测与分布正则化学习,无需负样本、温度参数等,生成更强的密集语义特征,在下游任务中优于对比基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00465 2026-07-02 cs.CV cs.CL cs.LG 新提交 62%

StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning

StochasT:基于随机轮次深度的视觉指令微调学习

Yuan Qing, Chengzhi Mao, Boqing Gong

机构 * Boston University(波士顿大学) Rutgers University(罗格斯大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对视觉指令微调中多轮训练与单轮测试不匹配的问题,提出StochasT方法,通过随机分组语言任务为不同大小的轮次深度,增强模型在单轮和多轮场景下的鲁棒性。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/StochasT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27527 2026-06-29 cs.CV cs.AI cs.LG 新提交 62%

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

大型语言模型教授视觉学生:细粒度概念知识的跨模态迁移

Thomas Shih-Chao Liang, Zhuoran Yu, Yong Jae Lee

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出LaViD框架,利用语言模型生成多选题来蒸馏细粒度视觉概念,无需多模态数据,在多个基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27023 2026-06-26 cs.LG cs.CL cs.CV 新提交 62%

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

你到底有多确定?改进医学视觉问答中的口头不确定性校准

Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman

机构 * Politecnico di Milano(米兰理工大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型在医学VQA中过度自信的问题,提出基于复合损失函数的微调框架,通过校准项、锚定正则化、对比对齐和KL稳定项,将校准误差降低60%以上,判别力提升26%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26891 2026-06-26 cs.CV cs.AI 新提交 62%

Bridging Vision and Language Concepts through Optimal Transport Semantic Flow

通过最优传输语义流桥接视觉与语言概念

Chenyang Zhang, Anqi Dong, Guangming Zhu, Nuoye Xiong, Siyuan Wang, Lin Mei, Liang Zhang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出最优传输流概念瓶颈模型(OTF-CBM),通过逆最优传输学习数据驱动的语义代价,并利用非平衡最优传输流匹配建模视觉块与文本概念间的语义转换,实现可解释的几何关系捕获,提升分类精度与概念忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24759 2026-06-24 cs.CV cs.AI 新提交 62%

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving

UniDrive: 面向自动驾驶可解释风险理解的统一视觉-语言与定位框架

Xiaowei Gao, Pengxiang Li, Yitai Cheng, Ruihan Xu, James Haworth, Stephen Law, Yun Ye

机构 * organization= Department of Earth Science \& Engineering, Imperial College London , city= London , postcode= SW7 2AZ , country= United Kingdom organization= SpaceTimeLab, Department of Civil, Environmental Geomatic Engineering, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Department of Computing, The Hong Kong Polytechnic University , city= Hong Kong , country= China organization= Trinity College, University of Oxford , city= Oxford , postcode= OX1 3BH , country= United Kingdom organization= Department of Geography, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Centre for Global Infrastructure Resilience, The Bartlett School of Sustainable Construction, University College London , city= London , postcode= WC1E 7HB , country= United Kingdom

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出UniDrive框架,通过融合时序推理与高分辨率感知分支,联合生成风险描述和边界框定位,在DRAMA-Reasoning基准上超越现有方法,提升小目标定位和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07558 2026-06-24 cs.CV cs.AI cs.DL 新提交 62%

Page image classifier fine-tuned on century-spanning archives of scanned documents for further content-specific processing

基于百年跨度扫描文档档案微调的页面图像分类器,用于进一步的内容特定处理

Kateryna Lutsai, Dana Křivánková, Pavel Straňák, David Novák

机构 * Institute of Formal and Applied Linguistics, Charles University MFF(查尔斯大学数学与物理学院形式与应用语言学研究所) Institute of Archaeology, Czech Academy of Sciences(捷克科学院考古研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对历史文档数字化中手动分类不可行的问题,提出基于视觉内容类型(文本、表格、图形)的自动页面图像分类系统,采用微调深度网络(RegNetY-16GF达99.16%准确率)实现近完美分类,并公开模型、数据集和代码。

Comments 29 pages, 19 figures, 13 tables. arXiv admin note: text overlap with arXiv:2507.21114

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 62%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21419 2026-06-23 cs.CV cs.AI 新提交 62%

MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning

MIRCaps: 一个大规模混合域数据集,包含图像级和区域级描述,用于细粒度视觉-语言学习

Arlindo Luciano Tulumba Roberto, Hyungjoon Kim

机构 * Changwon National University(昌原国立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 为解决通用与监控视频领域的混合域图像-描述数据集匮乏问题,构建了包含14万图像、98万图像级描述、174万区域级描述和139万边界框的大规模数据集,通过互补描述类型帮助视觉语言模型学习细粒度视觉属性,并在图像描述和目标检测任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20477 2026-06-23 cs.CV cs.CL cs.LG 新提交 62%

Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology

面向放射学的空间定位2D视觉-语言模型的可扩展训练

Yusuf Salcan, Simon Ging, Robin Tibor Schirrmeister, Philipp Arnold, Elmar Kotter, Behzad Bozorgtabar, Thomas Brox

机构 * Computer Vision Group, University of Freiburg, Germany(德国弗莱堡大学计算机视觉组) Department of Radiology, Medical Center -- University of Freiburg, Germany(德国弗莱堡大学医学中心放射科) CRIION-AI Lab, Freiburg, Germany(德国弗莱堡CRIION-AI实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 提出RefRad2D大规模双语数据集,通过LLM和自动分割生成空间定位数据,训练RadGrounder模型联合完成报告生成、VQA和空间定位,在外部基准上取得竞争性结果。

Comments Accepted for MICCAI 2026. First two authors: equal contribution. Last two authors: equal supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14703 2026-06-15 cs.CV cs.CL cs.LG 新提交 62%

Gaze Heads: How VLMs Look at What They Describe

注视头:视觉语言模型如何观察它们所描述的内容

Rohit Gandikota, David Bau

机构 * Northeastern University(东北大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 发现视觉语言模型的语言骨干中存在一组“注视头”,其注意力跟踪当前描述的图像区域,通过干预这些头可精确控制模型描述内容,准确率达83.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11889 2026-06-11 cs.CV cs.AI cs.RO 新提交 62%

Task-Aligned Stability Analysis of Vision-Language Models for Autonomous Driving Hazard Detection

面向自动驾驶危险检测的视觉-语言模型任务对齐稳定性分析

Everett Richards

机构 * Everett Richards(埃弗里特·里奇ards)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉-语言模型在自动驾驶危险检测中,嵌入漂移与任务对齐危险分数变化的关系,发现不同腐败类型导致不同的失效模式,建议基准测试包含任务对齐稳定性指标。

Comments 8 pages (5 main body + 3 references / appendices). ICML 2026 Workshop on Combining Theory and Benchmarks (CTB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09871 2026-06-10 cs.CV cs.AI cs.LG 新提交 62%

SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation

SD-GRPO:面向长格式视觉-语言生成的可验证片段分解

Hyunwoong Kim, Seongeun Lee, Hannah Yun, Junhyun Park, Jonggwon Park

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出SD-GRPO方法,通过将长格式输出分解为片段并计算逐片段优势,解决GRPO在视觉-语言任务中粗粒度信用分配不足的问题,实验证明其在多种长格式生成任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08894 2026-06-09 cs.CV cs.CL 新提交 62%

Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

推理视觉语言模型对语义视觉干扰具有鲁棒性吗?

Yizheng Sun, Mochuan Zhan, Yanan Ma, Jia Tong See, Yifan Wang, Ziyi Wang, Hao Li, Yang Cui, Wenhao Cai, Jingyu Sun, Chenghua Lin, Riza Batista-Navarro, Jingyuan Sun

机构 * University of Manchester(曼彻斯特大学) Marex Imperial College London(帝国理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对推理VLM在真实场景中易受语义视觉干扰的问题,提出Distract-Bench基准,发现推理VLM对语义干扰的鲁棒性低于感知退化,且干扰常被纳入推理过程导致错误答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07861 2026-06-09 cs.CV cs.AI 新提交 62%

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

最后一个可见像素:探究视觉-语言模型中的精细尺度感知

Lujun Li, Lama Sleem, Niccolo Gentile, Yangjie Xu, Yewei Song, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A. Université Paris-Saclay(巴黎-萨克雷大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FineSightBench基准,通过4-48像素尺度分离感知与推理任务,发现视觉-语言模型感知在12像素饱和,推理在更大尺度仍受限,揭示精细视觉推理的根本缺陷。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16263 2026-08-18 cs.CV 新提交 57%

Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models

先见后答:面向视觉语言模型的无训练视觉层分析

Ruchen Liu, Yi Yang, Yiming Xu, Michael Ying Yang, Monika Sester, Bodo Rosenhahn

机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) University of Bath(巴斯大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。

Comments ECCVW'26 eXCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15456 2026-08-18 cs.CV 新提交 57%

AlignJEPA: Predictive Vision-Language Alignment for Remote Sensing Foundation Models

AlignJEPA:面向遥感基础模型的预测性视觉-语言对齐

Md Aminur Hossain, Omkumar Vaghasiya, Rajeev Ranjan Dwivedi, Vinod Kurmi, Biplab Banerjee

机构 * Space Applications Centre, ISRO(印度空间研究组织空间应用中心) Indian Institute of Science Education and Research (IISER) Bhopal(印度科学教育与研究学院(博帕尔)) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 该研究针对遥感基础模型与自然语言对齐不足的问题,提出受JEPA启发的AlignJEPA框架,采用轻量级预测对齐网络,结合语义预测与双向对比检索,实现了参数高效的视觉-语言对齐。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11933 2026-08-13 cs.CV 新提交 57%

Dual Anchors, Do It Better: Hierarchical Group Merging for Zero-Shot Anomaly Detection

双锚点,效果更佳:用于零样本异常检测的分层分组合并方法

Jimin Roh, DongKyu Kim, Suk-Ju Kang

机构 * Sogang University(西江大学) LG Electronics(LG电子) NAVER Cloud(NAVER云)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 针对现有CLIP-based零样本异常检测方法的局限,提出Dual-Anchor框架,结合分层图像锚点与文本锚点,在8个工业和6个医疗基准上实现了优异泛化性能。

Comments 10 pages, 5 figures, 4 tables. Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11474 2026-08-13 cs.CV 新提交 57%

Test-Time Hallucination Control in Large Vision-Language Models

大型视觉语言模型的测试时幻觉控制

Mehran Tamjidi, Hamidreza Dastmalchi, Ali Cheraghian, Mohammadreza Alimoradijazi, Aijun An, Hossein Rahmani

机构 * Australian National University(澳大利亚国立大学) The University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) York University(约克大学) Lancaster University(兰卡斯特大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型的物体幻觉问题,提出无训练的测试时幻觉缓解(TTH)方法,通过令牌验证器模块等技术提升模型准确性与稳健性,通用性和实用性良好。

Comments Accepted at ECCV 2026 MUCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10959 2026-08-12 cs.CV cs.CR 新提交 57%

Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

一旦投毒,任意受控:视觉语言模型(VLM)中的可编程后门

Tao Lin, Gaojie Jin, Zongxin Liu, Peng Wu, Lijia Yu

专题命中 图文多模态 :any-to-any(abstract);分类 cs.CV

AI总结 该研究提出一种向VLM植入可编程后门的方法,通过启发式投毒策略和特征空间触发器隐写,可在推理时动态选择未见过的目标字幕并触发对应输出,攻击成功率高且能规避部分防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10758 2026-08-12 cs.CV 新提交 57%

Where To Look? : Causal Tracing of Vision Encoders in VLM

看向何处?:视觉语言模型中视觉编码器的因果追踪

Naren Kumar S, Tirth Bhatt, Mayank Singh

机构 * Indian Institute of Technology Gandhinagar(印度甘地纳格尔印度理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究通过因果追踪方法,发现视觉语言模型的高因果性视觉标记常位于目标区域外,其强大多模态性能不代表存在空间定位因果表示,还揭示了视觉感知、利用与推理视觉结构的差距,提供了研究视觉信息处理的因果框架。

Comments 10 Pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07863 2026-08-11 cs.CV eess.IV 新提交 57%

LHSDet: High-Resolution AI-Generated Image Detection via Visual Question Answering

LHSDet:基于视觉问答的高分辨率AI生成图像检测方法

Qian Yao, Jun-Jie Huang, Yongjun Wang, Luming Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) Academy of Military Science(军事科学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对现有AI生成图像检测方法忽略高分辨率细节、难以应对未知生成模型的问题,提出LHSDet,将检测任务转为视觉问答,采用三分支架构,在各类生成模型上实现高检测准确率与稳健性能。

详情

展开后加载摘要…

URL PDF HTML 收藏